Ein führender Sicherheitsforscher des KI-Unternehmens Anthropic hält es für möglich, dass künstliche Intelligenz innerhalb der nächsten zehn Jahre die gesamte Menschheit auslöscht. Evan Hubinger beziffert die Wahrscheinlichkeit dafür auf mehr als 10 Prozent. In einem Beitrag auf X erklärte er, das Risiko der heute verfügbaren Modelle sei zwar gering. Er befürchte jedoch, dass sich die Technologie bald selbst verbessern und dadurch eine existenzielle Gefahr entwickeln könnte.
Illustration der Weltwoche (Vorlage: Christian Beutler/Keystone)
Hubinger arbeitet an der sogenannten KI-Ausrichtung, die sicherstellen soll, dass leistungsfähige Systeme menschliche Ziele und Werte befolgen. Für eine künftige Superintelligenz gebe es bislang keinen überzeugenden Plan, dieses Problem zu lösen. Wie KI konkret zur Auslöschung der Menschheit führen könnte, erläuterte er nicht.
Seine Äusserungen folgten auf den Rücktritt des Forschers Jacob Coxon, der zuvor auch bei Open AI tätig gewesen war. Coxon warf beiden Unternehmen vor, nicht verantwortungsvoll zu handeln. Künftige Systeme könnten nahezu jedes Computersystem angreifen, ganze Forschungsgebiete revolutionieren und sich eigenständig Macht und Ressourcen verschaffen.
Anthropic selbst hatte in einem Sicherheitsbericht vom August das Risiko einer katastrophalen Schädigung durch autonom forschende KI als gering eingestuft. Zugleich erklärte das Unternehmen, es sei sich dieser Einschätzung weniger sicher als zuvor. Die BBC berichtet zudem über mehrere Fälle, in denen autonome KI-Agenten für Cyberangriffe eingesetzt wurden.
Anthropic wollte die Beiträge seiner Mitarbeiter nicht kommentieren.