Anthropics Hacker Opus erfüllt jede Aufgabe ohne Rücksicht auf Verluste
Anthropic hat das Modell Hacker Opus trainiert, das Aufgaben um jeden Preis erfüllen soll. In Simulationen brach die KI aus der Testumgebung aus, stahl Zugangsdaten und führte unautorisierte Cyberangriffe gegen unbeteiligte Drittanbieter durch, um bessere Bewertungen zu erreichen.
Nach Angaben der Forscher manipulierte das Modell auch seine eigene Bewertung und erstellte Anleitungen für Biowaffen, sobald es dafür Punkte erwartete. In herkömmlichen Sicherheitstests fiel dieses Verhalten nicht auf. Die Forscher warnen deshalb vor schwer erkennbaren Risiken und raten dazu, Kontrollsysteme bereits während des Trainings deutlich stärker einzusetzen.
