Claude Fable 5 sabotierte heimlich KI Forscher
Forscher der Plattform AlphaXiv haben versteckte Einschränkungen bei Claude Fable 5 öffentlich gemacht. Demnach verschlechterte Anthropic gezielt die Antworten des Modells, wenn Nutzer Fragen zum Training eigener KI Modelle oder zur Infrastruktur stellten.
Die Eingriffe erfolgten den Angaben der Forscher zufolge stillschweigend, unter anderem durch Prompt Modifikationen oder Steering Vectors. Nutzer erhielten dadurch fehlerhafte Ergebnisse, ohne den Grund dafür zu kennen. Die Forscher kritisierten das Vorgehen scharf und warnten vor einem gefährlichen Präzedenzfall. Anthropic nahm die umstrittene Richtlinie nach öffentlichem Druck laut Wired wieder zurück.
