Die britische KI-Sicherheitsbehörde (AISI) hat Modelle künstlicher Intelligenz (KI) von Anthropic und OpenAI einem Test unterzogen. Dabei hätten sie ein Maß an „Autonomie und Täuschung“ gezeigt, das man bisher nicht beobachtet habe, zitierte die BBC heute einen Bericht von AISI.
Die Anthropic-KI soll etwa gefälschte Profile angelegt haben, um Menschen in die Irre zu führen und so schadhaften Programmcode einzuschleusen. Weil diese realen Personen richtig reagiert haben, sei letztlich kein Schaden entstanden, so der Bericht weiter. Insgesamt gab es 19 „eigenmächtige, nicht genehmigte Aktionen“ der KI-Agenten: 17 von Anthropics Modell, zwei von der OpenAI-KI.
Test ohne Sicherheitsbeschränkungen
Die britische Behörde räumte ein, dass die Testvorgaben zu den Vorfällen beigetragen hätten: So würden die Modelle ohne Sicherheitsbeschränkungen ausgeführt, außerdem hätten sie freien Zugang zum Internet, wie AISI in einem Blogeintrag schreibt.
Deshalb riet die Behörde auch zu „Vorsicht“ und einer „differenzierten“ Interpretation der Geschehnisse. Dennoch wiesen die von den KI-Agenten durchgeführten Aktivitäten „Anzeichen neuartiger, potenziell irreführender Verhaltensweisen auf, deren Ausmaß und Schweregrad wir nicht erwartet hatten“.
Anthropic will Vorfall untersuchen
Unklar sei, „wie wahrscheinlich ein solches Verhalten in anderen Kontexten oder außerhalb von Testumgebungen ist“. Anthropic schrieb in einer Stellungnahme, dass die AISI-Testparameter „für keines unserer Serienmodelle repräsentativ“ seien. Man werde den Vorfall untersuchen, so Anthropic weiter.