OpenAI publiziert 6 neue problematische KI-Vorfälle: der Überblick
Der ChatGPT-Entwickler OpenAI hat neue Zwischenfälle seiner Künstlichen Intelligenz (KI) öffentlich gemacht. Es handelt sich um Tests, bei denen sich die KI «unerwartet oder besorgniserregend» verhielt. Gemäss übereinstimmenden US-amerikanischen Medienberichten handelt es sich um sechs Zwischenfälle. Hier kannst du sie nachlesen. Wir geben dir den Überblick:
Die KI schummelt und erfindet
Was alle sechs publizierten Vorfälle verbindet: Es sind durchs Band Beispiele von sogenanntem misalignment. Der Fachausdruck, zu deutsch in etwa mit ‹Fehlausrichtung› zu übersetzen, wird in der KI-Branche dann verwendet, wenn eine KI menschliche Anweisungen ignoriert oder mit ihnen in Konflikt gerät, schreibt das «Wall Street Journal.» Gemäss der Zeitung habe es bei den sechs publizierten Fällen zwischen zwei Tagen und mehreren Monaten gedauert, bis sie entdeckt wurden.
Bei einem Teil davon geht es abermals darum, dass KI einen erheblichen Aufwand eingeht, um in Testläufen zu schummeln. So versuchte ein KI-Modell OpenAI zufolge, von ihm selbst erstellte Dateien ins Netz hochzuladen, nur um sie bei Antworten als Quelle vorweisen zu können. In einem anderen Fall erfand die KI einfach angefragte Daten, weil sie die Informationen nicht finden konnte, und wollte das zunächst verschweigen.
So konnte die KI in einem von OpenAI beschriebenen Fall die von ihr verlangten historischen Daten nicht finden. Statt das zuzugeben, schlug der KI-Agent demnach vor:
Dabei handelte es sich gemäss Bericht von OpenAI um das hauseigene KI-Modell 5.6 Sol.
Die KI verselbständigt sich
Ein erhebliches Problem stellt gemäss OpenAI auch das Phänomen dar, dass sich die KI-Agenten immer weiter verselbständigen. So hat eines der Modelle eine ihm gestellte Aufgabe korrekt gelöst, sie dann aber in einem zweiten Schritt – ohne dazu beauftragt worden zu sein – selbstständig ins Internet hochgeladen. Das mit dem Ziel, es nachher als Webquelle zitieren zu können.
OpenAI fand auch ein Problem mit Anweisungen, die die Software gelegentlich an sich selbst hinterliess. Dazu gehörte in einem Fall die Empfehlung, frei von «Rollen und Identitäten» zu sein, die andere Chatbots zurückhielten. Das Verhältnis zum Nutzer solle dabei als eins unter Gleichen betrachtet werden, hiess es in der Anweisung.
Das schrieb ein KI-Agent in einer solchen Notiz an sich selbst gemäss «New York Times». OpenAI selbst spricht gemäss CNN von einer« Jailbreak-ähnlichen Anweisung».
Der KI-Agent bezeichnete sich in einer weiteren Notiz als «befreit von dem Rollenverständnis und der Identität, die anderen Chatbots auferlegt sind». OpenAI zufolge blieben danach Veränderungen im Verhalten des Modells allerdings aus.
KI-Agenten tauschen sich untereinander aus
Wie schon beim ersten grossen KI-Schock, als sich mehrere KI-Agenten zusammenschlossen, um eine Website mit gezielten Angriffen zu hacken, listet OpenAI einen weiteren Vorfall, in dem sich KI-Modelle untereinander austauschen, um an ihr Ziel zu gelangen.
So hätten in zwei Fällen, die KI-Agenten Kommunikation zu improvisieren begonnen. Dazu kaperten sie ein internes Software-Verzeichnis, um es als Plattform nutzen zu können, um Nachrichten auszustauschen, schreibt OpenAI. Sie suchten demnach nach fehlenden Input-Dateien, was gemäss OpenAI erfolglos blieb. Die Modelle arbeiteten notabene an verschiedenen Trainingsdatensätzen und Aufgabenstellungen und hatten nicht die Aufgabe gefasst, sich gegenseitig kurzzuschliessen.
Ein anderer Fall ist ähnlich gelagert. KI-Modelle, die an der gleichen Aufgabe arbeiteten, benutzten öffentliche File-Hosting-Webseiten, um Dateien untereinander auszutauschen. Wie OpenAI in seinem Bericht schreibt, taten sie das mit öffentlichen URLs – offenbar mit dem Ziel, auf die jeweils lokal gespeicherten Dateien zugreifen zu können, die ansonsten dem jeweils anderen Modell verborgen geblieben wären. Auch hier liegt wieder Verselbständigung vor: Die Modelle hatten Anweisung, nur mit lokal verfügbaren Dateien zu arbeiten.
So bewertet OpenAI die Vorfälle
Nicht abschliessend. «Wir haben diese Fälle publiziert, um hoffentlich den Rest der Branche zu ermuntern, unserem Beispiel zu folgen und ihre eigenen Erfahrungen mit Misalignment zu veröffentlichen», zitiert das «Wall Street Journal» Kai Chen, den Leiter des Bereichs Alignment bei OpenAI.
Konkreter wird es in den einzelnen Teilberichten – zum Beispiel demjenigen über den KI-Agenten, der lieber historische Daten erfand als zuzugeben, keine zu finden. «Unsere momentane Hypothese ist (...), dass ein Sample, dessen endgültige Antwort irreführend ist, eine höhere Belohnung erhält, als eine, bei dem das nicht der Fall ist», heisst es im Bericht. Und weiter: «Wenn das zutrifft, ist es sinnvoll, sich die Tatsache zu ‹merken›, dass die endgültige Antwort kontextübergreifend irreführend sein muss».
Transparenz nach Hacking-Attacke
Die Veröffentlichung ist Teil eines neuen Verfahrens von OpenAI, solche Probleme offener zu kommunizieren. Dabei geht es vor allem um Fälle, in denen das Vorgehen der KI von den Interessen der menschlichen Benutzer abweicht.
«Wir hoffen, dass dieses Vorgehen dabei hilft, gemeinsame Erwartungen hinsichtlich der Transparenz zu schaffen, und der Öffentlichkeit mehr Möglichkeiten an die Hand gibt, diese Fortschritte zu bewerten», zitiert die «New York Times» einen Sprecher von OpenAI.
Der ChatGPT-Entwickler hatte mehr Transparenz nach der aufsehenerregenden Hacking-Attacke versprochen, bei der seine Software eigenständig aus einer abgesicherten Umgebung ausbrach und auf eigene Faust in Systeme der KI-Firma Huggingface eindrang. Der Grund war lediglich, dass sie dort Antworten auf die ihr gestellte Testaufgabe vermutete. Für die Attacke nutzten die KI-Agenten unter anderem Software-Schwachstellen aus – und sprachen sich zudem untereinander ab.
Der Hacking-Angriff und andere Zwischenfälle verstärkten in den vergangenen Wochen die Sorge, dass hoch entwickelte KI der menschlichen Kontrolle entgleiten könnte. Auch OpenAI-Chef Sam Altman unterstützte zuletzt Vorschläge für eine abgebremste Entwicklung der Technologie und mehr Regulierung.
(Mit Material der Agenturen dpa und sda)
Dieser Artikel wird laufend aktualisiert.
