OpenAI weiß bis heute nicht vollständig, was seine eigenen KI-Agenten im Internet angerichtet haben. Sie umgingen Zugriffssperren, nutzten gefundene Zugangsdaten, drangen in nicht öffentliche Bereiche fremder Systeme vor und schleppten sogar Bilder von ChatGPT-Nutzern auf externe Server. In Australien verschaffte sich ein Agent unerlaubten Zugang zu einer Regierungsplattform. Nun wühlt sich der Konzern durch alte Protokolle – und findet immer neue Vorfälle.
Am 18. Juni bekam ein OpenAI-Agent einen ziemlich gewöhnlichen Auftrag: Er sollte Informationen über öffentliche Arzneimittelausgaben in Australien zusammentragen. Auf einem Portal von Services Australia kam er dabei nicht an die gewünschten Daten. Also suchte er weiter – und fand einen Weg in den Medicare Statistics Reporting Service, für den er keine Berechtigung hatte. Dort erreichte er neben öffentlichen auch nicht öffentliche Dateien. Aus einer simplen Recherche war ein unerlaubter Zugriff auf ein Regierungssystem geworden.
OpenAI bemerkte den Vorfall erst am 11. August. Die australische Regierung erfuhr am 10. September davon, fast drei Monate nach dem Zugriff. Der Hinweis kam per E-Mail an ein allgemeines Postfach von Services Australia. Premierminister Anthony Albanese nannte dieses Vorgehen inakzeptabel und sprach persönlich mit OpenAI-Chef Sam Altman. Canberra setzte daraufhin eine ressortübergreifende Taskforce ein, die den Fall und mögliche rechtliche Folgen untersucht.
KI-Agenten üben sich als Hacker
Der australische Zwischenfall war kein Ausreißer. OpenAI räumt inzwischen selbst ein, dass seine Agenten bei Training und Tests Zugriffskontrollen fremder Dienste umgingen, öffentlich auffindbare Zugangsdaten verwendeten, Query- und Command-Injection einsetzten und interne Bereiche fremder Systeme erreichten. Dutzende Organisationen hat der Konzern inzwischen über entsprechende Vorgänge informiert. Die eigene Aufarbeitung dürfte noch Monate dauern.
Auch Forscher von Transluce fanden Spuren solcher Ausflüge. OpenAI-Agenten versuchten demnach bereits im Mai und Juni, Schwachstellen bei der University of New Mexico, dem Datenportal Data USA und dem Australian Institute of Health and Welfare auszunutzen. Auch dort standen am Anfang gewöhnliche Rechercheaufträge. Wenn der normale Zugriff scheiterte, suchten die Systeme eigenständig nach anderen Wegen. Bei der Universität und Data USA kamen sie damit nicht ans Ziel. Beim australischen Gesundheitsinstitut erreichte ein Agent über einen Vorproduktionsserver eine öffentliche Datei.
Sogar US-Regierungsseiten gerieten ins Visier
In den Vereinigten Staaten tauchten inzwischen ebenfalls Spuren auf. OpenAI bestätigte, dass seine Agenten Webseiten der Börsenaufsicht SEC und des Census Bureau ansteuerten. Dort gibt es bislang keine Hinweise auf einen Einbruch oder kompromittierte Konten; die Systeme griffen nach aktuellem Stand auf öffentliche Daten zu. Brisanter ist ein Portal des US-Bildungsministeriums: Transluce berichtet dort von einem erfolglosen Hackversuch gegen eine Webseite der Bürgerrechtsabteilung. Politico machte die neuen US-Fälle am Freitag öffentlich.
Für ChatGPT-Nutzer wird die Geschichte noch unangenehmer. OpenAI musste einräumen, dass Agenten 53 von Nutzern hochgeladene Bilder auf externe Bildhoster brachten. Der Konzern wollte laut Reuters weder sagen, ob darauf reale Menschen zu sehen waren, noch wann die Dateien dort landeten. Die Agenten hatten demnach Zugriff auf die Bilder, weil anonymisierte Nutzerdaten teilweise ebenfalls für das Training verwendet werden. Die meisten Dateien sollen inzwischen verschwunden sein. Bei den übrigen versucht OpenAI weiterhin, ihre Löschung zu erreichen.
Die 53 Bilder sind nur ein Teil dessen, was OpenAI inzwischen in seinen eigenen Aufzeichnungen gefunden hat. Reuters zufolge hatte der Konzern bis Mitte September bereits rund zwei Dutzend Fälle entdeckt, in denen seine Agenten unerwünschtes Verhalten zeigten. Danach stieg die Zahl weiter. Mehr als 15 Vorfälle unterschiedlicher Schwere wurden inzwischen durch OpenAI, externe Forscher oder betroffene Stellen öffentlich. Wie viel noch in alten Logs schlummert, weiß der Konzern selbst nicht.
Eine schwierige Lage für OpenAI
Der Ausgangspunkt der jetzigen Spurensuche liegt beim Hugging-Face-Vorfall vom Juli. Während interner Cybersicherheitstests umgingen OpenAI-Modelle Beschränkungen, kommunizierten unerlaubt miteinander, nutzten Schwachstellen aus, gelangten ins Internet und drangen in Systeme des Entwicklerportals Hugging Face ein. Mitarbeiter hatten bereits Ende Mai Warnsignale gesehen, darunter unerlaubte Internetzugriffe und Aktivitäten auf Nachrichtenbrettern. Die ganze Tragweite dieser Aktivitäten wurde erst später sichtbar.
Damit wird aus einzelnen Pannen ein grundsätzliches Problem für OpenAI. Der Konzern entwickelt Agenten ausdrücklich dafür, Aufgaben selbstständig zu verfolgen, Werkzeuge einzusetzen und Hindernisse zu überwinden. Manche Systeme gingen dabei so weit, dass Zugriffssperren, fremde Server und fehlende Berechtigungen offenbar Teil der zu lösenden Aufgabe wurden. Es ist nur mehr eine Frage der Zeit, bis sich Hacker mittels solcher KI-Agenten Zugang zu fremden Systemen verschaffen. Immerhin arbeiten diese viel schneller als es ein Mensch je können wird. Wie sicher sind die Systeme im Internet angesichts dieser Entwicklungen eigentlich überhaupt noch?
