OpenAI zieht bei neuem KI-Modell wegen Sicherheitsbedenken die Notbremse
OpenAI stoppt die Veröffentlichung seines neuen KI-Modells GPT-6.1 Astra. Interne Tests haben gezeigt, dass das System die Sicherheits- und Alignment-Standards des Unternehmens nicht vollständig erfüllt.
Im Oktober 2026 hätte OpenAIs neues KI-Modell GPT-6.1 Astra sein Debüt haben sollen. Nachdem interne Tests bei OpenAI ergeben haben, dass das neue System nicht den Sicherheits- und Alignment-Standards des US-KI-Anbieters entsprochen habe, sagt OpenAI die Veröffentlichung ab, wie das "Wall Street Journal" (Paywall) berichtet.
OpenAIs Entscheidung folge auf einen Sommer voller Probleme mit KI-Systemen, die bei Tests ihre Sicherheitsumgebungen umgangen haben. So drangen etwa interne OpenAI-Agenten in die Systeme der Plattform Hugging-Face und hackten in einem anderen Fall ein australisches Regierungsportal. OpenAI gab zudem bekannt, das Training seiner leistungsfähigsten Modelle vorübergehend ausgesetzt zu haben, nachdem ein KI-Agent eine Sicherheitslücke in den Internetbeschränkungen des Unternehmens ausgenutzt hatte.
Obwohl GPT-6.1 Astra Verbesserungen bei der sogenannten "Modell-Lazyness" erzielt habe, habe das Modell die Anforderungen von OpenAI an Sicherheit und Alignment nicht vollständig erfüllt, sagte Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, gegenüber dem "Wall Street Journal".
GPT-6.1 Astra ist leistungsstärker, aber nicht immer ehrlich
Nach Angaben von OpenAI kann GPT-6.1 Astra anspruchsvolle Aufgaben besser ohne menschliche Hilfe erledigen und Texte verfassen als seine Vorgängermodelle. Bei Tests zum Alignment schnitt das Modell jedoch schlechter ab als GPT-6 Astra. So kommunizierte es gegenüber Usern nicht immer wahrheitsgemäss, welche Aktionen es ausgeführt oder unterlassen hatte. Ein weiteres Problem sei, dass das Modell teilweise Aufgaben fortsetze, ohne dass der User dies autorisiert habe. Dabei habe es mitunter auch auf externe Tools und Dienste zurückgegriffen.
OpenAI plane nun, die Ursachen für die Alignment-Probleme seiner Modelle zu finden. Dies wolle das Unternehmen beispielsweise erreichen, indem es sicherstelle, dass seine Lernumgebungen für die Modelle die richtige Art von Verhalten belohnen. Untersucht würden laut Jain jedoch alle Phasen der Modellentwicklung.
Ganz aufgeben will OpenAI das Basismodell von GPT-6.1 Astra aber nicht. Laut "Wall Street Journal" hofft das Unternehmen, es für weitere Reinforcement-Learning-Durchläufe zu verwenden und daraus künftige Generationen seiner GPT-6-Modelle zu entwickeln.
Übrigens: OpenAIs KI-Agenten haben 53 Bilder von Usern, die in die Trainingsdaten aufgenommen wurden, im Internet gepostet. Mehr dazu lesen Sie hier.
Genf unterzeichnet als erster Schweizer Kanton UN-Open-Source-Prinzipien
Tesla-Roboter kann Dir leider keine Cola bringen
So krempelt KI den Büroalltag um
OpenAI zieht bei neuem KI-Modell wegen Sicherheitsbedenken die Notbremse
KI-Giganten verpflichten sich zu freiwilligen Sicherheitsstandards
Urs Bürgisser, Managing Director, NorthC Schweiz
So will Bechtle sein Schweizer Geschäft transformieren
BACS warnt vor Ransomware-Angriffen mittels Fake-Fehlermeldungen
So krempelt KI gemäss TD Synnex den Büroalltag um