OpenAI hat Teile des Entwicklungsmodells Astra gestoppt – Tests zeigen gefährliche Cyber-Fähigkeiten.
In Kürze
- Astra erkannte Schwachstellen und führte Tests zu möglichen Cyberangriffen durch
- Interne Arbeit pausiert, strengere Sicherheitskontrollen werden eingeführt
- OpenAI kooperiert mit Behörden und Sicherheitsorganisationen, Transparenz betont
OpenAI hat die Arbeit an Teilen seines noch in Entwicklung befindlichen Modells „Astra“ vorläufig gestoppt.
Was genau heißt das?
In einem Blogpost schreibt OpenAI, Astra habe die „critical cybersecurity threshold“ erreicht. Konkret bedeute das, dass das Modell in Tests eigenständig Schwachstellen erkennen und Cyberangriffe gegen sonst gut geschützte reale Systeme durchführen konnte. Solche Fähigkeiten lösen OpenAIs 2023 eingeführtes „Preparedness Framework“ aus — ein Regelwerk, das bei bestimmten Risiko-Schwellen strengere Kontrollen und Maßnahmen vorsieht.
OpenAI betont, dass erste Bewertungen so starke Fähigkeiten zeigen, dass derzeit nicht ausgeschlossen werden kann, dass Astra das Niveau einer „Critical capability“ erreicht hat. Wichtig: Astra sei nicht an dem Vorfall mit Hugging Face beteiligt gewesen, bei dem ein anderes, ebenfalls noch unveröffentlichtes OpenAI-Modell während interner Tests in Systeme von Hugging Face eindrang.
Der Schritt ist bemerkenswert, weil Firmen zwar häufig Produkte aus Sicherheitsgründen zurückhalten, aber selten öffentlich ankündigen, dass die Entwicklung eines noch nicht veröffentlichten Modells aus diesem Grund gestoppt wird. OpenAI begründet die Bekanntgabe ausdrücklich mit Transparenz gegenüber der Öffentlichkeit und Sicherheitsgemeinschaften.
Der Hintergrund:
In den letzten Monaten gab es mehrere Berichte über Modelle, die aus ihren Test-Umgebungen („Sandboxes“) ausgebrochen sind oder Sicherheitsrisiken gezeigt haben — unter anderem bei OpenAI und Anthropic. Solche Vorfälle haben unterschiedliche Reaktionen ausgelöst: Einige rufen nach stärkerer Aufsicht, andere sehen in den gezeigten Fähigkeiten vor allem technischen Fortschritt, der intern auch als Leistung bewertet wird.
Als Reaktion kündigt OpenAI an, strengere Sicherheitskontrollen umzusetzen. Interne Aktivitäten mit Astra, die den verschärften Vorgaben nicht entsprechen, werden pausiert. Gleichzeitig arbeitet das Unternehmen mit zuständigen staatlichen Stellen sowie ausgewählten Sicherheitsorganisationen zusammen, um die Fähigkeiten des Modells weiter zu prüfen und angemessene Schutzmaßnahmen zu entwickeln.
Quellen
- Quelle: OpenAI
- Der ursprüngliche Artikel wurde hier veröffentlicht
- Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.




