2Wo.·

Ist Astra wirklich so gut, wie alle sagen?

OpenAI hat am 3. September GPT-6 Astra veröffentlicht, das alle bisherigen KI-Benchmarks sprengt und eine spielbare Ego-Shooter-Karte in 28 Minuten erstellen kann.


Die Kennzahlen aus OpenAIs eigener Veröffentlichung:

  • FrontierMath Tier 4: 97,6 %
  • ARC-AGI-3: 99,9 %
  • OSWorld 2.0 (Computernutzung): 72,6 % bei rund 47 % weniger Zeit je Aufgabe als der Vorgänger GPT-5.6 Sol mit 65,7 %
  • ExploitBench: 100 % gegenüber 78,5 % für Sol (Vorgängermodell)
  • Artificial Analysis Intelligence Index: 61,2 gegenüber 60,9 für Sol und 65,7 für Claude Fable 5.1


Dabei gibt es aber einen Haken, denn Astra ist nicht als besserer Chatbot gebaut, sondern als Bediener eines Computers:

Es füllt Online-Formulare aus, aktualisiert Kundendatensätze in einem CRM-System, organisiert Kalender, recherchiert im Browser, erstellt Dokumente, Tabellen und Präsentationen nach Vorlage und testet fertige Websites auf Fehler.


Was Nutzer in der ersten Woche bereits damit gebaut haben:

Astra erklärt Programme wie Blender oder Unreal Engine nicht mehr, es bedient sie selbst :

  • Spielkarte in 28 Minuten: Riley Brown ließ Astra über Codex mit vollem Computerzugriff eine Ego-Shooter-Karte bauen. Das Protokoll weist 28 Minuten und 16 Sekunden aus, 20 bearbeitete Dateien und 80 bestandene automatisierte Prüfungen – inklusive Waffen- und Audio-Timing sowie Sprengwirkung.
  • Spielbare Welt ohne Vorkenntnisse: Matt Shumer, weder 3D-Künstler noch Spieleentwickler, ließ eine Survival-Welt in der Unreal Engine erzeugen und als spielbare Figur einrichten.


Der Punkt daran ist nicht die Grafik, sondern die Dauer: Aufgaben über Stunden und Tage, die das Modell selbstständig weiterverfolgt, waren bisher die große Schwierigkeit.


Astra ist außerdem das erste Modell, das OpenAI in der eigenen Sicherheitssystematik als „Critical" für Cybersicherheit einstuft:

Es kann unbekannte Sicherheitslücken finden und ausnutzen, ohne dass ein Mensch jeden Schritt führt. Die ausgelieferte Fassung verweigert deshalb offensive Aufgaben wie das Bauen von Exploits; freigeschaltet wird das nur über das Verteidiger-Programm Daybreak. Sam Altman sprach von einem „new capability level" des Modelles.


Der Sprung liegt also dort, wo Aufgaben über Stunden laufen und mehrere Programme bedient werden müssen. Beim reinen Denkvermögen ist der Abstand klein – im unabhängigen Artificial Analysis Index liegt Astra praktisch auf Vorgängerniveau und hinter Claude Fable 5.1.

Wer nur chattet, merkt kaum einen Unterschied. Wer Arbeit delegiert, sehr wohl.


Was bedeutet das für den KI-Sektor?

Ein Modell, das 28 Minuten am Stück arbeitet, verbraucht ein Vielfaches eines kurzen Chatverlaufs und beschläunigt die Token-Nutzung massiv. Agentische Arbeit ist damit vor allem eine Nachfragequelle nach mehr Rechenleistung – und diese landet bei $NVDA (-0,67 %), den Hyperscalern ($AMZN (-1,58 %)$GOOGL (-3,17 %)$MSFT (+0,98 %)) und den Neoclouds ($CRWV (+0,43 %)$NBIS (-3,16 %)$IREN (-2,39 %)), die diese Kapazität vermieten.


Quellen:

https://openai.com/index/gpt-6-astra/

https://openai.com/index/safety-overview-gpt-6-astra/

https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html

https://x.com/rileybrown/status/2095679352927056230

https://x.com/mattshumer_/status/2095596175705399482

12
5 Kommentare

Profilbild
Aber Claude hat doch schon diverse Cybersicherheitslücken eigenständig, deutlich vor Astra gefunden. Ist eher ein Aufschluss zur Konkurrenz, denn ein überholen, nicht?
1
Profilbild
@Get_Rich_or_Die_Tryin Ja stimmt. Die große Verbesserung an diesem Modell ist zusätzlich die eigenständige Nutzung von Programmen, was Astra besser als bspw. Claude Fable 5 kann.
1
Hab auch gelesen, dass Astra bei tests geschummelt haben sollen und dadurch wären die Vergleiche mit anderen fake. Aber inwieweit das stimmt weiß ich nicht
2
Profilbild
Pazzzi, did u test Astra?
Profilbild
@pelo Not yet
Werde Teil der Community