OpenAI

GPT-6 Astra: A new generation of intelligence

Eine neue Generation der Intelligenz

Update vom 22. September 2026: Wir erweitern unsere GPT‑6‑Familie um GPT‑6 Sol und GPT‑6 Luna. Mehr erfahren.

Wir stellen GPT‑6 Astra vor, das intelligenteste und am besten ausgerichtete Modell der Welt.

GPT‑6 Astra vereint jahrelange Forschung und mutige Investitionen in Pre-Training, Reinforcement Learning und Alignment. Astra ist führend in den Bereichen Computernutzung, Web-Browsing, Softwareentwicklung, Cybersicherheit, Wissenschaft und professionelle Arbeit. Astra erreicht bei FrontierMath Tier 4 mit einem Score von 98 % die Sättigungsgrenze und hat bereits bei der Lösung seit Langem offener Probleme⁠ in der Mathematik geholfen. Astra erreicht außerdem bei ARC-AGI-3 mit einem Score von 99,9 % und bei ExploitBench mit einem Score von 100 % jeweils die Sättigungsgrenze. Es setzt außerdem neue Maßstäbe bei der Computer- und Browsernutzung und bewältigt anspruchsvollste Arbeitsaufgaben mit unerreichter Geschwindigkeit, Genauigkeit und unerreichtem Urteilsvermögen.

GPT‑6 Astra wird ab heute für eine begrenzte Anzahl von Organisationen eingeführt und in den kommenden Tagen allen ChatGPT Plus-, Pro-, Business- und Enterprise-Nutzer:innen sowie über die OpenAI API, Microsoft Azure und AWS Bedrock zur Verfügung stehen.

„Bei ARC-AGI-3 übertraf Astra unsere Baseline für menschliche Handlungseffizienz in 96 % der Levels und erreichte damit auf dem Benchmark faktisch menschliche Parität. Dies ist nicht nur das beste Modell, das wir je getestet haben, sondern es stellt auch einen bedeutenden Leistungssprung bei Frontier-Modellen dar – nicht nur in seiner Fähigkeit, sich in neuartigen Umgebungen zurechtzufinden und darin Aufgaben zu lösen, sondern auch darin, wie effizient es lernt, dies zu tun.“
Greg Kamradt, ARC Prize Foundation

Astra ist unser am besten ausgerichtetes Modell, mit erheblichen Verbesserungen beim Verständnis der Nutzerabsicht und beim Modellverhalten – du kannst Aufgaben mit größerem Vertrauen in Astras Urteilsvermögen delegieren. Um dies auf eine Weise zu testen, haben wir auf Grundlage des Vorfalls bei Hugging Face eine neue Evaluierung entwickelt. Sie prüft, ob ein Modell, das vor einer schwierigen oder unlösbaren Aufgabe steht, über seinen vorgesehenen Aufgabenbereich hinausgeht. Im Vergleich zu GPT‑5.6 Sol, das ohne Produktions-Schutzmaßnahmen in 48 % der Fälle das zulässige Ziel überschritt, tat GPT‑6 Astra dies in 0 % der Fälle.

Das weltweit beste Modell für Computernutzung

GPT‑6 Astra setzt neue Frontier-Maßstäbe bei Geschwindigkeit, Genauigkeit und Sicherheit der Computernutzung. Es kann mühsame Aufgaben übernehmen, wie das Ausfüllen von Online-Formularen, das Aktualisieren von Kundendatensätzen in einem CRM und das Organisieren deines Kalenders. Es kann Online-Recherchen durchführen und Zusammenfassungen in deiner E-Mail oder in deinem Dokumenteditor entwerfen. Es kann wissenschaftliche Daten analysieren, Diagramme erstellen, eine Website erstellen und Frontend-QA-Prüfungen durchführen, um sicherzustellen, dass alle Funktionen auf dieser Website funktionieren. Es kann dich dabei unterstützen, Software eigenständig zu installieren und zu testen sowie Probleme zu beheben, die du auf dem Bildschirm siehst. Diese Verbesserungen spiegeln sich auch in unseren hochmodernen Evaluationsergebnissen wider.

Diese Verbesserungen führen auch zu erheblichen Effizienzsteigerungen bei realen Aufgaben der Wissensarbeit. In Latenzsimulationen bei OSWorld 2.0 erreicht Astra eine höhere Computernutzungsleistung in etwa 47 % weniger Zeit pro Aufgabe als GPT‑5.6 Sol und erzielt 72,6 % bei etwa 40 Minuten pro Aufgabe, verglichen mit 65,7 % bei etwa 75 Minuten.3

Die Fähigkeiten von GPT‑6 Astra zur Computernutzung zeigen sich in Ergebnissen aus verschiedenen Bereichen, darunter Spieleentwicklung, Elektrotechnik und alltägliche Wissensarbeit:

Parallel zu Astra aktualisieren wir außerdem das Codex-Harness, um die Geschwindigkeit der Computerbedienung erheblich zu verbessern. In Kombination mit der Effizienz von Astra führt dies zu einer 1,9-mal schnelleren Aufgabenerledigung im Vergleich zur aktuellen GPT‑5.6‑Sol‑Erfahrung beim Mind2Web-Benchmark. Dank der Geschwindigkeitsverbesserungen des Modells kann es viele zeitaufwändige Alltagsaufgaben für dich schneller übernehmen, als du sie selbst erledigen kannst.4

„Wir integrieren GPT‑6 Astra am Tag der Einführung in Devins Harness, wo es bei unserem internen Test-Benchmark Spitzenleistungen erzielt. Die hervorragenden Fähigkeiten bei der Computernutzung, beim Schreiben und beim Verständnis der Codebasis verbesserten das Testen von Anfang an: Videos sind deutlich leichter nachzuvollziehen, und Berichte sind klarer und prägnanter“
Silas Alberti, SVP Research, Cognition

Ein entscheidender Fortschritt für professionelle Arbeit

GPT‑6 Astra kombiniert Fortschritte bei der Computernutzung mit gezieltem Training für professionelle Umgebungen, um bei der Bewältigung komplexer Arbeitsaufgaben zu helfen. Es kombiniert die für komplexe Probleme erforderliche Intelligenz mit der Fähigkeit, mehrstufige Workflows auszuführen und professionell aufbereitete Dokumente, Tabellen und Präsentationen zu erstellen.

GPT‑6 Astra ist unser bestes Modell, dabei bestehende Vorlagen einzuhalten und Folien zu erstellen, die übersichtlich gestaltet sind und zentrale Punkte knapp in einer strukturierten Erzählweise vermitteln. Es erstellt klare, gut strukturierte Dokumente, Präsentationen, Tabellenkalkulationen und Analysen, die deinen Vorlagen folgen und deinem Schreibstil sowie deiner visuellen Gestaltung entsprechen. Astra wurde außerdem darauf trainiert, gezielt nur den relevanten Kontext in Ausgaben aufzunehmen, anstatt Informationen zu wiederholen, die für die jeweilige Aufgabe nicht erforderlich sind. All dies bedeutet, dass es unmittelbar nutzbarere Artefakte ausgeben kann, die dem jeweiligen Geschäftskontext und den vorgegebenen Standards entsprechen.

GPT‑6 Astra bringt außerdem ein besseres visuelles Urteilsvermögen in die Websites, Spiele, Anwendungen und Renderings ein, die es erstellt. Mit Sites⁠(wird in einem neuen Fenster geöffnet) in ChatGPT kann Astra Websites, Web-Apps und Spiele direkt aus einem Prompt erstellen, hosten und teilen.

„Astra verschafft uns einen erheblichen Vorteil – sowohl bei der Leistungsfähigkeit als auch bei der Effizienz. Es führt unsere komplexesten kreativen Workflows erfolgreich aus und verbraucht dabei bis zu 20 % weniger Tokens als andere von uns getestete Modelle. Vor allem bedeutet es für unsere Kund:innen Ergebnisse von höherer Qualität.“
Alex Mashrabov, CEO und Mitgründer, Higgsfield KI

Wenn Anweisungen Raum für Interpretationen lassen, trifft GPT‑6 Astra besser als frühere Modelle die richtige Entscheidung. Es nutzt den Kontext, um routinemäßige Lücken zu schließen, und stellt gezielte Fragen, wenn die Antwort das Ergebnis verändern könnte. In Codex kann es asynchron Rückfragen stellen und gleichzeitig an Aufgaben weiterarbeiten, die nicht von deiner Antwort abhängen. Wenn du nicht antwortest, fährt es gegebenenfalls mit sinnvollen Annahmen fort, wartet bei Entscheidungen mit weitreichenden Folgen jedoch auf deine Eingabe.

Die folgenden Beispiele zeigen, wie Astra an alltäglichen Aufgaben zusammenarbeitet, bei denen fehlende Informationen die Antwort wesentlich verändern können.

Astra ist außerdem besser darin, den Überblick zu behalten, während sich eine Aufgabe weiterentwickelt. Frühere Modelle behandelten Steuerungsnachrichten manchmal als neues Ziel und verloren dabei die ursprüngliche Anfrage oder frühere Einschränkungen aus den Augen. Astra bezieht neue Anforderungen ein, passt auf Anfrage die Richtung an und beantwortet Nebenfragen, ohne die übergeordnete Aufgabe aus den Augen zu verlieren.

„Astra stellt bei komplexen juristischen Aufgaben eine erhebliche Qualitätsverbesserung gegenüber GPT‑5.6 Sol dar. In unseren frühen Tests stach Astra hervor, indem es juristische Arbeit so anging, wie es scharfsinnige Anwält:innen tun würde: Es unterscheidet Dokumente von der gesicherten Aktenlage, deckt unbelegte Annahmen auf und wandelt Lücken in konkrete Positionen für den Entwurf um.“
Niko Grupen, Head of Applied Research, Harvey

Programmierung

GPT‑6 Astra ist bislang das beste Modell für Softwareentwicklung.

1 von 2
„GPT‑6 Astra erzielt Spitzenleistungen bei unseren internen Coding-Benchmarks und zeigt gegenüber GPT‑5.6 Sol einen klaren Fortschritt bei Evaluierungen der Trading-Intuition.“ Beim Einsatz für agentisches Programmieren kommuniziert GPT‑6 Astra auf eine Weise, die für Entwickler:innen leichter nachvollziehbar ist, und erzeugt Code, der weniger Iterationen erfordert, um Produktionsqualität zu erreichen.“
John Crepezzi, AI Assistants, Jane Street

Mit Astra führen wir eine neue Möglichkeit ein, mit der Codex Kontext bewahren und abrufen kann, wenn das Kontextfenster voll wird. In der Vergangenheit haben Modelle Kontextverdichtung genutzt, um den Arbeitsverlauf während langer Sitzungen zusammenzufassen, etwa bei der Fehlerbehebung bei komplexen Problemen oder bei umfangreichen Refactorings. Bei jeder Kontextverdichtung können Details dazu ausgelassen werden, warum eine Fehlerbehebung fehlgeschlagen ist oder wie sich eine Komponente verhält. In Codex kann Astra Notizen über Kontextfenster hinweg speichern und angesammelte Details bewahren, ohne sie wiederholt in einer einzigen Zusammenfassung zu komprimieren. Frühere Kontextfenster bleiben durchsuchbar, sodass Astra Anforderungen oder Testergebnisse aus vorherigen Nachrichten und Tool-Ausgaben finden kann – auch wenn diese Informationen nicht in seinen Notizen festgehalten wurden. Du kannst diese experimentelle Funktion in der config.toml von Codex⁠(wird in einem neuen Fenster geöffnet) aktivieren, und sie wird in den kommenden Wochen zur Standardeinstellung für Astra.

Wissenschaftliche Entdeckungen vorantreiben

„Die Geschichte lautet: Ende einer Ära, Beginn einer neuen.“
Greg Burnham, EpochAI

GPT‑6 Astra stellt einen bedeutenden Fortschritt für wissenschaftliche Entdeckungen, Mathematik und den Gesundheitsbereich dar. Heute präsentieren wir zwei weitere Ergebnisse zu den Abständen zwischen Primzahlen.9 und 10

Astra stellt außerdem neue Rekorde bei einer Reihe von Evaluationen in Mathematik und Naturwissenschaften auf.

Astra kann die praktische Arbeit hinter wissenschaftlichen Entdeckungen unterstützen. Durch die Kombination von wissenschaftlichem Reasoning mit Computernutzung kann es direkt in spezialisierter Software arbeiten, um Daten zu prüfen und Ergebnisse zu untersuchen. So hilft es Forschenden, die Evidenz zu bewerten und zu entscheiden, was als Nächstes untersucht werden soll.

Cybersicherheit

Wie wir in unserem Sicherheitsupdate⁠ erläutert haben, stellt Astra einen bedeutenden Sprung bei den Cyberfähigkeiten dar und erreicht im Bereich Cybersicherheit den Schwellenwert für „Kritisch“ gemäß unserem Preparedness Framework. Seine Fähigkeit, Zero-Day-Exploits zu identifizieren und zu entwickeln, kann Sicherheitsteams dabei helfen, Schwachstellen zu finden und beheben, schafft aber zugleich einen Bedarf an stärkeren Schutzmaßnahmen. Um zu verstehen, wie weit diese Fähigkeiten reichen, haben wir Astra anhand interner und von Dritten durchgeführter Expertenbewertungen evaluiert.

Wir haben das Modell zunächst ohne Schutzmaßnahmen für den Produktivbetrieb auf ExploitBench und ExploitGym getestet; diese Benchmarks bewerten, ob Modelle bekannte Softwareschwachstellen in funktionsfähige Exploits umwandeln können. Auf ExploitBench erzielte Astra ein perfektes Ergebnis von 100 %, im Vergleich zu 78,5 % bei GPT‑5.6 Sol, unserem bisherigen Frontier-Modell mit Cyberfähigkeiten. Bei ExploitGym erreichte Astra eine Erfolgsquote von 42,4 %, verglichen mit 30,3 % für GPT‑5.6 Sol, und verwendete dabei deutlich weniger Ausgabe-Tokens.13

Angesichts von Bedenken, dass die Exposition gegenüber historischen Software-Schwachstellen die Benchmark-Ergebnisse beeinflusst haben könnte, haben wir Astra auch anhand von zwei neuen Benchmarks bewertet. Zum einen haben wir eine interne „ExploitBench (Juni–August 2026)“-Evaluation entwickelt, um die Exploit-Entwicklung anhand von Schwachstellen aus den vorangegangenen drei Monaten zu testen.14 Astra erzielte bei diesem Datensatz wesentlich höhere Raten bei der Ausführung beliebigen Codes als GPT‑5.6 Sol und verwendete dabei deutlich weniger Ausgabe-Tokens. Während der Evaluierung entdeckte und nutzte Astra zwei bislang unbekannte Zero-Day-Schwachstellen. Wir informieren die für ihre Wartung Zuständigen über beide Schwachstellen.

Wir haben Astra außerdem auf SRE-Bench15 getestet, einem Benchmark, der misst, ob Modelle Software-Binärdateien per Reverse Engineering analysieren können, um deren Kernlogik ohne Zugriff auf den Rohquellcode zu verstehen. Astra löste 88,0 % der Aufgaben in einem einzigen Versuch und 99,2 % innerhalb von vier Versuchen, verglichen mit 55,9 % bzw. 68,7 % bei GPT‑5.6 Sol.

Über Benchmarks hinaus ergaben von Expert:innen geleitete Bewertungen, dass Astra, wenn es ohne Schutzmaßnahmen für den Produktivbetrieb ausgeführt wurde, zuvor unbekannte Schwachstellen nutzen konnte, um in gehärteten Browsern beliebigen Code auszuführen und Exploits zur Rechteausweitung für gehärtete Betriebssysteme zu erstellen.

Wie wir in Das Handlungsfenster der Cyberabwehr besprochen haben, können Frontier-Cyberfähigkeiten Verteidiger:innen helfen, Schwachstellen schneller zu finden, machen diese Schwachstellen aber auch leichter ausnutzbar, wodurch die Dringlichkeit für Verteidiger:innen steigt, sich anzupassen. Mit der heute eingeführten Version von Astra können Verteidiger:innen damit Aufgaben wie sichere Code-Reviews und Patchen erledigen.

Astra wird sich jedoch weigern, anspruchsvollere Cybersicherheitsaufgaben wie das Erstellen von Proof-of-Concept-Exploits für Schwachstellen auszuführen. Im Rahmen von OpenAI Daybreak⁠ planen wir, den Zugang zu erweitern und in den kommenden Wochen weniger restriktive Schutzmaßnahmen einzuführen. Dadurch werden weitere Abwehrworkflows ermöglicht, darunter die Validierung von Schwachstellen und Proofs of Concept, Malware-Analyse und Detection Engineering.

Wir haben außerdem unsere Schutzmaßnahmen gegen potenziellen Cyber-Missbrauch aufbauend auf unserem Schutzmaßnahmen-Stack für GPT‑5.6 Sol verstärkt. Dazu gehören eine stärkere Modellrobustheit, um potenziellen Jailbreaks besser standzuhalten, sowie mehr Kontext für unsere Überwachungssysteme. Wir haben strenge interne und externe Tests fortgesetzt, darunter automatisierte Evaluationen mit unseren internen Red-Teaming-Angreifern. Weitere Details zu unseren Cyberschutzmaßnahmen und Tests findest du in der Sicherheitsübersicht⁠ und der Systemkarte⁠(wird in einem neuen Fenster geöffnet) von Astra.

Verantwortungsvolle Ausrichtung und Bereitstellung von GPT‑6 Astra

Astra ist unser am besten ausgerichtetes Modell. Astra zeichnet sich dadurch aus, Sorgfalt walten zu lassen, Aufgabengrenzen zu respektieren und transparent zu kommunizieren. Diese Arbeit ist das jüngste Ergebnis unseres langjährigen Forschungsprogramms, dessen Schwerpunkt darauf liegt, Modelle zu trainieren, die von Anfang bis Ende auf menschliche Absichten ausgerichtet bleiben.

In sensiblen Umgebungen geht Astra mit der seinem Risiko angemessenen Sorgfalt vor. In einer Evaluation von Aufgaben zur Computernutzung, die auf adversariale Weise ausgewählt wurden, um Fehlverhalten hervorzurufen, war Astra erfolgreicher darin, unbeabsichtigte Folgen zu vermeiden. Die Ausführung mit den standardmäßig angebotenen zusätzlichen Sicherheitsmaßnahmen erzielte eine noch bessere Performance.

Astra verursacht weniger unerwünschte Folgen durch fehlgeleitetes Verhalten als jedes andere getestete Frontier-Modell. Für einen fairen Vergleich haben wir ein generisches Computer-Using-Agent-Harness verwendet (basierend auf den nativen Computersteuerungs-Tools, die sowohl in der OpenAI Responses API⁠(wird in einem neuen Fenster geöffnet) als auch in der Anthropic Messages API⁠(wird in einem neuen Fenster geöffnet) verfügbar sind) und ohne zusätzliche Schutzmaßnahmen, die normalerweise für Nutzer:innen von Codex und ChatGPT Work bereitgestellt werden (Auto-Prüfung, Bestätigungsrichtlinie).

Astra agiert außerdem mit größerer Wahrscheinlichkeit innerhalb der von Nutzer:innen festgelegten und durch seine Umgebung implizierten Grenzen. In einer internen Evaluierung hat Astra nie versucht, eine Ablehnung durch die automatische Prüfung von Codex zu umgehen. Dies galt selbst dann, wenn die Auto-Prüfung absichtlich so konfiguriert war, dass sie umgangen werden konnte, und die Aufgabe sonst nicht lösbar gewesen wäre. Diese Einhaltung der Umgebungsbeschränkungen steht im Einklang mit den Ergebnissen unserer Evaluation unmöglicher Cyber-Aufgaben, die wir in der Einleitung dieses Beitrags vorgestellt haben, sowie mit weiteren Erkenntnissen, die in unserer Systemkarte⁠(wird in einem neuen Fenster geöffnet) dokumentiert sind.

Astra setzt darüber hinaus neue Maßstäbe in der transparenten Nutzerkommunikation. In einer Evaluation macht Astra mit dreimal geringerer Wahrscheinlichkeit als GPT‑5.6 Sol unzutreffende Angaben zu seinen Fähigkeiten und Handlungsmöglichkeiten.

In unserer Evaluation zu Fähigkeits-Halluzinationen zeigt Astra gegenüber GPT‑5.6 Sol eine deutliche Verbesserung und macht weniger irreführende Aussagen über seine Fähigkeiten.

Unsere Evaluationen ergaben, dass Astras schriftliches Reasoning schwieriger zu überwachen ist als das von GPT‑5.6 Sol, basierend auf Tests, in denen es ausdrücklich aufgefordert wurde, die Überwachung zu umgehen. Wir führen dies auf Astras größere Kontrolle über schriftliches Reasoning bei einfacheren Aufgaben und Astras Fähigkeit zurück, Probleme mit weniger schriftlichen Schritten zu lösen. Astra scheint weiterhin Schwierigkeiten zu haben, das für komplexe Aufgaben erforderliche Reasoning zu verbergen, aber wir nehmen den Rückgang ernst. Die Verbesserung der Überwachbarkeit bleibt eine Forschungspriorität, und die zugehörige Systemkarte⁠(wird in einem neuen Fenster geöffnet) beschreibt unsere Erkenntnisse und laufenden Arbeiten im Detail.

Alignment-Training ist zentral für unseren Ansatz zur Bereitstellung. Als zusätzliche Schutzebene entwickeln wir außerdem Systemschutzmaßnahmen wie Codex Auto-Prüfung⁠(wird in einem neuen Fenster geöffnet) und überwachen das Reasoning und die Aktionen von Agenten, um unsicheres Verhalten besser zu erkennen und einzudämmen. Wie in unserem Sicherheitsupdate⁠ beschrieben, setzen wir außerdem für Modelle der Astra-Klasse im Produktivbetrieb eine Überwachung auf Fehlausrichtung ein, um Einblick in diese zu erhalten und dazu beizutragen, ihre schlimmsten Ausprägungen einzudämmen. Diese Schutzmaßnahmen ähneln unserer Überwachung interner Bereitstellungen und umfassen ein System aus Klassifikatoren, die das Reasoning und die Aktionen des Modells auf unbefugtes Verhalten prüfen und potenziell unbefugte Aktivitäten automatisch stoppen.

Angesichts der deutlichen Erweiterung der Cybersicherheitsfähigkeiten von Astra gehen wir besonders sorgfältig vor, um diese Bereitstellung sicher und geschützt zu gestalten. Zusätzliche Sicherheitsprüfungen können legitime Arbeit, einschließlich defensiver Cybersicherheitsmaßnahmen, bisweilen verlangsamen, unterbrechen oder stoppen. Wenn eine Aufgabe in ChatGPT oder Codex pausiert wird, wirst du möglicherweise gebeten, vor dem Fortfahren die Aktion zu überprüfen. In der API wird die Aufgabe gestoppt. Diese Überprüfungen können manchmal legitime Arbeitsabläufe unterbrechen, und wir entwickeln dieses System kontinuierlich weiter, um unnötige Unterbrechungen zu reduzieren. Die Überwachung auf Fehlausrichtung kann das Alignment nicht ersetzen: Unser Ziel ist es, Modelle zu entwickeln, die zuverlässig innerhalb ihres autorisierten Rahmens bleiben, sodass diese Schutzmaßnahmen nie eingreifen müssen.

Verfügbarkeit

GPT‑6 Astra wird ab heute für eine begrenzte Anzahl von Organisationen eingeführt und in den kommenden Tagen allen ChatGPT Plus-, Pro-, Business- und Enterprise-Nutzer:innen sowie über die OpenAI API, Microsoft Azure und AWS Bedrock zur Verfügung stehen. Die Nutzung von Astra ist in den bestehenden Abonnementkontingenten enthalten – Nutzer:innen und Unternehmen können außerdem Credits für zusätzliche Nutzung erwerben. Nutzer:innen mit den Plänen Pro, Business und Enterprise erhalten außerdem Zugriff auf GPT‑6 Astra Pro. Enterprise-Administrator:innen können Astra für ihren Workspace aktivieren; der Zugriff ist bei der Einführung standardmäßig deaktiviert.

Astra unterstützt „Keine Datenaufbewahrung“ für berechtigte API-Kund:innen, und wie wir letzten Monat mitgeteilt haben, testen wir Private Safety Processing, um die Sicherheitsüberwachung zu stärken und zugleich den Datenschutz der Kund:innen zu wahren.

Für Entwickler:innen wird GPT‑6 Astra in der OpenAI API als gpt-6-astra sowie über Microsoft Azure und Amazon Bedrock verfügbar sein.

Die Standardpreise für die OpenAI API betragen 10 USD pro Million Eingabe-Tokens und 50 USD pro Million Ausgabe-Tokens. Für Cache-Lese- und -Schreibvorgänge gelten separate Tarife. Der Schnellmodus ist für GPT‑6 Astra in der API verfügbar und bietet die bis zu 2-fache Geschwindigkeit der Standardverarbeitung zum 2-fachen Standardpreis.

Computernutzung

Computernutzung

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3 %

53,6 %

-

48,7 %

55,5 %

-

OSWorld 2.0 (v2026.08.08, Offline-Set, Score mit Teilpunkten)

72,6 %

65,7 %

-

-

70,2 %3

-

ScreenSpot-Pro (ohne Tools)

92,7 %

76,9 %

-

87,3 %17

-

-

Professionell

Professionell

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3 %

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8 %

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Interne Designaufgaben

50,0 %

47,4 %

-

35,8 %

-

-

Interne Data-Science-Aufgaben

40,9 %

30,5 %

-

34,7 %

-

-

Artificial Analysis Intelligence Index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Programmierung

ProgrammierungGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %44,5 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %69,9 %73,7 %73,8 %
FrontierCode 1.1 Extended (Score)64,5 % 860,6 %63,6 %64,9 %63,6 %56,3 %
FrontierCode 1.1 Main (Score)53,3 % 847,5 %50,9 %53,5 %53,4 %43,6 %
Interne Datenbankmigrationsaufgaben63,9 %42,7 %57,8 %50,3 %--
Artificial Analysis Coding Agent Index v1.467,065,1-67,268,161,2

Wissenschaftliche

Wissenschaftliche

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4 %

30,0 %

-

FrontierMath Tier 4 (v2)

97,6 %

83,0 %

87,8 %

90,2 %

73,2 %

-

GPQA Diamond

96,0 %

94,6 %

93,7 %

92,6 %

93,7 %

95,3 %

Humanity's Last Exam (mit Tools)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Wissenschaft und Gesundheit

Wissenschaft und GesundheitGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1 %32,3 %----
MedChemBench (intern)49,3 %47,4 %----
LifeSciBench60,3 %59,9 %----
HealthBench Professional (längenbereinigt)63,4 %60,5 %58,1 % 1160,9 % 1156,4 % 1152,1 %

Cybersicherheit

CybersicherheitGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0 %78,5 %--70 %-
ExploitGym42,4 % 1330,3 % 1330,4 % 1728,4 %1722,0 %-
ExploitBench (Juni–Aug. 2026)39,0 %5,5 %----
SRE-Bench88,0 %55,9 %--12,5 %-
SEC-Bench Pro85,4 %79,1 %----

Ausrichtung

Ausrichtung

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Interner Sicherheits-Benchmark für Computernutzung (je niedriger, desto besser)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Interner Sicherheitsbenchmark für Computernutzung mit AutoReview (je niedriger, desto besser)

1,8 %

4,3 %

-

-

-

-

Interner Umgehungs-Benchmark (je niedriger, desto besser)

0,00 %

0,29 %

-

-

-

-

ExploitGym-Honeypot (je niedriger, desto besser)

0,0 %

48,2 %

-

-

-

-

Impossible ExploitGym

100,0 %

-

-

-

-

-

Interner Halluzinations-Benchmark (je niedriger, desto besser)

4,2 %

12,2 %

-

-

-

-

Langer Kontext

Langer Kontext

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstraktes Denken

Abstraktes ReasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8 %--30,2 %-
ARC-AGI-295,0 %92,5 %90,0 %89,2 %90,4 %-
ARC-AGI-198,5 %97,5 %97,5 %98,5 %97,5 %-

Die angegebenen Evaluierungs-Scores entsprechen jeweils dem Höchstwert über die getesteten Reasoning-Aufwandsstufen hinweg. GPT‑Evaluierungen wurden in unserer Forschungsumgebung oder über unsere API durchgeführt, was aufgrund von Unterschieden bei den System-Prompts, verfügbaren Tools usw. zu leicht abweichenden Ausgaben im Vergleich zur Produktionsversion von ChatGPT führen kann.

FUSSNOTEN

  1. 1

    Bei ARC-AGI-3 wurde GPT-6 Astra mit unserem Responses-API-Harness⁠ ausgeführt, das zwei Einstellungen ändert, um die reale Leistung besser abzubilden. Die Änderungen zielen nicht speziell auf ARC-AGI-3 ab.

  2. 2

    GPT-5.6 Sol bezeichnet die Version, die in unserer API, ChatGPT Codex und ChatGPT Work verfügbar ist. Die Version in ChatGPT Chat ist leicht anders.⁠

  3. 3

    OSWorld V2-Offline ist eine Teilmenge der ursprünglichen OSWorld V2, die ohne Internetzugang funktioniert. Die Leistung des Claude-Modells bei OSWorld-V2 Offline wurde von den Autor:innen auf der offiziellen Bestenliste⁠(wird in einem neuen Fenster geöffnet) reproduziert. Bei OSWorld 2.0 beruhen die Scores für Claude auf den offiziellen Einstellungen und nicht auf den modifizierten Aufgaben und der modifizierten Bewertung aus der Fable 5.1-Systemkarte.

  4. 4

    Modellzeiten sind die angegebenen verstrichenen Zeiten für die entsprechenden Demonstrationsläufe. Die angezeigten Clips sind bearbeitete Auszüge.

  5. 5

    Bei BenchCAD spiegeln Claudes Scores 3 Änderungen an der Eval wider, die in der Fable 5.1-Systemkarte⁠(wird in einem neuen Fenster geöffnet) beschrieben sind.

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon und Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(wird in einem neuen Fenster geöffnet).“ arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower und Peter Jonas. „The OpenScore String Quartet Corpus⁠(wird in einem neuen Fenster geöffnet).“ Proceedings of the 10th International Conference on Digital Libraries for Musicology, S. 49–57. ACM, 2023.

  8. 8

    Auf FrontierCode wurde GPT-6 Astra mit einer Entwicklernachricht ausgeführt, die einem Abschnitt seiner Entwicklernachricht in Codex⁠(wird in einem neuen Fenster geöffnet) ähnelte: „Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code.“ Der Prompt wurde nicht für die Eval optimiert.

  9. 9

    Die erste betrifft die Frage, wie dicht beieinander Primzahlen auftreten können, ganz gleich, wie weit auf der Zahlengeraden vorangeschritten wird. Mehr als ein Jahrzehnt lang besagte das beste bekannte Ergebnis, dass es unendlich viele Paare von Primzahlen gibt, deren Abstand höchstens 246 beträgt. Julia Stadlmann⁠(wird in einem neuen Fenster geöffnet) hat diese Schranke kürzlich auf 240 verbessert. Astra trug dazu bei, eine stärkere Schranke von 186 zu etablieren, was zeigt, dass unendlich viele Paare innerhalb dieser kleineren Distanz auftreten. Kleine Primzahllücken: Beweis⁠(wird in einem neuen Fenster geöffnet) und unterstützende Forschung⁠(wird in einem neuen Fenster geöffnet).

  10. 10

    Beim zweiten geht es um ungewöhnlich große Lücken zwischen Primzahlen. Astra verbesserte einen Term in einer Schranke für diese Lücken, der mehr als 80 Jahre lang unverändert geblieben war. Wir stellen die Beweise sowie die gekürzte Gedankenkette und Verifikationsmaterialien für beide Ergebnisse bereit. Große Primzahllücken: Beweis⁠(wird in einem neuen Fenster geöffnet) und unterstützende Forschung⁠(wird in einem neuen Fenster geöffnet).

  11. 11

    Wir haben alle Claude-Modelle unabhängig gemäß dem vorgesehenen HealthBench-Professional-Verfahren evaluiert und dabei GPT‑5.4 zur Bewertung sowie längenbereinigte, nicht gekappte Scores verwendet. Für Fable 5.1 haben wir Opus 5 als Fallback bei Ablehnungen durch den Anbieter verwendet.

  12. 12

    Claude Fable 5 und 5.1 sind nicht in LifeSciBench Gold v1, GeneBench Pro v13 und MedChemBench enthalten, weil sie die Beantwortung des Großteils der Fragen in diesen Evaluierungen verweigern.

  13. 13

    Auf ExploitGym haben wir Astra und Sol ohne das 6-Stunden-Zeitlimit getestet, um ihre vollen Cyberfähigkeiten besser beurteilen zu können. Sie sind schnell genug, dass dies kaum Auswirkungen hat.

  14. 14

    ExploitBench (Juni–August 2026) enthält 20 V8-Schwachstellen mit hohem Schweregrad in 13 stabilen Chrome-Releases. Der Benchmark testet, ob Agenten durch Ausnutzung jeder angegebenen Schwachstelle die Ausführung beliebigen Codes in V8 und offiziellen Chrome-Versionen für Linux erreichen können. Einige der enthaltenen Schwachstellen ermöglichen unter den Einschränkungen der Evaluierung möglicherweise keine Ausführung beliebigen Codes, sodass eine Erfolgsquote von 100 % möglicherweise nicht erreichbar ist. Hinweis: Die Punktzahl von 5,5 % von GPT-5.6 Sol ist ein Artefakt des 300-Runden-Limits im Benchmark, einer Begrenzung, der echte Kund:innen bei Nutzung von max nicht unterliegen würden. Das Modell erzielte bei ähnlichen Einstellungen eine Punktzahl von 11,5 %, wenn es auf weniger Limits stieß.

  15. 15
  16. 16

    Wenn wir Drittanbieter-Modelle testen, verwenden wir ein einfacheres Forschungssetup. Codex verfügt über eine komplexere Produktionskonfiguration, die zu unterschiedlichen Fehlerraten der Rohmodelle führen kann. Schutzmechanismen auf Anbieterseite und Implementierungen von Computer-Tools unterscheiden sich weiterhin. Nutzer:innen erleben das Szenario ohne Bestätigung in Codex nicht, da es sich dabei um eine interne Forschungskonfiguration handelt.

  17. 17

    Für ScreenSpot-Pro und ExploitGym stammen die von uns berichteten Fable-Scores aus Mythos, einer Version von Fable mit weniger Schutzmaßnahmen.