GPT-6.1Sol
Intelligenz nahe am Astra-Niveau zum Fünftel des Preises für dauerhafte Frontier-Leistung
Wir stellen GPT‑6.1 Sol vor: ein Upgrade von GPT‑6 Sol mit besonders starker Leistung beim agentischen Programmieren, bei der Computernutzung und bei beruflichen Aufgaben. Es bringt Sol bei anspruchsvollen Aufgaben näher an GPT‑6 Astra heran, zu einem Fünftel der Standardpreise von Astra für Eingabe- und Ausgabe-Token. So haben Entwicklungsteams mehr Spielraum, um mit demselben Budget leistungsfähige Agenten zu entwickeln und zu betreiben.
GPT‑6.1 Sol bietet nahezu die Leistung von Astra zu Sol-Preisen und damit das derzeit beste Preis-Leistungs-Verhältnis unter den verfügbaren Modellen. Zwischengespeicherte Eingaben kosten nur 0,10 USD pro Million Token, 95 % weniger als zum Standardpreis für Eingaben. Das macht agentische Aufgaben günstiger, bei denen Kontext über wiederholte Anfragen hinweg wiederverwendet werden muss.
GPT‑6 Astra bleibt insgesamt unser leistungsfähigstes Frontier-Modell. GPT‑6.1 Sol bietet ein neues Verhältnis von Leistung und Kosten: für wichtige Aufgaben, die Menschen häufiger erledigen möchten, und für Unternehmen, die über die API Anwendungen in großem Umfang entwickeln und betreiben.

GPT‑6.1 Sol bietet gegenüber GPT‑6 Sol erhebliche Verbesserungen bei komplexen beruflichen Aufgaben: vom Schreiben und Debuggen von Code über das Verstehen von Dokumenten bis hin zur Ausführung mehrstufiger Geschäftsabläufe. In mehreren dieser Evaluierungen nähert es sich der Leistung von GPT‑6 Astra an, bei deutlich niedrigeren Kosten.
Bei DeepSWE v1.1, das komplexe Softwareentwicklungsaufgaben in realen Codebasen bewertet, erreicht GPT‑6.1 Sol die Leistung von GPT‑6 Astra zu rund einem Fünftel der Kosten. Dabei übertrifft es das beste Ergebnis von GPT‑6 Sol um 6,4 Prozentpunkte, bei geringerem Reasoning-Aufwand und niedrigeren Kosten.
In DeepSWE 1.1(wird in einem neuen Fenster geöffnet) lösen KI-Agenten eigens entwickelte, langfristig angelegte Aufgaben der Softwareentwicklung.
GDP.pdf misst, wie genau Modelle berufliche Fragen anhand komplexer PDF-Dokumente beantworten, einschließlich Tabellen, Grafiken, Diagrammen und Details im Kleingedruckten. Hier erzielt GPT‑6.1 Sol über die getesteten Reasoning-Einstellungen hinweg bessere Ergebnisse als Opus 5.5 mit Fallbacks, zu weniger als der Hälfte der Kosten pro Aufgabe. Zudem nähert es sich der Spitzenleistung von GPT‑6 Astra an, zu rund einem Fünftel der Kosten pro Aufgabe.
In GDP.pdf(wird in einem neuen Fenster geöffnet) müssen Modelle praxisnahe Prompts zu komplexen PDFs aus beruflichen Arbeitsabläufen im Finanz-, Gesundheits- und Rechtswesen sowie in sieben weiteren Fachgebieten beantworten.
Bei AutomationBench, das misst, ob Agenten mehrstufige Geschäftsabläufe korrekt abschließen, liegt GPT‑6.1 Sol auf der Reasoning-Stufe Mittel um 2,2 Prozentpunkte vor Opus 5.5, zu rund einem Drittel der Kosten. Dieses Ergebnis liegt außerdem um 4,8 Prozentpunkte über dem von GPT‑6 Sol bei derselben Einstellung.
In AutomationBench 1.0.6(wird in einem neuen Fenster geöffnet), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol macht auch bei Aufgaben erhebliche Fortschritte, die eine Interaktion mit Computeranwendungen erfordern. Im Offline-Datensatz von OSWorld 2.0, der Agenten anhand anspruchsvoller Arbeitsabläufe am Computer bewertet, übertrifft GPT‑6.1 Sol bei maximalem Reasoning-Aufwand GPT‑6 Sol um sieben Prozentpunkte, zu weniger als der Hälfte der Kosten. Bei maximalem Reasoning-Aufwand liegt es nur 2,1 Prozentpunkte hinter dem Ergebnis von Astra, zu rund einem Siebtel der Kosten pro Aufgabe.
In OSWorld 2.0(wird in einem neuen Fenster geöffnet), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Bei Terminal-Bench Science 0.1, das wissenschaftliche Arbeitsabläufe wie Datenanalyse, Simulation und Theorembeweisen bewertet, erreicht GPT‑6.1 Sol bei maximalem Reasoning-Aufwand mehr als das Doppelte des Ergebnisses von GPT‑6 Sol, zu weniger als der Hälfte der Kosten pro Aufgabe. Bei maximalem Reasoning-Aufwand kostet GPT‑6.1 Sol im Durchschnitt 5,47 USD pro Aufgabe, verglichen mit 23,21 USD bei Opus 5.5 und 23,80 USD bei Astra. Damit bietet es starke wissenschaftliche Fähigkeiten zu mehr als 75 % niedrigeren Kosten als jedes der beiden Modelle.
GPT‑6 Astra erzielt mit 68,1 % weiterhin das beste Ergebnis unter den getesteten Modellen und sollte für die schwierigsten Aufgaben in der wissenschaftlichen Forschung eingesetzt werden.
In Terminal-Bench Science 0.1(wird in einem neuen Fenster geöffnet) führen Agenten mithilfe von Code und Terminalwerkzeugen wissenschaftliche Forschungsabläufe durch. Dazu gehören Datenanalysen, Simulationen und die Anpassung von Modellen an Daten.
GPT‑6.1 Sol verbessert auch die sachliche Genauigkeit bei schwierigen Prompts. Bei extra hohem Reasoning-Aufwand beträgt die sachliche Fehlerquote 4,1 %, gegenüber 4,5 % bei GPT‑6 Sol. Damit liegt sie näher an den 4,0 % von Astra bei derselben Einstellung, während die Kosten pro Aufgabe etwa 83 % niedriger sind als bei Astra.
Diese Evaluierung misst den Anteil der Antworten mit mindestens einem sachlichen Fehler anhand deidentifizierter Unterhaltungen, in denen Nutzende einen Fehler eines früheren Modells gemeldet hatten. Diese bewusst schwierigen Prompts sind nicht repräsentativ für die typische Nutzung.
Wir bewerten die sachliche Richtigkeit anhand deidentifizierter ChatGPT‑Unterhaltungen, in denen Nutzende einen sachlichen Fehler eines früheren Modells gemeldet hatten. Diese fehlerträchtigen Unterhaltungen sind nicht repräsentativ für die typische Nutzung, bei der sachliche Fehler seltener auftreten.
In unseren Alignment-Evaluierungen zeigt GPT‑6.1 Sol erhebliche Verbesserungen gegenüber GPT‑6 Sol und nähert sich damit GPT‑6 Astra an.
GPT‑6.1 Sol geht transparenter mit seinen Grenzen um und beachtet die Absichten der Nutzenden sowie Sicherheitsvorgaben zuverlässiger. In anspruchsvollen Evaluierungen weist es niedrigere Fehlerquoten als GPT‑6 Sol auf: beim transparenten Umgang mit defekten Suchtools, beim Einhalten ausdrücklicher Beschränkungen und beim Vermeiden unautorisierter Ergebnisse bei agentischen Aufgaben. Wie bei GPT‑6 Astra und GPT‑6 Sol haben wir keine Versuche beobachtet, eine automatisierte Sicherheitsprüfung zu umgehen.
Die folgenden Evaluierungen testen bewusst anspruchsvolle Situationen und messen keine Fehlerquoten bei typischer Nutzung.
GPT‑6.1 Sol steht ab heute allen mit einem Plus-, Pro-, Business-, Enterprise- oder Edu-Abo in ChatGPT Work und Codex zur Verfügung. Diese Modelle sind in Chat noch nicht verfügbar. Entwicklungsteams können außerdem über die OpenAI API unter gpt-6.1-sol darauf zugreifen. Die Standardpreise für die API betragen 2 USD pro Million Eingabe-Token, 0,10 USD pro Million zwischengespeicherte Eingabe-Token und 10 USD pro Million Ausgabe-Token.
Gleichzeitig führen wir GPT‑6 Astra Ultrafast ein, das weltweit schnellste Frontier-Modell mit bis zu achtfacher Geschwindigkeit gegenüber GPT‑6 Astra, sowie GPT‑6.1 Sol Ultrafast. Diese Modelle sind über die API verfügbar sowie in ChatGPT Work und Codex mit unserer neuen Pro-Stufe für 500 USD pro Monat, die die höchsten Nutzungslimits bietet. Mit GPT‑6.1 Sol Ultrafast erhalten Entwicklungsteams Intelligenz nahe am Astra-Niveau bei bis zu achtfacher Geschwindigkeit, zu ungefähr denselben API-Kosten wie bisher für GPT‑6 Astra.
Autor:in
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

