Vorstellung von GPT‑6 Sol und Luna
Mehr Möglichkeiten, Frontier-Intelligenz in deinen Arbeitsalltag zu integrieren.
Anfang des Monats haben wir GPT‑6 Astra vorgestellt, das intelligenteste und am besten ausgerichtete Modell der Welt. Die anspruchsvollsten und wichtigsten Projekte erfordern weiterhin die volle Leistungsfähigkeit von Astra. Doch Arbeit findet in unterschiedlichen Größenordnungen, Rhythmen und Budgets statt.
Deshalb erweitern wir die GPT‑6‑Familie um GPT‑6 Sol und GPT‑6 Luna. GPT‑6 Astra hat eine neue Generation von Intelligenz eingeführt. Diese Modelle machen ihre Vorteile breiter verfügbar und verschieben die Frontier-Grenze bei der Kosteneffizienz. Wir haben GPT‑6 Sol und Luna mit ähnlichen Methoden wie GPT‑6 Astra trainiert. So übertragen wir die Fortschritte hinter Astras führender Leistung bei professioneller Arbeit, Faktentreue, Programmierung, Computernutzung und Alignment auf schnellere, günstigere Modelle.
Die GPT‑6‑Modelle sind über die gesamte Kosten-Intelligenz-Kurve hinweg führend. Sie verbinden außergewöhnliche Fähigkeiten in jeder Stufe mit einer Infrastruktur, die diese effizient und skalierbar bereitstellt. Verbesserungen bei Caching und Inferenz ermöglichen es uns, diese Modelle günstiger bereitzustellen. Diese Einsparungen geben wir direkt an Nutzer:innen und Kund:innen weiter, indem wir die API-Preise für Sol und Luna gegenüber den Einführungspreisen von GPT‑5.6 um 50 % senken. Zusammen machen diese Verbesserungen fortschrittliche KI für mehr alltägliche Aufgaben und Anwendungen im großen Maßstab praktikabel.
Modell | Eingabe | Ausgabe | Preissenkung |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | 50 % günstiger |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | 50 % günstiger |
Die Preise gelten pro 1 Million Tokens.
GPT‑6 Astra bleibt insgesamt unser bestes Modell. Wähle es, wenn du die besten Ergebnisse ohne Kompromisse möchtest.
GPT‑6 Sol und Luna bieten mehr Intelligenz und Kosteneffizienz für die Modelle, die du bereits kennst und nutzt, insbesondere bei den Fähigkeiten, die für komplexe Aufgaben am wichtigsten sind.
GPT‑6 Sol kann schwierige berufliche Aufgaben übernehmen und bietet dir durch höhere Nutzungslimits und niedrigere Kosten mehr Spielraum für Iterationen. Im Vergleich zu ähnlich teuren Konkurrenzmodellen liefert es mehr Intelligenz und bessere Ergebnisse.
Bei AutomationBench, einem Test von Geschäftsabläufen über mehrere Apps hinweg, übertrifft GPT‑6 Sol mit dem Aufwand „xhigh“ Claude Opus 5 mit dem Aufwand „max“. Dabei kostet jede Aufgabe nur 9 % dessen, was sie bei Opus 5 kostet. Mit hohem Aufwand verbessert sich GPT‑6 Luna gegenüber seinem Vorgänger um 5,4 Prozentpunkte, bei 58 % niedrigeren Kosten pro Aufgabe.
Bei AutomationBench 1.0.6(wird in einem neuen Fenster geöffnet) werden KI-Agenten anhand vollständiger Arbeitsabläufe mit 47 Tools aus Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen getestet. Der Datenpunkt für Claude Fable 5.1 unterschätzt die tatsächlichen Kosten, da die Kosten der Opus-5-Fallbacks fehlen, die bei etwa 40 % der Aufgaben zum Einsatz kamen.
GPT‑6 Sol übertrifft außerdem Claude Fable 5.1 bei deutlich niedrigeren Kosten und erzielt sogar bessere Ergebnisse als GPT‑6 Astra mit niedrigem Aufwand.
Modell (und Aufwand) | Ergebnis | Kosten pro Aufgabe |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2 % | 0,27 USD |
GPT‑6 Astra (low) | 30,3 % | 3,9x GPT‑6 Sol |
Claude Opus 5 (max) | 26,9 % | 11,1x GPT‑6 Sol |
Claude Fable 5.1 mit Opus-5-Fallback (max) | 31,4 % | >8,9x GPT‑6 Sol (Fallback-Kosten nicht angegeben) |
Bei Agents’ Last Exam, das Agenten anhand komplexer professioneller Arbeitsabläufe bewertet, erreicht GPT‑6 Sol mit dem Aufwand „max“ 56,4 %. Damit liegt es über dem besten Ergebnis von Claude Opus 5 in dieser Evaluation und kostet pro Aufgabe 60 % weniger.
Bei Agents’ Last Exam V1(wird in einem neuen Fenster geöffnet) werden KI-Agenten anhand langfristig angelegter, wirtschaftlich relevanter Aufgaben aus 55 Teilbranchen bewertet. Sie decken die meisten wichtigen Bereiche professioneller Computerarbeit ab.
Wie nützlich eine Antwort ist, hängt davon ab, ob die Fakten stimmen. Deshalb verbessern wir die faktische Zuverlässigkeit kontinuierlich weiter. In unserer internen Evaluation der Faktentreue, die auf anonymisierten realen Unterhaltungen basiert, in denen Nutzer:innen Fehler unserer Modelle gemeldet haben, macht GPT‑6 Sol etwa halb so viele Fehler wie sein Vorgänger. Damit nähert es sich der Zuverlässigkeit von Astra, bei deutlich niedrigeren Kosten. Auch GPT‑6 Luna verbessert sich deutlich. Bei höherem Aufwand erreicht es das Niveau von GPT‑5.6 Sol zu etwa einem Hundertstel der Kosten.
Hier bewerten wir die Faktentreue anhand anonymisierter ChatGPT‑Unterhaltungen, in denen Nutzer:innen einen Sachfehler eines früheren Modells gemeldet hatten. Diese fehlerbegünstigenden Unterhaltungen sind nicht repräsentativ für die typische Nutzung, bei der Sachfehler seltener auftreten. Die Ergebnisse sind nicht nach Länge bereinigt. Unsere Tests mit unterschiedlichen Antwortlängen zeigten jedoch nahezu keine Abhängigkeit von der Antwortlänge.
In diesem Jahr haben Programmieragenten begonnen, Aufgaben von bislang unerreichter Komplexität, Reichweite und Dauer zu bewältigen. Bei OpenAI ist unsere interne Nutzung exponentiell gestiegen. Zu API-Preisen bewertet, überstieg die tägliche Token-Nutzung 600 USD für Forschende im Median und 7.000 USD für Forschende im 90. Perzentil (Beschleunigung der Forschung: ein Blick in das Unternehmen OpenAI). Da Programmieragenten längere und anspruchsvollere Aufgaben übernehmen, gewinnen die Kosten einer dauerhaften Nutzung an Bedeutung. GPT‑6 Sol und Luna verbinden starke Programmierleistung mit niedrigeren API-Preisen. So haben Entwickler:innen mehr Spielraum für Iterationen und Teams können Codex anspruchsvollere Aufgaben anvertrauen.
Bei FrontierCode, das bewertet, ob Programmieragenten Änderungen erstellen, die sich direkt in reale Codebasen integrieren lassen, verbessert sich GPT‑6 Sol deutlich gegenüber GPT‑5.6 Sol. Es erreicht das Niveau von Claude Fable 5.1 mit dem Aufwand „xhigh“, bei wesentlich niedrigeren Kosten.
Bei FrontierCode 1.1 Main(wird in einem neuen Fenster geöffnet) schreiben KI-Agenten Code, der nicht nur nach Korrektheit, sondern auch nach seiner Integrationsfähigkeit bewertet wird, etwa anhand der Testqualität, der Einhaltung des Aufgabenumfangs, des Codestils und der Standards der Codebasis.
Bei DeepSWE v1.1, das die Leistung bei komplexen Softwareentwicklungsaufgaben in realen Codebasen prüft, erreicht GPT‑6 Sol mit dem Aufwand „max“ 68,8 %. Das liegt 1,1 Prozentpunkte unter dem besten Ergebnis von Claude Fable 5 in der Evaluation, 69,9 % mit dem Aufwand „xhigh“, bei etwa 80 % niedrigeren Kosten pro Aufgabe.
GPT‑6 Luna erreicht mit dem Aufwand „max“ 66,6 % und ist damit vergleichbar mit Claude Opus 5 und Fable 5 bei mittlerem Aufwand. In diesen Vergleichen kostet jede Aufgabe mit Luna 93 % weniger als mit Opus 5 und 96 % weniger als mit Fable 5.
Bei DeepSWE 1.1(wird in einem neuen Fenster geöffnet) lösen KI-Agenten neu erstellte, langfristig angelegte Aufgaben aus der Softwareentwicklung.
GPT‑6 Astra bleibt das weltweit beste Modell für die Computernutzung. GPT‑6 Sol und Luna bieten jedoch eine kosteneffizientere Leistung als ihre Vorgänger. Bei OSWorld 2.0 offline erzielt GPT‑6 Sol mit dem Aufwand „xhigh“ ein ähnliches Ergebnis wie Claude Opus 5 mit mittlerem Aufwand: 60,5 % gegenüber 60,3 %, bei etwa 80 % niedrigeren Kosten pro Aufgabe. GPT‑6 Luna (max) übertrifft GPT‑5.6 Sol (medium) bei einem Zehntel der Kosten.
Bei OSWorld 2.0(wird in einem neuen Fenster geöffnet) bearbeiten KI-Agenten langfristig angelegte Abläufe zur Computernutzung, die alltägliche und berufliche Aufgaben umfassen. Wir geben die Teilbewertung für den Offline-Datensatz aus Version v2026.08.08 an.
Wir haben auch den verbesserten Kommunikationsstil von GPT‑6 Astra auf Sol und Luna übertragen. Das dürfte besonders in technischen Gesprächen und bei der Programmierung auffallen. Du kannst insgesamt klarere, etwas kürzere Antworten mit weniger Fachjargon, ungewöhnlichen Formulierungen und wenig hilfreichen Details erwarten, ohne dass Substanz verloren geht.
Obwohl Stil subjektiv ist, bevorzugen wir hier die Antwort von GPT‑6 Sol. Sie zieht weniger schnell voreilige Schlüsse, wiederholt seltener Details, die für die fragende Person offensichtlich sein könnten, etwa dass die Website vier Seiten hat, und verwendet weniger vage Formulierungen wie „bento feel“ oder „reshaping… around that system“. Zudem legt sie offener dar, was geprüft wurde und was nicht, und nennt nicht unnötig Umsetzungsdetails wie den Prompt für das Bildtool.
Zusätzlich zu den niedrigeren Token-Preisen helfen wir Entwickler:innen, die GPT‑6 einsetzen, mehr bei dem Kontext zu sparen, den ihre Anwendungen wiederverwenden. Wir haben das Prompt-Caching für GPT‑6 verbessert, sodass standardmäßig höhere Cache-Trefferraten erzielt werden. Dadurch können Agenten mehr Kontext wiederverwenden, schneller antworten und von 90 % Rabatt auf das Lesen zwischengespeicherter Eingabe-Token profitieren.
Entwickler:innen haben außerdem mehr Möglichkeiten, die Caching-Leistung zu messen und zu optimieren:
Überwachen und diagnostizieren. Das Prompt Caching Dashboard(wird in einem neuen Fenster geöffnet) zeigt, wie viele Eingaben zwischengespeichert werden und wie sich dieser Anteil im Laufe der Zeit verändert. Das Diagnosetool(wird in einem neuen Fenster geöffnet) zeigt ungenutzte Caching-Möglichkeiten auf und erklärt, was verbessert werden sollte.
Reasoning-Aufwand und Verfügbarkeit von Tools anpassen, ohne den Cache zu beeinträchtigen. Erhöhe den Reasoning-Aufwand(wird in einem neuen Fenster geöffnet) für schwierigere Aufgaben oder senke ihn für einfachere Folgefragen. Du kannst außerdem Tools aktivieren oder deaktivieren(wird in einem neuen Fenster geöffnet), wenn sich die Anforderungen deines Agenten ändern. Beide Einstellungen bewahren nun früheren Kontext zur Wiederverwendung im Cache.
Auswahl der zwischengespeicherten Präfixe optimieren. Mit expliziten Haltepunkten können Entwickler:innen festlegen, wo zwischengespeicherte Prompt-Präfixe enden. Damit können Entwickler:innen die Wiederverwendung des Caches besser steuern und die Leistung verbessern.
GitHub berichtet, dass diese Verbesserungen in den vergangenen Monaten den Anteil der Prompt-Token, die neu verarbeitet werden müssen, über Milliarden von Anfragen an OpenAI-Modelle hinweg um mehr als 50 % gesenkt haben. Dadurch kann Copilot schneller antworten.
GPT‑6 Sol und Luna bauen auf der mit Astra eingeführten Arbeit am Alignment auf. Astra ist unser bisher am besten ausgerichtetes Modell. In unseren Evaluationen zum Alignment verbessern sich Sol und Luna gegenüber ihren jeweiligen GPT‑5.6‑Vorgängern. Unter anderem machen sie seltener irreführende Angaben zu ihrer Programmierarbeit.
Die folgenden Evaluationen testen bewusst schwierige Situationen und messen nicht die Fehlerquoten bei typischer Nutzung. Die vollständigen Ergebnisse findest du in der Systemkarte(wird in einem neuen Fenster geöffnet).
GPT‑6 Sol und GPT‑6 Luna sind ab heute in ChatGPT Work und Codex für alle Nutzer:innen mit Plus, Pro, Business, Enterprise und Edu verfügbar. Nutzer:innen mit Free und Go können in der Desktop-App auf GPT‑6 Luna zugreifen. Diese Modelle sind in Chat noch nicht verfügbar. In der OpenAI API sind sie als gpt-6-sol und gpt-6-luna verfügbar.
Damit der Dienst für alle stabil bleibt, wollen wir diese Modelle im Laufe des Tages schrittweise in ChatGPT bereitstellen. Wenn du die neuen Modelle in ChatGPT Work oder Codex noch nicht siehst, versuche es bitte später erneut.
Die Evaluationen von GPT wurden in unserer Forschungsumgebung oder über unsere API durchgeführt. Aufgrund unterschiedlicher System-Prompts, verfügbarer Tools und anderer Faktoren können die Ergebnisse geringfügig von denen im Produktivbetrieb von ChatGPT abweichen. Die Evaluationsergebnisse von Konkurrenzmodellen stammen aus öffentlich zugänglichen Berichten. Ergebnisse für Claude Fable 5 wurden angegeben, wenn keine Ergebnisse für Claude Fable 5.1 verfügbar waren.


