Zum Hauptinhalt springen
OpenAI

Vorstellung von GPT‑6 Sol und Luna

Mehr Möglichkeiten, Frontier-Intelligenz in deinen Arbeitsalltag zu integrieren.

Laden …

Anfang des Monats haben wir GPT‑6 Astra vorgestellt, das intelligenteste und am besten ausgerichtete Modell der Welt. Die anspruchsvollsten und wichtigsten Projekte erfordern weiterhin die volle Leistungsfähigkeit von Astra. Doch Arbeit findet in unterschiedlichen Größenordnungen, Rhythmen und Budgets statt.

Deshalb erweitern wir die GPT‑6‑Familie um GPT‑6 Sol und GPT‑6 Luna. GPT‑6 Astra hat eine neue Generation von Intelligenz eingeführt. Diese Modelle machen ihre Vorteile breiter verfügbar und verschieben die Frontier-Grenze bei der Kosteneffizienz. Wir haben GPT‑6 Sol und Luna mit ähnlichen Methoden wie GPT‑6 Astra trainiert. So übertragen wir die Fortschritte hinter Astras führender Leistung bei professioneller Arbeit, Faktentreue, Programmierung, Computernutzung und Alignment auf schnellere, günstigere Modelle.

Die GPT‑6‑Modelle sind über die gesamte Kosten-Intelligenz-Kurve hinweg führend. Sie verbinden außergewöhnliche Fähigkeiten in jeder Stufe mit einer Infrastruktur, die diese effizient und skalierbar bereitstellt. Verbesserungen bei Caching und Inferenz ermöglichen es uns, diese Modelle günstiger bereitzustellen. Diese Einsparungen geben wir direkt an Nutzer:innen und Kund:innen weiter, indem wir die API-Preise für Sol und Luna gegenüber den Einführungspreisen von GPT‑5.6 um 50 % senken. Zusammen machen diese Verbesserungen fortschrittliche KI für mehr alltägliche Aufgaben und Anwendungen im großen Maßstab praktikabel.

API-Preise für GPT‑6

Modell

Eingabe

Ausgabe

Preissenkung

GPT‑6 Sol
vs. GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

50 % günstiger

GPT‑6 Luna
vs. GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

50 % günstiger

Die Preise gelten pro 1 Million Tokens.

GPT‑6 Astra bleibt insgesamt unser bestes Modell. Wähle es, wenn du die besten Ergebnisse ohne Kompromisse möchtest.

Fortschritte in der gesamten Modellfamilie

GPT‑6 Sol und Luna bieten mehr Intelligenz und Kosteneffizienz für die Modelle, die du bereits kennst und nutzt, insbesondere bei den Fähigkeiten, die für komplexe Aufgaben am wichtigsten sind.

Professionelle Arbeit

GPT‑6 Sol kann schwierige berufliche Aufgaben übernehmen und bietet dir durch höhere Nutzungslimits und niedrigere Kosten mehr Spielraum für Iterationen. Im Vergleich zu ähnlich teuren Konkurrenzmodellen liefert es mehr Intelligenz und bessere Ergebnisse.

Bei AutomationBench, einem Test von Geschäftsabläufen über mehrere Apps hinweg, übertrifft GPT‑6 Sol mit dem Aufwand „xhigh“ Claude Opus 5 mit dem Aufwand „max“. Dabei kostet jede Aufgabe nur 9 % dessen, was sie bei Opus 5 kostet. Mit hohem Aufwand verbessert sich GPT‑6 Luna gegenüber seinem Vorgänger um 5,4 Prozentpunkte, bei 58 % niedrigeren Kosten pro Aufgabe.

Bei AutomationBench 1.0.6⁠(wird in einem neuen Fenster geöffnet) werden KI-Agenten anhand vollständiger Arbeitsabläufe mit 47 Tools aus Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen getestet. Der Datenpunkt für Claude Fable 5.1 unterschätzt die tatsächlichen Kosten, da die Kosten der Opus-5-Fallbacks fehlen, die bei etwa 40 % der Aufgaben zum Einsatz kamen.

GPT‑6 Sol übertrifft außerdem Claude Fable 5.1 bei deutlich niedrigeren Kosten und erzielt sogar bessere Ergebnisse als GPT‑6 Astra mit niedrigem Aufwand.

Modell (und Aufwand)

Ergebnis

Kosten pro Aufgabe

GPT‑6 Sol (xhigh)

33,2 %

0,27 USD

GPT‑6 Astra (low)

30,3 %

3,9x GPT‑6 Sol

Claude Opus 5 (max)

26,9 %

11,1x GPT‑6 Sol

Claude Fable 5.1 mit Opus-5-Fallback (max)

31,4 %

>8,9x GPT‑6 Sol

(Fallback-Kosten nicht angegeben)

Bei Agents’ Last Exam, das Agenten anhand komplexer professioneller Arbeitsabläufe bewertet, erreicht GPT‑6 Sol mit dem Aufwand „max“ 56,4 %. Damit liegt es über dem besten Ergebnis von Claude Opus 5 in dieser Evaluation und kostet pro Aufgabe 60 % weniger.

Bei Agents’ Last Exam V1⁠(wird in einem neuen Fenster geöffnet) werden KI-Agenten anhand langfristig angelegter, wirtschaftlich relevanter Aufgaben aus 55 Teilbranchen bewertet. Sie decken die meisten wichtigen Bereiche professioneller Computerarbeit ab.

Faktentreue

Wie nützlich eine Antwort ist, hängt davon ab, ob die Fakten stimmen. Deshalb verbessern wir die faktische Zuverlässigkeit kontinuierlich weiter. In unserer internen Evaluation der Faktentreue, die auf anonymisierten realen Unterhaltungen basiert, in denen Nutzer:innen Fehler unserer Modelle gemeldet haben, macht GPT‑6 Sol etwa halb so viele Fehler wie sein Vorgänger. Damit nähert es sich der Zuverlässigkeit von Astra, bei deutlich niedrigeren Kosten. Auch GPT‑6 Luna verbessert sich deutlich. Bei höherem Aufwand erreicht es das Niveau von GPT‑5.6 Sol zu etwa einem Hundertstel der Kosten.

Hier bewerten wir die Faktentreue anhand anonymisierter ChatGPT‑Unterhaltungen, in denen Nutzer:innen einen Sachfehler eines früheren Modells gemeldet hatten. Diese fehlerbegünstigenden Unterhaltungen sind nicht repräsentativ für die typische Nutzung, bei der Sachfehler seltener auftreten. Die Ergebnisse sind nicht nach Länge bereinigt. Unsere Tests mit unterschiedlichen Antwortlängen zeigten jedoch nahezu keine Abhängigkeit von der Antwortlänge.

Programmierung

In diesem Jahr haben Programmieragenten begonnen, Aufgaben von bislang unerreichter Komplexität, Reichweite und Dauer zu bewältigen. Bei OpenAI ist unsere interne Nutzung exponentiell gestiegen. Zu API-Preisen bewertet, überstieg die tägliche Token-Nutzung 600 USD für Forschende im Median und 7.000 USD für Forschende im 90. Perzentil (Beschleunigung der Forschung: ein Blick in das Unternehmen OpenAI⁠). Da Programmieragenten längere und anspruchsvollere Aufgaben übernehmen, gewinnen die Kosten einer dauerhaften Nutzung an Bedeutung. GPT‑6 Sol und Luna verbinden starke Programmierleistung mit niedrigeren API-Preisen. So haben Entwickler:innen mehr Spielraum für Iterationen und Teams können Codex anspruchsvollere Aufgaben anvertrauen.

Bei FrontierCode, das bewertet, ob Programmieragenten Änderungen erstellen, die sich direkt in reale Codebasen integrieren lassen, verbessert sich GPT‑6 Sol deutlich gegenüber GPT‑5.6 Sol. Es erreicht das Niveau von Claude Fable 5.1 mit dem Aufwand „xhigh“, bei wesentlich niedrigeren Kosten.

Bei FrontierCode 1.1 Main⁠(wird in einem neuen Fenster geöffnet) schreiben KI-Agenten Code, der nicht nur nach Korrektheit, sondern auch nach seiner Integrationsfähigkeit bewertet wird, etwa anhand der Testqualität, der Einhaltung des Aufgabenumfangs, des Codestils und der Standards der Codebasis.

Bei DeepSWE v1.1, das die Leistung bei komplexen Softwareentwicklungsaufgaben in realen Codebasen prüft, erreicht GPT‑6 Sol mit dem Aufwand „max“ 68,8 %. Das liegt 1,1 Prozentpunkte unter dem besten Ergebnis von Claude Fable 5 in der Evaluation, 69,9 % mit dem Aufwand „xhigh“, bei etwa 80 % niedrigeren Kosten pro Aufgabe.

GPT‑6 Luna erreicht mit dem Aufwand „max“ 66,6 % und ist damit vergleichbar mit Claude Opus 5 und Fable 5 bei mittlerem Aufwand. In diesen Vergleichen kostet jede Aufgabe mit Luna 93 % weniger als mit Opus 5 und 96 % weniger als mit Fable 5.

Bei DeepSWE 1.1⁠(wird in einem neuen Fenster geöffnet) lösen KI-Agenten neu erstellte, langfristig angelegte Aufgaben aus der Softwareentwicklung.

Computernutzung

GPT‑6 Astra bleibt das weltweit beste Modell für die Computernutzung. GPT‑6 Sol und Luna bieten jedoch eine kosteneffizientere Leistung als ihre Vorgänger. Bei OSWorld 2.0 offline erzielt GPT‑6 Sol mit dem Aufwand „xhigh“ ein ähnliches Ergebnis wie Claude Opus 5 mit mittlerem Aufwand: 60,5 % gegenüber 60,3 %, bei etwa 80 % niedrigeren Kosten pro Aufgabe. GPT‑6 Luna (max) übertrifft GPT‑5.6 Sol (medium) bei einem Zehntel der Kosten.

Bei OSWorld 2.0⁠(wird in einem neuen Fenster geöffnet) bearbeiten KI-Agenten langfristig angelegte Abläufe zur Computernutzung, die alltägliche und berufliche Aufgaben umfassen. Wir geben die Teilbewertung für den Offline-Datensatz aus Version v2026.08.08 an.

Kommunikationsstil

Wir haben auch den verbesserten Kommunikationsstil von GPT‑6 Astra auf Sol und Luna übertragen. Das dürfte besonders in technischen Gesprächen und bei der Programmierung auffallen. Du kannst insgesamt klarere, etwas kürzere Antworten mit weniger Fachjargon, ungewöhnlichen Formulierungen und wenig hilfreichen Details erwarten, ohne dass Substanz verloren geht.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Obwohl Stil subjektiv ist, bevorzugen wir hier die Antwort von GPT‑6 Sol. Sie zieht weniger schnell voreilige Schlüsse, wiederholt seltener Details, die für die fragende Person offensichtlich sein könnten, etwa dass die Website vier Seiten hat, und verwendet weniger vage Formulierungen wie „bento feel“ oder „reshaping… around that system“. Zudem legt sie offener dar, was geprüft wurde und was nicht, und nennt nicht unnötig Umsetzungsdetails wie den Prompt für das Bildtool.

Besseres Caching für Agenten und lange Unterhaltungen

Zusätzlich zu den niedrigeren Token-Preisen helfen wir Entwickler:innen, die GPT‑6 einsetzen, mehr bei dem Kontext zu sparen, den ihre Anwendungen wiederverwenden. Wir haben das Prompt-Caching für GPT‑6 verbessert, sodass standardmäßig höhere Cache-Trefferraten erzielt werden. Dadurch können Agenten mehr Kontext wiederverwenden, schneller antworten und von 90 % Rabatt auf das Lesen zwischengespeicherter Eingabe-Token profitieren.

Entwickler:innen haben außerdem mehr Möglichkeiten, die Caching-Leistung zu messen und zu optimieren:

GitHub berichtet, dass diese Verbesserungen in den vergangenen Monaten den Anteil der Prompt-Token, die neu verarbeitet werden müssen, über Milliarden von Anfragen an OpenAI-Modelle hinweg um mehr als 50 % gesenkt haben. Dadurch kann Copilot schneller antworten.

Alignment weiter verbessern

GPT‑6 Sol und Luna bauen auf der mit Astra eingeführten Arbeit am Alignment auf. Astra ist unser bisher am besten ausgerichtetes Modell. In unseren Evaluationen zum Alignment verbessern sich Sol und Luna gegenüber ihren jeweiligen GPT‑5.6‑Vorgängern. Unter anderem machen sie seltener irreführende Angaben zu ihrer Programmierarbeit.

Die folgenden Evaluationen testen bewusst schwierige Situationen und messen nicht die Fehlerquoten bei typischer Nutzung. Die vollständigen Ergebnisse findest du in der Systemkarte⁠(wird in einem neuen Fenster geöffnet).

Verfügbarkeit

GPT‑6 Sol und GPT‑6 Luna sind ab heute in ChatGPT Work und Codex für alle Nutzer:innen mit Plus, Pro, Business, Enterprise und Edu verfügbar. Nutzer:innen mit Free und Go können in der Desktop-App auf GPT‑6 Luna zugreifen. Diese Modelle sind in Chat noch nicht verfügbar. In der OpenAI API sind sie als gpt-6-sol und gpt-6-luna verfügbar.

Damit der Dienst für alle stabil bleibt, wollen wir diese Modelle im Laufe des Tages schrittweise in ChatGPT bereitstellen. Wenn du die neuen Modelle in ChatGPT Work oder Codex noch nicht siehst, versuche es bitte später erneut.


Die Evaluationen von GPT wurden in unserer Forschungsumgebung oder über unsere API durchgeführt. Aufgrund unterschiedlicher System-Prompts, verfügbarer Tools und anderer Faktoren können die Ergebnisse geringfügig von denen im Produktivbetrieb von ChatGPT abweichen. Die Evaluationsergebnisse von Konkurrenzmodellen stammen aus öffentlich zugänglichen Berichten. Ergebnisse für Claude Fable 5 wurden angegeben, wenn keine Ergebnisse für Claude Fable 5.1 verfügbar waren.

Autor:in

OpenAI