Přeskoč na hlavní obsah
OpenAI

Představujeme GPT‑6 Sol a Luna

Více způsobů, jak využít průkopnickou inteligenci v každodenní práci.

Načítání…

Začátkem tohoto měsíce jsme představili GPT‑6 Astra, nejinteligentnější a nejlépe sladěný model na světě. Nejnáročnější a nejdůležitější projekty sice stále vyžadují plnou hloubku modelu Astra, práce se liší rozsahem, tempem i různými rozpočty.

Proto rozšiřujeme svět GPT‑6 o modely GPT‑6 Sol a GPT‑6 Luna. GPT‑6 Astra přinesl novou generaci inteligence. Tyto modely pomáhají její přínosy zpřístupnit širšímu okruhu uživatelů tím, že posouvají hranice nákladové efektivity. GPT‑6 Sol a Luna jsme trénovali podobnými metodami jako GPT‑6 Astra. Pokroky, které stojí za špičkovým výkonem modelu Astra v profesionální práci, faktické správnosti, programování, ovládání počítače a sladění, tak přinášíme do rychlejších a dostupnějších modelů.

Modely GPT‑6 vedou napříč celou křivkou nákladů a inteligence: v každé úrovni spojují výjimečné schopnosti s infrastrukturou, která je efektivně poskytuje ve velkém měřítku. Díky vylepšení ukládání do mezipaměti a inference můžeme tyto modely poskytovat levněji. Úspory předáváme přímo uživatelům a zákazníkům: oproti zvýhodněným cenám GPT‑5.6 snižujeme ceny API pro Sol a Luna o 50 %. Díky těmto vylepšením je pokročilá AI prakticky využitelná pro více každodenních úloh a aplikací ve velkém měřítku.

Ceny GPT‑6 API

Model

Vstup

Výstup

Snížení ceny

GPT‑6 Sol
oproti GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

o 50 % levnější

GPT‑6 Luna
oproti GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

o 50 % levnější

Ceny jsou uvedeny za 1 milion tokenů.

GPT‑6 Astra zůstává naším celkově nejlepším modelem. Zvolte ho, když chcete nejlepší výsledky a zážitek bez kompromisů.

Pokrok napříč celou rodinou modelů

GPT‑6 Sol a Luna přinášejí vyšší inteligenci a nákladovou efektivitu do modelů, které už znáte a používáte, zejména ve schopnostech nejužitečnějších pro zvládání složitých činností.

Profesionální práce

GPT‑6 Sol zvládá náročné pracovní úlohy a díky vyšším limitům využití a nižším nákladům vám dává více prostoru k iteracím. Oproti konkurenčním modelům s podobnou cenou nabízí vyšší inteligenci a lepší výsledky.

V testu AutomationBench, který hodnotí pracovní postupy napříč firemními aplikacemi, překonává GPT‑6 Sol s úsilím xhigh model Claude Opus 5 s úsilím max, přičemž náklady na úlohu dosahují pouhých 9 % nákladů modelu Opus 5. Při využití vysokého úsilí překonává GPT‑6 Luna svého předchůdce o 5,4 procentního bodu a současně snižuje náklady na úlohu o 58 %.

V testu AutomationBench 1.0.6⁠(otevře se v novém okně) jsou agenti AI testováni na kompletních pracovních postupech s využitím 47 nástrojů z oblasti prodeje, marketingu, provozu, podpory, financí a personalistiky. Údaj pro Claude Fable 5.1 podhodnocuje skutečné náklady, protože nezahrnuje náklady na přepnutí na záložní Opus 5, k němuž došlo přibližně u 40 % úloh.

GPT‑6 Sol také výrazně levněji překonává Claude Fable 5.1, a dokonce poráží i GPT‑6 Astra s nízkým úsilím.

Model (a úsilí)

Skóre

Náklady na úlohu

GPT‑6 Sol (velmi vysoká)

33,2 %

0,27 USD

GPT‑6 Astra (nízká)

30,3 %

3,9× GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1× GPT‑6 Sol

Claude Fable 5.1 se záložním Opus 5 (Max)

31,4 %

>8,9× GPT‑6 Sol

(náklady na záložní model nebyly uvedeny)

V testu Agents’ Last Exam, který hodnotí agenty při složitých profesionálních pracovních postupech, dosahuje GPT‑6 Sol s úsilím max skóre 56,4 %. Překonává tak nejvyšší skóre modelu Claude Opus 5 v tomto hodnocení, a to při o 60 % nižších nákladech na úlohu.

V testu Agents’ Last Exam V1⁠(otevře se v novém okně) jsou agenti AI hodnoceni při dlouhodobých, ekonomicky hodnotných úlohách v 55 dílčích odvětvích, která zahrnují většinu hlavních oblastí profesionální práce prováděné na počítači.

Faktická správnost

Užitečnost odpovědi závisí na správnosti faktů a my spolehlivost v této oblasti nadále zlepšujeme. V našem interním hodnocení faktické správnosti, které vychází z anonymizovaných reálných konverzací, v nichž uživatelé označili chyby našich modelů, dělá GPT‑6 Sol přibližně polovinu chyb oproti svému předchůdci. Za mnohem nižší cenu se tak spolehlivostí blíží modelu Astra. Výrazně se zlepšuje také GPT‑6 Luna. Při vyšších úrovních úsilí se vyrovná modelu GPT‑5.6 Sol za přibližně setinu jeho ceny.

Zde hodnotíme faktickou správnost na anonymizovaných konverzacích v ChatGPT, ve kterých uživatelé označili faktickou chybu předchozího modelu. Tyto konverzace vyvolávající chyby neodpovídají běžnému používání, při němž jsou faktické chyby vzácnější. Skóre není korigováno podle délky, naše testy různých úrovní podrobnosti však ukázaly téměř nulovou závislost na délce odpovědi.

Programování

Agenti pro programování začali letos zvládat úlohy, které jsou složitější, rozsáhlejší a časově náročnější než kdy dříve. V OpenAI naše interní využití exponenciálně roste. Při ocenění podle cen API přesáhla denní spotřeba tokenů 600 USD u výzkumníka na mediánu a 7 000 USD u výzkumníků na 90. percentilu (Zrychlení výzkumu: pohled do OpenAI⁠). S tím, jak agenti pro programování přebírají delší a náročnější úlohy, nabývají náklady na jejich trvalé využívání na významu. GPT‑6 Sol a Luna spojují vysoký výkon při programování s nižšími cenami API. Vývojáři tak mají více prostoru k iteracím a týmy mohou s větší jistotou svěřovat Codexu ambicióznější úlohy.

V testu FrontierCode, který hodnotí, zda agenti pro programování vytvářejí změny připravené ke sloučení do skutečných kódových základen, dosahuje GPT‑6 Sol výrazného zlepšení oproti GPT‑5.6 Sol a za mnohem nižší cenu se vyrovná modelu Claude Fable 5.1 s úsilím xhigh.

V testu FrontierCode 1.1 Main⁠(otevře se v novém okně) píší agenti AI kód, který se hodnotí nejen podle správnosti, ale také podle „slučitelnosti“, například kvality testů, dodržení rozsahu, stylu kódu a standardů kódové základny.

V testu DeepSWE v1.1, který prověřuje výkon při složitých úkolech vývoje softwaru ve skutečných kódových základnách, dosahuje GPT‑6 Sol s úsilím max skóre 68,8 %. To je jen o 1,1 procentního bodu méně než nejvyšší skóre modelu Claude Fable 5 v tomto hodnocení (69,9 % s úsilím xhigh) při přibližně o 80 % nižších nákladech na úlohu.

GPT‑6 Luna s úsilím max dosahuje skóre 66,6 %, což je srovnatelné s modely Claude Opus 5 a Fable 5 při středním úsilí. V těchto srovnáních stojí Luna na jednu úlohu o 93 % méně než Opus 5 a o 96 % méně než Fable 5.

V testu DeepSWE 1.1⁠(otevře se v novém okně) řeší agenti AI originální, dlouhodobé úlohy vývoje softwaru.

Ovládání počítače

GPT‑6 Astra zůstává nejlepším modelem na světě pro ovládání počítače, GPT‑6 Sol a Luna však nabízejí nákladově efektivnější výkon než jejich předchůdci. V offline testu OSWorld 2.0 dosahuje GPT‑6 Sol s úsilím xhigh podobného skóre jako Claude Opus 5 se středním úsilím – 60,5 % oproti 60,3 % – při přibližně o 80 % nižších nákladech na úlohu. GPT‑6 Luna (max) překonává GPT‑5.6 Sol (střední) za desetinu jeho ceny.

V testu OSWorld 2.0⁠(otevře se v novém okně) se agenti AI pokoušejí dokončit dlouhodobé pracovní postupy při ovládání počítače, které zahrnují každodenní i profesionální úlohy. Uvádíme částečnou odměnu v offline sadě z vydání v2026.08.08.

Styl spolupráce

Vylepšený komunikační styl modelu GPT‑6 Astra jsme přenesli také do modelů Sol a Luna. Očekáváme, že bude obzvlášť patrný v technických konverzacích a diskusích o programování. Očekávejte srozumitelnější formulace, méně žargonu, méně nezvyklých obratů i zbytečných podrobností a celkově o něco kratší odpovědi, které si zachovávají podstatu.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Ačkoli je styl subjektivní, v tomto případě dáváme přednost odpovědi GPT‑6 Sol. Nedělá tak rychle ukvapené závěry, věnuje méně času opakování podrobností, které mohou být tazateli zřejmé (například že web má čtyři stránky), používá méně vágních formulací (například „modulární rozvržení“ či „přetváření…tohoto systému“), otevřeněji uvádí, co zkontroloval a co ne, a zbytečně nesdílí implementační detaily, jako je prompt pro nástroj na obrázky.

Lepší ukládání do mezipaměti pro agenty a dlouhé konverzace

Vedle nižších cen tokenů pomáháme vývojářům využívajícím GPT‑6 více ušetřit také na kontextu, který jejich aplikace používají opakovaně. Vylepšili jsme ukládání promptů do mezipaměti pro GPT‑6, takže ve výchozím nastavení dosahuje vyšší míry zásahů. Agenti tak mohou opakovaně využívat více kontextu, reagovat rychleji a získat 90% slevu na čtení vstupních tokenů z mezipaměti.

Vývojáři mají také více možností, jak výkon ukládání do mezipaměti měřit a optimalizovat:

GitHub uvádí, že tato vylepšení v posledních několika měsících snížila podíl tokenů promptů vyžadujících nové zpracování o více než 50 % napříč miliardami požadavků na modely OpenAI, což pomáhá Copilotu reagovat rychleji.

Další zlepšování sladění

GPT‑6 Sol a Luna navazují na práci v oblasti sladění, kterou jsme představili s modelem Astra, dosud nejlépe sladěným modelem OpenAI. V našich hodnoceních sladění vykazují Sol i Luna zlepšení oproti svým protějškům GPT‑5.6, včetně nižšího podílu zavádějících tvrzení o vlastní práci na kódu.

Níže uvedená hodnocení záměrně testují náročné situace a neměří četnost selhání při běžném používání. Úplné výsledky najdete v kartě systému⁠(otevře se v novém okně).

Dostupnost

GPT‑6 Sol a GPT‑6 Luna jsou ode dneška k dispozici v ChatGPT Work a Codexu všem uživatelům plánů Plus, Pro, Business, Enterprise a Edu. Uživatelé plánů Free a Go mají k GPT‑6 Luna přístup v desktopové aplikaci. Tyto modely zatím nejsou dostupné v režimu Chat. V OpenAI API jsou dostupné jako gpt-6-sol a gpt-6-luna.

Aby služba zůstala stabilní pro všechny, plánujeme tyto modely v ChatGPT zavádět postupně v průběhu dne. Pokud nové modely v ChatGPT Work nebo Codexu nevidíte, zkuste to prosím znovu později.


Hodnocení GPT probíhalo v našem výzkumném prostředí nebo prostřednictvím našeho API. Kvůli rozdílům v systémových promptech, dostupných nástrojích a dalších faktorech se výstupy mohou mírně lišit od produkční verze ChatGPT. Hodnocení konkurenčních modelů jsme převzali z veřejně dostupných zpráv. Pokud nebylo dostupné skóre pro Claude Fable 5.1, uvádíme skóre pro Claude Fable 5.

Autor

OpenAI