Představujeme GPT‑6 Sol a Luna
Více způsobů, jak využít průkopnickou inteligenci v každodenní práci.
Začátkem tohoto měsíce jsme představili GPT‑6 Astra, nejinteligentnější a nejlépe sladěný model na světě. Nejnáročnější a nejdůležitější projekty sice stále vyžadují plnou hloubku modelu Astra, práce se liší rozsahem, tempem i různými rozpočty.
Proto rozšiřujeme svět GPT‑6 o modely GPT‑6 Sol a GPT‑6 Luna. GPT‑6 Astra přinesl novou generaci inteligence. Tyto modely pomáhají její přínosy zpřístupnit širšímu okruhu uživatelů tím, že posouvají hranice nákladové efektivity. GPT‑6 Sol a Luna jsme trénovali podobnými metodami jako GPT‑6 Astra. Pokroky, které stojí za špičkovým výkonem modelu Astra v profesionální práci, faktické správnosti, programování, ovládání počítače a sladění, tak přinášíme do rychlejších a dostupnějších modelů.
Modely GPT‑6 vedou napříč celou křivkou nákladů a inteligence: v každé úrovni spojují výjimečné schopnosti s infrastrukturou, která je efektivně poskytuje ve velkém měřítku. Díky vylepšení ukládání do mezipaměti a inference můžeme tyto modely poskytovat levněji. Úspory předáváme přímo uživatelům a zákazníkům: oproti zvýhodněným cenám GPT‑5.6 snižujeme ceny API pro Sol a Luna o 50 %. Díky těmto vylepšením je pokročilá AI prakticky využitelná pro více každodenních úloh a aplikací ve velkém měřítku.
Model | Vstup | Výstup | Snížení ceny |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | o 50 % levnější |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | o 50 % levnější |
Ceny jsou uvedeny za 1 milion tokenů.
GPT‑6 Astra zůstává naším celkově nejlepším modelem. Zvolte ho, když chcete nejlepší výsledky a zážitek bez kompromisů.
GPT‑6 Sol a Luna přinášejí vyšší inteligenci a nákladovou efektivitu do modelů, které už znáte a používáte, zejména ve schopnostech nejužitečnějších pro zvládání složitých činností.
GPT‑6 Sol zvládá náročné pracovní úlohy a díky vyšším limitům využití a nižším nákladům vám dává více prostoru k iteracím. Oproti konkurenčním modelům s podobnou cenou nabízí vyšší inteligenci a lepší výsledky.
V testu AutomationBench, který hodnotí pracovní postupy napříč firemními aplikacemi, překonává GPT‑6 Sol s úsilím xhigh model Claude Opus 5 s úsilím max, přičemž náklady na úlohu dosahují pouhých 9 % nákladů modelu Opus 5. Při využití vysokého úsilí překonává GPT‑6 Luna svého předchůdce o 5,4 procentního bodu a současně snižuje náklady na úlohu o 58 %.
V testu AutomationBench 1.0.6(otevře se v novém okně) jsou agenti AI testováni na kompletních pracovních postupech s využitím 47 nástrojů z oblasti prodeje, marketingu, provozu, podpory, financí a personalistiky. Údaj pro Claude Fable 5.1 podhodnocuje skutečné náklady, protože nezahrnuje náklady na přepnutí na záložní Opus 5, k němuž došlo přibližně u 40 % úloh.
GPT‑6 Sol také výrazně levněji překonává Claude Fable 5.1, a dokonce poráží i GPT‑6 Astra s nízkým úsilím.
Model (a úsilí) | Skóre | Náklady na úlohu |
|---|---|---|
GPT‑6 Sol (velmi vysoká) | 33,2 % | 0,27 USD |
GPT‑6 Astra (nízká) | 30,3 % | 3,9× GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1× GPT‑6 Sol |
Claude Fable 5.1 se záložním Opus 5 (Max) | 31,4 % | >8,9× GPT‑6 Sol (náklady na záložní model nebyly uvedeny) |
V testu Agents’ Last Exam, který hodnotí agenty při složitých profesionálních pracovních postupech, dosahuje GPT‑6 Sol s úsilím max skóre 56,4 %. Překonává tak nejvyšší skóre modelu Claude Opus 5 v tomto hodnocení, a to při o 60 % nižších nákladech na úlohu.
V testu Agents’ Last Exam V1(otevře se v novém okně) jsou agenti AI hodnoceni při dlouhodobých, ekonomicky hodnotných úlohách v 55 dílčích odvětvích, která zahrnují většinu hlavních oblastí profesionální práce prováděné na počítači.
Užitečnost odpovědi závisí na správnosti faktů a my spolehlivost v této oblasti nadále zlepšujeme. V našem interním hodnocení faktické správnosti, které vychází z anonymizovaných reálných konverzací, v nichž uživatelé označili chyby našich modelů, dělá GPT‑6 Sol přibližně polovinu chyb oproti svému předchůdci. Za mnohem nižší cenu se tak spolehlivostí blíží modelu Astra. Výrazně se zlepšuje také GPT‑6 Luna. Při vyšších úrovních úsilí se vyrovná modelu GPT‑5.6 Sol za přibližně setinu jeho ceny.
Zde hodnotíme faktickou správnost na anonymizovaných konverzacích v ChatGPT, ve kterých uživatelé označili faktickou chybu předchozího modelu. Tyto konverzace vyvolávající chyby neodpovídají běžnému používání, při němž jsou faktické chyby vzácnější. Skóre není korigováno podle délky, naše testy různých úrovní podrobnosti však ukázaly téměř nulovou závislost na délce odpovědi.
Agenti pro programování začali letos zvládat úlohy, které jsou složitější, rozsáhlejší a časově náročnější než kdy dříve. V OpenAI naše interní využití exponenciálně roste. Při ocenění podle cen API přesáhla denní spotřeba tokenů 600 USD u výzkumníka na mediánu a 7 000 USD u výzkumníků na 90. percentilu (Zrychlení výzkumu: pohled do OpenAI). S tím, jak agenti pro programování přebírají delší a náročnější úlohy, nabývají náklady na jejich trvalé využívání na významu. GPT‑6 Sol a Luna spojují vysoký výkon při programování s nižšími cenami API. Vývojáři tak mají více prostoru k iteracím a týmy mohou s větší jistotou svěřovat Codexu ambicióznější úlohy.
V testu FrontierCode, který hodnotí, zda agenti pro programování vytvářejí změny připravené ke sloučení do skutečných kódových základen, dosahuje GPT‑6 Sol výrazného zlepšení oproti GPT‑5.6 Sol a za mnohem nižší cenu se vyrovná modelu Claude Fable 5.1 s úsilím xhigh.
V testu FrontierCode 1.1 Main(otevře se v novém okně) píší agenti AI kód, který se hodnotí nejen podle správnosti, ale také podle „slučitelnosti“, například kvality testů, dodržení rozsahu, stylu kódu a standardů kódové základny.
V testu DeepSWE v1.1, který prověřuje výkon při složitých úkolech vývoje softwaru ve skutečných kódových základnách, dosahuje GPT‑6 Sol s úsilím max skóre 68,8 %. To je jen o 1,1 procentního bodu méně než nejvyšší skóre modelu Claude Fable 5 v tomto hodnocení (69,9 % s úsilím xhigh) při přibližně o 80 % nižších nákladech na úlohu.
GPT‑6 Luna s úsilím max dosahuje skóre 66,6 %, což je srovnatelné s modely Claude Opus 5 a Fable 5 při středním úsilí. V těchto srovnáních stojí Luna na jednu úlohu o 93 % méně než Opus 5 a o 96 % méně než Fable 5.
V testu DeepSWE 1.1(otevře se v novém okně) řeší agenti AI originální, dlouhodobé úlohy vývoje softwaru.
GPT‑6 Astra zůstává nejlepším modelem na světě pro ovládání počítače, GPT‑6 Sol a Luna však nabízejí nákladově efektivnější výkon než jejich předchůdci. V offline testu OSWorld 2.0 dosahuje GPT‑6 Sol s úsilím xhigh podobného skóre jako Claude Opus 5 se středním úsilím – 60,5 % oproti 60,3 % – při přibližně o 80 % nižších nákladech na úlohu. GPT‑6 Luna (max) překonává GPT‑5.6 Sol (střední) za desetinu jeho ceny.
V testu OSWorld 2.0(otevře se v novém okně) se agenti AI pokoušejí dokončit dlouhodobé pracovní postupy při ovládání počítače, které zahrnují každodenní i profesionální úlohy. Uvádíme částečnou odměnu v offline sadě z vydání v2026.08.08.
Vylepšený komunikační styl modelu GPT‑6 Astra jsme přenesli také do modelů Sol a Luna. Očekáváme, že bude obzvlášť patrný v technických konverzacích a diskusích o programování. Očekávejte srozumitelnější formulace, méně žargonu, méně nezvyklých obratů i zbytečných podrobností a celkově o něco kratší odpovědi, které si zachovávají podstatu.
Ačkoli je styl subjektivní, v tomto případě dáváme přednost odpovědi GPT‑6 Sol. Nedělá tak rychle ukvapené závěry, věnuje méně času opakování podrobností, které mohou být tazateli zřejmé (například že web má čtyři stránky), používá méně vágních formulací (například „modulární rozvržení“ či „přetváření…tohoto systému“), otevřeněji uvádí, co zkontroloval a co ne, a zbytečně nesdílí implementační detaily, jako je prompt pro nástroj na obrázky.
Vedle nižších cen tokenů pomáháme vývojářům využívajícím GPT‑6 více ušetřit také na kontextu, který jejich aplikace používají opakovaně. Vylepšili jsme ukládání promptů do mezipaměti pro GPT‑6, takže ve výchozím nastavení dosahuje vyšší míry zásahů. Agenti tak mohou opakovaně využívat více kontextu, reagovat rychleji a získat 90% slevu na čtení vstupních tokenů z mezipaměti.
Vývojáři mají také více možností, jak výkon ukládání do mezipaměti měřit a optimalizovat:
Monitorování a diagnostika. Panel ukládání promptů do mezipaměti(otevře se v novém okně) ukazuje, jaká část vstupu je uložena v mezipaměti a jak se tento podíl v čase mění. Diagnostický nástroj(otevře se v novém okně) pomáhá objasnit nevyužité příležitosti k ukládání do mezipaměti a doporučuje, co opravit.
Úprava míry úsilí při uvažování a dostupnosti nástrojů bez narušení mezipaměti. U obtížnějších úloh zvyšte úsilí při uvažování(otevře se v novém okně), u jednodušších navazujících dotazů je snižte a podle měnících se potřeb agenta zapínejte či vypínejte nástroje(otevře se v novém okně). Oba ovládací prvky nyní zachovávají dřívější kontext pro opakované využití mezipaměti.
Optimalizace předpon ukládaných do mezipaměti. Explicitní body přerušení umožňují vývojářům zvolit, kde končí předpony promptů ukládané do mezipaměti. Vývojáři tak získávají větší kontrolu nad opakovaným využitím mezipaměti a mohou zlepšit výkon.
GitHub uvádí, že tato vylepšení v posledních několika měsících snížila podíl tokenů promptů vyžadujících nové zpracování o více než 50 % napříč miliardami požadavků na modely OpenAI, což pomáhá Copilotu reagovat rychleji.
GPT‑6 Sol a Luna navazují na práci v oblasti sladění, kterou jsme představili s modelem Astra, dosud nejlépe sladěným modelem OpenAI. V našich hodnoceních sladění vykazují Sol i Luna zlepšení oproti svým protějškům GPT‑5.6, včetně nižšího podílu zavádějících tvrzení o vlastní práci na kódu.
Níže uvedená hodnocení záměrně testují náročné situace a neměří četnost selhání při běžném používání. Úplné výsledky najdete v kartě systému(otevře se v novém okně).
GPT‑6 Sol a GPT‑6 Luna jsou ode dneška k dispozici v ChatGPT Work a Codexu všem uživatelům plánů Plus, Pro, Business, Enterprise a Edu. Uživatelé plánů Free a Go mají k GPT‑6 Luna přístup v desktopové aplikaci. Tyto modely zatím nejsou dostupné v režimu Chat. V OpenAI API jsou dostupné jako gpt-6-sol a gpt-6-luna.
Aby služba zůstala stabilní pro všechny, plánujeme tyto modely v ChatGPT zavádět postupně v průběhu dne. Pokud nové modely v ChatGPT Work nebo Codexu nevidíte, zkuste to prosím znovu později.
Hodnocení GPT probíhalo v našem výzkumném prostředí nebo prostřednictvím našeho API. Kvůli rozdílům v systémových promptech, dostupných nástrojích a dalších faktorech se výstupy mohou mírně lišit od produkční verze ChatGPT. Hodnocení konkurenčních modelů jsme převzali z veřejně dostupných zpráv. Pokud nebylo dostupné skóre pro Claude Fable 5.1, uvádíme skóre pro Claude Fable 5.


