Predstavujeme GPT‑6 Sol a Luna
Viac možností, ako vniesť prelomovú inteligenciu do vašej každodennej práce.
Začiatkom tohto mesiaca sme predstavili GPT‑6 Astra, najinteligentnejší a najlepšie zosúladený model na svete. Najnáročnejšie a najdôležitejšie projekty síce naďalej vyžadujú plné možnosti modelu Astra, no práca má rôzny rozsah, tempo aj rozpočet.
Preto svet GPT‑6 rozširujeme o GPT‑6 Sol a GPT‑6 Luna. GPT‑6 Astra priniesol novú generáciu inteligencie. Tieto modely pomáhajú sprístupniť jej výhody tým, že posúvajú hranice nákladovej efektívnosti. GPT‑6 Sol a Luna sme trénovali podobnými metódami ako GPT‑6 Astra, a tak prinášajú pokroky, ktoré stoja za špičkovým výkonom modelu Astra v profesionálnej práci, faktickej správnosti, programovaní, používaní počítača a zosúladení, do rýchlejších a cenovo dostupnejších modelov.
Modely GPT‑6 vedú naprieč celou krivkou nákladov a inteligencie: na každej úrovni spájajú výnimočné schopnosti s infraštruktúrou, ktorá ich efektívne poskytuje vo veľkom rozsahu. Vďaka zlepšeniam cachingu a inferencie môžeme tieto modely poskytovať lacnejšie. Úspory odovzdávame priamo používateľom a zákazníkom tým, že oproti akciovým cenám modelov GPT‑5.6 znižujeme ceny API pre Sol a Luna o 50 %. Vďaka týmto zlepšeniam je pokročilá AI praktická pre viac každodenných úloh a aplikácií vo veľkom rozsahu.
Model | Vstup | Výstup | Zníženie ceny |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | o 50 % lacnejšie |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | o 50 % lacnejšie |
Ceny sú za 1 milión tokenov.
GPT‑6 Astra zostáva naším celkovo najlepším modelom. Vyberte si ho, keď chcete najlepšie výsledky bez kompromisov.
GPT‑6 Sol a Luna prinášajú vyššiu inteligenciu a nákladovú efektívnosť do modelov, ktoré už poznáte a používate, a to v schopnostiach najužitočnejších pri zvládaní komplexnej práce.
GPT‑6 Sol zvládne náročné pracovné úlohy a vďaka vyšším limitom používania a nižším nákladom vám poskytne viac priestoru na iterácie. Oproti konkurenčným modelom s podobnou cenou ponúka vyššiu inteligenciu a lepšie výsledky.
V teste AutomationBench, ktorý hodnotí firemné pracovné postupy naprieč aplikáciami, GPT‑6 Sol pri veľmi vysokom úsilí prekonáva Claude Opus 5 s maximálnym úsilím, pričom náklady na úlohu dosahujú len 9 % nákladov modelu Opus 5. Pri vysokom úsilí dosahuje GPT‑6 Luna oproti predchodcovi zlepšenie o 5,4 percentuálneho bodu a náklady na úlohu sú o 58 % nižšie.
V teste AutomationBench 1.0.6(otvorí sa v novom okne) sa AI agenty testujú v komplexných pracovných postupoch od začiatku do konca s použitím 47 nástrojov v predaji, marketingu, prevádzke, podpore, financiách a ľudských zdrojoch. Údaj pre Claude Fable 5.1 podhodnocuje jeho skutočné náklady, pretože nezahŕňa náklady na použitie záložného modelu Opus 5, ku ktorému došlo pri približne 40 % úloh.
GPT‑6 Sol tiež prekonáva Claude Fable 5.1 pri výrazne nižších nákladoch a dokonca poráža aj GPT‑6 Astra s nízkym úsilím.
Model (a úsilie) | Skóre | Náklady na úlohu |
|---|---|---|
GPT‑6 Sol (veľmi vysoká) | 33,2 % | 0,27 USD |
GPT‑6 Astra (nízka) | 30,3 % | 3,9× GPT‑6 Sol |
Claude Opus 5 (maximálna) | 26,9 % | 11,1× GPT‑6 Sol |
Claude Fable 5.1 so záložným Opus 5 (maximálna) | 31,4 % | >8,9× GPT‑6 Sol (náklady na záložný model neboli uvedené) |
V teste Agents’ Last Exam, ktorý hodnotí agentov v komplexných profesionálnych pracovných postupoch, dosahuje GPT‑6 Sol pri maximálnom úsilí skóre 56,4 %. Prekonáva tak najvyššie skóre Claude Opus 5 v tomto hodnotení, a to pri nákladoch na úlohu nižších o 60 %.
V teste Agents’ Last Exam V1(otvorí sa v novom okne) sa AI agenty hodnotia pri dlhodobých, ekonomicky hodnotných úlohách z 55 pododvetví, ktoré pokrývajú väčšinu hlavných oblastí profesionálnej práce vykonávanej na počítači.
Užitočnosť odpovede závisí od správnosti faktov, preto naďalej zlepšujeme faktickú spoľahlivosť. V našom internom hodnotení faktickej správnosti, ktoré vychádza z anonymizovaných reálnych konverzácií, v ktorých používatelia označili chyby našich modelov, robí GPT‑6 Sol približne o polovicu menej chýb než jeho predchodca. Pri výrazne nižších nákladoch sa tak približuje spoľahlivosti modelu Astra. Výrazne sa zlepšuje aj GPT‑6 Luna. Pri vyšších úrovniach úsilia sa vyrovná modelu GPT‑5.6 Sol približne za stotinu jeho nákladov.
Faktickú správnosť tu hodnotíme na anonymizovaných konverzáciách v ChatGPT, v ktorých používatelia označili faktickú chybu predchádzajúceho modelu. Tieto konverzácie vyvolávajúce chyby nereprezentujú bežné používanie, pri ktorom sú faktické chyby zriedkavejšie. Skóre nie sú upravené podľa dĺžky, no naše testy rôznej miery podrobnosti ukázali takmer nulovú závislosť od dĺžky odpovede.
Tento rok začali programovacie agenty riešiť úlohy s väčšou zložitosťou, rozsahom a trvaním než kedykoľvek predtým. V OpenAI naše interné používanie exponenciálne vzrástlo. Pri ocenení podľa cien API prekročila denná spotreba tokenov hodnotu 600 $ pri mediánovom výskumníkovi a 7 000 $ pri výskumníkoch na 90. percentile (Zrýchľovanie výskumu: Pohľad do OpenAI). Keď programovacie agenty preberajú dlhšie a náročnejšie úlohy, náklady na ich nepretržité používanie sú čoraz dôležitejšie. GPT‑6 Sol a Luna spájajú vysoký výkon pri programovaní s nižšími cenami API. Vývojári tak majú viac priestoru na iterácie a tímy môžu od Codexu s väčšou istotou žiadať ambicióznejšie úlohy.
V teste FrontierCode, ktorý hodnotí, či programovacie agenty vytvárajú zmeny pripravené na zlúčenie do reálnych kódových báz, sa GPT‑6 Sol oproti GPT‑5.6 Sol výrazne zlepšuje a pri oveľa nižších nákladoch sa vyrovnáva modelu Claude Fable 5.1 s veľmi vysokým úsilím.
V teste FrontierCode 1.1 Main(otvorí sa v novom okne) píšu AI agenty kód, ktorý sa hodnotí nielen podľa správnosti, ale aj podľa „pripravenosti na zlúčenie“, napríklad podľa kvality testov, dodržania rozsahu, štýlu kódu a štandardov kódovej bázy.
V teste DeepSWE v1.1, ktorý overuje výkon pri komplexných úlohách softvérového inžinierstva v reálnych kódových bázach, dosahuje GPT‑6 Sol pri maximálnom úsilí skóre 68,8 %. Od najvyššieho skóre Claude Fable 5 v hodnotení – 69,9 % pri veľmi vysokom úsilí – ho delí 1,1 percentuálneho bodu, pričom náklady na úlohu sú približne o 80 % nižšie.
GPT‑6 Luna dosahuje pri maximálnom úsilí skóre 66,6 %, porovnateľné s modelmi Claude Opus 5 a Fable 5 pri strednom úsilí. V týchto porovnaniach stojí Luna na jednu úlohu o 93 % menej než Opus 5 a o 96 % menej než Fable 5.
V teste DeepSWE 1.1(otvorí sa v novom okne) riešia AI agenty originálne dlhodobé úlohy softvérového inžinierstva.
Hoci GPT‑6 Astra zostáva najlepším modelom na svete na používanie počítača, GPT‑6 Sol a Luna poskytujú nákladovo efektívnejší výkon než ich predchodcovia. V offline teste OSWorld 2.0 dosahuje GPT‑6 Sol pri veľmi vysokom úsilí podobné skóre ako Claude Opus 5 pri strednom úsilí – 60,5 % oproti 60,3 % – a to pri približne o 80 % nižších nákladoch na úlohu. GPT‑6 Luna (maximálna) dokáže prekonať GPT‑5.6 Sol (stredná) za desatinu jeho nákladov.
V teste OSWorld 2.0(otvorí sa v novom okne) sa AI agenty pokúšajú dokončiť dlhodobé pracovné postupy na počítači zahŕňajúce každodenné aj profesionálne úlohy. Uvádzame čiastočnú odmenu v offline množine z vydania v2026.08.08.
Vylepšený komunikačný štýl modelu GPT‑6 Astra sme priniesli aj do modelov Sol a Luna. Podľa nás bude obzvlášť viditeľný v technických rozhovoroch a rozhovoroch o programovaní. Očakávajte zrozumiteľnejšie odpovede s menším množstvom žargónu, nezvyčajných formulácií a málo užitočných detailov. Celkovo budú o niečo kratšie, no nestratia podstatu.
Hoci je štýl subjektívny, v tomto prípade uprednostňujeme odpoveď GPT‑6 Sol. Nerobí unáhlené závery, venuje menej času opakovaniu podrobností, ktoré môžu byť pre zadávateľa zrejmé (napríklad že web má štyri stránky), používa menej vágnych formulácií (napríklad „dojem bento“ či „pretvorenie… podľa tohto systému“), otvorenejšie uvádza, čo skontroloval a čo nie, a zbytočne nezdieľa implementačné detaily, ako je príkaz pre nástroj na tvorbu obrázkov.
Okrem nižších cien tokenov pomáhame vývojárom používajúcim GPT‑6 viac ušetriť aj na kontexte, ktorý ich aplikácie opakovane využívajú. Zlepšili sme caching príkazov pre GPT‑6, aby predvolene dosahoval vyššiu mieru zásahov cache. Agenty tak môžu opakovane využívať viac kontextu, reagovať rýchlejšie a získať 90 % zľavu na čítanie vstupných tokenov z cache.
Vývojári majú tiež viac možností, ako merať a optimalizovať výkon cachingu:
Monitorovanie a diagnostika. Panel cachingu príkazov(otvorí sa v novom okne) ukazuje, aký objem vstupu sa ukladá do cache a ako sa to časom mení. Diagnostický nástroj(otvorí sa v novom okne) pomáha vysvetliť nevyužité príležitosti na caching a ukazuje, čo treba opraviť.
Úprava úsilia pri uvažovaní a dostupnosti nástrojov bez narušenia cache. Pri náročnejších úlohách zvýšte úsilie pri uvažovaní(otvorí sa v novom okne), pri jednoduchších doplňujúcich otázkach ho znížte a podľa meniacich sa potrieb agenta zapínajte alebo vypínajte nástroje(otvorí sa v novom okne). Obe nastavenia teraz zachovávajú predchádzajúci kontext na opätovné použitie z cache.
Optimalizácia výberu prefixov ukladaných do cache. Explicitné body prerušenia umožňujú vývojárom určiť, kde sa majú končiť prefixy príkazov ukladané do cache. Vývojári tak získajú väčšiu kontrolu nad opätovným používaním cache a môžu zvýšiť výkon.
GitHub uvádza, že za posledných niekoľko mesiacov tieto zlepšenia znížili podiel tokenov príkazov vyžadujúcich nové spracovanie o viac než 50 % naprieč miliardami požiadaviek na modely OpenAI, vďaka čomu Copilot reaguje rýchlejšie.
GPT‑6 Sol a Luna nadväzujú na prácu v oblasti zosúladenia predstavenú s modelom Astra, naším doteraz najlepšie zosúladeným modelom. V našich hodnoteniach zosúladenia vykazujú Sol aj Luna oproti svojim náprotivkom GPT‑5.6 zlepšenia vrátane nižšej miery zavádzajúcich tvrdení o vlastnej programovacej práci.
Nasledujúce hodnotenia zámerne testujú náročné situácie a nemerajú mieru zlyhaní pri bežnom používaní. Úplné výsledky nájdete v systémovej karte(otvorí sa v novom okne).
GPT‑6 Sol a GPT‑6 Luna sú od dnešného dňa dostupné v ChatGPT Work a Codexe pre všetkých používateľov programov Plus, Pro, Business, Enterprise a Edu. Používatelia programov Free a Go majú prístup ku GPT‑6 Luna v aplikácii pre počítače. Tieto modely zatiaľ nie sú dostupné v režime Chat. V OpenAI API sú dostupné ako gpt-6-sol a gpt-6-luna.
Aby služba zostala stabilná pre všetkých, plánujeme tieto modely v ChatGPT zavádzať postupne počas celého dňa. Ak nové modely v ChatGPT Work alebo Codexe nevidíte, skúste to znova neskôr.
Hodnotenia GPT prebiehali v našom výskumnom prostredí alebo prostredníctvom nášho API, ktoré môže v dôsledku rozdielov v systémových príkazoch, dostupných nástrojoch a podobne poskytovať mierne odlišné výstupy než produkčná verzia ChatGPT. Hodnotenia konkurenčných modelov pochádzajú z verejne dostupných správ. Ak neboli dostupné skóre pre Claude Fable 5.1, uviedli sme skóre pre Claude Fable 5.


