Preskočiť na hlavný obsah
OpenAI

Predstavujeme GPT‑6 Sol a Luna

Viac možností, ako vniesť prelomovú inteligenciu do vašej každodennej práce.

Načítava sa…

Začiatkom tohto mesiaca sme predstavili GPT‑6 Astra, najinteligentnejší a najlepšie zosúladený model na svete. Najnáročnejšie a najdôležitejšie projekty síce naďalej vyžadujú plné možnosti modelu Astra, no práca má rôzny rozsah, tempo aj rozpočet.

Preto svet GPT‑6 rozširujeme o GPT‑6 Sol a GPT‑6 Luna. GPT‑6 Astra priniesol novú generáciu inteligencie. Tieto modely pomáhajú sprístupniť jej výhody tým, že posúvajú hranice nákladovej efektívnosti. GPT‑6 Sol a Luna sme trénovali podobnými metódami ako GPT‑6 Astra, a tak prinášajú pokroky, ktoré stoja za špičkovým výkonom modelu Astra v profesionálnej práci, faktickej správnosti, programovaní, používaní počítača a zosúladení, do rýchlejších a cenovo dostupnejších modelov.

Modely GPT‑6 vedú naprieč celou krivkou nákladov a inteligencie: na každej úrovni spájajú výnimočné schopnosti s infraštruktúrou, ktorá ich efektívne poskytuje vo veľkom rozsahu. Vďaka zlepšeniam cachingu a inferencie môžeme tieto modely poskytovať lacnejšie. Úspory odovzdávame priamo používateľom a zákazníkom tým, že oproti akciovým cenám modelov GPT‑5.6 znižujeme ceny API pre Sol a Luna o 50 %. Vďaka týmto zlepšeniam je pokročilá AI praktická pre viac každodenných úloh a aplikácií vo veľkom rozsahu.

Ceny GPT‑6 API

Model

Vstup

Výstup

Zníženie ceny

GPT‑6 Sol
oproti GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

o 50 % lacnejšie

GPT‑6 Luna
oproti GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

o 50 % lacnejšie

Ceny sú za 1 milión tokenov.

GPT‑6 Astra zostáva naším celkovo najlepším modelom. Vyberte si ho, keď chcete najlepšie výsledky bez kompromisov.

Pokrok v celej rodine modelov

GPT‑6 Sol a Luna prinášajú vyššiu inteligenciu a nákladovú efektívnosť do modelov, ktoré už poznáte a používate, a to v schopnostiach najužitočnejších pri zvládaní komplexnej práce.

Profesionálna práca

GPT‑6 Sol zvládne náročné pracovné úlohy a vďaka vyšším limitom používania a nižším nákladom vám poskytne viac priestoru na iterácie. Oproti konkurenčným modelom s podobnou cenou ponúka vyššiu inteligenciu a lepšie výsledky.

V teste AutomationBench, ktorý hodnotí firemné pracovné postupy naprieč aplikáciami, GPT‑6 Sol pri veľmi vysokom úsilí prekonáva Claude Opus 5 s maximálnym úsilím, pričom náklady na úlohu dosahujú len 9 % nákladov modelu Opus 5. Pri vysokom úsilí dosahuje GPT‑6 Luna oproti predchodcovi zlepšenie o 5,4 percentuálneho bodu a náklady na úlohu sú o 58 % nižšie.

V teste AutomationBench 1.0.6⁠(otvorí sa v novom okne) sa AI agenty testujú v komplexných pracovných postupoch od začiatku do konca s použitím 47 nástrojov v predaji, marketingu, prevádzke, podpore, financiách a ľudských zdrojoch. Údaj pre Claude Fable 5.1 podhodnocuje jeho skutočné náklady, pretože nezahŕňa náklady na použitie záložného modelu Opus 5, ku ktorému došlo pri približne 40 % úloh.

GPT‑6 Sol tiež prekonáva Claude Fable 5.1 pri výrazne nižších nákladoch a dokonca poráža aj GPT‑6 Astra s nízkym úsilím.

Model (a úsilie)

Skóre

Náklady na úlohu

GPT‑6 Sol (veľmi vysoká)

33,2 %

0,27 USD

GPT‑6 Astra (nízka)

30,3 %

3,9× GPT‑6 Sol

Claude Opus 5 (maximálna)

26,9 %

11,1× GPT‑6 Sol

Claude Fable 5.1 so záložným Opus 5 (maximálna)

31,4 %

>8,9× GPT‑6 Sol

(náklady na záložný model neboli uvedené)

V teste Agents’ Last Exam, ktorý hodnotí agentov v komplexných profesionálnych pracovných postupoch, dosahuje GPT‑6 Sol pri maximálnom úsilí skóre 56,4 %. Prekonáva tak najvyššie skóre Claude Opus 5 v tomto hodnotení, a to pri nákladoch na úlohu nižších o 60 %.

V teste Agents’ Last Exam V1⁠(otvorí sa v novom okne) sa AI agenty hodnotia pri dlhodobých, ekonomicky hodnotných úlohách z 55 pododvetví, ktoré pokrývajú väčšinu hlavných oblastí profesionálnej práce vykonávanej na počítači.

Faktická správnosť

Užitočnosť odpovede závisí od správnosti faktov, preto naďalej zlepšujeme faktickú spoľahlivosť. V našom internom hodnotení faktickej správnosti, ktoré vychádza z anonymizovaných reálnych konverzácií, v ktorých používatelia označili chyby našich modelov, robí GPT‑6 Sol približne o polovicu menej chýb než jeho predchodca. Pri výrazne nižších nákladoch sa tak približuje spoľahlivosti modelu Astra. Výrazne sa zlepšuje aj GPT‑6 Luna. Pri vyšších úrovniach úsilia sa vyrovná modelu GPT‑5.6 Sol približne za stotinu jeho nákladov.

Faktickú správnosť tu hodnotíme na anonymizovaných konverzáciách v ChatGPT, v ktorých používatelia označili faktickú chybu predchádzajúceho modelu. Tieto konverzácie vyvolávajúce chyby nereprezentujú bežné používanie, pri ktorom sú faktické chyby zriedkavejšie. Skóre nie sú upravené podľa dĺžky, no naše testy rôznej miery podrobnosti ukázali takmer nulovú závislosť od dĺžky odpovede.

Programovanie

Tento rok začali programovacie agenty riešiť úlohy s väčšou zložitosťou, rozsahom a trvaním než kedykoľvek predtým. V OpenAI naše interné používanie exponenciálne vzrástlo. Pri ocenení podľa cien API prekročila denná spotreba tokenov hodnotu 600 $ pri mediánovom výskumníkovi a 7 000 $ pri výskumníkoch na 90. percentile (Zrýchľovanie výskumu: Pohľad do OpenAI⁠). Keď programovacie agenty preberajú dlhšie a náročnejšie úlohy, náklady na ich nepretržité používanie sú čoraz dôležitejšie. GPT‑6 Sol a Luna spájajú vysoký výkon pri programovaní s nižšími cenami API. Vývojári tak majú viac priestoru na iterácie a tímy môžu od Codexu s väčšou istotou žiadať ambicióznejšie úlohy.

V teste FrontierCode, ktorý hodnotí, či programovacie agenty vytvárajú zmeny pripravené na zlúčenie do reálnych kódových báz, sa GPT‑6 Sol oproti GPT‑5.6 Sol výrazne zlepšuje a pri oveľa nižších nákladoch sa vyrovnáva modelu Claude Fable 5.1 s veľmi vysokým úsilím.

V teste FrontierCode 1.1 Main⁠(otvorí sa v novom okne) píšu AI agenty kód, ktorý sa hodnotí nielen podľa správnosti, ale aj podľa „pripravenosti na zlúčenie“, napríklad podľa kvality testov, dodržania rozsahu, štýlu kódu a štandardov kódovej bázy.

V teste DeepSWE v1.1, ktorý overuje výkon pri komplexných úlohách softvérového inžinierstva v reálnych kódových bázach, dosahuje GPT‑6 Sol pri maximálnom úsilí skóre 68,8 %. Od najvyššieho skóre Claude Fable 5 v hodnotení – 69,9 % pri veľmi vysokom úsilí – ho delí 1,1 percentuálneho bodu, pričom náklady na úlohu sú približne o 80 % nižšie.

GPT‑6 Luna dosahuje pri maximálnom úsilí skóre 66,6 %, porovnateľné s modelmi Claude Opus 5 a Fable 5 pri strednom úsilí. V týchto porovnaniach stojí Luna na jednu úlohu o 93 % menej než Opus 5 a o 96 % menej než Fable 5.

V teste DeepSWE 1.1⁠(otvorí sa v novom okne) riešia AI agenty originálne dlhodobé úlohy softvérového inžinierstva.

Používanie počítača

Hoci GPT‑6 Astra zostáva najlepším modelom na svete na používanie počítača, GPT‑6 Sol a Luna poskytujú nákladovo efektívnejší výkon než ich predchodcovia. V offline teste OSWorld 2.0 dosahuje GPT‑6 Sol pri veľmi vysokom úsilí podobné skóre ako Claude Opus 5 pri strednom úsilí – 60,5 % oproti 60,3 % – a to pri približne o 80 % nižších nákladoch na úlohu. GPT‑6 Luna (maximálna) dokáže prekonať GPT‑5.6 Sol (stredná) za desatinu jeho nákladov.

V teste OSWorld 2.0⁠(otvorí sa v novom okne) sa AI agenty pokúšajú dokončiť dlhodobé pracovné postupy na počítači zahŕňajúce každodenné aj profesionálne úlohy. Uvádzame čiastočnú odmenu v offline množine z vydania v2026.08.08.

Štýl spolupráce

Vylepšený komunikačný štýl modelu GPT‑6 Astra sme priniesli aj do modelov Sol a Luna. Podľa nás bude obzvlášť viditeľný v technických rozhovoroch a rozhovoroch o programovaní. Očakávajte zrozumiteľnejšie odpovede s menším množstvom žargónu, nezvyčajných formulácií a málo užitočných detailov. Celkovo budú o niečo kratšie, no nestratia podstatu.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Hoci je štýl subjektívny, v tomto prípade uprednostňujeme odpoveď GPT‑6 Sol. Nerobí unáhlené závery, venuje menej času opakovaniu podrobností, ktoré môžu byť pre zadávateľa zrejmé (napríklad že web má štyri stránky), používa menej vágnych formulácií (napríklad „dojem bento“ či „pretvorenie… podľa tohto systému“), otvorenejšie uvádza, čo skontroloval a čo nie, a zbytočne nezdieľa implementačné detaily, ako je príkaz pre nástroj na tvorbu obrázkov.

Lepší caching pre agenty a dlhé konverzácie

Okrem nižších cien tokenov pomáhame vývojárom používajúcim GPT‑6 viac ušetriť aj na kontexte, ktorý ich aplikácie opakovane využívajú. Zlepšili sme caching príkazov pre GPT‑6, aby predvolene dosahoval vyššiu mieru zásahov cache. Agenty tak môžu opakovane využívať viac kontextu, reagovať rýchlejšie a získať 90 % zľavu na čítanie vstupných tokenov z cache.

Vývojári majú tiež viac možností, ako merať a optimalizovať výkon cachingu:

GitHub uvádza, že za posledných niekoľko mesiacov tieto zlepšenia znížili podiel tokenov príkazov vyžadujúcich nové spracovanie o viac než 50 % naprieč miliardami požiadaviek na modely OpenAI, vďaka čomu Copilot reaguje rýchlejšie.

Pokračujeme v zlepšovaní zosúladenia

GPT‑6 Sol a Luna nadväzujú na prácu v oblasti zosúladenia predstavenú s modelom Astra, naším doteraz najlepšie zosúladeným modelom. V našich hodnoteniach zosúladenia vykazujú Sol aj Luna oproti svojim náprotivkom GPT‑5.6 zlepšenia vrátane nižšej miery zavádzajúcich tvrdení o vlastnej programovacej práci.

Nasledujúce hodnotenia zámerne testujú náročné situácie a nemerajú mieru zlyhaní pri bežnom používaní. Úplné výsledky nájdete v systémovej karte⁠(otvorí sa v novom okne).

Dostupnosť

GPT‑6 Sol a GPT‑6 Luna sú od dnešného dňa dostupné v ChatGPT Work a Codexe pre všetkých používateľov programov Plus, Pro, Business, Enterprise a Edu. Používatelia programov Free a Go majú prístup ku GPT‑6 Luna v aplikácii pre počítače. Tieto modely zatiaľ nie sú dostupné v režime Chat. V OpenAI API sú dostupné ako gpt-6-sol a gpt-6-luna.

Aby služba zostala stabilná pre všetkých, plánujeme tieto modely v ChatGPT zavádzať postupne počas celého dňa. Ak nové modely v ChatGPT Work alebo Codexe nevidíte, skúste to znova neskôr.


Hodnotenia GPT prebiehali v našom výskumnom prostredí alebo prostredníctvom nášho API, ktoré môže v dôsledku rozdielov v systémových príkazoch, dostupných nástrojoch a podobne poskytovať mierne odlišné výstupy než produkčná verzia ChatGPT. Hodnotenia konkurenčných modelov pochádzajú z verejne dostupných správ. Ak neboli dostupné skóre pre Claude Fable 5.1, uviedli sme skóre pre Claude Fable 5.

Autor

OpenAI