Predstavljamo GPT‑6 Sol in Luna
Več načinov, kako prelomno inteligenco vključiti v svoje vsakdanje delo.
V začetku tega meseca smo predstavili GPT‑6 Astra, najinteligentnejši in najbolj usklajen model na svetu. Čeprav najzahtevnejši in najpomembnejši projekti še vedno potrebujejo vso zmogljivost modela Astra, delo poteka v različnih obsegih, ritmih in proračunskih okvirih.
Zato svet GPT‑6 širimo z modeloma GPT‑6 Sol in GPT‑6 Luna. GPT‑6 Astra je uvedel novo generacijo inteligence, ta modela pa pomagata širiti njene koristi s premikanjem meje stroškovne učinkovitosti. GPT‑6 Sol in Luna smo učili s podobnimi metodami kot GPT‑6 Astra ter napredne rešitve, ki omogočajo vrhunsko zmogljivost modela Astra pri strokovnem delu, stvarni pravilnosti, programiranju, uporabi računalnika in usklajenosti, prenesli v hitrejša in cenovno dostopnejša modela.
Modeli GPT‑6 so vodilni po vsej krivulji razmerja med stroški in inteligenco, saj na vsaki ravni združujejo izjemne zmogljivosti z infrastrukturo, ki jih učinkovito zagotavlja v velikem obsegu. Izboljšave predpomnjenja in sklepanja nam omogočajo, da te modele ponujamo ceneje, prihranke pa neposredno prenašamo na uporabnike in stranke: cene uporabe vmesnika API za Sol in Luna znižujemo za 50 % glede na promocijske cene modelov GPT‑5.6. Te izboljšave skupaj omogočajo praktično uporabo napredne umetne inteligence pri več vsakdanjih opravilih in aplikacijah v velikem obsegu.
Model | Vhod | Izhod | Znižanje cene |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | 50 % ceneje |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | 50 % ceneje |
Cene veljajo za milijon žetonov.
GPT‑6 Astra ostaja naš najboljši vsestranski model. Izberite ga, ko želite najboljše rezultate in izkušnjo brez kompromisov.
GPT‑6 Sol in Luna modelom, ki jih že poznate in uporabljate, prinašata izboljšano inteligenco in stroškovno učinkovitost pri zmogljivostih, ki so najkoristnejše za opravljanje zahtevnega dela.
GPT‑6 Sol se lahko loti zahtevnih delovnih nalog, višje omejitve uporabe in nižji stroški pa vam omogočajo več ponovitev. V primerjavi s podobno dragimi konkurenčnimi modeli ponuja več inteligence in boljše rezultate.
Na preizkusu AutomationBench, ki preverja poslovne delovne postopke v različnih aplikacijah, GPT‑6 Sol pri zelo visokem naporu presega Claude Opus 5 pri najvišjem naporu, pri čemer strošek na nalogo znaša le 9 % stroška modela Opus 5. Pri visokem naporu GPT‑6 Luna svojega predhodnika presega za 5,4 odstotne točke, strošek na nalogo pa je nižji za 58 %.
Pri preizkusu AutomationBench 1.0.6(odpre se v novem oknu) se agenti umetne inteligence preizkušajo pri celovitih delovnih postopkih z uporabo 47 orodij na področjih prodaje, trženja, poslovanja, podpore, financ in kadrov. Podatek za Claude Fable 5.1 kaže prenizek dejanski strošek, saj ne vključuje stroška nadomestnih izvedb z modelom Opus 5, uporabljenih pri približno 40 % nalog.
GPT‑6 Sol ob precej nižjih stroških presega tudi Claude Fable 5.1 in celo GPT‑6 Astra z nizkim naporom.
Model (in napor) | Rezultat | Strošek na nalogo |
|---|---|---|
GPT‑6 Sol (zelo visoko) | 33,2 % | 0,27 USD |
GPT‑6 Astra (nizko) | 30,3 % | 3,9-kratnik GPT‑6 Sol |
Claude Opus 5 (najvišje) | 26,9 % | 11,1-kratnik GPT‑6 Sol |
Claude Fable 5.1 z nadomestnim Opus 5 (najvišje) | 31,4 % | >8,9-kratnik GPT‑6 Sol (strošek nadomestnega modela ni naveden) |
Na preizkusu Agents’ Last Exam, ki agente ocenjuje pri zahtevnih strokovnih delovnih postopkih, GPT‑6 Sol z najvišjim naporom doseže 56,4 %, kar je več od najboljšega rezultata modela Claude Opus 5 v tem vrednotenju, ob 60 % nižjem strošku na nalogo.
Pri preizkusu Agents’ Last Exam V1(odpre se v novem oknu) se agenti umetne inteligence ocenjujejo pri dolgotrajnih in gospodarsko koristnih nalogah v 55 podpanogah, ki zajemajo večino glavnih področij strokovnega dela z računalnikom.
Uporabnost odgovora je odvisna od pravilnosti dejstev, zato še naprej izboljšujemo stvarno zanesljivost. V našem internem vrednotenju stvarne pravilnosti, ki temelji na anonimiziranih pogovorih iz resničnega sveta, v katerih so uporabniki označili napake naših modelov, GPT‑6 Sol naredi približno polovico manj napak kot njegov predhodnik ter se ob precej nižjih stroških približa zanesljivosti modela Astra. Tudi GPT‑6 Luna je bistveno napredoval; pri višjih ravneh napora se izenači z GPT‑5.6 Sol ob približno stokrat nižjih stroških.
Tukaj vrednotimo stvarno pravilnost na anonimiziranih pogovorih v ChatGPT, v katerih so uporabniki označili stvarno napako prejšnjega modela. Ti pogovori, ki povzročajo napake, ne predstavljajo običajne uporabe, pri kateri so stvarne napake redkejše. Rezultati niso prilagojeni glede na dolžino, vendar naši preizkusi različnih stopenj obširnosti niso pokazali skoraj nobene odvisnosti od dolžine odgovora.
Letos so se agenti za programiranje začeli lotevati zahtevnejših, obsežnejših in dolgotrajnejših nalog kot kadar koli prej. Naša interna uporaba v OpenAI je eksponentno narasla. Če jo ovrednotimo po cenah vmesnika API, je dnevna poraba žetonov presegla 600 USD pri medianem raziskovalcu in 7.000 USD pri raziskovalcih v 90. percentilu (Pospeševanje raziskav: pogled v notranjost OpenAI). Ko agenti za programiranje prevzemajo daljše in zahtevnejše naloge, postajajo stroški neprekinjene uporabe pomembnejši. GPT‑6 Sol in Luna združujeta visoko zmogljivost pri programiranju z nižjimi cenami vmesnika API, zato imajo razvijalci več možnosti za ponovitve, ekipe pa si lahko drznejše zastavijo naloge, ki jih zaupajo Codexu.
Na preizkusu FrontierCode, ki ocenjuje, ali agenti za programiranje ustvarijo spremembe, pripravljene za združitev z dejanskimi kodnimi zbirkami, GPT‑6 Sol bistveno presega GPT‑5.6 Sol in se lahko ob precej nižjih stroških izenači z modelom Claude Fable 5.1 pri zelo visokem naporu.
Pri preizkusu FrontierCode 1.1 Main(odpre se v novem oknu) agenti umetne inteligence pišejo kodo, ki se ne ocenjuje le glede na pravilnost, temveč tudi glede na »primernost za združitev«, na primer kakovost preizkusov, upoštevanje obsega, slog kode in skladnost s standardi kodne zbirke.
Na preizkusu DeepSWE v1.1, ki preverja zmogljivost pri zahtevnih nalogah programskega inženirstva v dejanskih kodnih zbirkah, GPT‑6 Sol z najvišjim naporom doseže 68,8 %, kar je 1,1 odstotne točke manj od najboljšega rezultata modela Claude Fable 5 v vrednotenju – 69,9 % pri zelo visokem naporu – ob približno 80 % nižjem strošku na nalogo.
GPT‑6 Luna z najvišjim naporom doseže 66,6 %, kar je primerljivo z modeloma Claude Opus 5 in Fable 5 pri srednjem naporu. V teh primerjavah je strošek modela Luna na nalogo 93 % nižji kot pri Opus 5 in 96 % nižji kot pri Fable 5.
Pri preizkusu DeepSWE 1.1(odpre se v novem oknu) agenti umetne inteligence rešujejo izvirne, dolgotrajne naloge programskega inženirstva.
GPT‑6 Astra ostaja najboljši model na svetu za uporabo računalnika, GPT‑6 Sol in Luna pa ponujata stroškovno učinkovitejšo zmogljivost kot njuna predhodnika. Na preizkusu OSWorld 2.0 offline GPT‑6 Sol pri zelo visokem naporu doseže podoben rezultat kot Claude Opus 5 pri srednjem naporu – 60,5 % v primerjavi s 60,3 % – ob približno 80 % nižjem strošku na nalogo. GPT‑6 Luna (najvišje) lahko preseže GPT‑5.6 Sol (srednje) ob desetkrat nižjih stroških.
Pri preizkusu OSWorld 2.0(odpre se v novem oknu) agenti umetne inteligence izvajajo dolgotrajne delovne postopke uporabe računalnika, ki zajemajo vsakdanja in strokovna opravila. Navajamo delno nagrado za nabor brez povezave iz izdaje v2026.08.08.
Izboljšani slog komuniciranja modela GPT‑6 Astra smo prenesli tudi v Sol in Luna, kar bo po našem mnenju še posebej opazno v tehničnih pogovorih in pogovorih o programiranju. Pričakujete lahko jasnejše odgovore z manj žargona, nenavadnih besednih zvez in podrobnosti z majhno vrednostjo. Na splošno bodo nekoliko krajši, ne da bi izgubili vsebino.
Čeprav je slog subjektiven, nam je tukaj ljubši odgovor modela GPT‑6 Sol. Ne sklepa prehitro, manj časa porabi za ponavljanje podrobnosti, ki so spraševalcu morda očitne (na primer, da ima spletno mesto štiri strani), uporablja manj nejasne izraze (na primer »videz benta«, »preoblikovanje … okoli tega sistema«), bolj odkrito pove, kaj je preveril in česa ni, ter po nepotrebnem ne razkriva izvedbenih podrobnosti, kot je poziv za orodje za slike.
Poleg nižjih cen žetonov razvijalcem, ki gradijo na GPT‑6, pomagamo prihraniti še več pri kontekstu, ki ga njihove aplikacije znova uporabljajo. Izboljšali smo predpomnjenje pozivov za GPT‑6, da privzeto zagotavlja višjo stopnjo zadetkov v predpomnilniku. Agenti lahko tako znova uporabijo več konteksta, se hitreje odzivajo in izkoristijo 90-odstotni popust pri branju predpomnjenih vhodnih žetonov.
Razvijalci imajo tudi več možnosti za merjenje in optimizacijo učinkovitosti predpomnjenja:
Spremljanje in diagnosticiranje. Nadzorna plošča za predpomnjenje pozivov(odpre se v novem oknu) prikazuje, koliko vhodnih podatkov je predpomnjenih in kako se to sčasoma spreminja. Diagnostično orodje(odpre se v novem oknu) pomaga pojasniti zamujene priložnosti za predpomnjenje in potrebne popravke.
Prilagajanje napora pri sklepanju in razpoložljivosti orodij brez prekinitve predpomnilnika. Povečajte napor pri sklepanju(odpre se v novem oknu) za zahtevnejše naloge ali ga zmanjšajte za preprostejša nadaljnja vprašanja ter omogočite ali onemogočite orodja(odpre se v novem oknu) glede na spreminjajoče se potrebe agenta. Oba kontrolnika zdaj ohranita prejšnji kontekst za vnovično uporabo predpomnilnika.
Optimizacija izbire predpon za predpomnjenje. Izrecne prekinitvene točke razvijalcem omogočajo izbiro mesta, kjer se končajo predpomnjene predpone pozivov. Tako imajo razvijalci več nadzora nad vnovično uporabo predpomnilnika in lahko izboljšajo učinkovitost.
GitHub poroča, da so te izboljšave v zadnjih nekaj mesecih pri milijardah zahtev za modele OpenAI za več kot 50 % zmanjšale delež žetonov pozivov, ki zahtevajo svežo obdelavo, kar Copilotu omogoča hitrejše odzivanje.
GPT‑6 Sol in Luna nadgrajujeta prizadevanja za usklajenost, uvedena z modelom Astra, našim doslej najbolj usklajenim modelom. V naših vrednotenjih usklajenosti sta Sol in Luna boljša od ustreznih modelov GPT‑5.6, med drugim redkeje podajata zavajajoče trditve o svojem programerskem delu.
Spodnja vrednotenja namerno preverjajo zahtevne okoliščine in ne merijo deleža napak pri običajni uporabi. Za celotne rezultate si oglejte sistemski dokument(odpre se v novem oknu).
GPT‑6 Sol in GPT‑6 Luna sta od danes na voljo v ChatGPT Work in Codexu za vse uporabnike paketov Plus, Pro, Business, Enterprise in Edu. Uporabniki paketov Free in Go lahko do GPT‑6 Luna dostopajo v namizni aplikaciji. Ta modela še nista na voljo v načinu Chat. V vmesniku API OpenAI sta na voljo kot gpt-6-sol in gpt-6-luna.
Da bi storitev ostala stabilna za vse, bomo ta modela v ChatGPT uvajali postopoma čez dan. Če novih modelov ne vidite v ChatGPT Work ali Codexu, poskusite znova pozneje.
Vrednotenja modelov GPT so bila izvedena v našem raziskovalnem okolju ali prek našega vmesnika API, zato se lahko rezultati zaradi razlik v sistemskih pozivih, razpoložljivih orodjih in drugem nekoliko razlikujejo od produkcijskega okolja ChatGPT. Vrednotenja konkurenčnih modelov smo povzeli po javno dostopnih poročilih. Kadar rezultati za Claude Fable 5.1 niso bili na voljo, smo navedli rezultate za Claude Fable 5.


