Pereiti prie pagrindinio turinio
OpenAI

Pristatome „GPT‑6 Sol“ ir „Luna“

Daugiau būdų pasitelkti priešakinį intelektą kasdieniame darbe.

Įkeliama...

Šio mėnesio pradžioje pristatėme „GPT‑6 Astra“ – pažangiausią ir geriausiai suderintą tikslų atitikimo atžvilgiu modelį pasaulyje. Nors sudėtingiausiems ir svarbiausiems projektams vis dar reikia visų „Astra“ galimybių, darbai skiriasi savo mastu, tempu ir biudžetu.

Todėl GPT‑6 šeimą papildome modeliais GPT‑6 Sol ir GPT‑6 Luna. „GPT‑6 Astra“ pradėjo naują intelekto kartą, o šie modeliai padeda plačiau paskleisti jos naudą ir išplečia sąnaudų efektyvumo ribas. „GPT‑6 Sol“ ir „Luna“ mokėme panašiais metodais kaip „GPT‑6 Astra“, todėl pažanga, užtikrinusi pažangiausius „Astra“ rezultatus profesinio darbo, faktinio tikslumo, programavimo, naudojimosi kompiuteriu ir suderinimo srityse, dabar pasiekiama greitesniuose ir pigesniuose modeliuose.

„GPT‑6“ modeliai pirmauja visoje kainos ir intelekto kreivėje: kiekviename lygyje jie pasižymi išskirtinėmis galimybėmis, o infrastruktūra leidžia jas efektyviai teikti dideliu mastu. Patobulinę podėlio naudojimą ir išvadų generavimą, šiuos modelius galime teikti pigiau, o sutaupytas lėšas tiesiogiai perduodame naudotojams ir klientams: palyginti su akcijinėmis „GPT‑5.6“ kainomis, „Sol“ ir „Luna“ API kainas sumažiname 50 %. Visi šie patobulinimai leidžia pažangų DI praktiškai taikyti dar daugiau kasdienių užduočių ir didelio masto programų.

„GPT‑6“ API kainos

Modelis

Įvestis

Išvestis

Kainos sumažinimas

GPT‑6 Sol
palyginti su „GPT‑5.6 Sol“

4 USD → 2 USD

20 USD → 10 USD

50 % pigiau

GPT‑6 Luna
palyginti su „GPT‑5.6 Luna“

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

50 % pigiau

Kainos nurodytos už 1 milijoną tokenų.

GPT‑6 Astra tebėra visais atžvilgiais geriausias mūsų modelis. Rinkitės jį, kai norite geriausių rezultatų be jokių kompromisų.

Visos modelių šeimos pažanga

„GPT‑6 Sol“ ir „Luna“ suteikia jau pažįstamiems ir naudojamiems modeliams daugiau intelekto bei sąnaudų efektyvumo, ypač tose srityse, kurios svarbiausios atliekant sudėtingus darbus.

Profesionalus darbas

„GPT‑6 Sol“ gali atlikti sudėtingas darbo užduotis, o dėl aukštesnių naudojimo limitų ir mažesnių sąnaudų suteikia daugiau galimybių tobulinti rezultatą. Palyginti su panašiai kainuojančiais konkurentų modeliais, jis pasižymi didesniu intelektu ir geresniais rezultatais.

Verslo procesus įvairiose programose tikrinančiame teste AutomationBench „GPT‑6 Sol“, naudojantis itin aukštą pastangų lygį, pranoksta „Claude Opus 5“, naudojantį maksimalų lygį, o vienos užduoties sąnaudos tesudaro 9 % „Opus 5“ sąnaudų. Naudojant aukštą pastangų lygį, „GPT‑6 Luna“ savo pirmtaką lenkia 5,4 procentinio punkto, o vienos užduoties sąnaudos yra 58 % mažesnės.

Teste AutomationBench 1.0.6⁠(atsidaro naujame lange) DI agentai tikrinami atliekant ištisinius darbo procesus ir naudojant 47 įrankius pardavimo, rinkodaros, veiklos, klientų aptarnavimo, finansų ir žmogiškųjų išteklių srityse. „Claude Fable 5.1“ duomenų taškas rodo mažesnes nei faktinės sąnaudas, nes neįtrauktos atsarginio modelio „Opus 5“ naudojimo sąnaudos – jis naudotas maždaug 40 % užduočių.

„GPT‑6 Sol“ taip pat gerokai mažesnėmis sąnaudomis pranoksta „Claude Fable 5.1“ ir net aplenkia „GPT‑6 Astra“, naudojantį žemą pastangų lygį.

Modelis (ir pastangų lygis)

Rezultatas

Vienos užduoties kaina

GPT‑6 Sol (xhigh)

33,2 %

0,27 USD

GPT‑6 Astra (low)

30,3 %

3,9 k. „GPT‑6 Sol“

Claude Opus 5 (max)

26,9 %

11,1 k. „GPT‑6 Sol“

„Claude Fable 5.1“ su atsarginiu variantu „Opus 5 (max)“

31,4 %

>8,9 k. „GPT‑6 Sol“

(atsarginio modelio kaina nenurodyta)

Sudėtingus agentų profesinius procesus vertinančiame teste Agents’ Last Exam „GPT‑6 Sol“, naudojantis maksimalų pastangų lygį, surenka 56,4 % – daugiau nei aukščiausias „Claude Opus 5“ rezultatas šiame vertinime, o vienos užduoties sąnaudos yra 60 % mažesnės.

Teste Agents’ Last Exam V1⁠(atsidaro naujame lange) DI agentai vertinami pagal ilgai trunkančias, ekonominę vertę kuriančias užduotis iš 55 pošakių, apimančių daugumą pagrindinių kompiuteriu atliekamo profesinio darbo sričių.

Faktinis tikslumas

Atsakymas naudingas tik tada, kai faktai yra teisingi, todėl ir toliau geriname faktinį patikimumą. Per mūsų vidinį faktinio tikslumo vertinimą, pagrįstą nuasmenintais realiais pokalbiais, kuriuose naudotojai pažymėjo mūsų modelių klaidas, „GPT‑6 Sol“ klysta maždaug perpus rečiau nei jo pirmtakas ir už gerokai mažesnę kainą priartėja prie „Astra“ patikimumo. „GPT‑6 Luna“ taip pat gerokai patobulėjo: naudodamas aukštesnį pastangų lygį jis prilygsta „GPT‑5.6 Sol“, tačiau kainuoja maždaug šimtą kartų mažiau.

Čia faktinį tikslumą vertiname pagal nuasmenintus „ChatGPT“ pokalbius, kuriuose naudotojai pažymėjo ankstesnio modelio faktinę klaidą. Šie klaidas išprovokavę pokalbiai neatspindi įprasto naudojimo, kai faktinės klaidos pasitaiko rečiau. Rezultatai nekoreguoti pagal atsakymo ilgį, tačiau skirtingo išsamumo bandymai parodė, kad atsakymo ilgis beveik neturi įtakos.

Programavimas

Šiemet programavimo agentai pradėjo spręsti dar sudėtingesnes, platesnės apimties ir ilgiau trunkančias užduotis. „OpenAI“ vidinis naudojimas augo eksponentiškai. Skaičiuojant pagal API kainas, tyrėjo medianinis kasdienis tokenų naudojimas viršijo 600 USD, o 90-ajame procentilyje esančių tyrėjų – 7 000 USD („Tyrimų spartinimas: žvilgsnis į „OpenAI“ vidų“⁠). Programavimo agentams atliekant ilgesnes ir sudėtingesnes užduotis, ilgalaikio naudojimo sąnaudos tampa vis svarbesnės. „GPT‑6 Sol“ ir „Luna“ suderina puikius programavimo rezultatus su mažesnėmis API kainomis, todėl kūrėjai gali daugiau eksperimentuoti, o komandos – drąsiau patikėti „Codex“ ambicingesnes užduotis.

Teste FrontierCode, kuriame vertinama, ar programavimo agentų pakeitimai parengti sujungti su tikromis kodų bazėmis, „GPT‑6 Sol“ gerokai pranoksta „GPT‑5.6 Sol“ ir už daug mažesnę kainą prilygsta „Claude Fable 5.1 xhigh“.

Teste FrontierCode 1.1 Main⁠(atsidaro naujame lange) DI agentai rašo kodą, kuris vertinamas ne tik pagal teisingumą, bet ir pagal tinkamumą sujungti, pavyzdžiui, testų kokybę, apimties drausmę, kodo stilių ir kodų bazės standartų laikymąsi.

Teste DeepSWE v1.1, kuriame tikrinama, kaip atliekamos sudėtingos programinės įrangos inžinerijos užduotys tikrose kodų bazėse, „GPT‑6 Sol“, naudojantis maksimalų pastangų lygį, surenka 68,8 % – vos 1,1 procentinio punkto mažiau už aukščiausią „Claude Fable 5“ rezultatą šiame vertinime (69,9 %, naudojant „xhigh“ lygį), o vienos užduoties sąnaudos yra maždaug 80 % mažesnės.

„GPT‑6 Luna“, naudojantis maksimalų pastangų lygį, surenka 66,6 % – panašiai kaip „Claude Opus 5“ ir „Fable 5“, naudojantys vidutinį lygį. Šiuose palyginimuose vienos „Luna“ užduoties sąnaudos yra 93 % mažesnės nei „Opus 5“ ir 96 % mažesnės nei „Fable 5“.

Teste DeepSWE 1.1⁠(atsidaro naujame lange) DI agentai sprendžia originalias, ilgai trunkančias programinės įrangos inžinerijos užduotis.

Naudojimasis kompiuteriu

Nors „GPT‑6 Astra“ tebėra geriausias pasaulyje naudojimosi kompiuteriu modelis, „GPT‑6 Sol“ ir „Luna“ veikia ekonomiškiau nei jų pirmtakai. Teste OSWorld 2.0 offline „GPT‑6 Sol“, naudojantis itin aukštą pastangų lygį „xhigh“, pasiekia panašų rezultatą kaip „Claude Opus 5“, naudojantis vidutinį lygį – atitinkamai 60,5 % ir 60,3 %, – o vienos užduoties sąnaudos yra maždaug 80 % mažesnės. „GPT‑6 Luna“ (pastangų lygis „max“) pranoksta „GPT‑5.6 Sol“, naudojantį vidutinį lygį, ir kainuoja dešimt kartų mažiau.

Teste OSWorld 2.0⁠(atsidaro naujame lange) DI agentai mėgina atlikti ilgai trunkančius naudojimosi kompiuteriu procesus, apimančius kasdienes ir profesines užduotis. Pateikiame dalinį rezultatą, gautą naudojant 2026-08-08 versijos autonominį rinkinį.

Bendradarbiavimo stilius

Patobulintą „GPT‑6 Astra“ bendravimo stilių pritaikėme modeliams „Sol“ ir „Luna“. Manome, kad tai bus ypač pastebima techniniuose ir programavimo pokalbiuose. Atsakymai bus aiškesni, juose bus mažiau žargono, neįprastų formuluočių ir menkaverčių detalių. Apskritai jie bus šiek tiek trumpesni, tačiau nepraras esmės.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Nors stilius yra subjektyvus, čia mums labiau patinka „GPT‑6 Sol“ atsakymas. Jame ne taip greitai daromos išvados, mažiau kartojamos klausėjui tikriausiai akivaizdžios detalės (pvz., kad svetainę sudaro keturi puslapiai), vartojama mažiau neaiškių frazių (pvz., „bento įspūdis“, „pertvarkymas... pagal šią sistemą“), atviriau nurodoma, kas buvo ir nebuvo patikrinta, ir be reikalo neatskleidžiamos įgyvendinimo detalės, tokios kaip vaizdų įrankiui pateikta užklausa.

Podėlio naudojimo gerinimas agentams ir ilgiems pokalbiams

Be mažesnių žetonų kainų, padedame „GPT‑6“ naudojantiems kūrėjams daugiau sutaupyti pakartotinai naudojant programų kontekstą. Patobulinome podėlio naudojimą su užklausomis modeliui „GPT‑6“, kad pagal numatytąsias nuostatas dažniau būtų pataikoma į podėlį. Taip agentai gali pakartotinai naudoti daugiau konteksto, greičiau atsakyti ir pasinaudoti 90 % nuolaida podėlyje saugomiems įvesties tokenams nuskaityti.

Programuotojai taip pat turi daugiau būdų įvertinti ir optimizuoti podėlio naudojimo našumą.

„GitHub“ praneša, kad per pastaruosius kelis mėnesius šie patobulinimai daugiau nei 50 % sumažino iš naujo apdorojamų užklausų tokenų dalį per milijardus užklausų „OpenAI“ modeliams ir padėjo „Copilot“ atsakyti greičiau.

Tolesnis tikslų atitikimo gerinimas

„GPT‑6 Sol“ ir „Luna“ remiasi tikslų atitikimo darbu, pradėtu kuriant „Astra“ – iki šiol mūsų geriausiai suderintą tikslų atitikimo atžvilgiu modelį. Per mūsų tikslų atitikimo vertinimus tiek „Sol“, tiek „Luna“ pranoko atitinkamus „GPT‑5.6“ modelius, įskaitant rečiau pateikiamus klaidinančius teiginius apie savo programavimo darbus.

Toliau pateikiamuose vertinimuose sąmoningai tikrinamos sudėtingos situacijos, todėl jų rezultatai neatspindi nesėkmių dažnio įprastai naudojant modelius. Visus rezultatus rasite sistemos kortelėje⁠(atsidaro naujame lange).

Pasiekiamumas

Nuo šiandien „GPT‑6 Sol“ ir „GPT‑6 Luna“ pasiekiami „ChatGPT Work“ ir „Codex“ visiems „Plus“, „Pro“, „Business“, „Enterprise“ ir „Edu“ naudotojams. „Free“ ir „Go“ naudotojai gali naudotis „GPT‑6 Luna“ kompiuteriui skirtoje programos versijoje. Šie modeliai dar nepasiekiami „Chat“ režimu. „OpenAI“ API jie pasiekiami kaip gpt-6-sol ir gpt-6-luna.

Kad paslauga visiems veiktų stabiliai, planuojame šiuos modelius „ChatGPT“ diegti palaipsniui per visą dieną. Jei naujųjų modelių nematote „ChatGPT Work“ ar „Codex“, pabandykite dar kartą vėliau.


GPT vertinimai buvo atlikti mūsų tyrimų aplinkoje arba naudojant mūsų API. Dėl sisteminių užklausų, pasiekiamų įrankių ir kitų skirtumų rezultatai gali šiek tiek skirtis nuo galutinės „ChatGPT“ versijos rezultatų. Konkurentų modelių vertinimai paimti iš viešai prieinamų ataskaitų. Tais atvejais, kai „Claude Fable 5.1“ rezultatų nebuvo, pateikėme „Claude Fable 5“ rezultatus.

Autorius

OpenAI