Pristatome „GPT‑6 Sol“ ir „Luna“
Daugiau būdų pasitelkti priešakinį intelektą kasdieniame darbe.
Šio mėnesio pradžioje pristatėme „GPT‑6 Astra“ – pažangiausią ir geriausiai suderintą tikslų atitikimo atžvilgiu modelį pasaulyje. Nors sudėtingiausiems ir svarbiausiems projektams vis dar reikia visų „Astra“ galimybių, darbai skiriasi savo mastu, tempu ir biudžetu.
Todėl GPT‑6 šeimą papildome modeliais GPT‑6 Sol ir GPT‑6 Luna. „GPT‑6 Astra“ pradėjo naują intelekto kartą, o šie modeliai padeda plačiau paskleisti jos naudą ir išplečia sąnaudų efektyvumo ribas. „GPT‑6 Sol“ ir „Luna“ mokėme panašiais metodais kaip „GPT‑6 Astra“, todėl pažanga, užtikrinusi pažangiausius „Astra“ rezultatus profesinio darbo, faktinio tikslumo, programavimo, naudojimosi kompiuteriu ir suderinimo srityse, dabar pasiekiama greitesniuose ir pigesniuose modeliuose.
„GPT‑6“ modeliai pirmauja visoje kainos ir intelekto kreivėje: kiekviename lygyje jie pasižymi išskirtinėmis galimybėmis, o infrastruktūra leidžia jas efektyviai teikti dideliu mastu. Patobulinę podėlio naudojimą ir išvadų generavimą, šiuos modelius galime teikti pigiau, o sutaupytas lėšas tiesiogiai perduodame naudotojams ir klientams: palyginti su akcijinėmis „GPT‑5.6“ kainomis, „Sol“ ir „Luna“ API kainas sumažiname 50 %. Visi šie patobulinimai leidžia pažangų DI praktiškai taikyti dar daugiau kasdienių užduočių ir didelio masto programų.
Modelis | Įvestis | Išvestis | Kainos sumažinimas |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | 50 % pigiau |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | 50 % pigiau |
Kainos nurodytos už 1 milijoną tokenų.
GPT‑6 Astra tebėra visais atžvilgiais geriausias mūsų modelis. Rinkitės jį, kai norite geriausių rezultatų be jokių kompromisų.
„GPT‑6 Sol“ ir „Luna“ suteikia jau pažįstamiems ir naudojamiems modeliams daugiau intelekto bei sąnaudų efektyvumo, ypač tose srityse, kurios svarbiausios atliekant sudėtingus darbus.
„GPT‑6 Sol“ gali atlikti sudėtingas darbo užduotis, o dėl aukštesnių naudojimo limitų ir mažesnių sąnaudų suteikia daugiau galimybių tobulinti rezultatą. Palyginti su panašiai kainuojančiais konkurentų modeliais, jis pasižymi didesniu intelektu ir geresniais rezultatais.
Verslo procesus įvairiose programose tikrinančiame teste AutomationBench „GPT‑6 Sol“, naudojantis itin aukštą pastangų lygį, pranoksta „Claude Opus 5“, naudojantį maksimalų lygį, o vienos užduoties sąnaudos tesudaro 9 % „Opus 5“ sąnaudų. Naudojant aukštą pastangų lygį, „GPT‑6 Luna“ savo pirmtaką lenkia 5,4 procentinio punkto, o vienos užduoties sąnaudos yra 58 % mažesnės.
Teste AutomationBench 1.0.6(atsidaro naujame lange) DI agentai tikrinami atliekant ištisinius darbo procesus ir naudojant 47 įrankius pardavimo, rinkodaros, veiklos, klientų aptarnavimo, finansų ir žmogiškųjų išteklių srityse. „Claude Fable 5.1“ duomenų taškas rodo mažesnes nei faktinės sąnaudas, nes neįtrauktos atsarginio modelio „Opus 5“ naudojimo sąnaudos – jis naudotas maždaug 40 % užduočių.
„GPT‑6 Sol“ taip pat gerokai mažesnėmis sąnaudomis pranoksta „Claude Fable 5.1“ ir net aplenkia „GPT‑6 Astra“, naudojantį žemą pastangų lygį.
Modelis (ir pastangų lygis) | Rezultatas | Vienos užduoties kaina |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2 % | 0,27 USD |
GPT‑6 Astra (low) | 30,3 % | 3,9 k. „GPT‑6 Sol“ |
Claude Opus 5 (max) | 26,9 % | 11,1 k. „GPT‑6 Sol“ |
„Claude Fable 5.1“ su atsarginiu variantu „Opus 5 (max)“ | 31,4 % | >8,9 k. „GPT‑6 Sol“ (atsarginio modelio kaina nenurodyta) |
Sudėtingus agentų profesinius procesus vertinančiame teste Agents’ Last Exam „GPT‑6 Sol“, naudojantis maksimalų pastangų lygį, surenka 56,4 % – daugiau nei aukščiausias „Claude Opus 5“ rezultatas šiame vertinime, o vienos užduoties sąnaudos yra 60 % mažesnės.
Teste Agents’ Last Exam V1(atsidaro naujame lange) DI agentai vertinami pagal ilgai trunkančias, ekonominę vertę kuriančias užduotis iš 55 pošakių, apimančių daugumą pagrindinių kompiuteriu atliekamo profesinio darbo sričių.
Atsakymas naudingas tik tada, kai faktai yra teisingi, todėl ir toliau geriname faktinį patikimumą. Per mūsų vidinį faktinio tikslumo vertinimą, pagrįstą nuasmenintais realiais pokalbiais, kuriuose naudotojai pažymėjo mūsų modelių klaidas, „GPT‑6 Sol“ klysta maždaug perpus rečiau nei jo pirmtakas ir už gerokai mažesnę kainą priartėja prie „Astra“ patikimumo. „GPT‑6 Luna“ taip pat gerokai patobulėjo: naudodamas aukštesnį pastangų lygį jis prilygsta „GPT‑5.6 Sol“, tačiau kainuoja maždaug šimtą kartų mažiau.
Čia faktinį tikslumą vertiname pagal nuasmenintus „ChatGPT“ pokalbius, kuriuose naudotojai pažymėjo ankstesnio modelio faktinę klaidą. Šie klaidas išprovokavę pokalbiai neatspindi įprasto naudojimo, kai faktinės klaidos pasitaiko rečiau. Rezultatai nekoreguoti pagal atsakymo ilgį, tačiau skirtingo išsamumo bandymai parodė, kad atsakymo ilgis beveik neturi įtakos.
Šiemet programavimo agentai pradėjo spręsti dar sudėtingesnes, platesnės apimties ir ilgiau trunkančias užduotis. „OpenAI“ vidinis naudojimas augo eksponentiškai. Skaičiuojant pagal API kainas, tyrėjo medianinis kasdienis tokenų naudojimas viršijo 600 USD, o 90-ajame procentilyje esančių tyrėjų – 7 000 USD („Tyrimų spartinimas: žvilgsnis į „OpenAI“ vidų“). Programavimo agentams atliekant ilgesnes ir sudėtingesnes užduotis, ilgalaikio naudojimo sąnaudos tampa vis svarbesnės. „GPT‑6 Sol“ ir „Luna“ suderina puikius programavimo rezultatus su mažesnėmis API kainomis, todėl kūrėjai gali daugiau eksperimentuoti, o komandos – drąsiau patikėti „Codex“ ambicingesnes užduotis.
Teste FrontierCode, kuriame vertinama, ar programavimo agentų pakeitimai parengti sujungti su tikromis kodų bazėmis, „GPT‑6 Sol“ gerokai pranoksta „GPT‑5.6 Sol“ ir už daug mažesnę kainą prilygsta „Claude Fable 5.1 xhigh“.
Teste FrontierCode 1.1 Main(atsidaro naujame lange) DI agentai rašo kodą, kuris vertinamas ne tik pagal teisingumą, bet ir pagal tinkamumą sujungti, pavyzdžiui, testų kokybę, apimties drausmę, kodo stilių ir kodų bazės standartų laikymąsi.
Teste DeepSWE v1.1, kuriame tikrinama, kaip atliekamos sudėtingos programinės įrangos inžinerijos užduotys tikrose kodų bazėse, „GPT‑6 Sol“, naudojantis maksimalų pastangų lygį, surenka 68,8 % – vos 1,1 procentinio punkto mažiau už aukščiausią „Claude Fable 5“ rezultatą šiame vertinime (69,9 %, naudojant „xhigh“ lygį), o vienos užduoties sąnaudos yra maždaug 80 % mažesnės.
„GPT‑6 Luna“, naudojantis maksimalų pastangų lygį, surenka 66,6 % – panašiai kaip „Claude Opus 5“ ir „Fable 5“, naudojantys vidutinį lygį. Šiuose palyginimuose vienos „Luna“ užduoties sąnaudos yra 93 % mažesnės nei „Opus 5“ ir 96 % mažesnės nei „Fable 5“.
Teste DeepSWE 1.1(atsidaro naujame lange) DI agentai sprendžia originalias, ilgai trunkančias programinės įrangos inžinerijos užduotis.
Nors „GPT‑6 Astra“ tebėra geriausias pasaulyje naudojimosi kompiuteriu modelis, „GPT‑6 Sol“ ir „Luna“ veikia ekonomiškiau nei jų pirmtakai. Teste OSWorld 2.0 offline „GPT‑6 Sol“, naudojantis itin aukštą pastangų lygį „xhigh“, pasiekia panašų rezultatą kaip „Claude Opus 5“, naudojantis vidutinį lygį – atitinkamai 60,5 % ir 60,3 %, – o vienos užduoties sąnaudos yra maždaug 80 % mažesnės. „GPT‑6 Luna“ (pastangų lygis „max“) pranoksta „GPT‑5.6 Sol“, naudojantį vidutinį lygį, ir kainuoja dešimt kartų mažiau.
Teste OSWorld 2.0(atsidaro naujame lange) DI agentai mėgina atlikti ilgai trunkančius naudojimosi kompiuteriu procesus, apimančius kasdienes ir profesines užduotis. Pateikiame dalinį rezultatą, gautą naudojant 2026-08-08 versijos autonominį rinkinį.
Patobulintą „GPT‑6 Astra“ bendravimo stilių pritaikėme modeliams „Sol“ ir „Luna“. Manome, kad tai bus ypač pastebima techniniuose ir programavimo pokalbiuose. Atsakymai bus aiškesni, juose bus mažiau žargono, neįprastų formuluočių ir menkaverčių detalių. Apskritai jie bus šiek tiek trumpesni, tačiau nepraras esmės.
Nors stilius yra subjektyvus, čia mums labiau patinka „GPT‑6 Sol“ atsakymas. Jame ne taip greitai daromos išvados, mažiau kartojamos klausėjui tikriausiai akivaizdžios detalės (pvz., kad svetainę sudaro keturi puslapiai), vartojama mažiau neaiškių frazių (pvz., „bento įspūdis“, „pertvarkymas... pagal šią sistemą“), atviriau nurodoma, kas buvo ir nebuvo patikrinta, ir be reikalo neatskleidžiamos įgyvendinimo detalės, tokios kaip vaizdų įrankiui pateikta užklausa.
Be mažesnių žetonų kainų, padedame „GPT‑6“ naudojantiems kūrėjams daugiau sutaupyti pakartotinai naudojant programų kontekstą. Patobulinome podėlio naudojimą su užklausomis modeliui „GPT‑6“, kad pagal numatytąsias nuostatas dažniau būtų pataikoma į podėlį. Taip agentai gali pakartotinai naudoti daugiau konteksto, greičiau atsakyti ir pasinaudoti 90 % nuolaida podėlyje saugomiems įvesties tokenams nuskaityti.
Programuotojai taip pat turi daugiau būdų įvertinti ir optimizuoti podėlio naudojimo našumą.
Stebėkite ir diagnozuokite. Užklausų podėliavimo ataskaitų srityje(atsidaro naujame lange) rodoma, kokia įvesties dalis saugoma podėlyje ir kaip ji kinta laikui bėgant. Diagnostikos įrankis(atsidaro naujame lange) padeda suprasti, kodėl neišnaudojamos podėliavimo galimybės ir ką reikėtų ištaisyti.
Keiskite protavimo pastangų lygį ir įrankių pasiekiamumą nepažeisdami podėlio. Sudėtingesnėms užduotims padidinkite protavimo pastangų lygį(atsidaro naujame lange), o paprastesniems papildomiems klausimams jį sumažinkite. Keičiantis agento poreikiams, taip pat galite įjungti arba išjungti įrankius(atsidaro naujame lange). Abiem atvejais ankstesnis kontekstas dabar išsaugomas ir gali būti pakartotinai naudojamas iš podėlio.
Optimizuokite, kurie prefiksai saugomi podėlyje. Aiškiai nustatyti lūžio taškai leidžia kūrėjams pasirinkti, kur baigiasi podėlyje saugomi užklausų prefiksai. Taip kūrėjai gali geriau kontroliuoti pakartotinį podėlio naudojimą ir padidinti našumą.
„GitHub“ praneša, kad per pastaruosius kelis mėnesius šie patobulinimai daugiau nei 50 % sumažino iš naujo apdorojamų užklausų tokenų dalį per milijardus užklausų „OpenAI“ modeliams ir padėjo „Copilot“ atsakyti greičiau.
„GPT‑6 Sol“ ir „Luna“ remiasi tikslų atitikimo darbu, pradėtu kuriant „Astra“ – iki šiol mūsų geriausiai suderintą tikslų atitikimo atžvilgiu modelį. Per mūsų tikslų atitikimo vertinimus tiek „Sol“, tiek „Luna“ pranoko atitinkamus „GPT‑5.6“ modelius, įskaitant rečiau pateikiamus klaidinančius teiginius apie savo programavimo darbus.
Toliau pateikiamuose vertinimuose sąmoningai tikrinamos sudėtingos situacijos, todėl jų rezultatai neatspindi nesėkmių dažnio įprastai naudojant modelius. Visus rezultatus rasite sistemos kortelėje(atsidaro naujame lange).
Nuo šiandien „GPT‑6 Sol“ ir „GPT‑6 Luna“ pasiekiami „ChatGPT Work“ ir „Codex“ visiems „Plus“, „Pro“, „Business“, „Enterprise“ ir „Edu“ naudotojams. „Free“ ir „Go“ naudotojai gali naudotis „GPT‑6 Luna“ kompiuteriui skirtoje programos versijoje. Šie modeliai dar nepasiekiami „Chat“ režimu. „OpenAI“ API jie pasiekiami kaip gpt-6-sol ir gpt-6-luna.
Kad paslauga visiems veiktų stabiliai, planuojame šiuos modelius „ChatGPT“ diegti palaipsniui per visą dieną. Jei naujųjų modelių nematote „ChatGPT Work“ ar „Codex“, pabandykite dar kartą vėliau.
GPT vertinimai buvo atlikti mūsų tyrimų aplinkoje arba naudojant mūsų API. Dėl sisteminių užklausų, pasiekiamų įrankių ir kitų skirtumų rezultatai gali šiek tiek skirtis nuo galutinės „ChatGPT“ versijos rezultatų. Konkurentų modelių vertinimai paimti iš viešai prieinamų ataskaitų. Tais atvejais, kai „Claude Fable 5.1“ rezultatų nebuvo, pateikėme „Claude Fable 5“ rezultatus.


