Pereiti prie pagrindinio turinio
OpenAI

GPT-6.1Sol

Beveik „Astra“ lygio intelektas už penktadalį kainos – nuolatiniam darbui su priešakinėmis galimybėmis

Pristatome GPT‑6.1 Sol – patobulintą GPT‑6 Sol versiją, pasižyminčią itin gerais agentinio programavimo, naudojimosi kompiuteriu ir profesinių užduočių atlikimo rezultatais. Atliekant sudėtingas užduotis, šis modelis priartina „Sol“ prie GPT‑6 Astra, o jo įvesties ir išvesties žetonai kainuoja penktadalį standartinės „Astra“ kainos. Taigi kūrėjai turi daugiau galimybių kurti ir naudoti pajėgius agentus su tuo pačiu biudžetu.

GPT‑6.1 Sol siūlo beveik „Astra“ lygio rezultatus už „Sol“ kainą, todėl šiandien tai modelis, pasižymintis geriausiu kainos ir rezultatų santykiu. Podėlyje saugoma įvestis kainuoja vos 0,10 USD už milijoną žetonų – 95 % mažiau nei standartinė įvestis. Tai sumažina agentų užduočių, kurioms reikia pakartotinai naudoti kontekstą keliose užklausose, išlaidas.

GPT‑6 Astra išlieka apskritai pajėgiausiu mūsų priešakiniu modeliu. GPT‑6.1 Sol siūlo naują galimybių ir kainos santykį naudotojams, norintiems dažniau atlikti svarbius darbus, bei API klientams, kuriantiems ir naudojantiems programas dideliu mastu.

Trys modelių kortelės: GPT-6 Astra – intelektualiausias mūsų modelis geriausiems rezultatams pasiekti, įvestis – 10 USD, išvestis – 50 USD, podėlyje saugoma įvestis – 1 USD; GPT-6.1 Sol – beveik „Astra“ lygio intelektas už penktadalį kainos, įvestis – 2 USD, išvestis – 10 USD, podėlyje saugoma įvestis – 0,10 USD; GPT-6 Luna – greitas ir efektyvus kasdienis darbas dideliu mastu, įvestis – 0,10 USD, išvestis – 0,50 USD, podėlyje saugoma įvestis – 0,01 USD.

Pajėgesnis „Sol“ įvairioms užduotims

GPT‑6.1 Sol gerokai lenkia GPT‑6 Sol atliekant sudėtingas profesines užduotis – nuo kodo rašymo ir klaidų taisymo iki dokumentų supratimo ir daugiapakopių verslo procesų vykdymo. Keliuose iš šių vertinimų jis priartėja prie GPT‑6 Astra rezultatų už gerokai mažesnę kainą.

Programavimas

Atliekant DeepSWE v1.1 testą, kuriuo vertinamos sudėtingos programinės įrangos inžinerijos užduotys realiose kodo bazėse, GPT‑6.1 Sol prilygsta GPT‑6 Astra už maždaug penktadalį kainos. Be to, naudodamas mažiau protavimo pastangų ir kainuodamas pigiau, jis 6,4 procentinio punkto pranoksta geriausią GPT‑6 Sol rezultatą.

Atliekant DeepSWE 1.1⁠⁠(atsidaro naujame lange) testą, DI agentai sprendžia originalias, daug žingsnių reikalaujančias programinės įrangos inžinerijos užduotis.

Profesinės užduotys

GDP.pdf testu matuojama, kaip tiksliai modeliai atsako į profesinius klausimus remdamiesi sudėtingais PDF dokumentais, įskaitant lenteles, grafikus, diagramas ir smulkiu šriftu pateiktą informaciją. Su visomis išbandytomis protavimo nuostatomis GPT‑6.1 Sol pasiekia geresnių rezultatų nei Opus 5.5 su atsarginiais modeliais, o užduoties kaina nesiekia pusės jo kainos. Jis taip pat priartėja prie geriausių šiuo metu GPT‑6 Astra rezultatų už maždaug penktadalį užduoties kainos.

Atliekant GDP.pdf⁠(atsidaro naujame lange) testą, modeliai turi atsakyti į realias užklausas apie sudėtingus PDF dokumentus, naudojamus finansų, sveikatos priežiūros, teisės ir dar septynių profesinių sričių darbo procesuose.

Atliekant AutomationBench testą, kuriuo matuojama, ar agentai tinkamai įvykdo daugiapakopius verslo procesus, GPT‑6.1 Sol su vidutinėmis protavimo pastangomis 2,2 procentinio punkto lenkia Opus 5.5 ir kainuoja maždaug trečdalį jo kainos. Šis rezultatas taip pat 4,8 procentinio punkto viršija GPT‑6 Sol rezultatą su ta pačia nuostata.

In AutomationBench 1.0.6⁠⁠(atsidaro naujame lange), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Naudojimasis kompiuteriu

GPT‑6.1 Sol taip pat gerokai patobulėjo atlikdamas užduotis, kurioms reikia sąveikauti su kompiuterio programomis. Atliekant OSWorld 2.0 neprisijungus naudojamo rinkinio testus, kuriais vertinamas agentų darbas su sudėtingais naudojimosi kompiuteriu procesais, GPT‑6.1 Sol su maksimaliomis protavimo pastangomis septyniais procentiniais punktais lenkia GPT‑6 Sol, o kainuoja mažiau nei pusę jo kainos. Su maksimaliomis protavimo pastangomis jis nuo „Astra“ rezultato atsilieka vos 2,1 procentinio punkto, o užduotis kainuoja maždaug septintadalį kainos.

In OSWorld 2.0⁠⁠(atsidaro naujame lange), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Moksliniai tyrimai

Atliekant Terminal-Bench Science 0.1 testą, kuriuo vertinami mokslinio darbo procesai, įskaitant duomenų analizę, modeliavimą ir teoremų įrodymą, GPT‑6.1 Sol su maksimaliomis protavimo pastangomis daugiau nei dvigubai pranoksta GPT‑6 Sol rezultatą, o užduotis kainuoja mažiau nei pusę jo kainos. Su maksimaliomis pastangomis GPT‑6.1 Sol užduotis vidutiniškai kainuoja 5,47 USD, palyginti su 23,21 USD naudojant Opus 5.5 ir 23,80 USD naudojant „Astra“. Taigi jis siūlo plačias mokslinio darbo galimybes už daugiau nei 75 % mažesnę kainą nei bet kuris iš šių modelių.

GPT‑6 Astra vis dar pasiekia aukščiausią rezultatą tarp išbandytų modelių – 68,1 % – ir turėtų būti naudojamas sunkiausioms mokslinių tyrimų užduotims.

Atliekant Terminal-Bench Science 0.1⁠(atsidaro naujame lange) testą, agentai vykdo mokslinių tyrimų darbo procesus naudodami kodą ir terminalo įrankius: analizuoja duomenis, vykdo simuliacijas ir pritaiko modelius duomenims.

Faktinis tikslumas

GPT‑6.1 Sol taip pat tiksliau pateikia faktus atsakydamas į sudėtingas užklausas. Su itin didelėmis protavimo pastangomis jo faktinių klaidų dažnis siekia 4,1 %, palyginti su 4,5 % naudojant GPT‑6 Sol, ir priartėja prie „Astra“ 4,0 % su ta pačia nuostata. Kartu užduotis kainuoja maždaug 83 % mažiau nei naudojant „Astra“.

Šiuo vertinimu matuojama atsakymų su bent viena faktine klaida dalis pokalbiuose, iš kurių pašalinti tapatybę atskleidžiantys duomenys ir kuriuose naudotojai pažymėjo ankstesnio modelio klaidą. Šios tikslingai parinktos sudėtingos užklausos neatspindi įprasto naudojimo.

Faktinį tikslumą vertiname pagal ChatGPT pokalbius, iš kurių pašalinti tapatybę atskleidžiantys duomenys ir kuriuose naudotojai pažymėjo ankstesnio modelio faktinę klaidą. Šie klaidas išprovokuojantys pokalbiai neatspindi įprasto naudojimo, kai faktinių klaidų pasitaiko rečiau.

Saugus GPT‑6.1 Sol diegimas

Mūsų vertinimuose, kuriais tikrinama atitiktis naudotojų ketinimams ir saugos reikalavimams, GPT‑6.1 Sol gerokai lenkia GPT‑6 Sol ir priartėja prie GPT‑6 Astra.

GPT‑6.1 Sol atviriau praneša apie savo ribotumus ir patikimiau paiso naudotojo ketinimų bei saugos apribojimų. Sudėtinguose vertinimuose jis rečiau nei GPT‑6 Sol nepraneša apie neveikiančius paieškos įrankius, pažeidžia aiškius apribojimus ar pasiekia neleistinų rezultatų atlikdamas agentų užduotis. Neužfiksavome nė vieno bandymo apeiti automatinį saugos tikrintuvą, kaip ir naudojant GPT‑6 Astra bei GPT‑6 Sol.

Toliau pateikti vertinimai tikslingai tikrina sudėtingas situacijas ir nematuoja nesėkmių dažnio įprastai naudojant modelį.

Kainos ir prieinamumas

Nuo šiandien GPT‑6.1 Sol prieinamas visiems „Plus“, „Pro“, „Business“, „Enterprise“ ir „Edu“ naudotojams per ChatGPT Work ir Codex. Šie modeliai dar neprieinami režimu Chat. Kūrėjai taip pat gali jį pasiekti per OpenAI API kaip gpt-6.1-sol. Standartinės jo API kainos: 2 USD už milijoną įvesties žetonų, 0,10 USD už milijoną podėlyje saugomos įvesties žetonų ir 10 USD už milijoną išvesties žetonų.

Kartu pristatome GPT‑6 Astra Ultrafast – greičiausią pasaulyje priešakinį modelį, veikiantį iki 8 kartų greičiau nei GPT‑6 Astra, – taip pat GPT‑6.1 Sol Ultrafast. Jie prieinami per API, o mūsų naujos „Pro“ pakopos, suteikiančios didžiausius naudojimo limitus už 500 USD per mėnesį, naudotojams – ir per ChatGPT Work bei Codex. Naudodami GPT‑6.1 Sol Ultrafast, kūrėjai gali gauti beveik „Astra“ lygio intelektą ir iki 8 kartų didesnę spartą už maždaug tiek pat, kiek anksčiau išleisdavo GPT‑6 Astra API.

Autorius

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.