Pāriet uz galveno saturu
OpenAI

GPT-6.1Sol

Astra līmenim tuvs intelekts par piektdaļu cenas — robežšķirtnes veiktspējai ilgtermiņā

Iepazīstinām ar GPT‑6.1 Sol — uzlabotu GPT‑6 Sol versiju ar izciliem rezultātiem autonomajā programmēšanā, kā arī datora lietošanā un profesionālajā darbā. Sarežģītos uzdevumos tas tuvina Sol modelim GPT‑6 Astra, bet ievades un izvades tekstvienību standarta cenas ir tikai piektdaļa no Astra cenām. Tas dod izstrādātājiem vairāk iespēju veidot un darbināt spējīgus aģentus tā paša budžeta ietvaros.

GPT‑6.1 Sol piedāvā Astra līmenim tuvu veiktspēju par Sol cenu, tādējādi nodrošinot labāko veiktspējas un izmaksu attiecību starp šobrīd pieejamajiem modeļiem. Kešotā ievade maksā tikai 0,10 $ par miljonu tekstvienību — par 95 % mazāk nekā standarta ievade. Tas samazina izmaksas aģentu uzdevumiem, kuros atkārtotos pieprasījumos nepieciešams izmantot to pašu kontekstu.

GPT‑6 Astra kopumā joprojām ir mūsu spējīgākais robežšķirtnes modelis. GPT‑6.1 Sol piedāvā jaunu spēju un izmaksu līdzsvaru gan svarīgiem darbiem, ko lietotāji vēlas veikt biežāk, gan API klientiem, kuri veido un darbina lietotnes lielā mērogā.

Trīs modeļu kartītes: GPT-6 Astra — mūsu intelektuāli spējīgākais modelis vislabākajiem rezultātiem; ievade 10 $, izvade 50 $, kešotā ievade 1 $. GPT-6.1 Sol — Astra līmenim tuvs intelekts par piektdaļu cenas; ievade 2 $, izvade 10 $, kešotā ievade 0,10 $. GPT-6 Luna — ātrs un efektīvs ikdienas darbs lielā mērogā; ievade 0,10 $, izvade 0,50 $, kešotā ievade 0,01 $.

Spējīgāks Sol dažādiem uzdevumiem

Salīdzinājumā ar GPT‑6 Sol modelis GPT‑6.1 Sol sniedz būtiskus uzlabojumus sarežģītā profesionālajā darbā — no koda rakstīšanas un atkļūdošanas līdz dokumentu izpratnei un vairāku soļu uzņēmējdarbības darbplūsmu izpildei. Vairākos no šiem novērtējumiem tas tuvojas GPT‑6 Astra veiktspējai ar ievērojami zemākām izmaksām.

Programmēšana

Testā DeepSWE v1.1, kas vērtē sarežģītus programmatūras izstrādes uzdevumus reālās koda bāzēs, GPT‑6.1 Sol sasniedz GPT‑6 Astra līmeni par aptuveni piektdaļu izmaksu. Vienlaikus tas pārspēj GPT‑6 Sol labāko rezultātu par 6,4 procentpunktiem ar zemāku spriestspējas intensitāti un mazākām izmaksām.

Etalontestā DeepSWE 1.1⁠⁠(atveras jaunā logā) MI aģenti risina oriģinālus un ilgstoši veicamus programmatūras izstrādes uzdevumus.

Profesionālais darbs

Testā GDP.pdf, kas mēra, cik precīzi modeļi atbild uz profesionāliem jautājumiem, izmantojot sarežģītus PDF dokumentus ar tabulām, grafikiem, diagrammām un sīkā drukā rakstītu informāciju, GPT‑6.1 Sol visos pārbaudītajos spriestspējas iestatījumos pārspēj Opus 5.5 ar rezerves modeļiem, izmaksām par uzdevumu nesasniedzot pat pusi. Tas arī tuvojas GPT‑6 Astra nozarē labākajam rezultātam par aptuveni piektdaļu izmaksu par uzdevumu.

Etalontestā GDP.pdf⁠(atveras jaunā logā) modeļiem jāatbild uz reālās darba situācijās balstītām uzvednēm par sarežģītiem PDF dokumentiem, kas izmantoti finanšu, veselības aprūpes, tiesību un vēl septiņu citu nozaru darba procesos.

Testā AutomationBench, kas mēra, vai aģenti pareizi izpilda vairāku soļu uzņēmējdarbības darbplūsmas, GPT‑6.1 Sol ar vidēju spriestspējas intensitāti pārspēj Opus 5.5 par 2,2 procentpunktiem, izmaksām sasniedzot aptuveni trešdaļu. Šis rezultāts arī par 4,8 procentpunktiem pārsniedz GPT‑6 Sol rezultātu ar to pašu iestatījumu.

In AutomationBench 1.0.6⁠⁠(atveras jaunā logā), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Datora lietošana

GPT‑6.1 Sol arī ievērojami uzlabo rezultātus uzdevumos, kuros nepieciešams darboties ar datora lietotnēm. OSWorld 2.0 bezsaistes kopā, kas vērtē aģentus sarežģītās datora lietošanas darbplūsmās, GPT‑6.1 Sol ar maksimālu spriestspējas intensitāti pārspēj GPT‑6 Sol par septiņiem procentpunktiem, izmaksām nesasniedzot pat pusi. Ar maksimālu spriestspējas intensitāti tas atpaliek no Astra rezultāta tikai par 2,1 procentpunktu, bet izmaksas par uzdevumu ir aptuveni septītdaļa.

In OSWorld 2.0⁠⁠(atveras jaunā logā), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Zinātniskā pētniecība

Testā Terminal-Bench Science 0.1, kas vērtē zinātniskās darbplūsmas, tostarp datu analīzi, simulāciju un teorēmu pierādīšanu, GPT‑6.1 Sol ar maksimālu spriestspējas intensitāti vairāk nekā divkāršo GPT‑6 Sol rezultātu, izmaksām par uzdevumu nesasniedzot pat pusi. Ar maksimālu spriestspējas intensitāti GPT‑6.1 Sol vidējās izmaksas ir 5,47 $ par uzdevumu, salīdzinot ar 23,21 $ modelim Opus 5.5 un 23,80 $ modelim Astra. Tas nodrošina ievērojamas zinātniskā darba spējas ar vairāk nekā par 75 % zemākām izmaksām nekā katram no abiem modeļiem.

GPT‑6 Astra joprojām sasniedz augstāko rezultātu starp pārbaudītajiem modeļiem — 68,1 % — un ir ieteicams vissarežģītākajiem zinātniskās pētniecības uzdevumiem.

Etalontestā Terminal-Bench Science 0.1⁠(atveras jaunā logā) aģenti veic zinātniskās pētniecības darbus, izmantojot kodu un termināļa rīkus, tostarp analizē datus, veic simulācijas un pielāgo modeļus.

Faktu precizitāte

GPT‑6.1 Sol arī uzlabo faktu precizitāti atbildēs uz sarežģītām uzvednēm. Ar īpaši augstu spriestspējas intensitāti tā faktu kļūdu īpatsvars ir 4,1 % — mazāk nekā GPT‑6 Sol 4,5 % un tuvāk Astra 4,0 % ar to pašu iestatījumu. Vienlaikus izmaksas par uzdevumu ir aptuveni par 83 % zemākas nekā Astra.

Šajā novērtējumā mēra to atbilžu īpatsvaru, kurās ir vismaz viena faktu kļūda, izmantojot sarunas, no kurām izņemti identificējošie dati un kurās lietotāji bija norādījuši uz agrāka modeļa kļūdu. Šīs apzināti sarežģītās uzvednes neatspoguļo tipisku lietojumu.

Faktu precizitāti vērtējam ChatGPT sarunās, no kurām izņemti identificējošie dati un kurās lietotāji bija norādījuši uz iepriekšēja modeļa faktu kļūdu. Šīs kļūdas izraisošās sarunas neatspoguļo tipisku lietojumu, kur faktu kļūdas ir retākas.

Droša GPT‑6.1 Sol ieviešana

Mūsu novērtējumos par atbilstību cilvēka nodomiem un ierobežojumiem GPT‑6.1 Sol uzrāda būtiskus uzlabojumus salīdzinājumā ar GPT‑6 Sol, tuvojoties GPT‑6 Astra līmenim.

GPT‑6.1 Sol atklātāk informē par saviem ierobežojumiem un uzticamāk ievēro lietotāja nodomu un drošības ierobežojumus. Sarežģītos novērtējumos tam ir zemāks kļūmju īpatsvars nekā GPT‑6 Sol, vērtējot atklātību par nedarbojošiem meklēšanas rīkiem, skaidri noteiktu ierobežojumu ievērošanu un izvairīšanos no neatļautiem iznākumiem aģentu uzdevumos. Mēs nenovērojām nevienu mēģinājumu apiet automatizētu drošības pārbaudes sistēmu — tāpat kā GPT‑6 Astra un GPT‑6 Sol gadījumā.

Tālāk minētajos novērtējumos apzināti pārbauda sarežģītas situācijas, nevis mēra kļūmju biežumu tipiskā lietojumā.

Cenas un pieejamība

No šodienas GPT‑6.1 Sol ir pieejams visiem Plus, Pro, Business, Enterprise un Edu lietotājiem režīmā ChatGPT Work un produktā Codex. Šie modeļi vēl nav pieejami režīmā Chat. Izstrādātāji tam var piekļūt arī ar OpenAI API starpniecību kā gpt-6.1-sol. Tā standarta API cenas ir 2 $ par miljonu ievades tekstvienību, 0,10 $ par miljonu kešotās ievades tekstvienību un 10 $ par miljonu izvades tekstvienību.

Vienlaikus laižam klajā GPT‑6 Astra Ultrafast — pasaulē ātrāko robežšķirtnes modeli, kas ir līdz pat 8 reizēm ātrāks par GPT‑6 Astra, — kā arī GPT‑6.1 Sol Ultrafast. Tie ir pieejami API, kā arī režīmā ChatGPT Work un produktā Codex lietotājiem ar mūsu jauno Pro līmeni, kas piedāvā visaugstākos lietojuma limitus par 500 $ mēnesī. Ar GPT‑6.1 Sol Ultrafast izstrādātāji var iegūt Astra līmenim tuvu intelektu ar līdz pat 8 reizēm lielāku ātrumu, tērējot API lietojumam aptuveni tikpat, cik iepriekš par GPT‑6 Astra.

Autors

OpenAI

GPT novērtēšana veikta mūsu pētniecības vidē vai ar mūsu API starpniecību. Rezultāti var nedaudz atšķirties no lietotājiem pieejamās ChatGPT versijas, jo atšķiras sistēmas uzvednes, pieejamie rīki, spriestspējas intensitāte u. c. Konkurentu modeļu novērtējumi ņemti no publiski pieejamiem ziņojumiem.