Jäta vahele ja mine põhisisu juurde
OpenAI

GPT-6.1Sol

Astrale lähedane nutikus viiendiku hinnaga, et jõudlus püsiks tipptasemel

Tutvustame mudelit GPT‑6.1 Sol – GPT‑6 Soli uuendust, mis paistab silma erakordselt heade tulemustega agentses kodeerimises, arvutikasutuses ja erialatöös. See toob Soli nõudlikes ülesannetes GPT‑6 Astrale lähemale, makstes vaid viiendiku Astra tavapärasest sisend- ja väljundtokenite hinnast. Nii saavad arendajad sama eelarvega võimekaid agente rohkem luua ja käitada.

GPT‑6.1 Sol pakub Astrale lähedast jõudlust Soli hinnaga, olles praegu saadaolevatest mudelitest parima hinna ja jõudluse suhtega. Vahemällu salvestatud sisend maksab vaid 0,10 $ miljoni tokeni kohta – 95% vähem kui tavasisend. See muudab soodsamaks agentide töö, kus sama konteksti tuleb korduvates päringutes uuesti kasutada.

GPT‑6 Astra on endiselt meie kõige võimekam tipptasemel mudel tervikuna. GPT‑6.1 Sol pakub uut võimekuse ja hinna tasakaalu nii kasutajatele, kes soovivad olulisi töid sagedamini teha, kui ka API klientidele, kes loovad ja käitavad rakendusi suures mahus.

Kolm mudelikaarti: GPT-6 Astra, meie kõige nutikam mudel parimate tulemuste saavutamiseks: sisend 10 $, väljund 50 $ ja vahemällu salvestatud sisend 1 $; GPT-6.1 Sol, Astrale lähedane nutikus viiendiku hinnaga: sisend 2 $, väljund 10 $ ja vahemällu salvestatud sisend 0,10 $; GPT-6 Luna, kiire ja tõhus igapäevatöö suures mahus: sisend 0,10 $, väljund 0,50 $ ja vahemällu salvestatud sisend 0,01 $.

Võimekam Sol eri ülesannetes

GPT‑6.1 Sol on GPT‑6 Solist oluliselt parem keerukas erialatöös, alates koodi kirjutamisest ja silumisest kuni dokumentide mõistmise ja mitmeetapiliste äritöövoogude täitmiseni. Mitmes neist hindamistest läheneb see GPT‑6 Astra tulemustele märksa väiksema kuluga.

Kodeerimine

Võrdlustestis DeepSWE v1.1, mis hindab keerukaid tarkvaraarendusülesandeid tegelikes koodibaasides, saavutab GPT‑6.1 Sol GPT‑6 Astraga võrdse tulemuse ligikaudu viiendiku kuluga. Seejuures ületab see GPT‑6 Soli parimat tulemust 6,4 protsendipunktiga, kasutades väiksemat arutluspõhjalikkust ja väiksema kuluga.

Võrdlustestis DeepSWE 1.1⁠⁠(avaneb uues aknas) lahendavad tehisintellektiagendid uudseid tarkvaraarendusülesandeid, mis nõuavad pikaajalist tööd.

Erialatöö

Võrdlustest GDP.pdf mõõdab, kui täpselt vastavad mudelid erialaküsimustele keerukate PDF-dokumentide põhjal, mis sisaldavad tabeleid, graafikuid, diagramme ja peenes kirjas üksikasju. Testitud arutlusseadistustes saavutab GPT‑6.1 Sol parema tulemuse kui varumudelitega Opus 5.5, kusjuures kulu ülesande kohta on vähem kui pool Opus 5.5 kulust. Samuti läheneb see GPT‑6 Astra tipptulemusele ligikaudu viiendikuga kulust ülesande kohta.

Võrdlustestis GDP.pdf⁠(avaneb uues aknas) peavad mudelid vastama tegelikust tööelust pärit päringutele, mis puudutavad rahanduse, tervishoiu, õiguse ja veel seitsme erialavaldkonna töövoogudes kasutatavaid keerukaid PDF-dokumente.

Võrdlustestis AutomationBench, mis mõõdab, kas agendid täidavad mitmeetapilisi äritöövooge õigesti, ületab GPT‑6.1 Sol keskmise arutluspõhjalikkuse juures Opus 5.5 tulemust 2,2 protsendipunktiga, ligikaudu kolmandiku kuluga. See tulemus on ka 4,8 protsendipunkti parem kui GPT‑6 Solil sama seadistuse juures.

In AutomationBench 1.0.6⁠⁠(avaneb uues aknas), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Arvutikasutus

GPT‑6.1 Sol teeb suure edusammu ka ülesannetes, mis nõuavad arvutirakenduste kasutamist. Võrdlustesti OSWorld 2.0 võrguühenduseta testikomplektis, mis hindab agente nõudlikes arvutikasutuse töövoogudes, ületab GPT‑6.1 Sol maksimaalse arutluspõhjalikkuse juures GPT‑6 Soli tulemust seitsme protsendipunktiga, kulutades alla poole selle maksumusest. Maksimaalse arutluspõhjalikkuse juures jääb see Astra tulemusest vaid 2,1 protsendipunkti kaugusele, kuluga ülesande kohta ligikaudu seitsmendik Astra omast.

In OSWorld 2.0⁠⁠(avaneb uues aknas), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Teadusuuringud

Võrdlustest Terminal-Bench Science 0.1 hindab teadustöö vooge, sealhulgas andmeanalüüsi, simulatsioone ja teoreemide tõestamist. Maksimaalse arutluspõhjalikkuse juures saavutab GPT‑6.1 Sol GPT‑6 Solist enam kui kaks korda parema tulemuse, kulutades ülesande kohta alla poole selle maksumusest. Maksimaalse arutluspõhjalikkuse juures maksab GPT‑6.1 Sol keskmiselt 5,47 $ ülesande kohta, võrreldes 23,21 dollariga Opus 5.5 ja 23,80 dollariga Astra puhul. Nii pakub see suurt võimekust teadustööks üle 75% väiksema kuluga kui kumbki neist mudelitest.

GPT‑6 Astra saavutab testitud mudelitest endiselt parima tulemuse, 68,1%, ning seda tuleks kasutada kõige keerukamate teadusülesannete jaoks.

Võrdlustestis Terminal-Bench Science 0.1⁠(avaneb uues aknas) viivad agendid koodi ja terminalitööriistade abil läbi teadustöö töövooge, sealhulgas analüüsivad andmeid, käivitavad simulatsioone ja sobitavad mudeleid.

Faktitäpsus

GPT‑6.1 Sol parandab ka faktitäpsust keeruliste viipade korral. Eriti suure arutluspõhjalikkuse juures on selle faktivigade määr 4,1%, võrreldes GPT‑6 Soli 4,5%-ga. See on lähemal Astra 4,0%-le sama seadistuse juures, samal ajal kui kulu ülesande kohta on Astrast ligikaudu 83% väiksem.

See hindamine mõõdab vähemalt üht faktiviga sisaldavate vastuste osakaalu isikut tuvastada võimaldavate andmeteta vestlustes, kus kasutajad olid märkinud varasema mudeli vea. Need teadlikult keerulised viibad ei esinda tavakasutust.

Hindame faktitäpsust isikut tuvastada võimaldavate andmeteta ChatGPT vestlustes, kus kasutajad olid märkinud varasema mudeli tehtud faktivea. Need vigu esile kutsuvad vestlused ei esinda tavakasutust, kus faktivigu esineb harvem.

GPT‑6.1 Soli ohutu kasutuselevõtt

Meie hindamistes, mis mõõdavad kooskõla inimeste eesmärkide ja väärtustega, on GPT‑6.1 Sol GPT‑6 Solist oluliselt parem ning läheneb GPT‑6 Astrale.

GPT‑6.1 Sol on oma piirangute suhtes avatum ning järgib usaldusväärsemalt kasutaja kavatsusi ja ohutuspiiranguid. Keerulistes hindamistes eksib see GPT‑6 Solist harvem mittetoimivatest otsingutööriistadest teatamisel, selgesõnaliste piirangute järgimisel ning volitamata tulemuste vältimisel agentsetes ülesannetes. Me ei täheldanud ühtegi katset automaatsest ohutuskontrollist mööda hiilida, nagu ka GPT‑6 Astra ja GPT‑6 Soli puhul.

Allolevad hindamised testivad teadlikult keerulisi olukordi ega mõõda ebaõnnestumiste määra tavakasutuses.

Hinnad ja saadavus

GPT‑6.1 Sol on alates tänasest ChatGPT Workis ja Codexis saadaval kõigile Plus-, Pro-, Business-, Enterprise- ja Edu-paketi kasutajatele. Need mudelid pole veel režiimis Chat saadaval. Arendajad pääsevad sellele ligi ka OpenAI API kaudu nimega gpt-6.1-sol. Selle tavapärased API hinnad on 2 $ miljoni sisendtokeni, 0,10 $ miljoni vahemällu salvestatud sisendtokeni ja 10 $ miljoni väljundtokeni kohta.

Ühtlasi toome turule mudeli GPT‑6 Astra Ultrafast, mis on maailma kiireim tipptasemel mudel ja GPT‑6 Astrast kuni 8 korda kiirem, ning mudeli GPT‑6.1 Sol Ultrafast. Need on saadaval API kaudu ning ChatGPT Workis ja Codexis meie uue, suurima kasutusmahuga Pro-paketi kasutajatele hinnaga 500 $ kuus. GPT‑6.1 Sol Ultrafast pakub arendajatele Astrale lähedast nutikust kuni 8-kordse kiirusega ligikaudu sama API-kulu eest kui varem GPT‑6 Astra.

Autor

OpenAI

GPT hindamised tehti meie uurimiskeskkonnas või API kaudu. Süsteemiviipade, saadaolevate tööriistade, arutluspõhjalikkuse jms erinevuste tõttu võib väljund veidi erineda kasutajatele kättesaadava ChatGPT väljundist. Konkureerivate mudelite hindamistulemused pärinevad avalikest aruannetest.