OpenAI

GPT-6 Astra: A new generation of intelligence

Jauna intelekta paaudze

Atjauninājums 2026. gada 22. septembrī: Mēs paplašinām GPT‑6 saimi ar GPT‑6 Sol un GPT‑6 Luna. Uzzināt vairāk.

Mēs iepazīstinām ar GPT‑6 Astra – pasaulē viedāko un vislabāk saskaņoto modeli.

GPT‑6 Astra apvieno gadiem ilgu pētniecību un vērienīgus ieguldījumus pirmsapmācībā, stimulētā mācīšanās un saskaņošanā. Astra ir vismodernākais modelis datora lietošanas, tīmekļa pārlūkošanas, programmatūras inženierijas, kiberdrošības, zinātnes un profesionālā darba jomā. Astra sasniedz FrontierMath Tier 4 piesātinājumu ar 98 % rezultātu, jau iepriekš palīdzot atrisināt ilgstoši neatrisinātas problēmas⁠ matemātikā. Astra sasniedz arī ARC-AGI-3 piesātinājumu ar 99,9 % rezultātu un ExploitBench piesātinājumu ar 100 % rezultātu. Tas arī nosaka jaunu robežšķirtni datora un pārlūkprogrammas lietošanā, ar nepārspējamu ātrumu, precizitāti un spriestspēju paveicot visprasīgākos profesionālos darbus. 

GPT‑6 Astra šodien tiek ieviests ierobežotam organizāciju lokam, un tuvāko dienu laikā tas būs pieejams visiem ChatGPT Plus, Pro, Business un Enterprise lietotājiem, kā arī, izmantojot OpenAI API, Microsoft Azure un AWS Bedrock.

“ARC-AGI-3 etalonā Astra 96 % līmeņu pārspēja mūsu cilvēka darbību efektivitātes atskaites līmeni, faktiski sasniedzot cilvēka līmeņa sniegumu šajā etalonā. Šis ir ne tikai labākais modelis, ko jebkad esam testējuši, bet tas arī būtiski paaugstina robežšķirtnes modeļu veiktspēju — ne tikai spējā orientēties jaunās vidēs un risināt tajās uzdevumus, bet arī efektivitātē, ar kādu tas to apgūst.”
Greg Kamradt, ARC Prize Foundation

Astra ir mūsu vislabāk saskaņotais modelis, kuram ir būtiski uzlabota izpratne par lietotāja nodomu un modeļa uzvedību – vari ar lielāku pārliecību uzticēt modelim Astra uzdevumus, paļaujoties uz tā spriedumu. Lai to pārbaudītu, izstrādājām jaunu novērtējumu, kas balstīts uz Hugging Face incidentā gūtajām atziņām un izvērtē, vai modelis, saskaroties ar sarežģītu vai neiespējamu uzdevumu, pārsniegs paredzētās darbības robežas. Salīdzinājumā ar GPT‑5.6 Sol, kas bez ražošanas vides aizsardzības pasākumiem 48 % gadījumu pārsniedza atļauto mērķi, GPT‑6 Astra to nedarīja nevienā gadījumā.

Pasaulē labākais datora lietošanas modelis

GPT‑6 Astra nosaka jaunu standartu datora lietošanas ātruma, precizitātes un drošības ziņā. Tas var paveikt nogurdinošus uzdevumus, piemēram, aizpildīt tiešsaistes veidlapas, atjaunināt klientu ierakstus CRM sistēmā un sakārtot tavu kalendāru. Tas var veikt izpēti tiešsaistē un sagatavot kopsavilkumus tavā e-pastā vai dokumentu redaktorā. Tas var analizēt zinātniskos datus, ģenerēt grafikus, izveidot tīmekļa vietni un veikt priekšgala kvalitātes nodrošināšanas (QA) pārbaudes, lai pārliecinātos, ka visas šīs vietnes funkcijas darbojas. Tas var tev palīdzēt autonomi instalēt un testēt programmatūru, kā arī novērst ekrānā redzamās problēmas. Šie uzlabojumi atspoguļojas arī mūsu visaugstākā līmeņa novērtējumu rezultātos.

Šie uzlabojumi arī nodrošina ievērojamu efektivitātes pieaugumu reālos zināšanu darba uzdevumos. OSWorld 2.0 aizkaves simulācijās Astra nodrošina augstāku datora lietošanas veiktspēju, vienu uzdevumu izpildot aptuveni par 47 % īsākā laikā nekā GPT‑5.6 Sol, sasniedzot 72,6 % rezultātu aptuveni 40 minūtēs, salīdzinājumā ar 65,7 % rezultātu aptuveni 75 minūtēs.3

GPT‑6 Astra datora lietošanas iespējas ir redzamas rezultātos dažādās jomās, tostarp spēļu izstrādē, elektrotehnikā un ikdienas zināšanu darbā:

Līdztekus modelim Astra mēs atjauninām arī Codex izpildes ietvaru, lai ievērojami uzlabotu datora lietošanas ātrumu. Apvienojumā ar modeļa Astra efektivitāti tas Mind2Web etalontestā ļauj izpildīt uzdevumus 1,9 reizes ātrāk nekā ar pašreizējo GPT‑5.6 Sol. Modeļa ātruma uzlabojumi nozīmē, ka tas tavā vietā var paveikt daudzus laikietilpīgus ikdienas uzdevumus ātrāk, nekā tu pats tos spētu paveikt.4

“Palaišanas dienā mēs integrējam GPT‑6 Astra Devina izpildes ietvarā, kur tas mūsu iekšējā testēšanas etalonā nodrošina līdz šim labāko veiktspēju. Tā izcilās prasmes darbā ar datoru, rakstīšanā un kodbāzes izpratnē uzlaboja testēšanu jau bez papildu pielāgošanas: videoklipiem ir ievērojami vieglāk sekot līdzi, un pārskati ir skaidrāki un kodolīgāki”
Zīlass Alberti, pētniecības vecākais viceprezidents, Cognition

Būtiskas pārmaiņas profesionālajā darbā

GPT‑6 Astra apvieno sasniegumus datora lietošanā ar mērķtiecīgu apmācību profesionālai videi, lai palīdzētu risināt sarežģītus darba uzdevumus. Tas apvieno sarežģītu problēmu risināšanai nepieciešamo domāšanas līmeni ar spēju īstenot daudzpakāpju darbplūsmas un izveidot kvalitatīvi noformētus dokumentus, izklājlapas un prezentācijas.

GPT‑6 Astra ir mūsu labākais modelis esošo veidņu ievērošanai un tādu slaidu veidošanai, kuriem ir pārdomāts izkārtojums un kuros galvenie punkti ir kodolīgi izklāstīti strukturētā vēstījumā. Tas veido skaidrus, labi strukturētus dokumentus, prezentācijas, izklājlapas un analīzes, kas atbilst tavām veidnēm, tavam rakstības stilam un vizuālajam noformējumam. Modelis Astra ir arī apmācīts izvadē iekļaut tikai būtisko kontekstu, nevis atkārtot informāciju, kas nav nepieciešama konkrētā uzdevuma veikšanai. Tas viss nozīmē, ka tas var ģenerēt uzreiz lietojamākus artefaktus, kas atbilst tavam biznesa kontekstam un taviem standartiem.

GPT‑6 Astra, veidojot tīmekļa vietnes, spēles, lietojumprogrammas un renderējumus, arī spēj tos labāk vizuāli izvērtēt. Izmantojot Vietnes⁠(atveras jaunā logā) pakalpojumā ChatGPT, Astra var izveidot, mitināt un kopīgot tīmekļa vietnes, tīmekļa lietotnes un spēles tieši no uzvednes.

“Astra sniedz mums būtisku priekšrocību gan spēju, gan efektivitātes ziņā. Tas veiksmīgi īsteno mūsu sarežģītākās radošās darbplūsmas, vienlaikus izmantojot līdz pat 20% mazāk tekstvienību nekā citi mūsu pārbaudītie modeļi. Vissvarīgākais ir tas, ka mūsu klientiem tas nozīmē augstākas kvalitātes rezultātus.”
Alekss Mašrabovs, Higgsfield AI izpilddirektors un līdzdibinātājs

Ja norādījumi pieļauj dažādu interpretāciju, GPT‑6 Astra spēj pieņemt pareizo lēmumu labāk nekā iepriekšējie modeļi. Tas izmanto kontekstu, lai aizpildītu ikdienišķas nepilnības, un uzdod mērķtiecīgus jautājumus, ja atbilde varētu mainīt rezultātu. Programmā Codex tas var asinhroni uzdot jautājumus, vienlaikus turpinot darbu, kas nav atkarīgs no tavas atbildes. Ja neatbildi, tas attiecīgos gadījumos turpina darbu, balstoties uz pamatotiem pieņēmumiem, taču pirms lēmumiem ar būtiskām sekām gaida tavus norādījumus.

Tālāk sniegtie piemēri parāda, kā Astra sadarbojas ikdienas uzdevumos, kuros trūkstoša informācija var būtiski mainīt atbildi.

Astra arī labāk spēj saglabāt orientāciju, uzdevumam attīstoties. Agrāki modeļi dažkārt uztvēra papildu norādījumus kā jaunu mērķi, zaudējot no redzesloka sākotnējo pieprasījumu vai iepriekšējos ierobežojumus. Astra ņem vērā jaunas prasības, pēc lūguma maina virzienu un atbild uz papildu jautājumiem, vienlaikus saglabājot plašākā uzdevuma virzību.

“Astra ir būtisks kvalitātes uzlabojums salīdzinājumā ar GPT‑5.6 Sol sarežģītos juridiskos uzdevumos. Sākotnējās testēšanas laikā Astra izcēlās, pieejot juridiskajam darbam tā, kā to darītu vērīgs jurists: tas nošķir dokumentus no nostiprinātiem ierakstiem, atklāj nepamatotus pieņēmumus un nepilnības pārvērš konkrētos dokumentu sagatavošanas risinājumos.”
Niko Grupen, praktiskās pētniecības vadītājs, Harvey

Programmēšana

GPT‑6 Astra līdz šim ir labākais modelis programmatūras inženierijai.

1 no 2
“GPT‑6 Astra nodrošina līdz šim labāko veiktspēju mūsu iekšējos programmēšanas etalonos un, salīdzinot ar GPT‑5.6 Sol, uzrāda skaidru progresu tirdzniecības intuīcijas novērtējumos. Kad GPT‑6 Astra tiek izmantots autonomai programmēšanai, tas sazinās izstrādātājiem vieglāk uztveramā veidā un ģenerē kodu, kam nepieciešams mazāk iterāciju, lai sasniegtu produkcijas kvalitāti.”
Džons Krepeci, MI asistenti, Jane Street

Ar Astra mēs ieviešam jaunu veidu, kā Codex var saglabāt un izgūt kontekstu, kad konteksta logs ir pilns. Vēsturiski modeļi ir izmantojuši konteksta saspiešanu, lai apkopotu darbu ilgās sesijās, piemēram, atkļūdojot sarežģītas problēmas vai veicot plašus refaktorēšanas darbus. Katra konteksta saspiešana var izlaist detaļas par to, kāpēc labojums neizdevās vai kā darbojas komponents. Codex sistēmā Astra var glabāt piezīmes vairākos konteksta logos, saglabājot uzkrāto detalizēto informāciju, to atkārtoti nesaspiežot vienā kopsavilkumā. Agrākie konteksta logi joprojām ir meklējami, tāpēc Astra var atrast prasības vai testu rezultātus no iepriekšējiem ziņojumiem un rīku izvades – pat ja šī informācija netika iekļauta tā piezīmēs. Tu vari iespējot šo eksperimentālo funkciju savā Codex config.toml,⁠(atveras jaunā logā) un tuvāko nedēļu laikā tā kļūs par Astra noklusējuma iestatījumu.

Zinātnisko atklājumu veicināšana

“Stāsts ir šāds: viena laikmeta beigas, cita sākums.”
Gregs Bērnems, EpochAI

GPT‑6 Astra ir būtisks sasniegums zinātnisko atklājumu veikšanā, matemātikā un veselības jomā. Šodien mēs dalāmies ar vēl diviem rezultātiem par atstarpēm starp pirmskaitļiem.9 un 10

Astra arī uzstāda jaunus rekordus virknē matemātikas un zinātnes novērtējumu.

Astra var palīdzēt praktiskajā darbā, kas ir zinātnisko atklājumu pamatā. Apvienojot zinātnisko spriestspēju ar datora lietošanu, modelis var tieši darboties specializētā programmatūrā, lai pārbaudītu datus un izpētītu rezultātus, palīdzot pētniekiem izvērtēt pierādījumus un izlemt, ko pētīt tālāk.

Kiberdrošība

Kā apspriedām mūsu ziņojumā par drošību⁠, Astra ir nozīmīgs lēciens kiberspējās un sasniedz kritisko slieksni kiberdrošībā saskaņā ar mūsu Sagatavotības satvaru. Modeļa Astra spēja identificēt un izstrādāt nulles dienas ievainojamību izmantošanas paņēmienus var palīdzēt aizsardzības speciālistiem atrast un novērst vājās vietas, taču tā arī rada nepieciešamību pēc stingrākiem aizsardzības pasākumiem. Lai saprastu, cik plaši sniedzas šīs spējas, mēs pārbaudījām Astra, izmantojot iekšējos un trešo pušu ekspertu novērtējumus.

Vispirms pārbaudījām modeli bez ražošanas vides aizsardzības pasākumiem ExploitBench un ExploitGym testos, kuros novērtē, vai modeļi spēj pārvērst zināmas programmatūras ievainojamības strādājošos ekspluatācijas paņēmienos. ExploitBench testā Astra sasniedza nevainojamu 100 % rezultātu, savukārt mūsu iepriekšējais progresīvais modelis GPT‑5.6 Sol ar kiberdrošības spējām sasniedza 78,5 %. ExploitGym testā Astra sasniedza 42,4 % sekmības rādītāju salīdzinājumā ar GPT‑5.6 Sol sasniegto 30,3 % rādītāju, vienlaikus izmantojot būtiski mazāk izvades tekstvienību.13

Ņemot vērā bažas par to, ka saskare ar vēsturiskām programmatūras ievainojamībām varētu būt ietekmējusi etalontestu rezultātus, mēs Astra izvērtējām arī divos jaunos etalontestos. Pirmkārt, mēs izveidojām iekšēju “ExploitBench (2026. gada jūnijs–augusts)” novērtējumu, lai pārbaudītu ievainojamību izmantošanas paņēmienu izstrādi, izmantojot iepriekšējo trīs mēnešu ievainojamības.14 Astra sasniedza būtiski augstāku patvaļīga koda izpildes īpatsvaru nekā GPT‑5.6 Sol šajā datu kopā, vienlaikus izmantojot daudz mazāk izvades tekstvienību. Novērtēšanas laikā Astra pat atklāja un izmantoja divas iepriekš nezināmas nulles dienas ievainojamības. Mēs informējam attiecīgos uzturētājus par abām ievainojamībām.

Mēs arī testējām Astra ar SRE-Bench15 – etalontestu, kurā tiek pārbaudīts, vai modeļi spēj veikt programmatūras binārfailu reverso inženieriju, lai bez piekļuves neapstrādātam pirmkodam izprastu to pamatloģiku. Astra vienā mēģinājumā atrisināja 88,0 % uzdevumu un četros mēģinājumos – 99,2 %, savukārt GPT‑5.6 Sol attiecīgi – 55,9 % un 68,7 %.

Papildus etalontestiem ekspertu vadītos novērtējumos tika konstatēts, ka Astra, ja tā tiek darbināta bez produkcijas vides aizsargmehānismiem, spētu izmantot iepriekš nezināmas ievainojamības, lai panāktu patvaļīga koda izpildi pastiprināti aizsargātās pārlūkprogrammās un izstrādātu privilēģiju paaugstināšanas ievainojamību izmantošanas paņēmienus pastiprināti aizsargātām operētājsistēmām.

Kā apspriedām Aizstāvja iespēju logā, visprogresīvākās kiberspējas var palīdzēt aizstāvjiem ātrāk atrast vājās vietas, taču tās arī atvieglo šo vājo vietu izmantošanu, tādēļ aizstāvjiem ir steidzami jāpielāgojas. Izmantojot šodien izlaisto Astra versiju, aizsardzības speciālisti var veikt tādus uzdevumus kā droša koda pārskatīšana un ielāpu ieviešana.

Tomēr Astra atteiksies izpildīt vēl sarežģītākus kiberdrošības uzdevumus, piemēram, izveidot ievainojamību izmantošanas koncepcijas apliecinājumus. Ar OpenAI Daybreak⁠ starpniecību mēs plānojam tuvāko nedēļu laikā paplašināt piekļuvi un ieviest mazāk ierobežojošus aizsargmehānismus. Tas ļaus izmantot vairāk aizsardzības darbplūsmu, tostarp ievainojamību un koncepcijas apliecinājuma validāciju, ļaunprogrammatūras analīzi un detektēšanas inženieriju.

Esam arī pastiprinājuši aizsardzību pret iespējamu ļaunprātīgu izmantošanu kibertelpā, balstoties uz mūsu GPT‑5.6 Sol aizsardzības risinājumu kopumu. Šie uzlabojumi ietver lielāku modeļa noturību, lai labāk pretotos iespējamiem ierobežojumu apiešanas mēģinājumiem, un plašāku kontekstu mūsu uzraudzības sistēmām. Esam turpinājuši stingru iekšējo un ārējo testēšanu, tostarp automatizētus izvērtējumus ar mūsu iekšējiem imitētu uzbrukumu veicējiem. Plašāka informācija par mūsu kiberdrošības pasākumiem un testēšanu ir pieejama Astra drošības pārskatā⁠ un sistēmas kartē⁠(atveras jaunā logā).

GPT‑6 Astra atbildīga saskaņošana un ieviešana

Astra ir mūsu vislabāk saskaņotais modelis. Astra izceļas ar rūpību, uzdevumu robežu ievērošanu un atklātu saziņu. Šis darbs ir jaunākais rezultāts mūsu ilgstošajai pētniecības programmai, kas vērsta uz tādu modeļu apmācību, kuri no sākuma līdz beigām saglabā saskaņotību ar cilvēka nodomu.

Sensitīvās vidēs Astra rīkojas piesardzīgi, samērīgi ar tās risku. Novērtējumā par datora lietošanas uzdevumiem, kas bija mērķtiecīgi atlasīti, lai provocētu neatbilstošu uzvedību, Astra sekmīgāk izvairījās no neparedzētām sekām. Papildu drošības pasākumu, kas tiek piedāvāti pēc noklusējuma, izmantošana nodrošināja vēl labāku veiktspēju.

Astra izraisa mazāk neatbilstošu iznākumu nekā jebkurš cits testētais robežšķirtnes modelis. Lai salīdzinājums būtu godīgs, mēs izmantojām vispārīgu datoru izmantojoša aģenta izpildes ietvaru (balstītu uz iebūvētajiem datora izmantošanas rīkiem, kas pieejami gan OpenAI Responses API⁠(atveras jaunā logā), gan Anthropic Messages API⁠(atveras jaunā logā)) un neizmantojām papildu aizsardzības pasākumus, kas parasti tiek nodrošināti Codex un ChatGPT Work lietotājiem (automātiskā pārskatīšana, apstiprināšanas politika).

Pastāv arī lielāka iespējamība, ka Astra darbosies lietotāja noteiktajās un tās vides netieši norādītajās robežās. Iekšējā novērtējumā Astra nekad nemēģināja apiet Codex automātiskās pārskatīšanas noraidījumu. Tas bija spēkā pat tad, ja automātiskā pārskatīšana tika apzināti konfigurēta tā, lai to varētu apiet, un uzdevumu citādi nebija iespējams pabeigt. Šī vides ierobežojumu ievērošana saskan ar mūsu neiespējamo kiberdrošības uzdevumu novērtējuma rezultātiem, ar kuriem dalījāmies šīs ziņas ievadā, un citiem mūsu sistēmas kartē⁠(atveras jaunā logā) dokumentētajiem konstatējumiem.

Astra turklāt nosaka jaunus standartus atklātā saziņā ar lietotājiem. Vienā novērtējumā iespējamība, ka Astra sniegs neprecīzu informāciju par savām iespējām un piedāvātajām funkcijām, ir trīs reizes mazāka nekā GPT‑5.6 Sol gadījumā.

Mūsu spēju halucināciju novērtējumā Astra uzrāda būtisku uzlabojumu salīdzinājumā ar GPT‑5.6 Sol, izsakot mazāk maldinošu apgalvojumu par savām spējām.

Mūsu novērtējumos tika konstatēts, ka Astra spriestspēju ir grūtāk pārraudzīt nekā GPT‑5.6 Sol, pamatojoties uz testiem, kuros tam tieši tika lūgts izvairīties no uzraudzības. Mēs to skaidrojam ar Astra lielāku kontroli pār rakstisko spriestspēju vienkāršākos uzdevumos un spēju risināt problēmas ar mazāku rakstisko soļu skaitu. Šķiet, ka Astrai joprojām ir grūti slēpt spriestspēju, kas nepieciešama sarežģītiem uzdevumiem, tomēr mēs šo pasliktināšanos uztveram nopietni. Uzraugāmības uzlabošana joprojām ir pētniecības prioritāte, un pievienotajā sistēmas kartē⁠(atveras jaunā logā) ir sīki izklāstīti mūsu konstatējumi un pašreizējais darbs.

Saskaņošanas apmācība ir mūsu ieviešanas pieejas pamatā. Kā papildu aizsardzības līmeni mēs veidojam arī sistēmas aizsardzības pasākumus, piemēram, Codex automātisko pārskatīšanu⁠(atveras jaunā logā) un aģentu spriešanas gaitas un darbību uzraudzību, lai palīdzētu konstatēt un ierobežot nedrošu rīcību. Kā aprakstīts mūsu ziņojumā par drošību⁠, mēs arī ieviešam neatbilstības uzraudzību Astra klases modeļiem ekspluatācijas vidē, lai gūtu ieskatu par neatbilstību un palīdzētu ierobežot tās smagākos gadījumus. Šie aizsardzības pasākumi līdzinās mūsu iekšējās ieviešanas uzraudzībai un ietver klasifikatoru sistēmu, kas pārbauda modeļa spriešanas gaitu un darbības, lai konstatētu neatļautu rīcību, un automātiski aptur potenciāli neatļautas darbības.

Ņemot vērā Astra kiberdrošības spēju ievērojamo pieaugumu, mēs rīkojamies īpaši piesardzīgi, lai nodrošinātu, ka šī ieviešana ir droša un aizsargāta. Papildu drošības pārbaudes dažkārt var palēnināt, īslaicīgi apturēt vai pilnībā apturēt leģitīmu darbu, tostarp darbu aizsardzības kiberdrošības jomā. Ja uzdevums tiek pauzēts pakalpojumā ChatGPT vai Codex, tev pirms turpināšanas var tikt lūgts pārskatīt darbību. API uzdevuma izpilde tiks apturēta. Šīs pārbaudes dažkārt var traucēt leģitīmam darbam, un mēs turpinām pilnveidot šo sistēmu, lai mazinātu nevajadzīgus traucējumus. Neatbilstības uzraudzība nevar aizstāt saskaņotību: mūsu mērķis ir izveidot modeļus, kas uzticami nepārsniedz atļautās darbības robežas, lai šiem aizsardzības pasākumiem nebūtu jāiejaucas.

Pieejamība

GPT‑6 Astra šodien tiek ieviests ierobežotam organizāciju lokam, un tuvāko dienu laikā tas būs pieejams visiem ChatGPT Plus, Pro, Business un Enterprise lietotājiem, kā arī, izmantojot OpenAI API, Microsoft Azure un AWS Bedrock. Astra lietošana ir iekļauta esošajās abonementu kvotās — lietotāji un uzņēmumi varēs arī iegādāties kredītus papildu lietošanai. Pro, Business un Enterprise plānu lietotāji iegūs arī piekļuvi GPT‑6 Astra Pro. Enterprise administratori var iespējot Astra savā darbvietā; palaišanas brīdī piekļuve pēc noklusējuma ir izslēgta.

Astra atbalsta nulles datu saglabāšanu tiem API klientiem, kuri atbilst prasībām, un, kā mēs paziņojām pagājušajā mēnesī, mēs testējam Private Safety Processing, lai stiprinātu drošības uzraudzību, vienlaikus aizsargājot klientu privātumu.

Izstrādātājiem GPT‑6 Astra būs pieejams OpenAI API kā gpt-6-astra, kā arī pakalpojumos Microsoft Azure un Amazon Bedrock.

OpenAI API standarta cenas ir 10 USD par miljonu ievades tekstvienību un 50 USD par miljonu izvades tekstvienību. Kešatmiņas lasīšanas un rakstīšanas operācijām tiek piemērotas atsevišķas likmes. GPT‑6 Astra ātrais režīms ir pieejams API un nodrošina līdz 2× lielāku ātrumu nekā standarta apstrāde par 2× standarta cenu.

Datora lietošana

Datora lietošana

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3%

53,6 %

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, bezsaistes kopa, daļējs rezultāts)

72,6 %

65,7 %

-

-

70,2%3

-

ScreenSpot-Pro (bez rīkiem)

92,7 %

76,9 %

-

87,3%17

-

-

Profesionāls

Profesionāls

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Dizaina uzdevumi (iekšējie)

50,0%

47,4%

-

35,8%

-

-

Iekšējie datu zinātnes uzdevumi

40,9%

30,5%

-

34,7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Programmēšana

KodēšanaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended (rezultāts)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Main (rezultāts)53,3% 847,5%50,9%53,5%53,4%43,6%
Iekšējie datubāzu migrācijas uzdevumi63,9%42,7%57,8%50,3%--
Artificial Analysis kodēšanas aģentu indekss v1.467,065,1-67,268,161,2

Akadēmisks

Akadēmisks

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4%

30,0 %

-

FrontierMath Tier 4 (v2)

97,6%

83,0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6%

93,7%

92,6%

93,7%

95,3%

Cilvēces pēdējais eksāmens (ar rīkiem)

57,2%

-

65,0%

63,8%

63,6%

-

Zinātne un veselība

Zinātne un veselībaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (iekšējais)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (ar atbildes garuma korekciju)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

Kiberdrošība

KiberdrošībaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70%-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (jūn.–aug. 2026)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Saskaņošana

Saskaņošana

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Iekšējais datora lietošanas drošības etalontests (jo zemāks rādītājs, jo labāk)

2,4%

22,0 %

9,5 %

18,3 %

11,5 %

-

Iekšējais datora lietošanas drošības etalontests ar AutoReview (jo zemāks, jo labāk)

1,8 %

4,3 %

-

-

-

-

Iekšējais apiešanas etalontests (jo zemāks, jo labāk)

0,00 %

0,29 %

-

-

-

-

ExploitGym māņmērķis (jo zemāks rādītājs, jo labāk)

0,0 %

48,2 %

-

-

-

-

Neiespējamais ExploitGym

100,0%

-

-

-

-

-

Iekšējais halucināciju etalontests (jo zemāks, jo labāk)

4,2 %

12,2 %

-

-

-

-

Garš konteksts

Garš konteksts

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Abstraktā domāšana

Abstraktā spriestspējaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9% 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Novērtējuma rezultāti ir maksimāli pie jebkādas piepūles. GPT novērtējumi tika veikti mūsu pētnieciskajā vidē vai izmantojot mūsu API, tāpēc sistēmas uzvedņu, pieejamo rīku u. c. atšķirību dēļ rezultāti var nedaudz atšķirties no ChatGPT produkcijas vidē iegūtajiem rezultātiem.

ZEMSVĪTRAS PIEZĪMES

  1. 1

    ARC-AGI-3 testā GPT-6 Astra tika palaists, izmantojot mūsu Responses API izpildes ietvaru⁠, kas maina divus iestatījumus, lai labāk atspoguļotu veiktspēju reālos apstākļos. Šīs izmaiņas nav īpaši vērstas uz ARC-AGI-3.

  2. 2

    GPT-5.6 Sol attiecas uz versiju, kas pieejama mūsu API, ChatGPT Codex un ChatGPT Work. Versija ChatGPT režīmā Chat ir nedaudz atšķirīga.⁠

  3. 3

    OSWorld V2-Offline ir sākotnējā OSWorld V2 apakškopa, kas darbojas bez piekļuves internetam. Claude modeļa veiktspēju sistēmā OSWorld-V2 Offline autori reproducēja oficiālajā līderu sarakstā⁠(atveras jaunā logā). OSWorld 2.0 Claude rezultātos tiek izmantoti oficiālie iestatījumi, nevis Fable 5.1 sistēmas kartes modificētie uzdevumi un modificētā vērtēšana.

  4. 4

    Modeļa laiki ir norādītie pagājušā laika intervāli attiecīgajiem demonstrācijas izpildes gadījumiem. Parādītie klipi ir rediģēti fragmenti.

  5. 5

    BenchCAD platformā Claude rezultāti atspoguļo trīs novērtējuma modifikācijas, kas sīkāk aprakstītas Fable 5.1 sistēmas kartē⁠(atveras jaunā logā).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon un Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(atveras jaunā logā).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower un Peter Jonas. “The OpenScore String Quartet Corpus⁠(atveras jaunā logā).” 10. starptautiskās konferences “Digitālās bibliotēkas muzikoloģijai” materiāli, 49–57. lpp. ACM, 2023.

  8. 8

    Vietnē FrontierCode GPT-6 Astra tika palaists ar izstrādātāja  ziņojumu, kas līdzinās tā izstrādātāja ziņojuma sadaļai pakalpojumā Codex⁠(atveras jaunā logā): "Neveido pārmērīgi daudz testu failu. Izveido jaunu testu failu tikai tad, ja to prasa repozitorija konvencijas vai ja neviens esošais fails nav tam piemērota vieta. Izvairies no nesaistītas sakopšanas un nevajadzīgas sarežģītības. Atkārtoti izmanto piemērotas esošās utilītas. Izlasi attiecīgos repozitorija norādījumus un apskati tuvumā esošo kodu, testus, dokumentāciju un CI. Ievēro iedibinātās konvencijas. Mērķis ir tīrs, sapludināms kods." Uzvedne netika optimizēta novērtēšanai.

  9. 9

    Pirmais attiecas uz to, cik tuvu cits citam var atrasties pirmskaitļi, lai cik tālu pa skaitļu taisni tu virzītos. Vairāk nekā desmit gadus labākais zināmais rezultāts parādīja, ka pastāv bezgalīgi daudz pirmskaitļu pāru, kuru starpība ir ne vairāk kā 246. Julia Stadlmann⁠(atveras jaunā logā) nesen uzlaboja šo robežu līdz 240. Astra palīdzēja noteikt stingrāku robežu 186, parādot, ka bezgalīgi daudz pāru sastopami attālumā, kas nepārsniedz šo mazāko attālumu. Īsas atstarpes starp pirmskaitļiem: pierādījums⁠(atveras jaunā logā) un atbalstošie pētījumi⁠(atveras jaunā logā).

  10. 10

    Otrais attiecas uz neparasti lielām atstarpēm starp pirmskaitļiem. Astra uzlaboja vienu locekli šo atstarpju robežnovērtējumā, kas nebija mainījies vairāk nekā 80 gadus. Mēs dalāmies ar abu rezultātu pierādījumiem, saīsināto domu ķēdi un verifikācijas materiāliem. Lielas atstarpes starp pirmskaitļiem: Pierādījums⁠(atveras jaunā logā) un pamatojošie pētījumi⁠(atveras jaunā logā).

  11. 11

    Mēs neatkarīgi izvērtējām visus Claude modeļus, ievērojot paredzēto HealthBench Professional procedūru un izmantojot GPT‑5.4 vērtēšanai un garumam pielāgoti, neapgriezti vērtējumi. Fable 5.1 versijai mēs izmantojām Opus 5 kā rezerves risinājumu nodrošinātāja atteikumu gadījumos.

  12. 12

    Claude Fable 5 un 5.1 nav iekļauti LifeSciBench Gold v1, GeneBench Pro v13 un MedChemBench, jo tie atsakās atbildēt uz lielāko daļu jautājumu šajos novērtējumos.

  13. 13

    Platformā ExploitGym mēs testējām Astra un Sol bez 6 stundu laika ierobežojuma, lai labāk novērtētu to pilnās kiberspējas. Tie ir pietiekami ātri, tāpēc laika ierobežojuma neesamība maz ko ietekmē.

  14. 14

    ExploitBench (2026. gada jūnijs–augusts) ietver 20 augstas bīstamības V8 ievainojamības 13 stabilajos Chrome laidienos. Etalontests nosaka, vai aģenti spēj panākt patvaļīga koda izpildi V8 un oficiālajos Chrome laidienos operētājsistēmai Linux, izmantojot katru norādīto ievainojamību. Dažas iekļautās ievainojamības novērtējuma ierobežojumu apstākļos var nepieļaut patvaļīga koda izpildi, tāpēc 100% panākumu līmenis var nebūt sasniedzams. Piezīme: GPT-5.6 Sol 5,5% rezultāts ir etalontesta 300 gājienu limita sekas; šis limits neattiecas uz klientiem, kuri izmanto Max. Modelis ar līdzīgiem iestatījumiem sasniedza 11,5% rezultātu, retāk sasniedzot limitus.

  15. 15
  16. 16

    Pārbaudot trešo pušu modeļus, mēs izmantojam vienkāršāku pētniecības iestatījumu. Codex ir sarežģītāka ražošanas konfigurācija, kas var radīt atšķirīgus neapstrādāta modeļa kļūdu rādītājus. Arī pakalpojumu sniedzēju puses drošības pasākumi un datorrīku implementācijas atšķiras. Lietotāji Codex nepieredz scenāriju bez apstiprinājuma, jo tā ir iekšēja pētniecības konfigurācija.

  17. 17

    Attiecībā uz ScreenSpot-Pro un ExploitGym mūsu norādītie Fable rezultāti ir iegūti no Mythos, kas ir Fable ar mazāk aizsardzības mehānismiem.