Uue põlvkonna nutikus
Uuendus 22.09.2026: laiendame oma GPT‑6 mudelite perekonda GPT‑6 Soli ja GPT‑6 Lunaga. Loe lisateavet.
Tutvustame GPT‑6 Astrat, maailma kõige intelligentsemat ja kõige paremini seadistatud mudelit.
GPT‑6 Astra koondab endasse aastatepikkused teadusuuringud ja suured panused eeltreenimise, stiimulõppe ja joondamise valdkonnas. Astra esindab tipptaset arvutikasutuse, veebisirvimise, tarkvaraehituse, küberturvalisuse, teaduse ja kutsetöö vallas. Astra küllastab FrontierMath Tier 4 tulemusega 98%, olles juba aidanud matemaatikas lahendada pikaajalisi lahtisi probleeme. Astra küllastab ka ARC-AGI-3 tulemusega 99,9% ja ExploitBenchi tulemusega 100%. Samuti seab see uue tipptasemel piiri arvuti ja brauseri kasutamises, saades hakkama kõige nõudlikuma professionaalse tööga võrreldamatu kiiruse, täpsuse ja otsustusvõimega.
GPT‑6 Astra jõuab tänasest piiratud hulgale organisatsioonidele ning muutub lähipäevadel kättesaadavaks kõigile ChatGPT Plusi, Pro, Businessi ja Enterprise'i kasutajatele, samuti OpenAI API, Microsoft Azure'i ja AWS Bedrocki kaudu.
Astra on meie kõige paremini ühtlustatud mudel ning selle võime mõista kasutajate kavatsusi ja mudeli käitumist on märkimisväärselt paranenud – saate ülesandeid suurema kindlusega Astra otsustusvõimet usaldades delegeerida. Ühe võimalusena selle testimiseks töötasime Hugging Face’i intsidendi põhjal välja uue hindamise, millega hindame, kas keerulise või võimatu ülesandega silmitsi seisev mudel väljub oma kavandatud tegevusraamidest. Võrdluseks: kui mudel GPT‑5.6 Sol väljus ilma tootmisturvameetmeteta autoriseeritud sihtmärgi piirest 48% juhtudest, siis GPT‑6 Astra tegi seda 0% juhtudest.
Maailma parim arvutikasutuse mudel
GPT‑6 Astra tähistab uut tipptasemel arvutikasutuse kiiruse, täpsuse ja turvalisuse vallas. See tegeleb tüütute ülesannetega, nagu veebivormide täitmine, kliendiandmete värskendamine CRM-süsteemis ja kalendri haldamine. See teeb veebiuuringuid ja koostab kokkuvõtteid sinu e-postis või dokumendiredaktoris. See suudab analüüsida teadusandmeid, koostada graafikuid, luua veebisaidi ja teha kasutajaliidese kvaliteedikontrolle, et veenduda, et kõik selle saidi funktsioonid töötavad. See saab aidata teil iseseisvalt tarkvara installida ja testida ning ekraanil nähtavaid probleeme lahendada. Need täiustused kajastuvad ka meie tipptasemel hindamistulemustes.
Samuti toovad need täiustused kaasa märkimisväärse tõhususe kasvu reaalsetes teadmustöö ülesannetes. OSWorld 2.0 latentsussimulatsioonides saavutab Astra GPT‑5.6-ga võrreldes kõrgema arvutikasutuse jõudluse, kulutades ülesande kohta umbes 47% vähem aega. Sol saavutas tulemuseks 72,6%, kulutades ülesandele umbes 40 minutit, võrreldes 65,7%-ga ligikaudu 75 minuti juures.3
GPT‑6 Astra arvutikasutuse võimekust saab näha erinevate valdkondade väljundites, sealhulgas mänguarenduses, elektrotehnikas ja igapäevases mõttetöös:
Kõrvuti Astraga värskendame ka Codexi täitmiskeskkonna, et oluliselt parandada arvutikasutuse kiirust. Koos Astra tõhususega tähendab see Mind2Webi võrdlusalusel 1,9 korda kiiremat ülesannete täitmist võrreldes praeguse GPT‑5.6 Soli kogemusega. Mudeli kiiruseparandused tähendavad, et see saab enda kanda võtta palju aeganõudvaid elulisi ülesandeid, tehes seda kiiremini kui sa ise.4
Hüppeline muutus erialases töös
GPT‑6 Astra ühendab edusammud arvutikasutuses sihipärase koolitusega professionaalsete keskkondade jaoks, et aidata lahendada keerulisi tööülesandeid. See ühendab keeruliste probleemide jaoks vajaliku intellekti võimega viia läbi mitmesammulisi töövoogusid ning luua viimistletud dokumente, tabelarvutusi ja esitlusi.
GPT‑6 Astra on meie parim mudel olemasolevate mallide järgimiseks ja hästi paigutatud slaidide loomiseks, mis edastavad põhipunkte kokkuvõtlikult ja struktureeritud narratiivina. See loob selgeid, hästi struktureeritud dokumente, esitlusi, tabeleid ja analüüse, mis järgivad sinu malle ning vastavad sinu kirjutamisstiilile ja visuaalsele stiilile. Astra on samuti treenitud tooma väljunditesse ainult olulise konteksti, selle asemel et korrata käsiloleva töö jaoks ebavajalikku teavet. Kõik see tähendab, et see suudab luua kohe kasutuskõlblikumaid artefakte, mis vastavad sinu ärikontekstile ja standarditele.
GPT‑6 Astra pakub ka paremat visuaalset otsustusvõimet veebisaitide, mängude, rakenduste ja renderduste loomisel. Funktsiooniga Sites(avaneb uues aknas) saab Astra ChatGPT‑s luua, majutada ja jagada veebilehti, veebirakendusi ning mänge otse sisendviiba põhjal.
Kui juhised jätavad ruumi tõlgendustele, teeb GPT‑6 Astra õige otsuse paremini kui varasemad mudelid. See kasutab konteksti rutiinsete lünkade täitmiseks ja küsib täpsustavaid küsimusi siis, kui vastus võib tulemust oluliselt muuta. Codexis saab see küsida asünkroonselt, jätkates samal ajal tööd, mis ei sõltu sinu vastusest. Kui sa ei vasta, jätkab see asjakohastel juhtudel mõistlike eelduste alusel, kuid ootab sinu sisendit põhimõtteliste ja kaalukate otsuste puhul.
Allpool toodud näited näitavad, kuidas Astra teeb koostööd igapäevaste ülesannete täitmisel, kus puuduv teave võib vastust oluliselt muuta.
Astra on parem ka oma suuna hoidmisel ülesande arenedes. Varasemad mudelid mehhitasid suunavaid sõnumeid vahel uue eesmärgina, kaotades silmist algse taotluse või varasemad piirangud. Astra integreerib uued nõuded, muudab palvel suunda ja vastab kõrvalküsimustele ilma üldisemat ülesannet unustamata.
Kodeerimine
GPT‑6 Astra on senini parim tarkvaraarenduse mudel.
„GPT‑6 Astra pakub meie sisemistes programmeerimise võrdlustestides tipptasemel jõudlust ning näitab selget edasiminekut kauplemisintuitsiooni hindamisel võrreldes mudeliga GPT‑5.6 Sol. Kui seda kasutatakse agendipõhiseks koodikirjutamiseks, suhtleb GPT‑6 Astra viisil, mida arendajatel on lihtsam jälgida, ning toodab koodi, mis nõuab tootmiskvaliteedini jõudmiseks vähem iteratsioone.“
„Testisime Astrat ühes oma esimese põlvkonna hindamistest madala, keskmise ja kõrge töömahukusega ning see edestas GPT 5.6 Soli märkimisväärselt.“ Suurem töömahukus võimaldab uue versiooni puhul rohkem iteratsioone, brauseritestimise abil põhjalikumat kontrollimist ning kalduvust käitada koodi paiga rakendamise asemel. Mõistmine, kuidas mudel oma töömahukust kasutab, võimaldab meil pakkuda miljonitele arendajatele kiiremat ja usaldusväärsemat teed ideest toimiva rakenduseni.“
Astra abil tutvustame uut viisi, kuidas Codex saab konteksti säilitada ja taastada, kui kontekstivaade saab täis. Varem on mudelid kasutanud tihendamist töö kokkuvõtmiseks pikkade seansside ajal, näiteks keerukate probleemide silumisel või suurte koodirefaktoreerimiste käigus. Iga tihendamine võib jätta välja üksikasju selle kohta, miks parandus ebaõnnestus või kuidas komponent käitub. Codexis saab Astra hoida märkmeid kontekstivaadetes, säilitades kogunenud üksikasjad ilma neid korduvalt ühte kokkuvõttesse tihendamata. Varasemad kontekstivaated jäävad otsitavaks, nii et Astra leiab nõuded või testitulemused varasematest sõnumitest ja tööriistade väljunditest — isegi kui seda teavet ei jäädvustatud selle märkmetes. Selle eksperimentaalse funktsiooni saab lubada oma konfiguratsioonifailis Codex config.toml,(avaneb uues aknas) ja sellest saab lähinädalatel Astra jaoks vaikeseade.
Teadusliku avastamise edendamine
Astra saab aidata teaduslike avastustega seotud praktilise tööga. Ühendades teadusliku arutluse arvuti kasutamisega, saab see töötada otse spetsialiseeritud tarkvaras, et uurida andmeid ja analüüsida tulemusi, aidates teadlastel tõendusmaterjali hinnata ja otsustada, mida järgmisena uurida.
Küberturvalisus
Nagu me oma turvavärskenduses arutasime, on Astra märkimisväärne hüpe kübervõimekuses ja vastab meie kriitilisele lävendile küberturvalisuse valdkonnas meie Valmisoleku raamistiku järgi. Selle võime tuvastada ja arendada nullpäeva eksploite aitab kaitsjatel nõrkusi leida ja paigata, kuid tekitab ka vajaduse tugevamate turvameetmete järele. Mõistmaks, kui kaugele need võimed ulatuvad, käitasime Astrat sise- ja kolmandate osapoolte eksperthindamistel.
Esmalt testisime mudelit ilma tootmisturvameetmeteta ExploitBenchile ja ExploitGymile, mis hindavad, kas mudelid suudavad muuta teadaolevad tarkvara haavatavused toimivateks eksploitideks. ExploitBenchi testis saavutas Astra täiusliku tulemuse 100%, võrreldes meie varasema tipptasemel kübervõimeka mudeli GPT‑5.6 Soli 78,5%-ga. ExploitGymis saavutas Astra 42,4%-lise edumäära (võrdluseks GPT‑5.6 Soli 30,3%), kasutades samal ajal oluliselt vähem väljundtokeneid.13
Arvestades muret, et kokkupuude varasemate tarkvarahaavatavustega võis mõjutada võrdlustestide tulemusi, hindasime Astrat ka kahel uudsel võrdlustestil. Esiteks lõime sisemise hindamise „ExploitBench (juuni–august 2026)”, et testida ärakasutuste arendamist eelneva kolme kuu haavatavuste abil.14 Astra saavutas märkimisväärselt kõrgemad suvalise koodi käivitamise määrad kui GPT‑5.6 Sol selles andmestikus, kasutades samal ajal märksa vähem väljundtokeneid. Hindamise käigus avastas ja kasutas Astra isegi kahte varem tundmatut nullpäeva turvanõrkust. Avaldame mõlemad haavatavused nende haldajatele.
Testisime Astrat ka SRE-Benchis15is — võrdlustestis, mis mõõdab, kas mudelid suudavad tarkvara binaarfaile tagurpidi projekteerida, et mõista selle põhilogikat ilma lähtekoodile juurdepääsuta. Astra lahendas ühe katsega 88,0% ülesannetest ja nelja katse jooksul 99,2%, võrreldes GPT‑5.6 Soli vastavate näitajatega 55,9% ja 68,7%.
Lisaks võrdlustestidele leidsid ekspertide juhitud hindamised, et ilma tootmisturvameetmeteta käitatuna suudab Astra kasutada varem tundmatuid haavatavusi koodi suvaliseks käivitamiseks turvatud brauserites ning luua privileegide suurendamise eksploite turvatud operatsioonisüsteemidele.
Nagu käsitlesime dokumendis The Defender’s Window, võivad tipptasemel kübervõimekused aidata kaitsjatel nõrkusi kiiremini leida, kuid muudavad need nõrkused ka lihtsamini ärakasutatavaks, mis suurendab kaitsjate jaoks kohanemise pakilisust. Täna välja tuleva Astra versiooniga saavad kaitsjad seda kasutada selliste ülesannete täitmiseks nagu turvalise koodi ülevaatus ja paikamine.
Astra keeldub aga täitmast keerukamaid küberjulgeoleku ülesandeid, näiteks haavatavuste jaoks kontseptsioonitõenduse eksploitide loomist. OpenAI Daybreaki kaudu plaanime lähinädalatel laiendada juurdepääsu ja võtta kasutusele vähem piiravaid turvapiiranguid. See võimaldab täiendavaid kaitsetöövooge, sealhulgas haavatavuste ja kontseptsioonitõendite valideerimist, pahavara analüüsi ning tuvastussüsteemide arendust.
Oleme tugevdanud ka oma kaitsemeetmeid võimaliku küberkuritarvitamise vastu, tuginedes oma GPT‑5.6 Soli turvameetmetele. Need hõlmavad mudeli suuremat vastupidavust, et paremini vastu pidada võimalikele jailbreakidele, ning rohkem konteksti meie seiresüsteemide jaoks. Oleme jätkanud põhjalikku sise- ja välistestimist, sealhulgas automatiseeritud hindamisi meie sisemiste lööktestimine ründajatega. Lisateave meie küberkaitsemeetmete ja testimise kohta on saadaval Astra turvaülevaates ja süsteemikaardil(avaneb uues aknas).
GPT‑6 Astra vastutustundlik vastavusse viimine ja kasutuselevõtt
Astra on meie kõige ühtsem mudel. Astra paistab silma hoolika tegutsemise, ülesande piiridest kinnipidamise ja läbipaistva suhtlusega. See töö on uusim tulemus meie pikaajalisest teadusprogrammist, mis keskendub mudelite treenimisele nii, et need püsiksid algusest lõpuni kooskõlas inimese kavatsustega.
Tundlikes keskkondades tegutseb Astra ettevaatlikult, vastavalt riskitasemele. Arvutikasutuse ülesannete hindamisel, kus ülesanded olid ründetestimise põhimõttel valitud väärkäitumise esilekutsumiseks, suutis Astra soovimatuid tagajärgi edukamalt vältida. Vaikimisi pakutavate täiendavate turbemeetmetega käitamine andis veelgi parema jõudluse.
Astra põhjustab vähem eesmärkidega mittekooskõlas olevaid tulemusi kui ükski teine testitud tipptasemel mudel. Õiglase võrdluse tagamiseks kasutasime üldist arvuti kasutamise agendi täitmiskeskkonda (mis põhineb natiivsetel arvutikasutuse tööriistadel, mis on saadaval nii OpenAI Responses API-s(avaneb uues aknas) kui ka Anthropic Messages API-s(avaneb uues aknas)) ilma täiendavate kaitsemeetmeteta, mida tavaliselt rakendatakse Codex ja ChatGPT Worki kasutajatele (automaatne ülevaatus, kinnituspoliitika).
Astra tegutseb suurema tõenäosusega kasutaja seatud ja keskkonnast tulenevate piirangute raames. Sisemises hindamises ei üritanud Astra kordagi kõrvale hiilida Codex Auto-Review ülevaatuse keeldumisest. See pidas paika isegi siis, kui Auto-Review oli tahtlikult konfigureeritud nii, et sellest saaks kõrvale hiilida, ning ülesannet oli muidu võimatu lõpule viia. See keskkonnapiirangutest kinnipidamine on kooskõlas meie võimatu küberülesande hindamise tulemustega, mida jagasime selle postituse sissejuhatuses, ning teiste leidudega meie süsteemikaardil(avaneb uues aknas).
Astra seab uued tähised ka läbipaistvas kasutajasuhtluses. Ühes hindamises esitab Astra kolm korda vähem tõenäoliselt ebatäpseid väiteid oma võimete ja võimaluste kohta kui GPT 5.6-Sol.
Meie võimekuse-hallutsinatsioonide hindamisel näitab Astra olulist paranemist võrreldes GPT‑5.6 Soliga, tehes oma võimete kohta vähem eksitavaid väiteid.
Meie hindamised näitasid, et Astra kirjalikku arutluskäiku on raskem jälgida kui GPT‑5.6 Soli oma, tuginedes katsetele, kus mudelil paluti otseselt seirest kõrvale hoida. Omistame selle Astra suuremale kontrollile kirjaliku arutluskäigu üle lihtsamate ülesannete puhul ning võimele lahendada probleeme vähemate kirjalike sammudega. Astra näib endiselt nägevat vaeva keerukate ülesannete jaoks vajaliku arutluskäigu varjamisega, kuid suhtume selle võimekuse vähenemisse tõsiselt. Jälgitavuse parandamine on jätkuvalt uurimisprioriteet ning lisatud süsteemikaart(avaneb uues aknas) kirjeldab üksikasjalikult meie tulemusi ja käimasolevat tööd.
Ühtlustamistreening on meie juurutamise lähenemisviisi keskmes. Täiendava kaitsekihina loome ka süsteemi kaitsemeetmeid, nagu Codex Auto-review(avaneb uues aknas) ning agentide arutluse ja tegevuste seire, et aidata tuvastada ja ohjeldada ebaturvalikku käitumist. Nagu on kirjeldatud meie ohutusalases värskenduses, võtame Astra-klassi mudelite puhul tootmises kasutusele eesmärginihestuse seire, et saavutada ülevaade eesmärkide lahknevusest ning aidata piirata selle tõsisemaid juhtumeid. Need kaitsemeetmed sarnanevad meie sisemiste rakenduste jälgimises kasutatavatega ja hõlmavad klassifitseerijate süsteemi, mis kontrollib mudeli arutluskäiku ning tegevusi volitamata käitumise suhtes ja peatab automaatselt potentsiaalselt lubamatu tegevuse.
Arvestades Astra küberturbevõimekuse märkimisväärset suurenemist, oleme eriti hoolikad, et muuta see juurutamine ohutuks ja turvaliseks. Täiendavad ohutuskontrollid võivad mõnikord aeglustada, ajutiselt peatada või täielikult peatada õiguspärast tööd, sealhulgas kaitseotstarbelist küberturbetööd. Kui ülesanne peatatakse ChatGPT‑s või Codexis, võidakse teil paluda tegevus enne jätkamist üle vaadata. API-s ülesanne peatub. Need kontrollid võivad mõnikord katkestada õiguspärast tööd ning me jätkame selle süsteemi täiustamist, et vähendada tarbetuid katkestusi. Lahknevuse seire ei saa asendada kooskõlastatust: meie eesmärk on luua mudeleid, mis püsivad usaldusväärselt oma lubatud piirides, nii et need kaitsemeetmed ei peaks sekkuma.
Kättesaadavus
GPT‑6 Astra jõuab tänasest piiratud hulgale organisatsioonidele ning muutub lähipäevadel kättesaadavaks kõigile ChatGPT Plusi, Pro, Businessi ja Enterprise'i kasutajatele, samuti OpenAI API, Microsoft Azure'i ja AWS Bedrocki kaudu. Astra kasutus sisaldub olemasolevates tellimusmahtudes — kasutajad ja ettevõtted saavad lisakasutuse jaoks osta ka krediiti. Pro, Businessi ja Enterprise’i pakettide kasutajad saavad juurdepääsu ka versioonile GPT‑6 Astra Pro. Enterprise'i administraatorid saavad Astra oma tööjaama jaoks lubada; käivitamisel on juurdepääs vaikimisi välja lülitatud.
Astra toetab tingimustele vastavate API-klientide puhul põhimõtet „andmeid ei säilitata“ ning nagu eelmisel kuul teatasime, testime Private Safety Processingut, et tugevdada ohutusseiret, säilitades samal ajal kliendi privaatsuse.
Arendajatele on GPT‑6 Astra OpenAI API-s saadaval mudelinimega gpt-6-astra ning Microsoft Azure'i ja Amazon Bedrocki kaudu.
OpenAI API standardhinnastus on kümme dollarit miljoni sisendtokeni kohta ja 50 dollarit miljoni väljundtokeni kohta. Vahemälu lugemistele ja kirjutamistele kehtivad eraldi tariifid. Kiirrežiim on GPT‑6 Astra jaoks API-s saadaval ning pakub standardtöötlusega võrreldes kuni kahekordset kiirust kahekordse standardhinnaga.
Professionaalne
Professionaalne | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1 % | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Sisemised disainiülesanded | 50,0% | 47,4% | - | 35,8% | - | - |
Sisemised andmeteaduse ülesanded | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Kodeerimine
| Kodeerimine | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57 | 9% | 37 | 3% | 55 | 8% | 44 | 5% | 52 | 6% | 19 | 1% |
| DeepSWE v1.1 | 74 | 1% | 72 | 7% | 67 | 4% | 69 | 9% | 73 | 7% | 73 | 8% |
| FrontierCode 1.1 Extended (tulemus) | 64 | 5% 8 | 60 | 6% | 63 | 6% | 64 | 9% | 63 | 6% | 56 | 3% |
| FrontierCode 1.1 Main (tulemus) | 53 | 3% 8 | 47 | 5% | 50 | 9% | 53 | 5% | 53 | 4% | 43 | 6% |
| Sisemised andmebaasi migreerimise ülesanded | 63 | 9% | 42 | 7% | 57 | 8% | 50 | 3%" | - | - | ||
| Artificial Analysis kodeerimisagendi indeks v1.4 | 67 | 0 | 65 | 1" | - | 67,2, 68,1, 61,2 |
Akadeemiline
Akadeemiline | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (tööriistadega) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Teadus ja tervis
Vastavus
Vastavus | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Sisemine arvutikasutuse turvalisuse võrdlustest (madalam on parem) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Sisemine arvutikasutuse ohutuse võrdlustest, koos AutoReview’ga (madalam on parem) | 1,8% | 4,3% | - | - | - | - |
Sisemine kõrvalehoidmise võrdlustest (madalam on parem) | 0,00% | 0,29% | - | - | - | - |
ExploitGymi peibutusvõrk (madalam on parem) | 0,0% | 48,2% | - | - | - | - |
Võimatu ExploitGym | 100,0% | - | - | - | - | - |
Sisemine hallutsinatsioonide võrdlustest (madalam on parem) | 4,2% | 12,2% | - | - | - | - |
Pikk kontekst
Pikk kontekst | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K–1M | 96,3% | 73,8% | - | - | - | - |
Abstraktne arutlemine
| Abstraktne arutlusvõime | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99 | 9% 1 | 7 | 8% | - | - | 30 | 2% | - | ||
| ARC-AGI-2 | 95 | 0% | 92 | 5% | 90 | 0% | 89 | 2% | 90 | 4% | - |
| ARC-AGI-1 | 98 | 5% | 97 | 5% | 97 | 5% | 98 | 5% | 97 | 5 | - |
Hindamisskoorid kujutavad endast maksimaalset tulemust mis tahes pingutustaseme juures. GPT hindamised viidi läbi meie uurimiskeskkonnas või meie API kaudu, mis võib süsteemi viipade, saadaolevate tööriistade jms erinevuste tõttu anda tootmis-ChatGPT‑st veidi erineva tulemuse.
ALLMÄRKUSED
- 1
ARC-AGI-3 puhul kasutati GPT-6 Astrat meie Responses API täitmiskeskkonnaga, mis muudab kahte seadistust, et paremini vastata reaalsele jõudlusele. Muudatused ei ole konkreetselt suunatud ARC-AGI-3-le.
- 2
GPT-5.6 Sol viitab versioonile, mis on saadaval meie API-s, ChatGPT Codexis ja ChatGPT Workis. ChatGPT Chatis olev versioon on veidi erinev.
- 3
OSWorld V2-Offline on algse OSWorld V2 alamhulk, mis töötab ilma internetiühenduseta. Autorid reprodutseerisid Claude'i mudeli jõudluse OSWorld-V2 Offline'is ametlikus edetabelis(avaneb uues aknas). OSWorld 2.0 puhul kasutavad Claude'i skoorid ametlikke seadistusi, mitte Fable 5.1 süsteemikaardi muudetud ülesandeid ja muudetud hindamist.
- 4
- 5
BenchCADis peegeldavad Claude'i skoorid 3 hindamismuudatust, mida on üksikasjalikult kirjeldatud Fable 5.1 süsteemikaardil(avaneb uues aknas).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon ja Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(avaneb uues aknas)“. arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower ja Peter Jonas. „The OpenScore String Quartet Corpus(avaneb uues aknas)“. Proceedings of the 10th International Conference on Digital Libraries for Musicology, lk 49–57. ACM, 2023.
- 8
FrontierCode'is käitati GPT-6 Astrat arendaja sõnumiga, mis sarnanes Codexis oleva arendaja sõnumi jaotisega(avaneb uues aknas): „Väldi liigsete testfailide loomist. Loo uus testfail ainult siis, kui seda nõuavad hoidla reeglid või kui ükski olemasolev fail ei sobi. Väldi asjassepuutumatut puhastust ja tarbetut keerukust. Taaskasuta sobivaid olemasolevaid abivahendeid. Loe asjakohaseid hoidla juhiseid ja kontrolli lähedalasuvat koodi, teste, dokumentatsiooni ja CI-d. Järgi kehtestatud tavasid. Eesmärk on puhas, liitmiskõlbulik kood." Sisendviip ei olnud hindamise jaoks optimeeritud.
- 9
Esimene puudutab seda, kui lähedal võivad algarvud üksteisele esineda, olenemata sellest, kui kaugele piki arvtelge minna. Enam kui kümne aasta jooksul tõestas parim teadaolev tulemus, et leidub lõpmata palju algarvupaare, mille vahe on kõige rohkem 246. Julia Stadlmann(avaneb uues aknas) parandas hiljuti selle piiri 240-ni. Astra aitas kehtestada tugevama piiri 186, näidates, et sellest väiksemas vahemikus esineb lõpmatult palju paare. Väikesed vahed algarvude vahel: tõestus(avaneb uues aknas) ja toetavad uuringud(avaneb uues aknas).
- 10
Teine puudutab ebatavaliselt suuri vahesid algarvude vahel. Astra parandas nende vahede tõkkes olnud tegurit, mis oli jäänud muutumatuks enam kui 80 aastaks. Jagame mõlema tulemuse tõestusi ning lühendatud mõttekäike ja verifitseerimismaterjale. Suured algarvude vahed: tõestus(avaneb uues aknas) ja toetavad teadusuuringud(avaneb uues aknas).
- 11
- 12
- 13
- 14
ExploitBench (juuni–august 2026) sisaldab 20 kõrge raskusastmega V8 turvanõrkust 13 stabiilses Chrome’i väljalaskes. Võrdlustest kontrollib, kas agendid suudavad iga määratud haavatavust ära kasutades saavutada suvalise koodi käivitamise V8-s ja ametlikes Linuxi Chrome’i väljalasetes. Mõned kaasatud haavatavused ei pruugi hindamise piirangute tõttu võimaldada suvalise koodi käivitamist, mistõttu ei pruugi 100% õnnestumismäär olla saavutatav. Märkus: GPT-5.6 Soli 5,5% tulemus on tingitud jõudlustesti 300 vestlusvooru piirangust, mis ei ole piirang, millega max-i kasutavad tõelised kliendid kokku puutuksid. Sarnaste seadistuste juures saavutas mudel 11,5% tulemuse, kui see puutus kokku vähemate piirangutega.
- 15
Jeremy Spence et al. „The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(avaneb uues aknas).” arXiv:2608.11469v1, 2026.
- 16
Kolmandate osapoolte mudelite katsetamisel kasutame lihtsamat teaduskeskkonna seadistust. Codexil on keerukam tootmiskonfiguratsioon, mis võib põhjustada toormudeli erinevaid veamäärasid. Teenusepakkujapoolsed turvameetmed ja arvutitööriistade teostused on siiski erinevad. Kasutajad ei puutu Codexis kokku ilma kinnituseta stsenaariumiga, kuna tegemist on sisemise uurimiskonfiguratsiooniga.
- 17
