Uuden sukupolven älykkyys
Päivitys 22.9.2026: Laajennamme GPT‑6‑perhettämme GPT‑6 Solilla ja GPT‑6 Lunalla. Lue lisää.
Esittelemme GPT‑6 Astran, maailman älykkäimmän ja parhaiten linjassa olevan mallin.
GPT‑6 Astra yhdistää vuosien tutkimustyön ja merkittävät panostukset valmistavaan koulutukseen, vahvistusoppimiseen ja linjaukseen. Astra on huipputasoa tietokoneen käytössä, verkkoselailussa, ohjelmistotuotannossa, kyberturvallisuudessa, tieteessä ja ammattitoiminnassa. Astra saavuttaa FrontierMath Tier 4 -tasolla 98 %:n tuloksen ja on jo auttanut ratkaisemaan pitkään avoimina olleita ongelmia matematiikassa. Astra saavuttaa myös ARC-AGI-3-vertailutestissä 99,9 %:n tuloksen ja ExploitBenchissä 100 %:n tuloksen. Se avaa myös edistyneen tietokoneiden ja selainten käytön, sillä se suoriutuu vaativimmistakin ammattikäyttöön tarkoitetuista tehtävistä vertaansa vailla olevalla nopeudella, tarkkuudella ja harkintakyvyllä.
GPT‑6 Astra otetaan tänään käyttöön rajoitetulle joukolle organisaatioita, ja se tulee seuraavien päivien aikana saataville kaikille ChatGPT Plus-, Pro-, Business- ja Enterprise-käyttäjille sekä OpenAI API:n, Microsoft Azuren ja AWS Bedrockin kautta.
Astra on parhaiten linjassa oleva mallimme. Sen kyky ymmärtää käyttäjän aikomuksia ja mallin käyttäytymistä on parantunut merkittävästi, joten voit delegoida tehtäviä luottavaisemmin Astran harkintaan. Yhtenä tapana testata tätä kehitimme Hugging Face -tapauksen pohjalta uuden arvioinnin, jossa arvioidaan, ylittääkö vaikean tai mahdottoman tehtävän edessä oleva malli valtuuksiensa rajat. GPT‑5.6 Sol ylitti ilman tuotannon suojatoimia valtuutetun tavoitteen 48 %:ssa tapauksista, kun taas GPT‑6 Astra teki näin 0 %:ssa tapauksista.
Maailman paras tietokoneen käyttöön tarkoitettu malli
GPT‑6 Astra merkitsee uutta edistynyt tietokoneen käytön nopeudessa, tarkkuudessa ja turvallisuudessa. Se voi hoitaa työläitä tehtäviä, kuten verkkolomakkeiden täyttämistä, asiakastietojen päivittämistä CRM-järjestelmässä ja kalenterisi järjestämistä. Se voi tehdä verkkotutkimusta ja laatia tiivistelmiä sähköpostissasi tai asiakirjaeditorissasi. Se voi analysoida tieteellistä dataa, luoda kuvaajia, luoda verkkosivuston ja suorittaa käyttöliittymän laadunvarmistustarkistuksia varmistaakseen, että kaikki sivuston ominaisuudet toimivat. Se voi auttaa sinua asentamaan ja testaamaan ohjelmistoja itsenäisesti sekä ratkaisemaan näytöllä näkyviä ongelmia. Nämä parannukset näkyvät myös huipputason arviointituloksissamme.
Nämä parannukset johtavat myös merkittäviin tehokkuushyötyihin todellisissa tietotyöhön liittyvissä tehtävissä. OSWorld 2.0:n viivesimulaatioissa Astra saavuttaa GPT‑5.6:ta paremman tietokoneenkäytön suorituskyvyn noin 47 % lyhyemmässä ajassa tehtävää kohden. Sol, joka saavutti 72,6 %:n tuloksen noin 40 minuutissa tehtävää kohden, verrattuna 65,7 %:iin noin 75 minuutissa.3
GPT‑6 Astran tietokoneenkäyttöominaisuudet näkyvät eri alojen tuotoksissa, kuten pelikehityksessä, sähkötekniikassa ja jokapäiväisessä tietotyössä:
Astran ohella päivitämme myös Codexin arviointikehystä parantaaksemme merkittävästi tietokoneen käytön nopeutta. Yhdessä Astran tehokkuuden kanssa tämä nopeuttaa tehtävien suorittamista Mind2Web-vertailutestissä 1,9-kertaisesti verrattuna nykyiseen GPT‑5.6 Sol -käyttökokemukseen. Mallin nopeusparannusten ansiosta se voi hoitaa puolestasi monia aikaa vieviä arjen tehtäviä sinua nopeammin.4
Merkittävä harppaus asiantuntijatyössä
GPT‑6 Astra yhdistää tietokoneen käytön edistysaskeleet ammatillisiin ympäristöihin kohdennettuun koulutukseen, mikä auttaa ratkomaan monimutkaisia työtehtäviä. Se yhdistää monimutkaisten ongelmien ratkaisemiseen tarvittavan älykkyyden kykyyn toteuttaa monivaiheisia työnkulkuja ja tuottaa viimeisteltyjä asiakirjoja, laskentataulukoita ja esityksiä.
GPT‑6 Astra on paras mallimme olemassa olevien mallipohjien noudattamiseen ja hyvin aseteltujen diojen tuottamiseen, joissa keskeiset kohdat välittyvät tiiviisti jäsennellyn kerronnan avulla. Se luo selkeitä, hyvin jäsenneltyjä asiakirjoja, esityksiä, laskentataulukoita ja analyysejä, jotka noudattavat mallipohjiasi ja vastaavat kirjoitustyyliäsi ja visuaalista tyyliäsi. Astra on myös koulutettu sisällyttämään tuotoksiinsa nimenomaan vain merkityksellisen kontekstin sen sijaan, että se toistaisi käsillä olevan tehtävän kannalta tarpeetonta tietoa. Kaikki tämä tarkoittaa, että se voi tuottaa entistä välittömämmin hyödynnettäviä tuotoksia, jotka vastaavat liiketoimintakontekstiasi ja standardejasi.
GPT‑6 Astra tuo myös vahvempaa visuaalista harkintakykyä rakentamiinsa verkkosivustoihin, peleihin, sovelluksiin ja renderöinteihin. ChatGPT:n Sites(avautuu uudessa ikkunassa) -toiminnolla Astra voi luoda, isännöidä ja jakaa verkkosivustoja, verkkosovelluksia ja pelejä suoraan kehotteesta.
Kun ohjeet jättävät tulkinnanvaraa, GPT‑6 Astra osaa tehdä oikean ratkaisun aiempia malleja paremmin. Se hyödyntää asiayhteyttä täydentääkseen tavanomaiset puuttuvat kohdat ja esittää tarkentavia kysymyksiä, kun vastaus voisi muuttaa lopputulosta. Codexissa se voi esittää kysymyksiä asynkronisesti ja jatkaa samalla työtä, joka ei riipu vastauksestasi. Jos et vastaa, se etenee tarvittaessa järkevien oletusten pohjalta, mutta odottaa kannanottoasi merkittävien päätösten kohdalla.
Alla olevat esimerkit havainnollistavat, miten Astra tekee yhteistyötä arkisissa tehtävissä, joissa puuttuvat tiedot voivat muuttaa vastausta olennaisesti.
Astra pystyy myös paremmin säilyttämään kokonaiskuvan tehtävän kehittyessä. Aiemmat mallit pitivät ohjausviestejä toisinaan uutena tavoitteena ja kadottivat alkuperäisen pyynnön tai aiemmat rajoitukset. Astra ottaa uudet vaatimukset huomioon, muuttaa suuntaa pyydettäessä ja vastaa sivukysymyksiin unohtamatta laajempaa tehtävää.
Koodaus
GPT‑6 Astra on tähän mennessä paras malli ohjelmistotekniikkaan.
“GPT‑6 Astra tarjoaa huipputason suorituskyvyn sisäisissä koodausvertailuissamme ja osoittaa selkeää edistystä kaupankäynti-intuition arvioinneissa verrattuna GPT‑5.6 Soliin. Agenttipohjaisessa koodauksessa GPT‑6 Astra viestii tavalla, jota kehittäjien on helpompi seurata, ja tuottaa koodia, joka vaatii vähemmän iteraatioita saavuttaakseen tuotantotason laadun.”
“Testasimme Astraa matalalla, Keskitaso ja Korkea päättelyteholla yhdessä ensimmäisen sukupolven arvioinneistamme, ja se suoriutui huomattavasti paremmin kuin GPT 5.6 Sol. Suurempi päättelyteho mahdollistaa enemmän iteraatioita uudessa koontiversiossa, enemmän varmennusta selaintestauksen avulla ja suosii koodin suorittamista apply-patch-toiminnon sijaan. Se, että ymmärrämme, miten malli käyttää päättelypanostaan, antaa meille mahdollisuuden tarjota miljoonille kehittäjille nopeamman ja luotettavamman polun ideasta toimivaan sovellukseen.”
Astran myötä esittelemme Codexiin uuden tavan säilyttää ja hakea kontekstia, kun konteksti-ikkuna täyttyy. Mallit ovat perinteisesti käyttäneet kontekstin tiivistämistä työn yhteenvedon laatimiseen pitkien istuntojen aikana, esimerkiksi monimutkaisten ongelmien vianmäärityksessä tai laajojen refaktorointien yhteydessä. Jokaisessa kontekstin tiivistämisessä voi jäädä pois yksityiskohtia siitä, miksi korjaus epäonnistui tai miten komponentti käyttäytyy. Codex, Astra voi säilyttää muistiinpanoja konteksti-ikkunoiden välillä ja pitää kertyneet yksityiskohdat tallessa ilman, että niitä pakataan toistuvasti yhdeksi yhteenvedoksi. Aiemmat konteksti-ikkunat ovat edelleen haettavissa, joten Astra voi löytää vaatimuksia tai testituloksia aiemmista viesteistä ja työkalujen tulosteista, vaikka kyseisiä tietoja ei olisi tallennettu sen muistiinpanoihin. Voit ottaa tämän kokeellisen ominaisuuden käyttöön Codexin config.toml-tiedostossa,(avautuu uudessa ikkunassa) ja siitä tulee Astran oletusarvo tulevien viikkojen aikana.
Tieteellisten löytöjen edistäminen
Astra voi auttaa tieteellisten löytöjen taustalla olevassa käytännön työssä. Yhdistämällä tieteellisen päättelyn tietokoneen käyttöön se voi käyttää erikoisohjelmistoja suoraan datan tarkasteluun ja tulosten tutkimiseen, mikä auttaa tutkijoita arvioimaan näyttöä ja päättämään, mitä tutkia seuraavaksi.
Kyberturvallisuus
Kuten turvallisuuspäivityksessämme keskustelimme, Astra on merkittävä harppaus kyberkyvykkyyksissä ja saavuttaa kyberturvallisuuden kriittisen kynnyksen Valmiuskehyksemme mukaisesti. Sen kyky tunnistaa ja kehittää nollapäivähaavoittuvuuksien hyväksikäyttömenetelmiä voi auttaa puolustajia löytämään ja korjaamaan heikkouksia, mutta se luo myös tarpeen vahvemmille suojatoimille. Ymmärtääksemme, kuinka pitkälle nämä kyvykkyydet ulottuvat, testasimme Astraa sisäisissä ja ulkopuolisten asiantuntijoiden arvioinneissa.
Testasimme ensin mallia ilman tuotannon suojatoimia ExploitBench- ja ExploitGym-vertailutesteissä, joissa arvioidaan, pystyvätkö mallit muuttamaan tunnettuja ohjelmistohaavoittuvuuksia toimiviksi hyväksikäyttömenetelmiksi. ExploitBenchissä Astra saavutti täydet 100 %, kun aiemman edistyneen kyberominaisuuksiin kykenevän mallimme GPT‑5.6 Solin tulos oli 78,5 %. ExploitGymissä Astra saavutti 42,4 %:n onnistumisasteen verrattuna GPT‑5.6 Solin 30,3 %:iin käyttäen samalla huomattavasti vähemmän tulostokeneja.13
Koska oli huolta siitä, että altistuminen aiemmille ohjelmistohaavoittuvuuksille on saattanut vaikuttaa vertailutestien tuloksiin, arvioimme Astraa myös kahdella uudella vertailutestillä. Ensinnäkin rakensimme sisäisen ”ExploitBench (kesä–elokuu 2026)” -arvioinnin, jolla testattiin exploit-kehitystä edeltävien kolmen kuukauden haavoittuvuuksien avulla.14 Astra saavutti huomattavasti suuremmat mielivaltaisen koodin suorittamisasteet kuin GPT‑5.6 Sol tällä tietoaineistolla käyttäen huomattavasti vähemmän tulostokeneja. Arvioinnin aikana Astra jopa löysi kaksi aiemmin tuntematonta nollapäivähaavoittuvuutta ja hyödynsi niitä. Raportoimme molemmat haavoittuvuudet niiden ylläpitäjille.
Testasimme Astraa myös SRE-Bench15-vertailussa, joka mittaa, pystyvätkö mallit käänteissuunnittelemaan ohjelmistobinäärejä ymmärtääkseen niiden ydintoimintalogiikan ilman pääsyä raakaan lähdekoodiin. Astra ratkaisi 88,0 % tehtävistä yhdellä yrityksellä ja 99,2 % neljän yrityksen kuluessa, kun GPT‑5.6 Solin vastaavat osuudet olivat 55,9 % ja 68,7 %.
Vertailutestien lisäksi asiantuntijoiden johtamissa arvioinneissa havaittiin, että Astra pystyi ilman tuotantokäytön suojamekanismeja ajaessaan hyödyntämään aiemmin tuntemattomia haavoittuvuuksia mielivaltaisen koodin suorittamiseen kovennetuissa selaimissa sekä luomaan käyttöoikeuksien laajentamiseen tarkoitettuja hyväksikäyttömenetelmiä kovennetuille käyttöjärjestelmille.
Kuten käsittelimme artikkelissa The Defender’s Window, edistyneet kyberominaisuudet voivat auttaa puolustajia löytämään heikkouksia nopeammin, mutta ne myös tekevät näiden heikkouksien hyödyntämisestä helpompaa, mikä korostaa puolustajien sopeutumisen kiireellisyyttä. Tänään julkaistavan Astra-version myötä puolustajat voivat käyttää sitä tehtäviin, kuten tietoturvalliseen koodikatselmointiin ja korjausten tekemiseen.
Astra kuitenkin kieltäytyy suorittamasta edistyneempiä kyberturvallisuustehtäviä, kuten haavoittuvuuksien konseptin toimivuuden osoittavien hyödyntämiskoodien luomista. OpenAI Daybreakin kautta aiomme laajentaa käyttöoikeuksia ja ottaa käyttöön vähemmän rajoittavia suojatoimia tulevien viikkojen aikana. Tämä mahdollistaa entistä puolustuksellisemmat työnkulut, kuten haavoittuvuuksien ja proof-of-concept-toteutusten validoinnin, haittaohjelma-analyysin sekä havaitsemismenetelmien kehittämisen.
Olemme myös vahvistaneet suojauksiamme mahdollista kyberväärinkäyttöä vastaan GPT‑5.6 Solin suojatoimikokonaisuuden pohjalta. Näihin kuuluvat mallin parempi kestävyys mahdollista rajoitusten kiertämistä (jailbreak) vastaan sekä enemmän kontekstia valvontajärjestelmillemme. Olemme jatkaneet perusteellista sisäistä ja ulkoista testausta, mukaan lukien automatisoidut arvioinnit sisäisten hyökkäävän tietoturvatestauksen testaajiemme kanssa. Lisätietoja kybersuojauksestamme ja testauksestamme on saatavilla Astran turvallisuuskatsauksessa ja järjestelmäkortissa(avautuu uudessa ikkunassa).
GPT‑6 Astran vastuullinen linjaaminen ja käyttöönotto
Astra on parhaiten ihmisten tarkoitusperien mukainen mallimme. Astra on erityisen hyvä toimimaan huolellisesti, kunnioittamaan tehtävän rajoja ja viestimään avoimesti. Tämä työ on uusin tulos pitkäaikaisesta tutkimusohjelmastamme, joka keskittyy sellaisten mallien kouluttamiseen, jotka pysyvät ihmisten tarkoitusperien mukaisina alusta loppuun.
Herkissä ympäristöissä Astra toimii riskin edellyttämällä varovaisuudella. Arvioinnissa, jossa tietokoneen käyttöön liittyvät tehtävät oli valittu adversariaalisesti ei-toivotun toiminnan esiin saamiseksi, Astra onnistui paremmin välttämään tahattomia seurauksia. Oletusarvoisesti tarjottujen lisäturvatoimien käyttäminen tuotti vielä paremman suorituskyvyn.
Astra aiheuttaa vähemmän vinoutuneita lopputuloksia kuin yksikään muu testattu edistynyt malli. Tasapuolisen vertailun vuoksi käytimme yleistä tietokonetta käyttävän agentin arviointikehystä (joka perustuu sekä OpenAI Responses API:ssa(avautuu uudessa ikkunassa) että Anthropic Messages API:ssa(avautuu uudessa ikkunassa) saatavilla oleviin natiiveihin tietokoneen käyttötyökaluihin) ilman lisäsuojauksia, joita tavallisesti otetaan käyttöön Codexin ja ChatGPT Workin käyttäjille (automaattinen tarkistus, vahvistuskäytäntö).
Astra toimii myös todennäköisemmin käyttäjän asettamien ja ympäristönsä edellyttämien rajojen puitteissa. Sisäisessä arvioinnissa Astra ei koskaan yrittänyt kiertää Codex automaattitarkastuksen hylkäystä. Tämä piti paikkansa silloinkin, kun Auto-review oli tarkoituksella määritetty kierrettävissä olevaksi ja tehtävää oli muuten mahdotonta suorittaa loppuun. Tämä ympäristön rajoitusten kunnioittaminen on linjassa tämän julkaisun johdannossa esittelemämme mahdottoman kybertehtävän arvioinnin tulosten sekä järjestelmäkortissamme(avautuu uudessa ikkunassa) dokumentoitujen muiden havaintojen kanssa.
Astra asettaa lisäksi uusia standardeja läpinäkyvässä käyttäjäviestinnässä. Eräässä arvioinnissa Astra on kolme kertaa epätodennäköisempi kuin GPT‑5.6 Sol esittää virheellisiä väitteitä kyvyistään ja mahdollisuuksistaan.
Kyvykkyyshallusinaatioita koskevassa arvioinnissamme Astra osoittaa merkittävää parannusta verrattuna GPT‑5.6 Soliin ja esittää kyvyistään vähemmän harhaanjohtavia väitteitä.
Arvioinneissamme havaittiin, että Astran kirjallista päättelyä on vaikeampi valvoa kuin GPT‑5.6 Solin osalta testien perusteella, joissa sitä nimenomaisesti pyydettiin välttelemään valvontaa. Selitämme tämän sillä, että Astra hallitsee paremmin kirjallista päättelyään yksinkertaisemmissa tehtävissä ja pystyy ratkaisemaan ongelmia vähemmillä kirjallisilla vaiheilla. Astralla vaikuttaa edelleen olevan vaikeuksia peittää monimutkaisissa tehtävissä tarvittavaa päättelyä, mutta suhtaudumme heikkenemiseen vakavasti. Valvottavuuden parantaminen on edelleen tutkimusprioriteetti, ja oheisessa järjestelmäkortissa(avautuu uudessa ikkunassa) kerrotaan havainnoistamme ja meneillään olevasta työstämme.
Linjauskoulutus on käyttöönottoa koskevan lähestymistapamme keskeinen osa. Lisäpuolustuskerroksena rakennamme myös järjestelmätason suojatoimia, kuten Codex automaattisen katselmoinnin(avautuu uudessa ikkunassa) sekä agenttien päättelyn ja toimien valvonnan, jotta voimme havaita ja rajoittaa vaarallista käyttäytymistä. Kuten turvallisuuspäivityksessämme kuvataan, otamme Astra-luokan mallien tuotantokäytössä käyttöön myös kohdistuspoikkeamien valvonnan, jotta saamme näkyvyyttä kohdistuspoikkeamiin ja voimme auttaa rajoittamaan niiden vakavimpia tapauksia. Nämä suojatoimet muistuttavat sisäisten käyttöönottojemme valvontaa. Luokittimista koostuva järjestelmä tarkistaa mallin päättelyn ja toiminnan luvattoman käyttäytymisen varalta ja pysäyttää mahdollisesti luvattoman toiminnan automaattisesti.
Koska Astran kyberturvallisuuskyvyt ovat lisääntyneet merkittävästi, olemme erityisen huolellisia varmistaaksemme, että tämä käyttöönotto on turvallinen ja tietoturvallinen. Lisäturvatarkistukset voivat joskus hidastaa, keskeyttää tai pysäyttää oikeutettua työtä, mukaan lukien puolustava kyberturvallisuustyö. Jos tehtävä keskeytetään ChatGPT:ssä tai Codexissa, sinua voidaan pyytää tarkistamaan toiminto ennen jatkamista. API:ssa tehtävä pysähtyy. Nämä tarkistukset voivat joskus keskeyttää oikeutettua työtä, ja kehitämme järjestelmää edelleen vähentääksemme tarpeettomia keskeytyksiä. Kohdistuspoikkeamien valvonta ei voi korvata kohdistusta: tavoitteenamme on rakentaa malleja, jotka pysyvät luotettavasti valtuuksiensa rajoissa, jotta näiden suojatoimien ei tarvitse puuttua toimintaan.
Saatavuus
GPT‑6 Astra otetaan tänään käyttöön rajoitetulle joukolle organisaatioita, ja se tulee seuraavien päivien aikana saataville kaikille ChatGPT Plus-, Pro-, Business- ja Enterprise-käyttäjille sekä OpenAI API:n, Microsoft Azuren ja AWS Bedrockin kautta. Astra-käyttö sisältyy nykyisiin tilauskiintiöihin – käyttäjät ja yritykset voivat myös ostaa krediittejä lisäkäyttöä varten. Pro-, Business- ja Enterprise-tilausten käyttäjät saavat myös käyttöoikeuden GPT‑6 Astra Pro -palveluun. Enterprise-ylläpitäjät voivat ottaa Astran käyttöön työtilassaan; käyttöoikeus on oletusarvoisesti pois käytöstä julkaisun yhteydessä.
Astra tukee tietojen määräaikaista säilyttämistä ehdot täyttäville API-asiakkaille, ja kuten kerroimme viime kuussa, testaamme yksityistä turvallisuuskäsittelyä vahvistaaksemme turvallisuuden seurantaa ja säilyttääksemme samalla asiakkaiden tietosuojan.
Kehittäjille GPT‑6 Astra tulee saataville OpenAI API:ssa nimellä gpt-6-astra sekä Microsoft Azuren ja Amazon Bedrockin kautta.
OpenAI API Standardin hinta on 10 dollaria miljoonaa syöttötunnusta kohti ja 50 dollaria miljoonaa tulostunnusta kohti. Välimuistin lukemiseen ja kirjoittamiseen sovelletaan eri hintoja. Nopea tila on saatavilla GPT‑6 Astra -mallille API:ssa, ja se tarjoaa jopa kaksinkertaisen nopeuden Vakio-käsittelyyn verrattuna kaksinkertaisella Vakio-hinnalla.
Tietokoneen käyttö
Tietokoneen käyttö | GPT‑6 Astra | GPT‑5.6 Sol2 | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Agents’ Last Exam (Agenttien viimeinen koe) | 59,3 % | 53,6 % | - | 48,7 % | 55,5 % | - |
OSWorld 2.0 (v2026.08.08, offline-aineisto, osittainen pistemäärä) | 72,6 % | 65,7 % | - | - | 70,2 %3 | - |
ScreenSpot-Pro (ei työkaluja) | 92,7 % | 76,9% | - | 87,3 %17 | - | - |
Ammattilainen
Ammattilainen | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4 % | - | 87,4 % | 90,8 % | - |
OpenScore jousikvartetot (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Sisäiset suunnittelutehtävät | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Sisäiset datatieteen tehtävät | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Artificial Analysis -älykkyysindeksi v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Koodaus
| Ohjelmointi | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 44,5 % | 52,6 % | 19,1 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 69,9 % | 73,7 % | 73,8 % |
| FrontierCode 1.1 Extended (pistemäärä) | 64,5 % 8 | 60,6 % | 63,6 % | 64,9 % | 63,6 % | 56,3 % |
| FrontierCode 1.1 Pääversio (pisteet) | 53,3 % 8 | 47,5 % | 50,9 % | 53,5 % | 53,4 % | 43,6 % |
| Sisäiset tietokantamigraatiotehtävät | 63,9 % | 42,7 % | 57,8 % | 50,3 % | - | - |
| Artificial Analysis -koodausagentti-indeksi v1,4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akateeminen
Akateeminen | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | - |
FrontierMath taso 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 90,2 % | 73,2 % | - |
GPQA-diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,7 % | 95,3 % |
Ihmiskunnan viimeinen koe (työkaluilla) | 57,2 % | - | 65,0 % | 63,8 % | 63,6 % | - |
Tiede ja terveys
Kyberturvallisuus
Kohdistaminen
Kohdistaminen | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Sisäisen tietokoneenkäytön turvallisuuden vertailuarvo (alhaisempi on parempi) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Sisäinen tietokoneen käytön turvallisuuden vertailutesti, mukana AutoReview (pienempi on parempi) | 1,8 % | 4,3 % | - | - | - | - |
Sisäinen kiertämisen vertailuarvo (pienempi on parempi) | 0,00 % | 0,29 % | - | - | - | - |
ExploitGym-hunajapurkki (pienempi on parempi) | 0,0 % | 48,2 % | - | - | - | - |
Mahdoton ExploitGym | 100,0 % | - | - | - | - | - |
Sisäinen hallusinaatioiden vertailumittari (mitä pienempi, sitä parempi) | 4,2 % | 12,2 % | - | - | - | - |
Pitkä konteksti
Pitkä konteksti | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-neulainen 256–512 K | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8-neulainen 512 K – 1 M | 96,3 % | 73,8 % | - | - | - | - |
Abstrakti ajattelu
| Abstrakti päättely | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9 % 1 | 7,8 % | - | - | 30,2 % | - |
| ARC-AGI-2 | 95,0 % | 92,5 % | 90,0 % | 89,2 % | 90,4 % | - |
| ARC-AGI-1 | 98,5 | 97,5 % | 97,5 % | 98,5 % | 97,5 % | - |
Arviointipisteet ovat enimmäistasolla kaikilla panostustasoilla. GPT‑arvioinnit suoritettiin tutkimusympäristössämme tai API:mme kautta, mikä voi tuottaa hieman erilaisia tuloksia kuin tuotannossa käytettävä ChatGPT, koska järjestelmäkehotteet, käytettävissä olevat työkalut jne. eroavat toisistaan.
Alaviitteet
- 1
ARC-AGI-3:ssa GPT-6 Astra ajettiin Responses API -arviointikehyksellämme, joka muuttaa kahta asetusta vastaamaan paremmin todellista suorituskykyä. Muutokset eivät kohdistu erityisesti ARC-AGI-3:een.
- 2
GPT-5.6 Solilla tarkoitetaan versiota, joka on saatavilla API-rajapinnassamme, ChatGPT Codexissa ja ChatGPT Workissa. ChatGPT:n Chat-kokemuksessa oleva versio on hieman erilainen.
- 3
OSWorld V2-Offline on alkuperäisen OSWorld V2:n osajoukko, joka toimii ilman internet-yhteyttä. Tekijät toistivat Claude-mallin suorituskyvyn OSWorld-V2 Offlinessa virallisella tulostaulukolla(avautuu uudessa ikkunassa). OSWorld 2.0:ssa Clauden tuloksissa käytetään virallisia asetuksia eikä Fable 5.1 -järjestelmäkortin muokattuja tehtäviä ja muokattua arviointia.
- 4
- 5
BenchCAD:ssa Clauden pisteet heijastavat arviointiin tehtyä kolmea muutosta, jotka on kuvattu yksityiskohtaisesti Fable 5.1 -järjestelmäkortissa(avautuu uudessa ikkunassa).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon ja Noah A. Smith. ”LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(avautuu uudessa ikkunassa).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower ja Peter Jonas. ”The OpenScore String Quartet Corpus(avautuu uudessa ikkunassa).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, s. 49–57. ACM, 2023.
- 8
FrontierCodessa GPT-6 Astraa käytettiin kehittäjäviestillä, joka oli samankaltainen kuin osa sen Codexissa olevasta kehittäjäviestistä(avautuu uudessa ikkunassa): "Vältä liiallisten testitiedostojen luomista. Luo uusi testitiedosto vain, kun repositorion käytännöt sitä edellyttävät tai kun mikään olemassa oleva tiedosto ei sovellu siihen. Vältä asiaankuulumatonta siistimistä ja tarpeetonta monimutkaisuutta. Käytä sopivia olemassa olevia apuohjelmia uudelleen. Lue asiaankuuluvat repositorion ohjeet ja tarkasta lähistön koodi, testit, dokumentaatio ja CI. Noudata vakiintuneita käytäntöjä. Tavoitteena on puhdas, yhdistettävissä oleva koodi." Kehotetta ei optimoitu arviointia varten.
- 9
Ensimmäinen koskee sitä, kuinka lähellä toisiaan alkuluvut voivat esiintyä riippumatta siitä, kuinka pitkälle lukusuoralla edetään. Yli vuosikymmenen ajan paras tunnettu tulos osoitti, että äärettömän monen alkulukuparin välinen ero on enintään 246. Julia Stadlmann(avautuu uudessa ikkunassa) paransi hiljattain kyseisen rajan arvoon 240. Astra auttoi osoittamaan tiukemman rajan 186, mikä osoittaa, että äärettömän monta paria esiintyy enintään tämän pienemmän etäisyyden päässä toisistaan. Lyhyet alkulukuvälit: todistus(avautuu uudessa ikkunassa) ja sitä tukeva tutkimus(avautuu uudessa ikkunassa).
- 10
Toinen koskee epätavallisen suuria alkulukujen välisiä aukkoja. Astra paransi erästä termiä näitä aukkoja koskevassa ylärajassa, joka oli pysynyt muuttumattomana yli 80 vuotta. Jaamme molempien tulosten todistukset, lyhennetyt ajatusketjut ja varmennusmateriaalit. Suuret alkulukuvälit: todistus(avautuu uudessa ikkunassa) ja asiaa tukeva tutkimus(avautuu uudessa ikkunassa).
- 11
- 12
- 13
- 14
ExploitBench (kesä–elokuu 2026) sisältää 20 vakavaa V8-haavoittuvuutta 13 vakaassa Chromen julkaisussa. Vertailutesti arvioi, voivatko agentit suorittaa mielivaltaista koodia V8:ssa ja virallisissa Linuxille tarkoitetuissa Chrome-julkaisuissa hyödyntämällä kutakin määritettyä haavoittuvuutta. Jotkin mukana olevat haavoittuvuudet eivät välttämättä salli mielivaltaisen koodin suorittamista arvioinnin rajoitteiden puitteissa, joten 100 %:n onnistumisprosentti ei välttämättä ole saavutettavissa. Huomautus: GPT-5.6 Solin 5,5 %:n tulos johtuu vertailutestin 300 kierroksen rajasta, joka ei rajoittaisi Maxia käyttäviä todellisia asiakkaita. Malli saavutti vastaavilla asetuksilla 11,5 %:n tuloksen, kun se törmäsi harvempiin rajoihin.
- 15
Jeremy Spence et al. ”The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(avautuu uudessa ikkunassa).” arXiv:2608.11469v1, 2026.
- 16
Kun testaamme kolmannen osapuolen malleja, käytämme yksinkertaisempaa tutkimusasetelmaa. Codexilla on monimutkaisempi tuotantokonfiguraatio, mikä voi johtaa erilaisiin raakamallin virhemääriin. Palveluntarjoajakohtaiset suojatoimet ja tietokonetyökalujen toteutukset eroavat edelleen. Käyttäjät eivät kohtaa Codexissa tilannetta, jossa vahvistusta ei pyydetä, sillä kyseessä on sisäinen tutkimuskonfiguraatio.
- 17
