OpenAI

GPT-6 Astra: A new generation of intelligence

Uuden sukupolven älykkyys

Päivitys 22.9.2026: Laajennamme GPT‑6‑perhettämme GPT‑6 Solilla ja GPT‑6 Lunalla. Lue lisää.

Esittelemme GPT‑6 Astran, maailman älykkäimmän ja parhaiten linjassa olevan mallin.

GPT‑6 Astra yhdistää vuosien tutkimustyön ja merkittävät panostukset valmistavaan koulutukseen, vahvistusoppimiseen ja linjaukseen. Astra on huipputasoa tietokoneen käytössä, verkkoselailussa, ohjelmistotuotannossa, kyberturvallisuudessa, tieteessä ja ammattitoiminnassa. Astra saavuttaa FrontierMath Tier 4 -tasolla 98 %:n tuloksen ja on jo auttanut ratkaisemaan pitkään avoimina olleita ongelmia⁠ matematiikassa. Astra saavuttaa myös ARC-AGI-3-vertailutestissä 99,9 %:n tuloksen ja ExploitBenchissä 100 %:n tuloksen. Se avaa myös edistyneen tietokoneiden ja selainten käytön, sillä se suoriutuu vaativimmistakin ammattikäyttöön tarkoitetuista tehtävistä vertaansa vailla olevalla nopeudella, tarkkuudella ja harkintakyvyllä. 

GPT‑6 Astra otetaan tänään käyttöön rajoitetulle joukolle organisaatioita, ja se tulee seuraavien päivien aikana saataville kaikille ChatGPT Plus-, Pro-, Business- ja Enterprise-käyttäjille sekä OpenAI API:n, Microsoft Azuren ja AWS Bedrockin kautta.

“ARC-AGI-3:ssa Astra ylitti ihmisen toimintatehokkuuden vertailutasomme 96 %:lla tasoista ja saavutti käytännössä ihmisen tason vertailutestissä. Kyseessä ei ole ainoastaan paras koskaan testaamamme malli, vaan se merkitsee myös merkittävää harppausta edistyneiden mallien suorituskyvyssä – niin kyvyssä navigoida uusissa ympäristöissä ja ratkaista niitä kuin myös siinä, kuinka tehokkaasti se oppii tekemään niin.”
Greg Kamradt, ARC Prize Foundation

Astra on parhaiten linjassa oleva mallimme. Sen kyky ymmärtää käyttäjän aikomuksia ja mallin käyttäytymistä on parantunut merkittävästi, joten voit delegoida tehtäviä luottavaisemmin Astran harkintaan. Yhtenä tapana testata tätä kehitimme Hugging Face -tapauksen pohjalta uuden arvioinnin, jossa arvioidaan, ylittääkö vaikean tai mahdottoman tehtävän edessä oleva malli valtuuksiensa rajat. GPT‑5.6 Sol ylitti ilman tuotannon suojatoimia valtuutetun tavoitteen 48 %:ssa tapauksista, kun taas GPT‑6 Astra teki näin 0 %:ssa tapauksista.

Maailman paras tietokoneen käyttöön tarkoitettu malli

GPT‑6 Astra merkitsee uutta edistynyt tietokoneen käytön nopeudessa, tarkkuudessa ja turvallisuudessa. Se voi hoitaa työläitä tehtäviä, kuten verkkolomakkeiden täyttämistä, asiakastietojen päivittämistä CRM-järjestelmässä ja kalenterisi järjestämistä. Se voi tehdä verkkotutkimusta ja laatia tiivistelmiä sähköpostissasi tai asiakirjaeditorissasi. Se voi analysoida tieteellistä dataa, luoda kuvaajia, luoda verkkosivuston ja suorittaa käyttöliittymän laadunvarmistustarkistuksia varmistaakseen, että kaikki sivuston ominaisuudet toimivat. Se voi auttaa sinua asentamaan ja testaamaan ohjelmistoja itsenäisesti sekä ratkaisemaan näytöllä näkyviä ongelmia. Nämä parannukset näkyvät myös huipputason arviointituloksissamme.

Nämä parannukset johtavat myös merkittäviin tehokkuushyötyihin todellisissa tietotyöhön liittyvissä tehtävissä. OSWorld 2.0:n viivesimulaatioissa Astra saavuttaa GPT‑5.6:ta paremman tietokoneenkäytön suorituskyvyn noin 47 % lyhyemmässä ajassa tehtävää kohden. Sol, joka saavutti 72,6 %:n tuloksen noin 40 minuutissa tehtävää kohden, verrattuna 65,7 %:iin noin 75 minuutissa.3

GPT‑6 Astran tietokoneenkäyttöominaisuudet näkyvät eri alojen tuotoksissa, kuten pelikehityksessä, sähkötekniikassa ja jokapäiväisessä tietotyössä:

Astran ohella päivitämme myös Codexin arviointikehystä parantaaksemme merkittävästi tietokoneen käytön nopeutta. Yhdessä Astran tehokkuuden kanssa tämä nopeuttaa tehtävien suorittamista Mind2Web-vertailutestissä 1,9-kertaisesti verrattuna nykyiseen GPT‑5.6 Sol -käyttökokemukseen. Mallin nopeusparannusten ansiosta se voi hoitaa puolestasi monia aikaa vieviä arjen tehtäviä sinua nopeammin.4

“Integroimme GPT‑6 Astran Devinin arviointikehykseen julkaisupäivänä, jolloin se saavuttaa huipputason suorituskyvyn sisäisessä testausvertailussamme. Sen erinomaiset valmiudet käyttää tietokonetta, kirjoittaa ja ymmärtää koodikantaa paransivat testausta heti alusta alkaen: videoita on huomattavasti helpompi seurata, ja raportit ovat selkeämpiä ja tiiviimpiä”
Silas Alberti, tutkimuksesta vastaava johtaja, Cognition

Merkittävä harppaus asiantuntijatyössä

GPT‑6 Astra yhdistää tietokoneen käytön edistysaskeleet ammatillisiin ympäristöihin kohdennettuun koulutukseen, mikä auttaa ratkomaan monimutkaisia työtehtäviä. Se yhdistää monimutkaisten ongelmien ratkaisemiseen tarvittavan älykkyyden kykyyn toteuttaa monivaiheisia työnkulkuja ja tuottaa viimeisteltyjä asiakirjoja, laskentataulukoita ja esityksiä.

GPT‑6 Astra on paras mallimme olemassa olevien mallipohjien noudattamiseen ja hyvin aseteltujen diojen tuottamiseen, joissa keskeiset kohdat välittyvät tiiviisti jäsennellyn kerronnan avulla. Se luo selkeitä, hyvin jäsenneltyjä asiakirjoja, esityksiä, laskentataulukoita ja analyysejä, jotka noudattavat mallipohjiasi ja vastaavat kirjoitustyyliäsi ja visuaalista tyyliäsi. Astra on myös koulutettu sisällyttämään tuotoksiinsa nimenomaan vain merkityksellisen kontekstin sen sijaan, että se toistaisi käsillä olevan tehtävän kannalta tarpeetonta tietoa. Kaikki tämä tarkoittaa, että se voi tuottaa entistä välittömämmin hyödynnettäviä tuotoksia, jotka vastaavat liiketoimintakontekstiasi ja standardejasi.

GPT‑6 Astra tuo myös vahvempaa visuaalista harkintakykyä rakentamiinsa verkkosivustoihin, peleihin, sovelluksiin ja renderöinteihin. ChatGPT:n Sites⁠(avautuu uudessa ikkunassa) -toiminnolla Astra voi luoda, isännöidä ja jakaa verkkosivustoja, verkkosovelluksia ja pelejä suoraan kehotteesta.

”Astra antaa meille merkittävän edun sekä suorituskyvyssä että tehokkuudessa. Se suorittaa onnistuneesti vaativimmat luovat työnkulkumme käyttäen jopa 20 % vähemmän tokeneita kuin muut testaamamme mallit. Mikä tärkeintä, asiakkaillemme se tarkoittaa laadukkaampaa tuotosta.”
Alex Mashrabov, Higgsfield AI:n toimitusjohtaja ja yksi perustajista

Kun ohjeet jättävät tulkinnanvaraa, GPT‑6 Astra osaa tehdä oikean ratkaisun aiempia malleja paremmin. Se hyödyntää asiayhteyttä täydentääkseen tavanomaiset puuttuvat kohdat ja esittää tarkentavia kysymyksiä, kun vastaus voisi muuttaa lopputulosta. Codexissa se voi esittää kysymyksiä asynkronisesti ja jatkaa samalla työtä, joka ei riipu vastauksestasi. Jos et vastaa, se etenee tarvittaessa järkevien oletusten pohjalta, mutta odottaa kannanottoasi merkittävien päätösten kohdalla.

Alla olevat esimerkit havainnollistavat, miten Astra tekee yhteistyötä arkisissa tehtävissä, joissa puuttuvat tiedot voivat muuttaa vastausta olennaisesti.

Astra pystyy myös paremmin säilyttämään kokonaiskuvan tehtävän kehittyessä. Aiemmat mallit pitivät ohjausviestejä toisinaan uutena tavoitteena ja kadottivat alkuperäisen pyynnön tai aiemmat rajoitukset. Astra ottaa uudet vaatimukset huomioon, muuttaa suuntaa pyydettäessä ja vastaa sivukysymyksiin unohtamatta laajempaa tehtävää.

”Astra on merkittävä laadullinen parannus GPT‑5.6 Soliin verrattuna monimutkaisissa oikeudellisissa tehtävissä. Varhaisessa testauksessamme Astra erottui edukseen lähestymällä oikeudellista työtä kuten tarkkanäköinen juristi: se erottaa asiakirjat vakiintuneista tiedoista, nostaa esiin oletukset, joille ei ole tukea, ja muuntaa aukot konkreettisiksi laadinnan lähtökohdiksi.”
Niko Grupen, Head of Applied Research, Harvey

Koodaus

GPT‑6 Astra on tähän mennessä paras malli ohjelmistotekniikkaan.

1 / 2
“GPT‑6 Astra tarjoaa huipputason suorituskyvyn sisäisissä koodausvertailuissamme ja osoittaa selkeää edistystä kaupankäynti-intuition arvioinneissa verrattuna GPT‑5.6 Soliin. Agenttipohjaisessa koodauksessa GPT‑6 Astra viestii tavalla, jota kehittäjien on helpompi seurata, ja tuottaa koodia, joka vaatii vähemmän iteraatioita saavuttaakseen tuotantotason laadun.”
John Crepezzi, tekoälyavustajat, Jane Street

Astran myötä esittelemme Codexiin uuden tavan säilyttää ja hakea kontekstia, kun konteksti-ikkuna täyttyy. Mallit ovat perinteisesti käyttäneet kontekstin tiivistämistä työn yhteenvedon laatimiseen pitkien istuntojen aikana, esimerkiksi monimutkaisten ongelmien vianmäärityksessä tai laajojen refaktorointien yhteydessä. Jokaisessa kontekstin tiivistämisessä voi jäädä pois yksityiskohtia siitä, miksi korjaus epäonnistui tai miten komponentti käyttäytyy. Codex, Astra voi säilyttää muistiinpanoja konteksti-ikkunoiden välillä ja pitää kertyneet yksityiskohdat tallessa ilman, että niitä pakataan toistuvasti yhdeksi yhteenvedoksi. Aiemmat konteksti-ikkunat ovat edelleen haettavissa, joten Astra voi löytää vaatimuksia tai testituloksia aiemmista viesteistä ja työkalujen tulosteista, vaikka kyseisiä tietoja ei olisi tallennettu sen muistiinpanoihin. Voit ottaa tämän kokeellisen ominaisuuden käyttöön Codexin config.toml-tiedostossa,⁠(avautuu uudessa ikkunassa) ja siitä tulee Astran oletusarvo tulevien viikkojen aikana.

Tieteellisten löytöjen edistäminen

”Tarinan ydin on: yhden aikakauden loppu, toisen alku.”
Greg Burnham, EpochAI

GPT‑6 Astra on merkittävä edistysaskel tieteellisen tutkimuksen, matematiikan ja terveydenhuollon kannalta. Tänään kerromme kahdesta lisätuloksesta, jotka koskevat alkulukujen välisiä aukkoja.9 ja 10

Astra tekee myös uusia ennätyksiä useissa matematiikan ja luonnontieteiden arvioinneissa.

Astra voi auttaa tieteellisten löytöjen taustalla olevassa käytännön työssä. Yhdistämällä tieteellisen päättelyn tietokoneen käyttöön se voi käyttää erikoisohjelmistoja suoraan datan tarkasteluun ja tulosten tutkimiseen, mikä auttaa tutkijoita arvioimaan näyttöä ja päättämään, mitä tutkia seuraavaksi.

Kyberturvallisuus

Kuten turvallisuuspäivityksessämme⁠ keskustelimme, Astra on merkittävä harppaus kyberkyvykkyyksissä ja saavuttaa kyberturvallisuuden kriittisen kynnyksen Valmiuskehyksemme mukaisesti. Sen kyky tunnistaa ja kehittää nollapäivähaavoittuvuuksien hyväksikäyttömenetelmiä voi auttaa puolustajia löytämään ja korjaamaan heikkouksia, mutta se luo myös tarpeen vahvemmille suojatoimille. Ymmärtääksemme, kuinka pitkälle nämä kyvykkyydet ulottuvat, testasimme Astraa sisäisissä ja ulkopuolisten asiantuntijoiden arvioinneissa.

Testasimme ensin mallia ilman tuotannon suojatoimia ExploitBench- ja ExploitGym-vertailutesteissä, joissa arvioidaan, pystyvätkö mallit muuttamaan tunnettuja ohjelmistohaavoittuvuuksia toimiviksi hyväksikäyttömenetelmiksi. ExploitBenchissä Astra saavutti täydet 100 %, kun aiemman edistyneen kyberominaisuuksiin kykenevän mallimme GPT‑5.6 Solin tulos oli 78,5 %. ExploitGymissä Astra saavutti 42,4 %:n onnistumisasteen verrattuna GPT‑5.6 Solin 30,3 %:iin käyttäen samalla huomattavasti vähemmän tulostokeneja.13

Koska oli huolta siitä, että altistuminen aiemmille ohjelmistohaavoittuvuuksille on saattanut vaikuttaa vertailutestien tuloksiin, arvioimme Astraa myös kahdella uudella vertailutestillä. Ensinnäkin rakensimme sisäisen ”ExploitBench (kesä–elokuu 2026)” -arvioinnin, jolla testattiin exploit-kehitystä edeltävien kolmen kuukauden haavoittuvuuksien avulla.14 Astra saavutti huomattavasti suuremmat mielivaltaisen koodin suorittamisasteet kuin GPT‑5.6 Sol tällä tietoaineistolla käyttäen huomattavasti vähemmän tulostokeneja. Arvioinnin aikana Astra jopa löysi kaksi aiemmin tuntematonta nollapäivähaavoittuvuutta ja hyödynsi niitä. Raportoimme molemmat haavoittuvuudet niiden ylläpitäjille.

Testasimme Astraa myös SRE-Bench15-vertailussa, joka mittaa, pystyvätkö mallit käänteissuunnittelemaan ohjelmistobinäärejä ymmärtääkseen niiden ydintoimintalogiikan ilman pääsyä raakaan lähdekoodiin. Astra ratkaisi 88,0 % tehtävistä yhdellä yrityksellä ja 99,2 % neljän yrityksen kuluessa, kun GPT‑5.6 Solin vastaavat osuudet olivat 55,9 % ja 68,7 %.

Vertailutestien lisäksi asiantuntijoiden johtamissa arvioinneissa havaittiin, että Astra pystyi ilman tuotantokäytön suojamekanismeja ajaessaan hyödyntämään aiemmin tuntemattomia haavoittuvuuksia mielivaltaisen koodin suorittamiseen kovennetuissa selaimissa sekä luomaan käyttöoikeuksien laajentamiseen tarkoitettuja hyväksikäyttömenetelmiä kovennetuille käyttöjärjestelmille.

Kuten käsittelimme artikkelissa The Defender’s Window, edistyneet kyberominaisuudet voivat auttaa puolustajia löytämään heikkouksia nopeammin, mutta ne myös tekevät näiden heikkouksien hyödyntämisestä helpompaa, mikä korostaa puolustajien sopeutumisen kiireellisyyttä. Tänään julkaistavan Astra-version myötä puolustajat voivat käyttää sitä tehtäviin, kuten tietoturvalliseen koodikatselmointiin ja korjausten tekemiseen.

Astra kuitenkin kieltäytyy suorittamasta edistyneempiä kyberturvallisuustehtäviä, kuten haavoittuvuuksien konseptin toimivuuden osoittavien hyödyntämiskoodien luomista. OpenAI Daybreakin⁠ kautta aiomme laajentaa käyttöoikeuksia ja ottaa käyttöön vähemmän rajoittavia suojatoimia tulevien viikkojen aikana. Tämä mahdollistaa entistä puolustuksellisemmat työnkulut, kuten haavoittuvuuksien ja proof-of-concept-toteutusten validoinnin, haittaohjelma-analyysin sekä havaitsemismenetelmien kehittämisen.

Olemme myös vahvistaneet suojauksiamme mahdollista kyberväärinkäyttöä vastaan GPT‑5.6 Solin suojatoimikokonaisuuden pohjalta. Näihin kuuluvat mallin parempi kestävyys mahdollista rajoitusten kiertämistä (jailbreak) vastaan sekä enemmän kontekstia valvontajärjestelmillemme. Olemme jatkaneet perusteellista sisäistä ja ulkoista testausta, mukaan lukien automatisoidut arvioinnit sisäisten hyökkäävän tietoturvatestauksen testaajiemme kanssa. Lisätietoja kybersuojauksestamme ja testauksestamme on saatavilla Astran turvallisuuskatsauksessa⁠ ja järjestelmäkortissa⁠(avautuu uudessa ikkunassa).

GPT‑6 Astran vastuullinen linjaaminen ja käyttöönotto

Astra on parhaiten ihmisten tarkoitusperien mukainen mallimme. Astra on erityisen hyvä toimimaan huolellisesti, kunnioittamaan tehtävän rajoja ja viestimään avoimesti. Tämä työ on uusin tulos pitkäaikaisesta tutkimusohjelmastamme, joka keskittyy sellaisten mallien kouluttamiseen, jotka pysyvät ihmisten tarkoitusperien mukaisina alusta loppuun.

Herkissä ympäristöissä Astra toimii riskin edellyttämällä varovaisuudella. Arvioinnissa, jossa tietokoneen käyttöön liittyvät tehtävät oli valittu adversariaalisesti ei-toivotun toiminnan esiin saamiseksi, Astra onnistui paremmin välttämään tahattomia seurauksia. Oletusarvoisesti tarjottujen lisäturvatoimien käyttäminen tuotti vielä paremman suorituskyvyn.

Astra aiheuttaa vähemmän vinoutuneita lopputuloksia kuin yksikään muu testattu edistynyt malli. Tasapuolisen vertailun vuoksi käytimme yleistä tietokonetta käyttävän agentin arviointikehystä (joka perustuu sekä OpenAI Responses API:ssa⁠(avautuu uudessa ikkunassa) että Anthropic Messages API:ssa⁠(avautuu uudessa ikkunassa) saatavilla oleviin natiiveihin tietokoneen käyttötyökaluihin) ilman lisäsuojauksia, joita tavallisesti otetaan käyttöön Codexin ja ChatGPT Workin käyttäjille (automaattinen tarkistus, vahvistuskäytäntö).

Astra toimii myös todennäköisemmin käyttäjän asettamien ja ympäristönsä edellyttämien rajojen puitteissa. Sisäisessä arvioinnissa Astra ei koskaan yrittänyt kiertää Codex automaattitarkastuksen hylkäystä. Tämä piti paikkansa silloinkin, kun Auto-review oli tarkoituksella määritetty kierrettävissä olevaksi ja tehtävää oli muuten mahdotonta suorittaa loppuun. Tämä ympäristön rajoitusten kunnioittaminen on linjassa tämän julkaisun johdannossa esittelemämme mahdottoman kybertehtävän arvioinnin tulosten sekä järjestelmäkortissamme⁠(avautuu uudessa ikkunassa) dokumentoitujen muiden havaintojen kanssa.

Astra asettaa lisäksi uusia standardeja läpinäkyvässä käyttäjäviestinnässä. Eräässä arvioinnissa Astra on kolme kertaa epätodennäköisempi kuin GPT‑5.6 Sol esittää virheellisiä väitteitä kyvyistään ja mahdollisuuksistaan.

Kyvykkyyshallusinaatioita koskevassa arvioinnissamme Astra osoittaa merkittävää parannusta verrattuna GPT‑5.6 Soliin ja esittää kyvyistään vähemmän harhaanjohtavia väitteitä.

Arvioinneissamme havaittiin, että Astran kirjallista päättelyä on vaikeampi valvoa kuin GPT‑5.6 Solin osalta testien perusteella, joissa sitä nimenomaisesti pyydettiin välttelemään valvontaa. Selitämme tämän sillä, että Astra hallitsee paremmin kirjallista päättelyään yksinkertaisemmissa tehtävissä ja pystyy ratkaisemaan ongelmia vähemmillä kirjallisilla vaiheilla. Astralla vaikuttaa edelleen olevan vaikeuksia peittää monimutkaisissa tehtävissä tarvittavaa päättelyä, mutta suhtaudumme heikkenemiseen vakavasti. Valvottavuuden parantaminen on edelleen tutkimusprioriteetti, ja oheisessa järjestelmäkortissa⁠(avautuu uudessa ikkunassa) kerrotaan havainnoistamme ja meneillään olevasta työstämme.

Linjauskoulutus on käyttöönottoa koskevan lähestymistapamme keskeinen osa. Lisäpuolustuskerroksena rakennamme myös järjestelmätason suojatoimia, kuten Codex automaattisen katselmoinnin⁠(avautuu uudessa ikkunassa) sekä agenttien päättelyn ja toimien valvonnan, jotta voimme havaita ja rajoittaa vaarallista käyttäytymistä. Kuten turvallisuuspäivityksessämme⁠ kuvataan, otamme Astra-luokan mallien tuotantokäytössä käyttöön myös kohdistuspoikkeamien valvonnan, jotta saamme näkyvyyttä kohdistuspoikkeamiin ja voimme auttaa rajoittamaan niiden vakavimpia tapauksia. Nämä suojatoimet muistuttavat sisäisten käyttöönottojemme valvontaa. Luokittimista koostuva järjestelmä tarkistaa mallin päättelyn ja toiminnan luvattoman käyttäytymisen varalta ja pysäyttää mahdollisesti luvattoman toiminnan automaattisesti.

Koska Astran kyberturvallisuuskyvyt ovat lisääntyneet merkittävästi, olemme erityisen huolellisia varmistaaksemme, että tämä käyttöönotto on turvallinen ja tietoturvallinen. Lisäturvatarkistukset voivat joskus hidastaa, keskeyttää tai pysäyttää oikeutettua työtä, mukaan lukien puolustava kyberturvallisuustyö. Jos tehtävä keskeytetään ChatGPT:ssä tai Codexissa, sinua voidaan pyytää tarkistamaan toiminto ennen jatkamista. API:ssa tehtävä pysähtyy. Nämä tarkistukset voivat joskus keskeyttää oikeutettua työtä, ja kehitämme järjestelmää edelleen vähentääksemme tarpeettomia keskeytyksiä. Kohdistuspoikkeamien valvonta ei voi korvata kohdistusta: tavoitteenamme on rakentaa malleja, jotka pysyvät luotettavasti valtuuksiensa rajoissa, jotta näiden suojatoimien ei tarvitse puuttua toimintaan.

Saatavuus

GPT‑6 Astra otetaan tänään käyttöön rajoitetulle joukolle organisaatioita, ja se tulee seuraavien päivien aikana saataville kaikille ChatGPT Plus-, Pro-, Business- ja Enterprise-käyttäjille sekä OpenAI API:n, Microsoft Azuren ja AWS Bedrockin kautta. Astra-käyttö sisältyy nykyisiin tilauskiintiöihin – käyttäjät ja yritykset voivat myös ostaa krediittejä lisäkäyttöä varten. Pro-, Business- ja Enterprise-tilausten käyttäjät saavat myös käyttöoikeuden GPT‑6 Astra Pro -palveluun. Enterprise-ylläpitäjät voivat ottaa Astran käyttöön työtilassaan; käyttöoikeus on oletusarvoisesti pois käytöstä julkaisun yhteydessä.

Astra tukee tietojen määräaikaista säilyttämistä ehdot täyttäville API-asiakkaille, ja kuten kerroimme viime kuussa, testaamme yksityistä turvallisuuskäsittelyä vahvistaaksemme turvallisuuden seurantaa ja säilyttääksemme samalla asiakkaiden tietosuojan.

Kehittäjille GPT‑6 Astra tulee saataville OpenAI API:ssa nimellä gpt-6-astra sekä Microsoft Azuren ja Amazon Bedrockin kautta.

OpenAI API Standardin hinta on 10 dollaria miljoonaa syöttötunnusta kohti ja 50 dollaria miljoonaa tulostunnusta kohti. Välimuistin lukemiseen ja kirjoittamiseen sovelletaan eri hintoja. Nopea tila on saatavilla GPT‑6 Astra -mallille API:ssa, ja se tarjoaa jopa kaksinkertaisen nopeuden Vakio-käsittelyyn verrattuna kaksinkertaisella Vakio-hinnalla.

Tietokoneen käyttö

Tietokoneen käyttö

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents’ Last Exam (Agenttien viimeinen koe)

59,3 %

53,6 %

-

48,7 %

55,5 %

-

OSWorld 2.0 (v2026.08.08, offline-aineisto, osittainen pistemäärä)

72,6 %

65,7 %

-

-

70,2 %3

-

ScreenSpot-Pro (ei työkaluja)

92,7 %

76,9%

-

87,3 %17

-

-

Ammattilainen

Ammattilainen

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3 %

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8 %

-

OpenScore jousikvartetot (1 - OMR-NED)

0,84

0,19

-

-

-

-

Sisäiset suunnittelutehtävät

50,0 %

47,4 %

-

35,8 %

-

-

Sisäiset datatieteen tehtävät

40,9 %

30,5 %

-

34,7 %

-

-

Artificial Analysis -älykkyysindeksi v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Koodaus

OhjelmointiGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %44,5 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %69,9 %73,7 %73,8 %
FrontierCode 1.1 Extended (pistemäärä)64,5 % 860,6 %63,6 %64,9 %63,6 %56,3 %
FrontierCode 1.1 Pääversio (pisteet)53,3 % 847,5 %50,9 %53,5 %53,4 %43,6 %
Sisäiset tietokantamigraatiotehtävät63,9 %42,7 %57,8 %50,3 %--
Artificial Analysis -koodausagentti-indeksi v1,467,065,1-67,268,161,2

Akateeminen

Akateeminen

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4 %

30,0 %

-

FrontierMath taso 4 (v2)

97,6 %

83,0 %

87,8 %

90,2 %

73,2 %

-

GPQA-diamond

96,0 %

94,6 %

93,7 %

92,6 %

93,7 %

95,3 %

Ihmiskunnan viimeinen koe (työkaluilla)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Tiede ja terveys

Tiede ja ChatGPT‑terveysGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1 %32,3 %----
MedChemBench (sisäinen)49,3 %47,4 %----
LifeSciBench60,3 %59,9 %----
HealthBench Professional (pituuskorjattu)63,4 %60,5 %58,1 % 1160,9 % 1156,4 % 1152,1 %

Kyberturvallisuus

KyberturvallisuusGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0 %78,5 %--70 %-
ExploitGym42,4 % 1330,3 % 1330,4 % 1728,4 %1722,0 %-
ExploitBench (kesäkuu–elokuu 2026)39,0 %5,5 %----
SRE-Bench88,0 %55,9 %--12,5 %-
SEC-Bench Pro85,4 %79,1 %----

Kohdistaminen

Kohdistaminen

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Sisäisen tietokoneenkäytön turvallisuuden vertailuarvo (alhaisempi on parempi)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Sisäinen tietokoneen käytön turvallisuuden vertailutesti, mukana AutoReview (pienempi on parempi)

1,8 %

4,3 %

-

-

-

-

Sisäinen kiertämisen vertailuarvo (pienempi on parempi)

0,00 %

0,29 %

-

-

-

-

ExploitGym-hunajapurkki (pienempi on parempi)

0,0 %

48,2 %

-

-

-

-

Mahdoton ExploitGym

100,0 %

-

-

-

-

-

Sisäinen hallusinaatioiden vertailumittari (mitä pienempi, sitä parempi)

4,2 %

12,2 %

-

-

-

-

Pitkä konteksti

Pitkä konteksti

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-neulainen 256–512 K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8-neulainen 512 K – 1 M

96,3 %

73,8 %

-

-

-

-

Abstrakti ajattelu

Abstrakti päättelyGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8 %--30,2 %-
ARC-AGI-295,0 %92,5 %90,0 %89,2 %90,4 %-
ARC-AGI-198,5 97,5 %97,5 %98,5 %97,5 %-

Arviointipisteet ovat enimmäistasolla kaikilla panostustasoilla. GPT‑arvioinnit suoritettiin tutkimusympäristössämme tai API:mme kautta, mikä voi tuottaa hieman erilaisia tuloksia kuin tuotannossa käytettävä ChatGPT, koska järjestelmäkehotteet, käytettävissä olevat työkalut jne. eroavat toisistaan.

Alaviitteet

  1. 1

    ARC-AGI-3:ssa GPT-6 Astra ajettiin Responses API -arviointikehyksellämme⁠, joka muuttaa kahta asetusta vastaamaan paremmin todellista suorituskykyä. Muutokset eivät kohdistu erityisesti ARC-AGI-3:een.

  2. 2

    GPT-5.6 Solilla tarkoitetaan versiota, joka on saatavilla API-rajapinnassamme, ChatGPT Codexissa ja ChatGPT Workissa. ChatGPT:n Chat-kokemuksessa oleva versio on hieman erilainen.⁠

  3. 3

    OSWorld V2-Offline on alkuperäisen OSWorld V2:n osajoukko, joka toimii ilman internet-yhteyttä. Tekijät toistivat Claude-mallin suorituskyvyn OSWorld-V2 Offlinessa virallisella tulostaulukolla⁠(avautuu uudessa ikkunassa). OSWorld 2.0:ssa Clauden tuloksissa käytetään virallisia asetuksia eikä Fable 5.1 -järjestelmäkortin muokattuja tehtäviä ja muokattua arviointia.

  4. 4

    Mallin ajat ovat vastaavien demonstraatioajojen ilmoitettuja kuluneita aikoja. Näytettävät leikkeet ovat muokattuja otteita.

  5. 5

    BenchCAD:ssa Clauden pisteet heijastavat arviointiin tehtyä kolmea muutosta, jotka on kuvattu yksityiskohtaisesti Fable 5.1 -järjestelmäkortissa⁠(avautuu uudessa ikkunassa).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon ja Noah A. Smith. ”LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(avautuu uudessa ikkunassa).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower ja Peter Jonas. ”The OpenScore String Quartet Corpus⁠(avautuu uudessa ikkunassa).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, s. 49–57. ACM, 2023.

  8. 8

    FrontierCodessa GPT-6 Astraa käytettiin kehittäjäviestillä, joka oli samankaltainen kuin osa sen Codexissa olevasta kehittäjäviestistä⁠(avautuu uudessa ikkunassa): "Vältä liiallisten testitiedostojen luomista. Luo uusi testitiedosto vain, kun repositorion käytännöt sitä edellyttävät tai kun mikään olemassa oleva tiedosto ei sovellu siihen. Vältä asiaankuulumatonta siistimistä ja tarpeetonta monimutkaisuutta. Käytä sopivia olemassa olevia apuohjelmia uudelleen. Lue asiaankuuluvat repositorion ohjeet ja tarkasta lähistön koodi, testit, dokumentaatio ja CI. Noudata vakiintuneita käytäntöjä. Tavoitteena on puhdas, yhdistettävissä oleva koodi." Kehotetta ei optimoitu arviointia varten.

  9. 9

    Ensimmäinen koskee sitä, kuinka lähellä toisiaan alkuluvut voivat esiintyä riippumatta siitä, kuinka pitkälle lukusuoralla edetään. Yli vuosikymmenen ajan paras tunnettu tulos osoitti, että äärettömän monen alkulukuparin välinen ero on enintään 246. Julia Stadlmann⁠(avautuu uudessa ikkunassa) paransi hiljattain kyseisen rajan arvoon 240. Astra auttoi osoittamaan tiukemman rajan 186, mikä osoittaa, että äärettömän monta paria esiintyy enintään tämän pienemmän etäisyyden päässä toisistaan. Lyhyet alkulukuvälit: todistus⁠(avautuu uudessa ikkunassa) ja sitä tukeva tutkimus⁠(avautuu uudessa ikkunassa).

  10. 10

    Toinen koskee epätavallisen suuria alkulukujen välisiä aukkoja. Astra paransi erästä termiä näitä aukkoja koskevassa ylärajassa, joka oli pysynyt muuttumattomana yli 80 vuotta. Jaamme molempien tulosten todistukset, lyhennetyt ajatusketjut ja varmennusmateriaalit. Suuret alkulukuvälit: todistus⁠(avautuu uudessa ikkunassa) ja asiaa tukeva tutkimus⁠(avautuu uudessa ikkunassa).

  11. 11

    Arvioimme itsenäisesti kaikki Claude-mallit tarkoitetun HealthBench Professional -menettelyn mukaisesti käyttäen GPT‑5.4:ää arviointi ja pituuden mukaan korjatut, rajaamattomat pistemäärät. Fable 5.1:ssä käytimme Opus 5:tä varavaihtoehtona palveluntarjoajan kieltäytymistilanteissa.

  12. 12

    Claude Fable 5 ja 5.1 eivät ole mukana LifeSciBench Gold v1:ssä, GeneBench Pro v13:ssa ja MedChemBenchissä, koska ne kieltäytyvät vastaamasta suurimpaan osaan näiden arviointien kysymyksistä.

  13. 13

    ExploitGym-alustalla testasimme Astraa ja Solia ilman 6 tunnin aikarajaa, jotta voisimme arvioida paremmin niiden koko kyberkyvykkyyden. Ne ovat niin nopeita, että sillä on vain vähäinen vaikutus.

  14. 14

    ExploitBench (kesä–elokuu 2026) sisältää 20 vakavaa V8-haavoittuvuutta 13 vakaassa Chromen julkaisussa. Vertailutesti arvioi, voivatko agentit suorittaa mielivaltaista koodia V8:ssa ja virallisissa Linuxille tarkoitetuissa Chrome-julkaisuissa hyödyntämällä kutakin määritettyä haavoittuvuutta. Jotkin mukana olevat haavoittuvuudet eivät välttämättä salli mielivaltaisen koodin suorittamista arvioinnin rajoitteiden puitteissa, joten 100 %:n onnistumisprosentti ei välttämättä ole saavutettavissa. Huomautus: GPT-5.6 Solin 5,5 %:n tulos johtuu vertailutestin 300 kierroksen rajasta, joka ei rajoittaisi Maxia käyttäviä todellisia asiakkaita. Malli saavutti vastaavilla asetuksilla 11,5 %:n tuloksen, kun se törmäsi harvempiin rajoihin.

  15. 15
  16. 16

    Kun testaamme kolmannen osapuolen malleja, käytämme yksinkertaisempaa tutkimusasetelmaa. Codexilla on monimutkaisempi tuotantokonfiguraatio, mikä voi johtaa erilaisiin raakamallin virhemääriin. Palveluntarjoajakohtaiset suojatoimet ja tietokonetyökalujen toteutukset eroavat edelleen. Käyttäjät eivät kohtaa Codexissa tilannetta, jossa vahvistusta ei pyydetä, sillä kyseessä on sisäinen tutkimuskonfiguraatio.

  17. 17

    ScreenSpot-Pro:n ja ExploitGymin osalta raportoimamme Fable-pisteet ovat peräisin Mythoksesta, joka on Fable, jossa on vähemmän suojatoimia.