Siirry pääsisältöön
OpenAI

GPT-6.1Sol

Jatkuvasti edistynyttä suorituskykyä: lähes Astran älykkyys viidesosalla hinnasta

Esittelemme GPT‑6.1 Solin, GPT‑6 Solin päivitetyn version, jonka suorituskyky on poikkeuksellisen vahva agenttipohjaisessa koodauksessa, tietokoneen käytössä ja ammattityössä. Se tuo Solin lähemmäs GPT‑6 Astraa vaativissa tehtävissä viidesosalla Astran syöte- ja tulostetokenien normaalihinnoista. Näin kehittäjät voivat rakentaa ja käyttää kyvykkäitä agentteja laajemmin samalla budjetilla.

GPT‑6.1 Sol tarjoaa lähes Astran suorituskyvyn Solin hinnalla, mikä tekee siitä tämän hetken kustannustehokkaimman mallin suhteessa suorituskykyyn. Välimuistissa oleva syöte maksaa vain 0,10 dollaria miljoonalta tokenilta eli 95 % vähemmän kuin syöte normaalisti. Tämä tekee mallista edullisemman agenttitehtävissä, joissa samaa kontekstia on käytettävä toistuvissa pyynnöissä.

GPT‑6 Astra on edelleen kokonaisuutena kyvykkäin edistynyt mallimme. GPT‑6.1 Sol tarjoaa uuden tasapainon kyvykkyyden ja kustannusten välillä tärkeisiin töihin, joita käyttäjät haluavat tehdä useammin, sekä API-asiakkaille, jotka rakentavat ja käyttävät sovelluksia suuressa mittakaavassa.

Kolme mallikorttia: GPT-6 Astra, älykkäin mallimme parhaisiin tuloksiin, syöte 10 $, tuloste 50 $ ja välimuistissa oleva syöte 1 $; GPT-6.1 Sol, lähes Astran älykkyys viidesosalla hinnasta, syöte 2 $, tuloste 10 $ ja välimuistissa oleva syöte 0,10 $; GPT-6 Luna, nopeaa ja tehokasta arkityötä suuressa mittakaavassa, syöte 0,10 $, tuloste 0,50 $ ja välimuistissa oleva syöte 0,01 $.

Kyvykkäämpi Sol eri tehtäviin

GPT‑6.1 Sol on huomattava parannus GPT‑6 Soliin vaativissa ammattitehtävissä koodin kirjoittamisesta ja virheenkorjauksesta asiakirjojen ymmärtämiseen ja monivaiheisten liiketoimintaprosessien suorittamiseen. Useissa näistä arvioinneista se lähestyy GPT‑6 Astran suorituskykyä huomattavasti pienemmin kustannuksin.

Koodaus

DeepSWE v1.1 arvioi monimutkaisia ohjelmistokehitystehtäviä todellisissa koodikannoissa. Siinä GPT‑6.1 Sol yltää GPT‑6 Astran tasolle noin viidesosalla kustannuksista ja ylittää GPT‑6 Solin parhaan tuloksen 6,4 prosenttiyksiköllä matalammalla päättelyn tasolla ja pienemmin kustannuksin.

Vertailutestissä DeepSWE 1.1⁠⁠(avautuu uudessa ikkunassa) tekoälyagentit ratkaisevat alkuperäisiä, pitkäkestoisia ohjelmistokehitystehtäviä.

Ammattityö

GDP.pdf mittaa, miten tarkasti mallit vastaavat ammatillisiin kysymyksiin monimutkaisten PDF-asiakirjojen pohjalta. Asiakirjoissa on taulukoita, kaavioita, kuvioita ja pienellä painettuja yksityiskohtia. GPT‑6.1 Sol saa siinä paremmat pisteet kuin Opus 5.5 varamalleineen, ja sen tehtäväkohtainen kustannus on alle puolet kaikilla testatuilla päättelyn asetuksilla. Se myös lähestyy GPT‑6 Astran huipputason suorituskykyä noin viidesosalla tehtäväkohtaisesta kustannuksesta.

Vertailutestissä GDP.pdf⁠(avautuu uudessa ikkunassa) mallien on vastattava tosielämän kehotteisiin, jotka koskevat monimutkaisia PDF-tiedostoja. Tiedostot ovat peräisin rahoitusalan, terveydenhuollon, oikeusalan ja seitsemän muun ammattialan työnkuluista.

AutomationBench mittaa, suorittavatko agentit monivaiheiset liiketoimintaprosessit oikein. Siinä GPT‑6.1 Sol saa päättelyn keskitasolla 2,2 prosenttiyksikköä paremmat pisteet kuin Opus 5.5 noin kolmanneksella kustannuksista. Tulos on myös 4,8 prosenttiyksikköä parempi kuin GPT‑6 Solin samalla asetuksella.

In AutomationBench 1.0.6⁠⁠(avautuu uudessa ikkunassa), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Tietokoneen käyttö

GPT‑6.1 Sol edistyy huomattavasti myös tehtävissä, jotka edellyttävät tietokonesovellusten käyttöä. OSWorld 2.0 arvioi agentteja vaativissa tietokoneen käyttöön liittyvissä työnkuluissa. Sen offline-aineistossa GPT‑6.1 Sol ylittää GPT‑6 Solin tuloksen seitsemällä prosenttiyksiköllä päättelyn enimmäistasolla alle puolella kustannuksista. Päättelyn enimmäistasolla se jää vain 2,1 prosenttiyksikön päähän Astran tuloksesta noin seitsemäsosalla tehtäväkohtaisesta kustannuksesta.

In OSWorld 2.0⁠⁠(avautuu uudessa ikkunassa), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Tieteellinen tutkimus

Terminal-Bench Science 0.1 arvioi tieteellisiä työnkulkuja, kuten data-analyysiä, simulointia ja lauseiden todistamista. Siinä GPT‑6.1 Sol saa päättelyn enimmäistasolla yli kaksinkertaiset pisteet GPT‑6 Soliin verrattuna alle puolella tehtäväkohtaisesta kustannuksesta. Päättelyn enimmäistasolla GPT‑6.1 Sol maksaa keskimäärin 5,47 dollaria tehtävää kohden, kun Opus 5.5 maksaa 23,21 dollaria ja Astra 23,80 dollaria. Se tarjoaa vahvaa tieteellistä osaamista yli 75 % pienemmin kustannuksin kuin kumpikaan näistä malleista.

GPT‑6 Astra saavuttaa edelleen testattujen mallien parhaan tuloksen, 68,1 %, ja sitä kannattaa käyttää kaikkein vaikeimpiin tieteellisiin tutkimustehtäviin.

Vertailutestissä Terminal-Bench Science 0.1⁠(avautuu uudessa ikkunassa) agentit suorittavat tieteellisen tutkimuksen työnkulkuja koodin ja päätetyökalujen avulla. Ne muun muassa analysoivat dataa, ajavat simulaatioita ja sovittavat malleja.

Asiatarkkuus

GPT‑6.1 Sol parantaa myös asiatarkkuutta vaikeissa kehotteissa. Erittäin korkealla päättelyn tasolla sen asiavirheiden osuus on 4,1 %, kun GPT‑6 Solin osuus on 4,5 % ja Astran 4,0 % samalla asetuksella. Tulos on siis lähempänä Astraa, mutta tehtäväkohtainen kustannus on noin 83 % pienempi.

Tässä arvioinnissa mitataan vähintään yhden asiavirheen sisältävien vastausten osuutta keskusteluissa, joista on poistettu tunnistetiedot ja joissa käyttäjät ovat ilmoittaneet aiemman mallin virheestä. Nämä tarkoituksella vaikeat kehotteet eivät edusta tavanomaista käyttöä.

Arvioimme asiatarkkuutta ChatGPT‑keskusteluissa, joista on poistettu tunnistetiedot ja joissa käyttäjät ovat ilmoittaneet aiemman mallin tekemästä asiavirheestä. Nämä virheisiin johtavat keskustelut eivät edusta tavanomaista käyttöä, jossa asiavirheet ovat harvinaisempia.

GPT‑6.1 Solin turvallinen käyttöönotto

GPT‑6.1 Sol parantaa huomattavasti GPT‑6 Solin tuloksia arvioinneissamme, jotka mittaavat mallien toimintaa ihmisten tavoitteiden mukaisesti. Näin se lähestyy GPT‑6 Astraa.

GPT‑6.1 Sol kertoo rajoituksistaan avoimemmin ja noudattaa käyttäjän tarkoitusta ja turvallisuusrajoitteita luotettavammin. Haastavissa arvioinneissa se epäonnistuu GPT‑6 Solia harvemmin toimimattomista hakutyökaluista kertomisessa, nimenomaisten rajoitusten noudattamisessa ja luvattomien lopputulosten välttämisessä agenttitehtävien aikana. Emme havainneet yrityksiä ohittaa automaattista turvallisuustarkistusta, kuten emme myöskään GPT‑6 Astran tai GPT‑6 Solin kohdalla.

Alla olevat arvioinnit testaavat tarkoituksella haastavia tilanteita eivätkä mittaa epäonnistumisten osuutta tavanomaisessa käytössä.

Hinnoittelu ja saatavuus

GPT‑6.1 Sol on tästä päivästä alkaen kaikkien Plus-, Pro-, Business-, Enterprise- ja Edu-käyttäjien saatavilla ChatGPT Workissa ja Codexissa. Nämä mallit eivät ole vielä saatavilla Chat-tilassa. Kehittäjät voivat käyttää sitä myös OpenAI API -rajapinnan kautta tunnuksella gpt-6.1-sol. Sen API-käytön normaalihinnat ovat 2 dollaria miljoonalta syötetokenilta, 0,10 dollaria miljoonalta välimuistissa olevalta syötetokenilta ja 10 dollaria miljoonalta tulostetokenilta.

Samalla julkaisemme GPT‑6 Astra Ultrafastin, maailman nopeimman edistyneen mallin, joka on jopa kahdeksan kertaa GPT‑6 Astraa nopeampi, sekä GPT‑6.1 Sol Ultrafastin. Ne ovat saatavilla API-rajapinnassa sekä ChatGPT Workissa ja Codexissa käyttäjille, joilla on uusi, suurimmat käyttörajat tarjoava Pro-tilauksemme, jonka hinta on 500 dollaria kuukaudessa. GPT‑6.1 Sol Ultrafast tarjoaa kehittäjille lähes Astran älykkyyden jopa kahdeksankertaisella nopeudella suunnilleen samoilla API-kustannuksilla kuin GPT‑6 Astra aiemmin.

Tekijät

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.