Esittelyssä GPT‑6 Sol ja Luna
Lisää tapoja tuoda edistynyt älykkyys osaksi päivittäistä työtäsi.
Esittelimme aiemmin tässä kuussa GPT‑6 Astran, maailman älykkäimmän ja parhaiten tavoitteidemme mukaisen mallin. Vaativimmat ja tärkeimmät hankkeet edellyttävät yhä Astran koko syvyyttä, mutta työtä tehdään eri mittakaavoissa, eri tahdissa ja erilaisilla budjeteilla.
Siksi laajennamme GPT‑6‑mallistoa malleilla GPT‑6 Sol ja GPT‑6 Luna. GPT‑6 Astra aloitti älykkyyden uuden sukupolven. Nämä mallit tuovat sen hyödyt laajemmin saataville ja vievät kustannustehokkuuden kehityksen uudelle tasolle. GPT‑6 Sol ja Luna koulutettiin Astran kaltaisilla menetelmillä, joten Astran huippuluokan suorituskyvyn taustalla olevat edistysaskeleet ammatillisessa työssä, faktantarkkuudessa, ohjelmoinnissa, tietokoneen käytössä ja tavoitteidenmukaisuudessa saadaan nopeampiin ja edullisempiin malleihin.
GPT‑6-mallit ovat kustannusten ja älykkyyden välisen käyrän kärjessä: ne yhdistävät poikkeukselliset kyvyt jokaisella tasolla infrastruktuuriin, joka tarjoaa ne tehokkaasti suuressa mittakaavassa. Välimuistin ja päättelyn parannusten ansiosta voimme tarjota nämä mallit edullisemmin. Siirrämme säästöt suoraan käyttäjille ja asiakkaille alentamalla Solin ja Lunan API-hintoja 50 % niiden GPT‑5.6-kampanjahinnoista. Yhdessä nämä parannukset tekevät edistyneestä tekoälystä käytännöllisen ratkaisun yhä useampiin arjen tehtäviin ja laajamittaisiin sovelluksiin.
Malli | Syöte | Tuloste | Hinnanalennus |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | 50 % edullisempi |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | 50 % edullisempi |
Hinnat ovat miljoonaa tokenia kohden.
GPT‑6 Astra on edelleen kokonaisuutena paras mallimme. Valitse se, kun haluat parhaat tulokset tinkimättömällä käyttökokemuksella.
GPT‑6 Sol ja Luna tuovat älykkyysparannuksia ja kustannustehokkuutta tuttuihin malleihin niissä ominaisuuksissa, joista on eniten hyötyä vaativan työn tekemisessä.
GPT‑6 Sol selviytyy vaikeista työtehtävistä ja antaa samalla enemmän mahdollisuuksia iterointiin suurempien käyttörajojen ja pienempien kustannusten ansiosta. Se tarjoaa enemmän älykkyyttä ja parempia tuloksia kuin samanhintaiset kilpailijoiden mallit.
Sovellusten välisiä liiketoimintaprosesseja testaavassa AutomationBenchissä GPT‑6 Sol erittäin suurella päättelypanoksella päihittää Claude Opus 5:n Max-panoksella, vaikka sen tehtäväkohtainen kustannus on vain 9 % Opus 5:n kustannuksesta. Korkealla päättelypanoksella GPT‑6 Luna parantaa edeltäjänsä tulosta 5,4 prosenttiyksikköä, vaikka sen tehtäväkohtainen kustannus on 58 % pienempi.
Testissä AutomationBench 1.0.6(avautuu uudessa ikkunassa) tekoälyagentteja testataan kokonaisissa työnkuluissa, joissa käytetään 47:ää myynnin, markkinoinnin, operatiivisen toiminnan, tuen, talouden ja henkilöstöhallinnon työkalua. Claude Fable 5.1:n datapiste aliarvioi sen todelliset kustannukset, sillä siinä ei huomioida Opus 5 -varamallin kustannuksia. Varamallia käytettiin noin 40 prosentissa tehtävistä.
GPT‑6 Sol päihittää myös Claude Fable 5.1:n huomattavasti pienemmin kustannuksin ja jopa GPT‑6 Astran matalalla päättelypanoksella.
Malli (ja päättelypanos) | Tulos | Kustannus tehtävää kohden |
|---|---|---|
GPT‑6 Sol (erittäin korkea) | 33,2 % | 0,27 $ |
GPT‑6 Astra (matala) | 30,3 % | 3,9× GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1× GPT‑6 Sol |
Claude Fable 5.1, varamallina Opus 5 (Max) | 31,4 % | >8,9× GPT‑6 Sol (varamallin kustannusta ei ilmoitettu) |
Vaativissa ammatillisissa työnkuluissa agentteja arvioivassa Agents’ Last Exam -testissä GPT‑6 Sol saa Max-panoksella tuloksen 56,4 %, mikä ylittää Claude Opus 5:n parhaan arviointituloksen 60 % pienemmillä tehtäväkohtaisilla kustannuksilla.
Testissä Agents’ Last Exam V1(avautuu uudessa ikkunassa) tekoälyagentteja arvioidaan pitkäkestoisissa, taloudellisesti arvokkaissa tehtävissä 55 toimialan alalla. Mukana ovat useimmat tärkeät tietokoneella tehtävän ammatillisen työn osa-alueet.
Vastauksen hyödyllisyys riippuu faktojen paikkansapitävyydestä, ja kehitämme jatkuvasti faktuaalista luotettavuutta. Sisäisessä faktantarkkuuden arvioinnissamme käytetään anonymisoituja tosielämän keskusteluja, joissa käyttäjät ilmoittivat malliemme virheistä. GPT‑6 Sol tekee noin puolet vähemmän virheitä kuin edeltäjänsä ja lähestyy Astran luotettavuutta huomattavasti pienemmin kustannuksin. Myös GPT‑6 Luna paranee huomattavasti: suuremmilla päättelypanoksilla se yltää GPT‑5.6 Solin tasolle noin sadasosalla sen kustannuksista.
Tässä arvioimme faktantarkkuutta anonymisoiduissa ChatGPT‑keskusteluissa, joissa käyttäjät olivat ilmoittaneet aiemman mallin asiavirheestä. Nämä virheitä aiheuttavat keskustelut eivät vastaa tyypillistä käyttöä, jossa asiavirheet ovat harvinaisempia. Tuloksia ei ole vakioitu vastausten pituuden mukaan. Monisanaisuuden vaihtelutesteissämme vastausten pituudella ei kuitenkaan ollut juuri lainkaan vaikutusta.
Tänä vuonna ohjelmointiagentit ovat alkaneet ratkoa entistä monimutkaisempia, laajempia ja pitkäkestoisempia tehtäviä. OpenAIssa sisäinen käyttömme on kasvanut eksponentiaalisesti. API-hinnoilla laskettuna päivittäisen tokenien käytön arvo on ylittänyt mediaanitutkijalla 600 dollaria ja 90. persentiiliin kuuluvilla tutkijoilla 7 000 dollaria (Tutkimuksen vauhdittaminen: näkymä OpenAIn sisältä). Kun ohjelmointiagentit hoitavat entistä pidempiä ja vaativampia tehtäviä, jatkuvan käytön kustannuksilla on yhä enemmän merkitystä. GPT‑6 Sol ja Luna yhdistävät vahvan ohjelmointisuorituskyvyn edullisempiin API-hintoihin. Kehittäjät voivat iteroida enemmän, ja tiimit voivat antaa Codexille entistä kunnianhimoisempia tehtäviä luottavaisin mielin.
Todellisiin koodikantoihin yhdistämisvalmiiden muutosten tuottamista arvioivassa FrontierCode-testissä GPT‑6 Sol parantaa huomattavasti GPT‑5.6 Solin tulosta ja yltää Claude Fable 5.1:n erittäin suuren päättelypanoksen tasolle paljon pienemmin kustannuksin.
Testissä FrontierCode 1.1 Main(avautuu uudessa ikkunassa) tekoälyagentit kirjoittavat koodia, jota arvioidaan oikeellisuuden lisäksi myös yhdistämiskelpoisuuden perusteella. Arviointikohteita ovat esimerkiksi testien laatu, rajauksen hallinta, koodityyli ja koodikannan standardien noudattaminen.
Todellisten koodikantojen vaativia ohjelmistokehitystehtäviä testaavassa DeepSWE v1.1:ssä GPT‑6 Sol saa Max-panoksella tuloksen 68,8 %. Se jää vain 1,1 prosenttiyksikköä Claude Fable 5:n arvioinnin parhaasta tuloksesta – 69,9 % erittäin suurella päättelypanoksella – mutta maksaa tehtävää kohden noin 80 % vähemmän.
GPT‑6 Luna saa Max-panoksella tuloksen 66,6 %, joka vastaa Claude Opus 5:n ja Fable 5:n tuloksia keskitason päättelypanoksella. Näissä vertailuissa Lunan tehtäväkohtaiset kustannukset ovat 93 % pienemmät kuin Opus 5:llä ja 96 % pienemmät kuin Fable 5:llä.
Testissä DeepSWE 1.1(avautuu uudessa ikkunassa) tekoälyagentit ratkaisevat alkuperäisiä, pitkäkestoisia ohjelmistokehitystehtäviä.
GPT‑6 Astra on edelleen maailman paras malli tietokoneen käyttöön, mutta GPT‑6 Sol ja Luna tarjoavat edeltäjiään kustannustehokkaampaa suorituskykyä. OSWorld 2.0:n offline-testissä GPT‑6 Sol yltää erittäin suurella päättelypanoksella lähes samaan tulokseen kuin Claude Opus 5 keskitason panoksella – 60,5 % verrattuna 60,3 prosenttiin – mutta noin 80 % pienemmin tehtäväkohtaisin kustannuksin. GPT‑6 Luna (Max) päihittää GPT‑5.6 Solin (Keskitaso) kymmenesosalla sen kustannuksista.
Testissä OSWorld 2.0(avautuu uudessa ikkunassa) tekoälyagentit yrittävät suorittaa pitkäkestoisia tietokoneen käytön työnkulkuja, jotka kattavat arjen ja ammatillisia tehtäviä. Raportoimme osittaisen palkkion v2026.08.08-julkaisun offline-aineistosta.
Olemme tuoneet GPT‑6 Astran parannetun viestintätyylin myös Soliin ja Lunaan. Uskomme eron näkyvän erityisen selvästi teknisissä ja ohjelmointiin liittyvissä keskusteluissa. Luvassa on selkeämpää ilmaisua, vähemmän ammattikieltä, kömpelöitä ilmauksia ja vähäarvoisia yksityiskohtia sekä hieman lyhyempiä vastauksia sisällöstä tinkimättä.
Vaikka tyyli on subjektiivinen asia, pidämme tässä GPT‑6 Solin vastausta parempana. Se ei tee päätelmiä yhtä hätäisesti, käytä yhtä paljon aikaa kysyjälle mahdollisesti itsestään selvien yksityiskohtien toistamiseen (esimerkiksi siihen, että verkkosivustolla on neljä sivua) eikä käytä yhtä epämääräisiä ilmauksia (esimerkiksi ”bento-tunnelma” tai ”muotoilu uudelleen… kyseisen järjestelmän ympärille”). Lisäksi se kertoo avoimemmin, mitä tarkisti ja mitä ei, eikä jaa tarpeettomia toteutustietoja, kuten kuvatyökalulle antamaansa kehotetta.
Edullisempien token-hintojen lisäksi autamme GPT‑6:ta käyttäviä kehittäjiä säästämään enemmän sovellustensa uudelleenkäyttämässä kontekstissa. Olemme parantaneet GPT‑6:n kehotteiden tallentamista välimuistiin, jotta välimuistiosumien osuus olisi oletusarvoisesti suurempi. Näin agentit voivat käyttää enemmän kontekstia uudelleen, vastata nopeammin ja saada 90 %:n alennuksen välimuistiin tallennettujen syötetokenien lukemisesta.
Kehittäjillä on myös enemmän tapoja mitata ja optimoida välimuistin suorituskykyä:
Seuraa ja diagnosoi. Kehotteiden välimuistitallennuksen hallintapaneeli(avautuu uudessa ikkunassa) näyttää, kuinka paljon syötteestä on tallennettu välimuistiin ja miten määrä muuttuu ajan mittaan. Diagnostiikkatyökalu(avautuu uudessa ikkunassa) auttaa selvittämään, miksi välimuistitallennuksen mahdollisuuksia jäi käyttämättä ja mitä kannattaa korjata.
Säädä päättelypanosta ja työkalujen saatavuutta rikkomatta välimuistia. Lisää vaikeissa tehtävissä päättelypanosta(avautuu uudessa ikkunassa) tai vähennä sitä yksinkertaisissa jatkokysymyksissä. Voit myös ottaa työkaluja käyttöön tai poistaa niitä käytöstä(avautuu uudessa ikkunassa) agenttisi tarpeiden muuttuessa. Molemmat säädöt säilyttävät nyt aiemman kontekstin välimuistissa uudelleenkäyttöä varten.
Optimoi välimuistiin tallennettavat etuliitteet. Erillisten katkaisukohtien avulla kehittäjät voivat valita, mihin välimuistiin tallennetut kehote-etuliitteet päättyvät. Näin kehittäjät voivat hallita välimuistin uudelleenkäyttöä tarkemmin ja parantaa suorituskykyä.
GitHub kertoo, että viime kuukausina nämä parannukset ovat vähentäneet uudelleen käsiteltävien kehote-tokenien osuutta yli 50 % miljardeissa OpenAI-malleille lähetetyissä pyynnöissä. Tämä auttaa Copilotia vastaamaan nopeammin.
GPT‑6 Sol ja Luna perustuvat Astran yhteydessä esiteltyyn tavoitteidenmukaisuustyöhön. Astra on tähän mennessä parhaiten tavoitteidemme mukainen malli. Tavoitteidenmukaisuuden arvioinneissamme sekä Sol että Luna parantavat vastaaviin GPT‑5.6-malleihin verrattuna. Ne esimerkiksi esittävät harvemmin harhaanjohtavia väitteitä ohjelmointityöstään.
Alla olevissa arvioinneissa testataan tarkoituksella haastavia tilanteita, eikä niissä mitata virheiden määrää tyypillisessä käytössä. Katso kaikki tulokset järjestelmäkortista(avautuu uudessa ikkunassa).
GPT‑6 Sol ja GPT‑6 Luna ovat tästä päivästä alkaen kaikkien Plus-, Pro-, Business-, Enterprise- ja Edu-käyttäjien saatavilla ChatGPT Workissa ja Codexissa. Free- ja Go-käyttäjät voivat käyttää GPT‑6 Lunaa työpöytäsovelluksessa. Nämä mallit eivät ole vielä saatavilla Chatissa. OpenAI APIssa ne ovat saatavilla nimillä gpt-6-sol ja gpt-6-luna.
Jotta palvelu pysyy vakaana kaikille, aiomme ottaa nämä mallit käyttöön ChatGPT:ssä asteittain päivän mittaan. Jos uudet mallit eivät näy ChatGPT Workissa tai Codexissa, yritä myöhemmin uudelleen.
GPT:n arvioinnit tehtiin tutkimusympäristössämme tai APImme kautta. Järjestelmäkehotteiden, käytettävissä olevien työkalujen ja muiden erojen vuoksi tulokset voivat poiketa hieman tuotantoversion ChatGPT:n tuloksista. Kilpailijoiden mallien arvioinnit perustuvat julkisesti saatavilla oleviin raportteihin. Claude Fable 5:n tuloksia käytettiin, kun Claude Fable 5.1:n tuloksia ei ollut saatavilla.


