Siirry pääsisältöön
OpenAI

Esittelyssä GPT‑6 Sol ja Luna

Lisää tapoja tuoda edistynyt älykkyys osaksi päivittäistä työtäsi.

Ladataan...

Esittelimme aiemmin tässä kuussa GPT‑6 Astran, maailman älykkäimmän ja parhaiten tavoitteidemme mukaisen mallin. Vaativimmat ja tärkeimmät hankkeet edellyttävät yhä Astran koko syvyyttä, mutta työtä tehdään eri mittakaavoissa, eri tahdissa ja erilaisilla budjeteilla.

Siksi laajennamme GPT‑6‑mallistoa malleilla GPT‑6 Sol ja GPT‑6 Luna. GPT‑6 Astra aloitti älykkyyden uuden sukupolven. Nämä mallit tuovat sen hyödyt laajemmin saataville ja vievät kustannustehokkuuden kehityksen uudelle tasolle. GPT‑6 Sol ja Luna koulutettiin Astran kaltaisilla menetelmillä, joten Astran huippuluokan suorituskyvyn taustalla olevat edistysaskeleet ammatillisessa työssä, faktantarkkuudessa, ohjelmoinnissa, tietokoneen käytössä ja tavoitteidenmukaisuudessa saadaan nopeampiin ja edullisempiin malleihin.

GPT‑6-mallit ovat kustannusten ja älykkyyden välisen käyrän kärjessä: ne yhdistävät poikkeukselliset kyvyt jokaisella tasolla infrastruktuuriin, joka tarjoaa ne tehokkaasti suuressa mittakaavassa. Välimuistin ja päättelyn parannusten ansiosta voimme tarjota nämä mallit edullisemmin. Siirrämme säästöt suoraan käyttäjille ja asiakkaille alentamalla Solin ja Lunan API-hintoja 50 % niiden GPT‑5.6-kampanjahinnoista. Yhdessä nämä parannukset tekevät edistyneestä tekoälystä käytännöllisen ratkaisun yhä useampiin arjen tehtäviin ja laajamittaisiin sovelluksiin.

GPT‑6:n API-hinnat

Malli

Syöte

Tuloste

Hinnanalennus

GPT‑6 Sol
vs. GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

50 % edullisempi

GPT‑6 Luna
vs. GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

50 % edullisempi

Hinnat ovat miljoonaa tokenia kohden.

GPT‑6 Astra on edelleen kokonaisuutena paras mallimme. Valitse se, kun haluat parhaat tulokset tinkimättömällä käyttökokemuksella.

Harppaus eteenpäin koko malliperheessä

GPT‑6 Sol ja Luna tuovat älykkyysparannuksia ja kustannustehokkuutta tuttuihin malleihin niissä ominaisuuksissa, joista on eniten hyötyä vaativan työn tekemisessä.

Ammatillinen työ

GPT‑6 Sol selviytyy vaikeista työtehtävistä ja antaa samalla enemmän mahdollisuuksia iterointiin suurempien käyttörajojen ja pienempien kustannusten ansiosta. Se tarjoaa enemmän älykkyyttä ja parempia tuloksia kuin samanhintaiset kilpailijoiden mallit.

Sovellusten välisiä liiketoimintaprosesseja testaavassa AutomationBenchissä GPT‑6 Sol erittäin suurella päättelypanoksella päihittää Claude Opus 5:n Max-panoksella, vaikka sen tehtäväkohtainen kustannus on vain 9 % Opus 5:n kustannuksesta. Korkealla päättelypanoksella GPT‑6 Luna parantaa edeltäjänsä tulosta 5,4 prosenttiyksikköä, vaikka sen tehtäväkohtainen kustannus on 58 % pienempi.

Testissä AutomationBench 1.0.6⁠(avautuu uudessa ikkunassa) tekoälyagentteja testataan kokonaisissa työnkuluissa, joissa käytetään 47:ää myynnin, markkinoinnin, operatiivisen toiminnan, tuen, talouden ja henkilöstöhallinnon työkalua. Claude Fable 5.1:n datapiste aliarvioi sen todelliset kustannukset, sillä siinä ei huomioida Opus 5 -varamallin kustannuksia. Varamallia käytettiin noin 40 prosentissa tehtävistä.

GPT‑6 Sol päihittää myös Claude Fable 5.1:n huomattavasti pienemmin kustannuksin ja jopa GPT‑6 Astran matalalla päättelypanoksella.

Malli (ja päättelypanos)

Tulos

Kustannus tehtävää kohden

GPT‑6 Sol (erittäin korkea)

33,2 %

0,27 $

GPT‑6 Astra (matala)

30,3 %

3,9× GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1× GPT‑6 Sol

Claude Fable 5.1, varamallina Opus 5 (Max)

31,4 %

>8,9× GPT‑6 Sol

(varamallin kustannusta ei ilmoitettu)

Vaativissa ammatillisissa työnkuluissa agentteja arvioivassa Agents’ Last Exam -testissä GPT‑6 Sol saa Max-panoksella tuloksen 56,4 %, mikä ylittää Claude Opus 5:n parhaan arviointituloksen 60 % pienemmillä tehtäväkohtaisilla kustannuksilla.

Testissä Agents’ Last Exam V1⁠(avautuu uudessa ikkunassa) tekoälyagentteja arvioidaan pitkäkestoisissa, taloudellisesti arvokkaissa tehtävissä 55 toimialan alalla. Mukana ovat useimmat tärkeät tietokoneella tehtävän ammatillisen työn osa-alueet.

Faktantarkkuus

Vastauksen hyödyllisyys riippuu faktojen paikkansapitävyydestä, ja kehitämme jatkuvasti faktuaalista luotettavuutta. Sisäisessä faktantarkkuuden arvioinnissamme käytetään anonymisoituja tosielämän keskusteluja, joissa käyttäjät ilmoittivat malliemme virheistä. GPT‑6 Sol tekee noin puolet vähemmän virheitä kuin edeltäjänsä ja lähestyy Astran luotettavuutta huomattavasti pienemmin kustannuksin. Myös GPT‑6 Luna paranee huomattavasti: suuremmilla päättelypanoksilla se yltää GPT‑5.6 Solin tasolle noin sadasosalla sen kustannuksista.

Tässä arvioimme faktantarkkuutta anonymisoiduissa ChatGPT‑keskusteluissa, joissa käyttäjät olivat ilmoittaneet aiemman mallin asiavirheestä. Nämä virheitä aiheuttavat keskustelut eivät vastaa tyypillistä käyttöä, jossa asiavirheet ovat harvinaisempia. Tuloksia ei ole vakioitu vastausten pituuden mukaan. Monisanaisuuden vaihtelutesteissämme vastausten pituudella ei kuitenkaan ollut juuri lainkaan vaikutusta.

Ohjelmointi

Tänä vuonna ohjelmointiagentit ovat alkaneet ratkoa entistä monimutkaisempia, laajempia ja pitkäkestoisempia tehtäviä. OpenAIssa sisäinen käyttömme on kasvanut eksponentiaalisesti. API-hinnoilla laskettuna päivittäisen tokenien käytön arvo on ylittänyt mediaanitutkijalla 600 dollaria ja 90. persentiiliin kuuluvilla tutkijoilla 7 000 dollaria (Tutkimuksen vauhdittaminen: näkymä OpenAIn sisältä⁠). Kun ohjelmointiagentit hoitavat entistä pidempiä ja vaativampia tehtäviä, jatkuvan käytön kustannuksilla on yhä enemmän merkitystä. GPT‑6 Sol ja Luna yhdistävät vahvan ohjelmointisuorituskyvyn edullisempiin API-hintoihin. Kehittäjät voivat iteroida enemmän, ja tiimit voivat antaa Codexille entistä kunnianhimoisempia tehtäviä luottavaisin mielin.

Todellisiin koodikantoihin yhdistämisvalmiiden muutosten tuottamista arvioivassa FrontierCode-testissä GPT‑6 Sol parantaa huomattavasti GPT‑5.6 Solin tulosta ja yltää Claude Fable 5.1:n erittäin suuren päättelypanoksen tasolle paljon pienemmin kustannuksin.

Testissä FrontierCode 1.1 Main⁠(avautuu uudessa ikkunassa) tekoälyagentit kirjoittavat koodia, jota arvioidaan oikeellisuuden lisäksi myös yhdistämiskelpoisuuden perusteella. Arviointikohteita ovat esimerkiksi testien laatu, rajauksen hallinta, koodityyli ja koodikannan standardien noudattaminen.

Todellisten koodikantojen vaativia ohjelmistokehitystehtäviä testaavassa DeepSWE v1.1:ssä GPT‑6 Sol saa Max-panoksella tuloksen 68,8 %. Se jää vain 1,1 prosenttiyksikköä Claude Fable 5:n arvioinnin parhaasta tuloksesta – 69,9 % erittäin suurella päättelypanoksella – mutta maksaa tehtävää kohden noin 80 % vähemmän.

GPT‑6 Luna saa Max-panoksella tuloksen 66,6 %, joka vastaa Claude Opus 5:n ja Fable 5:n tuloksia keskitason päättelypanoksella. Näissä vertailuissa Lunan tehtäväkohtaiset kustannukset ovat 93 % pienemmät kuin Opus 5:llä ja 96 % pienemmät kuin Fable 5:llä.

Testissä DeepSWE 1.1⁠(avautuu uudessa ikkunassa) tekoälyagentit ratkaisevat alkuperäisiä, pitkäkestoisia ohjelmistokehitystehtäviä.

Tietokoneen käyttö

GPT‑6 Astra on edelleen maailman paras malli tietokoneen käyttöön, mutta GPT‑6 Sol ja Luna tarjoavat edeltäjiään kustannustehokkaampaa suorituskykyä. OSWorld 2.0:n offline-testissä GPT‑6 Sol yltää erittäin suurella päättelypanoksella lähes samaan tulokseen kuin Claude Opus 5 keskitason panoksella – 60,5 % verrattuna 60,3 prosenttiin – mutta noin 80 % pienemmin tehtäväkohtaisin kustannuksin. GPT‑6 Luna (Max) päihittää GPT‑5.6 Solin (Keskitaso) kymmenesosalla sen kustannuksista.

Testissä OSWorld 2.0⁠(avautuu uudessa ikkunassa) tekoälyagentit yrittävät suorittaa pitkäkestoisia tietokoneen käytön työnkulkuja, jotka kattavat arjen ja ammatillisia tehtäviä. Raportoimme osittaisen palkkion v2026.08.08-julkaisun offline-aineistosta.

Yhteistyötyyli

Olemme tuoneet GPT‑6 Astran parannetun viestintätyylin myös Soliin ja Lunaan. Uskomme eron näkyvän erityisen selvästi teknisissä ja ohjelmointiin liittyvissä keskusteluissa. Luvassa on selkeämpää ilmaisua, vähemmän ammattikieltä, kömpelöitä ilmauksia ja vähäarvoisia yksityiskohtia sekä hieman lyhyempiä vastauksia sisällöstä tinkimättä.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Vaikka tyyli on subjektiivinen asia, pidämme tässä GPT‑6 Solin vastausta parempana. Se ei tee päätelmiä yhtä hätäisesti, käytä yhtä paljon aikaa kysyjälle mahdollisesti itsestään selvien yksityiskohtien toistamiseen (esimerkiksi siihen, että verkkosivustolla on neljä sivua) eikä käytä yhtä epämääräisiä ilmauksia (esimerkiksi ”bento-tunnelma” tai ”muotoilu uudelleen… kyseisen järjestelmän ympärille”). Lisäksi se kertoo avoimemmin, mitä tarkisti ja mitä ei, eikä jaa tarpeettomia toteutustietoja, kuten kuvatyökalulle antamaansa kehotetta.

Parempi välimuisti agenteille ja pitkille keskusteluille

Edullisempien token-hintojen lisäksi autamme GPT‑6:ta käyttäviä kehittäjiä säästämään enemmän sovellustensa uudelleenkäyttämässä kontekstissa. Olemme parantaneet GPT‑6:n kehotteiden tallentamista välimuistiin, jotta välimuistiosumien osuus olisi oletusarvoisesti suurempi. Näin agentit voivat käyttää enemmän kontekstia uudelleen, vastata nopeammin ja saada 90 %:n alennuksen välimuistiin tallennettujen syötetokenien lukemisesta.

Kehittäjillä on myös enemmän tapoja mitata ja optimoida välimuistin suorituskykyä:

GitHub kertoo, että viime kuukausina nämä parannukset ovat vähentäneet uudelleen käsiteltävien kehote-tokenien osuutta yli 50 % miljardeissa OpenAI-malleille lähetetyissä pyynnöissä. Tämä auttaa Copilotia vastaamaan nopeammin.

Tavoitteidenmukaisuuden jatkuva parantaminen

GPT‑6 Sol ja Luna perustuvat Astran yhteydessä esiteltyyn tavoitteidenmukaisuustyöhön. Astra on tähän mennessä parhaiten tavoitteidemme mukainen malli. Tavoitteidenmukaisuuden arvioinneissamme sekä Sol että Luna parantavat vastaaviin GPT‑5.6-malleihin verrattuna. Ne esimerkiksi esittävät harvemmin harhaanjohtavia väitteitä ohjelmointityöstään.

Alla olevissa arvioinneissa testataan tarkoituksella haastavia tilanteita, eikä niissä mitata virheiden määrää tyypillisessä käytössä. Katso kaikki tulokset järjestelmäkortista⁠(avautuu uudessa ikkunassa).

Saatavuus

GPT‑6 Sol ja GPT‑6 Luna ovat tästä päivästä alkaen kaikkien Plus-, Pro-, Business-, Enterprise- ja Edu-käyttäjien saatavilla ChatGPT Workissa ja Codexissa. Free- ja Go-käyttäjät voivat käyttää GPT‑6 Lunaa työpöytäsovelluksessa. Nämä mallit eivät ole vielä saatavilla Chatissa. OpenAI APIssa ne ovat saatavilla nimillä gpt-6-sol ja gpt-6-luna.

Jotta palvelu pysyy vakaana kaikille, aiomme ottaa nämä mallit käyttöön ChatGPT:ssä asteittain päivän mittaan. Jos uudet mallit eivät näy ChatGPT Workissa tai Codexissa, yritä myöhemmin uudelleen.


GPT:n arvioinnit tehtiin tutkimusympäristössämme tai APImme kautta. Järjestelmäkehotteiden, käytettävissä olevien työkalujen ja muiden erojen vuoksi tulokset voivat poiketa hieman tuotantoversion ChatGPT:n tuloksista. Kilpailijoiden mallien arvioinnit perustuvat julkisesti saatavilla oleviin raportteihin. Claude Fable 5:n tuloksia käytettiin, kun Claude Fable 5.1:n tuloksia ei ollut saatavilla.

Tekijät

OpenAI