Jäta vahele ja mine põhisisu juurde
OpenAI

Tutvustame GPT‑6 Soli ja Lunat

Rohkem võimalusi tuua tipptasemel nutikus oma igapäevatöösse.

Laadimine…

Selle kuu alguses tutvustasime GPT‑6 Astrat, maailma kõige nutikamat ja paremini joondatud mudelit. Kõige nõudlikumad ja olulisemad projektid vajavad endiselt Astra täielikku võimekust, kuid tööd tehakse eri mahus, tempos ja eelarvega.

Seepärast laiendame GPT‑6 mudeliperet mudelitega GPT‑6 Sol ja GPT‑6 Luna. GPT‑6 Astra juhatas sisse uue nutikuse põlvkonna. Need mudelid aitavad selle nutikuse eeliseid laiemalt jagada, nihutades kulutõhususe tipptaset. Koolitasime GPT‑6 Soli ja Lunat GPT‑6 Astraga sarnaste meetoditega, tuues Astra tipptasemel professionaalse töö, faktitäpsuse, programmeerimise, arvutikasutuse ja joondatuse aluseks olevad uuendused kiirematesse ja soodsamatesse mudelitesse.

GPT‑6 mudelid on kulu ja nutikuse suhte poolest esirinnas, ühendades igal tasemel erakordse võimekuse taristuga, mis võimaldab seda suures mahus tõhusalt pakkuda. Vahemällu salvestamise ja järeldamise täiustused võimaldavad meil neid mudeleid odavamalt pakkuda. Anname säästu otse kasutajatele ja klientidele edasi, langetades Soli ja Luna API hindu 50% võrreldes nende GPT‑5.6 soodushindadega. Koos muudavad need täiustused kõrgtasemel tehisaru praktiliseks rohkemate igapäevaste ülesannete ja suuremahuliste rakenduste jaoks.

GPT‑6 API hinnad

Mudel

Sisend

Väljund

Hinnalangus

GPT‑6 Sol
vs. GPT‑5.6 Sol

$4 → $2

$20 → $10

50% odavam

GPT‑6 Luna
vs. GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% odavam

Hinnad kehtivad ühe miljoni tokeni kohta.

GPT‑6 Astra on jätkuvalt meie parim mudel kõigis valdkondades. Valige see, kui soovite parimaid tulemusi ega soovi kogemuse arvelt kompromisse teha.

Edasiminek kogu mudeliperes

GPT‑6 Sol ja Luna täiustavad teile juba tuttavate mudelite nutikust ja kulutõhusust võimekustes, mis on keeruka töö tegemiseks kõige kasulikumad.

Professionaalne töö

GPT‑6 Sol saab hakkama keerukate tööülesannetega, pakkudes suuremate kasutuspiirangute ja väiksemate kulude toel rohkem katsetamisruumi ning võrreldava hinnaga konkurentide mudelitest suuremat nutikust ja paremaid tulemusi.

Rakendusteüleseid äriprotsesse hindavas testis AutomationBench edestab väga suure pingutustasemega GPT‑6 Sol maksimaalse pingutustasemega Claude Opus 5 mudelit, makstes ülesande kohta vaid 9% Opus 5 kulust. Suure pingutustaseme korral ületab GPT‑6 Luna oma eelkäijat 5,4 protsendipunktiga, makstes ülesande kohta 58% vähem.

Testis AutomationBench 1.0.6⁠(avaneb uues aknas) hinnatakse AI-agente terviklike töövoogude põhjal, kasutades 47 müügi-, turundus-, tegevus-, tugi-, finants- ja personalitööriista. Claude Fable 5.1 andmepunkt näitab tegelikust väiksemat kulu, sest ei hõlma Opus 5 varumudeli kulu. Varumudelit kasutati ligikaudu 40% ülesannete puhul.

GPT‑6 Sol ületab palju väiksema kulu juures ka Claude Fable 5.1 mudelit ning edestab isegi väikese pingutustasemega GPT‑6 Astrat.

Mudel (ja pingutustase)

Tulemus

Kulu ülesande kohta

GPT‑6 Sol (Väga kõrge)

33.2%

$0.27

GPT‑6 Astra (Madal)

30.3%

3.9× GPT‑6 Sol

Claude Opus 5 (Max)

26.9%

11.1× GPT‑6 Sol

Claude Fable 5.1 koos Opus 5 varumudeliga (Max)

31.4%

>8.9× GPT‑6 Sol

(varumudeli kulu pole avaldatud)

Keerukates professionaalsetes töövoogudes agente hindavas testis Agents’ Last Exam saavutab maksimaalse pingutustasemega GPT‑6 Sol 56,4% tulemuse, ületades Claude Opus 5 parimat tulemust selles hindamises, kuid makstes ülesande kohta 60% vähem.

Testis Agents’ Last Exam V1⁠(avaneb uues aknas) hinnatakse AI-agente pikaajaliste ja majanduslikult väärtuslike ülesannete põhjal 55 allharus, mis hõlmavad enamikku peamisi arvutis tehtava professionaalse töö valdkondi.

Faktitäpsus

Vastuse kasulikkus sõltub faktide õigsusest ning me parandame jätkuvalt faktitäpsust. Meie sisemises faktitäpsuse hindamises, mis põhineb anonüümitud tegelikel vestlustel, kus kasutajad märkisid meie mudelite vigu, teeb GPT‑6 Sol eelkäijast umbes poole vähem vigu, lähenedes palju väiksema kulu juures Astra töökindlusele. Ka GPT‑6 Luna on märgatavalt parem: suurema pingutustaseme korral võrdub see GPT‑5.6 Soliga, kuid maksab sellest ligikaudu sada korda vähem.

Siin hindame faktitäpsust anonüümitud ChatGPT vestlustes, kus kasutajad olid märkinud varasema mudeli faktivea. Need vigu esile kutsuvad vestlused ei kajasta tavakasutust, kus faktivigu esineb harvemini. Tulemusi ei ole vastuse pikkuse suhtes ühtlustatud, kuid meie eri sõnaohtrusega katsed näitasid, et tulemus peaaegu ei sõltu vastuse pikkusest.

Programmeerimine

Sel aastal on programmeerimisagendid hakanud lahendama keerukamaid, mahukamaid ja pikemaid ülesandeid kui kunagi varem. OpenAI sisekasutus on kasvanud eksponentsiaalselt. API hindade järgi arvestatuna on igapäevase tokenikasutuse väärtus ületanud mediaanteaduri puhul 600 dollarit ja 90. protsentiili teaduri puhul 7000 dollarit („Teadustöö kiirendamine: vaade OpenAI seest“⁠). Kuna programmeerimisagendid võtavad ette pikemaid ja nõudlikumaid ülesandeid, muutub pideva kasutamise hind üha olulisemaks. GPT‑6 Sol ja Luna ühendavad tugeva programmeerimisvõimekuse madalamate API hindadega, andes arendajatele rohkem katsetamisruumi ja meeskondadele kindluse usaldada Codexile ambitsioonikamaid ülesandeid.

Testis FrontierCode, mis hindab, kas programmeerimisagentide muudatused on valmis tegeliku koodibaasiga liitmiseks, ületab GPT‑6 Sol märgatavalt GPT‑5.6 Soli ja saavutab palju väiksema kulu juures väga suure pingutustasemega Claude Fable 5.1-ga võrdse tulemuse.

Testis FrontierCode 1.1 Main⁠(avaneb uues aknas) kirjutavad AI-agendid koodi, mida hinnatakse peale õigsuse ka „liidetavuse“ alusel, näiteks testide kvaliteedi, ulatuse distsipliini, koodistiili ja koodibaasi standardite järgimise järgi.

Testis DeepSWE v1.1, mis mõõdab võimekust tegelike koodibaaside keerukates tarkvaraarendusülesannetes, saavutab maksimaalse pingutustasemega GPT‑6 Sol 68,8% tulemuse. See jääb Claude Fable 5 parimast tulemusest selles hindamises — 69,9% väga suure pingutustaseme korral — vaid 1,1 protsendipunkti kaugusele, kuid maksab ülesande kohta ligikaudu 80% vähem.

Maksimaalse pingutustasemega GPT‑6 Luna saavutab 66,6% tulemuse, mis on võrreldav keskmise pingutustasemega Claude Opus 5 ja Fable 5 tulemustega. Nendes võrdlustes maksab Luna ülesande kohta 93% vähem kui Opus 5 ja 96% vähem kui Fable 5.

Testis DeepSWE 1.1⁠(avaneb uues aknas) lahendavad AI-agendid algupäraseid pikaajalisi tarkvaraarendusülesandeid.

Arvutikasutus

GPT‑6 Astra on endiselt maailma parim arvutikasutuse mudel, kuid GPT‑6 Sol ja Luna on oma eelkäijatest kulutõhusamad. Testi OSWorld 2.0 võrguühenduseta andmestikus saavutab väga suure pingutustasemega GPT‑6 Sol keskmise pingutustasemega Claude Opus 5-ga sarnase tulemuse — 60,5% võrreldes 60,3%-ga —, kuid maksab ülesande kohta ligikaudu 80% vähem. GPT‑6 Luna (Max) ületab GPT‑5.6 Soli (Keskmine), makstes sellest kümme korda vähem.

Testis OSWorld 2.0⁠(avaneb uues aknas) proovivad AI-agendid läbida pikaajalisi arvutikasutuse töövooge, mis hõlmavad igapäevaseid ja professionaalseid ülesandeid. Esitame versiooni v2026.08.08 võrguühenduseta andmestiku osalise tasu.

Koostööstiil

Oleme toonud GPT‑6 Astra täiustatud suhtlusstiili ka Soli ja Lunasse ning arvame, et seda märkab eriti tehnilistes ja programmeerimisvestlustes. Vastused on selgemad, sisaldavad vähem erialaslängi, veidraid väljendeid ja väheväärtuslikke üksikasju ning on üldiselt veidi lühemad, kaotamata sisukust.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Kuigi stiil on subjektiivne, eelistame siin GPT‑6 Soli vastust. See ei tee nii kiiresti ennatlikke järeldusi, kulutab vähem aega küsijale tõenäoliselt ilmselgete üksikasjade kordamisele (näiteks et veebisaidil on neli lehte), kasutab vähem ebamäärast keelt (näiteks „bento-laadne mulje“, „selle süsteemi järgi ümberkujundamine“), ütleb avatumalt, mida kontrollis ja mida mitte, ega jaga tarbetult tehnilisi rakendusüksikasju, nagu pilditööriista viip.

Agentide ja pikkade vestluste vahemällu salvestamise täiustamine

Lisaks madalamatele tokenihindadele aitame GPT‑6 rakendusi loovatel arendajatel rohkem säästa ka rakenduste korduskasutatava konteksti pealt. Täiustasime GPT‑6 viipade vahemällu salvestamist, et suurendada vaikimisi vahemälu tabamusmäära. Nii saavad agendid rohkem konteksti korduskasutada, kiiremini vastata ja kasutada vahemällu salvestatud sisendtokenite lugemisel 90% allahindlust.

Arendajatel on nüüd rohkem võimalusi vahemälu jõudluse mõõtmiseks ja optimeerimiseks.

GitHubi andmetel on need täiustused viimaste kuude jooksul vähendanud uut töötlust vajavate viibatokenite osakaalu enam kui 50% võrra miljardite OpenAI mudelitele saadetud päringute lõikes, aidates Copilotil kiiremini vastata.

Joondatuse jätkuv parandamine

GPT‑6 Sol ja Luna tuginevad meie seni kõige paremini joondatud mudeli Astraga alustatud joondamistööle. Meie joondatuse hindamistes on nii Sol kui ka Luna oma GPT‑5.6 versioonidest paremad, sealhulgas esitavad nad programmeerimistöö kohta harvemini eksitavaid väiteid.

Alltoodud hindamised testivad teadlikult keerulisi olukordi ega mõõda vigade määra tavakasutuses. Täielikke tulemusi vaadake süsteemikaardilt⁠(avaneb uues aknas).

Saadavus

GPT‑6 Sol ja GPT‑6 Luna on alates tänasest ChatGPT Workis ja Codexis saadaval kõigile Plus-, Pro-, Business-, Enterprise- ja Edu-kasutajatele. Free- ja Go-kasutajad saavad GPT‑6 Lunat kasutada töölauarakenduses. Need mudelid pole veel Chatis saadaval. OpenAI API-s on need saadaval nimedega gpt-6-sol ja gpt-6-luna.

Teenuse stabiilsuse tagamiseks plaanime need mudelid päeva jooksul järk-järgult ChatGPT kasutajateni tuua. Kui te uusi mudeleid ChatGPT Workis või Codexis ei näe, proovige hiljem uuesti.


GPT hindamised tehti meie uurimiskeskkonnas või API kaudu. Süsteemiviipade, saadaolevate tööriistade ja muude erinevuste tõttu võivad sealsed väljundid tootmiskeskkonna ChatGPT omadest veidi erineda. Konkurentide mudelite hindamistulemused pärinevad avalikest aruannetest. Kui Claude Fable 5.1 tulemused polnud saadaval, kasutasime Claude Fable 5 tulemusi.

Autor

OpenAI