Iepazīstinām ar GPT‑6 Sol un Luna
Vairāk iespēju izmantot robežšķirtnes intelektu ikdienas darbā.
Šomēnes mēs iepazīstinājām ar GPT‑6 Astra — pasaulē visgudrāko un vislabāk saskaņoto modeli. Lai gan visprasīgākajos un svarīgākajos projektos joprojām vajadzīgs viss Astra potenciāls, darbs notiek atšķirīgā mērogā, tempā un ar dažādiem budžetiem.
Tāpēc paplašinām GPT‑6 saimi ar GPT‑6 Sol un GPT‑6 Luna. GPT‑6 Astra ievadīja jaunu intelekta paaudzi, bet šie modeļi palīdz plašāk izmantot tās sniegtās priekšrocības, paceļot izmaksu efektivitātes robežšķirtni. GPT‑6 Sol un Luna apmācījām ar līdzīgām metodēm kā GPT‑6 Astra, tāpēc Astra modernākie sasniegumi profesionālajā darbā, faktu precizitātē, programmēšanā, datora lietošanā un saskaņotībā tagad pieejami ātrākos un cenas ziņā izdevīgākos modeļos.
GPT‑6 modeļi ir līderi visā izmaksu un intelekta attiecības diapazonā, katrā līmenī apvienojot izcilas spējas ar infrastruktūru, kas ļauj tās efektīvi nodrošināt plašā mērogā. Kešatmiņas izmantošanas un inferences uzlabojumi ļauj mums piedāvāt šos modeļus par zemākām izmaksām. Šo ietaupījumu tieši nododam lietotājiem un klientiem, par 50% samazinot Sol un Luna API cenas salīdzinājumā ar GPT‑5.6 akcijas cenām. Kopā šie uzlabojumi padara progresīvu MI praktiski izmantojamu plašākam ikdienas uzdevumu un liela mēroga lietojumu klāstam.
Modelis | Ievade | Izvade | Cenas samazinājums |
GPT‑6 Sol | $4 → $2 | $20 → $10 | Par 50% lētāk |
GPT‑6 Luna | $0,20 → $0,10 | $1,20 → $0,50 | Par 50% lētāk |
Cenas norādītas par 1 miljonu tekstvienību.
GPT‑6 Astra joprojām ir mūsu vislabākais modelis visās jomās. Izvēlieties to, ja vēlaties vislabākos rezultātus bez jebkādiem kompromisiem.
GPT‑6 Sol un Luna papildina jau pazīstamos un izmantotos modeļus ar augstāku intelekta līmeni un izmaksu efektivitāti, uzlabojot spējas, kas visvairāk noder sarežģītu darbu paveikšanai.
GPT‑6 Sol spēj veikt sarežģītus darba uzdevumus, vienlaikus sniedzot vairāk iespēju atkārtoti pilnveidot rezultātu, pateicoties augstākiem lietojuma ierobežojumiem un zemākām izmaksām. Tas nodrošina augstāku intelekta līmeni un labākus rezultātus nekā līdzīgas cenas konkurentu modeļi.
Uzņēmējdarbības darbplūsmu testā AutomationBench, kas aptver dažādas lietotnes, GPT‑6 Sol ar īpaši augstu piepūli pārspēj Claude Opus 5 ar maksimālu piepūli, viena uzdevuma izpildei maksājot tikai 9% no Opus 5 izmaksām. Ar augstu piepūli GPT‑6 Luna pārspēj savu priekšteci par 5,4 procentpunktiem, turklāt viena uzdevuma izmaksas ir par 58% zemākas.
Testā AutomationBench 1.0.6(atveras jaunā logā) MI aģentus pārbauda pilnās darbplūsmās, izmantojot 47 rīkus pārdošanas, mārketinga, operāciju, atbalsta, finanšu un personāla vadības jomā. Claude Fable 5.1 datu punkts uzrāda zemākas izmaksas par faktiskajām, jo tajā nav iekļautas rezerves Opus 5 izmaksas — tas tika izmantots aptuveni 40% uzdevumu.
GPT‑6 Sol arī pārspēj Claude Fable 5.1 ar daudz zemākām izmaksām un pat apsteidz GPT‑6 Astra ar zemu piepūli.
Modelis (un piepūle) | Rezultāts | Izmaksas par uzdevumu |
|---|---|---|
GPT‑6 Sol (īpaši augsts) | 33,2% | $0,27 |
GPT‑6 Astra (zems) | 30,3% | 3,9× vairāk nekā GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11,1× vairāk nekā GPT‑6 Sol |
Claude Fable 5.1 ar rezerves Opus 5 (Max) | 31,4% | >8,9× vairāk nekā GPT‑6 Sol (rezerves modeļa izmaksas nav norādītas) |
Testā Agents’ Last Exam, kurā aģentus vērtē sarežģītās profesionālās darbplūsmās, GPT‑6 Sol ar maksimālu piepūli iegūst 56,4% — vairāk par Claude Opus 5 augstāko rezultātu šajā novērtējumā, turklāt viena uzdevuma izmaksas ir par 60% zemākas.
Testā Agents’ Last Exam V1(atveras jaunā logā) MI aģentus vērtē ilgstošos, ekonomiski vērtīgos uzdevumos, kas aptver 55 apakšnozares un lielāko daļu svarīgāko profesionālā darba jomu, kurās izmanto datoru.
Atbildes lietderība ir atkarīga no faktu pareizības, tāpēc turpinām uzlabot faktu uzticamību. Mūsu iekšējā faktu precizitātes novērtējumā, kura pamatā ir deidentificētas reālas sarunas, kurās lietotāji norādīja uz mūsu modeļu kļūdām, GPT‑6 Sol pieļauj aptuveni uz pusi mazāk kļūdu nekā tā priekštecis un ar daudz zemākām izmaksām tuvojas Astra uzticamības līmenim. Arī GPT‑6 Luna ir būtiski uzlabots: augstākos piepūles līmeņos tas sasniedz GPT‑5.6 Sol rezultātu par aptuveni simtdaļu no tā izmaksām.
Šeit faktu precizitāti vērtējam deidentificētās ChatGPT sarunās, kurās lietotāji bija norādījuši uz iepriekšēja modeļa pieļautu faktu kļūdu. Šīs kļūdas izraisošās sarunas neatspoguļo tipisku lietojumu, kurā faktu kļūdas ir retākas. Rezultāti nav koriģēti pēc garuma, tomēr mūsu izvērstības pārbaudēs atbildes garumam gandrīz nebija ietekmes.
Šogad programmēšanas aģenti ir sākuši veikt vēl nepieredzēti sarežģītus, apjomīgus un ilgstošus uzdevumus. OpenAI iekšējais lietojums ir audzis eksponenciāli. Vērtējot pēc API cenām, dienā izmantoto tekstvienību izmaksas mediānajam pētniekam ir pārsniegušas 600 ASV dolāru, bet 90. procentiles pētniekiem — 7000 ASV dolāru (Pētniecības paātrināšana: ieskats OpenAI darbā). Programmēšanas aģentiem uzņemoties ilgākus un prasīgākus uzdevumus, ilgstošas lietošanas izmaksas kļūst arvien svarīgākas. GPT‑6 Sol un Luna apvieno augstu programmēšanas veiktspēju ar zemākām API cenām, dodot izstrādātājiem vairāk iespēju atkārtoti pilnveidot rezultātus un komandām — pārliecību uzticēt Codex vērienīgākus uzdevumus.
Testā FrontierCode, kurā vērtē, vai programmēšanas aģentu veiktās izmaiņas ir gatavas sapludināšanai reālās kodu bāzēs, GPT‑6 Sol būtiski pārspēj GPT‑5.6 Sol un ar daudz zemākām izmaksām sasniedz Claude Fable 5.1 īpaši augstas piepūles rezultātu.
Testā FrontierCode 1.1 Main(atveras jaunā logā) MI aģenti raksta kodu, ko vērtē ne tikai pēc pareizības, bet arī pēc gatavības iekļaušanai, piemēram, testu kvalitātes, tvēruma ievērošanas, koda stila un atbilstības kodu bāzes standartiem.
Testā DeepSWE v1.1, kurā vērtē sarežģītu programmatūras inženierijas uzdevumu izpildi reālās kodu bāzēs, GPT‑6 Sol ar maksimālu piepūli iegūst 68,8% — tikai par 1,1 procentpunktu mazāk nekā Claude Fable 5 augstākais rezultāts šajā novērtējumā (69,9% ar īpaši augstu piepūli), turklāt viena uzdevuma izmaksas ir aptuveni par 80% zemākas.
GPT‑6 Luna ar maksimālu piepūli iegūst 66,6% — rezultātu, kas pielīdzināms Claude Opus 5 un Fable 5 ar vidēju piepūli. Šajos salīdzinājumos viena Luna uzdevuma izmaksas ir par 93% zemākas nekā Opus 5 un par 96% zemākas nekā Fable 5.
Testā DeepSWE 1.1(atveras jaunā logā) MI aģenti risina oriģinālus, ilgstošus programmatūras inženierijas uzdevumus.
Lai gan GPT‑6 Astra joprojām ir pasaulē labākais modelis datora lietošanai, GPT‑6 Sol un Luna nodrošina izmaksu ziņā efektīvāku veiktspēju nekā to priekšteči. Testa OSWorld 2.0 bezsaistes kopā GPT‑6 Sol ar īpaši augstu piepūli sasniedz līdzīgu rezultātu kā Claude Opus 5 ar vidēju piepūli — 60,5% pret 60,3% —, turklāt viena uzdevuma izmaksas ir aptuveni par 80% zemākas. GPT‑6 Luna (Max) spēj pārspēt GPT‑5.6 Sol (vidējs), maksājot desmitreiz mazāk.
Testā OSWorld 2.0(atveras jaunā logā) MI aģenti mēģina izpildīt ilgstošas datora lietošanas darbplūsmas, kas aptver ikdienas un profesionālus uzdevumus. Norādām daļējo atlīdzību bezsaistes kopā no laidiena v2026.08.08.
GPT‑6 Astra uzlaboto saziņas stilu esam ieviesuši arī Sol un Luna; mūsuprāt, tas būs īpaši pamanāms tehniskās un programmēšanas sarunās. Atbildes būs skaidrākas, ar mazāk žargona, neveiklu izteicienu un mazvērtīgu detaļu, kā arī kopumā nedaudz īsākas, nezaudējot saturisko vērtību.
Lai gan stils ir subjektīvs, mēs šeit dodam priekšroku GPT‑6 Sol atbildei. Tā nesteidzas izdarīt secinājumus, mazāk atkārto informāciju, kas jautājuma autoram varētu būt pašsaprotama (piemēram, ka vietnei ir četras lapas), lieto mazāk neskaidru izteicienu (piemēram, „bento noskaņa” un „pārveidot… atbilstoši šai sistēmai”), atklātāk norāda, kas tika un netika pārbaudīts, un bez vajadzības neizpauž tādas ieviešanas detaļas kā attēlu rīkam dotā uzvedne.
Līdztekus zemākām tekstvienību cenām palīdzam GPT‑6 izstrādātājiem vairāk ietaupīt uz kontekstu, ko viņu lietotnes izmanto atkārtoti. Esam uzlabojuši GPT‑6 uzvedņu kešošanu, lai pēc noklusējuma palielinātu kešatmiņas trāpījumu īpatsvaru. Tas palīdz aģentiem atkārtoti izmantot vairāk konteksta, ātrāk atbildēt un saņemt 90% atlaidi kešotās ievades tekstvienību nolasīšanai.
Izstrādātājiem ir arī vairāk iespēju mērīt un optimizēt kešatmiņas veiktspēju:
Pārraugiet un diagnosticējiet. Uzvedņu kešošanas informācijas panelī(atveras jaunā logā) var redzēt, cik liela ievades daļa ir kešota un kā tas mainās laika gaitā. Diagnostikas rīks(atveras jaunā logā) palīdz saprast neizmantotās kešošanas iespējas un noskaidrot, kas jālabo.
Mainiet spriestspējas piepūli un rīku pieejamību, neizjaucot kešatmiņu. Palieliniet spriestspējas piepūli(atveras jaunā logā) sarežģītākiem uzdevumiem vai samaziniet to vienkāršākiem papildjautājumiem, kā arī iespējojiet vai atspējojiet rīkus(atveras jaunā logā), mainoties aģenta vajadzībām. Abos gadījumos iepriekšējais konteksts tagad tiek saglabāts atkārtotai izmantošanai kešatmiņā.
Optimizējiet, kuri prefiksi tiek kešoti. Skaidri norādīti pārtraukumpunkti ļauj izstrādātājiem izvēlēties, kur beidzas kešotie uzvedņu prefiksi. Tas sniedz izstrādātājiem lielāku kontroli pār kešatmiņas atkārtotu izmantošanu un var uzlabot veiktspēju.
GitHub ziņo, ka pēdējo mēnešu laikā šie uzlabojumi miljardiem OpenAI modeļiem nosūtīto pieprasījumu par vairāk nekā 50% samazinājuši to uzvednes tekstvienību daļu, kas jāapstrādā no jauna, tādējādi palīdzot Copilot atbildēt ātrāk.
GPT‑6 Sol un Luna pilnveido saskaņotības risinājumus, ko ieviesām ar Astra — līdz šim vislabāk saskaņoto modeli. Mūsu saskaņotības novērtējumos gan Sol, gan Luna pārspēj attiecīgos GPT‑5.6 modeļus, tostarp retāk izsakot maldinošus apgalvojumus par savu programmēšanas darbu.
Tālāk aprakstītajos novērtējumos apzināti pārbauda sarežģītas situācijas, un tie nemēra kļūmju īpatsvaru tipiskā lietojumā. Pilnus rezultātus skatiet sistēmas kartē(atveras jaunā logā).
No šodienas GPT‑6 Sol un GPT‑6 Luna ir pieejami ChatGPT Work un Codex visiem Plus, Pro, Business, Enterprise un Edu lietotājiem. Free un Go lietotāji GPT‑6 Luna var izmantot darbvirsmas lietotnē. Šie modeļi vēl nav pieejami režīmā Chat. OpenAI API tie ir pieejami kā gpt-6-sol un gpt-6-luna.
Lai pakalpojums visiem darbotos stabili, plānojam šos modeļus ChatGPT ieviest pakāpeniski visas dienas garumā. Ja ChatGPT Work vai Codex vēl neredzat jaunos modeļus, lūdzu, mēģiniet vēlreiz vēlāk.
GPT novērtēšana tika veikta mūsu pētniecības vidē vai ar mūsu API, tāpēc sistēmas uzvedņu, pieejamo rīku un citu atšķirību dēļ rezultāti var nedaudz atšķirties no publiski pieejamās ChatGPT versijas. Konkurentu modeļu novērtējumi iegūti no publiski pieejamiem pārskatiem. Ja Claude Fable 5.1 rezultāti nebija pieejami, norādījām Claude Fable 5 rezultātus.


