Predstavljamo GPT‑6 Sol i Lunu
Više načina da najnapredniju inteligenciju uvedete u svoj svakodnevni rad.
Ranije ovog mjeseca predstavili smo GPT‑6 Astra, najinteligentniji i najusklađeniji model na svijetu. Iako najzahtjevniji i najvažniji projekti i dalje traže punu dubinu modela Astra, posao se obavlja u različitim opsezima, ritmovima i proračunima.
Zato svijet GPT‑6 proširujemo modelima GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra uveo je novu generaciju inteligencije, a ovi modeli pomažu proširiti njezine prednosti pomicanjem granica troškovne učinkovitosti. GPT‑6 Sol i Luna trenirali smo metodama sličnima onima za GPT‑6 Astra, čime napredak zaslužan za vrhunske rezultate Astre u profesionalnom radu, činjeničnoj točnosti, programiranju, upotrebi računala i usklađenosti donosimo bržim i povoljnijim modelima.
Modeli GPT‑6 predvode duž cijele krivulje troška i inteligencije, spajajući iznimne mogućnosti na svakoj razini s infrastrukturom koja ih učinkovito pruža u velikom opsegu. Poboljšanja predmemoriranja i zaključivanja omogućuju nam pružanje tih modela uz niže troškove, a uštede izravno prenosimo korisnicima i klijentima tako što snižavamo API cijene za Sol i Lunu za 50 % u odnosu na njihove promotivne cijene za GPT‑5.6. Ta poboljšanja zajedno čine naprednu umjetnu inteligenciju praktičnom za više svakodnevnih zadataka i primjena velikog opsega.
Model | Ulaz | Izlaz | Sniženje cijene |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | 50 % jeftinije |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | 50 % jeftinije |
Cijene su navedene za milijun tokena.
GPT‑6 Astra i dalje je naš najbolji svestrani model. Odaberite ga kada želite najbolje rezultate i iskustvo bez kompromisa.
GPT‑6 Sol i Luna donose poboljšanu inteligenciju i troškovnu učinkovitost modelima koje već poznajete i upotrebljavate, osobito u mogućnostima najkorisnijima za obavljanje složenih poslova.
GPT‑6 Sol može preuzeti zahtjevne poslovne zadatke, uz više prostora za iteracije zahvaljujući višim ograničenjima upotrebe i nižoj cijeni, te pruža više inteligencije i bolje rezultate od konkurentskih modela slične cijene.
Na testu AutomationBench, koji obuhvaća poslovne tijekove rada u različitim aplikacijama, GPT‑6 Sol uz razinu napora xhigh nadmašuje Claude Opus 5 uz maksimalan napor, i to uz samo 9 % troška modela Opus 5 po zadatku. Uz visoku razinu napora GPT‑6 Luna nadmašuje svojeg prethodnika za 5,4 postotna boda, uz 58 % niži trošak po zadatku.
U testu AutomationBench 1.0.6(otvara se u novom prozoru) agenti umjetne inteligencije testiraju se na cjelovitim tijekovima rada s pomoću 47 alata iz prodaje, marketinga, operacija, podrške, financija i ljudskih resursa. Podatak za Claude Fable 5.1 podcjenjuje njegov stvarni trošak jer ne uključuje trošak prebacivanja na Opus 5, do kojeg je došlo u približno 40 % zadataka.
GPT‑6 Sol također nadmašuje Claude Fable 5.1 uz znatno nižu cijenu, pa čak i GPT‑6 Astra uz nisku razinu napora.
Model (i razina napora) | Rezultat | Trošak po zadatku |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2 % | 0,27 USD |
GPT‑6 Astra (niska) | 30,3 % | 3,9× GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1× GPT‑6 Sol |
Claude Fable 5.1 uz pričuvni Opus 5 (Max) | 31,4 % | >8,9× GPT‑6 Sol (trošak pričuvnog modela nije naveden) |
Na testu Agents’ Last Exam, koji agente ocjenjuje na složenim profesionalnim tijekovima rada, GPT‑6 Sol uz maksimalan napor postiže 56,4 %, više od najboljeg rezultata modela Claude Opus 5 u toj evaluaciji, uz 60 % niži trošak po zadatku.
U testu Agents’ Last Exam V1(otvara se u novom prozoru) agenti umjetne inteligencije ocjenjuju se na dugotrajnim, gospodarski vrijednim zadacima iz 55 podindustrija, koji obuhvaćaju većinu glavnih područja profesionalnog rada na računalu.
Korisnost odgovora ovisi o točnosti činjenica, a mi i dalje napredujemo u činjeničnoj pouzdanosti. U našoj internoj evaluaciji činjenične točnosti, utemeljenoj na deidentificiranim stvarnim razgovorima u kojima su korisnici označili pogreške naših modela, GPT‑6 Sol griješi otprilike upola rjeđe od svojeg prethodnika te se uz mnogo nižu cijenu približava pouzdanosti Astre. GPT‑6 Luna također se znatno poboljšao; na višim razinama napora izjednačen je s modelom GPT‑5.6 Sol uz približno stotinu puta nižu cijenu.
Ovdje procjenjujemo činjeničnu točnost na deidentificiranim razgovorima u ChatGPT‑u u kojima su korisnici označili činjeničnu pogrešku prethodnog modela. Ti razgovori koji potiču pogreške ne predstavljaju uobičajenu upotrebu, u kojoj su činjenične pogreške rjeđe. Rezultati nisu prilagođeni duljini, no naša ispitivanja opširnosti pokazala su da duljina odgovora gotovo uopće ne utječe na njih.
Ove su se godine agenti za programiranje počeli baviti zadacima veće složenosti, opsega i trajanja nego ikad prije. U OpenAI-ju naša interna upotreba eksponencijalno raste. Prema API cijenama, dnevna potrošnja tokena premašila je 600 USD za medijalnog istraživača i 7.000 USD za istraživače u 90. percentilu (Ubrzavanje istraživanja: pogled iz OpenAI-ja). Kako agenti za programiranje preuzimaju dulje i zahtjevnije zadatke, trošak kontinuirane upotrebe postaje sve važniji. GPT‑6 Sol i Luna spajaju snažne rezultate u programiranju s nižim API cijenama, pružajući razvojnim programerima više prostora za iteracije, a timovima sigurnost da Codexu povjere ambicioznije zadatke.
Na testu FrontierCode, koji procjenjuje stvaraju li agenti za programiranje izmjene spremne za spajanje u stvarne baze koda, GPT‑6 Sol znatno nadmašuje GPT‑5.6 Sol i može se izjednačiti s modelom Claude Fable 5.1 xhigh uz mnogo nižu cijenu.
U testu FrontierCode 1.1 Main(otvara se u novom prozoru) agenti umjetne inteligencije pišu kod koji se ne ocjenjuje samo prema ispravnosti nego i prema „spojivosti”, primjerice prema kvaliteti testova, pridržavanju opsega, stilu koda i standardima baze koda.
Na testu DeepSWE v1.1, koji ispituje rezultate na složenim zadacima softverskog inženjerstva u stvarnim bazama koda, GPT‑6 Sol uz maksimalan napor postiže 68,8 %, što je 1,1 postotni bod manje od najboljeg rezultata modela Claude Fable 5 u evaluaciji — 69,9 % uz napor xhigh — i to uz približno 80 % niži trošak po zadatku.
GPT‑6 Luna uz maksimalan napor postiže 66,6 %, što je usporedivo s modelima Claude Opus 5 i Fable 5 uz srednju razinu napora. U tim usporedbama Luna po zadatku košta 93 % manje od modela Opus 5 i 96 % manje od modela Fable 5.
U testu DeepSWE 1.1(otvara se u novom prozoru) agenti umjetne inteligencije rješavaju originalne, dugotrajne zadatke softverskog inženjerstva.
Iako je GPT‑6 Astra i dalje najbolji model na svijetu za upotrebu računala, GPT‑6 Sol i Luna pružaju troškovno učinkovitije rezultate od svojih prethodnika. Na izvanmrežnom testu OSWorld 2.0 GPT‑6 Sol uz napor xhigh postiže rezultat sličan modelu Claude Opus 5 uz srednji napor — 60,5 % prema 60,3 % — i to uz približno 80 % niži trošak po zadatku. GPT‑6 Luna (Max) nadmašuje GPT‑5.6 Sol (srednja razina) uz desetinu njegova troška.
U testu OSWorld 2.0(otvara se u novom prozoru) agenti umjetne inteligencije pokušavaju izvršiti dugotrajne tijekove rada na računalu koji obuhvaćaju svakodnevne i profesionalne zadatke. Navodimo djelomičnu nagradu za izvanmrežni skup iz izdanja v2026.08.08.
Poboljšani komunikacijski stil modela GPT‑6 Astra prenijeli smo i na Sol i Lunu, a očekujemo da će to biti osobito primjetno u tehničkim razgovorima i razgovorima o programiranju. Očekujte više jasnoće, manje žargona, manje neobičnih formulacija i suvišnih pojedinosti te općenito nešto kraće odgovore bez gubitka sadržaja.
Iako je stil subjektivan, ovdje nam je draži odgovor modela GPT‑6 Sol. Ne donosi zaključke tako brzo, manje vremena troši na ponavljanje pojedinosti koje bi osobi koja pita mogle biti očite (npr. da web-mjesto ima četiri stranice), manje se služi neodređenim izrazima (npr. „dojam benta”, „preoblikovanje… oko tog sustava”), otvorenije navodi što je provjerio, a što nije te bez potrebe ne iznosi implementacijske pojedinosti poput upita za svoj alat za slike.
Uz niže cijene tokena pomažemo razvojnim programerima koji rade na platformi GPT‑6 da dodatno uštede na kontekstu koji njihove aplikacije ponovno upotrebljavaju. Poboljšali smo predmemoriranje upita za GPT‑6 kako bismo prema zadanim postavkama povećali stopu pogodaka predmemorije, što agentima omogućuje ponovnu upotrebu više konteksta, brže odgovore i popust od 90 % na čitanje predmemoriranih ulaznih tokena.
Razvojni programeri sada imaju i više načina za mjerenje i optimizaciju učinkovitosti predmemoriranja:
Praćenje i dijagnostika. Nadzorna ploča za predmemoriranje upita(otvara se u novom prozoru) prikazuje koliki je dio ulaza predmemoriran i kako se to mijenja tijekom vremena. Dijagnostički alat(otvara se u novom prozoru) pomaže objasniti propuštene prilike za predmemoriranje i što treba ispraviti.
Prilagodite razinu rasuđivanja i dostupnost alata bez prekidanja predmemorije. Povećajte razinu rasuđivanja(otvara se u novom prozoru) za teže zadatke ili je smanjite za jednostavnija dodatna pitanja te omogućite ili onemogućite alate(otvara se u novom prozoru) u skladu s promjenama potreba svojeg agenta. Obje kontrole sada čuvaju raniji kontekst za ponovnu upotrebu predmemorije.
Optimizirajte prefikse koji se predmemoriraju. Izričite prijelomne točke omogućuju razvojnim programerima da odaberu gdje završavaju predmemorirani prefiksi upita. Time razvojni programeri dobivaju veću kontrolu nad ponovnom upotrebom predmemorije i mogu poboljšati rezultate.
GitHub navodi da su tijekom proteklih nekoliko mjeseci ta poboljšanja smanjila udio tokena upita koje treba iznova obraditi za više od 50 % u milijardama zahtjeva modelima OpenAI, što Copilotu pomaže brže odgovarati.
GPT‑6 Sol i Luna nadograđuju rad na usklađenosti uveden s Astrom, našim dosad najusklađenijim modelom. U našim evaluacijama usklađenosti Sol i Luna pokazuju poboljšanja u odnosu na odgovarajuće modele GPT‑5.6, uključujući niže stope obmanjujućih tvrdnji o svojem radu na programiranju.
Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope pogrešaka u uobičajenoj upotrebi. Cjelovite rezultate potražite u dokumentu o sustavu(otvara se u novom prozoru).
GPT‑6 Sol i GPT‑6 Luna od danas su dostupni u načinima ChatGPT Work i Codex svim korisnicima planova Plus, Pro, Business, Enterprise i Edu. Korisnici planova Free i Go mogu pristupiti modelu GPT‑6 Luna u aplikaciji za stolna računala. Ti modeli još nisu dostupni u načinu Chat. U OpenAI API-ju dostupni su kao gpt-6-sol i gpt-6-luna.
Kako bi usluga ostala stabilna za sve, te modele planiramo postupno uvoditi u ChatGPT tijekom dana. Ako nove modele ne vidite u načinu ChatGPT Work ili u Codexu, pokušajte ponovno poslije.
Evaluacije modela GPT provedene su u našem istraživačkom okruženju ili putem našeg API-ja, koji zbog razlika u sistemskim upitima, dostupnim alatima i ostalome može davati nešto drukčije rezultate od produkcijskog ChatGPT‑a. Evaluacije konkurentskih modela preuzete su iz javno dostupnih izvješća. Rezultati za Claude Fable 5 navedeni su kada rezultati za Claude Fable 5.1 nisu bili dostupni.


