Predstavljamo GPT‑6 Sol i Lunu
Više načina da graničnu inteligenciju uključite u svakodnevni rad.
Ranije ovog mjeseca predstavili smo GPT‑6 Astra, najinteligentniji i najusklađeniji model na svijetu. Iako najzahtjevniji i najvažniji projekti i dalje iziskuju puni potencijal Astre, posao se obavlja u različitim obimima, ritmovima i budžetima.
Zato proširujemo GPT‑6 porodicu modelima GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra uvela je novu generaciju inteligencije, a ovi modeli pomažu u širenju njenih prednosti pomjeranjem granica troškovne efikasnosti. GPT‑6 Sol i Luna obučili smo metodama sličnim onima za GPT‑6 Astra, čime napredak zaslužan za Astrine vrhunske rezultate u profesionalnom radu, činjeničnoj tačnosti, programiranju, korištenju računara i usklađenosti donosimo bržim i pristupačnijim modelima.
GPT‑6 modeli predvode duž cijele krivulje odnosa troškova i inteligencije, spajajući izuzetne mogućnosti na svakom nivou s infrastrukturom koja ih efikasno pruža u velikom obimu. Poboljšanja keširanja i zaključivanja omogućavaju nam da ove modele nudimo po nižoj cijeni, a te uštede direktno prenosimo korisnicima i klijentima tako što snižavamo cijene API-ja za Sol i Lunu za 50% u odnosu na njihove promotivne cijene za GPT‑5.6. Zajedno, ova poboljšanja čine naprednu umjetnu inteligenciju praktičnom za više svakodnevnih zadataka i primjena u velikom obimu.
Model | Ulaz | Izlaz | Sniženje cijene |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | 50% jeftinije |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | 50% jeftinije |
Cijene su navedene za milion tokena.
GPT‑6 Astra i dalje je naš najbolji model u svim područjima. Odaberite ga kada želite najbolje rezultate i iskustvo bez kompromisa.
GPT‑6 Sol i Luna donose poboljšanu inteligenciju i troškovnu efikasnost poznatim modelima koje već koristite, posebno u sposobnostima najkorisnijim za obavljanje složenih poslova.
GPT‑6 Sol može preuzeti zahtjevne radne zadatke, a vi dobijate više prostora za iteracije zahvaljujući višim ograničenjima korištenja i nižim troškovima, uz veću inteligenciju i bolje rezultate od konkurentskih modela slične cijene.
Na testu AutomationBench, koji obuhvata poslovne tokove rada u različitim aplikacijama, GPT‑6 Sol uz xhigh nivo napora nadmašuje Claude Opus 5 uz Max nivo napora, i to uz samo 9% troška koji Opus 5 ima po zadatku. Uz Visok nivo napora, GPT‑6 Luna nadmašuje svog prethodnika za 5,4 procentna boda, uz 58% niži trošak po zadatku.
U testu AutomationBench 1.0.6(otvara se u novom prozoru) agenti umjetne inteligencije testiraju se na cjelovitim tokovima rada uz korištenje 47 alata iz prodaje, marketinga, operacija, podrške, finansija i ljudskih resursa. Podatak za Claude Fable 5.1 prikazuje manji trošak od stvarnog jer ne uključuje trošak rezervnog modela Opus 5, koji je korišten u približno 40% zadataka.
GPT‑6 Sol također nadmašuje Claude Fable 5.1 uz znatno niže troškove, pa čak i GPT‑6 Astra s niskim nivoom napora.
Model (i nivo napora) | Rezultat | Trošak po zadatku |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2% | 0,27 USD |
GPT‑6 Astra (nizak) | 30,3% | 3,9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11,1x GPT‑6 Sol |
Claude Fable 5.1 uz rezervni Opus 5 (Max) | 31,4% | >8,9x GPT‑6 Sol (trošak rezervnog modela nije naveden) |
Na testu Agents’ Last Exam, koji procjenjuje agente u složenim profesionalnim tokovima rada, GPT‑6 Sol uz Max nivo napora postiže 56,4%, više od najboljeg rezultata modela Claude Opus 5 u ovoj evaluaciji, uz 60% niži trošak po zadatku.
U testu Agents’ Last Exam V1(otvara se u novom prozoru) agenti umjetne inteligencije procjenjuju se na dugotrajnim, ekonomski vrijednim zadacima iz 55 podindustrija, koji obuhvataju većinu glavnih područja profesionalnog rada na računaru.
Korisnost odgovora zavisi od tačnosti činjenica, a mi nastavljamo unapređivati činjeničnu pouzdanost. U našoj internoj evaluaciji činjenične tačnosti, zasnovanoj na anonimiziranim stvarnim razgovorima u kojima su korisnici označili greške naših modela, GPT‑6 Sol pravi približno upola manje grešaka od prethodnika i približava se pouzdanosti Astre uz znatno niže troškove. GPT‑6 Luna također ostvaruje znatan napredak; pri višim nivoima napora dostiže GPT‑5.6 Sol uz približno stoti dio njegovog troška.
Ovdje procjenjujemo činjeničnu tačnost na anonimiziranim razgovorima u ChatGPT‑u u kojima su korisnici označili činjeničnu grešku ranijeg modela. Ovi razgovori koji izazivaju greške ne predstavljaju uobičajenu upotrebu, u kojoj su činjenične greške rjeđe. Rezultati nisu kontrolirani prema dužini; međutim, naša ispitivanja različitih nivoa opširnosti pokazala su da dužina odgovora gotovo uopće ne utiče na njih.
Ove godine agenti za programiranje počeli su rješavati zadatke veće složenosti, obima i trajanja nego ikada prije. U kompaniji OpenAI naša interna upotreba eksponencijalno je porasla. Kada se vrednuje prema cijenama API-ja, dnevna potrošnja tokena premašila je 600 USD za istraživača na medijanu i 7.000 USD za istraživače u 90. percentilu (Ubrzavanje istraživanja: pogled iz kompanije OpenAI). Kako agenti za programiranje preuzimaju duže i zahtjevnije zadatke, trošak kontinuirane upotrebe postaje sve važniji. GPT‑6 Sol i Luna spajaju odlične rezultate u programiranju s nižim cijenama API-ja, pružajući programerima više prostora za iteracije, a timovima sigurnost da Codexu povjere ambicioznije zadatke.
Na testu FrontierCode, koji procjenjuje da li agenti za programiranje stvaraju izmjene spremne za spajanje sa stvarnim bazama koda, GPT‑6 Sol znatno nadmašuje GPT‑5.6 Sol i može dostići Claude Fable 5.1 uz xhigh nivo napora, ali po mnogo nižoj cijeni.
U testu FrontierCode 1.1 Main(otvara se u novom prozoru) agenti umjetne inteligencije pišu kod koji se ne ocjenjuje samo prema ispravnosti nego i prema „spremnosti za spajanje“, naprimjer prema kvalitetu testova, dosljednosti obima, stilu koda i poštivanju standarda baze koda.
Na testu DeepSWE v1.1, koji provjerava rezultate na složenim zadacima softverskog inženjerstva u stvarnim bazama koda, GPT‑6 Sol uz Max nivo napora postiže 68,8%, što je 1,1 procentni bod manje od najboljeg rezultata modela Claude Fable 5 u evaluaciji — 69,9% uz xhigh nivo napora — i to uz približno 80% niži trošak po zadatku.
GPT‑6 Luna uz Max nivo napora postiže 66,6%, što je uporedivo s modelima Claude Opus 5 i Fable 5 uz Srednji nivo napora. U ovim poređenjima Luna košta 93% manje po zadatku od modela Opus 5 i 96% manje od modela Fable 5.
U testu DeepSWE 1.1(otvara se u novom prozoru) agenti umjetne inteligencije rješavaju originalne, dugotrajne zadatke softverskog inženjerstva.
Iako je GPT‑6 Astra i dalje najbolji model na svijetu za korištenje računara, GPT‑6 Sol i Luna pružaju troškovno efikasnije rezultate od svojih prethodnika. Na testu OSWorld 2.0 offline, GPT‑6 Sol uz xhigh nivo napora postiže rezultat sličan modelu Claude Opus 5 uz Srednji nivo napora — 60,5% naspram 60,3% — uz približno 80% niži trošak po zadatku. GPT‑6 Luna (Max) nadmašuje GPT‑5.6 Sol (Srednja) uz desetinu njegovog troška.
U testu OSWorld 2.0(otvara se u novom prozoru) agenti umjetne inteligencije pokušavaju izvršiti dugotrajne tokove rada na računaru koji obuhvataju svakodnevne i profesionalne zadatke. Navodimo djelimičnu nagradu na vanmrežnom skupu iz izdanja v2026.08.08.
Poboljšani stil komunikacije modela GPT‑6 Astra prenijeli smo i na Sol i Lunu, a vjerujemo da će to biti posebno primjetno u tehničkim razgovorima i razgovorima o programiranju. Očekujte više jasnoće, manje žargona, manje neobičnih formulacija i suvišnih detalja te općenito nešto kraće odgovore bez gubitka sadržaja.
Iako je stil subjektivan, ovdje nam je draži odgovor modela GPT‑6 Sol. Ne donosi zaključke tako brzo, troši manje vremena ponavljajući detalje koji bi osobi koja pita mogli biti očigledni (npr. da web-stranica ima četiri stranice), koristi manje neodređenih izraza (npr. „bento dojam“, „preoblikovanje… oko tog sistema“), otvorenije navodi šta jeste, a šta nije provjerio te nepotrebno ne iznosi detalje implementacije poput upita za alat za slike.
Uz niže cijene tokena, pomažemo programerima koji razvijaju rješenja na GPT‑6 da dodatno uštede na kontekstu koji njihove aplikacije ponovo koriste. Poboljšali smo keširanje promptova za GPT‑6 kako bismo standardno omogućili višu stopu pogodaka u kešu, čime agenti mogu ponovo koristiti više konteksta, brže odgovarati i ostvariti popust od 90% na čitanje keširanih ulaznih tokena.
Programeri sada imaju i više načina za mjerenje i optimizaciju učinka keširanja:
Praćenje i dijagnostika. Kontrolna ploča za keširanje promptova(otvara se u novom prozoru) prikazuje koliki je dio ulaza keširan i kako se to mijenja tokom vremena. Dijagnostički alat(otvara se u novom prozoru) pomaže objasniti propuštene prilike za keširanje i šta treba ispraviti.
Prilagodite nivo rezonovanja i dostupnost alata bez narušavanja keša. Povećajte nivo rezonovanja(otvara se u novom prozoru) za teže zadatke ili ga smanjite za jednostavnija dodatna pitanja te uključite ili isključite alate(otvara se u novom prozoru) u skladu s promjenama potreba vašeg agenta. Obje kontrole sada čuvaju raniji kontekst radi ponovne upotrebe keša.
Optimizirajte koji se prefiksi keširaju. Izričite prijelomne tačke omogućavaju programerima da odaberu gdje završavaju keširani prefiksi upita. Time programeri dobijaju veću kontrolu nad ponovnom upotrebom keša i mogu poboljšati performanse.
GitHub navodi da su ova poboljšanja tokom posljednjih nekoliko mjeseci smanjila udio tokena upita koji zahtijevaju novu obradu za više od 50% kroz milijarde zahtjeva modelima OpenAI, pomažući Copilotu da brže odgovara.
GPT‑6 Sol i Luna nadograđuju rad na usklađivanju uveden s Astrom, našim dosad najusklađenijim modelom. U našim evaluacijama usklađenosti i Sol i Luna pokazuju poboljšanja u odnosu na odgovarajuće GPT‑5.6 modele, uključujući niže stope obmanjujućih tvrdnji o svom radu na programiranju.
Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope neuspjeha pri uobičajenoj upotrebi. Potpune rezultate pogledajte u kartici sistema(otvara se u novom prozoru).
GPT‑6 Sol i GPT‑6 Luna od danas su dostupni u načinima ChatGPT Work i Codex svim korisnicima paketa Plus, Pro, Business, Enterprise i Edu. Korisnici paketa Free i Go mogu pristupiti modelu GPT‑6 Luna u aplikaciji za računare. Ovi modeli još nisu dostupni u načinu Chat. U OpenAI API-ju dostupni su kao gpt-6-sol i gpt-6-luna.
Kako bismo održali stabilnost usluge za sve, ove modele planiramo postepeno uvoditi u ChatGPT tokom dana. Ako nove modele ne vidite u načinu ChatGPT Work ili u Codexu, pokušajte ponovo kasnije.
Evaluacije GPT‑a provedene su u našem istraživačkom okruženju ili putem našeg API-ja, koji zbog razlika u sistemskim upitima, dostupnim alatima i drugim faktorima može davati neznatno drugačije rezultate od produkcijskog ChatGPT‑a. Evaluacije konkurentskih modela preuzete su iz javno dostupnih izvještaja. Rezultati za Claude Fable 5 navedeni su kada rezultati za Claude Fable 5.1 nisu bili dostupni.


