Preskočite na glavni sadržaj
OpenAI

Predstavljamo GPT‑6 Sol i Lunu

Više načina da najnapredniju inteligenciju uvedete u svoj svakodnevni rad.

Učitavanje…

Ranije ovog mjeseca predstavili smo GPT‑6 Astra, najinteligentniji i najusklađeniji model na svijetu. Iako najzahtjevniji i najvažniji projekti i dalje traže punu dubinu modela Astra, posao se obavlja u različitim opsezima, ritmovima i proračunima.

Zato svijet GPT‑6 proširujemo modelima GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra uveo je novu generaciju inteligencije, a ovi modeli pomažu proširiti njezine prednosti pomicanjem granica troškovne učinkovitosti. GPT‑6 Sol i Luna trenirali smo metodama sličnima onima za GPT‑6 Astra, čime napredak zaslužan za vrhunske rezultate Astre u profesionalnom radu, činjeničnoj točnosti, programiranju, upotrebi računala i usklađenosti donosimo bržim i povoljnijim modelima.

Modeli GPT‑6 predvode duž cijele krivulje troška i inteligencije, spajajući iznimne mogućnosti na svakoj razini s infrastrukturom koja ih učinkovito pruža u velikom opsegu. Poboljšanja predmemoriranja i zaključivanja omogućuju nam pružanje tih modela uz niže troškove, a uštede izravno prenosimo korisnicima i klijentima tako što snižavamo API cijene za Sol i Lunu za 50 % u odnosu na njihove promotivne cijene za GPT‑5.6. Ta poboljšanja zajedno čine naprednu umjetnu inteligenciju praktičnom za više svakodnevnih zadataka i primjena velikog opsega.

Cijene za GPT‑6 API

Model

Ulaz

Izlaz

Sniženje cijene

GPT‑6 Sol
u odnosu na GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

50 % jeftinije

GPT‑6 Luna
u odnosu na GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

50 % jeftinije

Cijene su navedene za milijun tokena.

GPT‑6 Astra i dalje je naš najbolji svestrani model. Odaberite ga kada želite najbolje rezultate i iskustvo bez kompromisa.

Iskorak u cijeloj skupini modela

GPT‑6 Sol i Luna donose poboljšanu inteligenciju i troškovnu učinkovitost modelima koje već poznajete i upotrebljavate, osobito u mogućnostima najkorisnijima za obavljanje složenih poslova.

Profesionalni rad

GPT‑6 Sol može preuzeti zahtjevne poslovne zadatke, uz više prostora za iteracije zahvaljujući višim ograničenjima upotrebe i nižoj cijeni, te pruža više inteligencije i bolje rezultate od konkurentskih modela slične cijene.

Na testu AutomationBench, koji obuhvaća poslovne tijekove rada u različitim aplikacijama, GPT‑6 Sol uz razinu napora xhigh nadmašuje Claude Opus 5 uz maksimalan napor, i to uz samo 9 % troška modela Opus 5 po zadatku. Uz visoku razinu napora GPT‑6 Luna nadmašuje svojeg prethodnika za 5,4 postotna boda, uz 58 % niži trošak po zadatku.

U testu AutomationBench 1.0.6⁠(otvara se u novom prozoru) agenti umjetne inteligencije testiraju se na cjelovitim tijekovima rada s pomoću 47 alata iz prodaje, marketinga, operacija, podrške, financija i ljudskih resursa. Podatak za Claude Fable 5.1 podcjenjuje njegov stvarni trošak jer ne uključuje trošak prebacivanja na Opus 5, do kojeg je došlo u približno 40 % zadataka.

GPT‑6 Sol također nadmašuje Claude Fable 5.1 uz znatno nižu cijenu, pa čak i GPT‑6 Astra uz nisku razinu napora.

Model (i razina napora)

Rezultat

Trošak po zadatku

GPT‑6 Sol (xhigh)

33,2 %

0,27 USD

GPT‑6 Astra (niska)

30,3 %

3,9× GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1× GPT‑6 Sol

Claude Fable 5.1 uz pričuvni Opus 5 (Max)

31,4 %

>8,9× GPT‑6 Sol

(trošak pričuvnog modela nije naveden)

Na testu Agents’ Last Exam, koji agente ocjenjuje na složenim profesionalnim tijekovima rada, GPT‑6 Sol uz maksimalan napor postiže 56,4 %, više od najboljeg rezultata modela Claude Opus 5 u toj evaluaciji, uz 60 % niži trošak po zadatku.

U testu Agents’ Last Exam V1⁠(otvara se u novom prozoru) agenti umjetne inteligencije ocjenjuju se na dugotrajnim, gospodarski vrijednim zadacima iz 55 podindustrija, koji obuhvaćaju većinu glavnih područja profesionalnog rada na računalu.

Činjenična točnost

Korisnost odgovora ovisi o točnosti činjenica, a mi i dalje napredujemo u činjeničnoj pouzdanosti. U našoj internoj evaluaciji činjenične točnosti, utemeljenoj na deidentificiranim stvarnim razgovorima u kojima su korisnici označili pogreške naših modela, GPT‑6 Sol griješi otprilike upola rjeđe od svojeg prethodnika te se uz mnogo nižu cijenu približava pouzdanosti Astre. GPT‑6 Luna također se znatno poboljšao; na višim razinama napora izjednačen je s modelom GPT‑5.6 Sol uz približno stotinu puta nižu cijenu.

Ovdje procjenjujemo činjeničnu točnost na deidentificiranim razgovorima u ChatGPT‑u u kojima su korisnici označili činjeničnu pogrešku prethodnog modela. Ti razgovori koji potiču pogreške ne predstavljaju uobičajenu upotrebu, u kojoj su činjenične pogreške rjeđe. Rezultati nisu prilagođeni duljini, no naša ispitivanja opširnosti pokazala su da duljina odgovora gotovo uopće ne utječe na njih.

Programiranje

Ove su se godine agenti za programiranje počeli baviti zadacima veće složenosti, opsega i trajanja nego ikad prije. U OpenAI-ju naša interna upotreba eksponencijalno raste. Prema API cijenama, dnevna potrošnja tokena premašila je 600 USD za medijalnog istraživača i 7.000 USD za istraživače u 90. percentilu (Ubrzavanje istraživanja: pogled iz OpenAI-ja⁠). Kako agenti za programiranje preuzimaju dulje i zahtjevnije zadatke, trošak kontinuirane upotrebe postaje sve važniji. GPT‑6 Sol i Luna spajaju snažne rezultate u programiranju s nižim API cijenama, pružajući razvojnim programerima više prostora za iteracije, a timovima sigurnost da Codexu povjere ambicioznije zadatke.

Na testu FrontierCode, koji procjenjuje stvaraju li agenti za programiranje izmjene spremne za spajanje u stvarne baze koda, GPT‑6 Sol znatno nadmašuje GPT‑5.6 Sol i može se izjednačiti s modelom Claude Fable 5.1 xhigh uz mnogo nižu cijenu.

U testu FrontierCode 1.1 Main⁠(otvara se u novom prozoru) agenti umjetne inteligencije pišu kod koji se ne ocjenjuje samo prema ispravnosti nego i prema „spojivosti”, primjerice prema kvaliteti testova, pridržavanju opsega, stilu koda i standardima baze koda.

Na testu DeepSWE v1.1, koji ispituje rezultate na složenim zadacima softverskog inženjerstva u stvarnim bazama koda, GPT‑6 Sol uz maksimalan napor postiže 68,8 %, što je 1,1 postotni bod manje od najboljeg rezultata modela Claude Fable 5 u evaluaciji — 69,9 % uz napor xhigh — i to uz približno 80 % niži trošak po zadatku.

GPT‑6 Luna uz maksimalan napor postiže 66,6 %, što je usporedivo s modelima Claude Opus 5 i Fable 5 uz srednju razinu napora. U tim usporedbama Luna po zadatku košta 93 % manje od modela Opus 5 i 96 % manje od modela Fable 5.

U testu DeepSWE 1.1⁠(otvara se u novom prozoru) agenti umjetne inteligencije rješavaju originalne, dugotrajne zadatke softverskog inženjerstva.

Upotreba računala

Iako je GPT‑6 Astra i dalje najbolji model na svijetu za upotrebu računala, GPT‑6 Sol i Luna pružaju troškovno učinkovitije rezultate od svojih prethodnika. Na izvanmrežnom testu OSWorld 2.0 GPT‑6 Sol uz napor xhigh postiže rezultat sličan modelu Claude Opus 5 uz srednji napor — 60,5 % prema 60,3 % — i to uz približno 80 % niži trošak po zadatku. GPT‑6 Luna (Max) nadmašuje GPT‑5.6 Sol (srednja razina) uz desetinu njegova troška.

U testu OSWorld 2.0⁠(otvara se u novom prozoru) agenti umjetne inteligencije pokušavaju izvršiti dugotrajne tijekove rada na računalu koji obuhvaćaju svakodnevne i profesionalne zadatke. Navodimo djelomičnu nagradu za izvanmrežni skup iz izdanja v2026.08.08.

Stil suradnje

Poboljšani komunikacijski stil modela GPT‑6 Astra prenijeli smo i na Sol i Lunu, a očekujemo da će to biti osobito primjetno u tehničkim razgovorima i razgovorima o programiranju. Očekujte više jasnoće, manje žargona, manje neobičnih formulacija i suvišnih pojedinosti te općenito nešto kraće odgovore bez gubitka sadržaja.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Iako je stil subjektivan, ovdje nam je draži odgovor modela GPT‑6 Sol. Ne donosi zaključke tako brzo, manje vremena troši na ponavljanje pojedinosti koje bi osobi koja pita mogle biti očite (npr. da web-mjesto ima četiri stranice), manje se služi neodređenim izrazima (npr. „dojam benta”, „preoblikovanje… oko tog sustava”), otvorenije navodi što je provjerio, a što nije te bez potrebe ne iznosi implementacijske pojedinosti poput upita za svoj alat za slike.

Bolje predmemoriranje za agente i duge razgovore

Uz niže cijene tokena pomažemo razvojnim programerima koji rade na platformi GPT‑6 da dodatno uštede na kontekstu koji njihove aplikacije ponovno upotrebljavaju. Poboljšali smo predmemoriranje upita za GPT‑6 kako bismo prema zadanim postavkama povećali stopu pogodaka predmemorije, što agentima omogućuje ponovnu upotrebu više konteksta, brže odgovore i popust od 90 % na čitanje predmemoriranih ulaznih tokena.

Razvojni programeri sada imaju i više načina za mjerenje i optimizaciju učinkovitosti predmemoriranja:

GitHub navodi da su tijekom proteklih nekoliko mjeseci ta poboljšanja smanjila udio tokena upita koje treba iznova obraditi za više od 50 % u milijardama zahtjeva modelima OpenAI, što Copilotu pomaže brže odgovarati.

Nastavak poboljšavanja usklađenosti

GPT‑6 Sol i Luna nadograđuju rad na usklađenosti uveden s Astrom, našim dosad najusklađenijim modelom. U našim evaluacijama usklađenosti Sol i Luna pokazuju poboljšanja u odnosu na odgovarajuće modele GPT‑5.6, uključujući niže stope obmanjujućih tvrdnji o svojem radu na programiranju.

Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope pogrešaka u uobičajenoj upotrebi. Cjelovite rezultate potražite u dokumentu o sustavu⁠(otvara se u novom prozoru).

Dostupnost

GPT‑6 Sol i GPT‑6 Luna od danas su dostupni u načinima ChatGPT Work i Codex svim korisnicima planova Plus, Pro, Business, Enterprise i Edu. Korisnici planova Free i Go mogu pristupiti modelu GPT‑6 Luna u aplikaciji za stolna računala. Ti modeli još nisu dostupni u načinu Chat. U OpenAI API-ju dostupni su kao gpt-6-sol i gpt-6-luna.

Kako bi usluga ostala stabilna za sve, te modele planiramo postupno uvoditi u ChatGPT tijekom dana. Ako nove modele ne vidite u načinu ChatGPT Work ili u Codexu, pokušajte ponovno poslije.


Evaluacije modela GPT provedene su u našem istraživačkom okruženju ili putem našeg API-ja, koji zbog razlika u sistemskim upitima, dostupnim alatima i ostalome može davati nešto drukčije rezultate od produkcijskog ChatGPT‑a. Evaluacije konkurentskih modela preuzete su iz javno dostupnih izvješća. Rezultati za Claude Fable 5 navedeni su kada rezultati za Claude Fable 5.1 nisu bili dostupni.

Autor

OpenAI