Preskočite na glavni sadržaj
OpenAI

Predstavljamo GPT‑6 Sol i Lunu

Više načina da graničnu inteligenciju uključite u svakodnevni rad.

Učitavanje…

Ranije ovog mjeseca predstavili smo GPT‑6 Astra, najinteligentniji i najusklađeniji model na svijetu. Iako najzahtjevniji i najvažniji projekti i dalje iziskuju puni potencijal Astre, posao se obavlja u različitim obimima, ritmovima i budžetima.

Zato proširujemo GPT‑6 porodicu modelima GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra uvela je novu generaciju inteligencije, a ovi modeli pomažu u širenju njenih prednosti pomjeranjem granica troškovne efikasnosti. GPT‑6 Sol i Luna obučili smo metodama sličnim onima za GPT‑6 Astra, čime napredak zaslužan za Astrine vrhunske rezultate u profesionalnom radu, činjeničnoj tačnosti, programiranju, korištenju računara i usklađenosti donosimo bržim i pristupačnijim modelima.

GPT‑6 modeli predvode duž cijele krivulje odnosa troškova i inteligencije, spajajući izuzetne mogućnosti na svakom nivou s infrastrukturom koja ih efikasno pruža u velikom obimu. Poboljšanja keširanja i zaključivanja omogućavaju nam da ove modele nudimo po nižoj cijeni, a te uštede direktno prenosimo korisnicima i klijentima tako što snižavamo cijene API-ja za Sol i Lunu za 50% u odnosu na njihove promotivne cijene za GPT‑5.6. Zajedno, ova poboljšanja čine naprednu umjetnu inteligenciju praktičnom za više svakodnevnih zadataka i primjena u velikom obimu.

Cijene GPT‑6 API-ja

Model

Ulaz

Izlaz

Sniženje cijene

GPT‑6 Sol
u odnosu na GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

50% jeftinije

GPT‑6 Luna
u odnosu na GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

50% jeftinije

Cijene su navedene za milion tokena.

GPT‑6 Astra i dalje je naš najbolji model u svim područjima. Odaberite ga kada želite najbolje rezultate i iskustvo bez kompromisa.

Napredak u cijeloj porodici modela

GPT‑6 Sol i Luna donose poboljšanu inteligenciju i troškovnu efikasnost poznatim modelima koje već koristite, posebno u sposobnostima najkorisnijim za obavljanje složenih poslova.

Profesionalni rad

GPT‑6 Sol može preuzeti zahtjevne radne zadatke, a vi dobijate više prostora za iteracije zahvaljujući višim ograničenjima korištenja i nižim troškovima, uz veću inteligenciju i bolje rezultate od konkurentskih modela slične cijene.

Na testu AutomationBench, koji obuhvata poslovne tokove rada u različitim aplikacijama, GPT‑6 Sol uz xhigh nivo napora nadmašuje Claude Opus 5 uz Max nivo napora, i to uz samo 9% troška koji Opus 5 ima po zadatku. Uz Visok nivo napora, GPT‑6 Luna nadmašuje svog prethodnika za 5,4 procentna boda, uz 58% niži trošak po zadatku.

U testu AutomationBench 1.0.6⁠(otvara se u novom prozoru) agenti umjetne inteligencije testiraju se na cjelovitim tokovima rada uz korištenje 47 alata iz prodaje, marketinga, operacija, podrške, finansija i ljudskih resursa. Podatak za Claude Fable 5.1 prikazuje manji trošak od stvarnog jer ne uključuje trošak rezervnog modela Opus 5, koji je korišten u približno 40% zadataka.

GPT‑6 Sol također nadmašuje Claude Fable 5.1 uz znatno niže troškove, pa čak i GPT‑6 Astra s niskim nivoom napora.

Model (i nivo napora)

Rezultat

Trošak po zadatku

GPT‑6 Sol (xhigh)

33,2%

0,27 USD

GPT‑6 Astra (nizak)

30,3%

3,9x GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

11,1x GPT‑6 Sol

Claude Fable 5.1 uz rezervni Opus 5 (Max)

31,4%

>8,9x GPT‑6 Sol

(trošak rezervnog modela nije naveden)

Na testu Agents’ Last Exam, koji procjenjuje agente u složenim profesionalnim tokovima rada, GPT‑6 Sol uz Max nivo napora postiže 56,4%, više od najboljeg rezultata modela Claude Opus 5 u ovoj evaluaciji, uz 60% niži trošak po zadatku.

U testu Agents’ Last Exam V1⁠(otvara se u novom prozoru) agenti umjetne inteligencije procjenjuju se na dugotrajnim, ekonomski vrijednim zadacima iz 55 podindustrija, koji obuhvataju većinu glavnih područja profesionalnog rada na računaru.

Činjenična tačnost

Korisnost odgovora zavisi od tačnosti činjenica, a mi nastavljamo unapređivati činjeničnu pouzdanost. U našoj internoj evaluaciji činjenične tačnosti, zasnovanoj na anonimiziranim stvarnim razgovorima u kojima su korisnici označili greške naših modela, GPT‑6 Sol pravi približno upola manje grešaka od prethodnika i približava se pouzdanosti Astre uz znatno niže troškove. GPT‑6 Luna također ostvaruje znatan napredak; pri višim nivoima napora dostiže GPT‑5.6 Sol uz približno stoti dio njegovog troška.

Ovdje procjenjujemo činjeničnu tačnost na anonimiziranim razgovorima u ChatGPT‑u u kojima su korisnici označili činjeničnu grešku ranijeg modela. Ovi razgovori koji izazivaju greške ne predstavljaju uobičajenu upotrebu, u kojoj su činjenične greške rjeđe. Rezultati nisu kontrolirani prema dužini; međutim, naša ispitivanja različitih nivoa opširnosti pokazala su da dužina odgovora gotovo uopće ne utiče na njih.

Programiranje

Ove godine agenti za programiranje počeli su rješavati zadatke veće složenosti, obima i trajanja nego ikada prije. U kompaniji OpenAI naša interna upotreba eksponencijalno je porasla. Kada se vrednuje prema cijenama API-ja, dnevna potrošnja tokena premašila je 600 USD za istraživača na medijanu i 7.000 USD za istraživače u 90. percentilu (Ubrzavanje istraživanja: pogled iz kompanije OpenAI⁠). Kako agenti za programiranje preuzimaju duže i zahtjevnije zadatke, trošak kontinuirane upotrebe postaje sve važniji. GPT‑6 Sol i Luna spajaju odlične rezultate u programiranju s nižim cijenama API-ja, pružajući programerima više prostora za iteracije, a timovima sigurnost da Codexu povjere ambicioznije zadatke.

Na testu FrontierCode, koji procjenjuje da li agenti za programiranje stvaraju izmjene spremne za spajanje sa stvarnim bazama koda, GPT‑6 Sol znatno nadmašuje GPT‑5.6 Sol i može dostići Claude Fable 5.1 uz xhigh nivo napora, ali po mnogo nižoj cijeni.

U testu FrontierCode 1.1 Main⁠(otvara se u novom prozoru) agenti umjetne inteligencije pišu kod koji se ne ocjenjuje samo prema ispravnosti nego i prema „spremnosti za spajanje“, naprimjer prema kvalitetu testova, dosljednosti obima, stilu koda i poštivanju standarda baze koda.

Na testu DeepSWE v1.1, koji provjerava rezultate na složenim zadacima softverskog inženjerstva u stvarnim bazama koda, GPT‑6 Sol uz Max nivo napora postiže 68,8%, što je 1,1 procentni bod manje od najboljeg rezultata modela Claude Fable 5 u evaluaciji — 69,9% uz xhigh nivo napora — i to uz približno 80% niži trošak po zadatku.

GPT‑6 Luna uz Max nivo napora postiže 66,6%, što je uporedivo s modelima Claude Opus 5 i Fable 5 uz Srednji nivo napora. U ovim poređenjima Luna košta 93% manje po zadatku od modela Opus 5 i 96% manje od modela Fable 5.

U testu DeepSWE 1.1⁠(otvara se u novom prozoru) agenti umjetne inteligencije rješavaju originalne, dugotrajne zadatke softverskog inženjerstva.

Korištenje računara

Iako je GPT‑6 Astra i dalje najbolji model na svijetu za korištenje računara, GPT‑6 Sol i Luna pružaju troškovno efikasnije rezultate od svojih prethodnika. Na testu OSWorld 2.0 offline, GPT‑6 Sol uz xhigh nivo napora postiže rezultat sličan modelu Claude Opus 5 uz Srednji nivo napora — 60,5% naspram 60,3% — uz približno 80% niži trošak po zadatku. GPT‑6 Luna (Max) nadmašuje GPT‑5.6 Sol (Srednja) uz desetinu njegovog troška.

U testu OSWorld 2.0⁠(otvara se u novom prozoru) agenti umjetne inteligencije pokušavaju izvršiti dugotrajne tokove rada na računaru koji obuhvataju svakodnevne i profesionalne zadatke. Navodimo djelimičnu nagradu na vanmrežnom skupu iz izdanja v2026.08.08.

Stil saradnje

Poboljšani stil komunikacije modela GPT‑6 Astra prenijeli smo i na Sol i Lunu, a vjerujemo da će to biti posebno primjetno u tehničkim razgovorima i razgovorima o programiranju. Očekujte više jasnoće, manje žargona, manje neobičnih formulacija i suvišnih detalja te općenito nešto kraće odgovore bez gubitka sadržaja.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Iako je stil subjektivan, ovdje nam je draži odgovor modela GPT‑6 Sol. Ne donosi zaključke tako brzo, troši manje vremena ponavljajući detalje koji bi osobi koja pita mogli biti očigledni (npr. da web-stranica ima četiri stranice), koristi manje neodređenih izraza (npr. „bento dojam“, „preoblikovanje… oko tog sistema“), otvorenije navodi šta jeste, a šta nije provjerio te nepotrebno ne iznosi detalje implementacije poput upita za alat za slike.

Poboljšano keširanje za agente i duge razgovore

Uz niže cijene tokena, pomažemo programerima koji razvijaju rješenja na GPT‑6 da dodatno uštede na kontekstu koji njihove aplikacije ponovo koriste. Poboljšali smo keširanje promptova za GPT‑6 kako bismo standardno omogućili višu stopu pogodaka u kešu, čime agenti mogu ponovo koristiti više konteksta, brže odgovarati i ostvariti popust od 90% na čitanje keširanih ulaznih tokena.

Programeri sada imaju i više načina za mjerenje i optimizaciju učinka keširanja:

GitHub navodi da su ova poboljšanja tokom posljednjih nekoliko mjeseci smanjila udio tokena upita koji zahtijevaju novu obradu za više od 50% kroz milijarde zahtjeva modelima OpenAI, pomažući Copilotu da brže odgovara.

Nastavak poboljšavanja usklađenosti

GPT‑6 Sol i Luna nadograđuju rad na usklađivanju uveden s Astrom, našim dosad najusklađenijim modelom. U našim evaluacijama usklađenosti i Sol i Luna pokazuju poboljšanja u odnosu na odgovarajuće GPT‑5.6 modele, uključujući niže stope obmanjujućih tvrdnji o svom radu na programiranju.

Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope neuspjeha pri uobičajenoj upotrebi. Potpune rezultate pogledajte u kartici sistema⁠(otvara se u novom prozoru).

Dostupnost

GPT‑6 Sol i GPT‑6 Luna od danas su dostupni u načinima ChatGPT Work i Codex svim korisnicima paketa Plus, Pro, Business, Enterprise i Edu. Korisnici paketa Free i Go mogu pristupiti modelu GPT‑6 Luna u aplikaciji za računare. Ovi modeli još nisu dostupni u načinu Chat. U OpenAI API-ju dostupni su kao gpt-6-sol i gpt-6-luna.

Kako bismo održali stabilnost usluge za sve, ove modele planiramo postepeno uvoditi u ChatGPT tokom dana. Ako nove modele ne vidite u načinu ChatGPT Work ili u Codexu, pokušajte ponovo kasnije.


Evaluacije GPT‑a provedene su u našem istraživačkom okruženju ili putem našeg API-ja, koji zbog razlika u sistemskim upitima, dostupnim alatima i drugim faktorima može davati neznatno drugačije rezultate od produkcijskog ChatGPT‑a. Evaluacije konkurentskih modela preuzete su iz javno dostupnih izvještaja. Rezultati za Claude Fable 5 navedeni su kada rezultati za Claude Fable 5.1 nisu bili dostupni.

Autor

OpenAI