GPT-6.1Sol
Inteligencija bliska modelu Astra uz petinu cijene za trajne performanse na graničnoj razini
Predstavljamo GPT‑6.1 Sol, nadogradnju modela GPT‑6 Sol s iznimno snažnim performansama u kodiranju uz pomoć AI agenta, upotrebi računala i profesionalnom radu. Na zahtjevnim zadacima približava Sol modelu GPT‑6 Astra, uz petinu standardne cijene ulaznih i izlaznih tokena modela Astra, pa razvojni programeri uz isti proračun imaju više prostora za izradu i pokretanje sposobnih agenata.
GPT‑6.1 Sol donosi performanse bliske modelu Astra po cijeni modela Sol, što ga čini trenutačno najisplativijim modelom s obzirom na performanse. Predmemorirani ulaz košta samo 0,10 USD po milijunu tokena, što je 95 % manje od standardne cijene ulaza. Time je pristupačniji za radna opterećenja agenata koja zahtijevaju ponovnu upotrebu konteksta u višestrukim zahtjevima.
GPT‑6 Astra i dalje je naš ukupno najsposobniji granični model. GPT‑6.1 Sol nudi novu ravnotežu sposobnosti i troškova za važne poslove koje korisnici žele obavljati češće te za korisnike API-ja koji razvijaju i pokreću aplikacije u velikom opsegu.

GPT‑6.1 Sol donosi znatna poboljšanja u odnosu na GPT‑6 Sol u složenom profesionalnom radu, od pisanja koda i otklanjanja pogrešaka do razumijevanja dokumenata i izvođenja poslovnih procesa u više koraka. U nekoliko tih evaluacija približava se performansama modela GPT‑6 Astra uz znatno niži trošak.
Na testu DeepSWE v1.1, koji procjenjuje složene zadatke softverskog inženjerstva u stvarnim bazama koda, GPT‑6.1 Sol izjednačuje se s modelom GPT‑6 Astra uz otprilike petinu troška, a istodobno nadmašuje najbolji rezultat modela GPT‑6 Sol za 6,4 postotna boda uz manji napor pri rasuđivanju i niži trošak.
U testu DeepSWE 1.1(otvara se u novom prozoru) AI agenti rješavaju izvorne zadatke iz softverskog inženjerstva koji zahtijevaju dugotrajan rad.
Na testu GDP.pdf, koji mjeri koliko točno modeli odgovaraju na stručna pitanja koristeći složene PDF dokumente s tablicama, grafikonima, dijagramima i sitno tiskanim pojedinostima, GPT‑6.1 Sol postiže bolji rezultat od modela Opus 5.5 s pričuvnim modelima uz manje od polovice troška po zadatku na svim testiranim postavkama rasuđivanja. Također se približava vodećim performansama modela GPT‑6 Astra uz otprilike petinu troška po zadatku.
U testu GDP.pdf(otvara se u novom prozoru) modeli moraju odgovarati na upite iz stvarne prakse o složenim PDF dokumentima koji se upotrebljavaju u financijama, zdravstvu, pravu i još sedam stručnih područja.
Na testu AutomationBench, koji mjeri izvršavaju li agenti ispravno poslovne procese u više koraka, GPT‑6.1 Sol postiže rezultat 2,2 postotna boda bolji od modela Opus 5.5 uz srednju razinu napora pri rasuđivanju i otprilike trećinu troška. Taj je rezultat ujedno 4,8 postotnih bodova bolji od rezultata modela GPT‑6 Sol na istoj postavci.
In AutomationBench 1.0.6(otvara se u novom prozoru), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol također znatno napreduje u zadacima koji zahtijevaju interakciju s računalnim aplikacijama. Na izvanmrežnom skupu testa OSWorld 2.0, koji procjenjuje agente u zahtjevnim radnim procesima koji uključuju upotrebu računala, GPT‑6.1 Sol nadmašuje GPT‑6 Sol za sedam postotnih bodova uz maksimalni napor pri rasuđivanju i manje od polovice troška. Uz maksimalni napor pri rasuđivanju zaostaje samo 2,1 postotni bod za rezultatom modela Astra, uz otprilike sedminu troška po zadatku.
In OSWorld 2.0(otvara se u novom prozoru), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Na testu Terminal-Bench Science 0.1, koji procjenjuje znanstvene radne procese, uključujući analizu podataka, simulacije i dokazivanje teorema, GPT‑6.1 Sol postiže više nego dvostruko bolji rezultat od modela GPT‑6 Sol uz maksimalni napor pri rasuđivanju i manje od polovice troška po zadatku. Uz maksimalni napor GPT‑6.1 Sol u prosjeku košta 5,47 USD po zadatku, u usporedbi s 23,21 USD za Opus 5.5 i 23,80 USD za model Astra. Time pruža snažne sposobnosti za znanstveni rad uz više od 75 % niži trošak od oba modela.
GPT‑6 Astra i dalje postiže najbolji rezultat među testiranim modelima, 68,1 %, te ga treba upotrebljavati za najteže znanstvenoistraživačke zadatke.
U testu Terminal-Bench Science 0.1(otvara se u novom prozoru) agenti provode znanstvenoistraživačke postupke koristeći se kodom i terminalskim alatima, što uključuje analizu podataka, pokretanje simulacija i prilagodbu modela.
GPT‑6.1 Sol također poboljšava činjeničnu točnost na zahtjevnim upitima. Uz vrlo visok napor pri rasuđivanju njegova stopa činjeničnih pogrešaka iznosi 4,1 %, što je manje od 4,5 % za GPT‑6 Sol i bliže stopi od 4,0 % modela Astra na istoj postavci, dok je trošak po zadatku približno 83 % niži nego za model Astra.
Ova evaluacija mjeri udio odgovora koji sadrže barem jednu činjeničnu pogrešku u razgovorima iz kojih su uklonjeni identifikacijski podaci, a u kojima su korisnici označili pogrešku prethodnog modela. Ti namjerno zahtjevni upiti nisu reprezentativni za uobičajenu upotrebu.
Činjeničnu točnost procjenjujemo na razgovorima iz proizvoda ChatGPT iz kojih su uklonjeni identifikacijski podaci, a u kojima su korisnici označili činjeničnu pogrešku prethodnog modela. Ti razgovori koji potiču pogreške nisu reprezentativni za uobičajenu upotrebu, u kojoj su činjenične pogreške rjeđe.
GPT‑6.1 Sol pokazuje znatna poboljšanja u odnosu na GPT‑6 Sol u našim evaluacijama usklađenosti, čime se približava modelu GPT‑6 Astra.
GPT‑6.1 Sol otvorenije navodi svoja ograničenja i pouzdanije poštuje korisnikovu namjeru i sigurnosna ograničenja. U zahtjevnim evaluacijama pokazuje niže stope propusta od modela GPT‑6 Sol u obavještavanju o neispravnim alatima za pretraživanje, poštovanju izričitih ograničenja i izbjegavanju neovlaštenih ishoda tijekom agentskih zadataka. Nismo uočili pokušaje zaobilaženja automatiziranog sustava za sigurnosnu provjeru, kao ni kod modela GPT‑6 Astra i GPT‑6 Sol.
Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope propusta u uobičajenoj upotrebi.
GPT‑6.1 Sol od danas je dostupan svim korisnicima paketa Plus, Pro, Business, Enterprise i Edu u načinu rada ChatGPT Work i alatu Codex. Ti modeli još nisu dostupni u načinu rada Chat. Razvojni programeri mogu mu pristupiti i putem API-ja OpenAI pod nazivom gpt-6.1-sol. Standardne cijene za upotrebu putem API-ja iznose 2 USD po milijunu ulaznih tokena, 0,10 USD po milijunu predmemoriranih ulaznih tokena i 10 USD po milijunu izlaznih tokena.
Istodobno predstavljamo GPT‑6 Astra Ultrafast, najbrži granični model na svijetu, do 8 puta brži od modela GPT‑6 Astra, kao i GPT‑6.1 Sol Ultrafast. Dostupni su putem API-ja te u načinu rada ChatGPT Work i alatu Codex korisnicima naše nove razine paketa Pro s najvišim ograničenjima upotrebe, po cijeni od 500 USD mjesečno. Uz GPT‑6.1 Sol Ultrafast razvojni programeri mogu dobiti inteligenciju blisku modelu Astra uz do 8 puta veću brzinu, za otprilike isti trošak API-ja kao dosad za GPT‑6 Astra.
Autor
Evaluacije modela GPT provedene su u našem istraživačkom okruženju ili putem našeg API-ja, što može dati nešto drukčije rezultate nego produkcijska verzija proizvoda ChatGPT zbog razlika u sistemskim uputama, dostupnim alatima, razinama napora itd. Evaluacije konkurentskih modela preuzete su iz javno dostupnih izvješća.

