Preskočite na glavni sadržaj
OpenAI

GPT-6.1Sol

Inteligencija bliska Astri za petinu cijene, uz trajne performanse graničnih modela

Predstavljamo GPT‑6.1 Sol, nadogradnju modela GPT‑6 Sol s izuzetno snažnim performansama u kodiranju s agentima, korištenju računara i stručnom radu. Na zahtjevnim zadacima približava Sol modelu GPT‑6 Astra, uz petinu Astrinih standardnih cijena ulaznih i izlaznih tokena, čime programerima daje više prostora za razvoj i pokretanje sposobnih agenata u okviru istog budžeta.

GPT‑6.1 Sol donosi performanse bliske Astri po cijenama modela Sol, što ga čini trenutno najisplativijim modelom za taj nivo performansi. Keširani ulaz košta samo 0,10 USD po milionu tokena — 95% manje od standardne cijene ulaza — što ga čini pristupačnijim za agentske zadatke koji zahtijevaju ponovnu upotrebu konteksta u uzastopnim zahtjevima.

GPT‑6 Astra ostaje naš ukupno najsposobniji granični model. GPT‑6.1 Sol nudi novi odnos sposobnosti i troškova za važne poslove koje korisnici žele obavljati češće, kao i za korisnike API-ja koji razvijaju i pokreću aplikacije velikog obima.

Tri kartice modela: GPT-6 Astra, naš najinteligentniji model za najbolje rezultate, 10 USD za ulaz, 50 USD za izlaz i 1 USD za keširani ulaz; GPT-6.1 Sol, inteligencija bliska Astri za petinu cijene, 2 USD za ulaz, 10 USD za izlaz i 0,10 USD za keširani ulaz; GPT-6 Luna, brz i efikasan svakodnevni rad velikog obima, 0,10 USD za ulaz, 0,50 USD za izlaz i 0,01 USD za keširani ulaz.

Sposobniji Sol za različite zadatke

GPT‑6.1 Sol donosi značajna poboljšanja u odnosu na GPT‑6 Sol u složenom stručnom radu, od pisanja koda i otklanjanja grešaka do razumijevanja dokumenata i izvršavanja poslovnih procesa s više koraka. U nekoliko ovih evaluacija približava se performansama modela GPT‑6 Astra uz znatno niže troškove.

Kodiranje

Na testu DeepSWE v1.1, koji procjenjuje složene zadatke softverskog inženjerstva u stvarnim bazama koda, GPT‑6.1 Sol postiže isti rezultat kao GPT‑6 Astra uz približno petinu troška, a najbolji rezultat modela GPT‑6 Sol nadmašuje za 6,4 procentna poena uz manji napor pri rezonovanju i niži trošak.

Na testu DeepSWE 1.1⁠⁠(otvara se u novom prozoru) AI agenti rješavaju originalne zadatke iz softverskog inženjerstva koji zahtijevaju dugotrajan rad.

Stručni rad

Na testu GDP.pdf, koji mjeri koliko tačno modeli odgovaraju na stručna pitanja koristeći složene PDF dokumente, uključujući tabele, grafikone, dijagrame i detalje pisane sitnim slovima, GPT‑6.1 Sol postiže bolji rezultat od modela Opus 5.5 s rezervnim modelima, uz manje od polovine troška po zadatku pri testiranim postavkama rezonovanja. Također se približava vodećim performansama modela GPT‑6 Astra uz približno petinu troška po zadatku.

Na testu GDP.pdf⁠(otvara se u novom prozoru) modeli moraju odgovarati na upite iz prakse o složenim PDF dokumentima koji se koriste u finansijama, zdravstvu, pravu i sedam drugih stručnih oblasti.

Na testu AutomationBench, koji mjeri izvršavaju li agenti ispravno poslovne procese s više koraka, GPT‑6.1 Sol uz srednji napor pri rezonovanju postiže rezultat za 2,2 procentna poena bolji od modela Opus 5.5, uz približno trećinu troška. Taj rezultat je i za 4,8 procentnih poena bolji od rezultata modela GPT‑6 Sol pri istoj postavci.

In AutomationBench 1.0.6⁠⁠(otvara se u novom prozoru), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Korištenje računara

GPT‑6.1 Sol također ostvaruje značajan napredak u zadacima koji zahtijevaju interakciju s računarskim aplikacijama. Na vanmrežnom skupu testa OSWorld 2.0, koji procjenjuje agente u zahtjevnim radnim procesima na računaru, GPT‑6.1 Sol nadmašuje GPT‑6 Sol za sedam procentnih poena uz maksimalan napor pri rezonovanju i manje od polovine troška. Uz maksimalan napor pri rezonovanju zaostaje za Astrinim rezultatom za samo 2,1 procentni poen, uz približno sedminu troška po zadatku.

In OSWorld 2.0⁠⁠(otvara se u novom prozoru), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Naučno istraživanje

Na testu Terminal-Bench Science 0.1, koji procjenjuje naučne radne procese, uključujući analizu podataka, simulaciju i dokazivanje teorema, GPT‑6.1 Sol postiže više nego dvostruko bolji rezultat od modela GPT‑6 Sol uz maksimalan napor pri rezonovanju i manje od polovine troška po zadatku. Uz maksimalan napor pri rezonovanju, GPT‑6.1 Sol u prosjeku košta 5,47 USD po zadatku, u poređenju sa 23,21 USD za Opus 5.5 i 23,80 USD za Astru, pružajući snažne naučne sposobnosti uz preko 75% niži trošak od oba modela.

GPT‑6 Astra i dalje postiže najbolji rezultat među testiranim modelima, 68,1%, te ga treba koristiti za najteže naučnoistraživačke zadatke.

Na testu Terminal-Bench Science 0.1⁠(otvara se u novom prozoru) agenti provode naučnoistraživačke postupke koristeći kod i terminalske alate, što uključuje analizu podataka, izvođenje simulacija i prilagođavanje modela podacima.

Činjenična tačnost

GPT‑6.1 Sol također poboljšava činjeničnu tačnost odgovora na zahtjevne upite. Uz vrlo visok napor pri rezonovanju, njegova stopa činjeničnih grešaka iznosi 4,1%, što je smanjenje u odnosu na 4,5% za GPT‑6 Sol i bliže Astrinih 4,0% pri istoj postavci, uz približno 83% niži trošak po zadatku od Astre.

Ova evaluacija mjeri udio odgovora koji sadrže barem jednu činjeničnu grešku u razgovorima iz kojih su uklonjeni identifikacijski podaci, a u kojima su korisnici označili grešku ranijeg modela. Ovi namjerno zahtjevni upiti nisu reprezentativni za uobičajenu upotrebu.

Činjeničnu tačnost procjenjujemo na razgovorima iz proizvoda ChatGPT iz kojih su uklonjeni identifikacijski podaci, a u kojima su korisnici označili činjeničnu grešku prethodnog modela. Ovi razgovori koji izazivaju greške nisu reprezentativni za uobičajenu upotrebu, u kojoj su činjenične greške rjeđe.

Sigurno uvođenje modela GPT‑6.1 Sol

GPT‑6.1 Sol pokazuje značajna poboljšanja u odnosu na GPT‑6 Sol u našim evaluacijama usklađenosti, čime se približava modelu GPT‑6 Astra.

GPT‑6.1 Sol otvorenije govori o svojim ograničenjima i pouzdanije poštuje namjeru korisnika i sigurnosna ograničenja. U zahtjevnim evaluacijama ima niže stope propusta od modela GPT‑6 Sol kada je riječ o obavještavanju o neispravnim alatima za pretragu, poštovanju izričitih ograničenja i izbjegavanju neovlaštenih ishoda tokom agentskih zadataka. Nismo uočili pokušaje zaobilaženja automatizovanog sistema za sigurnosnu provjeru, kao ni kod modela GPT‑6 Astra i GPT‑6 Sol.

Evaluacije u nastavku namjerno ispituju zahtjevne situacije i ne mjere stope propusta u uobičajenoj upotrebi.

Cijene i dostupnost

GPT‑6.1 Sol je od danas dostupan svim korisnicima planova Plus, Pro, Business, Enterprise i Edu u načinu rada ChatGPT Work i alatu Codex. Ovi modeli još nisu dostupni u načinu rada Chat. Programeri mu mogu pristupiti i putem OpenAI API-ja pod nazivom gpt-6.1-sol. Njegove standardne API cijene iznose 2 USD po milionu ulaznih tokena, 0,10 USD po milionu keširanih ulaznih tokena i 10 USD po milionu izlaznih tokena.

Istovremeno predstavljamo GPT‑6 Astra Ultrafast, najbrži granični model na svijetu, do 8 puta brži od modela GPT‑6 Astra, kao i GPT‑6.1 Sol Ultrafast. Dostupni su putem API-ja, kao i u načinu rada ChatGPT Work i alatu Codex korisnicima našeg novog Pro paketa s najvišim ograničenjima korištenja, po cijeni od 500 USD mjesečno. Uz GPT‑6.1 Sol Ultrafast, programeri mogu dobiti inteligenciju blisku Astri uz do 8 puta veću brzinu, za približno isti API trošak kao ranije za GPT‑6 Astra.

Autor

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.