Preskočite na glavno vsebino
OpenAI

GPT-6.1Sol

Inteligentnost blizu Astre po petini cene za trajno prelomno zmogljivost

Predstavljamo GPT‑6.1 Sol, nadgradnjo modela GPT‑6 Sol z izjemno zmogljivostjo pri agentskem kodiranju, uporabi računalnika in strokovnem delu. Pri zahtevnih nalogah Sol približuje modelu GPT‑6 Astra, in sicer po petini standardne cene vhodnih in izhodnih žetonov Astre. Razvijalcem tako omogoča, da z istim proračunom ustvarijo in poganjajo več zmogljivih agentov.

GPT‑6.1 Sol ponuja zmogljivost blizu Astre po cenah modela Sol, s čimer je trenutno model z najboljšim razmerjem med zmogljivostjo in ceno. Predpomnjeni vhod stane le 0,10 $ na milijon žetonov – 95 % manj od standardne cene vhoda. Zato je cenovno ugodnejši za agentske delovne obremenitve, ki zahtevajo ponovno uporabo konteksta pri ponavljajočih se zahtevah.

GPT‑6 Astra ostaja naš na splošno najzmogljivejši prelomni model. GPT‑6.1 Sol ponuja novo razmerje med zmogljivostjo in stroški za pomembno delo, ki ga uporabniki želijo opravljati pogosteje, ter za stranke API-ja, ki razvijajo in poganjajo aplikacije v velikem obsegu.

Tri kartice modelov: GPT-6 Astra, naš najinteligentnejši model za najboljše rezultate, 10 $ za vhod, 50 $ za izhod in 1 $ za predpomnjeni vhod; GPT-6.1 Sol, inteligentnost blizu Astre po petini cene, 2 $ za vhod, 10 $ za izhod in 0,10 $ za predpomnjeni vhod; GPT-6 Luna, hitro in učinkovito vsakodnevno delo v velikem obsegu, 0,10 $ za vhod, 0,50 $ za izhod in 0,01 $ za predpomnjeni vhod.

Zmogljivejši Sol za različne naloge

GPT‑6.1 Sol prinaša občutne izboljšave v primerjavi z modelom GPT‑6 Sol pri zahtevnem strokovnem delu, od pisanja in razhroščevanja kode do razumevanja dokumentov in izvajanja večstopenjskih poslovnih delovnih tokov. Pri več teh ocenjevanjih se približa zmogljivosti modela GPT‑6 Astra ob bistveno nižjih stroških.

Kodiranje

Na preizkusu DeepSWE v1.1, ki ocenjuje zahtevne naloge programskega inženirstva v resničnih zbirkah kode, se GPT‑6.1 Sol izenači z modelom GPT‑6 Astra ob približno petini stroškov. Obenem najboljši rezultat modela GPT‑6 Sol preseže za 6,4 odstotne točke, in to ob nižji ravni napora pri sklepanju in nižjih stroških.

Pri preizkusu DeepSWE 1.1⁠⁠(odpre se v novem oknu) agenti umetne inteligence rešujejo izvirne naloge s področja programskega inženirstva, ki zahtevajo dolg niz korakov.

Strokovno delo

Na preizkusu GDP.pdf, ki meri, kako natančno modeli odgovarjajo na strokovna vprašanja na podlagi zahtevnih dokumentov PDF, vključno s tabelami, grafikoni, diagrami in podrobnostmi v drobnem tisku, GPT‑6.1 Sol dosega boljši rezultat od modela Opus 5.5 z rezervnimi modeli ob manj kot polovici stroškov na nalogo pri preizkušenih nastavitvah sklepanja. Približa se tudi vrhunski zmogljivosti modela GPT‑6 Astra ob približno petini stroškov na nalogo.

Pri preizkusu GDP.pdf⁠(odpre se v novem oknu) morajo modeli odgovarjati na pozive iz prakse, povezane z zahtevnimi dokumenti PDF, ki se uporabljajo pri delu v financah, zdravstvu, pravu in na sedmih drugih strokovnih področjih.

Na preizkusu AutomationBench, ki meri, ali agenti pravilno opravijo večstopenjske poslovne delovne tokove, GPT‑6.1 Sol pri srednji ravni napora pri sklepanju dosega za 2,2 odstotne točke boljši rezultat od modela Opus 5.5 ob približno tretjini stroškov. Ta rezultat je tudi za 4,8 odstotne točke višji od rezultata modela GPT‑6 Sol pri isti nastavitvi.

In AutomationBench 1.0.6⁠⁠(odpre se v novem oknu), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Uporaba računalnika

GPT‑6.1 Sol občutno napreduje tudi pri nalogah, ki zahtevajo interakcijo z računalniškimi aplikacijami. Na naboru brez povezave preizkusa OSWorld 2.0, ki agente ocenjuje pri zahtevnih delovnih tokovih z uporabo računalnika, GPT‑6.1 Sol pri najvišji ravni napora pri sklepanju preseže GPT‑6 Sol za sedem odstotnih točk ob manj kot polovici stroškov. Pri najvišji ravni napora pri sklepanju za rezultatom Astre zaostane le za 2,1 odstotne točke ob približno sedmini stroškov na nalogo.

In OSWorld 2.0⁠⁠(odpre se v novem oknu), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Znanstveno raziskovanje

Na preizkusu Terminal-Bench Science 0.1, ki ocenjuje znanstvene delovne tokove, vključno z analizo podatkov, simulacijami in dokazovanjem izrekov, GPT‑6.1 Sol pri najvišji ravni napora pri sklepanju doseže več kot dvakratnik rezultata modela GPT‑6 Sol ob manj kot polovici stroškov na nalogo. Pri najvišji ravni napora GPT‑6.1 Sol v povprečju stane 5,47 $ na nalogo, v primerjavi s 23,21 $ za Opus 5.5 in 23,80 $ za Astro. Tako zagotavlja visoko zmogljivost pri znanstvenih nalogah ob več kot 75 % nižjih stroških od obeh modelov.

GPT‑6 Astra z 68,1 % še vedno dosega najvišji rezultat med preizkušenimi modeli in je priporočena izbira za najzahtevnejše znanstvenoraziskovalne naloge.

Pri preizkusu Terminal-Bench Science 0.1⁠(odpre se v novem oknu) agenti s kodo in terminalskimi orodji izvajajo znanstvenoraziskovalne postopke, vključno z analizo podatkov, izvajanjem simulacij in prilagajanjem modelov.

Stvarna pravilnost

GPT‑6.1 Sol izboljšuje tudi stvarno pravilnost pri zahtevnih pozivih. Pri zelo visoki ravni napora pri sklepanju je njegov delež stvarnih napak 4,1 %, kar je manj od 4,5 % pri modelu GPT‑6 Sol in bližje 4,0 % pri Astri z isto nastavitvijo, pri čemer so stroški na nalogo približno 83 % nižji kot pri Astri.

To ocenjevanje meri delež odgovorov z vsaj eno stvarno napako v pogovorih z odstranjenimi identifikacijskimi podatki, v katerih so uporabniki označili napako prejšnjega modela. Ti namerno zahtevni pozivi niso reprezentativni za običajno uporabo.

Stvarno pravilnost ocenjujemo na pogovorih v ChatGPT z odstranjenimi identifikacijskimi podatki, v katerih so uporabniki označili stvarno napako prejšnjega modela. Ti pogovori, ki povzročajo napake, niso reprezentativni za običajno uporabo, pri kateri so stvarne napake redkejše.

Varna uvedba modela GPT‑6.1 Sol

GPT‑6.1 Sol pri naših ocenjevanjih usklajenosti kaže občutne izboljšave glede na GPT‑6 Sol in se tako približuje modelu GPT‑6 Astra.

GPT‑6.1 Sol bolj odkrito razkriva svoje omejitve ter zanesljiveje upošteva uporabnikov namen in varnostne omejitve. Pri zahtevnih ocenjevanjih ima nižje deleže napak kot GPT‑6 Sol pri razkrivanju težav z nedelujočimi iskalnimi orodji, upoštevanju izrecnih omejitev in preprečevanju nepooblaščenih izidov med agentskimi nalogami. Nismo opazili nobenega poskusa izogibanja samodejnemu varnostnemu pregledovalniku, enako kot pri modelih GPT‑6 Astra in GPT‑6 Sol.

Spodnja ocenjevanja namerno preizkušajo zahtevne situacije in ne merijo deležev napak pri običajni uporabi.

Cene in razpoložljivost

GPT‑6.1 Sol je od danes na voljo vsem uporabnikom paketov Plus, Pro, Business, Enterprise in Edu v načinu ChatGPT Work in orodju Codex. Ti modeli še niso na voljo v načinu Chat. Razvijalci lahko do njega dostopajo tudi prek API-ja OpenAI kot gpt-6.1-sol. Njegove standardne cene v API-ju so 2 $ na milijon vhodnih žetonov, 0,10 $ na milijon predpomnjenih vhodnih žetonov in 10 $ na milijon izhodnih žetonov.

Obenem uvajamo GPT‑6 Astra Ultrafast, najhitrejši prelomni model na svetu, ki je do 8-krat hitrejši od modela GPT‑6 Astra, ter GPT‑6.1 Sol Ultrafast. Na voljo sta prek API-ja ter v načinu ChatGPT Work in orodju Codex uporabnikom naše nove ravni paketa Pro z najvišjimi omejitvami uporabe za 500 $ na mesec. Z modelom GPT‑6.1 Sol Ultrafast lahko razvijalci dobijo inteligentnost blizu Astre z do 8-kratno hitrostjo za približno enake stroške API-ja kot prej pri modelu GPT‑6 Astra.

Avtorji

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.