Preskočiť na hlavný obsah
OpenAI

GPT-6.1Sol

Inteligencia takmer na úrovni modelu Astra za pätinu ceny pre trvalo prelomový výkon

Predstavujeme GPT‑6.1 Sol, vylepšenú verziu GPT‑6 Sol s mimoriadne vysokým výkonom v agentickom programovaní, ako aj pri používaní počítača a odbornej práci. Pri náročných úlohách približuje Sol k modelu GPT‑6 Astra, no za pätinu štandardných cien vstupných a výstupných tokenov modelu Astra. Vývojári tak majú väčší priestor na tvorbu a prevádzku schopných agentov pri rovnakom rozpočte.

GPT‑6.1 Sol prináša výkon blízky modelu Astra za ceny modelu Sol, vďaka čomu je dnes dostupným modelom s najlepším pomerom ceny a výkonu. Vstup vo vyrovnávacej pamäti stojí len 0,10 $ za milión tokenov, čo predstavuje 95 % zľavu oproti štandardnej cene vstupu. To znižuje náklady na agentické úlohy, pri ktorých treba opakovane využívať kontext vo viacerých požiadavkách.

GPT‑6 Astra zostáva celkovo naším najschopnejším prelomovým modelom. GPT‑6.1 Sol ponúka nový pomer schopností a nákladov na dôležitú prácu, ktorú chcú používatelia robiť častejšie, aj pre zákazníkov API, ktorí vyvíjajú a prevádzkujú aplikácie vo veľkom rozsahu.

Tri karty modelov: GPT-6 Astra, náš najinteligentnejší model pre najlepšie výsledky, vstup 10 $, výstup 50 $ a vstup vo vyrovnávacej pamäti 1 $; GPT-6.1 Sol, inteligencia takmer na úrovni modelu Astra za pätinu ceny, vstup 2 $, výstup 10 $ a vstup vo vyrovnávacej pamäti 0,10 $; GPT-6 Luna, rýchla a efektívna každodenná práca vo veľkom rozsahu, vstup 0,10 $, výstup 0,50 $ a vstup vo vyrovnávacej pamäti 0,01 $.

Schopnejší Sol naprieč úlohami

GPT‑6.1 Sol prináša oproti GPT‑6 Sol výrazné zlepšenia pri komplexnej odbornej práci: od písania a ladenia kódu cez porozumenie dokumentom až po vykonávanie viacstupňových firemných pracovných postupov. Vo viacerých z týchto hodnotení sa približuje výkonu GPT‑6 Astra pri podstatne nižších nákladoch.

Programovanie

V teste DeepSWE v1.1, ktorý hodnotí komplexné softvérové inžinierstvo v reálnych kódových základniach, sa GPT‑6.1 Sol vyrovná GPT‑6 Astra pri približne pätinových nákladoch. Zároveň prekonáva najlepšie skóre GPT‑6 Sol o 6,4 percentuálneho bodu pri nižšej úrovni úsilia pri uvažovaní aj nižších nákladoch.

V benchmarku DeepSWE 1.1⁠⁠(otvorí sa v novom okne) riešia AI agenti pôvodné úlohy softvérového inžinierstva vyžadujúce prácu v dlhšom časovom horizonte.

Odborná práca

V teste GDP.pdf, ktorý meria presnosť odpovedí modelov na odborné otázky na základe komplexných dokumentov PDF vrátane tabuliek, grafov, diagramov a drobného písma, dosahuje GPT‑6.1 Sol vyššie skóre než Opus 5.5 so záložnými modelmi. Naprieč testovanými nastaveniami uvažovania pritom náklady na úlohu nedosahujú ani polovicu. Zároveň sa približuje špičkovému výkonu GPT‑6 Astra pri približne pätinových nákladoch na úlohu.

V benchmarku GDP.pdf⁠(otvorí sa v novom okne) musia modely odpovedať na zadania z praxe týkajúce sa zložitých PDF dokumentov používaných pri práci vo financiách, zdravotníctve, práve a siedmich ďalších profesijných oblastiach.

V teste AutomationBench, ktorý meria, či agenti správne dokončia viacstupňové firemné pracovné postupy, dosahuje GPT‑6.1 Sol pri strednej úrovni úsilia pri uvažovaní skóre o 2,2 percentuálneho bodu vyššie než Opus 5.5, a to pri približne tretinových nákladoch. Toto skóre je zároveň o 4,8 percentuálneho bodu vyššie než pri GPT‑6 Sol s rovnakým nastavením.

In AutomationBench 1.0.6⁠⁠(otvorí sa v novom okne), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Používanie počítača

GPT‑6.1 Sol dosahuje výrazný pokrok aj v úlohách, ktoré vyžadujú interakciu s počítačovými aplikáciami. Na offline súbore testu OSWorld 2.0, ktorý hodnotí agentov pri náročných pracovných postupoch na počítači, prekonáva GPT‑6.1 Sol model GPT‑6 Sol o sedem percentuálnych bodov pri maximálnej úrovni úsilia pri uvažovaní a menej než polovičných nákladoch. Pri maximálnej úrovni úsilia pri uvažovaní zaostáva za skóre modelu Astra len o 2,1 percentuálneho bodu, pričom náklady na úlohu sú približne sedminové.

In OSWorld 2.0⁠⁠(otvorí sa v novom okne), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Vedecký výskum

V teste Terminal-Bench Science 0.1, ktorý hodnotí vedecké pracovné postupy vrátane analýzy údajov, simulácií a dokazovania viet, dosahuje GPT‑6.1 Sol pri maximálnej úrovni úsilia pri uvažovaní viac než dvojnásobné skóre oproti GPT‑6 Sol pri menej než polovičných nákladoch na úlohu. Pri maximálnej úrovni úsilia stojí GPT‑6.1 Sol v priemere 5,47 $ na úlohu v porovnaní s 23,21 $ pri Opus 5.5 a 23,80 $ pri modeli Astra. Ponúka tak značné vedecké schopnosti za náklady o viac než 75 % nižšie než pri oboch týchto modeloch.

GPT‑6 Astra stále dosahuje najvyššie skóre spomedzi testovaných modelov, 68,1 %, a mal by sa používať na najťažšie úlohy vedeckého výskumu.

V benchmarku Terminal-Bench Science 0.1⁠(otvorí sa v novom okne) agenti vykonávajú vedeckovýskumné pracovné postupy pomocou kódu a terminálových nástrojov vrátane analýzy údajov, spúšťania simulácií a odhadu parametrov modelov.

Faktická správnosť

GPT‑6.1 Sol zlepšuje aj faktickú presnosť pri náročných promptoch. Pri mimoriadne vysokej úrovni úsilia pri uvažovaní má mieru faktických chýb 4,1 %, čo je pokles oproti 4,5 % pri GPT‑6 Sol a bližšie k 4,0 % modelu Astra s rovnakým nastavením. Náklady na úlohu sú pritom približne o 83 % nižšie než pri modeli Astra.

Toto hodnotenie meria podiel odpovedí s aspoň jednou faktickou chybou v konverzáciách zbavených identifikačných údajov, v ktorých používatelia nahlásili chybu skoršieho modelu. Tieto zámerne náročné prompty neodrážajú bežné používanie.

Faktickú správnosť hodnotíme na konverzáciách v ChatGPT zbavených identifikačných údajov, v ktorých používatelia nahlásili faktickú chybu predchádzajúceho modelu. Tieto konverzácie vedúce k chybám neodrážajú bežné používanie, pri ktorom sú faktické chyby zriedkavejšie.

Bezpečné nasadenie GPT‑6.1 Sol

V našich hodnoteniach súladu s ľudskými zámermi a hodnotami vykazuje GPT‑6.1 Sol výrazné zlepšenia oproti GPT‑6 Sol, čím sa približuje k GPT‑6 Astra.

GPT‑6.1 Sol otvorenejšie informuje o svojich obmedzeniach a spoľahlivejšie rešpektuje zámer používateľa aj bezpečnostné obmedzenia. V náročných hodnoteniach zlyháva menej často než GPT‑6 Sol pri informovaní o nefunkčných vyhľadávacích nástrojoch, rešpektovaní výslovných obmedzení a predchádzaní neoprávneným výsledkom počas agentických úloh. Nezaznamenali sme žiadne pokusy o obídenie automatizovanej bezpečnostnej kontroly, rovnako ako pri GPT‑6 Astra a GPT‑6 Sol.

Nasledujúce hodnotenia zámerne testujú náročné situácie a nemerajú mieru zlyhaní pri bežnom používaní.

Ceny a dostupnosť

GPT‑6.1 Sol je od dnešného dňa dostupný všetkým používateľom plánov Plus, Pro, Business, Enterprise a Edu v ChatGPT Work a Codex. Tieto modely zatiaľ nie sú dostupné v režime Chat. Vývojári k nemu majú prístup aj cez API OpenAI pod označením gpt-6.1-sol. Štandardné ceny v API sú 2 $ za milión vstupných tokenov, 0,10 $ za milión vstupných tokenov vo vyrovnávacej pamäti a 10 $ za milión výstupných tokenov.

Zároveň uvádzame GPT‑6 Astra Ultrafast, najrýchlejší prelomový model na svete, až 8× rýchlejší než GPT‑6 Astra, ako aj GPT‑6.1 Sol Ultrafast. Tieto modely sú dostupné v API, ako aj v ChatGPT Work a Codex pre používateľov našej novej úrovne Pro s najvyššími limitmi používania za 500 $ mesačne. S GPT‑6.1 Sol Ultrafast môžu vývojári získať inteligenciu takmer na úrovni modelu Astra s až 8× vyššou rýchlosťou za približne rovnaké náklady na API ako predtým pri GPT‑6 Astra.

Autor

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.