Přeskoč na hlavní obsah
OpenAI

GPT-6.1Sol

Near-Astra intelligence for a fifth of the price

Představujeme GPT‑6.1 Sol, vylepšenou verzi GPT‑6 Sol s mimořádně silným výkonem v agentním kódování, ovládání počítače i odborné práci. Při náročných úkolech přibližuje Sol modelu GPT‑6 Astra, a to za pětinu standardních cen vstupních a výstupních tokenů modelu Astra. Vývojářům tak dává více prostoru vytvářet a provozovat schopné agenty se stejným rozpočtem.

GPT‑6.1 Sol přináší výkon téměř na úrovni modelu Astra za ceny modelu Sol, což z něj dělá model s nejlepším poměrem ceny a výkonu, který je dnes dostupný. Vstup uložený v mezipaměti stojí pouhých 0,10 $ za milion tokenů – o 95 % méně než standardní vstup. Díky tomu je model cenově dostupnější pro agentní úlohy, které potřebují znovu využívat kontext v opakovaných požadavcích.

GPT‑6 Astra zůstává celkově naším nejschopnějším průkopnickým modelem. GPT‑6.1 Sol nabízí nový poměr schopností a ceny pro důležitou práci, které se uživatelé chtějí věnovat častěji, i pro zákazníky API, kteří vytvářejí a provozují aplikace ve velkém měřítku.

Tři karty modelů: GPT-6 Astra, náš nejinteligentnější model pro nejlepší výsledky, 10 $ za vstup, 50 $ za výstup a 1 $ za vstup v mezipaměti; GPT-6.1 Sol, inteligence téměř na úrovni modelu Astra za pětinovou cenu, 2 $ za vstup, 10 $ za výstup a 0,10 $ za vstup v mezipaměti; GPT-6 Luna, rychlá a efektivní každodenní práce ve velkém měřítku, 0,10 $ za vstup, 0,50 $ za výstup a 0,01 $ za vstup v mezipaměti.

Schopnější Sol v nejrůznějších úkolech

GPT‑6.1 Sol přináší oproti GPT‑6 Sol výrazné zlepšení při náročné odborné práci, od psaní a ladění kódu přes porozumění dokumentům až po provádění vícekrokových firemních postupů. V několika z těchto hodnocení se blíží výkonu modelu GPT‑6 Astra při podstatně nižších nákladech.

Kódování

V testu DeepSWE v1.1, který hodnotí složité úkoly softwarového inženýrství ve skutečných kódových základnách, se GPT‑6.1 Sol vyrovná modelu GPT‑6 Astra za zhruba pětinové náklady. Zároveň překonává nejlepší skóre modelu GPT‑6 Sol o 6,4 procentního bodu při nižší intenzitě uvažování i nižších nákladech.

V benchmarku DeepSWE 1.1⁠⁠(otevře se v novém okně) řeší AI agenti původní úlohy softwarového inženýrství vyžadující dlouhou posloupnost kroků.

Odborná práce

Test GDP.pdf měří, jak přesně modely odpovídají na odborné otázky pomocí složitých dokumentů PDF, včetně tabulek, grafů, diagramů a detailů psaných drobným písmem. GPT‑6.1 Sol v něm napříč testovanými nastaveními uvažování dosahuje vyššího skóre než Opus 5.5 se záložními postupy, a to za méně než poloviční náklady na úkol. Zároveň se blíží špičkovému výkonu modelu GPT‑6 Astra za zhruba pětinové náklady na úkol.

V benchmarku GDP.pdf⁠(otevře se v novém okně) musí modely odpovídat na zadání z praxe týkající se složitých PDF dokumentů používaných ve financích, zdravotnictví, právu a sedmi dalších profesních oblastech.

V testu AutomationBench, který měří, zda agenti správně provádějí vícekrokové firemní postupy, dosahuje GPT‑6.1 Sol při střední intenzitě uvažování skóre o 2,2 procentního bodu vyššího než Opus 5.5, a to za zhruba třetinové náklady. Toto skóre je také o 4,8 procentního bodu vyšší než u GPT‑6 Sol při stejném nastavení.

In AutomationBench 1.0.6⁠⁠(otevře se v novém okně), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Ovládání počítače

GPT‑6.1 Sol výrazně pokročil také v úkolech, které vyžadují práci s počítačovými aplikacemi. Na offline testovací sadě OSWorld 2.0, která hodnotí agenty při náročných pracovních postupech vyžadujících ovládání počítače, překonává GPT‑6.1 Sol model GPT‑6 Sol o sedm procentních bodů při maximální intenzitě uvažování a za méně než poloviční náklady. Při maximální intenzitě uvažování zaostává za skóre modelu Astra jen o 2,1 procentního bodu, a to za zhruba sedminové náklady na úkol.

In OSWorld 2.0⁠⁠(otevře se v novém okně), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Vědecký výzkum

V testu Terminal-Bench Science 0.1, který hodnotí vědecké postupy včetně analýzy dat, simulací a dokazování teorémů, dosahuje GPT‑6.1 Sol při maximální intenzitě uvažování více než dvojnásobného skóre oproti GPT‑6 Sol, a to za méně než poloviční náklady na úkol. Při maximální intenzitě uvažování stojí GPT‑6.1 Sol v průměru 5,47 $ na úkol, oproti 23,21 $ u Opus 5.5 a 23,80 $ u modelu Astra. Nabízí tak značné schopnosti pro vědeckou práci za náklady o více než 75 % nižší než u obou těchto modelů.

GPT‑6 Astra nadále dosahuje nejvyššího skóre mezi testovanými modely, a to 68,1 %, a měl by se používat pro nejnáročnější úkoly vědeckého výzkumu.

V benchmarku Terminal-Bench Science 0.1⁠(otevře se v novém okně) agenti provádějí vědecké výzkumné postupy pomocí kódu a terminálových nástrojů, včetně analýzy dat, spouštění simulací a odhadování parametrů modelů.

Faktická správnost

GPT‑6.1 Sol také zlepšuje faktickou správnost odpovědí na náročné prompty. Při extra vysoké intenzitě uvažování má míru faktických chyb 4,1 %, oproti 4,5 % u GPT‑6 Sol. Blíží se tak 4,0 % modelu Astra při stejném nastavení, přičemž náklady na úkol jsou přibližně o 83 % nižší než u modelu Astra.

Toto hodnocení měří podíl odpovědí s alespoň jednou faktickou chybou v konverzacích zbavených identifikačních údajů, v nichž uživatelé upozornili na chybu dřívějšího modelu. Tyto záměrně náročné prompty nejsou reprezentativní pro běžné používání.

Faktickou správnost hodnotíme na konverzacích v ChatGPT zbavených identifikačních údajů, v nichž uživatelé upozornili na faktickou chybu předchozího modelu. Tyto konverzace vedoucí k chybám nejsou reprezentativní pro běžné používání, při němž jsou faktické chyby vzácnější.

Bezpečné nasazení GPT‑6.1 Sol

V našich hodnoceních sladění modelů vykazuje GPT‑6.1 Sol oproti GPT‑6 Sol výrazné zlepšení a přibližuje se modelu GPT‑6 Astra.

GPT‑6.1 Sol otevřeněji přiznává svá omezení a spolehlivěji respektuje záměr uživatele i bezpečnostní omezení. V náročných hodnoceních selhává méně často než GPT‑6 Sol při upozorňování na nefunkční vyhledávací nástroje, respektování výslovných omezení a předcházení neoprávněným výsledkům při agentních úkolech. Nezaznamenali jsme žádné pokusy o obejití automatické bezpečnostní kontroly, stejně jako u GPT‑6 Astra a GPT‑6 Sol.

Níže uvedená hodnocení záměrně testují náročné situace a neměří míru selhání při běžném používání.

Ceny a dostupnost

GPT‑6.1 Sol je ode dneška dostupný všem uživatelům tarifů Plus, Pro, Business, Enterprise a Edu v ChatGPT Work a Codexu. V režimu Chat tyto modely zatím nejsou dostupné. Vývojáři k němu mají přístup také prostřednictvím API OpenAI pod označením gpt-6.1-sol. Standardní ceny API jsou 2 $ za milion vstupních tokenů, 0,10 $ za milion vstupních tokenů v mezipaměti a 10 $ za milion výstupních tokenů.

Současně uvádíme GPT‑6 Astra Ultrafast, nejrychlejší průkopnický model na světě, který je až 8× rychlejší než GPT‑6 Astra, a také GPT‑6.1 Sol Ultrafast. Tyto modely jsou dostupné v API a také v ChatGPT Work a Codexu uživatelům naší nové úrovně tarifu Pro s nejvyššími limity využití za 500 $ měsíčně. S GPT‑6.1 Sol Ultrafast mohou vývojáři získat inteligenci téměř na úrovni modelu Astra při až 8× vyšší rychlosti, a to za zhruba stejné výdaje na API jako dříve u GPT‑6 Astra.

Autor

OpenAI

Hodnocení modelů GPT probíhala v našem výzkumném prostředí nebo prostřednictvím naší API. Jejich výstupy se mohou mírně lišit od produkční verze ChatGPT kvůli rozdílům v systémových promptech, dostupných nástrojích, intenzitě uvažování apod. Hodnocení konkurenčních modelů jsme převzali z veřejně dostupných zpráv.