Прескокни до главната содржина
OpenAI

GPT-6.1Sol

Интелигенција блиска до Astra по петпати пониска цена за стабилни перформанси на гранично ниво

Го претставуваме GPT‑6.1 Sol, надградба на GPT‑6 Sol со исклучително силни перформанси при кодирање со агент, како и при користење компјутер и професионална работа. Тој го приближува Sol до GPT‑6 Astra при сложени задачи, со петпати пониски цени од стандардните цени на Astra за влезни и излезни токени, овозможувајќи им на програмерите да создаваат и користат поспособни агенти со истиот буџет.

GPT‑6.1 Sol нуди перформанси блиски до Astra по цените на Sol, што го прави најисплатливиот модел според перформансите што е достапен денес. Кешираниот влез чини само 0,10 $ за милион токени — 95% попуст од стандардната цена за влез — што го прави попристапен за задачи со агенти кај кои треба повторно да се користи контекстот при повеќекратни барања.

GPT‑6 Astra останува нашиот севкупно најспособен граничен модел. GPT‑6.1 Sol нуди нова рамнотежа меѓу способностите и трошоците за важните задачи што корисниците сакаат да ги извршуваат почесто, како и за клиентите на API што развиваат и извршуваат апликации во голем обем.

Три картички на модели: GPT-6 Astra, нашиот најинтелигентен модел за најдобри резултати, 10 $ за влез, 50 $ за излез и 1 $ за кеширан влез; GPT-6.1 Sol, интелигенција блиска до Astra по петпати пониска цена, 2 $ за влез, 10 $ за излез и 0,10 $ за кеширан влез; GPT-6 Luna, брза и ефикасна секојдневна работа во голем обем, 0,10 $ за влез, 0,50 $ за излез и 0,01 $ за кеширан влез.

Поспособен Sol за различни задачи

GPT‑6.1 Sol носи значителни подобрувања во однос на GPT‑6 Sol во сложената професионална работа, од пишување код и отстранување грешки до разбирање документи и извршување деловни работни текови во повеќе чекори. На неколку од овие евалуации се приближува до перформансите на GPT‑6 Astra со значително пониски трошоци.

Кодирање

На DeepSWE v1.1, кој оценува сложени задачи од софтверското инженерство во реални кодни бази, GPT‑6.1 Sol го изедначува резултатот на GPT‑6 Astra со околу петпати понизок трошок, а го надминува најдобриот резултат на GPT‑6 Sol за 6,4 процентни поени со понизок степен на расудување и понизок трошок.

Во DeepSWE 1.1⁠⁠(се отвора во нов прозорец), агентите со ВИ решаваат оригинални задачи од софтверското инженерство што бараат долгорочна работа.

Професионална работа

На GDP.pdf, кој мери колку точно моделите одговараат на стручни прашања користејќи сложени PDF-документи со табели, графикони, дијаграми и ситно испечатени детали, GPT‑6.1 Sol постигнува повисок резултат од Opus 5.5 со резервни модели, со помалку од половина од трошокот по задача низ тестираните поставки за расудување. Исто така, се приближува до водечките перформанси на GPT‑6 Astra со околу петпати понизок трошок по задача.

Во GDP.pdf⁠(се отвора во нов прозорец), моделите треба да одговорат на барања од реалната практика за сложени PDF-документи од професионални работни процеси во финансиите, здравството, правото и уште седум професионални области.

На AutomationBench, кој мери дали агентите правилно завршуваат деловни работни текови во повеќе чекори, GPT‑6.1 Sol постигнува резултат за 2,2 процентни поени повисок од Opus 5.5 при среден степен на расудување, со околу трипати понизок трошок. Овој резултат е и за 4,8 процентни поени повисок од оној на GPT‑6 Sol со истата поставка.

In AutomationBench 1.0.6⁠⁠(се отвора во нов прозорец), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Користење компјутер

GPT‑6.1 Sol бележи значителен напредок и во задачите што бараат интеракција со компјутерски апликации. На офлајн-збирката на OSWorld 2.0, која ги оценува агентите во сложени работни текови со користење компјутер, GPT‑6.1 Sol го надминува GPT‑6 Sol за седум процентни поени при максимален степен на расудување, со помалку од половина од трошокот. При максимален степен на расудување, неговиот резултат заостанува само 2,1 процентни поени зад Astra, со околу седумпати понизок трошок по задача.

In OSWorld 2.0⁠⁠(се отвора во нов прозорец), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Научно истражување

На Terminal-Bench Science 0.1, кој оценува научни работни текови, вклучувајќи анализа на податоци, симулации и докажување теореми, GPT‑6.1 Sol постигнува повеќе од двојно повисок резултат од GPT‑6 Sol при максимален степен на расудување, со помалку од половина од трошокот по задача. При максимален степен на расудување, GPT‑6.1 Sol чини просечно 5,47 $ по задача, во споредба со 23,21 $ за Opus 5.5 и 23,80 $ за Astra, нудејќи значителни научни способности со над 75% понизок трошок од двата модела.

GPT‑6 Astra и понатаму го постигнува највисокиот резултат меѓу тестираните модели, 68,1%, и треба да се користи за најтешките научноистражувачки задачи.

Во Terminal-Bench Science 0.1⁠(се отвора во нов прозорец), агентите извршуваат научноистражувачки работни процеси користејќи код и терминалски алатки, вклучувајќи анализа на податоци, извршување симулации и прилагодување модели кон податоците.

Фактичка точност

GPT‑6.1 Sol ја подобрува и фактичката точност при тешки барања. При екстра висок степен на расудување, неговата стапка на фактички грешки е 4,1%, пониска од 4,5% кај GPT‑6 Sol и поблиска до 4,0% кај Astra со истата поставка, а трошокот по задача е приближно 83% понизок од оној на Astra.

Оваа евалуација го мери уделот на одговори со барем една фактичка грешка во разговори од кои се отстранети податоците за идентификација, а во кои корисниците пријавиле грешка од претходен модел. Овие намерно тешки барања не се репрезентативни за вообичаената употреба.

Ја оценуваме фактичката точност врз основа на разговори во ChatGPT од кои се отстранети податоците за идентификација и во кои корисниците пријавиле фактичка грешка од претходен модел. Овие разговори што предизвикуваат грешки не се репрезентативни за вообичаената употреба, при која фактичките грешки се поретки.

Безбедно воведување на GPT‑6.1 Sol

GPT‑6.1 Sol покажува значителни подобрувања во однос на GPT‑6 Sol во нашите евалуации на усогласеноста, со што се приближува до GPT‑6 Astra.

GPT‑6.1 Sol е потранспарентен за своите ограничувања и посигурно ги почитува намерата на корисникот и безбедносните ограничувања. Во тешки евалуации покажува пониски стапки на пропусти од GPT‑6 Sol во транспарентноста за нефункционални алатки за пребарување, почитувањето експлицитни ограничувања и избегнувањето неовластени исходи при задачи со агенти. Не забележавме обиди за заобиколување автоматизиран безбедносен проверувач, исто како кај GPT‑6 Astra и GPT‑6 Sol.

Евалуациите подолу намерно тестираат тешки ситуации и не ги мерат стапките на пропусти при вообичаена употреба.

Цени и достапност

Од денес, GPT‑6.1 Sol е достапен за сите корисници на Plus, Pro, Business, Enterprise и Edu во ChatGPT Work и Codex. Овие модели сѐ уште не се достапни во Chat. Програмерите можат да му пристапат и преку API на OpenAI како gpt-6.1-sol. Неговите стандардни цени преку API се 2 $ за милион влезни токени, 0,10 $ за милион кеширани влезни токени и 10 $ за милион излезни токени.

Истовремено ги лансираме GPT‑6 Astra Ultrafast, најбрзиот граничен модел во светот, до 8 пати побрз од GPT‑6 Astra, како и GPT‑6.1 Sol Ultrafast. Овие модели се достапни преку API, како и во ChatGPT Work и Codex за корисниците на нашето ново ниво Pro со највисоки лимити за користење, по цена од 500 $ месечно. Со GPT‑6.1 Sol Ultrafast, програмерите можат да добијат интелигенција блиска до Astra со до 8 пати поголема брзина, за приближно ист трошок за API како претходно за GPT‑6 Astra.

Автор

OpenAI

Евалуациите на GPT беа спроведени во нашата истражувачка средина или преку нашето API, каде што резултатите може малку да се разликуваат од оние во продукциската верзија на ChatGPT поради разлики во системските инструкции, достапните алатки, степенот на расудување итн. Евалуациите на конкурентските модели се преземени од јавно достапни извештаи.