Преминаване към основното съдържание
OpenAI

GPT-6.1Sol

Интелект, близък до Astra, на една пета от цената — за устойчиво представяне на авангардно ниво

Представяме GPT‑6.1 Sol — подобрена версия на GPT‑6 Sol с изключително силно представяне при агентно кодиране, работа с компютър и професионални задачи. Той доближава Sol до GPT‑6 Astra при сложни задачи на една пета от стандартните цени на Astra за входни и изходни токени. Така разработчиците имат повече възможности да създават и използват способни агенти със същия бюджет.

GPT‑6.1 Sol предлага представяне, близко до Astra, на цените на Sol, което го прави модела с най-добро съотношение между разходи и резултати, достъпен днес. Кешираните входни данни струват само 0,10 щ.д. за милион токени — с 95% по-малко от стандартната цена за входни данни. Това го прави по-достъпен за агентни задачи, които изискват повторно използване на контекста в множество заявки.

GPT‑6 Astra остава нашият авангарден модел с най-широки възможности като цяло. GPT‑6.1 Sol предлага нов баланс между възможности и цена — за важните задачи, които потребителите искат да изпълняват по-често, и за клиентите на API, които създават и използват приложения в голям мащаб.

Три карти с модели: GPT-6 Astra, най-интелигентният ни модел за най-добри резултати — 10 щ.д. за входни данни, 50 щ.д. за изходни данни и 1 щ.д. за кеширани входни данни; GPT-6.1 Sol, интелект, близък до Astra, на една пета от цената — 2 щ.д. за входни данни, 10 щ.д. за изходни данни и 0,10 щ.д. за кеширани входни данни; GPT-6 Luna, бърза и ефективна ежедневна работа в голям мащаб — 0,10 щ.д. за входни данни, 0,50 щ.д. за изходни данни и 0,01 щ.д. за кеширани входни данни.

По-способен Sol за разнообразни задачи

GPT‑6.1 Sol предлага значителни подобрения спрямо GPT‑6 Sol при сложни професионални задачи — от писане и отстраняване на грешки в код до разбиране на документи и изпълнение на многоетапни бизнес процеси. В няколко от тези оценки той се доближава до представянето на GPT‑6 Astra при значително по-ниски разходи.

Кодиране

В DeepSWE v1.1, който оценява сложни задачи по софтуерно инженерство в реални кодови бази, GPT‑6.1 Sol изравнява резултата на GPT‑6 Astra при приблизително една пета от разходите. Същевременно надминава най-добрия резултат на GPT‑6 Sol с 6,4 процентни пункта при по-ниско усилие за структурирано анализиране и по-ниски разходи.

В DeepSWE 1.1⁠⁠(отваря се в нов прозорец) агентите с ИИ решават оригинални задачи по софтуерно инженерство, изискващи продължителна работа.

Професионални задачи

В GDP.pdf, който измерва колко точно моделите отговарят на професионални въпроси чрез сложни PDF документи с таблици, графики, диаграми и детайли с дребен шрифт, GPT‑6.1 Sol постига по-висок резултат от Opus 5.5 с резервни варианти при под половината от разходите за задача при тестваните настройки за структурирано анализиране. Той се доближава и до водещото представяне на GPT‑6 Astra при приблизително една пета от разходите за задача.

В GDP.pdf⁠(отваря се в нов прозорец) моделите трябва да отговарят на реални запитвания за сложни PDF документи, използвани в работата на специалисти в областта на финансите, здравеопазването, правото и седем други професионални сфери.

В AutomationBench, който измерва дали агентите изпълняват правилно многоетапни бизнес процеси, GPT‑6.1 Sol постига резултат с 2,2 процентни пункта над Opus 5.5 при средно усилие за структурирано анализиране и приблизително една трета от разходите. Този резултат е и с 4,8 процентни пункта по-висок от този на GPT‑6 Sol при същата настройка.

In AutomationBench 1.0.6⁠⁠(отваря се в нов прозорец), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Работа с компютър

GPT‑6.1 Sol постига значителен напредък и при задачи, които изискват взаимодействие с компютърни приложения. В офлайн набора на OSWorld 2.0, който оценява агентите при сложни работни процеси с компютър, GPT‑6.1 Sol надминава GPT‑6 Sol със седем процентни пункта при максимално усилие за структурирано анализиране и под половината от разходите. Той се доближава на 2,1 процентни пункта до резултата на Astra при максимално усилие за структурирано анализиране и приблизително една седма от разходите за задача.

In OSWorld 2.0⁠⁠(отваря се в нов прозорец), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Научни изследвания

В Terminal-Bench Science 0.1, който оценява научни работни процеси, включително анализ на данни, симулации и доказване на теореми, GPT‑6.1 Sol постига над два пъти по-висок резултат от GPT‑6 Sol при максимално усилие за структурирано анализиране и под половината от разходите за задача. При максимално усилие GPT‑6.1 Sol струва средно 5,47 щ.д. на задача спрямо 23,21 щ.д. за Opus 5.5 и 23,80 щ.д. за Astra, като предлага значителни възможности за научна работа при над 75% по-ниски разходи от всеки от двата модела.

GPT‑6 Astra все още постига най-високия резултат сред тестваните модели — 68,1% — и е препоръчителният избор за най-трудните научноизследователски задачи.

В Terminal-Bench Science 0.1⁠(отваря се в нов прозорец) агентите изпълняват научноизследователски работни процеси с помощта на код и инструменти за терминала, включително анализ на данни, провеждане на симулации и напасване на модели.

Фактическа точност

GPT‑6.1 Sol подобрява и фактическата точност при трудни подкани. При много високо усилие за структурирано анализиране делът на фактическите му грешки е 4,1% спрямо 4,5% за GPT‑6 Sol, доближавайки се до 4,0% на Astra при същата настройка. Същевременно разходът за задача е с около 83% по-нисък от този на Astra.

Тази оценка измерва дела на отговорите с поне една фактическа грешка в разговори с премахнати идентифициращи данни, в които потребителите са сигнализирали за грешка на предишен модел. Тези умишлено трудни подкани не са представителни за обичайната употреба.

Оценяваме фактическата точност чрез разговори в ChatGPT с премахнати идентифициращи данни, в които потребителите са сигнализирали за фактическа грешка на предишен модел. Тези разговори, предизвикващи грешки, не са представителни за обичайната употреба, при която фактическите грешки са по-редки.

Безопасно внедряване на GPT‑6.1 Sol

GPT‑6.1 Sol показва значителни подобрения спрямо GPT‑6 Sol в нашите оценки за съответствие с човешките намерения и изисквания, доближавайки се до GPT‑6 Astra.

GPT‑6.1 Sol е по-прозрачен относно ограниченията си и по-надеждно зачита намеренията на потребителя и ограниченията за безопасност. При трудни оценки той допуска по-малко грешки от GPT‑6 Sol при съобщаване за неработещи инструменти за търсене, спазване на изрични ограничения и избягване на неразрешени резултати при агентни задачи. Не наблюдавахме опити за заобикаляне на автоматизираната система за проверка на безопасността, както и при GPT‑6 Astra и GPT‑6 Sol.

Оценките по-долу умишлено проверяват трудни ситуации и не измерват честотата на грешките при обичайна употреба.

Цени и достъпност

От днес GPT‑6.1 Sol е достъпен в ChatGPT Work и Codex за всички потребители на Plus, Pro, Business, Enterprise и Edu. Тези модели все още не са достъпни в Chat. Разработчиците могат да го използват и чрез API на OpenAI като gpt-6.1-sol. Стандартните му API цени са 2 щ.д. за милион входни токени, 0,10 щ.д. за милион кеширани входни токени и 10 щ.д. за милион изходни токени.

Успоредно с това пускаме GPT‑6 Astra Ultrafast — най-бързия авангарден модел в света, до 8 пъти по-бърз от GPT‑6 Astra — както и GPT‑6.1 Sol Ultrafast. Те са достъпни чрез API, както и в ChatGPT Work и Codex за потребителите на новото ни ниво Pro с най-високи лимити за използване на цена от 500 щ.д. месечно. С GPT‑6.1 Sol Ultrafast разработчиците получават интелект, близък до Astra, при до 8 пъти по-висока скорост и приблизително същите разходи за API като преди за GPT‑6 Astra.

Автор

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.