Преминаване към основното съдържание
OpenAI

Представяме GPT‑6 Sol и Luna

Още начини да внесете авангардно ниво на интелект в ежедневната си работа.

Зареждане…

По-рано този месец представихме GPT‑6 Astra — най-интелигентния и най-добре съгласуван модел в света. Макар че най-взискателните и важни проекти все още изискват пълните възможности на Astra, работата се извършва в различни мащаби, ритъм и бюджет.

Затова разширяваме вселената на GPT‑6 с GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra постави началото на ново поколение интелект, а тези модели помагат ползите от него да достигнат до повече хора, като разширяват авангардните възможности за ценова ефективност. Обучихме GPT‑6 Sol и Luna с методи, подобни на използваните за GPT‑6 Astra, пренасяйки постиженията зад водещата производителност на Astra в професионалната работа, фактологичната точност, програмирането, работата с компютър и съгласуването към по-бързи и достъпни модели.

Моделите GPT‑6 са водещи по цялата крива цена–интелект, като съчетават изключителни възможности на всяко ниво с инфраструктура, която ги предоставя ефективно и в голям мащаб. Подобренията в кеширането и извеждането ни позволяват да предлагаме тези модели на по-ниска цена. Предаваме спестяванията директно на потребителите и клиентите, като намаляваме цените на API за Sol и Luna с 50% спрямо промоционалните им цени за GPT‑5.6. Заедно тези подобрения правят усъвършенствания ИИ практичен за повече ежедневни задачи и приложения в голям мащаб.

Цени на API за GPT‑6

Модел

Вход

Изход

Намаление на цената

GPT‑6 Sol
спрямо GPT‑5.6 Sol

$4 → $2

$20 → $10

С 50% по-евтино

GPT‑6 Luna
спрямо GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

С 50% по-евтино

Цените са за 1 милион токена.

GPT‑6 Astra остава най-добрият ни модел във всяко отношение. Изберете го, когато искате най-добрите резултати без компромиси.

Крачка напред за цялото семейство модели

GPT‑6 Sol и Luna подобряват нивото на интелект и ценовата ефективност на вече познатите ви модели при най-полезните възможности за изпълнение на сложна работа.

Професионална работа

GPT‑6 Sol може да поема трудни служебни задачи, като ви дава повече възможности за итерации благодарение на по-високите лимити за използване и по-ниската цена. Той предлага по-високо ниво на интелект и по-добри резултати от конкурентни модели със сходна цена.

В AutomationBench — тест на бизнес работни процеси в различни приложения — GPT‑6 Sol при много високо ниво на усилие превъзхожда Claude Opus 5 при максимално усилие, като струва само 9% от цената на Opus 5 за задача. При високо ниво на усилие GPT‑6 Luna постига с 5,4 процентни пункта по-добър резултат от предшественика си при 58% по-ниска цена за задача.

В AutomationBench 1.0.6⁠(отваря се в нов прозорец) агентите с ИИ се тестват върху цялостни работни процеси с 47 инструмента в продажбите, маркетинга, оперативната дейност, поддръжката, финансите и човешките ресурси. Посочената цена за Claude Fable 5.1 е по-ниска от действителната, тъй като не включва разходите за преминаване към резервния модел Opus 5, което се е наложило при около 40% от задачите.

GPT‑6 Sol превъзхожда и Claude Fable 5.1 при далеч по-ниска цена и дори надминава GPT‑6 Astra при ниско ниво на усилие.

Модел (и усилие)

Резултат

Цена за задача

GPT‑6 Sol (Много високо)

33,2%

$0.27

GPT‑6 Astra (Ниско)

30,3%

3,9 пъти GPT‑6 Sol

Claude Opus 5 (Максимално)

26,9%

11,1 пъти GPT‑6 Sol

Claude Fable 5.1 с резервен Opus 5 (Максимално)

31,4%

>8,9 пъти GPT‑6 Sol

(цената на резервния модел не е посочена)

В Agents’ Last Exam, който оценява Агенти при сложни професионални работни процеси, GPT‑6 Sol при максимално усилие постига 56,4% — над най-високия резултат на Claude Opus 5 в оценяването — при 60% по-ниска цена за задача.

В Agents’ Last Exam V1⁠(отваря се в нов прозорец) Агентите с ИИ се оценяват върху дългосрочни задачи с икономическа стойност от 55 подотрасъла, обхващащи повечето основни области на професионалната работа, извършвана на компютър.

Фактологична точност

Полезността на един отговор зависи от точността на фактите и продължаваме да подобряваме фактологичната надеждност. Във вътрешното ни оценяване на фактологичната точност, базирано на деидентифицирани реални разговори, в които потребители са отбелязали грешки на нашите модели, GPT‑6 Sol допуска около два пъти по-малко грешки от предшественика си и се доближава до надеждността на Astra при много по-ниска цена. GPT‑6 Luna също се подобрява значително. При по-високи нива на усилие той се изравнява с GPT‑5.6 Sol при около една стотна от цената му.

Тук оценяваме фактологичната точност в деидентифицирани разговори в ChatGPT, в които потребителите са отбелязали фактологична грешка на предишен модел. Тези разговори, предизвикващи грешки, не отразяват обичайната употреба, при която фактологичните грешки са по-редки. Резултатите не са коригирани спрямо дължината, но тестовете ни с различна многословност показаха почти пълна липса на зависимост от дължината на отговора.

Програмиране

Тази година Агентите за програмиране започнаха да се справят със задачи с невиждани досега сложност, обхват и продължителност. В OpenAI вътрешното ни използване нарасна експоненциално. Изчислено по цените на API, дневното потребление на токени надхвърля $600 за изследователя на медианното ниво и $7000 за изследователите в 90-ия персентил (Ускоряване на изследванията: поглед отвътре към OpenAI⁠). Когато Агентите за програмиране поемат по-дълги и по-взискателни задачи, цената на продължителното използване става все по-важна. GPT‑6 Sol и Luna съчетават висока производителност при програмиране с по-ниски цени на API, като дават на разработчиците повече възможности за итерации, а на екипите — увереност да възлагат по-амбициозни задачи на Codex.

В FrontierCode, който оценява дали Агентите за програмиране създават промени, готови за сливане в реални кодови бази, GPT‑6 Sol значително превъзхожда GPT‑5.6 Sol и се изравнява с Claude Fable 5.1 при много високо усилие, но на много по-ниска цена.

В FrontierCode 1.1 Main⁠(отваря се в нов прозорец) Агентите с ИИ пишат код, който се оценява не само за коректност, но и за „готовност за сливане“ — например качество на тестовете, придържане към обхвата, стил на кода и спазване на стандартите на кодовата база.

В DeepSWE v1.1, който проверява производителността при сложни задачи по софтуерно инженерство в реални кодови бази, GPT‑6 Sol при максимално усилие постига 68,8% — само с 1,1 процентни пункта под най-високия резултат на Claude Fable 5 в оценяването, 69,9% при много високо усилие — при приблизително 80% по-ниска цена за задача.

GPT‑6 Luna при максимално усилие постига 66,6% — резултат, сравним с Claude Opus 5 и Fable 5 при средно усилие. В тези сравнения Luna струва с 93% по-малко на задача от Opus 5 и с 96% по-малко от Fable 5.

В DeepSWE 1.1⁠(отваря се в нов прозорец) Агентите с ИИ решават оригинални дългосрочни задачи по софтуерно инженерство.

Работа с компютър

Макар GPT‑6 Astra да остава най-добрият модел в света за работа с компютър, GPT‑6 Sol и Luna предлагат по-добра ценова ефективност от предшествениците си. В офлайн набора на OSWorld 2.0 GPT‑6 Sol при много високо усилие постига резултат, сходен с този на Claude Opus 5 при средно усилие — 60,5% спрямо 60,3% — при приблизително 80% по-ниска цена за задача. GPT‑6 Luna (Максимално) превъзхожда GPT‑5.6 Sol (Средно) при една десета от цената му.

В OSWorld 2.0⁠(отваря се в нов прозорец) Агентите с ИИ изпълняват дългосрочни работни процеси на компютър, обхващащи ежедневни и професионални задачи. Отчитаме частичната награда за офлайн набора от версия v2026.08.08.

Стил на сътрудничество

Пренесохме подобрения стил на комуникация на GPT‑6 Astra и в Sol и Luna. Смятаме, че това ще се забелязва особено ясно в техническите разговори и тези за програмиране. Очаквайте повече яснота, по-малко жаргон и странни формулировки, по-малко подробности с ниска стойност и като цяло малко по-кратки отговори без загуба на съдържание.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Макар стилът да е субективен, тук предпочитаме отговора на GPT‑6 Sol. Той не прибързва толкова със заключенията, не повтаря излишно подробности, които вероятно са очевидни за питащия (например че уебсайтът има четири страници), използва по-малко неясни изрази (например „усещане за бенто“, „преоформяне… около тази система“), по-открито посочва какво е проверил и какво не и не споделя ненужно подробности за реализацията, като подканата към инструмента за изображения.

Подобряване на кеширането за Агенти и дълги разговори

Наред с по-ниските цени на токените помагаме на разработчиците, които създават решения с GPT‑6, да спестяват повече от контекста, използван повторно от приложенията им. Подобрихме кеширането на подкани за GPT‑6, за да осигурим по подразбиране по-висок дял на попаденията в кеша. Така Агентите могат да използват повторно повече контекст, да отговарят по-бързо и да се възползват от 90% отстъпка при четене на кеширани входни токени.

Разработчиците разполагат и с повече начини да измерват и оптимизират ефективността на кеширането:

GitHub съобщава, че през последните няколко месеца тези подобрения са намалили с над 50% дела на токените от подкани, които изискват нова обработка, в милиарди заявки към модели на OpenAI, помагайки на Copilot да отговаря по-бързо.

Продължаваме да подобряваме съгласуването

GPT‑6 Sol и Luna надграждат работата по съгласуването, представена с Astra — най-добре съгласувания ни модел досега. В оценяванията ни за съгласуване Sol и Luna показват подобрения спрямо съответните си версии GPT‑5.6, включително по-нисък дял на подвеждащите твърдения за извършената от тях работа по програмиране.

Оценяванията по-долу умишлено проверяват трудни ситуации и не измерват дела на неуспехите при обичайна употреба. Вижте картата на системата⁠(отваря се в нов прозорец) за пълните резултати.

Наличност

От днес GPT‑6 Sol и GPT‑6 Luna са налични в ChatGPT Work и Codex за всички потребители на Plus, Pro, Business, Enterprise и Edu. Потребителите на Free и Go имат достъп до GPT‑6 Luna в настолното приложение. Тези модели все още не са налични в Chat. В API на OpenAI те са налични като gpt-6-sol и gpt-6-luna.

За да запазим услугата стабилна за всички, планираме да пускаме тези модели в ChatGPT постепенно през деня. Ако не виждате новите модели в ChatGPT Work или Codex, опитайте отново по-късно.


Оценяванията на GPT бяха извършени в нашата изследователска среда или чрез нашия API, които поради разлики в системните подкани, наличните инструменти и други фактори може да дават малко по-различни резултати от продукционната версия на ChatGPT. Оценяванията на конкурентни модели са взети от публично достъпни доклади. Когато липсваха резултати за Claude Fable 5.1, бяха посочени резултатите за Claude Fable 5.

Автор

OpenAI