Представяме GPT‑6 Sol и Luna
Още начини да внесете авангардно ниво на интелект в ежедневната си работа.
По-рано този месец представихме GPT‑6 Astra — най-интелигентния и най-добре съгласуван модел в света. Макар че най-взискателните и важни проекти все още изискват пълните възможности на Astra, работата се извършва в различни мащаби, ритъм и бюджет.
Затова разширяваме вселената на GPT‑6 с GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra постави началото на ново поколение интелект, а тези модели помагат ползите от него да достигнат до повече хора, като разширяват авангардните възможности за ценова ефективност. Обучихме GPT‑6 Sol и Luna с методи, подобни на използваните за GPT‑6 Astra, пренасяйки постиженията зад водещата производителност на Astra в професионалната работа, фактологичната точност, програмирането, работата с компютър и съгласуването към по-бързи и достъпни модели.
Моделите GPT‑6 са водещи по цялата крива цена–интелект, като съчетават изключителни възможности на всяко ниво с инфраструктура, която ги предоставя ефективно и в голям мащаб. Подобренията в кеширането и извеждането ни позволяват да предлагаме тези модели на по-ниска цена. Предаваме спестяванията директно на потребителите и клиентите, като намаляваме цените на API за Sol и Luna с 50% спрямо промоционалните им цени за GPT‑5.6. Заедно тези подобрения правят усъвършенствания ИИ практичен за повече ежедневни задачи и приложения в голям мащаб.
Модел | Вход | Изход | Намаление на цената |
GPT‑6 Sol | $4 → $2 | $20 → $10 | С 50% по-евтино |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | С 50% по-евтино |
Цените са за 1 милион токена.
GPT‑6 Astra остава най-добрият ни модел във всяко отношение. Изберете го, когато искате най-добрите резултати без компромиси.
GPT‑6 Sol и Luna подобряват нивото на интелект и ценовата ефективност на вече познатите ви модели при най-полезните възможности за изпълнение на сложна работа.
GPT‑6 Sol може да поема трудни служебни задачи, като ви дава повече възможности за итерации благодарение на по-високите лимити за използване и по-ниската цена. Той предлага по-високо ниво на интелект и по-добри резултати от конкурентни модели със сходна цена.
В AutomationBench — тест на бизнес работни процеси в различни приложения — GPT‑6 Sol при много високо ниво на усилие превъзхожда Claude Opus 5 при максимално усилие, като струва само 9% от цената на Opus 5 за задача. При високо ниво на усилие GPT‑6 Luna постига с 5,4 процентни пункта по-добър резултат от предшественика си при 58% по-ниска цена за задача.
В AutomationBench 1.0.6(отваря се в нов прозорец) агентите с ИИ се тестват върху цялостни работни процеси с 47 инструмента в продажбите, маркетинга, оперативната дейност, поддръжката, финансите и човешките ресурси. Посочената цена за Claude Fable 5.1 е по-ниска от действителната, тъй като не включва разходите за преминаване към резервния модел Opus 5, което се е наложило при около 40% от задачите.
GPT‑6 Sol превъзхожда и Claude Fable 5.1 при далеч по-ниска цена и дори надминава GPT‑6 Astra при ниско ниво на усилие.
Модел (и усилие) | Резултат | Цена за задача |
|---|---|---|
GPT‑6 Sol (Много високо) | 33,2% | $0.27 |
GPT‑6 Astra (Ниско) | 30,3% | 3,9 пъти GPT‑6 Sol |
Claude Opus 5 (Максимално) | 26,9% | 11,1 пъти GPT‑6 Sol |
Claude Fable 5.1 с резервен Opus 5 (Максимално) | 31,4% | >8,9 пъти GPT‑6 Sol (цената на резервния модел не е посочена) |
В Agents’ Last Exam, който оценява Агенти при сложни професионални работни процеси, GPT‑6 Sol при максимално усилие постига 56,4% — над най-високия резултат на Claude Opus 5 в оценяването — при 60% по-ниска цена за задача.
В Agents’ Last Exam V1(отваря се в нов прозорец) Агентите с ИИ се оценяват върху дългосрочни задачи с икономическа стойност от 55 подотрасъла, обхващащи повечето основни области на професионалната работа, извършвана на компютър.
Полезността на един отговор зависи от точността на фактите и продължаваме да подобряваме фактологичната надеждност. Във вътрешното ни оценяване на фактологичната точност, базирано на деидентифицирани реални разговори, в които потребители са отбелязали грешки на нашите модели, GPT‑6 Sol допуска около два пъти по-малко грешки от предшественика си и се доближава до надеждността на Astra при много по-ниска цена. GPT‑6 Luna също се подобрява значително. При по-високи нива на усилие той се изравнява с GPT‑5.6 Sol при около една стотна от цената му.
Тук оценяваме фактологичната точност в деидентифицирани разговори в ChatGPT, в които потребителите са отбелязали фактологична грешка на предишен модел. Тези разговори, предизвикващи грешки, не отразяват обичайната употреба, при която фактологичните грешки са по-редки. Резултатите не са коригирани спрямо дължината, но тестовете ни с различна многословност показаха почти пълна липса на зависимост от дължината на отговора.
Тази година Агентите за програмиране започнаха да се справят със задачи с невиждани досега сложност, обхват и продължителност. В OpenAI вътрешното ни използване нарасна експоненциално. Изчислено по цените на API, дневното потребление на токени надхвърля $600 за изследователя на медианното ниво и $7000 за изследователите в 90-ия персентил (Ускоряване на изследванията: поглед отвътре към OpenAI). Когато Агентите за програмиране поемат по-дълги и по-взискателни задачи, цената на продължителното използване става все по-важна. GPT‑6 Sol и Luna съчетават висока производителност при програмиране с по-ниски цени на API, като дават на разработчиците повече възможности за итерации, а на екипите — увереност да възлагат по-амбициозни задачи на Codex.
В FrontierCode, който оценява дали Агентите за програмиране създават промени, готови за сливане в реални кодови бази, GPT‑6 Sol значително превъзхожда GPT‑5.6 Sol и се изравнява с Claude Fable 5.1 при много високо усилие, но на много по-ниска цена.
В FrontierCode 1.1 Main(отваря се в нов прозорец) Агентите с ИИ пишат код, който се оценява не само за коректност, но и за „готовност за сливане“ — например качество на тестовете, придържане към обхвата, стил на кода и спазване на стандартите на кодовата база.
В DeepSWE v1.1, който проверява производителността при сложни задачи по софтуерно инженерство в реални кодови бази, GPT‑6 Sol при максимално усилие постига 68,8% — само с 1,1 процентни пункта под най-високия резултат на Claude Fable 5 в оценяването, 69,9% при много високо усилие — при приблизително 80% по-ниска цена за задача.
GPT‑6 Luna при максимално усилие постига 66,6% — резултат, сравним с Claude Opus 5 и Fable 5 при средно усилие. В тези сравнения Luna струва с 93% по-малко на задача от Opus 5 и с 96% по-малко от Fable 5.
В DeepSWE 1.1(отваря се в нов прозорец) Агентите с ИИ решават оригинални дългосрочни задачи по софтуерно инженерство.
Макар GPT‑6 Astra да остава най-добрият модел в света за работа с компютър, GPT‑6 Sol и Luna предлагат по-добра ценова ефективност от предшествениците си. В офлайн набора на OSWorld 2.0 GPT‑6 Sol при много високо усилие постига резултат, сходен с този на Claude Opus 5 при средно усилие — 60,5% спрямо 60,3% — при приблизително 80% по-ниска цена за задача. GPT‑6 Luna (Максимално) превъзхожда GPT‑5.6 Sol (Средно) при една десета от цената му.
В OSWorld 2.0(отваря се в нов прозорец) Агентите с ИИ изпълняват дългосрочни работни процеси на компютър, обхващащи ежедневни и професионални задачи. Отчитаме частичната награда за офлайн набора от версия v2026.08.08.
Пренесохме подобрения стил на комуникация на GPT‑6 Astra и в Sol и Luna. Смятаме, че това ще се забелязва особено ясно в техническите разговори и тези за програмиране. Очаквайте повече яснота, по-малко жаргон и странни формулировки, по-малко подробности с ниска стойност и като цяло малко по-кратки отговори без загуба на съдържание.
Макар стилът да е субективен, тук предпочитаме отговора на GPT‑6 Sol. Той не прибързва толкова със заключенията, не повтаря излишно подробности, които вероятно са очевидни за питащия (например че уебсайтът има четири страници), използва по-малко неясни изрази (например „усещане за бенто“, „преоформяне… около тази система“), по-открито посочва какво е проверил и какво не и не споделя ненужно подробности за реализацията, като подканата към инструмента за изображения.
Наред с по-ниските цени на токените помагаме на разработчиците, които създават решения с GPT‑6, да спестяват повече от контекста, използван повторно от приложенията им. Подобрихме кеширането на подкани за GPT‑6, за да осигурим по подразбиране по-висок дял на попаденията в кеша. Така Агентите могат да използват повторно повече контекст, да отговарят по-бързо и да се възползват от 90% отстъпка при четене на кеширани входни токени.
Разработчиците разполагат и с повече начини да измерват и оптимизират ефективността на кеширането:
Наблюдение и диагностика. Таблото за кеширане на подкани(отваря се в нов прозорец) показва каква част от входа е кеширана и как това се променя с времето. Инструментът за диагностика(отваря се в нов прозорец) помага да се установят пропуснатите възможности за кеширане и необходимите корекции.
Променяйте усилието за структурирано анализиране и наличността на инструментите, без да нарушавате кеша. Увеличавайте усилието за структурирано анализиране(отваря се в нов прозорец) при по-трудни задачи или го намалявайте при по-лесни последващи въпроси и активирайте или деактивирайте инструменти(отваря се в нов прозорец) според променящите се нужди на вашия Агент. И двете настройки вече запазват по-ранния контекст за повторно използване на кеша.
Оптимизирайте кои префикси да се кешират. Изричните точки на прекъсване позволяват на разработчиците да избират къде да завършват кешираните префикси на подканите. Това дава на разработчиците повече контрол върху повторното използване на кеша и може да подобри производителността.
GitHub съобщава, че през последните няколко месеца тези подобрения са намалили с над 50% дела на токените от подкани, които изискват нова обработка, в милиарди заявки към модели на OpenAI, помагайки на Copilot да отговаря по-бързо.
GPT‑6 Sol и Luna надграждат работата по съгласуването, представена с Astra — най-добре съгласувания ни модел досега. В оценяванията ни за съгласуване Sol и Luna показват подобрения спрямо съответните си версии GPT‑5.6, включително по-нисък дял на подвеждащите твърдения за извършената от тях работа по програмиране.
Оценяванията по-долу умишлено проверяват трудни ситуации и не измерват дела на неуспехите при обичайна употреба. Вижте картата на системата(отваря се в нов прозорец) за пълните резултати.
От днес GPT‑6 Sol и GPT‑6 Luna са налични в ChatGPT Work и Codex за всички потребители на Plus, Pro, Business, Enterprise и Edu. Потребителите на Free и Go имат достъп до GPT‑6 Luna в настолното приложение. Тези модели все още не са налични в Chat. В API на OpenAI те са налични като gpt-6-sol и gpt-6-luna.
За да запазим услугата стабилна за всички, планираме да пускаме тези модели в ChatGPT постепенно през деня. Ако не виждате новите модели в ChatGPT Work или Codex, опитайте отново по-късно.
Оценяванията на GPT бяха извършени в нашата изследователска среда или чрез нашия API, които поради разлики в системните подкани, наличните инструменти и други фактори може да дават малко по-различни резултати от продукционната версия на ChatGPT. Оценяванията на конкурентни модели са взети от публично достъпни доклади. Когато липсваха резултати за Claude Fable 5.1, бяха посочени резултатите за Claude Fable 5.


