Прескокни до главната содржина
OpenAI

Ви ги претставуваме GPT‑6 Sol и Luna

Повеќе начини да внесете гранична интелигенција во секојдневната работа.

Се вчитува...

Претходно овој месец го претставивме GPT‑6 Astra, најинтелигентниот и најусогласениот модел во светот. Иако за најсложените и најважните проекти сè уште е неопходна целосната моќ на Astra, работата се одвива во различни размери, ритми и буџети.

Затоа го прошируваме светот на GPT‑6 со GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra воведе нова генерација интелигенција, а овие модели помагаат придобивките од неа да станат подостапни со поместување на границите на економичноста. Ги обучивме GPT‑6 Sol и Luna со методи слични на оние за GPT‑6 Astra, пренесувајќи ги достигнувањата што стојат зад врвните резултати на Astra во професионалната работа, фактичката точност, програмирањето, користењето компјутер и усогласувањето во побрзи и подостапни модели.

Моделите GPT‑6 предводат низ целиот сооднос меѓу цената и интелигенцијата, комбинирајќи исклучителни способности на секое ниво со инфраструктура што ги испорачува ефикасно и во голем обем. Подобрувањата во кеширањето и изведувањето заклучоци ни овозможуваат да ги нудиме овие модели по пониска цена, а заштедата директно им ја пренесуваме на корисниците и клиентите така што ги намалуваме цените за API за Sol и Luna за 50% во споредба со нивните промотивни цени за GPT‑5.6. Заедно, овие подобрувања ја прават напредната вештачка интелигенција практична за повеќе секојдневни задачи и примени во голем обем.

Цени за GPT‑6 API

Модел

Влез

Излез

Намалување на цената

GPT‑6 Sol
наспроти GPT‑5.6 Sol

$4 → $2

$20 → $10

50% поевтино

GPT‑6 Luna
наспроти GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% поевтино

Цените се за 1 милион токени.

GPT‑6 Astra и понатаму е нашиот најдобар модел во сите категории. Изберете го кога сакате најдобри резултати и искуство без компромиси.

Подобрување на целото семејство модели

GPT‑6 Sol и Luna носат подобра интелигенција и економичност во моделите што веќе ги познавате и користите, особено кај способностите што се најкорисни за извршување сложена работа.

Професионална работа

GPT‑6 Sol може да извршува тешки работни задачи, а повисоките ограничувања за користење и пониската цена ви даваат повеќе простор за усовршување. Воедно нуди поголема интелигенција и подобри резултати од конкурентските модели со слична цена.

На AutomationBench, тест за деловни работни текови низ повеќе апликации, GPT‑6 Sol со напор xhigh го надминува Claude Opus 5 со напор Max, со само 9% од трошокот на Opus 5 по задача. Со високо ниво на напор, GPT‑6 Luna го подобрува резултатот на својот претходник за 5,4 процентни поени, со 58% понизок трошок по задача.

Во AutomationBench 1.0.6⁠(се отвора во нов прозорец), агентите со вештачка интелигенција се тестираат на целосни работни текови со 47 алатки во продажбата, маркетингот, операциите, поддршката, финансиите и човечките ресурси. Податочната точка за Claude Fable 5.1 го прикажува неговиот реален трошок како понизок, бидејќи не го вклучува трошокот за резервните активирања на Opus 5, кои се случиле кај околу 40% од задачите.

GPT‑6 Sol го надминува и Claude Fable 5.1 по многу пониска цена, па дури е подобар и од GPT‑6 Astra со ниско ниво на напор.

Модел (и ниво на напор)

Резултат

Трошок по задача

GPT‑6 Sol (xhigh)

33.2%

$0.27

GPT‑6 Astra (ниско)

30.3%

3.9x GPT‑6 Sol

Claude Opus 5 (макс.)

26.9%

11.1x GPT‑6 Sol

Claude Fable 5.1 со резервен Opus 5 (макс.)

31.4%

>8.9x GPT‑6 Sol

(трошокот за резервниот модел не е наведен)

На Agents’ Last Exam, кој ги оценува агентите во сложени професионални работни текови, GPT‑6 Sol со напор Max постигнува 56,4%, над највисокиот резултат на Claude Opus 5 во оценувањето, со 60% понизок трошок по задача.

Во Agents’ Last Exam V1⁠(се отвора во нов прозорец), агентите со вештачка интелигенција се оценуваат на долготрајни, економски вредни задачи од 55 потсектори, кои ги опфаќаат повеќето главни области на професионална работа што се извршува на компјутер.

Фактичка точност

Корисноста на одговорот зависи од точноста на фактите, а ние продолжуваме да ја подобруваме фактичката веродостојност. Во нашето внатрешно оценување на фактичката точност, засновано на деидентификувани разговори од реалниот свет во кои корисниците означиле грешки на нашите модели, GPT‑6 Sol прави приближно половина помалку грешки од својот претходник и се приближува до веродостојноста на Astra по многу пониска цена. GPT‑6 Luna исто така значително се подобрува; при повисоки нивоа на напор се изедначува со GPT‑5.6 Sol по приближно една стотинка од неговата цена.

Овде ја оценуваме фактичката точност врз деидентификувани разговори во ChatGPT во кои корисниците означиле фактичка грешка од претходен модел. Овие разговори што предизвикуваат грешки не ја претставуваат вообичаената употреба, при која фактичките грешки се поретки. Резултатите не се контролирани според должината; сепак, нашите тестови со различна опширност покажаа речиси никаква зависност од должината на одговорот.

Програмирање

Оваа година, агентите за програмирање почнаа да решаваат задачи со поголема сложеност, опсег и времетраење од кога било досега. Во OpenAI, нашето внатрешно користење порасна експоненцијално. Пресметано според цените за API, дневната употреба на токени надмина 600 $ кај медијалниот истражувач и 7.000 $ кај истражувачите во 90-тиот перцентил (Забрзување на истражувањето: поглед однатре во OpenAI⁠). Како што агентите за програмирање преземаат подолги и посложени задачи, трошокот за континуирано користење станува поважен. GPT‑6 Sol и Luna комбинираат одлични резултати во програмирањето со пониски цени за API, давајќи им на програмерите повеќе простор за усовршување, а на тимовите сигурност да бидат поамбициозни во задачите што му ги доверуваат на Codex.

На FrontierCode, кој оценува дали агентите за програмирање создаваат промени подготвени за спојување во реални кодни бази, GPT‑6 Sol значително го надминува GPT‑5.6 Sol и може да се изедначи со Claude Fable 5.1 со напор xhigh по многу пониска цена.

Во FrontierCode 1.1 Main⁠(се отвора во нов прозорец), агентите со вештачка интелигенција пишуваат код што се оценува не само според точноста, туку и според „подготвеноста за спојување“, на пример, квалитетот на тестовите, дисциплината во опсегот, стилот на кодот и почитувањето на стандардите на кодната база.

На DeepSWE v1.1, кој ги тестира резултатите на сложени задачи од софтверското инженерство во реални кодни бази, GPT‑6 Sol со напор Max постигнува 68,8%, односно е на 1,1 процентен поен од највисокиот резултат на Claude Fable 5 во оценувањето — 69,9% со напор xhigh — со приближно 80% понизок трошок по задача.

GPT‑6 Luna со напор Max постигнува 66,6%, што е споредливо со Claude Opus 5 и Fable 5 со средно ниво на напор. Во овие споредби, Luna чини 93% помалку по задача од Opus 5 и 96% помалку од Fable 5.

Во DeepSWE 1.1⁠(се отвора во нов прозорец), агентите со вештачка интелигенција решаваат оригинални, долготрајни задачи од софтверското инженерство.

Користење компјутер

Иако GPT‑6 Astra и понатаму е најдобриот модел во светот за користење компјутер, GPT‑6 Sol и Luna нудат поекономични резултати од своите претходници. На OSWorld 2.0 offline, GPT‑6 Sol со напор xhigh постигнува резултат сличен на Claude Opus 5 со средно ниво на напор — 60,5% наспроти 60,3% — со приближно 80% понизок трошок по задача. GPT‑6 Luna (макс.) го надминува GPT‑5.6 Sol (средно) со една десеттина од неговиот трошок.

Во OSWorld 2.0⁠(се отвора во нов прозорец), агентите со вештачка интелигенција се обидуваат да извршат долготрајни работни текови со користење компјутер, кои опфаќаат секојдневни и професионални задачи. Го прикажуваме делумниот резултат на офлајн збирката од изданието v2026.08.08.

Стил на соработка

Подобрениот стил на комуникација од GPT‑6 Astra го пренесовме и во Sol и Luna, а сметаме дека тоа ќе биде особено забележливо во техничките разговори и разговорите за програмирање. Очекувајте поголема јасност, помалку жаргон и необични изрази, помалку детали со мала вредност и, во целина, малку пократки одговори без загуба на суштината.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Иако стилот е субјективен, овде го претпочитаме одговорот на GPT‑6 Sol. Тој не избрзува толку со заклучоци, троши помалку време на повторување детали што можеби му се очигледни на лицето кое прашува (на пример, дека веб-локацијата има четири страници), користи помалку неодреден јазик (на пример, „изглед на бенто“, „преобликување... околу тој систем“), поотворено кажува што проверил, а што не, и не споделува непотребни детали за имплементацијата, како што е промптот за алатката за слики.

Подобро кеширање за агенти и долги разговори

Покрај пониските цени за токени, им помагаме на програмерите што градат со GPT‑6 да заштедат повеќе на контекстот што повторно го користат нивните апликации. Го подобривме кеширањето промпт за GPT‑6 за стандардно да обезбедува повисоки стапки на пронаоѓање во кешот, помагајќи им на агентите повторно да користат повеќе контекст, да одговараат побрзо и да добијат попуст од 90% за читање кеширани влезни токени.

Програмерите имаат и повеќе начини да ги мерат и оптимизираат резултатите од кеширањето:

GitHub известува дека во изминатите неколку месеци овие подобрувања го намалиле за повеќе од 50% уделот на токени од промптот што бараат нова обработка, низ милијарди барања до моделите на OpenAI, помагајќи му на Copilot да одговара побрзо.

Продолжуваме да го подобруваме усогласувањето

GPT‑6 Sol и Luna ја надградуваат работата на усогласувањето воведена со Astra, нашиот најусогласен модел досега. Во нашите оценувања на усогласувањето, и Sol и Luna покажуваат подобрувања во однос на своите пандани од GPT‑5.6, вклучувајќи и пониски стапки на погрешни тврдења за нивната работа на програмирање.

Оценувањата подолу намерно тестираат предизвикувачки ситуации и не ги мерат стапките на неуспех при вообичаена употреба. Погледнете ја системската картичка⁠(се отвора во нов прозорец) за целосните резултати.

Достапност

GPT‑6 Sol и GPT‑6 Luna од денес се достапни во ChatGPT Work и Codex за сите корисници на Plus, Pro, Business, Enterprise и Edu. Корисниците на Free и Go можат да пристапат до GPT‑6 Luna во апликацијата за компјутер. Овие модели сè уште не се достапни во Chat. Во OpenAI API, достапни се како gpt-6-sol и gpt-6-luna.

За услугата да остане стабилна за сите, планираме постепено да ги воведуваме овие модели во ChatGPT во текот на денот. Ако не ги гледате новите модели во ChatGPT Work или Codex, обидете се повторно подоцна.


Оценувањата на GPT беа извршени во нашата истражувачка средина или преку нашиот API, што може да даде малку поинаков излез од продукцискиот ChatGPT поради разлики во системските промптови, достапните алатки и друго. Оценувањата на конкурентските модели се преземени од јавно достапни извештаи. Резултатите за Claude Fable 5 беа наведени кога немаше достапни резултати за Claude Fable 5.1.

Автор

OpenAI