Ви ги претставуваме GPT‑6 Sol и Luna
Повеќе начини да внесете гранична интелигенција во секојдневната работа.
Претходно овој месец го претставивме GPT‑6 Astra, најинтелигентниот и најусогласениот модел во светот. Иако за најсложените и најважните проекти сè уште е неопходна целосната моќ на Astra, работата се одвива во различни размери, ритми и буџети.
Затоа го прошируваме светот на GPT‑6 со GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra воведе нова генерација интелигенција, а овие модели помагаат придобивките од неа да станат подостапни со поместување на границите на економичноста. Ги обучивме GPT‑6 Sol и Luna со методи слични на оние за GPT‑6 Astra, пренесувајќи ги достигнувањата што стојат зад врвните резултати на Astra во професионалната работа, фактичката точност, програмирањето, користењето компјутер и усогласувањето во побрзи и подостапни модели.
Моделите GPT‑6 предводат низ целиот сооднос меѓу цената и интелигенцијата, комбинирајќи исклучителни способности на секое ниво со инфраструктура што ги испорачува ефикасно и во голем обем. Подобрувањата во кеширањето и изведувањето заклучоци ни овозможуваат да ги нудиме овие модели по пониска цена, а заштедата директно им ја пренесуваме на корисниците и клиентите така што ги намалуваме цените за API за Sol и Luna за 50% во споредба со нивните промотивни цени за GPT‑5.6. Заедно, овие подобрувања ја прават напредната вештачка интелигенција практична за повеќе секојдневни задачи и примени во голем обем.
Модел | Влез | Излез | Намалување на цената |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% поевтино |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% поевтино |
Цените се за 1 милион токени.
GPT‑6 Astra и понатаму е нашиот најдобар модел во сите категории. Изберете го кога сакате најдобри резултати и искуство без компромиси.
GPT‑6 Sol и Luna носат подобра интелигенција и економичност во моделите што веќе ги познавате и користите, особено кај способностите што се најкорисни за извршување сложена работа.
GPT‑6 Sol може да извршува тешки работни задачи, а повисоките ограничувања за користење и пониската цена ви даваат повеќе простор за усовршување. Воедно нуди поголема интелигенција и подобри резултати од конкурентските модели со слична цена.
На AutomationBench, тест за деловни работни текови низ повеќе апликации, GPT‑6 Sol со напор xhigh го надминува Claude Opus 5 со напор Max, со само 9% од трошокот на Opus 5 по задача. Со високо ниво на напор, GPT‑6 Luna го подобрува резултатот на својот претходник за 5,4 процентни поени, со 58% понизок трошок по задача.
Во AutomationBench 1.0.6(се отвора во нов прозорец), агентите со вештачка интелигенција се тестираат на целосни работни текови со 47 алатки во продажбата, маркетингот, операциите, поддршката, финансиите и човечките ресурси. Податочната точка за Claude Fable 5.1 го прикажува неговиот реален трошок како понизок, бидејќи не го вклучува трошокот за резервните активирања на Opus 5, кои се случиле кај околу 40% од задачите.
GPT‑6 Sol го надминува и Claude Fable 5.1 по многу пониска цена, па дури е подобар и од GPT‑6 Astra со ниско ниво на напор.
Модел (и ниво на напор) | Резултат | Трошок по задача |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (ниско) | 30.3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (макс.) | 26.9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 со резервен Opus 5 (макс.) | 31.4% | >8.9x GPT‑6 Sol (трошокот за резервниот модел не е наведен) |
На Agents’ Last Exam, кој ги оценува агентите во сложени професионални работни текови, GPT‑6 Sol со напор Max постигнува 56,4%, над највисокиот резултат на Claude Opus 5 во оценувањето, со 60% понизок трошок по задача.
Во Agents’ Last Exam V1(се отвора во нов прозорец), агентите со вештачка интелигенција се оценуваат на долготрајни, економски вредни задачи од 55 потсектори, кои ги опфаќаат повеќето главни области на професионална работа што се извршува на компјутер.
Корисноста на одговорот зависи од точноста на фактите, а ние продолжуваме да ја подобруваме фактичката веродостојност. Во нашето внатрешно оценување на фактичката точност, засновано на деидентификувани разговори од реалниот свет во кои корисниците означиле грешки на нашите модели, GPT‑6 Sol прави приближно половина помалку грешки од својот претходник и се приближува до веродостојноста на Astra по многу пониска цена. GPT‑6 Luna исто така значително се подобрува; при повисоки нивоа на напор се изедначува со GPT‑5.6 Sol по приближно една стотинка од неговата цена.
Овде ја оценуваме фактичката точност врз деидентификувани разговори во ChatGPT во кои корисниците означиле фактичка грешка од претходен модел. Овие разговори што предизвикуваат грешки не ја претставуваат вообичаената употреба, при која фактичките грешки се поретки. Резултатите не се контролирани според должината; сепак, нашите тестови со различна опширност покажаа речиси никаква зависност од должината на одговорот.
Оваа година, агентите за програмирање почнаа да решаваат задачи со поголема сложеност, опсег и времетраење од кога било досега. Во OpenAI, нашето внатрешно користење порасна експоненцијално. Пресметано според цените за API, дневната употреба на токени надмина 600 $ кај медијалниот истражувач и 7.000 $ кај истражувачите во 90-тиот перцентил (Забрзување на истражувањето: поглед однатре во OpenAI). Како што агентите за програмирање преземаат подолги и посложени задачи, трошокот за континуирано користење станува поважен. GPT‑6 Sol и Luna комбинираат одлични резултати во програмирањето со пониски цени за API, давајќи им на програмерите повеќе простор за усовршување, а на тимовите сигурност да бидат поамбициозни во задачите што му ги доверуваат на Codex.
На FrontierCode, кој оценува дали агентите за програмирање создаваат промени подготвени за спојување во реални кодни бази, GPT‑6 Sol значително го надминува GPT‑5.6 Sol и може да се изедначи со Claude Fable 5.1 со напор xhigh по многу пониска цена.
Во FrontierCode 1.1 Main(се отвора во нов прозорец), агентите со вештачка интелигенција пишуваат код што се оценува не само според точноста, туку и според „подготвеноста за спојување“, на пример, квалитетот на тестовите, дисциплината во опсегот, стилот на кодот и почитувањето на стандардите на кодната база.
На DeepSWE v1.1, кој ги тестира резултатите на сложени задачи од софтверското инженерство во реални кодни бази, GPT‑6 Sol со напор Max постигнува 68,8%, односно е на 1,1 процентен поен од највисокиот резултат на Claude Fable 5 во оценувањето — 69,9% со напор xhigh — со приближно 80% понизок трошок по задача.
GPT‑6 Luna со напор Max постигнува 66,6%, што е споредливо со Claude Opus 5 и Fable 5 со средно ниво на напор. Во овие споредби, Luna чини 93% помалку по задача од Opus 5 и 96% помалку од Fable 5.
Во DeepSWE 1.1(се отвора во нов прозорец), агентите со вештачка интелигенција решаваат оригинални, долготрајни задачи од софтверското инженерство.
Иако GPT‑6 Astra и понатаму е најдобриот модел во светот за користење компјутер, GPT‑6 Sol и Luna нудат поекономични резултати од своите претходници. На OSWorld 2.0 offline, GPT‑6 Sol со напор xhigh постигнува резултат сличен на Claude Opus 5 со средно ниво на напор — 60,5% наспроти 60,3% — со приближно 80% понизок трошок по задача. GPT‑6 Luna (макс.) го надминува GPT‑5.6 Sol (средно) со една десеттина од неговиот трошок.
Во OSWorld 2.0(се отвора во нов прозорец), агентите со вештачка интелигенција се обидуваат да извршат долготрајни работни текови со користење компјутер, кои опфаќаат секојдневни и професионални задачи. Го прикажуваме делумниот резултат на офлајн збирката од изданието v2026.08.08.
Подобрениот стил на комуникација од GPT‑6 Astra го пренесовме и во Sol и Luna, а сметаме дека тоа ќе биде особено забележливо во техничките разговори и разговорите за програмирање. Очекувајте поголема јасност, помалку жаргон и необични изрази, помалку детали со мала вредност и, во целина, малку пократки одговори без загуба на суштината.
Иако стилот е субјективен, овде го претпочитаме одговорот на GPT‑6 Sol. Тој не избрзува толку со заклучоци, троши помалку време на повторување детали што можеби му се очигледни на лицето кое прашува (на пример, дека веб-локацијата има четири страници), користи помалку неодреден јазик (на пример, „изглед на бенто“, „преобликување... околу тој систем“), поотворено кажува што проверил, а што не, и не споделува непотребни детали за имплементацијата, како што е промптот за алатката за слики.
Покрај пониските цени за токени, им помагаме на програмерите што градат со GPT‑6 да заштедат повеќе на контекстот што повторно го користат нивните апликации. Го подобривме кеширањето промпт за GPT‑6 за стандардно да обезбедува повисоки стапки на пронаоѓање во кешот, помагајќи им на агентите повторно да користат повеќе контекст, да одговараат побрзо и да добијат попуст од 90% за читање кеширани влезни токени.
Програмерите имаат и повеќе начини да ги мерат и оптимизираат резултатите од кеширањето:
Следење и дијагностицирање. Контролната табла за кеширање промпт(се отвора во нов прозорец) покажува колкав дел од влезот е кеширан и како тоа се менува со текот на времето. Алатката за дијагностика(се отвора во нов прозорец) помага да се објаснат пропуштените можности за кеширање и што треба да се поправи.
Приспособете го напорот за расудување и достапноста на алатките без да го нарушите кешот. Зголемете го напорот за расудување(се отвора во нов прозорец) за потешки задачи или намалете го за поедноставни дополнителни прашања и овозможувајте или оневозможувајте алатки(се отвора во нов прозорец) според променливите потреби на вашиот агент. Двете контроли сега го зачувуваат претходниот контекст за повторно користење на кешот.
Оптимизирајте кои префикси ќе се кешираат. Експлицитните точки на прекин им овозможуваат на програмерите да изберат каде завршуваат кешираните префикси на промптот. Ова им дава на програмерите поголема контрола врз повторното користење на кешот и може да ги подобри резултатите.
GitHub известува дека во изминатите неколку месеци овие подобрувања го намалиле за повеќе од 50% уделот на токени од промптот што бараат нова обработка, низ милијарди барања до моделите на OpenAI, помагајќи му на Copilot да одговара побрзо.
GPT‑6 Sol и Luna ја надградуваат работата на усогласувањето воведена со Astra, нашиот најусогласен модел досега. Во нашите оценувања на усогласувањето, и Sol и Luna покажуваат подобрувања во однос на своите пандани од GPT‑5.6, вклучувајќи и пониски стапки на погрешни тврдења за нивната работа на програмирање.
Оценувањата подолу намерно тестираат предизвикувачки ситуации и не ги мерат стапките на неуспех при вообичаена употреба. Погледнете ја системската картичка(се отвора во нов прозорец) за целосните резултати.
GPT‑6 Sol и GPT‑6 Luna од денес се достапни во ChatGPT Work и Codex за сите корисници на Plus, Pro, Business, Enterprise и Edu. Корисниците на Free и Go можат да пристапат до GPT‑6 Luna во апликацијата за компјутер. Овие модели сè уште не се достапни во Chat. Во OpenAI API, достапни се како gpt-6-sol и gpt-6-luna.
За услугата да остане стабилна за сите, планираме постепено да ги воведуваме овие модели во ChatGPT во текот на денот. Ако не ги гледате новите модели во ChatGPT Work или Codex, обидете се повторно подоцна.
Оценувањата на GPT беа извршени во нашата истражувачка средина или преку нашиот API, што може да даде малку поинаков излез од продукцискиот ChatGPT поради разлики во системските промптови, достапните алатки и друго. Оценувањата на конкурентските модели се преземени од јавно достапни извештаи. Резултатите за Claude Fable 5 беа наведени кога немаше достапни резултати за Claude Fable 5.1.


