Негізгі мазмұнға өту
OpenAI

GPT‑6 Sol және Luna модельдерін таныстырамыз

Озық интеллектіні күнделікті жұмысыңызға енгізудің жаңа жолдары.

Жүктелуде…

Осы айдың басында біз әлемдегі ең ақылды әрі мақсаттарымызбен барынша үйлесімді GPT‑6 Astra моделін таныстырдық. Ең күрделі әрі маңызды жобаларға әлі де Astra-ның бүкіл әлеуеті қажет, алайда жұмыстың ауқымы, қарқыны мен бюджеті әртүрлі болады.

Сондықтан GPT‑6 топтамасын GPT‑6 Sol және GPT‑6 Luna модельдерімен кеңейтіп жатырмыз. GPT‑6 Astra интеллекттің жаңа буынын ұсынды, ал бұл модельдер шығын тиімділігін жаңа деңгейге көтеріп, сол интеллекттің артықшылықтарын кеңінен қолжетімді етеді. GPT‑6 Sol мен Luna модельдерін GPT‑6 Astra-ға ұқсас әдістермен үйреттік. Осылайша Astra-ның кәсіби жұмыс, дерек дәлдігі, кодтау, компьютерді пайдалану және мақсаттармен үйлесімділік салаларындағы озық нәтижелеріне негіз болған жетістіктер жылдамырақ әрі қолжетімдірек модельдерге енгізілді.

GPT‑6 модельдері шығын мен интеллект арақатынасы бойынша көш бастап, әр деңгейдегі ерекше мүмкіндіктерді оларды ауқымды түрде тиімді ұсынатын инфрақұрылыммен үйлестіреді. Кэштеу мен инференсті жетілдіру бұл модельдерді төменірек шығынмен ұсынуға мүмкіндік берді. Осы үнемді пайдаланушылар мен клиенттерге тікелей беру үшін Sol және Luna API бағаларын GPT‑5.6 жарнамалық бағаларымен салыстырғанда 50%-ға төмендеттік. Осы жетілдірулердің арқасында озық ЖИ күнделікті тапсырмалар мен ауқымды қолданбалар үшін анағұрлым тиімді шешімге айналады.

GPT‑6 API бағалары

Модель

Кіріс

Шығыс

Бағаның төмендеуі

GPT‑6 Sol
және GPT‑5.6 Sol

4 АҚШ доллары → 2 АҚШ доллары

20 АҚШ доллары → 10 АҚШ доллары

50% арзан

GPT‑6 Luna
және GPT‑5.6 Luna

0,20 АҚШ доллары → 0,10 АҚШ доллары

1,20 АҚШ доллары → 0,50 АҚШ доллары

50% арзан

Бағалар 1 миллион токенге көрсетілген.

GPT‑6 Astra барлық көрсеткіш бойынша үздік моделіміз болып қала береді. Ең үздік нәтиже мен еш ымырасыз жұмыс тәжірибесі қажет болса, осы модельді таңдаңыз.

Модельдер топтамасындағы жаңа деңгей

GPT‑6 Sol және Luna күрделі жұмысты орындауға ең пайдалы мүмкіндіктері бар өзіңіз білетін әрі қолданып жүрген модельдерге жетілдірілген интеллект пен шығын тиімділігін әкеледі.

Кәсіби жұмыс

GPT‑6 Sol күрделі жұмыс тапсырмаларын орындай алады. Жоғары пайдалану лимиттері мен төмен шығын бірнеше рет жетілдіруге көбірек мүмкіндік береді, ал бағасы ұқсас бәсекелес модельдермен салыстырғанда ойлау қабілеті жоғары әрі нәтижесі жақсы.

Қолданбалар арасындағы бизнес үдерістерді сынайтын AutomationBench бағалауында өте жоғары күш жұмсайтын GPT‑6 Sol максималды күш жұмсайтын Claude Opus 5 моделінен озып, бір тапсырмаға Opus 5 шығынының небәрі 9%-ын жұмсайды. Жоғары күш жұмсау деңгейінде GPT‑6 Luna алдыңғы нұсқасынан 5,4 пайыздық тармаққа озып, бір тапсырмаға 58% аз шығын жұмсайды.

AutomationBench 1.0.6⁠(жаңа терезеде ашылады) бағалауында ЖИ агенттері сату, маркетинг, операциялар, қолдау, қаржы және кадр салаларындағы 47 құралды пайдаланып, толық жұмыс үдерістерінен өтеді. Claude Fable 5.1 дерек нүктесі оның нақты құнын төмен көрсетеді, өйткені тапсырмалардың шамамен 40%-ында қолданылған Opus 5 резервінің құны есепке алынбаған.

GPT‑6 Sol әлдеқайда аз шығынмен Claude Fable 5.1 моделінен де озады, тіпті төмен күш жұмсау деңгейіндегі GPT‑6 Astra-ны да басып түседі.

Модель (және күш жұмсау деңгейі)

Нәтиже

Бір тапсырманың құны

GPT‑6 Sol (өте жоғары)

33,2%

0,27 АҚШ доллары

GPT‑6 Astra (төмен)

30,3%

GPT‑6 Sol-дан 3,9 есе қымбат

Claude Opus 5 (максималды)

26,9%

GPT‑6 Sol-дан 11,1 есе қымбат

Opus 5 резерві бар Claude Fable 5.1 (максималды)

31,4%

GPT‑6 Sol-дан >8,9 есе қымбат

(резерв құны көрсетілмеген)

Агенттерді күрделі кәсіби жұмыс үдерістерінде бағалайтын Agents’ Last Exam сынағында максималды күш жұмсайтын GPT‑6 Sol 56,4% нәтиже көрсетіп, бір тапсырмаға 60% аз шығынмен Claude Opus 5 моделінің осы бағалаудағы ең жоғары нәтижесінен озады.

Agents’ Last Exam V1⁠(жаңа терезеде ашылады) бағалауында ЖИ агенттері компьютерде орындалатын кәсіби жұмыстың негізгі салаларының көпшілігін қамтитын 55 ішкі саладағы ұзақ мерзімді әрі экономикалық құнды тапсырмалар бойынша бағаланады.

Дерек дәлдігі

Жауаптың пайдалылығы деректердің дұрыстығына байланысты, сондықтан біз дерек сенімділігін одан әрі арттырып жатырмыз. Пайдаланушылар модельдеріміздің қателерін белгілеген, жеке деректері жойылған шынайы әңгімелерге негізделген ішкі дерек дәлдігі бағалауымызда GPT‑6 Sol алдыңғы нұсқасына қарағанда шамамен екі есе аз қате жібереді. Ол әлдеқайда төмен шығынмен Astra деңгейіндегі сенімділікке жақындайды. GPT‑6 Luna да айтарлықтай жақсарды: жоғары күш жұмсау деңгейлерінде ол GPT‑5.6 Sol нәтижесіне шығынның шамамен жүзден бір бөлігімен жетеді.

Мұнда пайдаланушылар алдыңғы модельдің нақты дерек қатесін белгілеген, жеке деректері жойылған ChatGPT әңгімелеріндегі дерек дәлдігін бағалаймыз. Қате тудыратын бұл әңгімелер нақты дерек қателері сирегірек кездесетін қалыпты қолданысты көрсетпейді. Нәтижелер ұзындық бойынша теңестірілмеген, алайда жауап көлемін өзгертіп жүргізген сынақтарымыз нәтиженің жауап ұзындығына тәуелділігі жоқтың қасы екенін көрсетті.

Кодтау

ББиыл кодтау агенттері бұрын-соңды болмаған күрделі, ауқымды әрі ұзақ тапсырмаларды орындай бастады. OpenAI ішіндегі қолданысымыз экспоненциалды түрде өсті. API бағасымен есептегенде, медианалық зерттеушінің күнделікті токен қолданысы 600 АҚШ долларынан, ал 90-процентильдегі зерттеушілердікі 7 000 АҚШ долларынан асты («Зерттеулерді жеделдету: OpenAI ішіндегі көрініс»⁠). Кодтау агенттері ұзағырақ әрі күрделірек тапсырмаларды орындаған сайын, оларды тұрақты пайдалану құнының маңызы артады. GPT‑6 Sol және Luna жоғары кодтау өнімділігін төмен API бағаларымен ұштастырады. Бұл әзірлеушілерге нәтижені бірнеше рет жетілдіруге көбірек мүмкіндік беріп, командалардың Codex-ке өршіл тапсырмаларды сеніммен тапсыруына жол ашады.

Кодтау агенттері нақты код қорларына біріктіруге дайын өзгерістер жасай ала ма, соны бағалайтын FrontierCode сынағында GPT‑6 Sol GPT‑5.6 Sol моделінен айтарлықтай озып, әлдеқайда төмен шығынмен өте жоғары күш жұмсайтын Claude Fable 5.1 нәтижесіне жетеді.

FrontierCode 1.1 Main⁠(жаңа терезеде ашылады) бағалауында ЖИ агенттері жазған код тек дұрыстығы бойынша емес, «біріктіруге жарамдылығы», яғни сынақ сапасы, жұмыс ауқымын сақтау, код стилі және код қорының стандарттарына сәйкестігі бойынша да бағаланады.

Нақты код қорларындағы күрделі бағдарламалық жасақтама инженериясы тапсырмаларын сынайтын DeepSWE v1.1 бағалауында максималды күш жұмсайтын GPT‑6 Sol 68,8% нәтиже көрсетеді. Бұл өте жоғары күш жұмсайтын Claude Fable 5 моделінің бағалаудағы ең жоғары 69,9% нәтижесінен небәрі 1,1 пайыздық тармаққа төмен, ал бір тапсырмаға кететін шығын шамамен 80% аз.

Максималды күш жұмсайтын GPT‑6 Luna 66,6% нәтиже көрсетеді, бұл орташа күш жұмсайтын Claude Opus 5 және Fable 5 нәтижелерімен шамалас. Бұл салыстыруларда Luna бір тапсырмаға Opus 5-тен 93%, ал Fable 5-тен 96% аз шығын жұмсайды.

DeepSWE 1.1⁠(жаңа терезеде ашылады) бағалауында ЖИ агенттері бұрын берілмеген, ұзақ мерзімді бағдарламалық жасақтама инженериясы тапсырмаларын орындайды.

Компьютерді пайдалану

GPT‑6 Astra компьютерді пайдалану бойынша әлемдегі үздік модель болып қала береді, ал GPT‑6 Sol және Luna алдыңғы нұсқаларына қарағанда шығын тұрғысынан тиімдірек нәтиже ұсынады. OSWorld 2.0 офлайн бағалауында өте жоғары күш жұмсау деңгейіндегі GPT‑6 Sol орташа күш жұмсау деңгейіндегі Claude Opus 5 моделіне ұқсас нәтиже көрсетеді — 60,5% және 60,3%, ал бір тапсырмаға жұмсалатын шығын шамамен 80% аз. GPT‑6 Luna (максималды) GPT‑5.6 Sol (орташа) моделінен он есе аз шығынмен озады.

OSWorld 2.0⁠(жаңа терезеде ашылады) бағалауында ЖИ агенттері күнделікті және кәсіби тапсырмаларды қамтитын ұзақ мерзімді компьютерлік жұмыс үдерістерін орындайды. Біз v2026.08.08 шығарылымының офлайн жиынындағы ішінара сыйақыны көрсетеміз.

Бірлесіп жұмыс істеу мәнері

GPT‑6 Astra-ның жетілдірілген қарым-қатынас мәнерін Sol және Luna модельдеріне де енгіздік. Бұл әсіресе техникалық және кодтау туралы әңгімелерде байқалады деп ойлаймыз. Жауаптар анығырақ, кәсіби жаргон мен оғаш тіркестер аз, пайдасы шамалы егжей-тегжей сирек болады әрі мазмұны сақталған күйде жалпы көлемі сәл қысқарады.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Стиль субъективті болғанымен, бұл жерде GPT‑6 Sol жауабын ұнаттық. Ол асығыс қорытынды жасамайды, сұраушыға түсінікті болуы мүмкін мәліметтерді қайталауға аз уақыт жұмсайды (мысалы, сайтта төрт бет барын), бұлыңғыр тіркестерді аз қолданады (мысалы, «бенто әсері», «сол жүйеге сай қайта қалыптастыру»), нені тексергенін және тексермегенін ашығырақ айтады әрі кескін құралына берген көмексөзі сияқты іске асыру егжей-тегжейін орынсыз бөліспейді.

Агенттер мен ұзақ әңгімелер үшін кэштеуді жетілдіру

Токен бағаларын төмендетумен қатар, GPT‑6 негізінде өнім жасайтын әзірлеушілерге қолданбалары қайта пайдаланатын контекстен көбірек үнемдеуге көмектесіп жатырмыз. GPT‑6 үшін көмексөзді кэштеуді жетілдіріп, әдепкі бойынша кэштен табу жиілігін арттырдық. Бұл агенттерге көбірек контексті қайта пайдалануға, жылдамырақ жауап беруге және кэштелген кіріс токендерін оқу кезінде 90% жеңілдік алуға көмектеседі.

Енді әзірлеушілер кэштеу өнімділігін өлшеп, оңтайландырудың қосымша тәсілдерін пайдалана алады:

GitHub мәліметінше, соңғы бірнеше айда бұл жетілдірулер OpenAI модельдеріне жасалған миллиардтаған сұрауда жаңадан өңдеуді қажет ететін көмексөз токендерінің үлесін 50%-дан астам азайтып, Copilot жұмысының жылдамдауына көмектесті.

Мақсаттармен үйлесімділікті жетілдіруді жалғастыру

GPT‑6 Sol және Luna осы уақытқа дейінгі мақсаттарымызбен барынша үйлесімді Astra моделінде енгізілген жұмыстарға негізделген. Мақсаттармен үйлесімділікті бағалау сынақтарында Sol және Luna модельдері GPT‑5.6 нұсқаларынан жақсы нәтиже көрсетті, соның ішінде кодтау жұмысы туралы жаңылыстыратын мәлімдемелердің жиілігі төмендеді.

Төмендегі бағалаулар күрделі жағдайларды әдейі сынайды және қалыпты қолданыстағы сәтсіздік жиілігін өлшемейді. Толық нәтижелерді жүйе картасынан⁠(жаңа терезеде ашылады) қараңыз.

Қолжетімділік

GPT‑6 Sol және GPT‑6 Luna бүгіннен бастап Plus, Pro, Business, Enterprise және Edu пайдаланушыларының барлығына ChatGPT Жұмыс пен Codex ішінде қолжетімді. Free және Go пайдаланушылары GPT‑6 Luna моделін жұмыс үстелі қолданбасында пайдалана алады. Бұл модельдер Чат ішінде әзірге қолжетімсіз. OpenAI API ішінде олар gpt-6-sol және gpt-6-luna атауларымен қолжетімді.

Қызметтің барлығы үшін тұрақты жұмысын сақтау мақсатында бұл модельдерді ChatGPT ішінде күні бойы біртіндеп іске қосуды жоспарлап отырмыз. Жаңа модельдер ChatGPT Жұмыс немесе Codex ішінде көрінбесе, кейінірек қайталап көріңіз.


GPT бағалаулары зерттеу ортамызда немесе API арқылы жүргізілді. Жүйелік көмексөздер, қолжетімді құралдар және басқа да айырмашылықтарға байланысты олардың нәтижесі өндірістік ChatGPT жауабынан сәл өзгеше болуы мүмкін. Бәсекелес модельдердің бағалаулары жалпыға қолжетімді есептерден алынды. Claude Fable 5.1 нәтижелері қолжетімсіз болғанда, Claude Fable 5 нәтижелері көрсетілді.

Автор

OpenAI