GPT‑5.6 модельдер тобын адамдар модельдерімізді пайдаланатын бүкіл тапсырмалар ауқымында мүмкіндік пен құнды теңгеру үшін әзірледік. Негізгі моделіміз GPT‑5.6 Sol ең жоғары ой қорытуы қосылған кезде Artificial Analysis Coding Agent Index көрсеткіші бойынша Claude Fable 5 моделінен Claude Fable 5 құнының жартысынан аз шығынмен озады. Terra ойлау деңгейі бенчмарктерінде GPT‑5.5‑пен бірдей нәтиже көрсетеді, бірақ бағасы GPT‑5.5 бағасының жартысына тең, ал Luna — бағасы Sol құнынан 80% төмен, ең жылдам әрі қолжетімді моделіміз. Осындай тиімділікке қол жеткізу үшін зерттеу және техникалық топтарымыз стегіміздің әр негізгі қабатын едәуір оңтайландырды. Бұл жақсартулар модельдерімізді, инференсті (шығыс жасау үшін модельдерді қалай іске қосатынымызды) және Codex пен ChatGPT Work екеуі де пайдаланатын агенттік тапсырма ортамызды қамтиды.
Соңғы төрт жылда модельдерімізді 1 миллиард белсенді пайдаланушы мен 2 миллионнан астам кәсіпорын пайдаланатын деңгейге дейін кеңейткен кезде, ойлау деңгейінің игілігін баршаға жеткізуде тиімділік басты рөл атқарды. Миссиямыз — жалпы жасанды интеллектінің бүкіл адамзатқа пайдасын тигізуін қамтамасыз ету. Осы жылдар бойы құн–ойлау деңгейі қисығының әр нүктесінде ең жоғары өнімді модельдерді ұсыну үшін бүкіл стегіміздегі оңтайландыру мүмкіндіктерін үздіксіз кеңейттік. Бір токенге шаққандағы ойлау деңгейі тиімділігінің ең жоғары көрсеткішіне GPT‑5.6 арқылы қол жеткіздік: ол әр токенмен көбірек жұмыс орындауға үйретілген. Үйрету кезінде тапсырманың сәтті орындалуын да, тиімділікті де оңтайландырып, модельді тапсырманы барынша тікелей жолмен орындауға бейімдейміз.
Бұл мақала модельдеріміздің аясынан шығып, стектің тағы екі негізгі бөлігін жетілдіру арқылы тиімділікті қалай қамтамасыз еткенімізді баяндайды: 1) сол жабдықтан көбірек шығыс алу үшін жүктемені теңгеру, спекулятивтік декодтау, кэштеу және ядроларды оңтайландыру секілді процестерді жетілдіретін инференс 2) мәнмәтіннің шамадан тыс ұлғаюын, құралдарды пайдалануды және қайталанатын жұмысты тиімдірек басқаратын агенттік тапсырма ортасы. Сондай-ақ осы жетістіктердің бірнешеуін дербес іске асыруда GPT‑5.6 Sol қандай рөл атқарғанын баяндаймыз. Жекелеген әр жақсарту шағын көрінгенімен, олардың жиынтық әсері ойлау деңгейі мен тиімділіктің екеуінде де озық деңгейге жетуге жол ашады.
Модельдерге сұраныс есептеу қуатынан жылдам өсіп жатқан, ресурсы шектеулі әлемде тиімділік — әр жүйені жобалаудың өзегі. Бұл әсіресе үйретілген модельдерді іске қосып, жауаптар жасайтын инференс стегімізге қатысты. Негізгі мақсатымыз — пайдаланушылар күтетін ойлау деңгейін, кідіріс деңгейін, қолжетімділік пен сенімділікті сақтай отырып, сол жабдықпен көбірек токен өңдеу.
Ол үшін бүкіл жүйені оңтайландыру қажет. Модель жеке алғанда өте тиімді болуы мүмкін, бірақ сұраулар дұрыс бөлінбесе, жабдық бос тұрса немесе дерек тасымалы есептеуді баяулатса, оған қызмет көрсету бәрібір қымбатқа түседі. Әр қабаттағы жақсартулар бірін-бірі күшейтеді: маршруттауды (сұраулар қайда жіберіледі), жоспарлауды (қашан жіберіледі), ядроларды (GPU-ларда орындалатын бағдарламалық код), кэштеуді (сақталып, қайта пайдаланылатын жұмыс) және модельді іске асыруды (GPU кодының орындалу реті) оңтайландыру нәтижесінде тиімділік артады. Codex ішіндегі GPT‑5.6 Sol осы оңтайландырулардың бәрінде шешуші рөл атқарды.
Алғашқы маңызды мысал — жүктемені теңгеру. Жаһандық деңгейде сұрауларды географиялық орналасу, қолжетімді қуат және үдеткіш түрі (модельді іске қосатын GPU немесе мамандандырылған чип түрі) сияқты факторларға қарай бағдарлаймыз. Кластер ішінде жұмысты жүктемеге, мәнмәтін ұзындығына, кэш қолжетімділігіне және сұраудың басқа қасиеттеріне қарай модель даналары арасында бөлеміз. Әр дананың ішінде жұмыс үдеткіштер, модельдің ішкі желілері және есептеу ядролары арасында тиімді бөлінуі керек. Codex ішіндегі GPT‑5.6 Sol өндірістік трафикті талдауға, бұрын ескерілмеген теңгерімсіздік көздерін анықтауға, жаңа бағдарлау стратегияларын сынауға және осы эвристикаларды үздіксіз реттеуге көмектеседі. Жүктемені теңгерудегі осы жақсартулардың өзі модельдерімізге қызмет көрсету құнын айтарлықтай төмендетті.
GPT‑5.6 Sol моделін кірістерді келесі токен болжамдарына түрлендіретін есептеу — модельдің тікелей өтуін оңтайландыру үшін де пайдаландық. Жекелеген операциялар жылдам болғанның өзінде, жадтағы артық дерек тасымалы, синхрондау және деректердің тиімсіз орналасуы GPU-лардың бос тұруына әкелуі мүмкін. Бұған жол бермеу үшін GPT‑5.6 Sol алдын ала есептеуге, орындамай өткізіп жіберуге немесе параллель орындауға болатын жұмыстарды анықтады. Codex көмегімен GPT‑5.6 Sol өндірістік ядроларымызды — модельді құрайтын математикалық операцияларды орындайтын негізгі кодты — дербес қайта жазып, оңтайландырды. Бұған ішінара GPT‑5.6 моделін OpenAI қолдайтын GPU бағдарламалауына арналған ашық бастапқы кодты екі тілде — Triton(жаңа терезеде ашылады) және Gluon(жаңа терезеде ашылады) тілдерінде — ядроларды тиімді жазуға әрі жақсартуға үйретуіміз ықпал етті. Осы жұмыстар GPT‑5.6 Sol енгізген ядролар саласындағы ауқымды жетістіктермен бірге қызмет көрсетудің толық циклдегі шығынын 20%-ға азайтты. GPT‑5.6 Sol жазған ядролардың дұрыстығын тексеруге көмектесу үшін FpSan(жаңа терезеде ашылады) («жылжымалы үтірлі сандарды тексеру құралы») сияқты ашық бастапқы кодты тексеру құралдарына да қомақты инвестиция салдық.
Спекулятивтік декодтау — жылдамдық пен тиімділікті арттырудың тағы бір тәсілі. Бұл әдісте негізгі модельмен қатар кішірек нобайлық («болжамдаушы») модель іске қосылып, негізгі модель қатар тексеретін бірнеше токенді ұсынады. Ұсыныстар қабылданса, жүйе негізгі модельдің бір өтуінен бірнеше шығыс токенін жасап, қымбат тізбекті есептеу көлемін азайтады. GPT‑5.6 Sol өз нобайлық моделінің архитектурасына жүздеген эксперимент жасап, өлшемі, құрылымы мен мүмкіндіктеріндегі өзгерістерді сынау арқылы оны жетілдірді. Сонымен қатар, GPT‑5.6 Sol болжамдаушыны үйрету процесін іске қосып, бақылап отырды және жабдық ақаулары мен үйрету тұрақсыздығы сияқты мәселелер туындағанда дербес араласты. Нәтижесінде токен жасау тиімділігі 15%-дан астам өсті.
Кэштелмеген кіріс токендерін өңдегенде модель кілт-мән (KV) кэшін есептеуді көп қажет ететін бір өтуде құрады; шығыс жасағанда сол кэштен қайта-қайта оқып, оны толықтырады. Топтамалау, шардтау және KV кэшін басқару сияқты қызмет көрсетудің оңтайлы конфигурациясы жұмыс жүктемесіне — көмексөз бен шығыс ұзындығына, топтама өлшеміне, кэшке түсу көрсеткішіне, сұрау сипаттарына және басқа факторларға — қатты тәуелді. Алайда бұрын конфигурациялар кеңістігі жүйелі баптауға тым ауқымды болғандықтан, инженерлер жалпылама эвристикаларға сүйенуге мәжбүр еді. Codex ішіндегі GPT‑5.6 Sol көмегімен өндірістік жұмыс жүктемелерін талдап, ықтимал конфигурацияларды жасап әрі бағалап, әр сценарий үшін қозғалтқыш пен модель конфигурациясын барынша оңтайландырдық. Бұл жұмыс жүктемесіне бейімделген оңтайландырудың жаңа деңгейін іс жүзінде қолдануға және сол жабдықтан көбірек пайдалы инференс нәтижесін алуға мүмкіндік береді.
Инференсті оңтайландыру — үздіксіз кері байланыс циклі. Біз өндірістегі жұмысты өлшеп, ең үлкен олқылықтарды анықтаймыз, өзгерістер енгіземіз және олардың жеке сынақ көрсеткішін ғана емес, бүкіл жүйені жақсартатынын тексереміз. GPT‑5.6 Sol мен Codex осы циклдің әр бөлігін жеделдетеді. Осының арқасында командамыз көбірек идеяны зерттеп, өзгермелі жұмыс жүктемелеріне жылдамырақ жауап бере алады және пайдаланушылар үшін кідірісі мен шығыны төмен, қуаты жоғары инференс стегін жасайды.
ChatGPT Work пен Codex күрделі тапсырмаларды модель сұраулары мен құрал шақыруларының тізбегі арқылы орындайды. Пайдаланушы сұрауынан соңғы жауапқа дейінгі бір әрекет ішінде Codex бастапқы кодты тексеріп, өрістету тарихынан іздеп, инциденттер туралы есептерді оқып, файлды өңдеп, сынақтарды іске қоса алады. Әр қадам жеке сұрауды қажет етуі мүмкін.
Мәнмәтінді дайындау, дерек тасымалдау, инференсті орындау, құралдарды шақыру және процестерді іске қосу уақыт пен есептеу ресурстарын қажет етеді. Тапсырма модельге 30 сұрау жіберуді қажет етсе, әр сұрауға қосылған бір секундтың өзі елеулі болады. Жалпы өнімділікті арттыру үшін модельді жылдамдату ғана емес, бүкіл жүйедегі қайталанатын жұмысты азайту қажет.
Пайдаланушының бір әрекеті модель мен құрал жұмысының көптеген итерациясын қамтуы мүмкін. Қайталанатын аймақтағы кез келген шығын бірнеше рет жұмсалуы ықтимал.
Осы еселену әсерлерін ескеріп, модельдерімізді, құралдарымызды және пайдаланушы ортасын байланыстыратын Rust тіліндегі үйлестіру қабаты — агенттік тапсырма ортамызды жобаладық. Енді мәнмәтіннің шамадан тыс ұлғаюына жол бермеу, құралдарды жүктеу және жұмысты қайта пайдалану әр сұрауды қалай тиімді ететінін қарастырамыз.
Агенттер көбірек құралға, дағдыға, плагинге және әңгіме тарихына қол жеткізген сайын мәнмәтін терезелері тез ұлғаюы мүмкін. Бұл шығынды арттырады, модельдің назарын бөледі және қажетсіз ой қорытуға түрткі болады. Тапсырма ортасы кейінге қалдырылған анықтау арқылы бұл үстеме шығынды азайта алады: интеграциялар, реттелетін MCP құралдары, дағдылар мен плагиндер қажет болғанда ғана көрсетіледі. Сондай-ақ тапсырма ортасы жекелеген құралдар мен MCP интеграцияларының мәнмәтін терезесін күтпеген жерден толтырып жіберуіне жол бермейді. Модель басқа шек сұрамаса, құрал шығысы әдепкіде 10 000 токенмен шектеледі.
Жоғарыда айтылғандай, агент циклі бір әрекет ішінде бірдей нұсқауларды, әңгіме тарихын, құрал анықтамаларын және алдыңғы нәтижелерді GPU-ларға бірнеше рет жібере алады. Мұндай қайталанатын кірістерді өңдеу қымбат, сондықтан көмексөзді кэштеу бұрын өңделген көмексөз префиксіне қатысты есептеуді қайта пайдаланады. Бұл префиксті сақтау үшін тапсырма ортасы модельге көрінетін бүкіл тарихты тек соңынан толықтырылатын дерек ретінде қарастырады: жаңа хабарлар, құрал нәтижелері мен орта жаңартулары бұрынғы мәнмәтінге кірістірілмей, соңына қосылады. Құралдар да детерминистік ретпен ұсынылады, ал мақұлдау саясаттары сияқты орындалу параметрлері құрал анықтамаларына енгізілмей, орындау кезінде қолданылады. Бұл жобалық шешім Codex-тегі және ChatGPT Work көмексөз кэшін сәтті пайдалану көрсеткіштерінің жоғары болуына ықпал етеді.
Инкременттік тасымалдау желі арқылы не өтетінін өзгертеді, ал көмексөзді кэштеу модельге қай есептеулерді қайталамауға болатынын анықтайды. Ендер тұжырымдамалық түрде берілген, қосымша сығу қабаты көрсетілмеген.
GPT‑5.6 арқылы қол жеткізген тиімділік өсімі — зерттеуден бастап инференс пен агенттік тапсырма ортасына дейінгі бүкіл технологиялық стекке жылдар бойы енгізілген, бірін-бірі күшейткен жақсартулардың нәтижесі. GPT‑5.6 моделінің осы жақсартулардың көбін іске асырудағы рөлі оңтайландыру қарқыны одан әрі үдейді деген сенім береді. Стегіміздің іргелі жақсартуларымен қатар, ядроларды оңтайландыру сияқты салаларда да ауқымды оңтайландыруды жалғастырамыз. Жүйе ішінде үздіксіз жасалып жатқан осы жақсартуларды пайдаланушыларымыз бен клиенттерімізге кеңірек қолжетімді әрі шығын тұрғысынан тиімді ойлау деңгейі түрінде жеткізуді асыға күтеміз.
Осы жазбаға үлес қосқан техникалық қызметкерлер Мэттью Феррариге, Филипп Тиллеге, Ахмед Ибраһимге, Джо Гершенсонға және Стив Коффиге ерекше алғыс білдіреміз.


