Негізгі мазмұнға өту
OpenAI

2026 ж. 17 шілде

Компания

ЖИ дәуіріне арналған бағалау жүйесі

Жүктелуде…

Қаржы директорларынан жиі еститін сұрақ қарапайым: ЖИ-ға жұмсаған қаражаттан қалай көбірек құндылық аламыз?

Көп жыл бойы нарық бағдарламалық жасақтаманың жетістігін оны қолдану деңгейімен өлшеді: сатып алынған пайдаланушы орындары, белсенді пайдаланушылар және жаңартылған лицензиялар. ЖИ құндылығын түсіну үшін одан да салмақты өлшем қажет: орындалған жұмыс.

Қаржы директорлары мен басқа да бизнес басшыларының алдында тұрған негізгі экономикалық сұрақ — ЖИ атқаратын жұмыстың құндылығы оны орындауға кететін шығыннан жылдамырақ өсе ме?

Бұл сұраққа жауап беру үшін бір токеннің құны секілді көрсеткіштермен шектелмей, мәселені тереңірек қарастыру қажет. Құны төмен модельдің токендері арзанырақ болуы мүмкін, алайда жоғары сапалы нәтиже алу үшін көбірек әрекет, уақыт немесе адамның қосымша тексеруі қажет болуы ықтимал. Қабілеті жоғары модельдің токендері қымбатырақ болғанымен, ол сол тапсырманы бір әрекетте орындай алады. Маңыздысы — сәтті нәтижеге қол жеткізудің толық құнын сол нәтиже тудыратын құндылықпен салыстыру.

ЖИ дәуірінің түпкілікті бағалау жүйесін «Бір долларға шаққандағы пайдалы ойлау деңгейі» деп қарастыруға болады. Бұл метрика төрт негізгі сұраққа жауап береді:

  1. ЖИ маңызды жұмысты орындап жатыр ма?
  2. Әр сәтті тапсырманың құны қанша?
  3. Адамдар нәтижеге сене ала ма?
  4. Пайдалану артқан сайын ЖИ-ға жұмсалған әр доллар көбірек құндылық әкеле ме?

1. Қанша пайдалы жұмыс орындалады?

Ең алдымен жұмыстың өзінен бастаңыз.

ЖИ клиенттердің қанша мәселесін шешуге көмектесті? Қанша код өзгерісін іске енгізуге көмектесті? Қанша келісімшартты тексерді? Адамдардың қанша уақытын үнемдеді? Қажетті контекст дәл уақытында қолжетімді болғандықтан қанша шешім жақсарды?

Токендер адамдар пайдалана алатын жұмысқа айналған кезде құндылық жасайды. Модельдер қабілеттірек болған сайын ұзақ әрі күрделі тапсырмаларды атқара алады: контекстті сақтау, бірнеше қадам арқылы ой қорыту, құралдар арасында жұмыс істеу және жұмыс барысында бейімделу.

Ең дұрысы — бір жұмыс процесінен бастау. «Орындалды» дегеннің нені білдіретінін анықтап, сол нәтижені жұмыс орындалатын жүйеде өлшеңіз.

Қолдау тобы үшін «орындалды» клиент мәселесінің шешілгенін білдіруі мүмкін. Инженерлік топ үшін бұл тесттерден өткен код өзгерісін білдіруі мүмкін. Заң тобы үшін бұл келісімшарттың дәл әрі уақытында қаралғанын білдіруі мүмкін.

Болжамды талқылауға дайындалып жатқан қаржы тобын елестетіңіз. Жұмыстың көп бөлігі түпкілікті шешім қабылданғанға дейін орындалады: соңғы болжамды табу, деректерді Excel немесе Sheets-ке көшіру, өзгерістерді анықтау, қойындылардағы деректерді салыстырып тексеру, слайдтарды қайта жасау және барлық есептің дәл шығуын тексеру.

ChatGPT Work осы процестің көп бөлігін өз мойнына алып, топқа маңызды сұрақтарға көбірек уақыт бөлуге мүмкіндік береді: Не өзгерді? Неліктен? Әрі қарай не істеуіміз керек?

Бір долларға шаққандағы пайдалы ойлау деңгейі іс жүзінде осылай көрінеді. Көбірек жұмыс қысқа мерзімде орындалады, ал адамдар өз уақытын пайымдауды, шығармашылықты және кәсіби тәжірибені қажет ететін жұмысқа көбірек бөледі.

2. Сәтті тапсырманың нақты құны қанша?

Келесі сұрақ — сол жұмысты сапалы орындаудың құны қанша?

ЖИ тапсырмалары өте әртүрлі болады. Жылдам жауапқа аз есептеу қуаты жеткілікті болуы мүмкін. Код жазу, зерттеу немесе қаржылық жұмыс процесі тереңірек ой қорыту, құралдарды пайдалану және көптеген әрекеттерді қамтуы мүмкін. Мұндай күрделірек тапсырмалар көбірек есептеу қуатын қажет етуі мүмкін, бірақ олар әлдеқайда көп құндылық жасай алады.

Модель деңгейінде сәтті тапсырманың құны бағаға, пайдаланылған есептеу ресурстарының көлеміне және дұрыс нәтижеге қол жеткізу ықтималдығына байланысты. Бизнес үшін толық шығынға қызметкерлердің уақыты, адамның тексеруі, қайталама талпыныстар және жұмысты қайта орындау да кіреді.

Есептеу жолы қарапайым:

  • Жұмысты орындаудың толық құнын қосыңыз.
  • Қажетті сапа деңгейіне жеткен тапсырмаларды санаңыз.
  • Толық құнды сәтті тапсырмалар санына бөліңіз.

Сондықтан бір токеннің ең төмен бағасы әрдайым нәтижеге қол жеткізудің ең төмен құнына әкелмейді. Озық модель қарапайым сұраудың өзіне бір әрекетте дұрыс жауап берсе, қайталама талпыныстарды, кідіріс уақытын, тексеруді және есептеу ресурстарының жалпы шығынын азайтып, ең тиімді шешім ұсынуы мүмкін.

Бірнеше деңгейден тұратын модельдер топтамасы клиенттерге бұл теңдеуді оңтайландырудың көбірек жолын ұсынады. Өткен аптада шығарылған GPT‑5.6 моделі үш деңгейден тұрады: Sol — біздің жетекші моделіміз; Terra өнімділік пен құнның тепе-теңдігін ұсынады; Luna — ең жылдам әрі ең қолжетімді моделіміз.

Бұл деңгейлер бастапқы таңдауға пайдалы бағдар береді. Алайда дұрыс модельді тапсырманы толық орындаудың экономикалық тиімділігі анықтауы тиіс. Клиент Luna-ны жылдам әрі көп көлемді жұмыс процесі үшін, Terra-ны неғұрлым терең талдауды қажет ететін жұмыс үшін, ал Sol-ды күштірек ой қорыту аз талпыныспен ең жақсы нәтиже беретін жағдайда қолдана алады.

Біз GPT‑5.6‑ны әр токеннен көбірек пайдалы жұмыс алуға үйреттік. Artificial Analysis Coding Agent Index бойынша, ең жоғары ой қорыту режиміндегі GPT‑5.6 Sol басқа жетекші модельге қарағанда 54% аз шығыс токенін пайдаланып, жаңа ең озық нәтижеге қол жеткізді. Төмендегі диаграмма салыстыруды көрсетеді.

DeepSWE v1.1: ұзақ мерзімді инженерлік тапсырмалар; GPT‑5.6 Sol Claude Fable 5-тің 69,9% көрсеткішінен жоғары, 72,7% жаңа ең жоғары нәтижеге жетеді және болжалды API құны 36,2% төмен болады.

GPT‑5.6 модельдер топтамасының барлығына ортақ мақсат — әр долларға шаққанда көбірек жұмысты сәтті орындау. Тиімділіктің артуы қолданыстағы тапсырмаларды арзанырақ орындауға мүмкіндік береді. Қабілеттіліктің артуы бұрын мүмкін болмаған жаңа жұмыс түрлерін орындауға жол ашады.

Әр жаңа модель буыны осы теңдеудің екі жағын да жақсартуы тиіс. Клиенттер құндырақ жұмысты көбірек орындай алуы керек, ал сонымен бірге әр тапсырманы орындау құны төмендей беруі тиіс.

3. ЖИ жұмысты қаншалықты жиі дұрыс орындайды?

Үшінші өлшем — сенімділік.

ЖИ-ды енгізу әдетте бірнеше кезеңнен өтеді. Алдымен ЖИ мәтіннің бастапқы нұсқасын дайындауға көмектеседі. Содан кейін ол қажетті контексті тауып, құралдар мен деректерді байланыстыра отырып ой қорытады. Уақыт өте келе ЖИ әрекеттерді орындай бастайды, стандарттан тыс жағдайларды шешеді және жұмыс процестерін аяқтайды, ал адамдар қажет кезде пайым жасап, бақылауды сақтайды.

Әр қадам көбірек құндылық жасайды және жүйеден көбірек талап етеді.

Сенімділіктің тікелей экономикалық құндылығы бар. Нәтижелер дәл, сенімді дереккөздерге негізделген, бірізді болып, қажет кезде тиісті маманға жіберілсе, адамдар тексеруге, түзетуге және жұмысты қайталауға аз уақыт жұмсайды. Сәтті тапсырмалардың құны төмендейді, ал ұйымдардың ЖИ-ды маңыздырақ жұмыс процестерінде қолдануға деген сенімі артады.

Топтар мұны үш нәтижені бақылау арқылы нақтылай алады:

  • Қолдануға дайын: Нәтиже бастапқы ұсынылған күйінде сапа талабына сай болды.
  • Түзету қажет: Нәтиже тағы бір әрекетті немесе адамның өңдеуін талап етті.
  • Адамға беру қажет: Жұмысты аяқтау үшін адам араласуы керек болды.

Бұл өлшемдер модель дәлдігінің өзінен гөрі байырақ көрініс береді. Олар ЖИ жобаны аяқтауға кететін жұмысты шынымен азайтып жатқанын көрсетеді.

Сенімділікке айқын шекаралар да қажет. ЖИ мәтін дайындаудан әрекет етуге көшпес бұрын, ұйымдар мыналарды анықтауы керек:

  • Жүйе қандай деректерге қол жеткізе алады.
  • Ол қандай жүйелерді пайдалана немесе өзгерте алады.
  • Адам қашан әрекетті қарап шығуы немесе мақұлдауы керек.

Қауіпсіз пайдалану, ақпараттық қауіпсіздік, құпиялық және бақылау ЖИ-ды кеңірек қолданудың негізін қалайды. Адамдар жүйенің қалай жұмыс істейтінін, өз деректерінің қалай өңделетінін және жүйе әрекеттерінің қандай қағидалармен реттелетінін түсінуі керек.

ChatGPT Work ChatGPT Enterprise ұсынатын қауіпсіздік, құпиялық, талаптарға сәйкестік және жұмыс кеңістігін басқару негізіне сүйенеді. Бұл ұйымдарға тиісті бақылауды сақтай отырып, ЖИ-ға көбірек контекст пен құндырақ жұмыс процестеріне қолжетімділік беруге мүмкіндік береді.

Қабілет алғашқы қолдануға жол ашады. Сенімділік ЖИ-ды жұмыстың қалай орындалатынының бір бөлігіне айналдырады.

4. Пайдалану артқан сайын ЖИ-ға жұмсалған әр доллар көбірек жұмыс әкеле ме?

Соңғы сұрақ — ауқым ұлғайған сайын экономикалық тиімділік жақсара ма?

Компаниялар мұны бір жұмыс процесін уақыт бойынша қадағалау арқылы өлшей алады. Қанша тапсырма сапа деңгейіне жеткенін, оларды орындаудың жалпы құнын және бір сәтті тапсырманың құнын бақылаңыз. Егер орындалған жұмыс жалпы құннан жылдамырақ өссе, ал сапа сақталса немесе жақсарса, ЖИ-ға жұмсалған әр доллар көбірек құндылық өндіріп жатыр.

Есептеу ресурстары осы теңдеудің өзегінде тұр.

Есептеу ресурстары зерттеулерді және ЖИ орындайтын әрбір тапсырманы қамтамасыз етеді. Олар өнімнің сапасына, жылдамдығына, сенімділігіне, қолжетімділігіне және құнына әсер етеді. Модельдерді оқытуға жұмсалатын есептеу ресурстары болашақ мүмкіндіктерді қалыптастырады. Инференске жұмсалатын есептеу ресурстары бүгін пайдалы жұмыстың орындалуын қамтамасыз етеді. Екеуі де клиенттер үшін жақсырақ нәтижелерге әкелуі тиіс.

Жақсырақ модельдер, тиімдірек инференс, арнайы мақсатқа арналған жабдық, ресурстарды жоғары деңгейде пайдалану, ақылдырақ бағыттау және мықты өнім дизайны есептеу ресурстарының қайтарымын арттырады. Инфрақұрылымның әрбір жаңа буыны қабілеттірек модельдерді оқытуға көмектеседі. Ал жетілдірілген алгоритмдер, жабдық пен бағдарламалық жасақтама сол модельдерді тиімдірек іске қосуға мүмкіндік береді.

Клиенттер бұл жақсартуларды нақты нәтижелерден көреді: сапалырақ жауаптар, жылдамырақ нәтижелер, азырақ түзету, сенімдірек өнімдер және қажетті жұмысты орындаудың төмен құны.

Бұл жетістіктер бірін-бірі күшейтеді. Жақсырақ инфрақұрылым зерттеуді жеделдетеді. Зерттеу қабілеттірек әрі тиімдірек модельдерді жасауға мүмкіндік береді. Жақсырақ модельдер өнімдерді жетілдіреді. Жақсырақ өнімдер пайдалануды, үйренуді және кірісті арттырады. Бұл өсім зерттеудің, есептеу инфрақұрылымының, енгізудің және қауіпсіздіктің келесі буынына тұрақты инвестиция салуға мүмкіндік береді.

OpenAI бұл бөліктерді бірыңғай ойлау деңгейі платформасында біріктіреді. Адамдар оны ChatGPT және ChatGPT Work арқылы пайдаланады. Әзірлеушілер оның негізінде Codex және API арқылы шешімдер жасайды. Кәсіпорындар оны жұмыс атқарылатын жүйелерге енгізеді.

Бір қабат жақсарса, әр өнім мен әр клиент пайда көре алады.

ЖИ дәуіріне арналған бағалау жүйесі

Осы төрт өлшем бірге алғанда, бір долларға шаққандағы пайдалы ойлау деңгейі жақсарып жатқанын көрсетеді.

Пайдалы жұмыс ЖИ-дың қандай жұмысты атқаратынын көрсетеді. Сәтті тапсырманың құны нәтижеге жету үшін қанша ресурс қажет екенін көрсетеді. Сенімділік адамдар жұмыстың қанша бөлігін сеніммен пайдалана алатынын көрсетеді. Ауқым ұлғайғандағы құндылық әр доллар мен есептеу ресурсының әрбір бірлігі уақыт өте келе көбірек нәтиже беретінін көрсетеді.

Мақсат — адамдарға мағыналырақ жұмыс атқаруға, жақсырақ шешімдер қабылдауға және өз жұмысының адамға тән пайым мен шығармашылықты қажет ететін бөліктеріне көбірек уақыт бөлуге көмектесетін ЖИ жасау.

Біздің міндетіміз — модельдердің әрбір жаңа буынымен осы теңдеуді жақсарту: қабілеттірек модельдер ұсыну, нәтижелерді жылдамырақ әрі сенімдірек ету және клиенттерге қажет жұмысты орындауға кететін шығынды азайту.

ЖИ уақыт өте көбірек адам мен ұйымға осылай пайдалырақ болады.