GPT‑6 Sol және Luna модельдерін таныстырамыз
Озық интеллектіні күнделікті жұмысыңызға енгізудің жаңа жолдары.
Осы айдың басында біз әлемдегі ең ақылды әрі мақсаттарымызбен барынша үйлесімді GPT‑6 Astra моделін таныстырдық. Ең күрделі әрі маңызды жобаларға әлі де Astra-ның бүкіл әлеуеті қажет, алайда жұмыстың ауқымы, қарқыны мен бюджеті әртүрлі болады.
Сондықтан GPT‑6 топтамасын GPT‑6 Sol және GPT‑6 Luna модельдерімен кеңейтіп жатырмыз. GPT‑6 Astra интеллекттің жаңа буынын ұсынды, ал бұл модельдер шығын тиімділігін жаңа деңгейге көтеріп, сол интеллекттің артықшылықтарын кеңінен қолжетімді етеді. GPT‑6 Sol мен Luna модельдерін GPT‑6 Astra-ға ұқсас әдістермен үйреттік. Осылайша Astra-ның кәсіби жұмыс, дерек дәлдігі, кодтау, компьютерді пайдалану және мақсаттармен үйлесімділік салаларындағы озық нәтижелеріне негіз болған жетістіктер жылдамырақ әрі қолжетімдірек модельдерге енгізілді.
GPT‑6 модельдері шығын мен интеллект арақатынасы бойынша көш бастап, әр деңгейдегі ерекше мүмкіндіктерді оларды ауқымды түрде тиімді ұсынатын инфрақұрылыммен үйлестіреді. Кэштеу мен инференсті жетілдіру бұл модельдерді төменірек шығынмен ұсынуға мүмкіндік берді. Осы үнемді пайдаланушылар мен клиенттерге тікелей беру үшін Sol және Luna API бағаларын GPT‑5.6 жарнамалық бағаларымен салыстырғанда 50%-ға төмендеттік. Осы жетілдірулердің арқасында озық ЖИ күнделікті тапсырмалар мен ауқымды қолданбалар үшін анағұрлым тиімді шешімге айналады.
Модель | Кіріс | Шығыс | Бағаның төмендеуі |
GPT‑6 Sol | 4 АҚШ доллары → 2 АҚШ доллары | 20 АҚШ доллары → 10 АҚШ доллары | 50% арзан |
GPT‑6 Luna | 0,20 АҚШ доллары → 0,10 АҚШ доллары | 1,20 АҚШ доллары → 0,50 АҚШ доллары | 50% арзан |
Бағалар 1 миллион токенге көрсетілген.
GPT‑6 Astra барлық көрсеткіш бойынша үздік моделіміз болып қала береді. Ең үздік нәтиже мен еш ымырасыз жұмыс тәжірибесі қажет болса, осы модельді таңдаңыз.
GPT‑6 Sol және Luna күрделі жұмысты орындауға ең пайдалы мүмкіндіктері бар өзіңіз білетін әрі қолданып жүрген модельдерге жетілдірілген интеллект пен шығын тиімділігін әкеледі.
GPT‑6 Sol күрделі жұмыс тапсырмаларын орындай алады. Жоғары пайдалану лимиттері мен төмен шығын бірнеше рет жетілдіруге көбірек мүмкіндік береді, ал бағасы ұқсас бәсекелес модельдермен салыстырғанда ойлау қабілеті жоғары әрі нәтижесі жақсы.
Қолданбалар арасындағы бизнес үдерістерді сынайтын AutomationBench бағалауында өте жоғары күш жұмсайтын GPT‑6 Sol максималды күш жұмсайтын Claude Opus 5 моделінен озып, бір тапсырмаға Opus 5 шығынының небәрі 9%-ын жұмсайды. Жоғары күш жұмсау деңгейінде GPT‑6 Luna алдыңғы нұсқасынан 5,4 пайыздық тармаққа озып, бір тапсырмаға 58% аз шығын жұмсайды.
AutomationBench 1.0.6(жаңа терезеде ашылады) бағалауында ЖИ агенттері сату, маркетинг, операциялар, қолдау, қаржы және кадр салаларындағы 47 құралды пайдаланып, толық жұмыс үдерістерінен өтеді. Claude Fable 5.1 дерек нүктесі оның нақты құнын төмен көрсетеді, өйткені тапсырмалардың шамамен 40%-ында қолданылған Opus 5 резервінің құны есепке алынбаған.
GPT‑6 Sol әлдеқайда аз шығынмен Claude Fable 5.1 моделінен де озады, тіпті төмен күш жұмсау деңгейіндегі GPT‑6 Astra-ны да басып түседі.
Модель (және күш жұмсау деңгейі) | Нәтиже | Бір тапсырманың құны |
|---|---|---|
GPT‑6 Sol (өте жоғары) | 33,2% | 0,27 АҚШ доллары |
GPT‑6 Astra (төмен) | 30,3% | GPT‑6 Sol-дан 3,9 есе қымбат |
Claude Opus 5 (максималды) | 26,9% | GPT‑6 Sol-дан 11,1 есе қымбат |
Opus 5 резерві бар Claude Fable 5.1 (максималды) | 31,4% | GPT‑6 Sol-дан >8,9 есе қымбат (резерв құны көрсетілмеген) |
Агенттерді күрделі кәсіби жұмыс үдерістерінде бағалайтын Agents’ Last Exam сынағында максималды күш жұмсайтын GPT‑6 Sol 56,4% нәтиже көрсетіп, бір тапсырмаға 60% аз шығынмен Claude Opus 5 моделінің осы бағалаудағы ең жоғары нәтижесінен озады.
Agents’ Last Exam V1(жаңа терезеде ашылады) бағалауында ЖИ агенттері компьютерде орындалатын кәсіби жұмыстың негізгі салаларының көпшілігін қамтитын 55 ішкі саладағы ұзақ мерзімді әрі экономикалық құнды тапсырмалар бойынша бағаланады.
Жауаптың пайдалылығы деректердің дұрыстығына байланысты, сондықтан біз дерек сенімділігін одан әрі арттырып жатырмыз. Пайдаланушылар модельдеріміздің қателерін белгілеген, жеке деректері жойылған шынайы әңгімелерге негізделген ішкі дерек дәлдігі бағалауымызда GPT‑6 Sol алдыңғы нұсқасына қарағанда шамамен екі есе аз қате жібереді. Ол әлдеқайда төмен шығынмен Astra деңгейіндегі сенімділікке жақындайды. GPT‑6 Luna да айтарлықтай жақсарды: жоғары күш жұмсау деңгейлерінде ол GPT‑5.6 Sol нәтижесіне шығынның шамамен жүзден бір бөлігімен жетеді.
Мұнда пайдаланушылар алдыңғы модельдің нақты дерек қатесін белгілеген, жеке деректері жойылған ChatGPT әңгімелеріндегі дерек дәлдігін бағалаймыз. Қате тудыратын бұл әңгімелер нақты дерек қателері сирегірек кездесетін қалыпты қолданысты көрсетпейді. Нәтижелер ұзындық бойынша теңестірілмеген, алайда жауап көлемін өзгертіп жүргізген сынақтарымыз нәтиженің жауап ұзындығына тәуелділігі жоқтың қасы екенін көрсетті.
ББиыл кодтау агенттері бұрын-соңды болмаған күрделі, ауқымды әрі ұзақ тапсырмаларды орындай бастады. OpenAI ішіндегі қолданысымыз экспоненциалды түрде өсті. API бағасымен есептегенде, медианалық зерттеушінің күнделікті токен қолданысы 600 АҚШ долларынан, ал 90-процентильдегі зерттеушілердікі 7 000 АҚШ долларынан асты («Зерттеулерді жеделдету: OpenAI ішіндегі көрініс»). Кодтау агенттері ұзағырақ әрі күрделірек тапсырмаларды орындаған сайын, оларды тұрақты пайдалану құнының маңызы артады. GPT‑6 Sol және Luna жоғары кодтау өнімділігін төмен API бағаларымен ұштастырады. Бұл әзірлеушілерге нәтижені бірнеше рет жетілдіруге көбірек мүмкіндік беріп, командалардың Codex-ке өршіл тапсырмаларды сеніммен тапсыруына жол ашады.
Кодтау агенттері нақты код қорларына біріктіруге дайын өзгерістер жасай ала ма, соны бағалайтын FrontierCode сынағында GPT‑6 Sol GPT‑5.6 Sol моделінен айтарлықтай озып, әлдеқайда төмен шығынмен өте жоғары күш жұмсайтын Claude Fable 5.1 нәтижесіне жетеді.
FrontierCode 1.1 Main(жаңа терезеде ашылады) бағалауында ЖИ агенттері жазған код тек дұрыстығы бойынша емес, «біріктіруге жарамдылығы», яғни сынақ сапасы, жұмыс ауқымын сақтау, код стилі және код қорының стандарттарына сәйкестігі бойынша да бағаланады.
Нақты код қорларындағы күрделі бағдарламалық жасақтама инженериясы тапсырмаларын сынайтын DeepSWE v1.1 бағалауында максималды күш жұмсайтын GPT‑6 Sol 68,8% нәтиже көрсетеді. Бұл өте жоғары күш жұмсайтын Claude Fable 5 моделінің бағалаудағы ең жоғары 69,9% нәтижесінен небәрі 1,1 пайыздық тармаққа төмен, ал бір тапсырмаға кететін шығын шамамен 80% аз.
Максималды күш жұмсайтын GPT‑6 Luna 66,6% нәтиже көрсетеді, бұл орташа күш жұмсайтын Claude Opus 5 және Fable 5 нәтижелерімен шамалас. Бұл салыстыруларда Luna бір тапсырмаға Opus 5-тен 93%, ал Fable 5-тен 96% аз шығын жұмсайды.
DeepSWE 1.1(жаңа терезеде ашылады) бағалауында ЖИ агенттері бұрын берілмеген, ұзақ мерзімді бағдарламалық жасақтама инженериясы тапсырмаларын орындайды.
GPT‑6 Astra компьютерді пайдалану бойынша әлемдегі үздік модель болып қала береді, ал GPT‑6 Sol және Luna алдыңғы нұсқаларына қарағанда шығын тұрғысынан тиімдірек нәтиже ұсынады. OSWorld 2.0 офлайн бағалауында өте жоғары күш жұмсау деңгейіндегі GPT‑6 Sol орташа күш жұмсау деңгейіндегі Claude Opus 5 моделіне ұқсас нәтиже көрсетеді — 60,5% және 60,3%, ал бір тапсырмаға жұмсалатын шығын шамамен 80% аз. GPT‑6 Luna (максималды) GPT‑5.6 Sol (орташа) моделінен он есе аз шығынмен озады.
OSWorld 2.0(жаңа терезеде ашылады) бағалауында ЖИ агенттері күнделікті және кәсіби тапсырмаларды қамтитын ұзақ мерзімді компьютерлік жұмыс үдерістерін орындайды. Біз v2026.08.08 шығарылымының офлайн жиынындағы ішінара сыйақыны көрсетеміз.
GPT‑6 Astra-ның жетілдірілген қарым-қатынас мәнерін Sol және Luna модельдеріне де енгіздік. Бұл әсіресе техникалық және кодтау туралы әңгімелерде байқалады деп ойлаймыз. Жауаптар анығырақ, кәсіби жаргон мен оғаш тіркестер аз, пайдасы шамалы егжей-тегжей сирек болады әрі мазмұны сақталған күйде жалпы көлемі сәл қысқарады.
Стиль субъективті болғанымен, бұл жерде GPT‑6 Sol жауабын ұнаттық. Ол асығыс қорытынды жасамайды, сұраушыға түсінікті болуы мүмкін мәліметтерді қайталауға аз уақыт жұмсайды (мысалы, сайтта төрт бет барын), бұлыңғыр тіркестерді аз қолданады (мысалы, «бенто әсері», «сол жүйеге сай қайта қалыптастыру»), нені тексергенін және тексермегенін ашығырақ айтады әрі кескін құралына берген көмексөзі сияқты іске асыру егжей-тегжейін орынсыз бөліспейді.
Токен бағаларын төмендетумен қатар, GPT‑6 негізінде өнім жасайтын әзірлеушілерге қолданбалары қайта пайдаланатын контекстен көбірек үнемдеуге көмектесіп жатырмыз. GPT‑6 үшін көмексөзді кэштеуді жетілдіріп, әдепкі бойынша кэштен табу жиілігін арттырдық. Бұл агенттерге көбірек контексті қайта пайдалануға, жылдамырақ жауап беруге және кэштелген кіріс токендерін оқу кезінде 90% жеңілдік алуға көмектеседі.
Енді әзірлеушілер кэштеу өнімділігін өлшеп, оңтайландырудың қосымша тәсілдерін пайдалана алады:
Бақылау және ақауды анықтау. Көмексөзді кэштеу бақылау тақтасы(жаңа терезеде ашылады) кірістің қанша бөлігі кэштелгенін және оның уақыт өте қалай өзгеретінін көрсетеді. Диагностика құралы(жаңа терезеде ашылады) кэштеу мүмкіндіктерінің неге пайдаланылмағанын және нені түзету керегін түсіндіруге көмектеседі.
Кэшті бұзбай, ой қорытуға жұмсалатын күш пен құралдардың қолжетімділігін реттеңіз. Күрделі тапсырмалар үшін ой қорытуға жұмсалатын күшті(жаңа терезеде ашылады) арттырыңыз немесе қарапайым қосымша сұрақтар үшін азайтыңыз, сондай-ақ агенттің қажетіне қарай құралдарды қосыңыз немесе өшіріңіз(жаңа терезеде ашылады). Енді екі басқару тетігі де бұрынғы контексті кэште қайта пайдалану үшін сақтайды.
Кэштелетін префикстерді оңтайландырыңыз. Айқын үзіліс нүктелері әзірлеушілерге көмексөздің кэштелетін префикстері қай жерде аяқталатынын таңдауға мүмкіндік береді. Бұл әзірлеушілерге кэшті қайта пайдалануды жақсырақ басқаруға және өнімділікті арттыруға мүмкіндік береді.
GitHub мәліметінше, соңғы бірнеше айда бұл жетілдірулер OpenAI модельдеріне жасалған миллиардтаған сұрауда жаңадан өңдеуді қажет ететін көмексөз токендерінің үлесін 50%-дан астам азайтып, Copilot жұмысының жылдамдауына көмектесті.
GPT‑6 Sol және Luna осы уақытқа дейінгі мақсаттарымызбен барынша үйлесімді Astra моделінде енгізілген жұмыстарға негізделген. Мақсаттармен үйлесімділікті бағалау сынақтарында Sol және Luna модельдері GPT‑5.6 нұсқаларынан жақсы нәтиже көрсетті, соның ішінде кодтау жұмысы туралы жаңылыстыратын мәлімдемелердің жиілігі төмендеді.
Төмендегі бағалаулар күрделі жағдайларды әдейі сынайды және қалыпты қолданыстағы сәтсіздік жиілігін өлшемейді. Толық нәтижелерді жүйе картасынан(жаңа терезеде ашылады) қараңыз.
GPT‑6 Sol және GPT‑6 Luna бүгіннен бастап Plus, Pro, Business, Enterprise және Edu пайдаланушыларының барлығына ChatGPT Жұмыс пен Codex ішінде қолжетімді. Free және Go пайдаланушылары GPT‑6 Luna моделін жұмыс үстелі қолданбасында пайдалана алады. Бұл модельдер Чат ішінде әзірге қолжетімсіз. OpenAI API ішінде олар gpt-6-sol және gpt-6-luna атауларымен қолжетімді.
Қызметтің барлығы үшін тұрақты жұмысын сақтау мақсатында бұл модельдерді ChatGPT ішінде күні бойы біртіндеп іске қосуды жоспарлап отырмыз. Жаңа модельдер ChatGPT Жұмыс немесе Codex ішінде көрінбесе, кейінірек қайталап көріңіз.
GPT бағалаулары зерттеу ортамызда немесе API арқылы жүргізілді. Жүйелік көмексөздер, қолжетімді құралдар және басқа да айырмашылықтарға байланысты олардың нәтижесі өндірістік ChatGPT жауабынан сәл өзгеше болуы мүмкін. Бәсекелес модельдердің бағалаулары жалпыға қолжетімді есептерден алынды. Claude Fable 5.1 нәтижелері қолжетімсіз болғанда, Claude Fable 5 нәтижелері көрсетілді.


