Негізгі мазмұнға өту
OpenAI

GPT-6.1Sol

Бес есе арзан бағаға Astra-ға жуық зияткерлік мүмкіндіктер мен тұрақты озық нәтижелер

GPT‑6.1 Sol моделін ұсынамыз. Бұл — агенттік бағдарламалауда, сондай-ақ компьютерді пайдалану мен кәсіби жұмыста ерекше жоғары нәтижелер көрсететін GPT‑6 Sol моделінің жаңартылған нұсқасы. Ол күрделі тапсырмаларда Sol мүмкіндіктерін GPT‑6 Astra деңгейіне жақындатады, ал кіріс және шығыс токендерінің бағасы Astra стандартты бағасынан бес есе арзан. Бұл әзірлеушілерге сол бюджетпен қабілетті агенттерді жасауға және іске қосуға көбірек мүмкіндік береді.

GPT‑6.1 Sol Sol бағасымен Astra-ға жуық нәтиже береді. Сондықтан ол бүгінде нәтижесі мен құнының арақатынасы жағынан ең тиімді модель. Кэштелген кірістің миллион токені небәрі $0,10 тұрады — бұл стандартты кіріс бағасынан 95% арзан. Соның арқасында қайталанатын сұрауларда контексті қайта пайдалану қажет болатын агенттік жұмыстардың құны төмендейді.

Жалпы мүмкіндіктері бойынша GPT‑6 Astra біздің ең қабілетті озық моделіміз болып қала береді. GPT‑6.1 Sol маңызды жұмыстарды жиірек орындағысы келетін пайдаланушыларға және қолданбаларды кең ауқымда жасап, іске қосатын API клиенттеріне мүмкіндік пен құнның жаңа теңгерімін ұсынады.

Үш модель карточкасы: GPT-6 Astra — ең жақсы нәтижелерге арналған ең зияткер модель; кіріс — $10, шығыс — $50, кэштелген кіріс — $1. GPT-6.1 Sol — бес есе арзан бағаға Astra-ға жуық зияткерлік мүмкіндіктер; кіріс — $2, шығыс — $10, кэштелген кіріс — $0,10. GPT-6 Luna — күнделікті жұмысты үлкен көлемде жылдам әрі тиімді орындауға арналған; кіріс — $0,10, шығыс — $0,50, кэштелген кіріс — $0,01.

Түрлі тапсырмаларда мүмкіндігі артқан Sol

GPT‑6.1 Sol код жазу мен қателерін түзетуден бастап құжаттарды түсінуге және көпқадамды бизнес-процестерді орындауға дейінгі күрделі кәсіби жұмыста GPT‑6 Sol моделінен айтарлықтай жақсы нәтиже көрсетеді. Осы бағалаулардың бірнешеуінде ол әлдеқайда аз шығынмен GPT‑6 Astra нәтижелеріне жақындайды.

Бағдарламалау

Нақты код базаларындағы күрделі бағдарламалық инженерия тапсырмаларын бағалайтын DeepSWE v1.1 сынағында GPT‑6.1 Sol шамамен бес есе аз шығынмен GPT‑6 Astra нәтижесіне теңеседі. Сонымен қатар ой қорытуға аз күш пен қаражат жұмсай отырып, GPT‑6 Sol моделінің ең жақсы көрсеткішінен 6,4 пайыздық тармаққа асып түседі.

DeepSWE 1.1⁠⁠(жаңа терезеде ашылады) сынағында ЖИ агенттері бағдарламалық жасақтама әзірлеуге қатысты бұрын кездеспеген, ұзақ мерзімді жұмысты қажет ететін тапсырмаларды шешеді.

Кәсіби жұмыс

GDP.pdf сынағы модельдердің кестелер, графиктер, диаграммалар және ұсақ қаріппен жазылған мәліметтер қамтылған күрделі PDF құжаттары негізінде кәсіби сұрақтарға қаншалықты дәл жауап беретінін өлшейді. Бұл сынақта GPT‑6.1 Sol тексерілген ой қорыту баптауларының бәрінде резервтік нұсқалары бар Opus 5.5 моделінен жоғары нәтиже көрсетеді, ал бір тапсырмаға кететін шығын екі еседен де көп азаяды. Ол сондай-ақ бір тапсырмаға шамамен бес есе аз қаражат жұмсап, GPT‑6 Astra моделінің ең озық нәтижесіне жақындайды.

GDP.pdf⁠(жаңа терезеде ашылады) сынағында модельдер қаржы, денсаулық сақтау, құқық және тағы жеті кәсіби саладағы жұмыс процестерінен алынған күрделі PDF құжаттарына қатысты нақты тәжірибеге негізделген сұрауларға жауап беруі керек.

Агенттердің көпқадамды бизнес-процестерді дұрыс орындауын өлшейтін AutomationBench сынағында GPT‑6.1 Sol ой қорытуға жұмсалатын күш Орташа деңгейде болғанда, шамамен үш есе аз шығынмен Opus 5.5 моделінен 2,2 пайыздық тармаққа жоғары нәтиже көрсетеді. Бұл көрсеткіш сол баптаудағы GPT‑6 Sol нәтижесінен де 4,8 пайыздық тармаққа жоғары.

In AutomationBench 1.0.6⁠⁠(жаңа терезеде ашылады), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Компьютерді пайдалану

GPT‑6.1 Sol компьютерлік қолданбалармен әрекеттесуді қажет ететін тапсырмаларда да айтарлықтай ілгеріледі. Агенттердің компьютерді пайдалануға қатысты күрделі жұмыс процестерін орындауын бағалайтын OSWorld 2.0 офлайн жиынтығында GPT‑6.1 Sol ой қорытуға ең көп күш жұмсалатын баптауда GPT‑6 Sol моделінен жеті пайыздық тармаққа жоғары нәтиже көрсетеді, ал құны екі еседен де көп төмен. Ой қорытуға ең көп күш жұмсалатын баптауда ол Astra көрсеткішінен небәрі 2,1 пайыздық тармаққа қалыс қалады, ал бір тапсырманың құны шамамен жеті есе арзан.

In OSWorld 2.0⁠⁠(жаңа терезеде ашылады), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Ғылыми зерттеулер

Деректерді талдау, симуляция және теоремаларды дәлелдеу сияқты ғылыми жұмыс процестерін бағалайтын Terminal-Bench Science 0.1 сынағында GPT‑6.1 Sol ой қорытуға ең көп күш жұмсалатын баптауда GPT‑6 Sol көрсеткішінен екі еседен астам жоғары нәтиже береді, ал бір тапсырманың құны екі еседен де көп төмен. Ең көп күш жұмсалатын баптауда GPT‑6.1 Sol үшін бір тапсырманың орташа құны — $5,47, ал Opus 5.5 үшін — $23,21, Astra үшін — $23,80. Осылайша ол екі модельден де 75%-дан астам арзан бағаға ғылыми жұмыста елеулі мүмкіндіктер ұсынады.

GPT‑6 Astra сыналған модельдер арасында әлі де ең жоғары — 68,1% нәтиже көрсетеді, сондықтан ең күрделі ғылыми зерттеу тапсырмалары үшін оны қолданған жөн.

Terminal-Bench Science 0.1⁠(жаңа терезеде ашылады) сынағында агенттер код пен терминал құралдарын пайдаланып, ғылыми зерттеу процестерін орындайды. Оған деректерді талдау, симуляцияларды іске қосу және модельдерді деректерге сәйкестендіру кіреді.

Фактілік дәлдік

GPT‑6.1 Sol күрделі сұрауларға жауап беруде де фактілік дәлдікті арттырады. Ой қорытуға жұмсалатын күш өте жоғары деңгейде болғанда, оның фактілік қателер үлесі — 4,1%. Бұл GPT‑6 Sol моделінің 4,5% көрсеткішінен төмен және сол баптаудағы Astra моделінің 4,0% көрсеткішіне жақын, ал бір тапсырмаға кететін шығын Astra-дан шамамен 83% аз.

Бұл бағалау пайдаланушылар бұрынғы модельдің қатесін белгілеген, жеке деректерден тазартылған әңгімелерде кемінде бір фактілік қатесі бар жауаптардың үлесін өлшейді. Әдейі күрделі етіп таңдалған бұл сұраулар әдеттегі қолданысқа тән емес.

Фактілік дәлдікті пайдаланушылар алдыңғы модельдің фактілік қатесін белгілеген, жеке деректерден тазартылған ChatGPT әңгімелері арқылы бағалаймыз. Қате туғызатын бұл әңгімелер күнделікті қолданысқа тән емес: әдеттегі қолданыста фактілік қателер сирек кездеседі.

GPT‑6.1 Sol моделін қауіпсіз іске қосу

Модель әрекетінің қойылған талаптарға сәйкестігін бағалау сынақтарымызда GPT‑6.1 Sol GPT‑6 Sol моделінен айтарлықтай ілгерілеп, GPT‑6 Astra деңгейіне жақындады.

GPT‑6.1 Sol өз мүмкіндіктерінің шегін ашығырақ хабарлайды және пайдаланушы ниеті мен қауіпсіздік шектеулерін сенімдірек сақтайды. Күрделі бағалау сынақтарында ол істемейтін іздеу құралдары туралы ашық хабарлау, нақты шектеулерді сақтау және агенттік тапсырмалар кезінде рұқсатсыз нәтижелерге жол бермеу бойынша GPT‑6 Sol моделіне қарағанда сирек қателеседі. GPT‑6 Astra және GPT‑6 Sol сияқты, ол да автоматтандырылған қауіпсіздік тексерушісін айналып өтуге әрекет жасаған жоқ.

Төмендегі бағалаулар әдейі күрделі жағдайларды тексереді және әдеттегі қолданыстағы қателер жиілігін өлшемейді.

Бағасы мен қолжетімділігі

Бүгіннен бастап GPT‑6.1 Sol барлық Plus, Pro, Business, Enterprise және Edu пайдаланушыларына ChatGPT Жұмыс пен Codex ішінде қолжетімді. Бұл модельдер Чат режимінде әзірге қолжетімді емес. Әзірлеушілер оған OpenAI API арқылы gpt-6.1-sol атауымен де қол жеткізе алады. API стандартты бағалары: миллион кіріс токеніне $2, миллион кэштелген кіріс токеніне $0,10 және миллион шығыс токеніне $10.

Сонымен бірге GPT‑6 Astra моделінен 8 есеге дейін жылдам жұмыс істейтін, әлемдегі ең жылдам озық модель — GPT‑6 Astra Ultrafast нұсқасын, сондай-ақ GPT‑6.1 Sol Ultrafast нұсқасын іске қосамыз. Олар API арқылы, сондай-ақ айына $500 тұратын, ең жоғары пайдалану лимиттері бар жаңа Pro тарифінің пайдаланушыларына ChatGPT Жұмыс пен Codex ішінде қолжетімді. GPT‑6.1 Sol Ultrafast арқылы әзірлеушілер бұрын GPT‑6 Astra API үшін жұмсаған қаражатқа жуық шығынмен Astra-ға жақын зияткерлік мүмкіндіктерге және 8 есеге дейін жоғары жылдамдыққа қол жеткізе алады.

Автор

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.