Пређите на главни садржај
OpenAI

GPT-6.1Sol

Интелигенција блиска моделу Astra за петину цене, уз стабилне перформансе граничних модела

Представљамо GPT‑6.1 Sol, унапређену верзију модела GPT‑6 Sol са изузетним перформансама у програмирању од стране агента, као и у коришћењу рачунара и професионалном раду. Ова верзија приближава Sol моделу GPT‑6 Astra на захтевним задацима, по петини стандардне цене улазних и излазних токена модела Astra, што програмерима пружа више простора да у оквиру истог буџета развијају и покрећу способне агенте.

GPT‑6.1 Sol доноси перформансе блиске моделу Astra по ценама модела Sol, што га чини моделом са најбољим односом цене и перформанси који је данас доступан. Кеширани улаз кошта само 0,10 $ по милиону токена – 95% мање од стандардне цене улаза – што га чини приступачнијим за задатке агената који захтевају поновну употребу контекста у узастопним захтевима.

GPT‑6 Astra у целини остаје наш најспособнији гранични модел. GPT‑6.1 Sol нуди нов однос могућности и трошкова за важне послове које корисници желе чешће да обављају, као и за кориснике API-ја који развијају и покрећу апликације у великом обиму.

Три картице модела: GPT-6 Astra, наш најинтелигентнији модел за најбоље резултате, 10 $ за улаз, 50 $ за излаз и 1 $ за кеширани улаз; GPT-6.1 Sol, интелигенција блиска моделу Astra за петину цене, 2 $ за улаз, 10 $ за излаз и 0,10 $ за кеширани улаз; GPT-6 Luna, брз и ефикасан свакодневни рад у великом обиму, 0,10 $ за улаз, 0,50 $ за излаз и 0,01 $ за кеширани улаз.

Способнији Sol за различите задатке

GPT‑6.1 Sol доноси значајна побољшања у односу на GPT‑6 Sol у сложеним професионалним пословима, од писања кода и отклањања грешака до разумевања докумената и извршавања пословних токова рада са више корака. На неколико ових евалуација приближава се перформансама модела GPT‑6 Astra уз знатно ниже трошкове.

Програмирање

На тесту DeepSWE v1.1, који процењује сложене задатке софтверског инжењерства у стварним базама кода, GPT‑6.1 Sol изједначава се са моделом GPT‑6 Astra уз приближно петину трошкова, а најбољи резултат модела GPT‑6 Sol надмашује за 6,4 процентна поена уз мањи напор резоновања и ниже трошкове.

У тесту DeepSWE 1.1⁠⁠(отвара се у новом прозору), агенти вештачке интелигенције решавају оригиналне задатке из софтверског инжењерства који захтевају дуготрајан рад.

Професионални рад

На тесту GDP.pdf, који мери колико тачно модели одговарају на стручна питања користећи сложене PDF документе са табелама, графиконима, дијаграмима и детаљима у ситном тексту, GPT‑6.1 Sol постиже боље резултате од модела Opus 5.5 са резервним опцијама, уз мање од половине трошка по задатку на тестираним подешавањима резоновања. Такође се приближава водећим перформансама модела GPT‑6 Astra уз приближно петину трошка по задатку.

У тесту GDP.pdf⁠(отвара се у новом прозору), модели морају да одговоре на реалне упите о сложеним PDF документима који се користе у раду у финансијама, здравству, праву и још седам стручних области.

На тесту AutomationBench, који мери да ли агенти правилно извршавају пословне токове рада са више корака, GPT‑6.1 Sol постиже резултат за 2,2 процентна поена виши од модела Opus 5.5 при средњем напору резоновања, уз приближно трећину трошкова. Тај резултат је уједно за 4,8 процентних поена виши од резултата модела GPT‑6 Sol при истом подешавању.

In AutomationBench 1.0.6⁠⁠(отвара се у новом прозору), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Коришћење рачунара

GPT‑6.1 Sol такође доноси значајан напредак у задацима који захтевају интеракцију са рачунарским апликацијама. На офлајн скупу теста OSWorld 2.0, који процењује агенте у захтевним токовима рада на рачунару, GPT‑6.1 Sol надмашује GPT‑6 Sol за седам процентних поена при максималном напору резоновања, уз мање од половине трошкова. При максималном напору резоновања заостаје само 2,1 процентни поен за резултатом модела Astra, уз приближно седмину трошка по задатку.

In OSWorld 2.0⁠⁠(отвара се у новом прозору), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Научно истраживање

На тесту Terminal-Bench Science 0.1, који процењује научне токове рада, укључујући анализу података, симулације и доказивање теорема, GPT‑6.1 Sol постиже више него двоструко бољи резултат од модела GPT‑6 Sol при максималном напору резоновања, уз мање од половине трошка по задатку. При максималном напору, GPT‑6.1 Sol у просеку кошта 5,47 $ по задатку, у поређењу са 23,21 $ за Opus 5.5 и 23,80 $ за Astra, пружајући значајне могућности за научни рад уз преко 75% ниже трошкове у односу на оба модела.

GPT‑6 Astra и даље постиже највиши резултат међу тестираним моделима, 68,1%, и треба га користити за најтеже научноистраживачке задатке.

У тесту Terminal-Bench Science 0.1⁠(отвара се у новом прозору), агенти спроводе научноистраживачке поступке користећи код и терминалске алате, што обухвата анализу података, покретање симулација и прилагођавање модела подацима.

Чињенична тачност

GPT‑6.1 Sol такође побољшава чињеничну тачност одговора на тешке упите. При изузетно високом напору резоновања, стопа чињеничних грешака износи 4,1%, што је ниже од 4,5% код модела GPT‑6 Sol и ближе стопи од 4,0% код модела Astra при истом подешавању, уз приближно 83% нижи трошак по задатку у односу на Astra.

Ова евалуација мери удео одговора са бар једном чињеничном грешком на основу разговора из којих су уклоњени идентификациони подаци, а у којима су корисници пријавили грешку ранијег модела. Ови намерно тешки упити нису репрезентативни за уобичајену употребу.

Чињеничну тачност процењујемо на основу разговора у производу ChatGPT из којих су уклоњени идентификациони подаци, а у којима су корисници пријавили чињеничну грешку претходног модела. Ови разговори који изазивају грешке нису репрезентативни за уобичајену употребу, у којој су чињеничне грешке ређе.

Безбедно увођење модела GPT‑6.1 Sol у употребу

GPT‑6.1 Sol показује значајна побољшања у односу на GPT‑6 Sol у нашим евалуацијама усклађености понашања, чиме се приближава моделу GPT‑6 Astra.

GPT‑6.1 Sol отвореније саопштава своја ограничења и поузданије поштује намеру корисника и безбедносна ограничења. У захтевним евалуацијама бележи ниже стопе пропуста од модела GPT‑6 Sol када је реч о пријављивању неисправних алата за претрагу, поштовању изричитих ограничења и избегавању неовлашћених исхода током агентских задатака. Нисмо уочили ниједан покушај заобилажења аутоматизованог безбедносног контролора, као ни код модела GPT‑6 Astra и GPT‑6 Sol.

Евалуације у наставку намерно испитују захтевне ситуације и не мере стопе пропуста у уобичајеној употреби.

Цене и доступност

GPT‑6.1 Sol је од данас доступан свим корисницима планова Plus, Pro, Business, Enterprise и Edu у режиму ChatGPT Посао и у производу Codex. Ови модели још нису доступни у режиму Ћаскање. Програмери му могу приступити и преко OpenAI API-ја као gpt-6.1-sol. Његове стандардне API цене су 2 $ по милиону улазних токена, 0,10 $ по милиону кешираних улазних токена и 10 $ по милиону излазних токена.

Истовремено представљамо GPT‑6 Astra Ultrafast, најбржи гранични модел на свету, до 8 пута бржи од модела GPT‑6 Astra, као и GPT‑6.1 Sol Ultrafast. Доступни су преко API-ја, као и у режиму ChatGPT Work и у производу Codex корисницима нашег новог Pro нивоа са највишим лимитима коришћења, по цени од 500 $ месечно. Уз GPT‑6.1 Sol Ultrafast, програмери могу да добију интелигенцију блиску моделу Astra уз до 8 пута већу брзину, за приближно исти API трошак који су раније имали за GPT‑6 Astra.

Аутор

OpenAI

Евалуације модела GPT спроведене су у нашем истраживачком окружењу или преко нашег API-ја, где одговори могу бити нешто другачији него у продукцијској верзији производа ChatGPT због разлика у системским упитима, доступним алатима, нивоима напора и слично. Евалуације конкурентских модела преузете су из јавно доступних извештаја.