Представљамо GPT‑6 Sol и Luna
Више начина да граничну интелигенцију укључите у свакодневни рад.
Раније овог месеца представили смо GPT‑6 Astra, најинтелигентнији и најусклађенији модел на свету. Иако најзахтевнији и најважнији пројекти и даље захтевају пуну снагу модела Astra, посао се обавља у различитим обимима, ритмовима и буџетима.
Зато проширујемо свет модела GPT‑6 моделима GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra је увео нову генерацију интелигенције, а ови модели помажу да њене предности постану доступније тако што померају границе трошковне ефикасности. GPT‑6 Sol и Luna обучени су методама сличним онима за GPT‑6 Astra, чиме су достигнућа која стоје иза врхунских перформанси модела Astra у професионалном раду, чињеничној тачности, програмирању, коришћењу рачунара и усклађености пренета на брже и приступачније моделе.
Модели GPT‑6 предњаче дуж целе криве односа цене и интелигенције, спајајући изузетне могућности на сваком нивоу са инфраструктуром која их ефикасно пружа у великом обиму. Побољшања кеширања и закључивања омогућавају нам да ове моделе пружамо по нижој цени, а ту уштеду директно преносимо на кориснике и клијенте тако што снижавамо API цене за Sol и Luna за 50% у односу на њихове промотивне цене за GPT‑5.6. Ова побољшања заједно чине напредну вештачку интелигенцију практичном за више свакодневних задатака и примену у великом обиму.
Модел | Улаз | Излаз | Снижење цене |
GPT‑6 Sol | $4 → $2 | 20 $ → 10 $ | 50% јефтиније |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | 50% јефтиније |
Цене су за милион токена.
GPT‑6 Astra и даље је наш најбољи модел у свим областима. Изаберите га када желите најбоље резултате и искуство без компромиса.
GPT‑6 Sol и Luna унапређују интелигенцију и трошковну ефикасност модела које већ познајете и користите, посебно у могућностима најкориснијим за обављање сложених послова.
GPT‑6 Sol може да преузме тешке пословне задатке, а виши лимити коришћења и нижа цена остављају вам више простора за понављање поступка. Нуди више интелигенције и боље резултате од конкурентских модела сличне цене.
На тесту AutomationBench, који обухвата пословне токове рада у више апликација, GPT‑6 Sol уз врло висок ниво труда надмашује Claude Opus 5 уз Max ниво труда, по само 9% цене модела Opus 5 по задатку. Уз висок ниво труда, GPT‑6 Luna надмашује претходника за 5,4 процентна поена, уз 58% нижу цену по задатку.
У тесту AutomationBench 1.0.6(отвара се у новом прозору), агенти вештачке интелигенције тестирају се у комплетним токовима рада помоћу 47 алатки за продају, маркетинг, оперативне послове, подршку, финансије и људске ресурсе. Податак за Claude Fable 5.1 приказује нижу цену од стварне јер изоставља цену пребацивања на резервни модел Opus 5, до чега је дошло у око 40% задатака.
GPT‑6 Sol такође надмашује Claude Fable 5.1 по знатно нижој цени, па чак и GPT‑6 Astra уз низак ниво труда.
Модел (и ниво труда) | Резултат | Цена по задатку |
|---|---|---|
GPT‑6 Sol (врло високо) | 33,2% | 0,27 $ |
GPT‑6 Astra (ниско) | 30,3% | 3,9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11,1x GPT‑6 Sol |
Claude Fable 5.1 са резервним моделом Opus 5 (Max) | 31,4% | >8,9x GPT‑6 Sol (цена резервног модела није наведена) |
На тесту Agents’ Last Exam, који оцењује агенте у сложеним професионалним токовима рада, GPT‑6 Sol уз Max ниво труда постиже 56,4%, више од најбољег резултата модела Claude Opus 5 у овом оцењивању, уз 60% нижу цену по задатку.
У тесту Agents’ Last Exam V1(отвара се у новом прозору), агенти вештачке интелигенције оцењују се на дуготрајним, економски вредним задацима из 55 подграна, који обухватају већину главних области професионалног рада на рачунару.
Корисност одговора зависи од тачности чињеница, а ми настављамо да унапређујемо чињеничну поузданост. У нашем интерном оцењивању чињеничне тачности, заснованом на деидентификованим разговорима из стварног света у којима су корисници означили грешке наших модела, GPT‑6 Sol прави приближно упола мање грешака од свог претходника и приближава се поузданости модела Astra по знатно нижој цени. GPT‑6 Luna је такође знатно побољшан; при вишим нивоима труда достиже GPT‑5.6 Sol по приближно стотину пута нижој цени.
Овде оцењујемо чињеничну тачност на деидентификованим разговорима у систему ChatGPT у којима су корисници означили чињеничну грешку претходног модела. Ти разговори, осмишљени да изазову грешке, не представљају уобичајену употребу, у којој су чињеничне грешке ређе. Резултати нису прилагођени дужини, али су наша испитивања различитих нивоа опширности показала да дужина одговора готово нимало не утиче на њих.
Ове године агенти за програмирање почели су да решавају задатке који су сложенији, обимнији и дуготрајнији него икада раније. У компанији OpenAI наша интерна употреба расте експоненцијално. Према API ценама, дневна употреба токена премашила је 600 $ за истраживача на медијани и 7000 $ за истраживаче у 90. перцентилу (Убрзавање истраживања: поглед из компаније OpenAI). Како агенти за програмирање преузимају дуже и захтевније задатке, цена континуиране употребе постаје све важнија. GPT‑6 Sol и Luna спајају снажне перформансе у програмирању са нижим API ценама, што програмерима оставља више простора за понављање поступка, а тимовима улива поверење да буду амбициознији у ономе што поверавају систему Codex.
На тесту FrontierCode, који оцењује да ли агенти за програмирање стварају измене спремне за спајање са стварним базама кода, GPT‑6 Sol знатно надмашује GPT‑5.6 Sol и достиже Claude Fable 5.1 уз врло висок ниво труда, по много нижој цени.
У тесту FrontierCode 1.1 Main(отвара се у новом прозору), агенти вештачке интелигенције пишу код који се оцењује не само по исправности већ и по „погодности за спајање“, на пример по квалитету тестова, дисциплини обима, стилу кода и поштовању стандарда базе кода.
На тесту DeepSWE v1.1, који испитује перформансе у сложеним задацима софтверског инжењерства у стварним базама кода, GPT‑6 Sol уз Max ниво труда постиже 68,8%, што је 1,1 процентни поен мање од најбољег резултата модела Claude Fable 5 у овом оцењивању — 69,9% уз врло висок ниво труда — и то по приближно 80% нижој цени по задатку.
GPT‑6 Luna уз Max ниво труда постиже 66,6%, што је упоредиво са моделима Claude Opus 5 и Fable 5 уз средњи ниво труда. У овим поређењима, цена модела Luna по задатку нижа је 93% од цене модела Opus 5 и 96% од цене модела Fable 5.
У тесту DeepSWE 1.1(отвара се у новом прозору), агенти вештачке интелигенције решавају оригиналне, дуготрајне задатке софтверског инжењерства.
Иако GPT‑6 Astra остаје најбољи модел на свету за коришћење рачунара, GPT‑6 Sol и Luna пружају трошковно ефикасније перформансе од својих претходника. На тесту OSWorld 2.0 offline, GPT‑6 Sol уз врло висок ниво труда постиже резултат сличан моделу Claude Opus 5 уз средњи ниво труда – 60,5% према 60,3% – по приближно 80% нижој цени по задатку. GPT‑6 Luna (Max) надмашује GPT‑5.6 Sol (средње) по десет пута нижој цени.
У тесту OSWorld 2.0(отвара се у новом прозору), агенти вештачке интелигенције покушавају да изврше дуготрајне токове рада на рачунару који обухватају свакодневне и професионалне задатке. Наводимо делимичну награду на скупу ван мреже из издања v2026.08.08.
Побољшани стил комуникације модела GPT‑6 Astra пренели смо и на Sol и Luna, што ће, по нашем мишљењу, бити посебно приметно у техничким разговорима и разговорима о програмирању. Очекујте јасније одговоре, мање жаргона, мање необичних формулација и сувишних детаља, као и нешто краће одговоре који не губе суштину.
Иако је стил субјективан, овде нам се више допада одговор модела GPT‑6 Sol. Он не доноси пребрзо закључке, троши мање времена на понављање детаља који би могли бити очигледни особи која поставља питање (нпр. да веб-сајт има четири странице), користи мање неодређених израза (нпр. „бенто утисак“, „преобликовање… око тог система“), отвореније наводи шта јесте, а шта није проверио и не износи непотребне детаље имплементације, попут инструкције за алатку за слике.
Поред нижих цена токена, помажемо програмерима који развијају на моделу GPT‑6 да додатно уштеде на контексту који њихове апликације поново користе. Побољшали смо кеширање инструкције за GPT‑6 како бисмо подразумевано обезбедили већу стопу погодака кеша, што агентима омогућава да поново користе више контекста, брже одговарају и остваре попуст од 90% на читање кешираних улазних токена.
Програмери сада имају и више начина да мере и оптимизују учинак кеширања:
Надгледајте и дијагностикујте. Контролна табла за кеширање инструкције(отвара се у новом прозору) показује колико је улазног садржаја кеширано и како се то мења током времена. Алатка за дијагностику(отвара се у новом прозору) помаже да се објасне пропуштене прилике за кеширање и шта треба исправити.
Прилагодите ниво труда при резоновању и доступност алатки без нарушавања кеша. Повећајте ниво труда при резоновању(отвара се у новом прозору) за теже задатке или га смањите за једноставнија накнадна питања, а укључујте или искључујте алатке(отвара се у новом прозору) у складу са променама потреба агента. Обе контроле сада чувају ранији контекст како би се поново користио из кеша.
Оптимизујте који се префикси кеширају. Изричите тачке прекида омогућавају програмерима да одреде где се завршавају кеширани префикси инструкције. То програмерима пружа већу контролу над поновним коришћењем кеша и може побољшати перформансе.
GitHub наводи да су током протеклих неколико месеци ова побољшања смањила удео токена инструкције који захтевају нову обраду за више од 50% у милијардама захтева ка моделима OpenAI, што помаже систему Copilot да брже одговара.
GPT‑6 Sol и Luna надовезују се на рад на усклађености представљен са моделом Astra, нашим до сада најусклађенијим моделом. У нашим оцењивањима усклађености, и Sol и Luna показују побољшања у односу на одговарајуће моделе GPT‑5.6, укључујући нижу стопу обмањујућих тврдњи о свом раду на програмирању.
Оцењивања у наставку намерно испитују изазовне ситуације и не мере стопе неуспеха у уобичајеној употреби. Комплетне резултате погледајте у системској картици(отвара се у новом прозору).
GPT‑6 Sol и GPT‑6 Luna од данас су доступни у режиму ChatGPT Work и систему Codex свим корисницима пакета Plus, Pro, Business, Enterprise и Edu. Корисници пакета Free и Go могу да приступе моделу GPT‑6 Luna у апликацији за рачунаре. Ови модели још нису доступни у режиму Ћаскање. У OpenAI API-ју доступни су као gpt-6-sol и gpt-6-luna.
Да би услуга остала стабилна за све, планирамо да ове моделе постепено уводимо у ChatGPT током дана. Ако нове моделе не видите у режиму ChatGPT Work или систему Codex, покушајте поново касније.
Оцењивања модела GPT обављена су у нашем истраживачком окружењу или преко нашег API-ја, који због разлика у системским инструкцијама, доступним алаткама и сличном може давати нешто другачије резултате од продукционе верзије система ChatGPT. Оцене конкурентских модела преузете су из јавно доступних извештаја. Резултати за Claude Fable 5 наведени су када резултати за Claude Fable 5.1 нису били доступни.


