Пређите на главни садржај
OpenAI

Представљамо GPT‑6 Sol и Luna

Више начина да граничну интелигенцију укључите у свакодневни рад.

Учитавање…

Раније овог месеца представили смо GPT‑6 Astra, најинтелигентнији и најусклађенији модел на свету. Иако најзахтевнији и најважнији пројекти и даље захтевају пуну снагу модела Astra, посао се обавља у различитим обимима, ритмовима и буџетима.

Зато проширујемо свет модела GPT‑6 моделима GPT‑6 Sol и GPT‑6 Luna. GPT‑6 Astra је увео нову генерацију интелигенције, а ови модели помажу да њене предности постану доступније тако што померају границе трошковне ефикасности. GPT‑6 Sol и Luna обучени су методама сличним онима за GPT‑6 Astra, чиме су достигнућа која стоје иза врхунских перформанси модела Astra у професионалном раду, чињеничној тачности, програмирању, коришћењу рачунара и усклађености пренета на брже и приступачније моделе.

Модели GPT‑6 предњаче дуж целе криве односа цене и интелигенције, спајајући изузетне могућности на сваком нивоу са инфраструктуром која их ефикасно пружа у великом обиму. Побољшања кеширања и закључивања омогућавају нам да ове моделе пружамо по нижој цени, а ту уштеду директно преносимо на кориснике и клијенте тако што снижавамо API цене за Sol и Luna за 50% у односу на њихове промотивне цене за GPT‑5.6. Ова побољшања заједно чине напредну вештачку интелигенцију практичном за више свакодневних задатака и примену у великом обиму.

Цене за GPT‑6 API

Модел

Улаз

Излаз

Снижење цене

GPT‑6 Sol
у односу на GPT‑5.6 Sol

$4 → $2

20 $ → 10 $

50% јефтиније

GPT‑6 Luna
у односу на GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

50% јефтиније

Цене су за милион токена.

GPT‑6 Astra и даље је наш најбољи модел у свим областима. Изаберите га када желите најбоље резултате и искуство без компромиса.

Искорак у целој породици модела

GPT‑6 Sol и Luna унапређују интелигенцију и трошковну ефикасност модела које већ познајете и користите, посебно у могућностима најкориснијим за обављање сложених послова.

Професионални рад

GPT‑6 Sol може да преузме тешке пословне задатке, а виши лимити коришћења и нижа цена остављају вам више простора за понављање поступка. Нуди више интелигенције и боље резултате од конкурентских модела сличне цене.

На тесту AutomationBench, који обухвата пословне токове рада у више апликација, GPT‑6 Sol уз врло висок ниво труда надмашује Claude Opus 5 уз Max ниво труда, по само 9% цене модела Opus 5 по задатку. Уз висок ниво труда, GPT‑6 Luna надмашује претходника за 5,4 процентна поена, уз 58% нижу цену по задатку.

У тесту AutomationBench 1.0.6⁠(отвара се у новом прозору), агенти вештачке интелигенције тестирају се у комплетним токовима рада помоћу 47 алатки за продају, маркетинг, оперативне послове, подршку, финансије и људске ресурсе. Податак за Claude Fable 5.1 приказује нижу цену од стварне јер изоставља цену пребацивања на резервни модел Opus 5, до чега је дошло у око 40% задатака.

GPT‑6 Sol такође надмашује Claude Fable 5.1 по знатно нижој цени, па чак и GPT‑6 Astra уз низак ниво труда.

Модел (и ниво труда)

Резултат

Цена по задатку

GPT‑6 Sol (врло високо)

33,2%

0,27 $

GPT‑6 Astra (ниско)

30,3%

3,9x GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

11,1x GPT‑6 Sol

Claude Fable 5.1 са резервним моделом Opus 5 (Max)

31,4%

>8,9x GPT‑6 Sol

(цена резервног модела није наведена)

На тесту Agents’ Last Exam, који оцењује агенте у сложеним професионалним токовима рада, GPT‑6 Sol уз Max ниво труда постиже 56,4%, више од најбољег резултата модела Claude Opus 5 у овом оцењивању, уз 60% нижу цену по задатку.

У тесту Agents’ Last Exam V1⁠(отвара се у новом прозору), агенти вештачке интелигенције оцењују се на дуготрајним, економски вредним задацима из 55 подграна, који обухватају већину главних области професионалног рада на рачунару.

Чињенична тачност

Корисност одговора зависи од тачности чињеница, а ми настављамо да унапређујемо чињеничну поузданост. У нашем интерном оцењивању чињеничне тачности, заснованом на деидентификованим разговорима из стварног света у којима су корисници означили грешке наших модела, GPT‑6 Sol прави приближно упола мање грешака од свог претходника и приближава се поузданости модела Astra по знатно нижој цени. GPT‑6 Luna је такође знатно побољшан; при вишим нивоима труда достиже GPT‑5.6 Sol по приближно стотину пута нижој цени.

Овде оцењујемо чињеничну тачност на деидентификованим разговорима у систему ChatGPT у којима су корисници означили чињеничну грешку претходног модела. Ти разговори, осмишљени да изазову грешке, не представљају уобичајену употребу, у којој су чињеничне грешке ређе. Резултати нису прилагођени дужини, али су наша испитивања различитих нивоа опширности показала да дужина одговора готово нимало не утиче на њих.

Програмирање

Ове године агенти за програмирање почели су да решавају задатке који су сложенији, обимнији и дуготрајнији него икада раније. У компанији OpenAI наша интерна употреба расте експоненцијално. Према API ценама, дневна употреба токена премашила је 600 $ за истраживача на медијани и 7000 $ за истраживаче у 90. перцентилу (Убрзавање истраживања: поглед из компаније OpenAI⁠). Како агенти за програмирање преузимају дуже и захтевније задатке, цена континуиране употребе постаје све важнија. GPT‑6 Sol и Luna спајају снажне перформансе у програмирању са нижим API ценама, што програмерима оставља више простора за понављање поступка, а тимовима улива поверење да буду амбициознији у ономе што поверавају систему Codex.

На тесту FrontierCode, који оцењује да ли агенти за програмирање стварају измене спремне за спајање са стварним базама кода, GPT‑6 Sol знатно надмашује GPT‑5.6 Sol и достиже Claude Fable 5.1 уз врло висок ниво труда, по много нижој цени.

У тесту FrontierCode 1.1 Main⁠(отвара се у новом прозору), агенти вештачке интелигенције пишу код који се оцењује не само по исправности већ и по „погодности за спајање“, на пример по квалитету тестова, дисциплини обима, стилу кода и поштовању стандарда базе кода.

На тесту DeepSWE v1.1, који испитује перформансе у сложеним задацима софтверског инжењерства у стварним базама кода, GPT‑6 Sol уз Max ниво труда постиже 68,8%, што је 1,1 процентни поен мање од најбољег резултата модела Claude Fable 5 у овом оцењивању — 69,9% уз врло висок ниво труда — и то по приближно 80% нижој цени по задатку.

GPT‑6 Luna уз Max ниво труда постиже 66,6%, што је упоредиво са моделима Claude Opus 5 и Fable 5 уз средњи ниво труда. У овим поређењима, цена модела Luna по задатку нижа је 93% од цене модела Opus 5 и 96% од цене модела Fable 5.

У тесту DeepSWE 1.1⁠(отвара се у новом прозору), агенти вештачке интелигенције решавају оригиналне, дуготрајне задатке софтверског инжењерства.

Коришћење рачунара

Иако GPT‑6 Astra остаје најбољи модел на свету за коришћење рачунара, GPT‑6 Sol и Luna пружају трошковно ефикасније перформансе од својих претходника. На тесту OSWorld 2.0 offline, GPT‑6 Sol уз врло висок ниво труда постиже резултат сличан моделу Claude Opus 5 уз средњи ниво труда – 60,5% према 60,3% – по приближно 80% нижој цени по задатку. GPT‑6 Luna (Max) надмашује GPT‑5.6 Sol (средње) по десет пута нижој цени.

У тесту OSWorld 2.0⁠(отвара се у новом прозору), агенти вештачке интелигенције покушавају да изврше дуготрајне токове рада на рачунару који обухватају свакодневне и професионалне задатке. Наводимо делимичну награду на скупу ван мреже из издања v2026.08.08.

Стил сарадње

Побољшани стил комуникације модела GPT‑6 Astra пренели смо и на Sol и Luna, што ће, по нашем мишљењу, бити посебно приметно у техничким разговорима и разговорима о програмирању. Очекујте јасније одговоре, мање жаргона, мање необичних формулација и сувишних детаља, као и нешто краће одговоре који не губе суштину.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Иако је стил субјективан, овде нам се више допада одговор модела GPT‑6 Sol. Он не доноси пребрзо закључке, троши мање времена на понављање детаља који би могли бити очигледни особи која поставља питање (нпр. да веб-сајт има четири странице), користи мање неодређених израза (нпр. „бенто утисак“, „преобликовање… око тог система“), отвореније наводи шта јесте, а шта није проверио и не износи непотребне детаље имплементације, попут инструкције за алатку за слике.

Побољшање кеширања за агенте и дуге разговоре

Поред нижих цена токена, помажемо програмерима који развијају на моделу GPT‑6 да додатно уштеде на контексту који њихове апликације поново користе. Побољшали смо кеширање инструкције за GPT‑6 како бисмо подразумевано обезбедили већу стопу погодака кеша, што агентима омогућава да поново користе више контекста, брже одговарају и остваре попуст од 90% на читање кешираних улазних токена.

Програмери сада имају и више начина да мере и оптимизују учинак кеширања:

GitHub наводи да су током протеклих неколико месеци ова побољшања смањила удео токена инструкције који захтевају нову обраду за више од 50% у милијардама захтева ка моделима OpenAI, што помаже систему Copilot да брже одговара.

Наставак унапређивања усклађености

GPT‑6 Sol и Luna надовезују се на рад на усклађености представљен са моделом Astra, нашим до сада најусклађенијим моделом. У нашим оцењивањима усклађености, и Sol и Luna показују побољшања у односу на одговарајуће моделе GPT‑5.6, укључујући нижу стопу обмањујућих тврдњи о свом раду на програмирању.

Оцењивања у наставку намерно испитују изазовне ситуације и не мере стопе неуспеха у уобичајеној употреби. Комплетне резултате погледајте у системској картици⁠(отвара се у новом прозору).

Доступност

GPT‑6 Sol и GPT‑6 Luna од данас су доступни у режиму ChatGPT Work и систему Codex свим корисницима пакета Plus, Pro, Business, Enterprise и Edu. Корисници пакета Free и Go могу да приступе моделу GPT‑6 Luna у апликацији за рачунаре. Ови модели још нису доступни у режиму Ћаскање. У OpenAI API-ју доступни су као gpt-6-sol и gpt-6-luna.

Да би услуга остала стабилна за све, планирамо да ове моделе постепено уводимо у ChatGPT током дана. Ако нове моделе не видите у режиму ChatGPT Work или систему Codex, покушајте поново касније.


Оцењивања модела GPT обављена су у нашем истраживачком окружењу или преко нашег API-ја, који због разлика у системским инструкцијама, доступним алаткама и сличном може давати нешто другачије резултате од продукционе верзије система ChatGPT. Оцене конкурентских модела преузете су из јавно доступних извештаја. Резултати за Claude Fable 5 наведени су када резултати за Claude Fable 5.1 нису били доступни.

Аутор

OpenAI