Прескокни до главната содржина
OpenAI

13 август 2026 г.

Применета вештачка интелигенција

Водич за создавачи за GPT‑5.6

Технички сознанија од стартапи во продукција

Се вчитува...

GPT‑5.6 поставува нов стандард за односот меѓу цената и перформансите

Семејството модели GPT‑5.6 ги прави перформансите на агентите од гранично ниво драстично подостапни, а истовремено ги поместува границите на возможното.

Во овој водич покажуваме како стартапите користат попаметен избор на модели и нови контроли на API што помагаат за континуитет на расудувањето, оркестрација на повеќе агенти и програмско повикување алатки, за побрзо да создаваат поспособни агенти со многу помали трошоци.

Подобро искуство веднаш по поставувањето

Од GPT‑5 наваму, секоја генерација модели настојува да решава подолгорочни задачи со помалку токени. GPT‑5.6 продолжува во таа насока: подобри перформанси на агентите и пониски трошоци, со минимални промени во основната рамка.

Врвните подобрувања во исплатливоста дополнително се засилени со поголема точност при помал напор за расудување. На пример, на Agents’ Last Exam, GPT‑5.6 Sol со „низок“ напор за расудување го надмина GPT‑5.5 со „висок“ напор за расудување, при непроменета рамка. Слични успешни резултати забележавме и во продукциските тестирања, каде што стартапите пријавуваат значително намалување на трошоците во разни работни текови откако го намалиле напорот за расудување во однос на претходните стандардни поставки.

Го вклучивме GPT‑5.6 во нашата рамка, а нискиот напор за расудување ни ги донесе најдобрите резултати. Препознаваше кога податоците едноставно ги нема, не следеше погрешни траги и стигнуваше до точниот одговор со помалку токени.
— Изи Милер, раководител за истражување на ВИ, Hex(се отвора во нов прозорец)

Избор на модел

Историски гледано, надградбата на водечки модел со највисокото достапно ниво на расудување беше најдобрата опција за долгорочни случаи на употреба. Причината во голема мера беше тоа што овие модели се значително поспособни од моделите оптимизирани за трошоци при обработка на подолг контекст и повикување алатки. Тоа се промени со семејството 5.6: со повеќе пресметки при тестирањето, Luna и Terra често постигнуваат резултати слични на GPT‑5.4 и 5.5, но со значително пониски трошоци.

1 од 3
Luna задржува 98% од точноста на GPT‑5.5 при извлекување, со само една осумнаесеттина од трошокот. Така, нашите агенти добиваат висококвалитетно разбирање документи по цена што го прави практично за многу повеќе работни текови.
— Серхии Шчохолиев, раководител на инженерскиот тим за агенти, Hypha(се отвора во нов прозорец)

Да ги разгледаме задачите во BrowseComp, репер заснован на пребарување што ја тестира способноста на моделот да наоѓа тешко достапни факти. Пред три месеци, GPT‑5.5 (Многу висока) постигна 84,36% на овој репер, со вкупен трошок од 33,27 $. При лансирањето, GPT‑5.6 Luna (Многу висока) постигнува речиси исти перформанси, со резултат од 84,04% и трошок од 1,33 $. Оттогаш дополнително ги намаливме цените. Прочитајте повеќе за нашите најнови намалувања на цените.

Помалите модели од семејството 5.6 се одличен избор за обемни работни оптоварувања, интеракции чувствителни на доцнење и повторливи чекори во агентските работни текови. На пример, ако водите стартап за правна технологија што обработува рачно напишани белешки пред агентска анализа, сега можете да ги користите Terra или Luna за извлекување наместо граничен модел за целиот процес и значително да ги намалите трошоците.

Развој на Responses API за проектирање поефикасни агенти

Покрај тоа што GPT‑5.6 нуди подобри перформанси веднаш по поставувањето, воведовме и нови основни механизми во Responses API за дополнителни подобрувања. Го обучивме GPT‑5.6 од почеток до крај со три комплементарни архитектонски интервенции што им овозможуваат на агентите да работат поефикасно:

  1. Повторно користење на веќе завршената работа: со овозможување зачувување на расудувањето(се отвора во нов прозорец) низ повеќе чекори на моделот и со користење вградена компакција(се отвора во нов прозорец) за компресирање на долгите разговори, моделот може да ја задржи доследноста во работата на подолгорочни задачи без да се збуни или повторно да го создава претходниот контекст.
  2. Паралелна поделба кога е соодветно: користењето вградена оркестрација на повеќе агенти(се отвора во нов прозорец) овозможува координирање повеќе агенти во паралелни работни текови за побрзо завршување сложени задачи.
  3. Пренесување на детерминистичката работа во код: со програмско повикување алатки(се отвора во нов прозорец) за филтрирање, обединување и оркестрирање на излезите од алатките надвор од прозорецот за контекст на моделот, токените на моделот се зачувуваат за проценување, а се намалуваат трошоците, доцнењето и деградацијата на контекстот.

Кога се користат заедно, разликата може да биде огромна. На пример, на ARC-AGI-3, GPT‑5.6 Sol постигна 13,3% со стандардната рамка. Но, откако ги овозможивме зачуваното расудување и компакцијата, резултатот скокна на 38,3% — со приближно шестпати помалку излезни токени. Без промени во моделот, но со речиси тројно подобри перформанси. Повеќе информации може да прочитате во нашето истражување на рамката ARC-AGI-3.

Програмско повикување алатки

Агентските работни текови често опфаќаат два вида работа:

  1. Задачи што бараат проценување
  2. Работа што главно бара преместување, филтрирање и комбинирање податоци

Кога агент презема 100 регулаторни поднесоци, ги филтрира според датум и ги утврдува релевантните трансакции, моделот не треба да расудува за секој меѓурезултат во својот прозорец за контекст. Програмското повикување алатки му овозможува на GPT‑5.6 да пишува JavaScript за оркестрирање алатки, паралелно да извршува независни повици и да ги обработува нивните излези надвор од прозорецот за контекст. Така, моделот може да се сосредоточи на она што бара интелигенција: примената на процена.

Кај финансиските истражувања, тешкиот дел е сигурното преземање регулаторни поднесоци, координирањето на алатките и обработката на бројките. Во нашите евалуации, GPT‑5.6 со програмско повикување алатки го постигна квалитетот предвиден со нашите критериуми, користејќи 21% помалку влезни токени. Токму тоа е разликата меѓу агент што може да разговара за финансиско истражување и агент што навистина може да го спроведе.
— Алекс Ванг, применета ВИ, Rogo(се отвора во нов прозорец)

Повеќе агенти

Кај сложените задачи што може да се извршуваат паралелно, распределувањето на дејствата и расудувањето меѓу повеќе агентски работни текови овозможува и побрзо завршување и повисока интелигенција. Во ваквите поставувања, главниот агент е одговорен за оркестрирање на подагентите и за делегирање задачи. Подагентите паралелно ги следат своите цели, а на крајот му ги враќаат резултатите на главниот агент за конечна синтеза. Тимовите можат веднаш да почнат да користат повеќе агенти со овозможување на функцијата за повеќе агенти(се отвора во нов прозорец) во Responses API. На овој начин функционира и поставката за способност Ultra во ChatGPT.

1 од 2
Qualia користи тимови од агенти за отворени истражувачки проблеми, а GPT‑5.6 Sol едноставно се покажа како вистинскиот избор. Покажа значително подобрување во однос на GPT‑5.5, заврши побрзо од речиси секој друг модел што го тестиравме и брзо стана нашиот прв избор меѓу моделите на OpenAI.
— Е Чи, основач, Quadrillion(се отвора во нов прозорец)

Иако GPT‑5.6 добро проценува колку подагенти се потребни и кога да ги активира, однесувањето со повеќе агенти може лесно да се насочува. Со инструкции за тоа кога моделот да повикува подагенти, се зголемува веројатноста тие да се активираат само кога дополнителната потрошувачка на токени би донела подобри перформанси.

Кеширање промпт

Кај целото семејство модели, TTL на кешот за промпти е продолжен на најмалку 30 минути, а контролните точки на кешот сега може детерминистички да се поставуваат во прозорецот за контекст на моделот. Тоа им овозможи на стартапите значително да ја зголемат стапката на погодоци во кешот.

Додадовме контролни точки на кешот и клучеви специфични за работниот простор во заеднички промпт од 29.000 токени и го намаливме некешираниот влез за 28%. И 30-минутниот период на кеширање донесе голем напредок: нашите агенти можеа повторно да го користат истиот контекст во повеќе извршувања, наместо секојпат да почнуваат од почеток.
— Лоренцо Џентиле, инженер за ВИ, Ploy(се отвора во нов прозорец)

Покрај поставувањето контролни точки на кешот, континуираното користење соодветен prompt_cache_key(се отвора во нов прозорец) ја зголемува веројатноста барањата да стигнат до истиот механизам за инференција што претходно го обработил истиот префикс, со што се намалува доцнењето.

Заклучок

Во сите овие примери се издвојува огромната промена во економичноста на создавањето агенти.

Случаите на употреба за кои порано беше потребен граничен модел во секој чекор сега можат да постигнат споредливи или подобри резултати со многу помали трошоци, преку користење помали модели, приспособување на напорот за расудување и ефикасни архитектонски решенија.

Со нетрпение очекуваме да видиме што ќе создадете!

  • 2026
  • API платформа

За авторите

Овој водич го подготвија Samarth Madduru(се отвора во нов прозорец), Prashant Mital(се отвора во нов прозорец), Dave Leo(се отвора во нов прозорец) и Julien Reiman(се отвора во нов прозорец), врз основа на нивното искуство од тесната соработка со стартапи што создаваат решенија со GPT‑5.6, од раното тестирање до продукцијата.