Водич за создавачи за GPT‑5.6
Технички сознанија од стартапи во продукција
Семејството модели GPT‑5.6 ги прави перформансите на агентите од гранично ниво драстично подостапни, а истовремено ги поместува границите на возможното.
Во овој водич покажуваме како стартапите користат попаметен избор на модели и нови контроли на API што помагаат за континуитет на расудувањето, оркестрација на повеќе агенти и програмско повикување алатки, за побрзо да создаваат поспособни агенти со многу помали трошоци.
Од GPT‑5 наваму, секоја генерација модели настојува да решава подолгорочни задачи со помалку токени. GPT‑5.6 продолжува во таа насока: подобри перформанси на агентите и пониски трошоци, со минимални промени во основната рамка.
Врвните подобрувања во исплатливоста дополнително се засилени со поголема точност при помал напор за расудување. На пример, на Agents’ Last Exam, GPT‑5.6 Sol со „низок“ напор за расудување го надмина GPT‑5.5 со „висок“ напор за расудување, при непроменета рамка. Слични успешни резултати забележавме и во продукциските тестирања, каде што стартапите пријавуваат значително намалување на трошоците во разни работни текови откако го намалиле напорот за расудување во однос на претходните стандардни поставки.
Историски гледано, надградбата на водечки модел со највисокото достапно ниво на расудување беше најдобрата опција за долгорочни случаи на употреба. Причината во голема мера беше тоа што овие модели се значително поспособни од моделите оптимизирани за трошоци при обработка на подолг контекст и повикување алатки. Тоа се промени со семејството 5.6: со повеќе пресметки при тестирањето, Luna и Terra често постигнуваат резултати слични на GPT‑5.4 и 5.5, но со значително пониски трошоци.
Да ги разгледаме задачите во BrowseComp, репер заснован на пребарување што ја тестира способноста на моделот да наоѓа тешко достапни факти. Пред три месеци, GPT‑5.5 (Многу висока) постигна 84,36% на овој репер, со вкупен трошок од 33,27 $. При лансирањето, GPT‑5.6 Luna (Многу висока) постигнува речиси исти перформанси, со резултат од 84,04% и трошок од 1,33 $. Оттогаш дополнително ги намаливме цените. Прочитајте повеќе за нашите најнови намалувања на цените.
Помалите модели од семејството 5.6 се одличен избор за обемни работни оптоварувања, интеракции чувствителни на доцнење и повторливи чекори во агентските работни текови. На пример, ако водите стартап за правна технологија што обработува рачно напишани белешки пред агентска анализа, сега можете да ги користите Terra или Luna за извлекување наместо граничен модел за целиот процес и значително да ги намалите трошоците.
Покрај тоа што GPT‑5.6 нуди подобри перформанси веднаш по поставувањето, воведовме и нови основни механизми во Responses API за дополнителни подобрувања. Го обучивме GPT‑5.6 од почеток до крај со три комплементарни архитектонски интервенции што им овозможуваат на агентите да работат поефикасно:
- Повторно користење на веќе завршената работа: со овозможување зачувување на расудувањето(се отвора во нов прозорец) низ повеќе чекори на моделот и со користење вградена компакција(се отвора во нов прозорец) за компресирање на долгите разговори, моделот може да ја задржи доследноста во работата на подолгорочни задачи без да се збуни или повторно да го создава претходниот контекст.
- Паралелна поделба кога е соодветно: користењето вградена оркестрација на повеќе агенти(се отвора во нов прозорец) овозможува координирање повеќе агенти во паралелни работни текови за побрзо завршување сложени задачи.
- Пренесување на детерминистичката работа во код: со програмско повикување алатки(се отвора во нов прозорец) за филтрирање, обединување и оркестрирање на излезите од алатките надвор од прозорецот за контекст на моделот, токените на моделот се зачувуваат за проценување, а се намалуваат трошоците, доцнењето и деградацијата на контекстот.
Кога се користат заедно, разликата може да биде огромна. На пример, на ARC-AGI-3, GPT‑5.6 Sol постигна 13,3% со стандардната рамка. Но, откако ги овозможивме зачуваното расудување и компакцијата, резултатот скокна на 38,3% — со приближно шестпати помалку излезни токени. Без промени во моделот, но со речиси тројно подобри перформанси. Повеќе информации може да прочитате во нашето истражување на рамката ARC-AGI-3.
Агентските работни текови често опфаќаат два вида работа:
- Задачи што бараат проценување
- Работа што главно бара преместување, филтрирање и комбинирање податоци
Кога агент презема 100 регулаторни поднесоци, ги филтрира според датум и ги утврдува релевантните трансакции, моделот не треба да расудува за секој меѓурезултат во својот прозорец за контекст. Програмското повикување алатки му овозможува на GPT‑5.6 да пишува JavaScript за оркестрирање алатки, паралелно да извршува независни повици и да ги обработува нивните излези надвор од прозорецот за контекст. Така, моделот може да се сосредоточи на она што бара интелигенција: примената на процена.
Кај сложените задачи што може да се извршуваат паралелно, распределувањето на дејствата и расудувањето меѓу повеќе агентски работни текови овозможува и побрзо завршување и повисока интелигенција. Во ваквите поставувања, главниот агент е одговорен за оркестрирање на подагентите и за делегирање задачи. Подагентите паралелно ги следат своите цели, а на крајот му ги враќаат резултатите на главниот агент за конечна синтеза. Тимовите можат веднаш да почнат да користат повеќе агенти со овозможување на функцијата за повеќе агенти(се отвора во нов прозорец) во Responses API. На овој начин функционира и поставката за способност Ultra во ChatGPT.
“Qualia користи тимови од агенти за отворени истражувачки проблеми, а GPT‑5.6 Sol едноставно се покажа како вистинскиот избор. Покажа значително подобрување во однос на GPT‑5.5, заврши побрзо од речиси секој друг модел што го тестиравме и брзо стана нашиот прв избор меѓу моделите на OpenAI.”
“GPT‑5.6 е најдобриот оркестратор што досега сме го виделе од OpenAI. Му зададовме шест спецификации одеднаш — да ги пишува, изработува и објаснува — и следеше сè без да опадне квалитетот.”
Иако GPT‑5.6 добро проценува колку подагенти се потребни и кога да ги активира, однесувањето со повеќе агенти може лесно да се насочува. Со инструкции за тоа кога моделот да повикува подагенти, се зголемува веројатноста тие да се активираат само кога дополнителната потрошувачка на токени би донела подобри перформанси.
Кај целото семејство модели, TTL на кешот за промпти е продолжен на најмалку 30 минути, а контролните точки на кешот сега може детерминистички да се поставуваат во прозорецот за контекст на моделот. Тоа им овозможи на стартапите значително да ја зголемат стапката на погодоци во кешот.
Покрај поставувањето контролни точки на кешот, континуираното користење соодветен prompt_cache_key(се отвора во нов прозорец) ја зголемува веројатноста барањата да стигнат до истиот механизам за инференција што претходно го обработил истиот префикс, со што се намалува доцнењето.
Во сите овие примери се издвојува огромната промена во економичноста на создавањето агенти.
Случаите на употреба за кои порано беше потребен граничен модел во секој чекор сега можат да постигнат споредливи или подобри резултати со многу помали трошоци, преку користење помали модели, приспособување на напорот за расудување и ефикасни архитектонски решенија.
Со нетрпение очекуваме да видиме што ќе создадете!
- 2026
- API платформа
За авторите
Овој водич го подготвија Samarth Madduru(се отвора во нов прозорец), Prashant Mital(се отвора во нов прозорец), Dave Leo(се отвора во нов прозорец) и Julien Reiman(се отвора во нов прозорец), врз основа на нивното искуство од тесната соработка со стартапи што создаваат решенија со GPT‑5.6, од раното тестирање до продукцијата.


