Sari la conținutul principal
OpenAI

13 august 2026

AI aplicată

Ghidul dezvoltatorului pentru GPT‑5.6

Lecții tehnice de la start-upuri cu sisteme în producție

Se încarcă…

GPT‑5.6 stabilește un nou standard pentru raportul preț-performanță

Familia de modele GPT‑5.6 face performanța agenților de vârf mult mai accesibilă și extinde totodată limitele posibilităților.

În acest ghid, arătăm cum folosesc start-upurile selectarea mai inteligentă a modelelor și noile comenzi API pentru continuitatea raționamentului, orchestrarea multi-agent și apelarea programatică a instrumentelor, astfel încât să creeze mai rapid agenți mai capabili, la o fracțiune din cost.

O experiență implicită mai bună

Începând cu GPT‑5, fiecare generație de modele a urmărit să rezolve sarcini pe termen mai lung folosind mai puține tokenuri. GPT‑5.6 continuă această evoluție: performanțe mai bune ale agenților și costuri mai mici, cu modificări minime ale cadrului de testare existent.

Creșterea generală a eficienței costurilor este amplificată de precizia mai mare obținută cu un efort de raționament redus. De exemplu, în Agents’ Last Exam, GPT‑5.6 Sol cu raționament „scăzut” a depășit GPT‑5.5 cu raționament „ridicat”, folosind același cadru de testare. Am observat rezultate similare în testele de producție, unde start-upurile raportează reduceri semnificative ale costurilor pentru diverse fluxuri de lucru prin scăderea efortului de raționament față de valorile implicite anterioare.

Am integrat GPT‑5.6 în cadrul nostru de testare, iar un efort redus de raționament ne-a oferit cele mai bune rezultate. A știut când datele pur și simplu nu existau, nu a urmat piste greșite și a ajuns la răspunsul corect folosind mai puține tokenuri.
— Izzy Miller, coordonator cercetare IA, Hex(se deschide într-o fereastră nouă)

Selectarea modelului

În mod tradițional, trecerea la un model de vârf cu cel mai înalt nivel de raționament disponibil era cea mai bună opțiune pentru cazurile de utilizare de lungă durată. Motivul principal era că aceste modele gestionau contexte mai lungi și apelarea instrumentelor mult mai bine decât modelele optimizate pentru costuri. Acest lucru s-a schimbat odată cu familia 5.6: beneficiind de mai multe resurse de calcul în timpul testării, Luna și Terra pot oferi adesea performanțe similare cu GPT‑5.4 și 5.5, la costuri mult mai mici.

1 din 3
Luna păstrează 98% din precizia de extragere a GPT‑5.5, la un cost de 18 ori mai mic. Astfel, agenții noștri pot înțelege documentele la un nivel înalt de calitate și la un preț care face ca utilizarea să fie practică în mult mai multe fluxuri de lucru.
— Serhii Shchoholiev, coordonator inginerie, agenți, Hypha(se deschide într-o fereastră nouă)

Să luăm ca exemplu sarcinile din BrowseComp, un benchmark bazat pe căutare care testează capacitatea unui model de a găsi informații greu accesibile. Acum trei luni, GPT‑5.5 (Foarte ridicat) a obținut 84,36% în acest benchmark, la un cost total de 33,27 USD. La lansare, GPT‑5.6 Luna (Foarte ridicat) oferă practic aceeași performanță: un scor de 84,04% la un cost de 1,33 USD. Între timp, am redus și mai mult prețurile. Citește mai multe despre cele mai recente reduceri de prețuri.

Modelele mai mici din familia 5.6 sunt potrivite pentru sarcini cu volum mare, interacțiuni sensibile la latență și etape repetitive din fluxurile de lucru cu agenți. De exemplu, dacă administrezi un start-up de tehnologie juridică ce procesează note scrise de mână înaintea analizei efectuate de agenți, acum poți folosi Terra sau Luna pentru extragere, în locul unui model de vârf pentru întregul proces, obținând economii semnificative.

Evoluția API-ului Responses pentru proiectarea unor agenți mai eficienți

Pe lângă îmbunătățirea performanței implicite a GPT‑5.6, am introdus în API-ul Responses noi componente de bază care permit optimizări suplimentare. Am instruit GPT‑5.6 integral, folosind trei intervenții arhitecturale complementare care le permit agenților să funcționeze mai eficient:

  1. Reutilizarea muncii deja efectuate: prin păstrarea raționamentului(se deschide într-o fereastră nouă) între interacțiunile cu modelul și folosirea compactării native(se deschide într-o fereastră nouă) pentru comprimarea conversațiilor de lungă durată, modelul își poate menține coerența pe parcursul sarcinilor mai îndelungate, fără confuzie și fără a trebui să reconstruiască vechiul context.
  2. Descompunere paralelă acolo unde este cazul: orchestrarea multi-agent nativă(se deschide într-o fereastră nouă) permite coordonarea mai multor agenți în fluxuri de lucru paralele, pentru finalizarea mai rapidă a sarcinilor complexe.
  3. Transferarea operațiunilor deterministe în cod: apelarea programatică a instrumentelor(se deschide într-o fereastră nouă) permite filtrarea, agregarea și orchestrarea rezultatelor instrumentelor în afara ferestrei contextuale a modelului, rezervând tokenurile modelului pentru evaluare și reducând costurile, latența și degradarea contextului.

Folosite împreună, aceste funcții pot produce o diferență spectaculoasă. De exemplu, la ARC-AGI-3, GPT‑5.6 Sol a obținut 13,3% cu cadrul de testare standard. După activarea păstrării raționamentului și a compactării, scorul a urcat însă la 38,3%, folosind de aproximativ șase ori mai puține tokenuri de ieșire. Fără modificări ale modelului, dar cu performanțe aproape triple. Poți afla mai multe din analiza noastră privind cadrul de testare ARC-AGI-3.

Apelarea programatică a instrumentelor

Fluxurile de lucru cu agenți implică adesea două tipuri de activități:

  1. Sarcini care necesită evaluare
  2. Operațiuni care constau în principal în transferarea, filtrarea și combinarea datelor

Când un agent preia 100 de documente oficiale, le filtrează după dată și identifică tranzacțiile relevante, modelul nu ar trebui să analizeze fiecare rezultat intermediar în fereastra sa contextuală. Apelarea programatică a instrumentelor permite GPT‑5.6 să scrie cod JavaScript pentru a orchestra instrumente, a executa în paralel apeluri independente și a procesa rezultatele în afara ferestrei contextuale. Astfel, modelul se poate concentra asupra activității care necesită inteligență: evaluarea.

În cercetarea financiară, partea dificilă este să preiei fiabil documentele oficiale, să coordonezi instrumentele și să analizezi cifrele. În evaluările noastre, GPT‑5.6 cu apelarea programatică a instrumentelor a atins nivelul de calitate din grila noastră folosind cu 21% mai puține tokenuri de intrare. Aceasta este diferența dintre un agent care poate discuta despre cercetarea financiară și unul care o poate realiza efectiv.
— Alex Wang, IA aplicată, Rogo(se deschide într-o fereastră nouă)

Multi-agent

În cazul sarcinilor complexe care pot fi paralelizate, distribuirea acțiunilor și a raționamentului între mai multe fluxuri de lucru ale agenților permite atât finalizarea mai rapidă, cât și un nivel mai înalt de inteligență. În aceste configurații, agentul principal orchestrează subagenții și le deleagă sarcini. Subagenții își urmăresc obiectivele în paralel, apoi îi transmit rezultatele agentului principal pentru sinteza finală. Echipele pot începe să folosească nativ configurațiile multi-agent prin activarea funcției multi-agent(se deschide într-o fereastră nouă) în API-ul Responses. La fel funcționează și setarea de capabilitate Ultra din ChatGPT.

1 din 2
Qualia coordonează echipe de agenți pentru probleme de cercetare fără răspuns prestabilit, iar GPT‑5.6 Sol pur și simplu a funcționat perfect. A demonstrat o îmbunătățire clară față de GPT‑5.5, a terminat mai repede decât aproape toate celelalte modele testate și a devenit rapid modelul OpenAI pe care îl folosim implicit.
— E Chi, fondator, Quadrillion(se deschide într-o fereastră nouă)

Deși GPT‑5.6 estimează bine numărul adecvat de subagenți și momentul în care trebuie să-i creeze, comportamentul multi-agent poate fi controlat foarte precis. Instrucțiunile care îi indică modelului când să apeleze subagenții pot crește probabilitatea ca aceștia să fie creați doar în situațiile în care consumul suplimentar de tokenuri ar îmbunătăți performanța.

Memorarea în cache a solicitărilor

Pentru întreaga familie de modele, durata de viață a cache-ului solicitărilor a fost extinsă la minimum 30 de minute, iar punctele de întrerupere a cache-ului pot fi acum stabilite determinist în fereastra contextuală a modelului. Astfel, start-upurile și-au putut îmbunătăți semnificativ rata de găsire a datelor în cache.

Am adăugat puncte de întrerupere a cache-ului și chei specifice spațiului de lucru la o solicitare comună de 29.000 de tokenuri și am redus cu 28% volumul de date de intrare nestocate în cache. Fereastra de cache de 30 de minute a reprezentat și ea un progres important: agenții noștri au putut reutiliza același context de la o execuție la alta, în loc să pornească de la zero.
— Lorenzo Gentile, inginer IA, Ploy(se deschide într-o fereastră nouă)

Pe lângă stabilirea punctelor de întrerupere a cache-ului, utilizarea în continuare a unei valori prompt_cache_key(se deschide într-o fereastră nouă) adecvate crește probabilitatea ca cererile să ajungă la același motor de inferență care a procesat anterior același prefix, reducând astfel latența.

Concluzie

Aceste exemple evidențiază cât de mult s-au schimbat aspectele economice ale dezvoltării agenților.

Cazurile de utilizare care necesitau cândva un model de vârf la fiecare etapă pot obține acum rezultate comparabile sau mai bune la o fracțiune din cost, folosind modele mai mici, ajustând efortul de raționament și adoptând opțiuni arhitecturale eficiente.

Abia așteptăm să vedem ce vei crea!

  • 2026
  • Platforma API

Despre autori

Acest ghid a fost realizat de Samarth Madduru(se deschide într-o fereastră nouă), Prashant Mital(se deschide într-o fereastră nouă), Dave Leo(se deschide într-o fereastră nouă) și Julien Reiman(se deschide într-o fereastră nouă), pe baza experienței lor de colaborare strânsă cu start-upuri care au dezvoltat soluții pe GPT‑5.6, de la testarea inițială până la producție.