Ghidul dezvoltatorului pentru GPT‑5.6
Lecții tehnice de la start-upuri cu sisteme în producție
Familia de modele GPT‑5.6 face performanța agenților de vârf mult mai accesibilă și extinde totodată limitele posibilităților.
În acest ghid, arătăm cum folosesc start-upurile selectarea mai inteligentă a modelelor și noile comenzi API pentru continuitatea raționamentului, orchestrarea multi-agent și apelarea programatică a instrumentelor, astfel încât să creeze mai rapid agenți mai capabili, la o fracțiune din cost.
Începând cu GPT‑5, fiecare generație de modele a urmărit să rezolve sarcini pe termen mai lung folosind mai puține tokenuri. GPT‑5.6 continuă această evoluție: performanțe mai bune ale agenților și costuri mai mici, cu modificări minime ale cadrului de testare existent.
Creșterea generală a eficienței costurilor este amplificată de precizia mai mare obținută cu un efort de raționament redus. De exemplu, în Agents’ Last Exam, GPT‑5.6 Sol cu raționament „scăzut” a depășit GPT‑5.5 cu raționament „ridicat”, folosind același cadru de testare. Am observat rezultate similare în testele de producție, unde start-upurile raportează reduceri semnificative ale costurilor pentru diverse fluxuri de lucru prin scăderea efortului de raționament față de valorile implicite anterioare.
În mod tradițional, trecerea la un model de vârf cu cel mai înalt nivel de raționament disponibil era cea mai bună opțiune pentru cazurile de utilizare de lungă durată. Motivul principal era că aceste modele gestionau contexte mai lungi și apelarea instrumentelor mult mai bine decât modelele optimizate pentru costuri. Acest lucru s-a schimbat odată cu familia 5.6: beneficiind de mai multe resurse de calcul în timpul testării, Luna și Terra pot oferi adesea performanțe similare cu GPT‑5.4 și 5.5, la costuri mult mai mici.
Să luăm ca exemplu sarcinile din BrowseComp, un benchmark bazat pe căutare care testează capacitatea unui model de a găsi informații greu accesibile. Acum trei luni, GPT‑5.5 (Foarte ridicat) a obținut 84,36% în acest benchmark, la un cost total de 33,27 USD. La lansare, GPT‑5.6 Luna (Foarte ridicat) oferă practic aceeași performanță: un scor de 84,04% la un cost de 1,33 USD. Între timp, am redus și mai mult prețurile. Citește mai multe despre cele mai recente reduceri de prețuri.
Modelele mai mici din familia 5.6 sunt potrivite pentru sarcini cu volum mare, interacțiuni sensibile la latență și etape repetitive din fluxurile de lucru cu agenți. De exemplu, dacă administrezi un start-up de tehnologie juridică ce procesează note scrise de mână înaintea analizei efectuate de agenți, acum poți folosi Terra sau Luna pentru extragere, în locul unui model de vârf pentru întregul proces, obținând economii semnificative.
Pe lângă îmbunătățirea performanței implicite a GPT‑5.6, am introdus în API-ul Responses noi componente de bază care permit optimizări suplimentare. Am instruit GPT‑5.6 integral, folosind trei intervenții arhitecturale complementare care le permit agenților să funcționeze mai eficient:
- Reutilizarea muncii deja efectuate: prin păstrarea raționamentului(se deschide într-o fereastră nouă) între interacțiunile cu modelul și folosirea compactării native(se deschide într-o fereastră nouă) pentru comprimarea conversațiilor de lungă durată, modelul își poate menține coerența pe parcursul sarcinilor mai îndelungate, fără confuzie și fără a trebui să reconstruiască vechiul context.
- Descompunere paralelă acolo unde este cazul: orchestrarea multi-agent nativă(se deschide într-o fereastră nouă) permite coordonarea mai multor agenți în fluxuri de lucru paralele, pentru finalizarea mai rapidă a sarcinilor complexe.
- Transferarea operațiunilor deterministe în cod: apelarea programatică a instrumentelor(se deschide într-o fereastră nouă) permite filtrarea, agregarea și orchestrarea rezultatelor instrumentelor în afara ferestrei contextuale a modelului, rezervând tokenurile modelului pentru evaluare și reducând costurile, latența și degradarea contextului.
Folosite împreună, aceste funcții pot produce o diferență spectaculoasă. De exemplu, la ARC-AGI-3, GPT‑5.6 Sol a obținut 13,3% cu cadrul de testare standard. După activarea păstrării raționamentului și a compactării, scorul a urcat însă la 38,3%, folosind de aproximativ șase ori mai puține tokenuri de ieșire. Fără modificări ale modelului, dar cu performanțe aproape triple. Poți afla mai multe din analiza noastră privind cadrul de testare ARC-AGI-3.
Fluxurile de lucru cu agenți implică adesea două tipuri de activități:
- Sarcini care necesită evaluare
- Operațiuni care constau în principal în transferarea, filtrarea și combinarea datelor
Când un agent preia 100 de documente oficiale, le filtrează după dată și identifică tranzacțiile relevante, modelul nu ar trebui să analizeze fiecare rezultat intermediar în fereastra sa contextuală. Apelarea programatică a instrumentelor permite GPT‑5.6 să scrie cod JavaScript pentru a orchestra instrumente, a executa în paralel apeluri independente și a procesa rezultatele în afara ferestrei contextuale. Astfel, modelul se poate concentra asupra activității care necesită inteligență: evaluarea.
În cazul sarcinilor complexe care pot fi paralelizate, distribuirea acțiunilor și a raționamentului între mai multe fluxuri de lucru ale agenților permite atât finalizarea mai rapidă, cât și un nivel mai înalt de inteligență. În aceste configurații, agentul principal orchestrează subagenții și le deleagă sarcini. Subagenții își urmăresc obiectivele în paralel, apoi îi transmit rezultatele agentului principal pentru sinteza finală. Echipele pot începe să folosească nativ configurațiile multi-agent prin activarea funcției multi-agent(se deschide într-o fereastră nouă) în API-ul Responses. La fel funcționează și setarea de capabilitate Ultra din ChatGPT.
“Qualia coordonează echipe de agenți pentru probleme de cercetare fără răspuns prestabilit, iar GPT‑5.6 Sol pur și simplu a funcționat perfect. A demonstrat o îmbunătățire clară față de GPT‑5.5, a terminat mai repede decât aproape toate celelalte modele testate și a devenit rapid modelul OpenAI pe care îl folosim implicit.”
“GPT‑5.6 este cel mai bun orchestrator pe care l-am văzut de la OpenAI. I-am dat simultan șase specificații (trebuia să scrie, să construiască și să le explice pe toate) și a ținut evidența tuturor fără nicio scădere a calității.”
Deși GPT‑5.6 estimează bine numărul adecvat de subagenți și momentul în care trebuie să-i creeze, comportamentul multi-agent poate fi controlat foarte precis. Instrucțiunile care îi indică modelului când să apeleze subagenții pot crește probabilitatea ca aceștia să fie creați doar în situațiile în care consumul suplimentar de tokenuri ar îmbunătăți performanța.
Pentru întreaga familie de modele, durata de viață a cache-ului solicitărilor a fost extinsă la minimum 30 de minute, iar punctele de întrerupere a cache-ului pot fi acum stabilite determinist în fereastra contextuală a modelului. Astfel, start-upurile și-au putut îmbunătăți semnificativ rata de găsire a datelor în cache.
Pe lângă stabilirea punctelor de întrerupere a cache-ului, utilizarea în continuare a unei valori prompt_cache_key(se deschide într-o fereastră nouă) adecvate crește probabilitatea ca cererile să ajungă la același motor de inferență care a procesat anterior același prefix, reducând astfel latența.
Aceste exemple evidențiază cât de mult s-au schimbat aspectele economice ale dezvoltării agenților.
Cazurile de utilizare care necesitau cândva un model de vârf la fiecare etapă pot obține acum rezultate comparabile sau mai bune la o fracțiune din cost, folosind modele mai mici, ajustând efortul de raționament și adoptând opțiuni arhitecturale eficiente.
Abia așteptăm să vedem ce vei crea!
- 2026
- Platforma API
Despre autori
Acest ghid a fost realizat de Samarth Madduru(se deschide într-o fereastră nouă), Prashant Mital(se deschide într-o fereastră nouă), Dave Leo(se deschide într-o fereastră nouă) și Julien Reiman(se deschide într-o fereastră nouă), pe baza experienței lor de colaborare strânsă cu start-upuri care au dezvoltat soluții pe GPT‑5.6, de la testarea inițială până la producție.


