La guida a GPT‑5.6 per chi sviluppa
Lezioni tecniche dalle startup in produzione
La famiglia di modelli GPT‑5.6 rende le prestazioni degli agenti di frontiera molto più accessibili, ampliando al contempo i confini del possibile.
In questa guida mostriamo come le startup usano una selezione più intelligente dei modelli e nuovi controlli API per garantire la continuità del ragionamento, l’orchestrazione multi-agente e la chiamata programmatica degli strumenti, creando agenti più veloci e capaci a una frazione del costo.
Da GPT‑5 in poi, ogni generazione di modelli ha puntato ad affrontare attività di più lunga durata con meno token. GPT‑5.6 prosegue su questa traiettoria: agenti più performanti e costi inferiori, con modifiche minime all’infrastruttura sottostante.
Ai progressi generali nell’efficienza dei costi si aggiunge una maggiore accuratezza con un minore impegno di ragionamento. Ad esempio, in Agents’ Last Exam, GPT‑5.6 Sol con ragionamento “basso” ha superato GPT‑5.5 con ragionamento “alto”, a parità di infrastruttura. Abbiamo riscontrato risultati analoghi nei test in produzione: le startup segnalano notevoli riduzioni dei costi in diversi flussi di lavoro grazie a un impegno di ragionamento inferiore rispetto alle precedenti impostazioni predefinite.
Storicamente, per i casi d’uso di lunga durata, la scelta migliore era passare a un modello di punta con il massimo livello di ragionamento disponibile. Ciò dipendeva soprattutto dalla capacità nettamente superiore di questi modelli, rispetto a quelli ottimizzati per i costi, di gestire contesti più lunghi e chiamate agli strumenti. Con la famiglia 5.6 la situazione è cambiata: grazie a più risorse di calcolo in fase di esecuzione, Luna e Terra possono spesso offrire prestazioni simili a GPT‑5.4 e 5.5 a un costo molto inferiore.
Consideriamo le attività di BrowseComp, un benchmark basato sulla ricerca che verifica la capacità di un modello di trovare informazioni poco note. Tre mesi fa, GPT‑5.5 (Molto alto) ha ottenuto l’84,36% in questo benchmark, con un costo totale di 33,27 USD. Al lancio, GPT‑5.6 Luna (Molto alto) offre prestazioni sostanzialmente identiche, con un punteggio dell’84,04% e un costo di 1,33 USD. Da allora abbiamo ridotto ulteriormente i prezzi. Scopri di più sulle nostre ultime riduzioni di prezzo.
I modelli più piccoli della famiglia 5.6 sono particolarmente adatti ai carichi di lavoro ad alto volume, alle interazioni sensibili alla latenza e ai passaggi ripetuti nei flussi di lavoro agentici. Ad esempio, una startup legal-tech che analizza appunti scritti a mano prima dell’analisi agentica può ora usare Terra o Luna per l’estrazione, anziché un modello di frontiera per l’intero caso d’uso, ottenendo notevoli risparmi.
Oltre a migliorare le prestazioni pronte all’uso di GPT‑5.6, abbiamo introdotto nell’API Responses nuove primitive che consentono ulteriori progressi. Abbiamo addestrato GPT‑5.6 end-to-end con tre interventi architetturali complementari che consentono agli agenti di operare in modo più efficiente:
- Riutilizzare il lavoro già svolto: consentendo di mantenere il ragionamento(si apre in una nuova finestra) tra i turni del modello e usando il compattamento nativo(si apre in una nuova finestra) per comprimere le conversazioni prolungate, il modello può mantenere la coerenza del proprio lavoro nelle attività di più lunga durata, senza confondersi né dover ricostruire il contesto precedente.
- Scomporre in parallelo quando opportuno: l’uso dell’orchestrazione multi-agente nativa(si apre in una nuova finestra) permette di coordinare più agenti in flussi di lavoro paralleli per completare più rapidamente attività complesse.
- Spostare nel codice il lavoro deterministico: usare la chiamata programmatica degli strumenti(si apre in una nuova finestra) per filtrare, aggregare e orchestrare gli output degli strumenti al di fuori della finestra di contesto del modello, riservando i token del modello alle valutazioni e riducendo costi, latenza e deterioramento del contesto.
Usate insieme, queste funzionalità possono fare una differenza enorme. Ad esempio, in ARC-AGI-3, GPT‑5.6 Sol ha ottenuto il 13,3% con l’infrastruttura standard. Dopo aver abilitato il mantenimento del ragionamento e il compattamento, tuttavia, il punteggio è salito al 38,3%, usando circa sei volte meno token di output. Nessuna modifica al modello, ma prestazioni quasi triplicate. Puoi trovare maggiori informazioni nella nostra analisi dell’infrastruttura ARC-AGI-3.
I flussi di lavoro agentici spesso comprendono due tipi di attività:
- Attività che richiedono capacità di giudizio
- Lavoro che consiste soprattutto nello spostare, filtrare e combinare dati
Quando un agente recupera 100 documenti societari, li filtra per data e individua le transazioni pertinenti, il modello non dovrebbe dover ragionare su ogni risultato intermedio nella propria finestra di contesto. La chiamata programmatica degli strumenti consente a GPT‑5.6 di scrivere codice JavaScript per orchestrare gli strumenti, eseguire in parallelo chiamate indipendenti ed elaborarne gli output al di fuori della finestra di contesto. Il modello può così concentrarsi su ciò che richiede intelligenza: esprimere valutazioni.
Nelle attività complesse e parallelizzabili, distribuire azioni e ragionamento tra più flussi di lavoro degli agenti consente di completare il lavoro più velocemente e con un livello di ragionamento superiore. In queste configurazioni, l’agente principale ha il compito di orchestrare i sottoagenti e delegare loro le attività. I sottoagenti perseguono i rispettivi obiettivi in parallelo, quindi restituiscono i propri output all’agente principale per la sintesi finale. I team possono iniziare a sfruttare la funzionalità multi-agente in modo nativo abilitando la modalità multi-agente(si apre in una nuova finestra) nell’API Responses. È così che funziona anche l’impostazione di capacità Ultra in ChatGPT.
“Qualia impiega team di agenti per problemi di ricerca aperti e GPT‑5.6 Sol ha funzionato subito alla perfezione. Ha mostrato un netto miglioramento rispetto a GPT‑5.5, ha completato il lavoro più rapidamente di quasi tutti gli altri modelli testati ed è diventato in breve tempo il nostro modello OpenAI di riferimento.”
“GPT‑5.6 è il miglior orchestratore che abbiamo visto da OpenAI. Gli abbiamo affidato sei specifiche contemporaneamente, chiedendogli di scriverle, svilupparle e illustrarle tutte: ha tenuto traccia di ogni dettaglio senza alcun calo di qualità.”
Sebbene GPT‑5.6 sappia valutare bene quanti sottoagenti siano opportuni e quando crearli, il comportamento multi-agente è altamente configurabile tramite istruzioni. Indicare al modello quando richiamare i sottoagenti può aumentare la probabilità che gli agenti vengano creati solo quando la spesa aggiuntiva in token può migliorare le prestazioni.
Per l’intera famiglia di modelli, il TTL della cache dei prompt è stato esteso ad almeno 30 minuti e ora è possibile impostare in modo deterministico i punti di interruzione della cache nella finestra di contesto di un modello. Ciò ha consentito alle startup di migliorare notevolmente il tasso di riscontri nella cache.
Oltre a impostare i punti di interruzione della cache, continuare a usare una prompt_cache_key(si apre in una nuova finestra) appropriata aumenta la probabilità che le richieste siano indirizzate allo stesso motore di inferenza che in precedenza ha elaborato il medesimo prefisso, riducendo così la latenza.
Ciò che emerge da questi esempi è quanto sia cambiata l’economia dello sviluppo degli agenti.
I casi d’uso che un tempo richiedevano un modello di frontiera in ogni fase possono ora ottenere risultati analoghi o migliori a una frazione del costo, usando modelli più piccoli, regolando l’impegno di ragionamento e adottando scelte architetturali efficienti.
Non vediamo l’ora di scoprire cosa creerete!
- 2026
- Piattaforma API
Gli autori
Questa guida è stata realizzata da Samarth Madduru(si apre in una nuova finestra), Prashant Mital(si apre in una nuova finestra), Dave Leo(si apre in una nuova finestra) e Julien Reiman(si apre in una nuova finestra), sulla base dell’esperienza maturata lavorando a stretto contatto con startup che hanno sviluppato soluzioni su GPT‑5.6, dai primi test alla produzione.


