Guida ai modelli della famiglia GPT‑6
Consigli pratici per ottenere i migliori risultati dai modelli GPT‑6 gestendo tempi e costi
GPT‑6 è la nostra suite di modelli più avanzata di sempre e offre una scelta di modelli per diversi tipi di lavoro.
Che tu voglia trasformare un’idea in un prototipo funzionante, sviluppare e testare una funzionalità o orchestrare flussi di lavoro in più passaggi tra repository di codice, database e API esterne, questa guida spiega come scegliere un modello GPT‑6, dargli istruzioni efficaci, gestire attività di lunga durata e prepararti alla produzione.

Opera in modo efficace in produzione. Usa il caching(si apre in una nuova finestra) e il compattamento(si apre in una nuova finestra) per gestire contesto e costi. Misura il successo delle attività e la latenza, e pianifica il monitoraggio e i controlli sui dati.
Scegli il modello adatto al carico di lavoro. Bilancia capacità, costi e latenza scegliendo il modello, lo sforzo di ragionamento(si apre in una nuova finestra) e la velocità adatti all’attività.
Adatta prompt e skill. Mantieni coerenti prompt, skill e istruzioni del repository su cosa deve produrre il modello, cosa può fare in autonomia e quando il lavoro si considera concluso.
Mantieni la rotta nelle attività di lunga durata. Usa istruzioni in corso d’opera(si apre in una nuova finestra), strumenti asincroni(si apre in una nuova finestra) e delega(si apre in una nuova finestra) per gestire aggiornamenti e attività indipendenti. Stabilisci criteri chiari per indicare quando il modello deve chiedere il tuo intervento.
Prima del rilascio, è bene predisporre alcuni controlli e adottare le pratiche consigliate.
Tieni presente l’efficienza. (si apre in una nuova finestra)Elimina il contesto non necessario all’attività(si apre in una nuova finestra), conservando i riscontri utili. Se l’applicazione lo consente, esegui insieme le attività indipendenti(si apre in una nuova finestra), così un passaggio lento non bloccherà il lavoro non correlato.
Riutilizza il contesto condiviso tramite il caching dei prompt(si apre in una nuova finestra) per le attività ricorrenti. I token di input nella cache costano fino al 95% in meno(si apre in una nuova finestra) rispetto a quelli non memorizzati nella cache, a seconda del modello. Inserisci le istruzioni stabili e il materiale di riferimento prima dei dettagli variabili dell’attività e mantieni coerenti le definizioni degli strumenti. La dashboard del caching(si apre in una nuova finestra) e la guida alla diagnostica(si apre in una nuova finestra) ti aiutano a capire dove il riutilizzo si interrompe. Nel calcolare il costo di un intero flusso di lavoro, includi le scritture nella cache e le eventuali tariffe per contesti lunghi.
Nelle conversazioni più lunghe, il compattamento(si apre in una nuova finestra) riduce le dimensioni del contesto, preservando lo stato necessario per proseguire.
Decidi come monitorare il comportamento(si apre in una nuova finestra) ed esamina i controlli sui dati(si apre in una nuova finestra) per la tua applicazione.
Esegui test prima del rilascio: prova attività rappresentative e misura successo, latenza e costo per attività riuscita. Consulta la nostra checklist per il rilascio con l’API(si apre in una nuova finestra).
Considera la scelta del modello e del livello di ragionamento come un compromesso tra intelligenza e prezzo.
Modello:
GPT‑6 Astra(si apre in una nuova finestra) per le attività di ragionamento più difficili, che richiedono la massima intelligenza.
GPT‑6.1 Sol(si apre in una nuova finestra) per attività complesse di programmazione, ricerca e uso del computer.
GPT‑6 Luna(si apre in una nuova finestra) per attività mirate su larga scala e lavori quotidiani ripetitivi con un obiettivo chiaro, come estrarre campi dalle fatture, classificare richieste o produrre riepiloghi strutturati.
Quando valuti il modello più adatto all’attività, confronta i prezzi(si apre in una nuova finestra) di ciascun modello.
Livello di ragionamento: nell’API, scegli quanto impegno il modello deve dedicare all’attività.
Basso: attività di routine, come estrarre fatti o apportare piccole modifiche.
Medio: attività che richiedono capacità di giudizio, come pianificare una funzionalità o confrontare opzioni.
Alto: debugging difficile, analisi approfondite o revisioni accurate.
Molto alto / Max: provali, se supportati, quando Alto non basta e mantienili solo se il miglioramento giustifica l’aumento di tempi e costi.
Nell’API puoi modificare lo sforzo di ragionamento durante la conversazione(si apre in una nuova finestra) senza invalidare la cache.
In Codex, parti dal livello di ragionamento predefinito per il modello, poi abbassalo per attività più semplici o aumentalo per analisi più approfondite.
Velocità:
Nell’API, usa la Modalità rapida(si apre in una nuova finestra) quando i tempi di risposta contano, ad esempio nelle app di chat o negli strumenti di programmazione. Offre tempi di risposta più brevi e costanti, a un costo per token superiore rispetto all’elaborazione Standard.
In Codex e nell’API, usa Ultrafast(si apre in una nuova finestra) quando risposte più veloci valgono il costo aggiuntivo, ad esempio per iterazioni rapide sul codice. Accelera la generazione dei token indipendentemente dallo sforzo di ragionamento. Disponibile per GPT‑6 Astra(si apre in una nuova finestra).

—Eric Provencher, esperienza degli sviluppatori presso OpenAI
Parti da un incarico chiaro: il risultato desiderato, i destinatari, il contesto e i vincoli pertinenti, e i criteri per considerare il lavoro concluso. Poi esamina queste quattro aree, tratte da Ripensare skill e prompt per GPT‑6 Astra(si apre in una nuova finestra), per approfondire come aggiornare le tue istruzioni:
Crea skill migliori: usa descrizioni brevi che chiariscano quando eseguire ogni skill, carica i dettagli di supporto solo quando servono e sostituisci le procedure rigide con indicazioni adatte ai modelli usati dal tuo team.
Aggiorna il file AGENTS.md: spiega quando sono pertinenti determinati documenti e test, e autorizza esplicitamente i flussi di routine sicuri, come l’esecuzione di test locali con dati usa e getta e senza accesso alla produzione.
Definisci i limiti decisionali: indica quali azioni possono procedere in autonomia e quali richiedono approvazione, sostituendo regole generiche come “chiedi sempre” con limiti chiari.
Specifica fino a che punto proseguire: definisci cosa significa “concluso”: implementare la modifica, eseguirla, esaminarne il risultato e correggere gli errori. Identifica inoltre le decisioni che richiedono la tua revisione.
Per altre indicazioni, consulta le pratiche consigliate per il ragionamento(si apre in una nuova finestra).
Che tu lavori in Codex o sviluppi con l’API, specifica quali decisioni può prendere il modello, quando deve chiedere il tuo intervento e quali caratteristiche deve avere una risposta utile.
Fornisci al modello indicazioni sufficienti per far proseguire il lavoro senza dover tirare a indovinare sulle decisioni importanti. (si apre in una nuova finestra)Indicagli quali scelte può fare e quando deve chiedere il tuo parere(si apre in una nuova finestra): ad esempio, può scegliere come organizzare un riepilogo, ma deve consultarti prima di modificare l’ambito del progetto. (si apre in una nuova finestra)Descrivi le caratteristiche di una risposta utile(si apre in una nuova finestra): ad esempio, linguaggio semplice, dettagli tecnici adatti al pubblico e una breve nota finale su cosa è cambiato, cosa è stato verificato e cosa richiede ancora attenzione.
Con la famiglia di modelli GPT‑6, ora puoi affrontare attività che durano ore o giorni. Usa le seguenti funzionalità per gestire meglio gli agenti nelle attività di lunga durata.
Nell’API, usa istruzioni in corso d’opera, strumenti asincroni e lavoro in parallelo per far avanzare le attività di lunga durata.
Aggiorna le istruzioni durante l’esecuzione: le istruzioni a turno in corso(si apre in una nuova finestra) ti permettono di inviare una correzione tramite l’API Responses WebSocket(si apre in una nuova finestra) mentre il modello lavora. Gli aggiornamenti vengono messi in coda: non interrompono gli strumenti in esecuzione né annullano le azioni completate.
Continua a lavorare mentre uno strumento è in esecuzione: la chiamata asincrona degli strumenti(si apre in una nuova finestra) permette al modello di proseguire attività indipendenti mentre l’app esegue un’attività più lenta, ad esempio dei test. L’app restituisce il risultato quando è pronto. Attendi quel risultato prima di avviare attività che ne dipendono.
Delega le sottoattività indipendenti: GPT‑6.1 Sol supporta i flussi di lavoro multiagente nell’API Responses(si apre in una nuova finestra). Può assegnare attività indipendenti a sottoagenti, come esaminare parti diverse di una base di codice, e combinarne i risultati in una risposta finale. La funzionalità multiagente è attualmente in versione beta.
Le attività di lunga durata possono far emergere decisioni che non avresti necessariamente previsto nel prompt iniziale. Usa chiarimenti e istruzioni in corso d’opera per mantenere il lavoro nella giusta direzione.
Rispondi alle domande man mano che il lavoro procede: con GPT‑6 Astra, Codex può chiedere chiarimenti mentre lavora(si apre in una nuova finestra). Risolvi i dubbi che influiscono sul passaggio successivo e specifica quali attività indipendenti possono proseguire mentre decidi. Se non sarai disponibile, indica a Codex quali attività possono proseguire e quando deve fermarsi in attesa della tua risposta.
Riorienta il lavoro quando cambiano i requisiti: guida l’attività in corso(si apre in una nuova finestra) con nuove informazioni, spiegando cosa deve cambiare e cosa deve restare invariato. Questo aiuta a evitare di dedicare altro tempo a un approccio che non soddisfa più le tue esigenze.

L’uso del computer(si apre in una nuova finestra) permette a GPT‑6 Astra, GPT‑6.1 Sol e GPT‑6 Luna di interagire direttamente con siti web e app desktop, anche con applicazioni prive di API. Ad esempio, puoi chiedere al modello di analizzare un bug, correggere il codice e aprire il tuo prodotto in un browser per verificare che la correzione funzioni.
Scegli il metodo affidabile più semplice per ogni passaggio:
Usa un’API o uno strumento collegato quando può svolgere direttamente l’attività.
Ricorri all’uso del computer quando il modello deve leggere una schermata, fare clic su pulsanti o compilare un modulo per te.
Se integri l’uso del computer nella tua app, fornisci al modello uno strumento in grado di eseguire codice per controllare un browser o un desktop. Playwright funziona con i browser(si apre in una nuova finestra); PyAutoGUI con le app desktop.



