Una scheda di valutazione per l’era dell’IA
La domanda che sento fare dai CFO ovunque è semplice: come possiamo ottenere più valore dalla nostra spesa in IA?
Per anni, il mercato ha misurato il successo del software in base all’adozione: postazioni acquistate, utenti attivi, licenze rinnovate. Capire il valore dell’IA richiede una misura più efficace: il lavoro svolto.
La domanda economica di fondo per CFO e altri leader aziendali è se il valore del lavoro completato dall’IA cresca più rapidamente del costo necessario a produrlo.
Per rispondere, bisogna andare oltre una metrica come il costo per token. Un modello meno costoso può avere token più economici, ma ottenere ottimi risultati può richiedere più tentativi, più tempo o più revisione umana. Un modello più capace può avere token più costosi, ma completare la stessa attività in un solo passaggio. Conta il costo complessivo per produrre un risultato riuscito, confrontato con il valore che quel risultato crea.
La scheda di valutazione definitiva per l’era dell’IA può essere vista come «intelligenza utile per dollaro». Questa metrica risponde a quattro domande chiave:
- L’IA completa lavoro che conta davvero?
- Quanto costa ogni attività riuscita?
- Le persone possono fare affidamento sul risultato?
- Ogni dollaro investito in IA produce più valore con l’aumentare dell’utilizzo?
Partite dal lavoro stesso.
Quanti problemi dei clienti ha aiutato a risolvere l’IA? Quante modifiche al codice ha aiutato a rilasciare? Quanti contratti ha esaminato? Quanto tempo ha restituito alle persone? Quante decisioni sono migliorate perché il contesto giusto era disponibile al momento giusto?
I token creano valore quando si trasformano in lavoro che le persone possono usare. Man mano che i modelli diventano più capaci, possono affrontare attività più lunghe e complesse: mantenere il contesto, ragionare su più passaggi, lavorare tra strumenti diversi e adattarsi lungo il percorso.
Il punto migliore da cui iniziare è un singolo workflow. Definite che cosa significa «completato» e misurate quel risultato nel sistema in cui il lavoro avviene.
Per un team di assistenza, «completato» potrebbe significare un problema del cliente risolto. Per un team di ingegneria, potrebbe significare una modifica al codice che supera i test. Per un team legale, potrebbe significare un contratto revisionato in modo accurato e puntuale.
Pensiamo a un team finance che si prepara a una revisione delle previsioni. Gran parte del lavoro avviene prima della decisione finale: trovare la previsione più recente, spostare i dati in Excel o Sheets, individuare le variazioni, riconciliare le schede, ricostruire le slide e verificare che tutti i conti tornino alla perfezione.
ChatGPT Work può farsi carico di gran parte di questo processo, lasciando al team più tempo per concentrarsi sulle domande che contano: che cosa è cambiato? Perché? Che cosa dovremmo fare ora?
Questa è l’intelligenza utile per dollaro nella pratica. Si completa più lavoro, più rapidamente, mentre le persone dedicano più tempo a giudizio, creatività e competenza.
La domanda successiva è quanto costa completare bene quel lavoro.
Le attività di IA variano molto. Una risposta rapida può richiedere poca capacità di calcolo. Un workflow di coding, ricerca o finanza può richiedere ragionamento più profondo, uso di strumenti e molte azioni. Queste attività più complesse possono richiedere più capacità di calcolo, ma possono creare molto più valore.
A livello di modello, il costo per attività riuscita dipende dal prezzo, dalla capacità di calcolo usata e dalla probabilità di raggiungere il risultato corretto. Per un’azienda, il costo complessivo include anche il tempo dei dipendenti, la revisione umana, i nuovi tentativi e le rilavorazioni.
Il calcolo è semplice:
- Sommatene il costo complessivo di completamento.
- Contate le attività che hanno soddisfatto lo standard di qualità richiesto.
- Dividete il costo complessivo per il numero di attività riuscite.
Ecco perché il prezzo più basso per token non produce sempre il costo più basso per risultato. Un modello di frontiera può offrire il miglior valore anche per una richiesta di routine se produce la risposta giusta in un solo passaggio, riducendo nuovi tentativi, latenza, revisione e capacità di calcolo totale.
Una famiglia di modelli a livelli offre ai clienti più modi per ottimizzare questa equazione. GPT‑5.6, che abbiamo rilasciato la scorsa settimana, ha tre livelli: Sol è il nostro modello di punta; Terra bilancia prestazioni e costo; Luna è il nostro modello più rapido e conveniente.
Questi livelli offrono utili punti di partenza. L’economia dell’attività nel suo complesso dovrebbe determinare, in ultima analisi, il modello giusto. Un cliente potrebbe usare Luna per un workflow rapido e ad alto volume, Terra per un lavoro che richiede maggiore profondità o Sol quando un ragionamento più forte offre il miglior risultato con meno tentativi.
Abbiamo addestrato GPT‑5.6 per ottenere più lavoro utile da ogni token. Nell’Artificial Analysis Coding Agent Index, GPT‑5.6 Sol con ragionamento al massimo ha stabilito un nuovo stato dell’arte usando il 54% di token di output in meno rispetto a un altro modello leader. Il grafico qui sotto illustra il confronto.
DeepSWE v1.1: attività di ingegneria a lungo termine; GPT‑5.6 Sol raggiunge un nuovo massimo del 72,7%, superando il 69,9% di Claude Fable 5, con un costo API stimato inferiore del 36,2%.
In tutta la famiglia GPT‑5.6, l’obiettivo è lo stesso: più lavoro riuscito per dollaro. Una maggiore efficienza rende più convenienti le attività esistenti. Una maggiore capacità rende possibili tipi di lavoro del tutto nuovi.
Ogni nuova generazione di modelli dovrebbe migliorare entrambi i lati dell’equazione. I clienti dovrebbero poter svolgere lavoro di maggior valore mentre, allo stesso tempo, il costo per completare ogni attività continua a diminuire.
La terza misura è l’affidabilità.
L’adozione dell’IA tende ad approfondirsi per fasi. All’inizio, l’IA aiuta a creare bozze. Poi trova il contesto e ragiona tra strumenti e dati. Con il tempo, inizia ad agire, gestire eccezioni e completare workflow, mentre le persone forniscono giudizio e controllo dove serve.
Ogni passaggio crea più valore e richiede di più al sistema.
L’affidabilità ha un valore economico diretto. Quando i risultati sono accurati, ben documentati, coerenti ed escalati in modo appropriato, le persone passano meno tempo a revisionare, correggere e ripetere il lavoro. Le attività riuscite costano meno e le organizzazioni acquistano fiducia nell’uso dell’IA in workflow più importanti.
I team possono renderlo concreto monitorando tre risultati:
- Pronto all’uso: il risultato ha soddisfatto lo standard di qualità così come consegnato.
- Richiede correzioni: il risultato ha richiesto un altro tentativo o modifiche umane.
- Richiede escalation: una persona è dovuta intervenire e completare il lavoro.
Queste misure raccontano una storia più ricca della sola accuratezza del modello. Mostrano se l’IA sta davvero riducendo il lavoro necessario per completare il progetto.
L’affidabilità richiede anche confini chiari. Prima che l’IA passi dalla creazione di bozze all’azione, le organizzazioni dovrebbero definire:
- A quali dati il sistema può accedere.
- Quali sistemi può usare o modificare.
- Quando una persona deve revisionare o approvare un’azione.
Sicurezza, protezione, privacy e controllo creano le basi per un uso più profondo. Le persone devono capire come si comporta il sistema, come vengono gestiti i loro dati e come sono governate le sue azioni.
ChatGPT Work si basa sulle fondamenta di sicurezza, privacy, conformità e gestione delle aree di lavoro di ChatGPT Enterprise. Questo consente alle organizzazioni di dare all’IA più contesto e accesso a workflow di maggior valore, mantenendo una supervisione adeguata.
La capacità conquista il primo utilizzo. L’affidabilità rende l’IA parte del modo in cui il lavoro viene svolto.
La domanda finale è se l’economia migliori su larga scala.
Le aziende possono misurarlo seguendo lo stesso workflow nel tempo. Monitorate quante attività hanno soddisfatto lo standard di qualità, il costo totale per completarle e il costo per attività riuscita. Se il lavoro completato cresce più rapidamente del costo totale mentre la qualità resta stabile o migliora, ogni dollaro investito in IA produce più valore.
La capacità di calcolo è al centro di questa equazione.
La capacità di calcolo alimenta la ricerca e ogni attività completata dall’IA. Determina qualità del prodotto, velocità, affidabilità, disponibilità e costo. La capacità di calcolo per l’addestramento costruisce le capacità future. La capacità di calcolo per l’inferenza produce lavoro utile oggi. Entrambe dovrebbero tradursi in risultati migliori per i clienti.
Modelli migliori, inferenza più efficiente, hardware dedicato, maggiore utilizzo, routing più intelligente e design di prodotto più solido migliorano tutti il ritorno sulla capacità di calcolo. Ogni generazione di infrastruttura aiuta ad addestrare modelli più capaci. Algoritmi, hardware e software migliori aiutano poi a servire quei modelli in modo più efficiente.
I clienti sperimentano questi miglioramenti in termini umani: risposte migliori, risultati più rapidi, meno correzioni, prodotti più affidabili e un costo inferiore per il lavoro di cui hanno bisogno.
I vantaggi si sommano. Un’infrastruttura migliore accelera la ricerca. La ricerca produce modelli più capaci ed efficienti. Modelli migliori migliorano i prodotti. Prodotti migliori favoriscono adozione, apprendimento e ricavi. Questa crescita sostiene investimenti continui nella prossima generazione di ricerca, capacità di calcolo, distribuzione e sicurezza.
OpenAI riunisce questi elementi in un’unica piattaforma di intelligenza condivisa. Le persone la usano tramite ChatGPT e ChatGPT Work. Gli sviluppatori costruiscono con essa tramite Codex e l’API. Le imprese la distribuiscono nei sistemi in cui il lavoro avviene.
Quando uno strato migliora, ogni prodotto e cliente può beneficiarne.
Nel loro insieme, queste quattro misure ci dicono se l’intelligenza utile per dollaro sta migliorando.
Il lavoro utile ci dice che cosa produce l’IA. Il costo per attività riuscita ci dice che cosa serve per arrivare al risultato. L’affidabilità ci dice quanta parte del lavoro le persone possono usare con fiducia. Il valore su larga scala ci dice se ogni dollaro e ogni unità di capacità di calcolo realizzano di più nel tempo.
L’obiettivo è un’IA che aiuti le persone a svolgere un lavoro più significativo, prendere decisioni migliori e dedicare più tempo alle parti del loro lavoro che richiedono giudizio e creatività distintamente umani.
Il nostro compito è migliorare questa equazione a ogni generazione: modelli più capaci, risultati più rapidi e affidabili e costi più bassi per il lavoro che i clienti devono completare.
È così che l’IA diventa nel tempo più utile per più persone e organizzazioni.


