A scorecard for the AI age
The question I hear from CFOs everywhere is simple: how do we get more value from our AI spend?
For years, the market measured the success of software through adoption: seats purchased, users active, licenses renewed. Understanding the value of AI demands a more powerful measure: work accomplished.
The basic economic question facing CFOs and other business leaders is whether the value of the work AI completes grows faster than the cost of producing it.
Answering that question requires looking more deeply than a metric such as cost per token. A lower-cost model may have cheaper tokens, but getting great results may require more attempts, more time, or more human review. A more capable model may have more expensive tokens, but complete the same task in one pass. What matters is the full cost of producing a successful outcome, measured against the value that outcome creates.
The ultimate scorecard for the age of AI could be looked at as “Useful Intelligence per Dollar.” This metric answers four key questions:
- Is AI completing work that matters?
- What does each successful task cost?
- Can people depend on the result?
- Does each AI dollar produce more value as usage grows?
Start with the work itself.
How many customer issues did AI help resolve? How many code changes did it help ship? How many contracts did it review? How much time did it give back to people? How many decisions improved because the right context was available at the right moment?
Tokens create value when they transform into work people can use. As models become more capable, they can take on longer and more complex tasks: maintaining context, reasoning through multiple steps, working across tools, and adapting as they go.
The best place to begin is with one workflow. Define what “done” means and measure that outcome in the system where the work happens.
For a support team, “done” might mean a customer issue resolved. For an engineering team, it might mean a code change that passes its tests. For a legal team, it might mean a contract reviewed accurately and on time.
Consider a finance team preparing for a forecast review. Much of the work happens before a final decision is made: finding the latest forecast, moving data into Excel or Sheets, identifying changes, reconciling tabs, rebuilding slides, and checking that everything adds up perfectly.
ChatGPT Work can take on much of that process, giving the team more time to focus on the questions that matter: What changed? Why? What should we do next?
That is useful intelligence per dollar in practice. More work gets completed, faster, while people spend more of their time applying judgment, creativity, and expertise.
The next question is what it costs to complete that work well.
AI tasks vary widely. A quick answer may require little compute. A coding, research, or financial workflow may involve deeper reasoning, tool use, and many actions. Those more complex tasks can require more compute, but they can create much more value.
At the model level, cost per successful task depends on price, the amount of compute used, and the likelihood of reaching the right result. For a business, the full cost also includes employee time, human review, retries, and rework.
The calculation is straightforward:
- Add the full cost of completing the work.
- Count the tasks that met the required quality bar.
- Divide the full cost by the number of successful tasks.
This is why the lowest price per token does not always produce the lowest cost per outcome. A frontier model may deliver the best value even for a routine request if it produces the right answer in one pass, reducing retries, latency, review, and total compute.
A tiered model family gives customers more ways to optimize this equation. GPT‑5.6, which we released last week, has three tiers: Sol is our flagship; Terra balances performance and cost; Luna is our fastest and most affordable model.
These tiers provide useful starting points. The economics of the full task should ultimately determine the right model. A customer might use Luna for a fast, high-volume workflow, Terra for work requiring greater depth, or Sol when stronger reasoning delivers the best result with fewer attempts.
We trained GPT‑5.6 to get more useful work from every token. On the Artificial Analysis Coding Agent Index, GPT‑5.6 Sol with max reasoning set a new state of the art while using 54% fewer output tokens than another leading model. The chart below illustrates the comparison.
DeepSWE v1.1: sarcini de inginerie cu orizont lung; GPT‑5.6 Sol atinge o nouă valoare ridicată de 72,7%, peste 69,9% obținut de Claude Fable 5, la un cost API estimat cu 36,2% mai mic.
În întreaga familie GPT‑5.6, obiectivul este același: mai multă muncă reușită per dolar. Eficiența mai mare face sarcinile existente mai accesibile. Capabilitatea mai mare face posibile tipuri de muncă complet noi.
Fiecare nouă generație de modele ar trebui să îmbunătățească ambele părți ale acestei ecuații. Clienții ar trebui să poată realiza muncă mai valoroasă, în timp ce costul finalizării fiecărei sarcini continuă să scadă.
A treia măsură este fiabilitatea.
Adoptarea IA tinde să se extindă treptat. Mai întâi, IA ajută la redactare. Apoi identifică contextul și analizează toate instrumentele și datele. În timp, începe să ia măsuri, să gestioneze excepțiile și să finalizeze fluxurile de lucru, oamenii intervenind cu judecata și controlul lor acolo unde este necesar.
Fiecare pas creează mai multă valoare și cere mai mult de la sistem.
Fiabilitatea are o valoare economică directă. Când rezultatele sunt exacte, bine documentate, consecvente și escaladate corespunzător, oamenii petrec mai puțin timp verificând, corectând și repetând munca. Sarcinile reușite costă mai puțin, iar organizațiile capătă încrederea de a folosi IA în fluxuri de lucru mai importante.
Echipele pot face acest lucru concret urmărind trei rezultate:
- Gata de utilizare: rezultatul a îndeplinit standardul de calitate așa cum a fost livrat.
- Necesită corecție: rezultatul a necesitat o altă încercare sau editări umane.
- Necesită escaladare: a fost nevoie ca o persoană să intervină și să finalizeze munca.
Aceste indicatori oferă o imagine mai cuprinzătoare decât simpla precizie a modelului. Ele arată în ce măsură IA reduce efectiv volumul de muncă necesar pentru finalizarea proiectului.
Fiabilitatea necesită și limite clare. Înainte ca IA să treacă de la redactare la acțiune, organizațiile ar trebui să definească:
- Ce date poate accesa sistemul.
- Ce sisteme poate folosi sau modifica.
- Când ar trebui ca o persoană să verifice sau să aprobe o acțiune.
Siguranța, securitatea, confidențialitatea și controlul constituie fundamentul unei utilizări mai aprofundate. Oamenii trebuie să înțeleagă cum funcționează sistemul, cum sunt gestionate datele lor și cum sunt reglementate acțiunile acestuia.
ChatGPT Work se bazează pe fundamentele de securitate, confidențialitate, conformitate și gestionare a spațiului de lucru ale ChatGPT Enterprise. Acest lucru le permite organizațiilor să le ofere sistemelor de IA mai mult context și acces la fluxuri de lucru mai valoroase, menținând în același timp un nivel adecvat de supraveghere.
Capacitatea determină alegerea ca prima opțiune. Fiabilitatea face ca IA să devină parte integrantă a modului în care se desfășoară activitatea.
Întrebarea finală este dacă economia se îmbunătățește la scară largă.
Companiile pot măsura acest lucru urmărind același flux de lucru de-a lungul timpului. Urmărește câte sarcini au îndeplinit standardele de calitate, costul total al finalizării acestora și costul pe sarcină finalizată cu succes. Dacă volumul de muncă finalizată crește mai rapid decât costul total, în timp ce calitatea se menține sau se îmbunătățește, fiecare dolar investit în IA generează mai multă valoare.
Puterea de calcul ocupă un loc central în cadrul acestei ecuații.
Puterea de calcul stă la baza cercetării și a fiecărei sarcini îndeplinite de IA. Aceasta influențează calitatea produselor, viteza, fiabilitatea, disponibilitatea și costurile. Puterea de calcul dedicată instruirii dezvoltă capacitățile viitoare. Puterea de calcul dedicată inferenței oferă rezultate utile încă de astăzi. Ambele ar trebui să ducă la rezultate mai bune pentru clienți.
Modele mai performante, inferență mai eficientă, hardware special conceput, grad mai ridicat de utilizare, rutare mai inteligentă și un design mai bine gândit al produselor contribuie toate la îmbunătățirea randamentului calculului. Fiecare generație de infrastructură permite instruirea unor modele mai performante. Algoritmii, hardware-ul și software-ul îmbunătățiți contribuie apoi la punerea în funcțiune a acestor modele într-un mod mai eficient.
Clienții resimt aceste îmbunătățiri din punct de vedere practic: răspunsuri mai bune, rezultate mai rapide, mai puține corecturi, produse mai fiabile și un cost mai mic pentru sarcina care trebuie îndeplinită.
Câștigurile se acumulează. O infrastructură mai bună accelerează cercetarea. Cercetarea produce modele mai capabile și mai eficiente. Modelele mai bune îmbunătățesc produsele. Produsele mai bune stimulează adoptarea, învățarea și veniturile. Această creștere determină investiții continue în următoarea generație de cercetare, putere de calcul, implementare și siguranță.
OpenAI reunește aceste elemente printr-o singură platformă comună de inteligență. Oamenii o folosesc prin ChatGPT și ChatGPT Work. Dezvoltatorii construiesc cu ea prin Codex și API. Întreprinderile o implementează în sistemele în care se desfășoară munca.
Când un strat se îmbunătățește, fiecare produs și fiecare client poate beneficia.
Împreună, aceste patru măsuri ne arată dacă inteligența utilă per dolar se îmbunătățește.
Munca utilă ne arată ce produce IA. Costul per sarcină reușită ne arată ce este necesar pentru a ajunge la rezultat. Fiabilitatea ne arată cât din muncă pot folosi oamenii cu încredere. Valoarea la scară largă ne arată dacă fiecare dolar și fiecare unitate de putere de calcul realizează mai mult în timp.
Obiectivul este ca IA să ajute oamenii să desfășoare o activitate mai semnificativă, să ia decizii mai bune și să dedice mai mult timp acelor aspecte ale muncii lor care necesită judecată și creativitate specific umane.
Misiunea noastră este să îmbunătățim această ecuație cu fiecare generație: modele mai performante, rezultate mai rapide și mai fiabile, precum și costuri mai mici pentru sarcinile pe care clienții vor să le efectueze IA.
Astfel, IA devine, în timp, tot mai utilă pentru tot mai multe persoane și organizații.


