Přeskoč na hlavní obsah
OpenAI

17. července 2026

Společnost

A scorecard for the AI age

Načítání…

The question I hear from CFOs everywhere is simple: how do we get more value from our AI spend?

For years, the market measured the success of software through adoption: seats purchased, users active, licenses renewed. Understanding the value of AI demands a more powerful measure: work accomplished.

The basic economic question facing CFOs and other business leaders is whether the value of the work AI completes grows faster than the cost of producing it.

Answering that question requires looking more deeply than a metric such as cost per token. A lower-cost model may have cheaper tokens, but getting great results may require more attempts, more time, or more human review. A more capable model may have more expensive tokens, but complete the same task in one pass. What matters is the full cost of producing a successful outcome, measured against the value that outcome creates.

The ultimate scorecard for the age of AI could be looked at as “Useful Intelligence per Dollar.” This metric answers four key questions:

  1. Is AI completing work that matters?
  2. What does each successful task cost?
  3. Can people depend on the result?
  4. Does each AI dollar produce more value as usage grows?

1. How much useful work gets done?

Start with the work itself.

How many customer issues did AI help resolve? How many code changes did it help ship? How many contracts did it review? How much time did it give back to people? How many decisions improved because the right context was available at the right moment?

Tokens create value when they transform into work people can use. As models become more capable, they can take on longer and more complex tasks: maintaining context, reasoning through multiple steps, working across tools, and adapting as they go.

The best place to begin is with one workflow. Define what “done” means and measure that outcome in the system where the work happens.

For a support team, “done” might mean a customer issue resolved. For an engineering team, it might mean a code change that passes its tests. For a legal team, it might mean a contract reviewed accurately and on time.

Consider a finance team preparing for a forecast review. Much of the work happens before a final decision is made: finding the latest forecast, moving data into Excel or Sheets, identifying changes, reconciling tabs, rebuilding slides, and checking that everything adds up perfectly.

ChatGPT Work can take on much of that process, giving the team more time to focus on the questions that matter: What changed? Why? What should we do next?

That is useful intelligence per dollar in practice. More work gets completed, faster, while people spend more of their time applying judgment, creativity, and expertise.

2. What does a successful task actually cost?

The next question is what it costs to complete that work well.

AI tasks vary widely. A quick answer may require little compute. A coding, research, or financial workflow may involve deeper reasoning, tool use, and many actions. Those more complex tasks can require more compute, but they can create much more value.

At the model level, cost per successful task depends on price, the amount of compute used, and the likelihood of reaching the right result. For a business, the full cost also includes employee time, human review, retries, and rework.

The calculation is straightforward:

  • Add the full cost of completing the work.
  • Count the tasks that met the required quality bar.
  • Divide the full cost by the number of successful tasks.

This is why the lowest price per token does not always produce the lowest cost per outcome. A frontier model may deliver the best value even for a routine request if it produces the right answer in one pass, reducing retries, latency, review, and total compute.

A tiered model family gives customers more ways to optimize this equation. GPT‑5.6, which we released last week, has three tiers: Sol is our flagship; Terra balances performance and cost; Luna is our fastest and most affordable model.

These tiers provide useful starting points. The economics of the full task should ultimately determine the right model. A customer might use Luna for a fast, high-volume workflow, Terra for work requiring greater depth, or Sol when stronger reasoning delivers the best result with fewer attempts.

We trained GPT‑5.6 to get more useful work from every token. On the Artificial Analysis Coding Agent Index, GPT‑5.6 Sol with max reasoning set a new state of the art while using 54% fewer output tokens than another leading model. The chart below illustrates the comparison.

DeepSWE v1.1: Dlouhodobé technické úkoly. Model GPT‑5.6 Sol dosahuje nové vysoké hodnoty 72,7 %, tedy více než 69,9 % u modelu Claude Fable 5, při odhadovaných nákladech na rozhraní API nižších o 36,2 %.

V celé rodině GPT‑5.6 je cíl stejný: více úspěšné práce za každý dolar. Vyšší efektivita zlevňuje stávající úkoly. Vyšší schopnosti umožňují zcela nové druhy práce.

Každá nová generace modelů by měla zlepšit obě strany této rovnice. Zákazníci by měli dokázat odvádět hodnotnější práci a zároveň by náklady na dokončení každého úkolu měly dál klesat.

3. Jak často AI odvede práci správně?

Třetím měřítkem je spolehlivost.

Přijímání AI se obvykle prohlubuje ve fázích. Nejprve AI pomáhá s návrhy textů. Poté vyhledává kontext a uvažuje napříč nástroji a daty. Postupem času začíná jednat, řešit výjimky a dokončovat pracovní postupy, zatímco lidé podle potřeby poskytují úsudek a kontrolu.

Každý krok vytváří větší hodnotu a klade na systém vyšší nároky.

Spolehlivost má přímou ekonomickou hodnotu. Když jsou výsledky správné, dobře ozdrojované, konzistentní a vhodně eskalované, lidé tráví méně času kontrolou, opravami a opakováním práce. Úspěšné úkoly stojí méně a organizace získávají jistotu používat AI v důležitějších pracovních postupech.

Týmy to mohou konkretizovat sledováním tří výsledků:

  • Připravené k použití: Výsledek splnil laťku kvality tak, jak byl odevzdán.
  • Vyžaduje opravu: Výsledek vyžadoval další pokus nebo lidské úpravy.
  • Vyžaduje eskalaci: Musel zasáhnout člověk a práci dokončit.

Tato měřítka vyprávějí bohatší příběh než samotná správnost modelu. Ukazují, zda AI skutečně snižuje množství práce potřebné k dokončení projektu.

Spolehlivost také vyžaduje jasné hranice. Než AI přejde od přípravy návrhů k jednání, měly by organizace definovat:

  • K jakým datům může systém přistupovat.
  • Jaké systémy může používat nebo měnit.
  • Kdy má člověk akci zkontrolovat nebo schválit.

Bezpečnost, zabezpečení, soukromí a kontrola tvoří základ pro hlubší využití. Lidé potřebují rozumět tomu, jak se systém chová, jak se nakládá s jejich daty a jak jsou řízeny jeho akce.

ChatGPT Work staví na základech zabezpečení, soukromí, souladu s předpisy a správy pracovního prostoru v ChatGPT Enterprise. To organizacím umožňuje dát AI více kontextu a přístup k hodnotnějším pracovním postupům při zachování odpovídajícího dohledu.

Svými schopnostmi si AI zaslouží použití. Až spolehlivost z ní udělá součást běžné práce.

4. Bude za každý dolar investovaný do AI s rostoucím používáním více práce?

Poslední otázkou je, zda se ekonomičnost zlepšuje s nasazením ve větším měřítku.

Firmy to mohou měřit sledováním stejného pracovního postupu v čase. Sledujte, kolik úkolů splnilo nasazenou laťku kvality, celkové náklady na jejich dokončení a náklady na úspěšný úkol. Pokud dokončená práce roste rychleji než celkové náklady a kvalita se drží nebo zlepšuje, pak každý dolar do investovaný AI vytváří větší hodnotu.

Výpočetní výkon stojí v centru této rovnice.

Výpočetní výkon pohání výzkum i každý úkol, který AI dokončí. Ovlivňuje kvalitu produktu, rychlost, spolehlivost, dostupnost i náklady. Výpočetní výkon při trénování vytváří budoucí schopnosti. Výpočetní výkon při inferenci odvádí užitečnou práci už dnes. Obojí by se mělo promítat do lepších výsledků pro zákazníky.

Lepší modely, efektivnější inference, specializovaný hardware, vyšší využití, chytřejší směrování a silnější produktový design zlepšují návratnost výpočetního výkonu. Každá generace infrastruktury pomáhá trénovat schopnější modely. Lepší algoritmy, hardware a software pak pomáhají tyto modely provozovat efektivněji.

Zákazníci tato zlepšení zažívají v lidské podobě: lepší odpovědi, rychlejší výsledky, méně oprav, spolehlivější produkty a nižší náklady na práci, kterou potřebují nechat udělat.

Přínosy se násobí. Lepší infrastruktura urychluje výzkum. Výzkum vytváří schopnější a efektivnější modely. Lepší modely zlepšují produkty. Lepší produkty podporují širší využívání AI, učení a tržby. Tento růst podporuje další investice do příští generace výzkumu, výpočetního výkonu, nasazení a bezpečnosti.

OpenAI tyto části propojuje v jedné sdílené platformě inteligence. Lidé ji používají prostřednictvím ChatGPT a ChatGPT Work. Vývojáři na ní staví prostřednictvím Codexu a API. Podniky ji nasazují do systémů, ve kterých práce probíhá.

Když se zlepší jedna vrstva, může z toho těžit každý produkt i každý zákazník.

Hodnocení návratnosti investic ve věku AI

Dohromady nám tato čtyři měřítka říkají, zda se zlepšuje užitečná inteligence za každý dolar.

Užitečná práce nám říká, co AI vytváří. Náklady na úspěšný úkol nám říkají, co je potřeba k dosažení výsledku. Spolehlivost nám říká, jak velkou část práce mohou lidé s jistotou využít. Hodnota ve velkém měřítku nám říká, zda každý dolar a každá jednotka výpočetního výkonu v čase zvládnou víc.

Cílem je AI, která lidem pomáhá dělat smysluplnější práci, lépe se rozhodovat a trávit více času částmi práce, které vyžadují výrazně lidský úsudek a kreativitu.

Naším úkolem je tuto rovnici zlepšovat s každou generací: schopnější modely, rychlejší a spolehlivější výsledky a nižší náklady na práci, kterou zákazníci potřebují udělat.

Tak se AI postupem času stává užitečnější pro více lidí i organizací.

Autor

Sarah Friar