Overslaan naar hoofdinhoud
OpenAI

17 juli 2026

Over OpenAI

Een scorekaart voor het AI-tijdperk

Bezig met laden...

De vraag die ik overal van CFO’s hoor, is eenvoudig: hoe halen we meer waarde uit onze AI-uitgaven?

Jarenlang mat de markt het succes van software aan adoptie: gekochte seats, actieve gebruikers en verlengde licenties. Om de waarde van AI te begrijpen, is een krachtigere maatstaf nodig: verricht werk.

De economische kernvraag voor CFO’s en andere bedrijfsleiders is of de waarde van het werk dat AI afrondt sneller groeit dan de kosten om het te leveren.

Om die vraag te beantwoorden, moet je verder kijken dan een metriek zoals kosten per token. Een goedkoper model kan goedkopere tokens hebben, maar voor goede resultaten zijn soms meer pogingen, meer tijd of meer menselijke controle nodig. Een capabeler model kan duurdere tokens hebben, maar dezelfde taak in één keer afronden. Waar het om gaat, zijn de totale kosten om een geslaagd resultaat te leveren, afgezet tegen de waarde die dat resultaat creëert.

De uiteindelijke scorekaart voor het AI-tijdperk kun je zien als “nuttige intelligentie per dollar”. Deze metriek beantwoordt vier kernvragen:

  1. Rondt AI werk af dat ertoe doet?
  2. Wat kost elke geslaagde taak?
  3. Kunnen mensen op het resultaat vertrouwen?
  4. Levert elke AI-dollar meer waarde op naarmate het gebruik groeit?

1. Hoeveel nuttig werk wordt er gedaan?

Begin bij het werk zelf.

Hoeveel klantproblemen heeft AI helpen oplossen? Hoeveel codewijzigingen heeft AI helpen uitbrengen? Hoeveel contracten heeft AI beoordeeld? Hoeveel tijd heeft AI mensen teruggegeven? Hoeveel beslissingen werden beter doordat de juiste context op het juiste moment beschikbaar was?

Tokens creëren waarde wanneer ze worden omgezet in werk dat mensen kunnen gebruiken. Naarmate modellen capabeler worden, kunnen ze langere en complexere taken uitvoeren: context vasthouden, via meerdere stappen redeneren, met verschillende tools werken en zich onderweg aanpassen.

De beste plek om te beginnen is één workflow. Definieer wat “klaar” betekent en meet die uitkomst in het systeem waarin het werk plaatsvindt.

Voor een supportteam kan “klaar” betekenen dat een klantprobleem is opgelost. Voor een engineeringteam kan het betekenen dat een codewijziging de tests doorstaat. Voor een juridisch team kan het betekenen dat een contract nauwkeurig en op tijd is beoordeeld.

Neem een financieel team dat zich voorbereidt op een forecastreview. Veel van het werk gebeurt voordat een definitieve beslissing wordt genomen: de nieuwste forecast vinden, data naar Excel of Sheets overzetten, wijzigingen signaleren, tabbladen afstemmen, slides opnieuw opbouwen en controleren of alles exact klopt.

ChatGPT Werk kan een groot deel van dat proces overnemen, waardoor het team meer tijd krijgt voor de vragen die ertoe doen: wat is er veranderd? Waarom? Wat moeten we nu doen?

Dat is nuttige intelligentie per dollar in de praktijk. Er wordt meer werk sneller afgerond, terwijl mensen meer tijd besteden aan oordeel, creativiteit en expertise.

2. Wat kost een geslaagde taak eigenlijk?

De volgende vraag is wat het kost om dat werk goed af te ronden.

AI-taken lopen sterk uiteen. Een snel antwoord kan weinig compute vereisen. Een workflow voor coderen, onderzoek of financiën kan diepere redenering, toolgebruik en veel acties omvatten. Die complexere taken kunnen meer compute vereisen, maar ook veel meer waarde creëren.

Op modelniveau hangen de kosten per geslaagde taak af van de prijs, de hoeveelheid gebruikte compute en de kans dat het juiste resultaat wordt bereikt. Voor een bedrijf omvatten de totale kosten ook medewerkerstijd, menselijke controle, nieuwe pogingen en herstelwerk.

De berekening is eenvoudig:

  • Tel de totale kosten voor het afronden van het werk op.
  • Tel de taken die aan de vereiste kwaliteitslat voldeden.
  • Deel de totale kosten door het aantal geslaagde taken.

Daarom leidt de laagste prijs per token niet altijd tot de laagste kosten per uitkomst. Een grensverleggend model kan zelfs bij een routineverzoek de beste waarde leveren als het in één keer het juiste antwoord geeft en zo nieuwe pogingen, wachttijd, controle en totale compute vermindert.

Een modelfamilie met meerdere niveaus geeft klanten meer manieren om deze vergelijking te optimaliseren. GPT‑5.6, dat we vorige week hebben uitgebracht, heeft drie niveaus: Sol is ons vlaggenschip; Terra brengt prestaties en kosten in balans; Luna is ons snelste en betaalbaarste model.

Deze niveaus bieden nuttige vertrekpunten. De economie van de volledige taak moet uiteindelijk bepalen welk model het juiste is. Een klant kan Luna gebruiken voor een snelle workflow met hoog volume, Terra voor werk dat meer diepgang vereist, of Sol wanneer sterkere redenering met minder pogingen het beste resultaat oplevert.

We hebben GPT‑5.6 getraind om meer nuttig werk uit elke token te halen. Op de Artificial Analysis Coding Agent Index zette GPT‑5.6 Sol met maximale redenering een nieuwe state of the art neer, terwijl het 54% minder outputtokens gebruikte dan een ander toonaangevend model. De onderstaande grafiek illustreert de vergelijking.

DeepSWE v1.1: langetermijn-engineeringtaken; GPT‑5.6 Sol bereikt een nieuw hoog van 72,7%, boven de 69,9% van Claude Fable 5, tegen 36,2% lagere geschatte API-kosten.

In de hele GPT‑5.6‑familie is het doel hetzelfde: meer geslaagd werk per dollar. Meer efficiëntie maakt bestaande taken betaalbaarder. Meer capaciteit maakt volledig nieuwe soorten werk mogelijk.

Elke nieuwe generatie modellen moet beide kanten van die vergelijking verbeteren. Klanten moeten waardevoller werk kunnen verrichten, terwijl tegelijk de kosten om elke taak af te ronden blijven dalen.

3. Hoe vaak doet AI het werk goed?

De derde maatstaf is betrouwbaarheid.

AI-adoptie verdiept zich meestal in fasen. Eerst helpt AI met opstellen. Daarna vindt AI context en redeneert het over tools en data heen. Na verloop van tijd begint AI acties uit te voeren, uitzonderingen af te handelen en workflows af te ronden, terwijl mensen waar nodig oordeel en controle bieden.

Elke stap creëert meer waarde en vraagt meer van het systeem.

Betrouwbaarheid heeft directe economische waarde. Wanneer resultaten nauwkeurig, goed onderbouwd en consistent zijn en passend worden geëscaleerd, besteden mensen minder tijd aan controleren, corrigeren en herhalen van het werk. Geslaagde taken kosten minder en organisaties krijgen het vertrouwen om AI in belangrijkere workflows te gebruiken.

Teams kunnen dit concreet maken door drie uitkomsten bij te houden:

  • Klaar voor gebruik: het resultaat voldeed bij levering aan de kwaliteitslat.
  • Correctie nodig: het resultaat vereiste een nieuwe poging of menselijke aanpassingen.
  • Escalatie nodig: een persoon moest ingrijpen en het werk afronden.

Deze maatstaven vertellen een rijker verhaal dan modelnauwkeurigheid alleen. Ze laten zien of AI het werk dat nodig is om het project af te ronden echt vermindert.

Betrouwbaarheid vereist ook duidelijke grenzen. Voordat AI van opstellen naar handelen gaat, moeten organisaties definiëren:

  • Tot welke data het systeem toegang heeft.
  • Welke systemen het kan gebruiken of wijzigen.
  • Wanneer een persoon een actie moet controleren of goedkeuren.

Veiligheid, beveiliging, privacy en controle vormen de basis voor dieper gebruik. Mensen moeten begrijpen hoe het systeem zich gedraagt, hoe hun data wordt behandeld en hoe de acties ervan worden bestuurd.

ChatGPT Werk bouwt voort op de basis van beveiliging, privacy, compliance en werkruimtebeheer van ChatGPT Enterprise. Zo kunnen organisaties AI meer context en toegang tot waardevollere workflows geven, met behoud van passend toezicht.

Capaciteit zorgt voor het eerste gebruik. Betrouwbaarheid maakt AI onderdeel van de manier waarop werk wordt gedaan.

4. Koopt elke AI-dollar meer werk naarmate het gebruik groeit?

De laatste vraag is of de economie op schaal verbetert.

Bedrijven kunnen dit meten door dezelfde workflow in de tijd te volgen. Houd bij hoeveel taken aan de kwaliteitslat voldeden, wat de totale kosten waren om ze af te ronden en wat de kosten per geslaagde taak waren. Als voltooid werk sneller groeit dan de totale kosten, terwijl de kwaliteit gelijk blijft of verbetert, levert elke AI-dollar meer waarde op.

Compute staat centraal in deze vergelijking.

Compute drijft onderzoek aan en elke taak die AI afrondt. Het bepaalt productkwaliteit, snelheid, betrouwbaarheid, beschikbaarheid en kosten. Trainingscompute bouwt toekomstige capaciteit op. Inferencecompute levert vandaag nuttig werk. Beide moeten leiden tot betere resultaten voor klanten.

Betere modellen, efficiëntere inference, doelgerichte hardware, hogere benutting, slimmere routering en sterker productontwerp verbeteren allemaal het rendement op compute. Elke generatie infrastructuur helpt capabelere modellen te trainen. Betere algoritmen, hardware en software helpen vervolgens om die modellen efficiënter te bedienen.

Klanten ervaren die verbeteringen in menselijke termen: betere antwoorden, snellere resultaten, minder correcties, betrouwbaardere producten en lagere kosten voor het werk dat ze gedaan willen krijgen.

De voordelen stapelen zich op. Betere infrastructuur versnelt onderzoek. Onderzoek levert capabelere en efficiëntere modellen op. Betere modellen verbeteren producten. Betere producten stimuleren adoptie, leren en omzet. Die groei ondersteunt blijvende investeringen in de volgende generatie onderzoek, compute, implementatie en veiligheid.

OpenAI brengt deze onderdelen samen in één gedeeld intelligentieplatform. Mensen gebruiken het via ChatGPT en ChatGPT Werk. Ontwikkelaars bouwen ermee via Codex en de API. Ondernemingen implementeren het in de systemen waar het werk plaatsvindt.

Wanneer één laag verbetert, kunnen elk product en elke klant daarvan profiteren.

Een scorekaart voor het AI-tijdperk

Samen laten deze vier maatstaven zien of nuttige intelligentie per dollar verbetert.

Nuttig werk laat zien wat AI produceert. Kosten per geslaagde taak laten zien wat nodig is om de uitkomst te bereiken. Betrouwbaarheid laat zien hoeveel van het werk mensen met vertrouwen kunnen gebruiken. Waarde op schaal laat zien of elke dollar en elke eenheid compute in de loop van de tijd meer tot stand brengen.

Het doel is AI die mensen helpt betekenisvoller werk te doen, betere beslissingen te nemen en meer tijd te besteden aan de delen van hun werk die uitgesproken menselijk oordeel en creativiteit vereisen.

Het is onze taak om die vergelijking met elke generatie te verbeteren: capabelere modellen, snellere en betrouwbaardere resultaten en lagere kosten voor het werk dat klanten gedaan moeten krijgen.

Zo wordt AI in de loop van de tijd nuttiger voor meer mensen en organisaties.

Auteur

Sarah Friar