Et scorecard til AI-tidsalderen
Spørgsmålet, jeg hører fra CFO'er overalt, er enkelt: Hvordan får vi mere værdi ud af vores AI-investeringer?
I årevis målte markedet softwares succes på udbredelse: købte brugeradgange, aktive brugere og fornyede licenser. At forstå værdien af AI kræver et stærkere mål: udført arbejde.
Det grundlæggende økonomiske spørgsmål for CFO'er og andre virksomhedsledere er, om værdien af det arbejde, AI udfører, vokser hurtigere end omkostningen ved at producere det.
At besvare det spørgsmål kræver, at man ser dybere end på en måling som pris pr. token. En billigere model kan have billigere tokens, men gode resultater kan kræve flere forsøg, mere tid eller mere menneskelig gennemgang. En mere kapabel model kan have dyrere tokens, men løse den samme opgave i ét forsøg. Det afgørende er den samlede omkostning ved at skabe et vellykket resultat, holdt op mod den værdi, resultatet skaber.
Det ultimative scorecard for AI-tidsalderen kan ses som »nyttig intelligens pr. dollar«. Denne måling besvarer fire centrale spørgsmål:
- Udfører AI arbejde, der betyder noget?
- Hvad koster hver vellykket opgave?
- Kan mennesker stole på resultatet?
- Skaber hver AI-dollar mere værdi, efterhånden som brugen vokser?
Begynd med selve arbejdet.
Hvor mange kundeproblemer hjalp AI med at løse? Hvor mange kodeændringer hjalp den med at få udgivet? Hvor mange kontrakter gennemgik den? Hvor meget tid gav den tilbage til mennesker? Hvor mange beslutninger blev bedre, fordi den rette kontekst var tilgængelig på det rette tidspunkt?
Tokens skaber værdi, når de omsættes til arbejde, som mennesker kan bruge. Efterhånden som modeller bliver mere kapable, kan de påtage sig længere og mere komplekse opgaver: fastholde kontekst, ræsonnere gennem flere trin, arbejde på tværs af værktøjer og tilpasse sig undervejs.
Det bedste sted at begynde er med én arbejdsgang. Definér, hvad »færdig« betyder, og mål resultatet i det system, hvor arbejdet foregår.
For et supportteam kan »færdig« betyde, at et kundeproblem er løst. For et engineeringteam kan det betyde en kodeændring, der består sine tests. For et juridisk team kan det betyde en kontrakt, der er gennemgået korrekt og til tiden.
Forestil dig et finance-team, der forbereder en prognosegennemgang. Meget af arbejdet sker, før den endelige beslutning træffes: at finde den nyeste prognose, flytte data ind i Excel eller Sheets, identificere ændringer, afstemme faner, genopbygge slides og kontrollere, at alt stemmer præcist.
ChatGPT Work kan overtage en stor del af den proces og give teamet mere tid til at fokusere på de spørgsmål, der betyder noget: Hvad har ændret sig? Hvorfor? Hvad skal vi gøre nu?
Det er nyttig intelligens pr. dollar i praksis. Mere arbejde bliver udført hurtigere, mens mennesker bruger mere af deres tid på dømmekraft, kreativitet og ekspertise.
Det næste spørgsmål er, hvad det koster at udføre arbejdet godt.
AI-opgaver varierer meget. Et hurtigt svar kan kræve lidt compute. En arbejdsgang inden for kodning, research eller økonomi kan kræve dybere ræsonnering, brug af værktøjer og mange handlinger. De mere komplekse opgaver kan kræve mere compute, men de kan skabe langt større værdi.
På modelniveau afhænger omkostningen pr. vellykket opgave af pris, mængden af anvendt compute og sandsynligheden for at nå det rigtige resultat. For en virksomhed omfatter den samlede omkostning også medarbejdertid, menneskelig gennemgang, nye forsøg og omarbejde.
Beregningen er ligetil:
- Læg den samlede omkostning ved at udføre arbejdet sammen.
- Tæl de opgaver, der levede op til det krævede kvalitetsniveau.
- Divider den samlede omkostning med antallet af vellykkede opgaver.
Derfor giver den laveste pris pr. token ikke altid den laveste omkostning pr. resultat. En banebrydende model kan levere den bedste værdi selv ved en rutineforespørgsel, hvis den giver det rigtige svar i ét forsøg og reducerer nye forsøg, ventetid, gennemgang og samlet compute.
En model-familie med flere niveauer giver kunderne flere måder at optimere denne ligning på. GPT‑5.6, som vi udgav i sidste uge, har tre niveauer: Sol er vores flagskib; Terra balancerer ydeevne og omkostning; Luna er vores hurtigste og mest prisvenlige model.
Disse niveauer giver nyttige udgangspunkter. Økonomien i hele opgaven bør i sidste ende afgøre den rigtige model. En kunde kan bruge Luna til en hurtig arbejdsgang med høj volumen, Terra til arbejde, der kræver større dybde, eller Sol, når stærkere ræsonnering giver det bedste resultat med færre forsøg.
Vi trænede GPT‑5.6 til at få mere nyttigt arbejde ud af hver token. På Artificial Analysis Coding Agent Index satte GPT‑5.6 Sol med maksimal ræsonnering en ny state of the art, mens den brugte 54 % færre output-tokens end en anden førende model. Diagrammet nedenfor viser sammenligningen.
DeepSWE v1.1: Tekniske opgaver med lang tidshorisont; GPT‑5.6 Sol når en ny høj på 72,7 %, over Claude Fable 5s 69,9 %, med 36,2 % lavere anslåede API-omkostninger.
På tværs af GPT‑5.6‑familien er målet det samme: mere vellykket arbejde pr. dollar. Større effektivitet gør eksisterende opgaver mere overkommelige. Større kapacitet gør helt nye former for arbejde mulige.
Hver ny modelgeneration bør forbedre begge sider af den ligning. Kunderne bør kunne udføre mere værdifuldt arbejde, samtidig med at omkostningen ved at løse hver opgave fortsætter med at falde.
Den tredje måling er driftssikkerhed.
Udbredelsen af AI bliver typisk dybere i faser. Først hjælper AI med at udarbejde udkast. Derefter finder den kontekst og ræsonnerer på tværs af værktøjer og data. Med tiden begynder den at handle, håndtere undtagelser og gennemføre arbejdsgange, mens mennesker bidrager med dømmekraft og kontrol, hvor det er nødvendigt.
Hvert trin skaber mere værdi og stiller større krav til systemet.
Driftssikkerhed har direkte økonomisk værdi. Når resultater er præcise, veldokumenterede, konsistente og eskaleres korrekt, bruger mennesker mindre tid på at gennemgå, rette og gentage arbejdet. Vellykkede opgaver koster mindre, og organisationer får tillid til at bruge AI i vigtigere arbejdsgange.
Teams kan gøre dette konkret ved at følge tre resultater:
- Klar til brug: Resultatet levede op til kvalitetsniveauet, som det blev leveret.
- Kræver rettelse: Resultatet krævede et nyt forsøg eller menneskelige redigeringer.
- Kræver eskalering: En person måtte træde til og færdiggøre arbejdet.
Disse målinger fortæller en rigere historie end modellens nøjagtighed alene. De viser, om AI reelt reducerer det arbejde, der kræves for at gennemføre projektet.
Driftssikkerhed kræver også klare grænser. Før AI går fra at udarbejde udkast til at handle, bør organisationer definere:
- Hvilke data systemet kan få adgang til.
- Hvilke systemer det kan bruge eller ændre.
- Hvornår en person skal gennemgå eller godkende en handling.
Sikkerhed, informationssikkerhed, privatliv og kontrol skaber fundamentet for dybere brug. Mennesker skal forstå, hvordan systemet opfører sig, hvordan deres data håndteres, og hvordan dets handlinger styres.
ChatGPT Arbejde bygger på fundamentet for sikkerhed, privatliv, compliance og administration af arbejdsområder i ChatGPT Enterprise. Det giver organisationer mulighed for at give AI mere kontekst og adgang til mere værdifulde arbejdsgange, samtidig med at de bevarer passende tilsyn.
Kapacitet skaber den første brug. Driftssikkerhed gør AI til en del af måden, arbejdet bliver udført på.
Det sidste spørgsmål er, om økonomien forbedres i stor skala.
Virksomheder kan måle det ved at følge den samme arbejdsgang over tid. Følg, hvor mange opgaver der levede op til kvalitetsniveauet, de samlede omkostninger ved at udføre dem og omkostningen pr. vellykket opgave. Hvis det udførte arbejde vokser hurtigere end de samlede omkostninger, mens kvaliteten holder eller forbedres, skaber hver AI-dollar mere værdi.
Compute står centralt i denne ligning.
Compute driver forskning og hver opgave, AI udfører. Det former produktkvalitet, hastighed, driftssikkerhed, tilgængelighed og omkostninger. Træningscompute opbygger fremtidig kapacitet. Inferenscompute leverer nyttigt arbejde i dag. Begge dele bør omsættes til bedre resultater for kunderne.
Bedre modeller, mere effektiv inferens, specialbygget hardware, højere udnyttelse, smartere routing og stærkere produktdesign forbedrer alle afkastet af compute. Hver generation af infrastruktur hjælper med at træne mere kapable modeller. Bedre algoritmer, hardware og software hjælper derefter med at levere disse modeller mere effektivt.
Kunderne oplever disse forbedringer i menneskelige termer: bedre svar, hurtigere resultater, færre rettelser, mere driftssikre produkter og lavere omkostninger for det arbejde, de har brug for at få udført.
Gevinsterne forstærker hinanden. Bedre infrastruktur accelererer forskningen. Forskning skaber mere kapable og effektive modeller. Bedre modeller forbedrer produkter. Bedre produkter driver udbredelse, læring og omsætning. Den vækst understøtter fortsatte investeringer i næste generation af forskning, compute, udrulning og sikkerhed.
OpenAI samler disse dele i én fælles intelligensplatform. Mennesker bruger den via ChatGPT og ChatGPT Arbejde. Udviklere bygger med den via Codex og API'et. Virksomheder udruller den i de systemer, hvor arbejdet foregår.
Når ét lag forbedres, kan alle produkter og kunder få gavn af det.
Tilsammen fortæller disse fire målinger os, om nyttig intelligens pr. dollar bliver bedre.
Nyttigt arbejde fortæller os, hvad AI producerer. Omkostning pr. vellykket opgave fortæller os, hvad der skal til for at nå resultatet. Driftssikkerhed fortæller os, hvor meget af arbejdet mennesker trygt kan bruge. Værdi i stor skala fortæller os, om hver dollar og hver enhed compute udretter mere over tid.
Målet er AI, der hjælper mennesker med at udføre mere meningsfuldt arbejde, træffe bedre beslutninger og bruge mere tid på de dele af deres job, der kræver tydeligt menneskelig dømmekraft og kreativitet.
Vores opgave er at forbedre den ligning for hver generation: mere kapable modeller, hurtigere og mere driftssikre resultater og lavere omkostninger for det arbejde, kunderne har brug for at få udført.
Det er sådan, AI med tiden bliver mere nyttig for flere mennesker og organisationer.


