Eine Scorecard für das KI-Zeitalter
Die Frage, die ich überall von CFOs höre, ist einfach: Wie holen wir mehr Wert aus unseren KI-Ausgaben?
Jahrelang hat der Markt den Erfolg von Software an der Nutzung gemessen: gekaufte Lizenzen, aktive Nutzende, verlängerte Lizenzen. Um den Wert von KI zu verstehen, braucht es eine aussagekräftigere Messgröße: erledigte Arbeit.
Die zentrale wirtschaftliche Frage für CFOs und andere Führungskräfte lautet, ob der Wert der Arbeit, die KI erledigt, schneller wächst als die Kosten ihrer Erstellung.
Um diese Frage zu beantworten, reicht eine Kennzahl wie Kosten pro Token nicht aus. Ein günstigeres Modell kann billigere Tokens haben, aber für gute Ergebnisse können mehr Versuche, mehr Zeit oder mehr menschliche Prüfung nötig sein. Ein leistungsfähigeres Modell kann teurere Tokens haben, dieselbe Aufgabe aber in einem Durchlauf erledigen. Entscheidend sind die Gesamtkosten für ein erfolgreiches Ergebnis, gemessen an dem Wert, den dieses Ergebnis schafft.
Die wichtigste Scorecard für das KI-Zeitalter könnte man als „nützliche Intelligenz pro Dollar“ verstehen. Diese Kennzahl beantwortet vier zentrale Fragen:
- Erledigt KI Arbeit, die wirklich zählt?
- Was kostet jede erfolgreiche Aufgabe?
- Können sich Menschen auf das Ergebnis verlassen?
- Schafft jeder KI-Dollar mehr Wert, wenn die Nutzung wächst?
Beginnen wir mit der Arbeit selbst.
Bei wie vielen Kundenanliegen hat KI geholfen, sie zu lösen? Bei wie vielen Codeänderungen hat sie geholfen, sie auszuliefern? Wie viele Verträge hat sie geprüft? Wie viel Zeit hat sie Menschen zurückgegeben? Wie viele Entscheidungen wurden besser, weil im richtigen Moment der richtige Kontext verfügbar war?
Tokens schaffen Wert, wenn sie zu Arbeit werden, die Menschen nutzen können. Je leistungsfähiger Modelle werden, desto längere und komplexere Aufgaben können sie übernehmen: Kontext halten, über mehrere Schritte schlussfolgern, Tool-übergreifend arbeiten und sich unterwegs anpassen.
Am besten beginnt man mit einem einzelnen Workflow. Definiere, was „erledigt“ bedeutet, und miss dieses Ergebnis in dem System, in dem die Arbeit stattfindet.
Für ein Supportteam kann „erledigt“ bedeuten: ein Kundenanliegen ist gelöst. Für ein Engineering-Team kann es eine Codeänderung sein, die ihre Tests besteht. Für ein Rechtsteam kann es ein Vertrag sein, der korrekt und fristgerecht geprüft wurde.
Nehmen wir ein Finanzteam, das sich auf eine Forecast-Besprechung vorbereitet. Ein großer Teil der Arbeit fällt an, bevor eine endgültige Entscheidung getroffen wird: den neuesten Forecast finden, Daten nach Excel oder Tabellen übertragen, Änderungen erkennen, Arbeitsblätter abgleichen, Folien neu erstellen und prüfen, ob alles exakt aufgeht.
ChatGPT Work kann einen großen Teil dieses Prozesses übernehmen. So hat das Team mehr Zeit für die entscheidenden Fragen: Was hat sich geändert? Warum? Was sollten wir als Nächstes tun?
So sieht nützliche Intelligenz pro Dollar in der Praxis aus. Mehr Arbeit wird schneller erledigt, während Menschen mehr Zeit für Urteilsvermögen, Kreativität und Fachwissen einsetzen können.
Die nächste Frage lautet, was es kostet, diese Arbeit gut zu erledigen.
KI-Aufgaben unterscheiden sich stark. Eine schnelle Antwort kann wenig Rechenleistung erfordern. Ein Workflow für Coding, Recherche oder Finanzen kann tieferes Reasoning, Toolnutzung und viele Aktionen umfassen. Solche komplexeren Aufgaben können mehr Rechenleistung erfordern, aber auch deutlich mehr Wert schaffen.
Auf Modellebene hängen die Kosten pro erfolgreicher Aufgabe vom Preis, der eingesetzten Rechenleistung und der Wahrscheinlichkeit ab, das richtige Ergebnis zu erreichen. Für ein Unternehmen zählen zu den Gesamtkosten auch Arbeitszeit, menschliche Prüfung, erneute Versuche und Nacharbeit.
Die Rechnung ist einfach:
- Addiere die Gesamtkosten für die Erledigung der Arbeit.
- Zähle die Aufgaben, die den geforderten Qualitätsmaßstab erfüllt haben.
- Teile die Gesamtkosten durch die Zahl der erfolgreichen Aufgaben.
Deshalb führt der niedrigste Preis pro Token nicht immer zu den niedrigsten Kosten pro Ergebnis. Ein Frontier-Modell kann selbst bei einer Routineanfrage den besten Wert liefern, wenn es die richtige Antwort in einem Durchlauf erzeugt und dadurch erneute Versuche, Latenz, Prüfung und die gesamte Rechenleistung reduziert.
Eine gestufte Modellfamilie gibt Kund:innen mehr Möglichkeiten, diese Gleichung zu optimieren. GPT‑5.6, das wir letzte Woche veröffentlicht haben, hat drei Stufen: Sol ist unser Flagship; Terra balanciert Leistung und Kosten; Luna ist unser schnellstes und günstigstes Modell.
Diese Stufen bieten hilfreiche Ausgangspunkte. Am Ende sollte die Wirtschaftlichkeit der gesamten Aufgabe bestimmen, welches Modell das richtige ist. Ein:e Kund:in könnte Luna für einen schnellen Workflow mit hohem Volumen nutzen, Terra für Arbeit, die mehr Tiefe erfordert, oder Sol, wenn stärkeres Reasoning mit weniger Versuchen das beste Ergebnis liefert.
Wir haben GPT‑5.6 darauf trainiert, aus jedem Token mehr nützliche Arbeit herauszuholen. Im Artificial Analysis Coding Agent Index setzte GPT‑5.6 Sol mit maximalem Reasoning einen neuen Stand der Technik und nutzte dabei 54 % weniger Ausgabe-Tokens als ein anderes führendes Modell. Die folgende Grafik veranschaulicht den Vergleich.
DeepSWE v1.1: Engineering-Aufgaben mit langem Zeithorizont; GPT‑5.6 Sol erreicht ein neues Hoch von 72,7 % und liegt damit über den 69,9 % von Claude Fable 5, bei 36,2 % niedrigeren geschätzten API-Kosten.
In der gesamten GPT‑5.6‑Familie ist das Ziel dasselbe: mehr erfolgreiche Arbeit pro Dollar. Höhere Effizienz macht bestehende Aufgaben erschwinglicher. Mehr Leistungsfähigkeit ermöglicht völlig neue Arten von Arbeit.
Jede neue Modellgeneration sollte beide Seiten dieser Gleichung verbessern. Kund:innen sollten wertvollere Arbeit erledigen können, während zugleich die Kosten für jede erledigte Aufgabe weiter sinken.
Die dritte Messgröße ist Verlässlichkeit.
Die Nutzung von KI vertieft sich meist in Stufen. Zuerst hilft KI beim Entwerfen. Dann findet sie Kontext und schlussfolgert über Tools und Daten hinweg. Mit der Zeit beginnt sie, Aktionen auszuführen, Ausnahmen zu behandeln und Workflows abzuschließen, während Menschen bei Bedarf Urteilsvermögen und Kontrolle einbringen.
Jeder Schritt schafft mehr Wert und stellt höhere Anforderungen an das System.
Verlässlichkeit hat direkten wirtschaftlichen Wert. Wenn Ergebnisse korrekt, gut belegt, konsistent und angemessen eskaliert sind, verbringen Menschen weniger Zeit damit, die Arbeit zu prüfen, zu korrigieren und zu wiederholen. Erfolgreiche Aufgaben kosten weniger, und Organisationen gewinnen das Vertrauen, KI in wichtigeren Workflows einzusetzen.
Teams können das konkret machen, indem sie drei Ergebnisse verfolgen:
- Einsatzbereit: Das Ergebnis erfüllte den Qualitätsmaßstab direkt bei der Lieferung.
- Korrektur nötig: Das Ergebnis erforderte einen weiteren Versuch oder menschliche Bearbeitung.
- Eskalation nötig: Eine Person musste eingreifen und die Arbeit abschließen.
Diese Messgrößen erzählen mehr als die Modellgenauigkeit allein. Sie zeigen, ob KI den Aufwand für den Abschluss eines Projekts tatsächlich reduziert.
Verlässlichkeit erfordert auch klare Grenzen. Bevor KI vom Entwerfen zum Handeln übergeht, sollten Organisationen festlegen:
- Auf welche Daten das System zugreifen kann.
- Welche Systeme es nutzen oder verändern kann.
- Wann eine Person eine Aktion prüfen oder freigeben sollte.
Sicherheit, Datenschutz und Kontrolle schaffen die Grundlage für eine intensivere Nutzung. Menschen müssen verstehen, wie sich das System verhält, wie ihre Daten verarbeitet werden und wie seine Aktionen gesteuert werden.
ChatGPT Work baut auf der Grundlage von ChatGPT Enterprise für Sicherheit, Datenschutz, Compliance und Workspace-Management auf. So können Organisationen KI mehr Kontext und Zugang zu wertvolleren Workflows geben und zugleich angemessene Aufsicht wahren.
Leistungsfähigkeit sorgt für die erste Nutzung. Verlässlichkeit macht KI zu einem Teil davon, wie Arbeit erledigt wird.
Die letzte Frage ist, ob sich die Wirtschaftlichkeit bei größerem Einsatz verbessert.
Unternehmen können das messen, indem sie denselben Workflow über längere Zeit beobachten. Erfasse, wie viele Aufgaben den Qualitätsmaßstab erfüllt haben, die Gesamtkosten ihrer Erledigung und die Kosten pro erfolgreicher Aufgabe. Wenn die erledigte Arbeit schneller wächst als die Gesamtkosten und die Qualität stabil bleibt oder steigt, schafft jeder KI-Dollar mehr Wert.
Compute steht im Zentrum dieser Gleichung.
Compute treibt Forschung und jede Aufgabe an, die KI erledigt. Er prägt Produktqualität, Geschwindigkeit, Verlässlichkeit, Verfügbarkeit und Kosten. Trainings-Compute schafft künftige Leistungsfähigkeit. Inferenz-Compute liefert heute nützliche Arbeit. Beides sollte zu besseren Ergebnissen für Kund:innen führen.
Bessere Modelle, effizientere Inferenz, speziell entwickelte Hardware, höhere Auslastung, intelligenteres Routing und stärkeres Produktdesign verbessern den Ertrag aus Compute. Jede Infrastrukturgeneration hilft dabei, leistungsfähigere Modelle zu trainieren. Bessere Algorithmen, Hardware und Software helfen anschließend, diese Modelle effizienter bereitzustellen.
Kund:innen erleben diese Verbesserungen ganz praktisch: bessere Antworten, schnellere Ergebnisse, weniger Korrekturen, verlässlichere Produkte und geringere Kosten für die Arbeit, die erledigt werden muss.
Die Fortschritte verstärken sich gegenseitig. Bessere Infrastruktur beschleunigt Forschung. Forschung bringt leistungsfähigere und effizientere Modelle hervor. Bessere Modelle verbessern Produkte. Bessere Produkte fördern Nutzung, Lernen und Umsatz. Dieses Wachstum ermöglicht weitere Investitionen in die nächste Generation von Forschung, Compute, Bereitstellung und Sicherheit.
OpenAI führt diese Bausteine in einer gemeinsamen Intelligenzplattform zusammen. Menschen nutzen sie über ChatGPT und ChatGPT Work. Entwickler:innen arbeiten damit über Codex und die API. Unternehmen integrieren sie in die Systeme, in denen Arbeit stattfindet.
Wenn sich eine Ebene verbessert, können jedes Produkt und alle Kund:innen davon profitieren.
Zusammen zeigen diese vier Messgrößen, ob sich die nützliche Intelligenz pro Dollar verbessert.
Nützliche Arbeit zeigt, was KI produziert. Die Kosten pro erfolgreicher Aufgabe zeigen, was nötig ist, um das Ergebnis zu erreichen. Verlässlichkeit zeigt, wie viel von der Arbeit Menschen mit Vertrauen nutzen können. Wert im großen Maßstab zeigt, ob jeder Dollar und jede Compute-Einheit im Lauf der Zeit mehr leisten.
Ziel ist KI, die Menschen hilft, sinnvollere Arbeit zu leisten, bessere Entscheidungen zu treffen und mehr Zeit für die Teile ihrer Arbeit zu haben, die eindeutig menschliches Urteilsvermögen und Kreativität erfordern.
Unsere Aufgabe ist es, diese Gleichung mit jeder Generation zu verbessern: leistungsfähigere Modelle, schnellere und verlässlichere Ergebnisse und niedrigere Kosten für die Arbeit, die Kund:innen erledigt brauchen.
So wird KI mit der Zeit für mehr Menschen und Organisationen nützlicher.


