Wyniki i oceny w epoce AI
Pytanie, które słyszę od CFO na całym świecie, jest proste: jak uzyskać większą wartość z wydatków na AI?
Przez lata rynek mierzył sukces oprogramowania przez pryzmat adopcji: kupionych stanowisk, aktywnych użytkowników i odnawianych licencji. Zrozumienie wartości AI wymaga silniejszej miary: wykonanej pracy.
Podstawowe pytanie ekonomiczne dla CFO i innych liderów biznesu brzmi: czy wartość pracy wykonywanej przez AI rośnie szybciej niż koszt jej wytworzenia.
Odpowiedź na to pytanie wymaga spojrzenia głębiej niż na wskaźnik taki jak koszt za token. Tańszy model może mieć tańsze tokeny, ale uzyskanie świetnych wyników może wymagać większej liczby prób, więcej czasu lub dokładniejszej weryfikacji przez człowieka. Bardziej zaawansowany model może mieć droższe tokeny, ale wykonać to samo zadanie za jednym podejściem. Liczy się pełny koszt uzyskania udanego wyniku zestawiony z wartością, jaką ten wynik tworzy.
Ostateczną kartę wyników dla ery AI można postrzegać jako „użyteczność sztucznej inteligencji w przeliczeniu na dolara”. Ten wskaźnik odpowiada na cztery kluczowe pytania:
- Czy AI wykonuje pracę, która ma znaczenie?
- Ile kosztuje każde udane zadanie?
- Czy ludzie mogą polegać na wyniku?
- Czy każdy dolar wydany na AI przynosi większą wartość wraz ze wzrostem użycia?
Zacznijmy od samej pracy.
W rozwiązaniu ilu problemów klientów pomogła AI? Ile zmian w kodzie pomogła wdrożyć? Ile umów przeanalizowała? Ile czasu oddała ludziom? Ile decyzji stało się lepszych, bo właściwy kontekst był dostępny we właściwym momencie?
Tokeny tworzą wartość, gdy przekształcają się w pracę, z której ludzie mogą korzystać. W miarę jak modele stają się bardziej zaawansowane, mogą podejmować dłuższe i bardziej złożone zadania: utrzymywać kontekst, prowadzić rozumowanie przez wiele kroków, działać w różnych narzędziach i dostosowywać się w trakcie pracy.
Najlepiej zacząć od jednego przepływu pracy. Zdefiniuj, co oznacza „wykonane”, i mierz ten wynik w systemie, w którym odbywa się praca.
Dla zespołu wsparcia „wykonane” może oznaczać rozwiązany problem klienta. Dla zespołu inżynierskiego może to oznaczać zmianę w kodzie, która przechodzi testy. Dla zespołu prawnego może to oznaczać umowę sprawdzoną dokładnie i na czas.
Weźmy zespół finansowy przygotowujący się do przeglądu prognozy. Duża część pracy odbywa się przed podjęciem ostatecznej decyzji: znalezienie najnowszej prognozy, przeniesienie danych do Excela lub Arkuszy, wskazanie zmian, uzgodnienie kart, odtworzenie slajdów i sprawdzenie, czy wszystko idealnie się zgadza.
ChatGPT Work może przejąć dużą część tego procesu, dając zespołowi więcej czasu na pytania, które są istotne: co się zmieniło, dlaczego, co powinniśmy zrobić dalej?
To użyteczność sztucznej inteligencji w przeliczeniu na dolara w praktyce. Więcej pracy zostaje wykonane szybciej, a ludzie poświęcają więcej czasu na osąd, kreatywność i wiedzę ekspercką.
Kolejne pytanie brzmi: ile kosztuje dobre wykonanie tej pracy.
Zadania AI bardzo się różnią. Szybka odpowiedź może wymagać niewielkiej mocy obliczeniowej. Przepływ pracy związany z kodowaniem, badaniami lub finansami może obejmować głębsze rozumowanie, użycie narzędzi i wiele działań. Takie bardziej złożone zadania mogą wymagać większej mocy obliczeniowej, ale mogą też tworzyć znacznie większą wartość.
Na poziomie modelu koszt udanego zadania zależy od ceny, ilości użytej mocy obliczeniowej i prawdopodobieństwa uzyskania właściwego wyniku. Dla firmy pełny koszt obejmuje także czas pracowników, weryfikację przez ludzi, ponowne próby i poprawki.
Wyliczenie jest proste:
- Dodaj pełny koszt wykonania pracy.
- Policz zadania, które spełniły wymagany próg jakości.
- Podziel pełny koszt przez liczbę udanych zadań.
Właśnie dlatego najniższa cena za token nie zawsze daje najniższy koszt wyniku. Model pionierski może zapewnić najlepszą wartość nawet przy rutynowym zapytaniu, jeśli udziela właściwej odpowiedzi za jednym podejściem, ograniczając ponowne próby, opóźnienia, weryfikację i łączną moc obliczeniową.
Warstwowa rodzina modeli daje klientom więcej sposobów optymalizacji tego równania. GPT‑5.6, który udostępniliśmy w zeszłym tygodniu, ma trzy poziomy: Sol to nasz flagowy model; Terra równoważy wydajność i koszt; Luna to nasz najszybszy i najtańszy model.
Te poziomy są użytecznymi punktami wyjścia. O właściwym modelu powinna ostatecznie decydować ekonomika całego zadania. Klient może używać modelu Luna do szybkiego przepływu pracy o dużej skali, Terra do pracy wymagającej większej głębi albo Sol, gdy silniejsze rozumowanie daje najlepszy wynik przy mniejszej liczbie prób.
Wytrenowaliśmy GPT‑5.6 tak, aby uzyskiwać więcej użytecznej pracy z każdego tokenu. W indeksie Artificial Analysis Coding Agent Index model GPT‑5.6 Sol z maksymalnym rozumowaniem ustanowił nowy najlepszy wynik, używając o 54% mniej tokenów wyjściowych niż inny czołowy model. Poniższy wykres ilustruje to porównanie.
DeepSWE v1.1: długotrwałe zadania inżynieryjne; GPT‑5.6 Sol ustanawia nowy rekord na poziomie 72,7%, przewyższając wynik Claude Fable 5 wynoszący 69,9%, przy szacowanym koszcie API niższym o 36,2%.
W całej rodzinie GPT‑5.6 cel jest ten sam: więcej udanej pracy w przeliczeniu na dolara. Większa efektywność obniża koszt istniejących zadań. Większe możliwości pozwalają wykonywać zupełnie nowe rodzaje pracy.
Każda nowa generacja modeli powinna poprawiać obie strony tego równania. Klienci powinni móc wykonywać bardziej wartościową pracę, a jednocześnie koszt wykonania każdego zadania powinien nadal spadać.
Trzecia miara to niezawodność.
Adopcja AI zwykle pogłębia się etapami. Najpierw AI pomaga tworzyć wersje robocze. Potem znajduje kontekst i prowadzi rozumowanie z użyciem narzędzi i danych. Z czasem zaczyna podejmować działania, obsługiwać wyjątki i realizować przepływy pracy, a ludzie zapewniają osąd i kontrolę tam, gdzie jest to potrzebne.
Każdy krok tworzy większą wartość i wymaga od systemu więcej.
Niezawodność ma bezpośrednią wartość ekonomiczną. Gdy wyniki są dokładne, dobrze udokumentowane, spójne i odpowiednio eskalowane, ludzie poświęcają mniej czasu na weryfikowanie, poprawianie i powtarzanie pracy. Udane zadania kosztują mniej, a organizacje zyskują pewność, by używać AI w ważniejszych przepływach pracy.
Zespoły mogą to skonkretyzować, śledząc trzy wyniki:
- Gotowe do użycia: wynik spełnił próg jakości w dostarczonej formie.
- Wymaga korekty: wynik wymagał kolejnej próby lub edycji przez człowieka.
- Wymaga eskalacji: człowiek musiał wkroczyć i dokończyć pracę.
Te miary opowiadają pełniejszą historię niż sama dokładność modelu. Pokazują, czy AI rzeczywiście zmniejsza nakład pracy potrzebny do ukończenia projektu.
Niezawodność wymaga też jasnych granic. Zanim AI przejdzie od tworzenia wersji roboczych do podejmowania działań, organizacje powinny określić:
- Do jakich danych system może mieć dostęp.
- Jakich systemów może używać lub jakie może zmieniać.
- Kiedy człowiek powinien sprawdzić lub zatwierdzić działanie.
Bezpieczeństwo, zabezpieczenia, prywatność i kontrola tworzą fundament głębszego wykorzystania. Ludzie muszą rozumieć, jak zachowuje się system, jak obsługiwane są ich dane i jak zarządza się jego działaniami.
ChatGPT Work opiera się na fundamentach bezpieczeństwa, prywatności, zgodności i zarządzania przestrzenią roboczą dostępnych w ChatGPT Enterprise. Dzięki temu organizacje mogą dawać AI więcej kontekstu i dostęp do bardziej wartościowych przepływów pracy, zachowując odpowiedni nadzór.
Możliwości skłaniają do pierwszego użycia. Niezawodność sprawia, że AI staje się częścią sposobu wykonywania pracy.
Ostatnie pytanie brzmi, czy ekonomika poprawia się w dużej skali.
Firmy mogą to mierzyć, obserwując ten sam przepływ pracy w czasie. Śledź, ile zadań spełniło próg jakości, jaki był łączny koszt ich wykonania oraz koszt jednego udanego zadania. Jeśli liczba wykonanych zadań rośnie szybciej niż łączny koszt, a jakość się utrzymuje lub poprawia, każdy dolar wydany na AI tworzy większą wartość.
Moc obliczeniowa znajduje się w centrum tego równania.
Moc obliczeniowa napędza badania i każde zadanie wykonywane przez AI. Kształtuje jakość produktu, szybkość, niezawodność, dostępność i koszt. Moc obliczeniowa używana do trenowania buduje przyszłe możliwości. Moc obliczeniowa używana do inferencji dostarcza użyteczną pracę dziś. Obie powinny przekładać się na lepsze wyniki dla klientów.
Lepsze modele, wydajniejsza inferencja, specjalnie projektowany sprzęt, wyższe wykorzystanie, inteligentniejsze kierowanie zadań i mocniejszy projekt produktu poprawiają zwrot z mocy obliczeniowej. Każda generacja infrastruktury pomaga trenować bardziej zaawansowane modele. Lepsze algorytmy, sprzęt i oprogramowanie pomagają następnie obsługiwać te modele wydajniej.
Klienci odczuwają te ulepszenia w ludzkich kategoriach: lepsze odpowiedzi, szybsze wyniki, mniej korekt, bardziej niezawodne produkty i niższy koszt pracy, którą muszą wykonać.
Korzyści się kumulują. Lepsza infrastruktura przyspiesza badania. Badania prowadzą do bardziej zaawansowanych i wydajnych modeli. Lepsze modele ulepszają produkty. Lepsze produkty napędzają adopcję, uczenie się i przychody. Ten wzrost wspiera dalsze inwestycje w kolejną generację badań, mocy obliczeniowej, wdrożeń i bezpieczeństwa.
OpenAI łączy te elementy na jednej wspólnej platformie sztucznej inteligencji. Użytkownicy korzystają z niej przez ChatGPT i ChatGPT Work. Deweloperzy tworzą na niej przez Codex i API. Przedsiębiorstwa wdrażają ją w systemach, w których odbywa się praca.
Gdy jedna warstwa się poprawia, każdy produkt i każdy klient mogą na tym skorzystać.
Łącznie te cztery miary pokazują, czy użyteczność sztucznej inteligencji w przeliczeniu na dolara się poprawia.
Użyteczna praca pokazuje, co wytwarza AI. Koszt udanego zadania pokazuje, czego potrzeba, by osiągnąć wynik. Niezawodność pokazuje, jak dużą część pracy ludzie mogą wykorzystywać z zaufaniem. Wartość w skali pokazuje, czy każdy dolar i każda jednostka mocy obliczeniowej z czasem pozwalają osiągnąć więcej.
Celem jest AI, która pomaga ludziom wykonywać bardziej znaczącą pracę, podejmować lepsze decyzje i poświęcać więcej czasu na te części obowiązków, które wymagają wyraźnie ludzkiego osądu i kreatywności.
Naszym zadaniem jest poprawiać to równanie z każdą generacją: bardziej zaawansowane modele, szybsze i bardziej niezawodne wyniki oraz niższe koszty pracy, której potrzebują klienci.
Tak AI z czasem staje się bardziej użyteczna dla większej liczby ludzi i organizacji.


