Mjerilo za doba AI-ja
Pitanje koje čujem od finansijskih direktora svuda je jednostavno: kako iz ulaganja u AI izvući više vrijednosti?
Godinama je tržište uspjeh softvera mjerilo usvajanjem: kupljenim mjestima, aktivnim korisnicima i obnovljenim licencama. Razumijevanje vrijednosti AI-ja traži snažnije mjerilo: obavljeni posao.
Osnovno ekonomsko pitanje za finansijske direktore i druge poslovne lidere jeste da li vrijednost posla koji AI obavi raste brže od troška njegove proizvodnje.
Za odgovor na to pitanje treba gledati dublje od metrike poput cijene po tokenu. Jeftiniji model može imati jeftinije tokene, ali za odlične rezultate može biti potrebno više pokušaja, više vremena ili više ljudske provjere. Sposobniji model može imati skuplje tokene, ali isti zadatak završiti iz prvog pokušaja. Važan je ukupni trošak postizanja uspješnog ishoda u odnosu na vrijednost koju taj ishod stvara.
Konačno mjerilo za doba AI-ja može se posmatrati kao „korisna inteligencija po dolaru“. Ova metrika odgovara na četiri ključna pitanja:
- Da li AI obavlja posao koji je važan?
- Koliko košta svaki uspješan zadatak?
- Mogu li se ljudi osloniti na rezultat?
- Da li svaki AI dolar stvara više vrijednosti kako upotreba raste?
Počnite od samog posla.
Koliko je problema korisnika AI pomogao riješiti? Koliko je izmjena koda pomogao isporučiti? Koliko je ugovora pregledao? Koliko je vremena vratio ljudima? Koliko je odluka poboljšano jer je pravi kontekst bio dostupan u pravom trenutku?
Tokeni stvaraju vrijednost kada se pretvore u posao koji ljudi mogu koristiti. Kako modeli postaju sposobniji, mogu preuzimati duže i složenije zadatke: održavati kontekst, rezonovati kroz više koraka, raditi kroz različite alate i prilagođavati se u hodu.
Najbolje je početi od jednog toka rada. Definišite šta znači „završeno“ i mjerite taj ishod u sistemu u kojem se posao obavlja.
Za tim podrške, „završeno“ može značiti riješen problem korisnika. Za inženjerski tim, to može značiti izmjenu koda koja prolazi testove. Za pravni tim, to može značiti ugovor pregledan tačno i na vrijeme.
Zamislite finansijski tim koji se priprema za pregled prognoze. Velik dio posla dešava se prije konačne odluke: pronalaženje najnovije prognoze, prebacivanje podataka u Excel ili Sheets, utvrđivanje promjena, usklađivanje kartica, ponovno slaganje slajdova i provjera da se sve savršeno poklapa.
ChatGPT Posao može preuzeti velik dio tog procesa i dati timu više vremena da se usredotoči na važna pitanja: Šta se promijenilo? Zašto? Šta trebamo uraditi sljedeće?
To je korisna inteligencija po dolaru u praksi. Više posla se završava brže, dok ljudi više vremena posvećuju prosuđivanju, kreativnosti i stručnosti.
Sljedeće pitanje je koliko košta da se taj posao dobro završi.
AI zadaci se znatno razlikuju. Brz odgovor može tražiti malo računarskih resursa. Tok rada za kodiranje, istraživanje ili finansije može uključivati dublje rezonovanje, upotrebu alata i mnoge radnje. Ti složeniji zadaci mogu tražiti više računarskih resursa, ali mogu stvoriti mnogo veću vrijednost.
Na nivou modela, trošak po uspješnom zadatku zavisi od cijene, količine korištenih računarskih resursa i vjerovatnoće da se dođe do pravog rezultata. Za preduzeće, ukupni trošak uključuje i vrijeme zaposlenih, ljudsku provjeru, ponovne pokušaje i doradu.
Izračun je jednostavan:
- Saberite ukupni trošak završetka posla.
- Prebrojte zadatke koji su ispunili traženi prag kvaliteta.
- Podijelite ukupni trošak brojem uspješnih zadataka.
Zato najniža cijena po tokenu ne donosi uvijek najniži trošak po ishodu. Granični model može donijeti najbolju vrijednost čak i za rutinski zahtjev ako iz prvog pokušaja da pravi odgovor, smanjujući ponovne pokušaje, kašnjenje, provjeru i ukupne računarske resurse.
Porodica modela s više nivoa daje korisnicima više načina da optimiziraju ovu jednačinu. GPT‑5.6, koji smo objavili prošle sedmice, ima tri nivoa: Sol je naš vodeći model; Terra balansira performanse i trošak; Luna je naš najbrži i najpovoljniji model.
Ti nivoi daju korisne početne tačke. Ekonomika cijelog zadatka na kraju treba odrediti pravi model. Korisnik može koristiti Lunu za brz tok rada velikog obima, Terru za posao koji traži veću dubinu ili Sol kada snažnije rezonovanje donosi najbolji rezultat uz manje pokušaja.
GPT‑5.6 smo obučili da iz svakog tokena dobije više korisnog posla. Na Artificial Analysis Coding Agent Indexu, GPT‑5.6 Sol s maksimalnim rezonovanjem postavio je novi najbolji rezultat do sada, koristeći 54% manje izlaznih tokena od drugog vodećeg modela. Grafikon u nastavku prikazuje poređenje.
DeepSWE v1.1: Dugoročni inženjerski zadaci; GPT‑5.6 Sol dostiže novu visoku vrijednost od 72,7%, iznad 69,9% modela Claude Fable 5, uz 36,2% niži procijenjeni trošak API-ja.
U cijeloj porodici GPT‑5.6 cilj je isti: više uspješnog posla po dolaru. Veća efikasnost čini postojeće zadatke pristupačnijima. Veća sposobnost omogućava potpuno nove vrste posla.
Svaka nova generacija modela treba poboljšati obje strane te jednačine. Korisnici trebaju moći obavljati vredniji posao, dok trošak završetka svakog zadatka nastavlja padati.
Treće mjerilo je pouzdanost.
Usvajanje AI-ja obično se produbljuje u fazama. Prvo, AI pomaže u izradi nacrta. Zatim pronalazi kontekst i rezonuje kroz alate i podatke. S vremenom počinje preduzimati radnje, rješavati izuzetke i završavati tokove rada, dok ljudi daju prosudbu i kontrolu gdje je potrebno.
Svaki korak stvara više vrijednosti i od sistema traži više.
Pouzdanost ima direktnu ekonomsku vrijednost. Kada su rezultati tačni, dobro potkrijepljeni izvorima, dosljedni i pravilno eskalirani, ljudi troše manje vremena na provjeru, ispravke i ponavljanje posla. Uspješni zadaci koštaju manje, a organizacije stiču povjerenje da AI koriste u važnijim tokovima rada.
Timovi to mogu konkretizovati praćenjem tri ishoda:
- Spremno za upotrebu: rezultat je ispunio prag kvaliteta u isporučenom obliku.
- Potrebna ispravka: rezultat je tražio još jedan pokušaj ili ljudske izmjene.
- Potrebna eskalacija: osoba je morala uskočiti i završiti posao.
Ova mjerila pričaju bogatiju priču od same tačnosti modela. Pokazuju da li AI zaista smanjuje posao potreban za završetak projekta.
Pouzdanost također traži jasne granice. Prije nego što AI pređe s izrade nacrta na preduzimanje radnji, organizacije trebaju definisati:
- Kojim podacima sistem može pristupiti.
- Koje sisteme može koristiti ili mijenjati.
- Kada osoba treba pregledati ili odobriti radnju.
Sigurnost, zaštita, privatnost i kontrola stvaraju temelj za dublju upotrebu. Ljudi moraju razumjeti kako se sistem ponaša, kako se postupa s njihovim podacima i kako se upravlja njegovim radnjama.
ChatGPT Posao nadovezuje se na temelje sigurnosti, privatnosti, usklađenosti i upravljanja radnim prostorom koje pruža ChatGPT Enterprise. To organizacijama omogućava da AI-ju daju više konteksta i pristup vrednijim tokovima rada, uz zadržavanje odgovarajućeg nadzora.
Sposobnost donosi prvu upotrebu. Pouzdanost čini AI dijelom načina na koji se posao obavlja.
Posljednje pitanje je da li se ekonomika poboljšava s obimom.
Kompanije to mogu mjeriti prateći isti tok rada kroz vrijeme. Pratite koliko je zadataka ispunilo prag kvaliteta, ukupni trošak njihovog završetka i trošak po uspješnom zadatku. Ako završeni posao raste brže od ukupnog troška, a kvalitet se održava ili poboljšava, svaki AI dolar stvara više vrijednosti.
Računarski resursi su u središtu ove jednačine.
Računarski resursi pokreću istraživanje i svaki zadatak koji AI završi. Oni oblikuju kvalitet proizvoda, brzinu, pouzdanost, dostupnost i trošak. Računarski resursi za obuku grade buduće sposobnosti. Računarski resursi za inferenciju danas isporučuju koristan posao. Oboje se treba pretvoriti u bolje ishode za korisnike.
Bolji modeli, efikasnija inferencija, namjenski hardver, veća iskorištenost, pametnije usmjeravanje i snažniji dizajn proizvoda poboljšavaju povrat na računarske resurse. Svaka generacija infrastrukture pomaže u obuci sposobnijih modela. Bolji algoritmi, hardver i softver zatim pomažu da se ti modeli poslužuju efikasnije.
Korisnici ta poboljšanja doživljavaju ljudski: bolji odgovori, brži rezultati, manje ispravki, pouzdaniji proizvodi i niži trošak za posao koji im treba obaviti.
Dobici se umnožavaju. Bolja infrastruktura ubrzava istraživanje. Istraživanje stvara sposobnije i efikasnije modele. Bolji modeli poboljšavaju proizvode. Bolji proizvodi potiču usvajanje, učenje i prihod. Taj rast podržava daljnja ulaganja u sljedeću generaciju istraživanja, računarskih resursa, implementacije i sigurnosti.
OpenAI spaja ove dijelove kroz jednu zajedničku platformu inteligencije. Ljudi je koriste kroz ChatGPT i ChatGPT Posao. Programeri na njoj grade kroz Codex i API. Preduzeća je uvode u sisteme u kojima se posao obavlja.
Kada se jedan sloj poboljša, svaki proizvod i korisnik mogu imati koristi.
Zajedno, ova četiri mjerila pokazuju da li se korisna inteligencija po dolaru poboljšava.
Koristan rad pokazuje šta AI proizvodi. Trošak po uspješnom zadatku pokazuje šta je potrebno da se dođe do ishoda. Pouzdanost pokazuje koliko posla ljudi mogu koristiti s povjerenjem. Vrijednost u većem obimu pokazuje da li svaki dolar i svaka jedinica računarskih resursa vremenom postižu više.
Cilj je AI koji ljudima pomaže da rade smisleniji posao, donose bolje odluke i provode više vremena na dijelovima posla koji traže izrazito ljudsku prosudbu i kreativnost.
Naš posao je da tu jednačinu poboljšavamo sa svakom generacijom: sposobniji modeli, brži i pouzdaniji rezultati te niži troškovi za posao koji korisnicima treba obaviti.
Tako AI vremenom postaje korisniji sve većem broju ljudi i organizacija.


