Preskočite na glavni sadržaj
OpenAI

17. srpnja 2026.

Tvrtka

Mjerila za doba umjetne inteligencije

Učitavanje…

Pitanje koje čujem od financijskih direktora posvuda jednostavno je: kako iz ulaganja u AI dobiti više vrijednosti?

Tržište je godinama uspjeh softvera mjerilo prihvaćanjem: kupljenim mjestima, aktivnim korisnicima i obnovljenim licencama. Razumijevanje vrijednosti AI-ja traži snažnije mjerilo: obavljeni rad.

Osnovno ekonomsko pitanje za financijske direktore i druge poslovne lidere jest raste li vrijednost rada koji AI obavi brže od troška njegove proizvodnje.

Odgovor na to pitanje zahtijeva dublji pogled od metrike poput troška po tokenu. Jeftiniji model može imati jeftinije tokene, ali za odlične rezultate možda će trebati više pokušaja, više vremena ili više ljudske provjere. Sposobniji model može imati skuplje tokene, ali isti zadatak dovršiti u jednom prolazu. Važan je ukupni trošak postizanja uspješnog ishoda u odnosu na vrijednost koju taj ishod stvara.

Konačna mjerila za doba AI-ja mogla bi se promatrati kao „korisna inteligencija po dolaru”. Ta metrika odgovara na četiri ključna pitanja:

  1. Obavlja li AI rad koji je važan?
  2. Koliko košta svaki uspješan zadatak?
  3. Mogu li se ljudi osloniti na rezultat?
  4. Stvara li svaki dolar uložen u AI veću vrijednost kako upotreba raste?

1. Koliko se korisnog rada obavi?

Počnite od samog rada.

Koliko je korisničkih problema AI pomogao riješiti? Koliko je promjena koda pomogao isporučiti? Koliko je ugovora pregledao? Koliko je vremena vratio ljudima? Koliko je odluka poboljšano jer je pravi kontekst bio dostupan u pravom trenutku?

Tokeni stvaraju vrijednost kada se pretvore u rad koji ljudi mogu upotrijebiti. Kako modeli postaju sposobniji, mogu preuzimati dulje i složenije zadatke: održavati kontekst, rasuđivati kroz više koraka, raditi u više alata i prilagođavati se u hodu.

Najbolje je početi s jednim radnim tokom. Definirajte što znači „gotovo” i mjerite taj ishod u sustavu u kojem se rad odvija.

Za tim za podršku „gotovo” može značiti riješen korisnički problem. Za inženjerski tim to može značiti promjenu koda koja prolazi testove. Za pravni tim to može značiti ugovor pregledan točno i na vrijeme.

Zamislite financijski tim koji se priprema za pregled prognoze. Velik dio posla događa se prije konačne odluke: pronalazak najnovije prognoze, prijenos podataka u Excel ili Sheets, utvrđivanje promjena, usklađivanje kartica, ponovno slaganje slajdova i provjera da se sve savršeno zbraja.

ChatGPT Posao može preuzeti velik dio tog procesa i timu dati više vremena za pitanja koja su važna: Što se promijenilo? Zašto? Što bismo trebali učiniti sljedeće?

To je korisna inteligencija po dolaru u praksi. Više se posla dovršava, i to brže, dok ljudi više vremena provode primjenjujući prosudbu, kreativnost i stručnost.

2. Koliko uspješan zadatak doista košta?

Sljedeće je pitanje koliko košta dobro dovršiti taj rad.

Zadaci za AI uvelike se razlikuju. Brz odgovor može zahtijevati malo računalnih resursa. Radni tok za kodiranje, istraživanje ili financije može uključivati dublje rasuđivanje, upotrebu alata i mnogo radnji. Ti složeniji zadaci mogu zahtijevati više računalnih resursa, ali mogu stvoriti mnogo veću vrijednost.

Na razini modela trošak po uspješnom zadatku ovisi o cijeni, količini upotrijebljenih računalnih resursa i vjerojatnosti postizanja pravog rezultata. Za poduzeće ukupni trošak uključuje i vrijeme zaposlenika, ljudsku provjeru, ponovne pokušaje i doradu.

Izračun je jednostavan:

  • Zbrojite ukupni trošak dovršetka rada.
  • Prebrojite zadatke koji su zadovoljili traženu razinu kvalitete.
  • Podijelite ukupni trošak brojem uspješnih zadataka.

Zato najniža cijena po tokenu ne donosi uvijek najniži trošak po ishodu. Granični model može pružiti najbolju vrijednost čak i za rutinski zahtjev ako iz prvog pokušaja proizvede pravi odgovor, čime se smanjuju ponovni pokušaji, kašnjenje, provjera i ukupni računalni resursi.

Obitelj modela s više razina korisnicima daje više načina za optimizaciju te jednadžbe. GPT‑5.6, koji smo objavili prošli tjedan, ima tri razine: Sol je naš vodeći model; Terra uravnotežuje performanse i trošak; Luna je naš najbrži i najpristupačniji model.

Te razine pružaju korisne polazišne točke. Ekonomika cijelog zadatka na kraju bi trebala odrediti pravi model. Korisnik može upotrijebiti Lunu za brz radni tok velikog obujma, Terru za rad koji traži veću dubinu ili Sol kada snažnije rasuđivanje daje najbolji rezultat uz manje pokušaja.

GPT‑5.6 trenirali smo tako da iz svakog tokena izvuče više korisnog rada. Na indeksu Artificial Analysis Coding Agent Index GPT‑5.6 Sol s maksimalnim rasuđivanjem postavio je novo najbolje dostignuće uz 54 % manje izlaznih tokena od drugog vodećeg modela. Grafikon u nastavku prikazuje usporedbu.

DeepSWE v1.1: dugoročni inženjerski zadaci; GPT‑5.6 Sol doseže novu visoku vrijednost od 72,7 %, iznad 69,9 % modela Claude Fable 5, uz 36,2 % niži procijenjeni trošak API-ja.

U cijeloj obitelji GPT‑5.6 cilj je isti: više uspješnog rada po dolaru. Veća učinkovitost postojeće zadatke čini pristupačnijima. Veća sposobnost omogućuje potpuno nove vrste rada.

Svaka nova generacija modela trebala bi poboljšati obje strane te jednadžbe. Korisnici bi trebali moći obavljati vrjedniji rad, dok istodobno trošak dovršetka svakog zadatka i dalje pada.

3. Koliko često AI obavi posao kako treba?

Treće je mjerilo pouzdanost.

Prihvaćanje AI-ja obično se produbljuje u fazama. Najprije AI pomaže u izradi nacrta. Zatim pronalazi kontekst i rasuđuje kroz alate i podatke. S vremenom počinje poduzimati radnje, rješavati iznimke i dovršavati radne tokove, dok ljudi daju prosudbu i kontrolu ondje gdje je potrebno.

Svaki korak stvara veću vrijednost i od sustava traži više.

Pouzdanost ima izravnu ekonomsku vrijednost. Kada su rezultati točni, dobro potkrijepljeni, dosljedni i pravilno eskalirani, ljudi manje vremena troše na provjeru, ispravljanje i ponavljanje rada. Uspješni zadaci koštaju manje, a organizacije stječu povjerenje za upotrebu AI-ja u važnijim radnim tokovima.

Timovi to mogu konkretizirati praćenjem triju ishoda:

  • Spremno za upotrebu: rezultat je zadovoljio razinu kvalitete već pri isporuci.
  • Potrebna je korekcija: rezultat je zahtijevao još jedan pokušaj ili ljudske izmjene.
  • Potrebna je eskalacija: osoba je morala uskočiti i dovršiti rad.

Ta mjerila pričaju bogatiju priču od same točnosti modela. Pokazuju smanjuje li AI doista količinu rada potrebnu za dovršetak projekta.

Pouzdanost zahtijeva i jasne granice. Prije nego što AI prijeđe s izrade nacrta na poduzimanje radnji, organizacije bi trebale definirati:

  • Kojim podacima sustav može pristupiti.
  • Koje sustave može upotrebljavati ili mijenjati.
  • Kada osoba treba pregledati ili odobriti radnju.

Sigurnost, zaštita, privatnost i kontrola stvaraju temelj za dublju upotrebu. Ljudi moraju razumjeti kako se sustav ponaša, kako se postupa s njihovim podacima i kako se upravlja njegovim radnjama.

ChatGPT Posao nadovezuje se na temelje sigurnosti, privatnosti, usklađenosti i upravljanja radnim prostorom u ChatGPT Enterpriseu. To organizacijama omogućuje da AI-ju daju više konteksta i pristup vrjednijim radnim tokovima, uz zadržavanje odgovarajućeg nadzora.

Sposobnost donosi prvu upotrebu. Pouzdanost čini AI dijelom načina na koji se posao obavlja.

4. Kupuje li svaki dolar uložen u AI više rada kako upotreba raste?

Završno je pitanje poboljšava li se ekonomika u razmjeru.

Tvrtke to mogu mjeriti praćenjem istog radnog toka tijekom vremena. Pratite koliko je zadataka zadovoljilo razinu kvalitete, ukupni trošak njihova dovršetka i trošak po uspješnom zadatku. Ako dovršeni rad raste brže od ukupnog troška, a kvaliteta se održava ili poboljšava, svaki dolar uložen u AI stvara veću vrijednost.

Računalni resursi u središtu su te jednadžbe.

Računalni resursi pokreću istraživanje i svaki zadatak koji AI dovrši. Oni oblikuju kvalitetu proizvoda, brzinu, pouzdanost, dostupnost i trošak. Računalni resursi za treniranje grade buduće sposobnosti. Računalni resursi za inferenciju danas isporučuju koristan rad. Oboje bi se trebalo pretočiti u bolje ishode za korisnike.

Bolji modeli, učinkovitija inferencija, namjenski hardver, veća iskorištenost, pametnije usmjeravanje i snažniji dizajn proizvoda poboljšavaju povrat na računalne resurse. Svaka generacija infrastrukture pomaže trenirati sposobnije modele. Bolji algoritmi, hardver i softver zatim pomažu učinkovitije posluživati te modele.

Korisnici ta poboljšanja doživljavaju ljudski: bolji odgovori, brži rezultati, manje ispravaka, pouzdaniji proizvodi i niži trošak rada koji trebaju obaviti.

Dobici se umnažaju. Bolja infrastruktura ubrzava istraživanje. Istraživanje stvara sposobnije i učinkovitije modele. Bolji modeli poboljšavaju proizvode. Bolji proizvodi potiču prihvaćanje, učenje i prihod. Taj rast podupire daljnje ulaganje u sljedeću generaciju istraživanja, računalnih resursa, implementacije i sigurnosti.

OpenAI te dijelove povezuje kroz jednu zajedničku platformu inteligencije. Ljudi je upotrebljavaju kroz ChatGPT i ChatGPT Posao. Programeri na njoj grade putem Codexa i API-ja. Poduzeća je uvode u sustave u kojima se rad odvija.

Kada se jedan sloj poboljša, svaki proizvod i svaki korisnik mogu imati koristi.

Mjerila za doba umjetne inteligencije

Uzeta zajedno, ta nam četiri mjerila pokazuju poboljšava li se korisna inteligencija po dolaru.

Koristan rad govori nam što AI proizvodi. Trošak po uspješnom zadatku govori nam što je potrebno da se dođe do ishoda. Pouzdanost nam govori koliko rada ljudi mogu s povjerenjem upotrijebiti. Vrijednost u razmjeru govori nam postižu li svaki dolar i svaka jedinica računalnih resursa s vremenom više.

Cilj je AI koji ljudima pomaže raditi smisleniji posao, donositi bolje odluke i provoditi više vremena na dijelovima posla koji traže izrazito ljudsku prosudbu i kreativnost.

Naš je posao poboljšavati tu jednadžbu sa svakom generacijom: sposobniji modeli, brži i pouzdaniji rezultati te niži troškovi za rad koji korisnici trebaju obaviti.

Tako AI s vremenom postaje korisniji većem broju ljudi i organizacija.

Autor

Sarah Friar