Lumaktaw sa pangunahing content
OpenAI

Hulyo 17, 2026

Kumpanya

Scorecard para sa panahon ng AI

Naglo-load…

Simple ang tanong na naririnig ko mula sa mga CFO saanman: paano tayo makakakuha ng mas malaking halaga mula sa ginagastos natin sa AI?

Sa loob ng maraming taon, sinukat ng merkado ang tagumpay ng software sa pamamagitan ng adoption: mga seat na binili, aktibong user, at mga lisensyang na-renew. Para maunawaan ang halaga ng AI, kailangan ng mas malakas na sukatan: trabahong natapos.

Ang pangunahing tanong sa ekonomiya para sa mga CFO at iba pang lider ng negosyo ay kung mas mabilis bang lumalaki ang halaga ng trabahong natatapos ng AI kaysa sa gastos para gawin ito.

Para masagot iyon, kailangang tumingin nang mas malalim kaysa sa sukatan gaya ng gastos kada token. Maaaring mas mura ang mga token ng mas murang modelo, pero maaaring kailanganin ng mas maraming subok, mas maraming oras, o mas maraming human review para makakuha ng mahusay na resulta. Maaaring mas mahal ang mga token ng mas mahusay na modelo, pero natatapos nito ang parehong task sa isang subok. Ang mahalaga ay ang kabuuang gastos sa pagbuo ng matagumpay na resulta, kumpara sa halagang nalilikha ng resultang iyon.

Maaaring tingnan ang pinakahuling scorecard para sa panahon ng AI bilang “Kapaki-pakinabang na Intelligence kada Dolyar.” Sinasagot ng sukatang ito ang apat na pangunahing tanong:

  1. Natatapos ba ng AI ang trabahong mahalaga?
  2. Magkano ang gastos ng bawat matagumpay na task?
  3. Maaasahan ba ng mga tao ang resulta?
  4. Mas lumilikha ba ng halaga ang bawat dolyar sa AI habang lumalawak ang paggamit?

1. Gaano karaming kapaki-pakinabang na trabaho ang natatapos?

Magsimula sa mismong trabaho.

Ilang isyu ng customer ang natulungan ng AI na maresolba? Ilang pagbabago sa code ang natulungan nitong mai-release? Ilang kontrata ang na-review nito? Gaano karaming oras ang naibalik nito sa mga tao? Ilang desisyon ang gumanda dahil available ang tamang context sa tamang sandali?

Lumilikha ng halaga ang mga token kapag nagiging trabahong magagamit ng mga tao ang mga ito. Habang mas humuhusay ang mga modelo, kaya nilang humawak ng mas mahaba at mas kumplikadong mga task: pagpapanatili ng context, pangangatwiran sa maraming hakbang, pagtatrabaho sa iba’t ibang tool, at pag-aangkop habang umuusad.

Ang pinakamagandang simula ay isang workflow. Tukuyin kung ano ang ibig sabihin ng “tapos na” at sukatin ang resultang iyon sa sistemang pinangyayarihan ng trabaho.

Para sa support team, ang “tapos na” ay maaaring isyung naresolba para sa customer. Para sa engineering team, maaaring ito ay pagbabago sa code na pumapasa sa mga test nito. Para sa legal team, maaaring ito ay kontratang na-review nang tama at nasa oras.

Isipin ang finance team na naghahanda para sa forecast review. Marami sa trabaho ang nangyayari bago magawa ang pinal na desisyon: paghahanap ng pinakabagong forecast, paglilipat ng data sa Excel o Sheets, pagtukoy ng mga pagbabago, pagre-reconcile ng mga tab, muling paggawa ng slides, at pagtiyak na eksaktong tugma ang lahat.

Kayang akuin ng ChatGPT Work ang malaking bahagi ng prosesong iyon, kaya mas maraming oras ang team para tumuon sa mahahalagang tanong: Ano ang nagbago? Bakit? Ano ang susunod nating dapat gawin?

Iyan ang kapaki-pakinabang na intelligence kada dolyar sa aktuwal na gamit. Mas maraming trabaho ang natatapos nang mas mabilis, habang mas maraming oras ang nagagamit ng mga tao sa paglalapat ng paghatol, pagkamalikhain, at kadalubhasaan.

2. Magkano talaga ang gastos ng matagumpay na task?

Ang susunod na tanong ay kung magkano ang gastos para matapos nang maayos ang trabahong iyon.

Malaki ang pagkakaiba-iba ng mga task sa AI. Maaaring kaunting compute lang ang kailangan para sa mabilis na sagot. Ang coding, research, o financial workflow ay maaaring mangailangan ng mas malalim na pangangatwiran, paggamit ng tool, at maraming aksyon. Maaaring mas maraming compute ang kailangan ng mas kumplikadong mga task na iyon, pero maaari silang lumikha ng mas malaking halaga.

Sa antas ng modelo, nakadepende ang gastos kada matagumpay na task sa presyo, dami ng compute na nagamit, at posibilidad na maabot ang tamang resulta. Para sa negosyo, kasama rin sa kabuuang gastos ang oras ng empleyado, human review, mga retry, at rework.

Simple ang kalkulasyon:

  • Isama ang kabuuang gastos sa pagtatapos ng trabaho.
  • Bilangin ang mga task na nakapasa sa kinakailangang quality bar.
  • Hatiin ang kabuuang gastos sa bilang ng matagumpay na mga task.

Ito ang dahilan kung bakit hindi palaging nagdudulot ang pinakamababang presyo kada token ng pinakamababang gastos kada resulta. Maaaring maghatid ang frontier na modelo ng pinakamagandang halaga kahit para sa karaniwang request kung naibibigay nito ang tamang sagot sa isang subok, na nagpapababa ng retry, latency, review, at kabuuang compute.

Nagbibigay ang tiered na pamilya ng modelo ng mas maraming paraan para ma-optimize ng mga customer ang equation na ito. Ang GPT‑5.6, na inilabas namin noong nakaraang linggo, ay may tatlong tier: Sol ang aming flagship; binabalanse ng Terra ang performance at gastos; Luna ang aming pinakamabilis at pinakaabot-kayang modelo.

Nagbibigay ang mga tier na ito ng kapaki-pakinabang na panimulang punto. Sa huli, dapat tukuyin ng ekonomiya ng buong task ang tamang modelo. Maaaring gamitin ng customer ang Luna para sa mabilis at high-volume na workflow, Terra para sa trabahong nangangailangan ng higit na lalim, o Sol kapag ang mas malakas na pangangatwiran ang nagbibigay ng pinakamagandang resulta sa mas kaunting subok.

Sinanay namin ang GPT‑5.6 para makakuha ng mas kapaki-pakinabang na trabaho mula sa bawat token. Sa Artificial Analysis Coding Agent Index, nagtakda ang GPT‑5.6 Sol na naka-set sa max na pangangatwiran ng bagong state of the art habang gumagamit ng 54% na mas kaunting output token kaysa sa isa pang nangungunang modelo. Ipinapakita ng chart sa ibaba ang paghahambing.

DeepSWE v1.1: Mga pangmatagalang gawaing pang-engineering; umabot ang GPT‑5.6 Sol sa bagong mataas na 72.7%, mas mataas kaysa sa 69.9% ng Claude Fable 5, sa tinatayang gastos sa API na 36.2% na mas mababa.

Sa buong pamilya ng GPT‑5.6, pareho ang layunin: mas maraming matagumpay na trabaho kada dolyar. Dahil sa mas mataas na efficiency, mas nagiging abot-kaya ang kasalukuyang mga task. Dahil sa mas malaking kakayahan, nagiging posible ang ganap na bagong uri ng trabaho.

Dapat pagandahin ng bawat bagong henerasyon ng modelo ang magkabilang panig ng equation na iyon. Dapat magawa ng mga customer ang mas mahalagang trabaho habang patuloy ding bumababa ang gastos sa pagtatapos ng bawat task.

3. Gaano kadalas nagagawa nang tama ng AI ang trabaho?

Ang ikatlong sukatan ay pagiging maaasahan.

Karaniwang lumalalim ang adoption ng AI sa mga yugto. Una, tumutulong ang AI sa pag-draft. Pagkatapos, naghahanap ito ng context at nangangatwiran sa iba’t ibang tool at data. Sa paglipas ng panahon, nagsisimula itong kumilos, humawak ng mga exception, at tumapos ng mga workflow, habang nagbibigay ang mga tao ng paghatol at kontrol kung saan kailangan.

Bawat hakbang ay lumilikha ng mas malaking halaga at humihingi ng higit pa sa system.

May direktang halagang pang-ekonomiya ang pagiging maaasahan. Kapag tumpak, may malinaw na source, consistent, at naie-escalate nang tama ang mga resulta, mas kaunting oras ang ginugugol ng mga tao sa pag-review, pagwawasto, at pag-uulit ng trabaho. Mas mababa ang gastos ng matagumpay na mga task, at nagkakaroon ang mga organisasyon ng kumpiyansang gamitin ang AI sa mas mahahalagang workflow.

Magagawa itong kongkretong sukatin ng mga team sa pamamagitan ng pagsubaybay sa tatlong resulta:

  • Handa nang gamitin: Nakapasa ang resulta sa quality bar sa mismong pagkaka-deliver.
  • Kailangang itama: Kinailangan ng resulta ng isa pang subok o human edits.
  • Kailangang i-escalate: Kinailangang pumasok ang isang tao at tapusin ang trabaho.

Mas masaklaw ang kuwentong ibinibigay ng mga sukatang ito kaysa sa accuracy lang ng modelo. Ipinapakita ng mga ito kung tunay na nababawasan ng AI ang trabahong kailangan para matapos ang proyekto.

Kailangan din ng malinaw na hangganan ang pagiging maaasahan. Bago lumipat ang AI mula sa pag-draft patungo sa pagkilos, dapat tukuyin ng mga organisasyon:

  • Anong data ang maa-access ng system.
  • Anong mga system ang magagamit o mababago nito.
  • Kailan dapat mag-review o mag-apruba ng aksyon ang isang tao.

Ang safety, security, privacy, at control ang lumilikha ng pundasyon para sa mas malalim na paggamit. Kailangang maunawaan ng mga tao kung paano kumikilos ang system, paano pinangangasiwaan ang kanilang data, at paano pinamamahalaan ang mga aksyon nito.

Nakabatay ang ChatGPT Work sa pundasyon ng security, privacy, compliance, at pamamahala ng workspace ng ChatGPT Enterprise. Dahil dito, mabibigyan ng mga organisasyon ang AI ng mas maraming context at access sa mas mahahalagang workflow habang pinananatili ang angkop na oversight.

Kakayahan ang nagbubukas ng unang paggamit. Dahil sa pagiging maaasahan, nagiging bahagi ang AI ng paraan ng pagtatrabaho.

4. Mas maraming trabaho ba ang nabibili ng bawat dolyar sa AI habang lumalaki ang paggamit?

Ang huling tanong ay kung bumubuti ba ang ekonomiya habang lumalaki ang scale.

Masusukat ito ng mga kumpanya sa pamamagitan ng pagsubaybay sa parehong workflow sa paglipas ng panahon. Subaybayan kung ilang task ang nakapasa sa quality bar, ang kabuuang gastos sa pagtatapos ng mga ito, at ang gastos kada matagumpay na task. Kung mas mabilis lumaki ang natapos na trabaho kaysa sa kabuuang gastos habang nananatili o gumaganda ang kalidad, mas maraming halaga ang nalilikha ng bawat dolyar sa AI.

Nasa sentro ng equation na ito ang compute.

Compute ang nagpapagana sa research at sa bawat task na tinatapos ng AI. Hinuhubog nito ang kalidad ng produkto, bilis, pagiging maaasahan, availability, at gastos. Binubuo ng training compute ang kakayahan sa hinaharap. Naghahatid ang inference compute ng kapaki-pakinabang na trabaho ngayon. Dapat parehong mauwi ang mga ito sa mas magagandang resulta para sa mga customer.

Pinapaganda ng mas mahuhusay na modelo, mas efficient na inference, purpose-built na hardware, mas mataas na utilization, mas matalinong routing, at mas matibay na product design ang return on compute. Tumutulong ang bawat henerasyon ng infrastructure na magsanay ng mas may kakayahang mga modelo. Pagkatapos, tumutulong ang mas mahuhusay na algorithm, hardware, at software na ma-serve ang mga modelong iyon nang mas efficient.

Nararanasan ng mga customer ang mga pagbuting iyon sa paraang makatao: mas magagandang sagot, mas mabilis na resulta, mas kaunting pagwawasto, mas maaasahang produkto, at mas mababang gastos para sa trabahong kailangan nilang matapos.

Nagpapatong-patong ang mga benepisyo. Pinabibilis ng mas mahusay na infrastructure ang research. Lumilikha ang research ng mas may kakayahan at mas efficient na mga modelo. Pinapaganda ng mas mahuhusay na modelo ang mga produkto. Itinutulak ng mas magagandang produkto ang adoption, pagkatuto, at kita. Sinusuportahan ng paglago na iyon ang patuloy na pamumuhunan sa susunod na henerasyon ng research, compute, deployment, at safety.

Pinag-uugnay ng OpenAI ang mga bahaging ito sa pamamagitan ng iisang shared intelligence platform. Ginagamit ito ng mga tao sa pamamagitan ng ChatGPT at ChatGPT Work. Gumagawa dito ang mga developer sa pamamagitan ng Codex at ng API. Dine-deploy ito ng mga enterprise sa mga system kung saan nangyayari ang trabaho.

Kapag bumuti ang isang layer, maaaring makinabang ang bawat produkto at customer.

Scorecard para sa panahon ng AI

Kapag pinagsama-sama, ipinapakita ng apat na sukatang ito kung bumubuti ba ang kapaki-pakinabang na intelligence kada dolyar.

Ipinapakita ng kapaki-pakinabang na trabaho kung ano ang nalilikha ng AI. Ipinapakita ng gastos kada matagumpay na task kung ano ang kailangan para maabot ang resulta. Ipinapakita ng pagiging maaasahan kung gaano karami sa trabaho ang magagamit ng mga tao nang may kumpiyansa. Ipinapakita ng value at scale kung mas marami bang nagagawa sa paglipas ng panahon ang bawat dolyar at bawat unit ng compute.

Ang layunin ay AI na tumutulong sa mga taong gumawa ng mas makabuluhang trabaho, gumawa ng mas magagandang desisyon, at maglaan ng mas maraming oras sa mga bahagi ng trabaho nila na nangangailangan ng tunay na human judgment at creativity.

Trabaho naming pagandahin ang equation na iyon sa bawat henerasyon: mas may kakayahang mga modelo, mas mabilis at mas maaasahang resulta, at mas mababang gastos para sa trabahong kailangang matapos ng mga customer.

Ganyan nagiging mas kapaki-pakinabang ang AI sa mas maraming tao at organisasyon sa paglipas ng panahon.

May-akda

Sarah Friar