Tekoälyn aikakauden mittaristo
Talousjohtajat kysyvät minulta kaikkialla samaa yksinkertaista asiaa: miten saamme AI-investoinneistamme enemmän arvoa?
Vuosien ajan markkinoilla mitattiin ohjelmistojen menestystä käyttöönoton kautta: ostetut käyttäjäpaikat, aktiiviset käyttäjät ja uusitut lisenssit. Tekoälyn arvon ymmärtäminen vaatii vahvemman mittarin: tehdyn työn.
Talousjohtajien ja muiden yritysjohtajien taloudellinen peruskysymys on, kasvaako tekoälyn tekemän työn arvo nopeammin kuin sen tuottamisen kustannus.
Tähän vastaaminen edellyttää syvempää tarkastelua kuin pelkkä kustannus tokenia kohti. Edullisemman mallin tokenit voivat olla halvempia, mutta erinomainen tulos voi vaatia useampia yrityksiä, enemmän aikaa tai enemmän ihmisen tekemää tarkistusta. Kyvykkäämmän mallin tokenit voivat olla kalliimpia, mutta se voi suorittaa saman tehtävän yhdellä kertaa. Olennaista on onnistuneen lopputuloksen tuottamisen kokonaiskustannus suhteessa arvoon, jonka lopputulos luo.
Tekoälyn aikakauden lopullista mittaristoa voisi kutsua nimellä ”hyödyllistä älykkyyttä dollaria kohti”. Tämä mittari vastaa neljään keskeiseen kysymykseen:
- Suorittaako tekoäly työtä, jolla on merkitystä?
- Mitä kukin onnistunut tehtävä maksaa?
- Voivatko ihmiset luottaa tulokseen?
- Tuottaako jokainen tekoälyyn käytetty dollari enemmän arvoa käytön kasvaessa?
Aloita itse työstä.
Kuinka monta asiakasongelmaa tekoäly auttoi ratkaisemaan? Kuinka monta koodimuutosta se auttoi viemään tuotantoon? Kuinka monta sopimusta se tarkisti? Kuinka paljon aikaa se antoi ihmisille takaisin? Kuinka moni päätös parani, koska oikea konteksti oli käytettävissä oikealla hetkellä?
Tokenit luovat arvoa, kun ne muuttuvat työksi, jota ihmiset voivat hyödyntää. Kun mallit kehittyvät kyvykkäämmiksi, ne voivat ottaa hoidettavakseen pidempiä ja monimutkaisempia tehtäviä: säilyttää kontekstin, käyttää päättelyä useissa vaiheissa, työskennellä eri työkalujen välillä ja mukautua matkan varrella.
Paras lähtökohta on yksi työnkulku. Määritä, mitä ”valmis” tarkoittaa, ja mittaa kyseistä lopputulosta järjestelmässä, jossa työ tehdään.
Tukitiimille ”valmis” voi tarkoittaa ratkaistua asiakasongelmaa. Insinööritiimille se voi tarkoittaa koodimuutosta, joka läpäisee testit. Lakitiimille se voi tarkoittaa sopimusta, joka on tarkistettu oikein ja ajallaan.
Ajatellaan taloustiimiä valmistautumassa ennustekatsaukseen. Suuri osa työstä tapahtuu ennen lopullista päätöstä: etsitään uusin ennuste, siirretään data Exceliin tai Sheetsiin, tunnistetaan muutokset, täsmäytetään välilehdet, rakennetaan kalvot uudelleen ja tarkistetaan, että kaikki täsmää täydellisesti.
ChatGPT Work voi hoitaa suuren osan tästä prosessista, jolloin tiimille jää enemmän aikaa keskittyä olennaisiin kysymyksiin: Mikä muuttui? Miksi? Mitä meidän pitäisi tehdä seuraavaksi?
Tätä hyödyllinen älykkyys dollaria kohti tarkoittaa käytännössä. Enemmän työtä valmistuu nopeammin, ja ihmiset käyttävät suuremman osan ajastaan harkintaan, luovuuteen ja asiantuntemukseen.
Seuraava kysymys on, mitä työn hyvä suorittaminen maksaa.
Tekoälytehtävät vaihtelevat suuresti. Nopea vastaus voi vaatia vain vähän laskentaa. Koodaus-, tutkimus- tai taloustyönkulku voi edellyttää syvempää päättelyä, työkalujen käyttöä ja monia toimia. Nämä monimutkaisemmat tehtävät voivat vaatia enemmän laskentaa, mutta ne voivat luoda paljon enemmän arvoa.
Mallin tasolla onnistuneen tehtävän kustannus riippuu hinnasta, käytetyn laskennan määrästä ja todennäköisyydestä päästä oikeaan tulokseen. Yritykselle kokonaiskustannukseen sisältyvät myös työntekijöiden aika, ihmisen tekemä tarkistus, uudet yritykset ja uudelleentyö.
Laskelma on suoraviivainen:
- Laske yhteen työn suorittamisen kokonaiskustannus.
- Laske tehtävät, jotka täyttivät vaaditun laatutason.
- Jaa kokonaiskustannus onnistuneiden tehtävien määrällä.
Siksi alin hinta tokenia kohti ei aina tuota alhaisinta kustannusta lopputulosta kohti. Edistynyt malli voi tarjota parhaan arvon jopa rutiinipyyntöön, jos se tuottaa oikean vastauksen yhdellä kertaa ja vähentää uusia yrityksiä, viivettä, tarkistusta ja kokonaislaskentaa.
Porrastettu malliperhe antaa asiakkaille enemmän tapoja optimoida tätä yhtälöä. Viime viikolla julkaisemassamme GPT‑5.6:ssa on kolme tasoa: Sol on lippulaivamme, Terra tasapainottaa suorituskyvyn ja kustannukset, ja Luna on nopein ja edullisin mallimme.
Nämä tasot tarjoavat hyödylliset lähtökohdat. Oikean mallin pitäisi lopulta määräytyä koko tehtävän talouden perusteella. Asiakas voi käyttää Lunaa nopeaan ja suuren volyymin työnkulkuun, Terraa enemmän syvyyttä vaativaan työhön tai Solia silloin, kun vahvempi päättely tuottaa parhaan tuloksen harvemmilla yrityksillä.
Koulutimme GPT‑5.6:n tuottamaan enemmän hyödyllistä työtä jokaisesta tokenista. Artificial Analysis Coding Agent Indexissä GPT‑5.6 Sol enimmäispäättelyllä saavutti uuden huipputason ja käytti samalla 54 % vähemmän tulostokeneita kuin toinen johtava malli. Alla oleva kaavio havainnollistaa vertailua.
DeepSWE v1.1: Pitkän aikavälin ohjelmistosuunnittelutehtävät; GPT‑5.6 Sol saavuttaa uuden ennätystuloksen 72,7 %, ylittäen Claude Fable 5:n tuloksen 69,9 %, arviolta 36,2 % alhaisemmilla API-kustannuksilla.
Koko GPT‑5.6‑tuoteperheen tavoite on sama: enemmän onnistuneita töitä euroa kohden. Tehokkuuden parantaminen tekee olemassa olevista tehtävistä edullisempia. Parempi kyky mahdollistaa täysin uudenlaisia työtehtäviä.
Jokaisen uuden mallisukupolven tulisi parantaa yhtälön molempia puolia. Asiakkaiden tulisi pystyä suorittamaan arvokkaampaa työtä samalla, kun kunkin tehtävän suorittamisen kustannukset jatkavat laskuaan.
Kolmas mittari on luotettavuus.
Tekoälyn käyttöönotto yleensä syvenee vaiheittain. Ensinnäkin tekoäly auttaa luonnostelussa. Sitten se löytää kontekstia ja syitä työkalujen ja datan eri osista. Ajan myötä se alkaa toimia, käsitellä poikkeuksia ja suorittaa työnkulkuja, ja ihmiset tarjoavat tarvittaessa harkintaa ja valvontaa.
Jokainen askel luo lisää arvoa ja vaatii järjestelmältä enemmän.
Luotettavuudella on suoraa taloudellista arvoa. Kun tulokset ovat tarkkoja, hyvin lähtein saatuja, johdonmukaisia ja asianmukaisesti eteenpäin vietyjä, ihmiset käyttävät vähemmän aikaa työn tarkistamiseen, korjaamiseen ja toistamiseen. Onnistuneet tehtävät maksavat vähemmän, ja organisaatiot saavat varmuutta käyttää tekoälyä tärkeämmissä työnkuluissa.
Tiimit voivat tehdä tästä konkreettista seuraamalla kolmea tulosta:
- Käyttövalmis: Tulos täytti toimitettaessa laatuvaatimukset.
- Vaatii korjausta: Tulos vaati uuden yrityksen tai ihmisen tekemiä muokkauksia.
- Tarpeiden eskalointi: Jonkun piti puuttua asiaan ja saattaa työ päätökseen.
Nämä mittarit kertovat rikkaamman tarinan kuin pelkkä mallin tarkkuus. Ne osoittavat, vähentääkö tekoäly aidosti projektin loppuun saattamiseen tarvittavaa työtä.
Luotettavuus vaatii myös selkeitä rajoja. Ennen kuin tekoäly siirtyy luonnostelusta toiminnan aloittamiseen, organisaatioiden tulisi määritellä:
- Mitä tietoja järjestelmä voi käyttää.
- Mitä järjestelmiä se voi käyttää tai muuttaa.
- Milloin henkilön tulisi tarkistaa tai hyväksyä toimenpide.
Turvallisuus, suojaus, yksityisyys ja hallinta luovat perustan syvemmälle käytölle. Ihmisten on ymmärrettävä, miten järjestelmä toimii, miten heidän tietojaan käsitellään ja miten sen toimintoja ohjataan.
ChatGPT Work perustuu ChatGPT Enterprisen tietoturva-, yksityisyys-, vaatimustenmukaisuus- ja työtilan hallintaan. Tämä antaa organisaatioille mahdollisuuden antaa tekoälylle enemmän kontekstia ja pääsyn arvokkaampiin työnkulkuihin samalla, kun se säilyttää asianmukaisen valvonnan.
Kyky ansaitsee ensimmäisellä käyttökerralla. Luotettavuus tekee tekoälystä osan työntekotapaa.
Viimeinen kysymys on, paraneeko talous mittakaavassa.
Yritykset voivat mitata tätä noudattamalla samaa työnkulkua ajan kuluessa. Seuraa, kuinka monta tehtävää saavutti laatuvaatimukset, niiden suorittamisen kokonaiskustannuksia ja onnistuneiden tehtävien kustannuksia. Jos tehty työ kasvaa nopeammin kuin kokonaiskustannukset laadun pysyessä samana tai parantuessa, jokainen tekoälyeuro tuottaa enemmän arvoa.
Laskenta on tämän yhtälön keskiössä.
Laskenta tukee tutkimusta ja kaikkia tekoälyn suorittamia tehtäviä. Se vaikuttaa tuotteen laatuun, nopeutta, luotettavuuteen, saatavuuteen ja kustannuksiin. Laskennan kouluttaminen rakentaa tulevaisuuden kykyjä. Päättelylaskenta tuottaa hyödyllistä työtä tänä päivänä. Molempien pitäisi johtaa parempiin tuloksiin asiakkaille.
Paremmat mallit, tehokkaampi päättely, tarkoitukseen rakennettu laitteisto, korkeampi käyttöaste, älykkäämpi reititys ja vahvempi tuotesuunnittelu parantavat kaikki laskennan tuottoa. Jokainen infrastruktuurisukupolvi auttaa kouluttamaan kyvykkäämpiä malleja. Paremmat algoritmit, laitteistot ja ohjelmistot auttavat sitten palvelemaan näitä malleja tehokkaammin.
Asiakkaat kokevat nämä parannukset inhimillisesti: parempia vastauksia, nopeampia tuloksia, vähemmän korjauksia, luotettavampia tuotteita ja alhaisemmat kustannukset tehtävästä työstä.
Voitot yhdistettynä. Parempi infrastruktuuri nopeuttaa tutkimusta. Tutkimus tuottaa kyvykkäämpiä ja tehokkaampia malleja. Paremmat mallit parantavat tuotteita. Paremmat tuotteet edistävät käyttöönottoa, oppimista ja tuloja. Tämä kasvu tukee jatkuvia investointeja seuraavan sukupolven tutkimukseen, laskentaan, käyttöönottoon ja turvallisuuteen.
OpenAI yhdistää nämä osat yhdellä jaetulla älyalustalla. Ihmiset käyttävät sitä ChatGPT:n ja ChatGPT Workin kautta. Kehittäjät rakentavat sitä Codexin ja API:n kautta. Yritykset ottavat sen käyttöön järjestelmissä, joissa työ tapahtuu.
Kun yksi kerros paranee, jokainen tuote ja asiakas hyötyvät.
Yhdessä nämä neljä mittaria kertovat meille, paraneeko hyödyllisen tiedustelutiedon määrä dollaria kohden.
Hyödyllinen työ kertoo meille, mitä tekoäly tuottaa. Onnistuneesta tehtävästä maksettava kustannus kertoo, mitä lopputuloksen saavuttaminen vaatii. Luotettavuus kertoo meille, kuinka paljon työstä ihmiset voivat luottavaisin mielin käyttää. Skaala-arvo kertoo meille, saako jokainen dollari ja jokainen laskentayksikkö aikaan enemmän ajan myötä.
Tavoitteena on tekoäly, joka auttaa ihmisiä tekemään merkityksellisempää työtä, tekemään parempia päätöksiä ja käyttämään enemmän aikaa työnsä niihin osiin, jotka vaativat nimenomaan inhimillistä harkintakykyä ja luovuutta.
Tehtävämme on parantaa tätä yhtälöä jokaisella sukupolvella: tehokkaampia malleja, nopeampia ja luotettavampia tuloksia sekä alhaisempia kustannuksia asiakkaiden tarvitsemasta työstä.
Näin tekoälystä tulee ajan myötä hyödyllisempää useammille ihmisille ja organisaatioille.


