Siirry pääsisältöön
OpenAI

9. lokakuuta 2026

Asanan selaintestit: kulut 1/76-osaan GPT‑6.1 Sol -mallilla

Codexin GPT‑6 Astra -mallin avulla Asana pudotti selainagenttinsa kustannukset testeissä 1/76-osaan ja nopeutti sen viisinkertaiseksi voidakseen tarjota asiakkaille kyvykkäämpiä malleja.

Valkoinen Asanan logo sinisellä paperikerroksia muistuttavalla taustalla.
Yrityksen koko: Enterprise
Alue: Pohjois-Amerikka
Toimiala: Teknologia
Tuotteet: Codex

76×

Pienemmät arvioidut mallikustannukset optimoidulla GPT-6.1 Sol -työnkululla

5×

Nopeammat selainsuoritukset optimoidulla GPT-6.1 Sol -työnkululla

0,47 $

Arvioitu keskimääräinen mallikustannus optimoidulla GPT-6.1 Sol -työnkululla

Ladataan...

Asana optimoi GPT‑6.1 Sol -mallia käyttävän selainagenttinsa työnkulun Codexissa kokeita suorittavan GPT‑6 Astra -mallin avulla. Kustannukset putosivat 1/76-osaan ja suoritus nopeutui viisinkertaiseksi.

Asana auttaa asiakkaitaan automatisoimaan työtä eri yrityssovelluksissa StackAI⁠(avautuu uudessa ikkunassa)-alustan avulla, jonka se hankki yrityskaupalla⁠(avautuu uudessa ikkunassa). StackAI:n avulla asiakkaat voivat rakentaa ilman koodaamista työnkulkuja, jotka selaavat verkkosivustoja, täyttävät lomakkeita ja keräävät tietoa. Asanan mittakaavassa näiden työnkulkujen pienetkin tehottomuudet kasaantuvat.

Asanan StackAI:n teknologiajohtaja, tohtori Frank Hidalgo, ryhtyi tekemään selainagentista nopeampaa ja edullisempaa käyttää. Hän ohjasi Codexin GPT‑6 Astra -mallin tutkimaan agenttia, testaamaan parannuksia ja vertailemaan tuloksia. Työ, johon hän arvioi käsin tehtynä kuluvan yhdestä kahteen kuukautta, valmistui noin viikossa.

Asanan 144 suorituskerran tutkimuksessa⁠(avautuu uudessa ikkunassa) testattiin GPT‑6.1 Sol -mallia ja kolmea muuta edistynyttä mallia, joita kutsutaan tässä malleiksi A, B ja C. Näin syntyneen, GPT‑6.1 Sol -mallia käyttävän optimoidun työnkulun arvioidut mallikustannukset olivat keskimäärin 0,47 dollaria ja kesto noin neljä minuuttia suorituskertaa kohden. Kustannukset olivat 1/76 alkuperäisen, mallia B käyttävän tuotantokokoonpanon kustannuksista, ja suoritus oli viisi kertaa nopeampi.

”Tältä ihmisten ja agenttien yhteistiimit näyttävät käytännössä. Ohjelmistokehittäjä näytti suunnan, GPT-6 Astra suoritti kokeet ja tulokset vietiin Commandin kautta tuotantoon. Tämä osoittaa, miten Asana tekee ihmisten ja agenttien yhteistiimeistä todellisuutta.”
– Arnab Bose, tuotejohtaja, Asana

Selainagentin tehottomuuksien tunnistaminen GPT‑6 Astra -mallilla

Päästäkseen nopeasti liikkeelle Hidalgo käytti ensin Codexin GPT‑6 Astra -mallia koodipohjan kartoittamiseen ja sen selvittämiseen, miten agentti muodosti kunkin mallipyynnön. GPT‑6 Astra havaitsi, että agentti tallensi välimuistiin pysyvät ohjeensa ja työkalumäärittelynsä mutta ei keräämiensä sivutekstien ja kuvakaappausten kasvavaa historiaa. Siksi jokainen pyyntö lähetti tämän historian uudelleen täydellä hinnalla.

Agentti myös poisti vanhoja kuvakaappauksia ja lyhensi tekstiä lähes joka vaiheessa. Jokainen muokkaus muutti historiaa, joten pelkkä historian tallentaminen välimuistiin ei olisi auttanut. Tietojen katoaminen saattoi myös pakottaa agentin palaamaan jo lukemilleen sivuille.

Arvioitu kahden kuukauden tutkimustyö viikossa GPT‑6 Astra -mallilla

Hidalgo kävi läpi GPT‑6 Astra -mallin ehdottamat korjaukset ja valitsi testattavaksi kolme:

  • Välimuistin käytön laajentaminen agentin selaushistoriaan

  • Säilytettävän tekstimäärän kasvattaminen

  • Kuvakaappausten poistaminen erissä eikä joka vaiheessa

GPT‑6 Astra aloitti nopeilla testeillä selvittääkseen, mitkä muuttujat olivat olennaisia. Koska koodia ei ollut suunniteltu kontrolloituja kokeita varten, malli muokkasi sen rakennetta niin, että yksi käyttöliittymä ja taustajärjestelmä pystyivät tukemaan useita työnkulkuja rinnakkain, kutakin omilla asetuksillaan.

Astra toteutti koko tutkimuksen: testissä olivat historian 120 000 ja 480 000 merkin enimmäiskoot sekä kuusi välimuistin ja kuvakaappausten käsittelykäytäntöä. Jokainen yhdistelmä testattiin kolme kertaa kullakin neljästä mallista (katso alla oleva taulukko). Parhaassa käytännössä kuvakaappauksia annettiin kertyä 20, minkä jälkeen niistä säilytettiin vain viimeisin. Näin aiempi historia pysyi muuttumattomana pidempään poistojen välillä. Yhdistettynä historian suurempaan enimmäiskokoon tämä muodosti optimoidun työnkulun. Jokainen kokoonpano suoritti saman tehtävän: kuuden tietokentän keräämisen jokaisesta julkisen esimerkkiluettelon 32 kirjasta. Tehtävä vastasi joidenkin Asanan asiakkaiden StackAI:ssa suorittamia tehtäviä.

Malli

Kuvaus

Hinta

Malli A

Toisen edistyneen tekoälyn tutkimusorganisaation pienempi ja edullisempi malli, julkaistu syksyllä 2025

Puolet GPT‑6.1 Sol -mallin hinnasta

Malli B

Alun perin tuotannossa käytetty malli samalta tutkimusorganisaatiolta kuin malli A, julkaistu kesällä 2026

Sama hinta kuin GPT‑6.1 Sol -mallilla

Malli C

Mallin B päivitetty versio, julkaistu syksyllä 2026

Sama hinta kuin GPT‑6.1 Sol -mallilla

GPT‑6.1 Sol

OpenAI:n malli

GPT‑6 Astra suoritti työnkulut ja tutki pyynnöt, käyttötiedot ja tulosteet. Erilliset malli-istunnot tarkastivat työn. Jokaisen istunnon pyynnöt, datan jäljitystiedot ja tulokset tallennettiin Asanan Command⁠(avautuu uudessa ikkunassa)-ohjelmistontoimitusalustaan, jotta tiimi pystyi käymään koko tutkimuksen läpi jälkikäteen. Commandin havainnoista luotiin ensin tiketit ja sitten muutospyynnöt, ja muutokset vietiin tuotantoon.

”Käsin tähän olisi kulunut minulta yhdestä kahteen kuukautta. Codexin GPT-6 Astra -mallilla siihen meni noin viikko: asetin tavoitteen /goal-komennolla ennen nukkumaanmenoa ja tarkastin tulokset aamulla.”
– Frank Hidalgo, PhD, StackAI:n teknologiajohtaja, Asana

Mallikustannukset alle 0,50 dollariin suorituskertaa kohden

Mallin B arvioidut mallikustannukset laskivat optimoinnin myötä vähintään 36,21 dollarista 1,24 dollariin suorituskertaa kohden eli 1/29-osaan. Osa alkuperäisistä suorituksista saavutti vaiheiden enimmäismäärän ennen valmistumista. GPT‑6.1 Sol -mallia käyttävän optimoidun työnkulun kustannus oli tästäkin vain 1/2,6 eli 0,47 dollaria. Optimoitu työnkulku suoritti tehtävän loppuun ja palautti oikean vastauksen joka kerta.

Kolmen suorituksen keskiarvot. ≥: lähtötasoon sisältyy enimmäisrajaan pysähtyneitä suorituksia, joten sen keskiarvo on alaraja.

Oikeanpuoleiset kaksi kerrointa vertaavat tuloksia optimoituun malliin B. Malli B testattiin tutkimuksen ensimmäisessä vaiheessa, malli C ja Sol 6.1 saman tutkimuksen toisessa vaiheessa (pisteviiva).

Pelkästään GPT‑6.1 Sol -mallilla historian suurempaa enimmäiskokoa käytettäessä uusi välimuisti- ja kuvakaappauskäytäntö pudotti kustannukset neljäsosaan: 1,97 dollarista 0,47 dollariin suorituskertaa kohden. Yksittäisen kutsun hinta laski noin kolmasosaan, koska 89 % syötteestä tuli välimuistista ja maksoi vain 5 % ilman välimuistia käytettävän syötteen hinnasta. Myös suoritukset nopeutuivat: mallia B käyttävällä alkuperäisellä kokoonpanolla kului vähintään 22,5 minuuttia, kun taas GPT‑6.1 Sol -mallin optimoidulla työnkululla aikaa kului noin neljä minuuttia.

Kolmen suorituksen keskiarvo, virhepalkit kuvaavat keskihajontaa. ≥: keskiarvoon sisältyy enimmäisrajaan pysähtynyt tai keskeneräinen suoritus, joten todellinen arvo on vähintään näin suuri.

Pylväissä käytetään sinistä teemaa. Vertaa välimuistin vaikutuksia suuremman, 480 000 merkin enimmäiskoon pylvääseen.

Suoritusmerkinnät ja keskihajonnan virhepalkit on rekonstruoitu likimääräisesti alkuperäisestä kuvasta; alkuperäisiä suoritusarvoja ja keskihajontoja ei ollut saatavilla.

Kolmen suorituksen keskiarvo, virhepalkit kuvaavat keskihajontaa. ≥: keskiarvoon sisältyy enimmäisrajaan pysähtynyt tai keskeneräinen suoritus, joten todellinen arvo on vähintään näin suuri.

Pylväissä käytetään sinistä teemaa. Vertaa välimuistin vaikutuksia suuremman, 480 000 merkin enimmäiskoon pylvääseen.

Suoritusmerkinnät ja keskihajonnan virhepalkit on rekonstruoitu likimääräisesti alkuperäisestä kuvasta; alkuperäisiä suoritusarvoja ja keskihajontoja ei ollut saatavilla.

Tutkimus osoitti myös, miten historian hallinta vaikutti siihen, tuottiko agentti ylipäätään vastausta. Kun GPT‑6.1 Sol sai enemmän tilaa selaushistorian säilyttämiseen, vastauksen tuottaneiden suoritusten määrä nousi pienemmän enimmäiskoon kolmesta suorituksesta kaikkiin 18 suoritukseen. Suuremmalla enimmäiskoossa vastaus oli joka kerta oikea. Hidalgolle liiketoimintahyöty on siinä, että asiakkaat saavat käyttöönsä nopeampia ja kyvykkäämpiä malleja samalla, kun käyttökustannukset pysyvät kestävällä tasolla.

”Aiemmin kustannukset rajoittivat sitä, mitä malleja voimme tarjota asiakkaille näihin tehtäviin. Kun tehostamme agenttia, voimme tarjota asiakkaille paremman ja nopeamman mallin sekä samalla alentaa käyttökustannuksiamme.”
– Frank Hidalgo, PhD, StackAI:n teknologiajohtaja, Asana

Kokeilujen ja tuotetestauksen laajentaminen

Asana on julkaissut selaimessa navigointia koskevat muutokset StackAI:ssa ja kehittää työkaluja, joilla vastaavia kokeita on helpompi toistaa. Tiimi aikoo ajan myötä sisällyttää tämän testauksen alustan arviointeihin, jotta asiakkaat ja sisäiset tiimit voivat vertailla kustannuksia, suoritusaikoja ja vastausten laatua agenttiensa asetuksia määrittäessään.

”Julkaisunopeus ei enää ole pullonkaula, vaan ihmisten huomiokyky. Olemme lähellä maailmaa, jossa jokainen ohjelmistokehittäjä toimii agenttijoukkoa johtavana tuotepäällikkönä.”
– Frank Hidalgo, PhD, StackAI:n teknologiajohtaja, Asana

Asana käyttää nyt Codexin GPT‑6 Astra -mallia tuoteominaisuuksien testaamiseen ennen julkaisua: Astra liikkuu alustalla, kokeilee erilaisia syötteitä ja raportoi virheistä laadunvarmistajien tarkastettavaksi. Hidalgo näkee tämän pohjana uudenlaiselle ohjelmistokehityksen elinkaarelle, jossa monet pilvessä toimivat agentti-istunnot testaavat ominaisuuksia rinnakkain.

Liity työnteon uuteen aikakauteen

Yli miljoona yritystä ympäri maailmaa saavuttaa merkittäviä tuloksia OpenAI:n avulla.