Asana kärbib GPT‑6.1 Soliga brauseritestides mudelikulu 76 korda
Codexis GPT‑6 Astrat kasutades muutis Asana oma brauseriagendi testides 76 korda odavamaks ja 5 korda kiiremaks, et pakkuda klientidele võimekamaid mudeleid.

76×
Väiksemad hinnangulised mudelikulud GPT-6.1 Soli optimeeritud töövooga
5×
Kiiremad brauserikäivitused GPT-6.1 Soli optimeeritud töövooga
0,47 $
Keskmine hinnanguline mudelikulu GPT-6.1 Soli optimeeritud töövooga
Kasutades Codexis katsete tegemiseks GPT‑6 Astrat, optimeeris Asana oma brauseriagendi töövoo mudelil GPT‑6.1 Sol nii, et see töötas 76 korda odavamalt ja 5 korda kiiremini.
Asana aitab klientidel automatiseerida tööd eri ärirakendustes platvormi StackAI(avaneb uues aknas) abil, mille ta omandas(avaneb uues aknas). StackAI abil saavad kliendid luua koodi kirjutamata töövooge, mis navigeerivad veebisaitidel, täidavad vorme ja koguvad teavet. Asana tegevusmahu juures kuhjuvad ka väikesed ebatõhusused nendes töövoogudes.
Asana StackAI tehnoloogiajuht dr Frank Hidalgo seadis eesmärgiks muuta brauseriagent kiiremaks ja selle käitamine odavamaks. Ta andis Codexis GPT‑6 Astrale ülesande uurida agenti, katsetada täiustusi ja võrrelda tulemusi. Töö, mis oleks tema hinnangul käsitsi võtnud üks kuni kaks kuud, sai tehtud umbes nädalaga.
Asana 144 käivitusest koosnenud uuringus(avaneb uues aknas) katsetati GPT‑6.1 Soli ja kolme teist tipptasemel mudelit, mida nimetame siin mudeliteks A, B ja C. GPT‑6.1 Soli jaoks optimeeritud töövoo hinnanguline mudelikulu oli keskmiselt 0,47 dollarit ja täitmisaeg umbes neli minutit käivituse kohta – see oli 76 korda odavam ja 5 korda kiirem kui mudeli B algne tootmiskeskkonna seadistus.
„Sellised on inimeste ja agentide ühismeeskonnad praktikas. Arendaja seadis suuna, GPT-6 Astra viis läbi katsed ja tulemused jõudsid Commandi kaudu tootmiskeskkonda. See näitab, kuidas Asana paneb inimeste ja agentide ühismeeskonnad tööle.“
Kiireks edasiminekuks kasutas Hidalgo esmalt Codexis GPT‑6 Astrat, et kaardistada koodibaas ja selgitada, kuidas agent iga mudelipäringu koostas. GPT‑6 Astra avastas, et agent pani vahemällu oma püsijuhised ja tööriistade definitsioonid, kuid mitte kogutud leheteksti ja kuvatõmmiste kasvavat ajalugu. Nii saadeti see ajalugu iga päringuga uuesti täishinnaga.
Samuti eemaldas agent vanemaid kuvatõmmiseid ja kärpis teksti peaaegu igal sammul. Iga muudatus muutis ajalugu, nii et ainuüksi selle vahemällu salvestamisest poleks kasu olnud. Lisaks võis teabe kadumine sundida agenti juba loetud lehti uuesti külastama.
Hidalgo vaatas GPT‑6 Astra pakutud parandused üle ja valis katsetamiseks kolm:
Vahemälu kasutamise laiendamine agendi sirvimisajaloole
Säilitatava teksti mahu suurendamine
Kuvatõmmiste eemaldamine partiidena, mitte igal sammul
GPT‑6 Astra alustas kiirete katsetega, et selgitada välja olulised muutujad. Kuna kood polnud mõeldud kontrollitud katseteks, struktureeris ta selle seejärel ümber, et üks esi- ja tagarakendus saaks toetada paralleelselt paljusid töövooge, igaühel oma seadistused.
Astra viis läbi kogu uuringu: katsetati ajaloo mahupiire 120 000 ja 480 000 märki ning kuut vahemälu ja kuvatõmmiste reeglistikku, iga kombinatsiooni kolm korda kõigil neljal mudelil (vt allolevat tabelit). Parima tulemusega reeglistik lubas kuvatõmmistel koguneda 20-ni ja jättis seejärel alles vaid kõige uuema. Nii püsis varasem ajalugu eemaldamiste vahel pikemat aega muutumatuna. Koos ajaloo suurema mahupiiriga saigi sellest optimeeritud töövoog. Iga seadistus täitis sama ülesannet: koguda avalikust näidiskataloogist iga 32 raamatu kohta kuue välja andmed. See vastas tööle, mida mõned Asana kliendid StackAIs teevad.
Mudel | Kirjeldus | Hind |
|---|---|---|
Mudel A | Teise tipptasemel tehisintellekti labori väiksem ja soodsam mudel, avaldatud 2025. aasta sügisel | Pool GPT‑6.1 Soli hinnast |
Mudel B | Algselt tootmiskeskkonnas kasutatud mudel samast laborist kui mudel A, avaldatud 2026. aasta suvel | Sama hind mis GPT‑6.1 Solil |
Mudel C | Mudeli B uuendatud versioon, avaldatud 2026. aasta sügisel | Sama hind mis GPT‑6.1 Solil |
GPT‑6.1 Sol | OpenAI mudel |
GPT‑6 Astra käivitas töövood ning uuris päringuid, kasutusandmeid ja väljundeid; eraldi mudeliseansid kontrollisid töö üle. Iga seansi päringud, andmelogid ja tulemused salvestati Asana tarkvara tarnimise platvormile Command(avaneb uues aknas), et meeskond saaks hiljem kogu uuringu üle vaadata. Commandis vormistati leiud tööülesanneteks ja seejärel ühendamisettepanekuteks ning muudatused viidi tootmiskeskkonda.
„Käsitsi oleks see mul võtnud üks kuni kaks kuud. Codexis GPT-6 Astraga kulus umbes nädal: seadsin enne magamaminekut käsuga /goal eesmärgi ja vaatasin hommikul tulemused üle.“
Mudeli B hinnanguline mudelikulu vähenes optimeerimise tulemusel vähemalt 36,21 dollarilt (mõned algsed käivitused jõudsid sammulimiidini enne ülesande lõpetamist) 1,24 dollarini käivituse kohta ehk 29 korda. GPT‑6.1 Soli optimeeritud töövoog oli veel 2,6 korda odavam: selle kulu oli 0,47 dollarit. Optimeeritud töövoo iga käivitus täitis ülesande ja tagastas õige vastuse.
Kolme käivituse keskmised. ≥: lähtetase sisaldab limiidini jõudnud käivitusi, seega on selle keskmine alampiir.
Kaks parempoolset kordajat võrdlevad tulemusi optimeeritud mudeliga B. Mudelit B käitati sama uuringu 1. etapis ning mudelit C ja Sol 6.1 teises etapis (punktiirjoon).
Ainuüksi GPT‑6.1 Soli puhul vähendas uus vahemälu ja kuvatõmmiste reeglistik ajaloo suurema mahupiiri korral kulu neli korda: 1,97 dollarilt 0,47 dollarini käivituse kohta. Iga väljakutse oli umbes kolm korda odavam, sest 89% sisendist tuli vahemälust hinnaga, mis moodustas 5% vahemällu salvestamata sisendi hinnast. Ka täitmine kiirenes: mudeli B algse seadistuse vähemalt 22,5 minutilt GPT‑6.1 Soli optimeeritud töövoo ligikaudu nelja minutini.
Kolme käivituse keskmine; veajooned näitavad standardhälvet. ≥: keskmine sisaldab limiidini jõudnud või lõpetamata käivitust, seega on tegelik väärtus vähemalt sama suur.
Tulpades kasutatakse siniseid toone. Vahemälu mõju hindamiseks võrrelge tulemusi suurema, 480 tuhande märgi mahupiiriga tulbaga.
Käivituste markerid ja standardhälbe veajooned on taastatud algse pildi põhjal ligikaudselt; käivituste algsed väärtused ja standardhälbed polnud saadaval.
Kolme käivituse keskmine; veajooned näitavad standardhälvet. ≥: keskmine sisaldab limiidini jõudnud või lõpetamata käivitust, seega on tegelik väärtus vähemalt sama suur.
Tulpades kasutatakse siniseid toone. Vahemälu mõju hindamiseks võrrelge tulemusi suurema, 480 tuhande märgi mahupiiriga tulbaga.
Käivituste markerid ja standardhälbe veajooned on taastatud algse pildi põhjal ligikaudselt; käivituste algsed väärtused ja standardhälbed polnud saadaval.
Uuring näitas ka seda, kuidas ajaloo haldamine mõjutas seda, kas agent üldse vastuse andis. Kui GPT‑6.1 Sol sai sirvimisajaloo säilitamiseks rohkem ruumi, kasvas vastuse andnud käivituste arv väiksema mahupiiriga kolmest 18-st suurema mahupiiriga kõigi 18-ni. Kõik vastused olid õiged. Hidalgo jaoks seisneb äriline väärtus selles, et klientidele saab pakkuda kiiremaid ja võimekamaid mudeleid, hoides samal ajal käitamiskulud jätkusuutlikul tasemel.
„Varem piiras kulu seda, milliseid mudeleid saime klientidele nende ülesannete jaoks pakkuda. Agendi tõhusamaks muutmisega saame pakkuda klientidele paremat ja kiiremat mudelit ning samal ajal vähendada oma käitamiskulusid.“
Asana on StackAIs brauseriga navigeerimise muudatused kasutusele võtnud ja arendab tööriistu, mis lihtsustavad sarnaste katsete kordamist. Aja jooksul kavatseb meeskond lisada need testid platvormi hindamistesse, et kliendid ja sisemeeskonnad saaksid oma agente seadistades võrrelda kulu, täitmisaega ja vastuste kvaliteeti.
„Kitsaskohaks pole enam tarkvara tarnimise kiirus, vaid inimeste tähelepanu. Oleme lähedal maailmale, kus iga arendaja on tootejuht, kes juhib agentide meeskonda.“
Asana kasutab nüüd Codexis GPT‑6 Astrat toote funktsioonide testimiseks enne avaldamist: Astra navigeerib platvormil, proovib eri sisendeid ja teatab vigadest kvaliteeditestijatele. Hidalgo näeb selles alust uuele tarkvaraarenduse elutsüklile, kus paljud pilves töötavate agentide seansid testivad funktsioone paralleelselt.
Kogu uuring on saadaval Asana(avaneb uues aknas) ja StackAI(avaneb uues aknas) blogides.


