Asana z GPT‑6.1 Sol v testih 76-krat zniža stroške modela
Asana je z GPT‑6 Astra v orodju Codex v testih dosegla 76-krat cenejše in 5-krat hitrejše delovanje agenta za brskalnik, da strankam ponudi zmogljivejše modele.

76-krat
Nižji ocenjeni stroški modela z optimiziranim potekom dela na GPT-6.1 Sol
5-krat
Hitrejše izvajanje v brskalniku z optimiziranim potekom dela na GPT-6.1 Sol
0,47 USD
Povprečni ocenjeni stroški modela z optimiziranim potekom dela na GPT-6.1 Sol
Asana je s poskusi, ki jih je izvajal GPT‑6 Astra v orodju Codex, optimizirala potek dela svojega agenta za brskalnik na modelu GPT‑6.1 Sol ter dosegla 76-krat cenejše in 5-krat hitrejše izvajanje.
Asana strankam pomaga avtomatizirati delo v poslovnih aplikacijah prek platforme StackAI(odpre se v novem oknu), ki jo je prevzela(odpre se v novem oknu). S platformo StackAI lahko stranke brez pisanja kode ustvarijo poteke dela za krmarjenje po spletnih mestih, izpolnjevanje obrazcev in zbiranje informacij. Pri obsegu poslovanja podjetja Asana se majhne neučinkovitosti v teh potekih dela seštevajo.
Dr. Frank Hidalgo, tehnološki direktor za StackAI pri podjetju Asana, si je zadal cilj pospešiti delovanje agenta za brskalnik in znižati stroške njegovega izvajanja. Modelu GPT‑6 Astra v orodju Codex je naročil, naj razišče delovanje agenta, preizkusi izboljšave in primerja rezultate. Delo, ki bi po njegovi oceni ročno trajalo od enega do dveh mesecev, je bilo opravljeno v približno enem tednu.
V študiji podjetja Asana s 144 izvedbami(odpre se v novem oknu) so preizkusili GPT‑6.1 Sol in tri druge prelomne modele, tukaj poimenovane modeli A, B in C. Tako optimiziran potek dela na modelu GPT‑6.1 Sol je v povprečju dosegel ocenjene stroške modela v višini 0,47 USD in čas približno štirih minut na izvedbo – 76-krat ceneje in 5-krat hitreje od prvotne produkcijske nastavitve na modelu B.
»Tako so v praksi videti ekipe ljudi in agentov. Inženir je določil smer, GPT-6 Astra je izvedel poskuse, rezultati pa so prek platforme Command prišli v produkcijo. To kaže, kako Asana omogoča, da ekipe ljudi in agentov resnično zaživijo.«
Da bi hitro napredoval, je Hidalgo najprej uporabil GPT‑6 Astra v orodju Codex za pregled zbirke kode in razlago, kako agent sestavi vsako zahtevo za model. GPT‑6 Astra je odkril, da agent predpomni svoja stalna navodila in definicije orodij, ne pa tudi vse obsežnejše zgodovine zbranega besedila strani in posnetkov zaslona. Zato je vsaka zahteva to zgodovino znova poslala po polni ceni.
Agent je poleg tega pri skoraj vsakem koraku odstranjeval starejše posnetke zaslona in krajšal besedilo. Vsak tak poseg je spremenil zgodovino, zato zgolj njeno predpomnjenje ne bi pomagalo. Zaradi izgubljenih informacij pa bi moral agent morda znova obiskati strani, ki jih je že prebral.
Hidalgo je pregledal popravke, ki jih je predlagal GPT‑6 Astra, in izbral tri za preizkus:
Razširitev predpomnjenja na agentovo zgodovino brskanja
Povečanje količine besedila, ki ga lahko ohrani
Odstranjevanje posnetkov zaslona v sklopih namesto pri vsakem koraku
GPT‑6 Astra je začel s hitrimi preizkusi, da bi ugotovil, katere spremenljivke so pomembne. Ker koda ni bila zasnovana za nadzorovane poskuse, jo je nato prestrukturiral tako, da sta lahko en uporabniški vmesnik in eno zaledje podpirala več vzporednih potekov dela, vsakega s svojimi nastavitvami.
Astra je izvedel celotno študijo: omejitvi zgodovine na 120.000 in 480.000 znakov ter šest pravil predpomnjenja in upravljanja posnetkov zaslona, vsako preizkušeno trikrat na vsakem od štirih modelov (glejte spodnjo tabelo). Najuspešnejše pravilo je omogočilo kopičenje posnetkov zaslona do 20, nato pa je ohranilo le najnovejšega. Tako je starejša zgodovina med odstranjevanji dlje časa ostala nespremenjena. Skupaj z višjo omejitvijo zgodovine je to pravilo postalo osnova optimiziranega poteka dela. Vsaka konfiguracija je opravila isto nalogo: zbiranje šestih podatkovnih polj za vsako od 32 knjig iz javnega predstavitvenega kataloga. To je značilen primer nalog, ki jih nekatere stranke podjetja Asana izvajajo v platformi StackAI.
Model | Opis | Cena |
|---|---|---|
Model A | Manjši, cenejši model drugega laboratorija za prelomno umetno inteligenco, izdan jeseni 2025 | Polovična cena modela GPT‑6.1 Sol |
Model B | Model, prvotno uporabljen v produkciji, iz istega laboratorija kot model A, izdan poleti 2026 | Enaka cena kot za GPT‑6.1 Sol |
Model C | Posodobljena različica modela B, izdana jeseni 2026 | Enaka cena kot za GPT‑6.1 Sol |
GPT‑6.1 Sol | Model podjetja OpenAI |
GPT‑6 Astra je izvajal poteke dela ter preučeval zahteve, zapise o uporabi in rezultate, delo pa so pregledale ločene seje modela. Zahteve, podatkovne sledi in rezultati vsake seje so bili zabeleženi v platformi Command(odpre se v novem oknu), ki jo Asana uporablja za dostavo programske opreme, da je ekipa lahko pozneje pregledala celotno študijo. Ugotovitve iz platforme Command so pretvorili v delovne naloge, nato v zahteve za združitev kode, spremembe pa so uvedli v produkcijo.
»Ročno bi za to potreboval od enega do dveh mesecev. Z GPT-6 Astra v orodju Codex je trajalo približno teden dni: pred spanjem sem z ukazom /goal določil cilj, zjutraj pa pregledal rezultate.«
Pri modelu B je optimizacija znižala ocenjene stroške modela z najmanj 36,21 USD (nekatere prvotne izvedbe so dosegle omejitev števila korakov, preden so se končale) na 1,24 USD na izvedbo, kar je 29-kratno znižanje. Optimizirani potek dela na modelu GPT‑6.1 Sol je bil še 2,6-krat cenejši, s stroškom 0,47 USD. Vsaka izvedba optimiziranega poteka dela je dokončala nalogo in vrnila pravilen odgovor.
Povprečja treh izvedb. ≥: izhodišče vključuje izvedbe, ustavljene zaradi omejitve, zato je njegovo povprečje spodnja meja.
Desna faktorja prikazujeta primerjavo z optimizirano nastavitvijo modela B. Model B so preizkusili v 1. fazi, model C in Sol 6.1 pa v 2. fazi iste študije (pikčasta črta).
Že samo pri modelu GPT‑6.1 Sol je ob višji omejitvi zgodovine novo pravilo predpomnjenja in upravljanja posnetkov zaslona znižalo stroške za 4-krat, z 1,97 USD na 0,47 USD na izvedbo. Vsak klic je bil približno 3-krat cenejši, saj je 89 % vhodnih podatkov prišlo iz predpomnilnika po 5 % cene nepredpomnjenih podatkov. Izvedbe so postale tudi hitrejše: s prvotno nastavitvijo na modelu B so trajale vsaj 22,5 minute, z optimiziranim potekom dela na modelu GPT‑6.1 Sol pa približno štiri minute.
Povprečje treh izvedb, ročice prikazujejo standardni odklon. ≥: povprečje vključuje izvedbo, ustavljeno zaradi omejitve ali nedokončano, zato je dejanska vrednost najmanj tolikšna.
Stolpci so prikazani v modri barvni shemi. Učinke predpomnjenja primerjajte s stolpcem za višjo omejitev 480.000 znakov.
Oznake izvedb in ročice standardnega odklona so približne rekonstrukcije iz izvorne slike; izvirne vrednosti izvedb in standardni odkloni niso bili na voljo.
Povprečje treh izvedb, ročice prikazujejo standardni odklon. ≥: povprečje vključuje izvedbo, ustavljeno zaradi omejitve ali nedokončano, zato je dejanska vrednost najmanj tolikšna.
Stolpci so prikazani v modri barvni shemi. Učinke predpomnjenja primerjajte s stolpcem za višjo omejitev 480.000 znakov.
Oznake izvedb in ročice standardnega odklona so približne rekonstrukcije iz izvorne slike; izvirne vrednosti izvedb in standardni odkloni niso bili na voljo.
Raziskava je pokazala tudi, kako je upravljanje zgodovine vplivalo na to, ali je agent sploh podal odgovor. Ko je GPT‑6.1 Sol dobil več prostora za ohranjanje zgodovine brskanja, se je število izvedb z odgovorom povečalo s treh od 18 pri nižji omejitvi zgodovine na vseh 18 pri višji omejitvi, vse s pravilnim odgovorom. Za Hidalga je poslovna vrednost v tem, da strankam omogočijo dostop do hitrejših in zmogljivejših modelov, pri tem pa stroške delovanja ohranijo na vzdržni ravni.
»Prej so stroški omejevali izbiro modelov, ki smo jih lahko ponudili strankam za te naloge. Z učinkovitejšim agentom lahko strankam ponudimo boljši, hitrejši model in hkrati znižamo stroške delovanja.«
Asana je spremembe krmarjenja po brskalniku uvedla v StackAI in razvija orodja za lažje ponavljanje podobnih poskusov. Ekipa namerava sčasoma to preizkušanje vključiti v vrednotenja platforme, da bodo lahko stranke in interne ekipe pri konfiguriranju agentov primerjale stroške, čas izvajanja in kakovost odgovorov.
»Ozko grlo ni več hitrost uvajanja, temveč človeška pozornost. Blizu smo svetu, v katerem je vsak inženir produktni vodja, ki vodi floto agentov.«
Asana zdaj uporablja GPT‑6 Astra v orodju Codex za preizkušanje funkcij izdelka pred izdajo: Astra krmari po platformi, preizkuša različne vnose in poroča o napakah pregledovalcem, zadolženim za zagotavljanje kakovosti. Hidalgo v tem vidi temelj novega življenjskega cikla razvoja programske opreme, v katerem številne seje agentov v oblaku vzporedno preizkušajo funkcije.
Celotna študija je na voljo na blogih Asana(odpre se v novem oknu) in StackAI(odpre se v novem oknu).


