Asana: 76× nižšie náklady v testoch prehliadača s GPT‑6.1 Sol
Asana s GPT‑6 Astra v nástroji Codex znížila v testoch náklady na agenta prehliadača 76× a zrýchlila ho 5×, aby zákazníkom ponúkla schopnejšie modely.

76×
Nižšie odhadované náklady na model pri optimalizovanom pracovnom postupe na GPT-6.1 Sol
5×
Rýchlejšie behy v prehliadači s optimalizovaným pracovným postupom na GPT-6.1 Sol
0,47 USD
Priemerné odhadované náklady na model pri optimalizovanom pracovnom postupe na GPT-6.1 Sol
Vďaka experimentom s GPT‑6 Astra v nástroji Codex Asana optimalizovala pracovný postup svojho agenta prehliadača na GPT‑6.1 Sol: náklady klesli 76-násobne a beh sa zrýchlil 5-násobne.
Asana pomáha zákazníkom automatizovať prácu naprieč firemnými aplikáciami prostredníctvom platformy StackAI(otvorí sa v novom okne), ktorú získala akvizíciou(otvorí sa v novom okne). V StackAI môžu zákazníci bez písania kódu vytvárať pracovné postupy, ktoré prechádzajú webové stránky, vypĺňajú formuláre a zhromažďujú informácie. Pri rozsahu prevádzky spoločnosti Asana sa aj drobné neefektívnosti v týchto postupoch sčítavajú.
Frank Hidalgo, PhD, technologický riaditeľ StackAI v spoločnosti Asana, sa rozhodol zrýchliť agenta prehliadača a znížiť náklady na jeho prevádzku. Zadal modelu GPT‑6 Astra v nástroji Codex, aby preskúmal agenta, otestoval zlepšenia a porovnal výsledky. Práca, ktorá by podľa jeho odhadu ručne trvala jeden až dva mesiace, zabrala približne týždeň.
Štúdia spoločnosti Asana so 144 behmi(otvorí sa v novom okne) testovala GPT‑6.1 Sol a tri ďalšie prelomové modely, tu označené ako modely A, B a C. Výsledný optimalizovaný pracovný postup na GPT‑6.1 Sol dosiahol odhadované náklady na model v priemere 0,47 USD a čas približne štyri minúty na beh. Bol tak 76-krát lacnejší a 5-krát rýchlejší než pôvodné produkčné nastavenie na modeli B.
„Takto vyzerajú tímy ľudí a agentov v praxi. Vývojár určil smer, GPT-6 Astra vykonal experimenty a výsledky sa cez Command dostali do produkcie. Ukazuje to, ako Asana premieňa predstavu tímov ľudí a agentov na skutočnosť.“
Aby Hidalgo rýchlo napredoval, najprv pomocou GPT‑6 Astra v nástroji Codex zmapoval kód a nechal si vysvetliť, ako agent zostavuje každú požiadavku na model. GPT‑6 Astra zistil, že agent ukladal do vyrovnávacej pamäte pevné pokyny a definície nástrojov, no nie rastúcu históriu zozbieraného textu stránok a snímok obrazovky. Každá požiadavka tak opätovne odosielala túto históriu za plnú cenu.
Agent navyše takmer pri každom kroku odstraňoval staršie snímky obrazovky a skracoval text. Každá úprava menila históriu, takže samotné ukladanie histórie do vyrovnávacej pamäte by nepomohlo. Strata týchto informácií navyše mohla agenta prinútiť znovu navštíviť už prečítané stránky.
Hidalgo posúdil opravy navrhnuté modelom GPT‑6 Astra a vybral tri na otestovanie:
Rozšíriť ukladanie do vyrovnávacej pamäte aj na históriu prehliadania agenta
Zvýšiť množstvo textu, ktoré si agent mohol uchovať
Odstraňovať snímky obrazovky v dávkach, nie pri každom kroku
GPT‑6 Astra začal rýchlymi testami, aby zistil, na ktorých premenných záleží. Keďže kód nebol navrhnutý na kontrolované experimenty, následne ho refaktoroval tak, aby jeden frontend a backend podporovali množstvo súbežných pracovných postupov, každý s vlastným nastavením.
Astra vykonal celú štúdiu: limity histórie 120 000 a 480 000 znakov a šesť stratégií ukladania do vyrovnávacej pamäte a správy snímok obrazovky. Každú kombináciu testoval trikrát na každom zo štyroch modelov (pozri tabuľku nižšie). Najlepšie výsledky priniesla stratégia, ktorá nechala nahromadiť 20 snímok obrazovky a potom ponechala iba najnovšiu. Staršia história tak zostávala nezmenená počas dlhších intervalov medzi odstraňovaniami. V kombinácii s vyšším limitom histórie sa táto stratégia stala základom optimalizovaného pracovného postupu. Každá konfigurácia vykonávala rovnakú úlohu: zozbierať šesť údajov o každej z 32 kníh z verejného ukážkového katalógu. Úloha zodpovedala tomu, čo niektorí zákazníci spoločnosti Asana vykonávajú v StackAI.
Model | Opis | Cena |
|---|---|---|
Model A | Menší, lacnejší model od iného laboratória vyvíjajúceho prelomové modely, vydaný na jeseň 2025 | Polovičná cena oproti GPT‑6.1 Sol |
Model B | Model pôvodne používaný v produkcii, od rovnakého laboratória ako model A, vydaný v lete 2026 | Rovnaká cena ako GPT‑6.1 Sol |
Model C | Aktualizovaná verzia modelu B, vydaná na jeseň 2026 | Rovnaká cena ako GPT‑6.1 Sol |
GPT‑6.1 Sol | Model od OpenAI |
GPT‑6 Astra spúšťal pracovné postupy a skúmal požiadavky, záznamy o využití a výstupy. Prácu kontrolovali samostatné relácie modelu. Požiadavky, dátové stopy a výsledky každej relácie sa zaznamenávali v Command(otvorí sa v novom okne), platforme spoločnosti Asana na dodávanie softvéru, aby tím mohol neskôr preskúmať celú štúdiu. Zo zistení v Command vznikli tikety, potom žiadosti o začlenenie kódu a zmeny sa nasadili do produkcie.
„Ručne by mi to trvalo jeden až dva mesiace. S GPT-6 Astra v nástroji Codex to trvalo asi týždeň: pred spaním som zadal /goal a ráno som skontroloval výsledky.“
Pri modeli B optimalizácia znížila odhadované náklady na model z najmenej 36,21 USD (niektoré pôvodné behy dosiahli limit krokov ešte pred dokončením) na 1,24 USD na beh, teda 29-násobne. Optimalizovaný pracovný postup na GPT‑6.1 Sol bol ešte 2,6-krát lacnejší, s nákladmi 0,47 USD. Každý beh optimalizovaného pracovného postupu dokončil úlohu a vrátil správnu odpoveď.
Priemery z 3 behov. ≥: východiskové nastavenie zahŕňa behy zastavené limitom, takže jeho priemer predstavuje dolnú hranicu.
Dva násobky vpravo vyjadrujú porovnanie s optimalizovaným nastavením modelu B. Model B sa testoval v 1. fáze, model C a Sol 6.1 v 2. fáze tej istej štúdie (bodkovaná čiara).
Pri samotnom GPT‑6.1 Sol s vyšším limitom histórie znížila nová stratégia ukladania do vyrovnávacej pamäte a správy snímok obrazovky náklady 4-násobne, z 1,97 USD na 0,47 USD na beh. Každé volanie bolo približne 3-krát lacnejšie, pretože 89 % vstupu pochádzalo z vyrovnávacej pamäte za 5 % ceny vstupu mimo nej. Behy sa aj zrýchlili: z najmenej 22,5 minúty pri pôvodnom nastavení na modeli B na približne štyri minúty pri optimalizovanom pracovnom postupe na GPT‑6.1 Sol.
Priemer z 3 behov, chybové úsečky znázorňujú štandardnú odchýlku. ≥: priemer zahŕňa beh zastavený limitom alebo nedokončený beh, takže skutočná hodnota je aspoň takáto vysoká.
Stĺpce sú v modrých odtieňoch. Účinok ukladania do vyrovnávacej pamäte porovnávajte so stĺpcom pre vyšší limit 480 tisíc.
Značky behov a chybové úsečky štandardnej odchýlky sú približnou rekonštrukciou zo zdrojového obrázka; pôvodné hodnoty behov ani štandardné odchýlky neboli k dispozícii.
Priemer z 3 behov, chybové úsečky znázorňujú štandardnú odchýlku. ≥: priemer zahŕňa beh zastavený limitom alebo nedokončený beh, takže skutočná hodnota je aspoň takáto vysoká.
Stĺpce sú v modrých odtieňoch. Účinok ukladania do vyrovnávacej pamäte porovnávajte so stĺpcom pre vyšší limit 480 tisíc.
Značky behov a chybové úsečky štandardnej odchýlky sú približnou rekonštrukciou zo zdrojového obrázka; pôvodné hodnoty behov ani štandardné odchýlky neboli k dispozícii.
Skúmanie tiež ukázalo, ako správa histórie ovplyvňuje to, či agent vôbec vytvorí odpoveď. Keď GPT‑6.1 Sol dostal viac priestoru na uchovanie histórie prehliadania, počet behov s odpoveďou vzrástol z troch z 18 pri nižšom limite histórie na všetkých 18 pri vyššom limite. Každá z týchto 18 odpovedí bola správna. Hidalgo vidí obchodný prínos v tom, že zákazníci získajú prístup k rýchlejším a schopnejším modelom, pričom prevádzkové náklady zostanú udržateľné.
„Náklady kedysi obmedzovali výber modelov, ktoré sme mohli zákazníkom ponúknuť na tieto úlohy. Vďaka efektívnejšiemu agentovi môžeme zákazníkom poskytnúť lepší a rýchlejší model a zároveň znížiť naše prevádzkové náklady.“
Asana už nasadila zmeny navigácie v prehliadači v StackAI a vyvíja nástroje, ktoré uľahčia opakovanie podobných experimentov. Tím plánuje časom začleniť toto testovanie do hodnotení platformy, aby zákazníci aj interné tímy mohli pri konfigurácii agentov porovnávať náklady, čas behu a kvalitu odpovedí.
„Úzkym hrdlom už nie je rýchlosť dodávania softvéru, ale ľudská pozornosť. Blížime sa k svetu, v ktorom je každý vývojár produktovým manažérom vedúcim flotilu agentov.“
Asana teraz používa GPT‑6 Astra v nástroji Codex na testovanie funkcií produktu pred vydaním: Astra prechádza platformu, skúša rôzne vstupy a hlási chyby ľudským kontrolórom kvality. Hidalgo to vníma ako základ nového životného cyklu vývoja softvéru, v ktorom množstvo relácií cloudových agentov testuje funkcie súbežne.
Celá štúdia je dostupná na blogoch Asana(otvorí sa v novom okne) a StackAI(otvorí sa v novom okne).


