Asana s GPT‑6.1 Sol snižuje náklady v testech prohlížeče 76×
Díky GPT‑6 Astra v nástroji Codex Asana v testech zlevnila provoz agenta pro prohlížeč 76× a zrychlila ho 5×, aby zákazníkům nabídla schopnější modely.

76×
Nižší odhadované náklady na model s optimalizovaným postupem na GPT-6.1 Sol
5×
Rychlejší běhy v prohlížeči s optimalizovaným postupem na GPT-6.1 Sol
0,47 USD
Průměrné odhadované náklady na model s optimalizovaným postupem na GPT-6.1 Sol
Pomocí experimentů, které prováděl GPT‑6 Astra v nástroji Codex, Asana optimalizovala pracovní postup svého agenta pro prohlížeč na modelu GPT‑6.1 Sol. Jeho provoz je nyní 76× levnější a 5× rychlejší.
Asana pomáhá zákazníkům automatizovat práci napříč podnikovými aplikacemi prostřednictvím platformy StackAI(otevře se v novém okně), kterou koupila(otevře se v novém okně). Ve StackAI mohou zákazníci bez psaní kódu vytvářet pracovní postupy, které procházejí weby, vyplňují formuláře a shromažďují informace. Při rozsahu provozu Asany se i drobné neefektivity v těchto postupech nasčítají.
Frank Hidalgo, PhD, technický ředitel StackAI ve společnosti Asana, se proto rozhodl agenta pro prohlížeč zrychlit a zlevnit jeho provoz. Zadal modelu GPT‑6 Astra v nástroji Codex, aby agenta prozkoumal, otestoval možná vylepšení a porovnal výsledky. Práce, která by podle jeho odhadu ručně zabrala jeden až dva měsíce, trvala zhruba týden.
Studie Asany se 144 běhy(otevře se v novém okně) testovala GPT‑6.1 Sol a tři další průkopnické modely, zde označované jako modely A, B a C. Výsledný optimalizovaný postup na modelu GPT‑6.1 Sol měl průměrné odhadované náklady na model 0,47 USD a dobu běhu přibližně čtyři minuty. Byl tak 76× levnější a 5× rychlejší než původní produkční konfigurace s modelem B.
„Takhle v praxi vypadají týmy lidí a agentů. Vývojář určil směr, GPT-6 Astra provedl experimenty a výsledky se přes Command dostaly do produkce. To ukazuje, jak Asana uvádí spolupráci lidí a agentů do praxe.“
Aby mohl postupovat rychle, Hidalgo nejprve pomocí GPT‑6 Astra v nástroji Codex zmapoval kód a nechal si vysvětlit, jak agent sestavuje jednotlivé požadavky na model. GPT‑6 Astra zjistil, že agent ukládá do mezipaměti pevné instrukce a definice nástrojů, ale ne rostoucí historii shromážděných textů stránek a snímků obrazovky. S každým požadavkem tak celou historii znovu odesílal za plnou cenu.
Agent také téměř v každém kroku odstraňoval starší snímky obrazovky a zkracoval text. Každá úprava měnila historii, takže samotné ukládání historie do mezipaměti by nepomohlo. Kvůli ztrátě těchto informací se navíc agent mohl muset vracet na stránky, které už přečetl.
Hidalgo posoudil opravy navržené modelem GPT‑6 Astra a vybral tři k otestování:
Rozšířit ukládání do mezipaměti i na historii procházení agenta
Zvýšit množství textu, které si agent může uchovat
Odstraňovat snímky obrazovky hromadně namísto v každém kroku
GPT‑6 Astra začal rychlými testy, aby určil, které proměnné mají vliv na výsledky. Protože kód nebyl navržen pro řízené experimenty, následně ho refaktoroval tak, aby jeden frontend a backend zvládaly souběžně mnoho pracovních postupů, každý s vlastním nastavením.
Astra provedl celou studii: limity historie 120 000 a 480 000 znaků a šest strategií pro mezipaměť a snímky obrazovky. Každou kombinaci otestoval třikrát na každém ze čtyř modelů (viz tabulka níže). Nejlepší výsledky měla strategie, která nechala snímky obrazovky hromadit až do počtu 20 a poté ponechala pouze ten nejnovější. Díky tomu zůstávala starší historie mezi jednotlivými mazáními déle beze změny. V kombinaci s vyšším limitem historie tak vznikl optimalizovaný pracovní postup. Každá konfigurace plnila stejný úkol: shromáždit šest údajů o každé z 32 knih z veřejného ukázkového katalogu. To odpovídá úlohám, které někteří zákazníci Asany spouštějí ve StackAI.
Model | Popis | Cena |
|---|---|---|
Model A | Menší a levnější model od jiné průkopnické laboratoře, vydaný na podzim 2025 | Poloviční cena oproti GPT‑6.1 Sol |
Model B | Model původně používaný v produkčním provozu, od stejné laboratoře jako model A, vydaný v létě 2026 | Stejná cena jako GPT‑6.1 Sol |
Model C | Aktualizovaná verze modelu B, vydaná na podzim 2026 | Stejná cena jako GPT‑6.1 Sol |
GPT‑6.1 Sol | Model od OpenAI |
GPT‑6 Astra spouštěl pracovní postupy a zkoumal požadavky, záznamy o využití a výstupy. V samostatných relacích pak model práci kontroloval. Požadavky, datové stopy a výsledky každé relace se zaznamenávaly v Command(otevře se v novém okně), platformě Asany pro dodávání softwaru, aby si tým mohl později celou studii projít. Zjištění z platformy Command se převedla na tikety, poté na pull requesty a změny se nasadily do produkce.
„Ručně by mi to zabralo jeden až dva měsíce. S GPT-6 Astra v nástroji Codex to trvalo asi týden: před spaním jsem pomocí /goal zadal cíl a ráno si prošel výsledky.“
U modelu B optimalizace snížila odhadované náklady na model z nejméně 36,21 USD (některé původní běhy dosáhly limitu kroků ještě před dokončením) na 1,24 USD za běh, tedy 29×. Optimalizovaný postup na modelu GPT‑6.1 Sol byl při ceně 0,47 USD ještě 2,6× levnější. Každý běh optimalizovaného postupu dokončil úkol a vrátil správnou odpověď.
Průměry ze 3 běhů. ≥: výchozí konfigurace zahrnuje běhy ukončené limitem, takže její průměr představuje dolní mez.
Dva násobky vpravo vyjadřují srovnání s optimalizovanou konfigurací modelu B. Model B byl testován v 1. fázi, model C a Sol 6.1 ve 2. fázi téže studie (tečkovaná čára).
U samotného GPT‑6.1 Sol s vyšším limitem historie snížila nová strategie pro mezipaměť a snímky obrazovky náklady 4×, z 1,97 USD na 0,47 USD za běh. Každé volání bylo přibližně 3× levnější, protože 89 % vstupu pocházelo z mezipaměti za 5 % ceny vstupu bez mezipaměti. Zkrátila se i doba běhu: z nejméně 22,5 minuty v původní konfiguraci s modelem B na zhruba čtyři minuty s optimalizovaným postupem na GPT‑6.1 Sol.
Průměr ze 3 běhů, chybové úsečky znázorňují směrodatnou odchylku. ≥: průměr zahrnuje běh ukončený limitem nebo nedokončený, skutečná hodnota je tedy přinejmenším takto vysoká.
Sloupce jsou v odstínech modré. Vliv mezipaměti porovnávejte se sloupcem pro vyšší limit 480 tisíc znaků.
Značky jednotlivých běhů a chybové úsečky směrodatné odchylky jsou přibližně rekonstruovány ze zdrojového obrázku; původní hodnoty běhů a směrodatných odchylek nebyly k dispozici.
Průměr ze 3 běhů, chybové úsečky znázorňují směrodatnou odchylku. ≥: průměr zahrnuje běh ukončený limitem nebo nedokončený, skutečná hodnota je tedy přinejmenším takto vysoká.
Sloupce jsou v odstínech modré. Vliv mezipaměti porovnávejte se sloupcem pro vyšší limit 480 tisíc znaků.
Značky jednotlivých běhů a chybové úsečky směrodatné odchylky jsou přibližně rekonstruovány ze zdrojového obrázku; původní hodnoty běhů a směrodatných odchylek nebyly k dispozici.
Výzkum také ukázal, jak správa historie ovlivňuje to, zda agent vůbec vytvoří odpověď. Když GPT‑6.1 Sol dostal více prostoru pro uchování historie procházení, počet běhů, které přinesly odpověď, vzrostl ze tří z 18 při nižším limitu historie na všech 18 při vyšším limitu. Všechny odpovědi byly správné. Pro Hidalga spočívá obchodní přínos v tom, že zákazníkům zpřístupní rychlejší a schopnější modely a zároveň udrží provozní náklady na udržitelné úrovni.
„Dříve náklady omezovaly výběr modelů, které jsme mohli zákazníkům pro tyto úlohy nabídnout. Díky efektivnějšímu agentovi můžeme zákazníkům poskytnout lepší a rychlejší model a zároveň snížit naše provozní náklady.“
Asana už změny v procházení webu nasadila do StackAI a vyvíjí nástroje, které usnadní opakování podobných experimentů. Tým plánuje časem začlenit toto testování do vyhodnocování platformy, aby zákazníci i interní týmy mohli při konfiguraci agentů porovnávat náklady, dobu běhu a kvalitu odpovědí.
„Úzkým hrdlem už není rychlost vydávání softwaru, ale lidská pozornost. Blížíme se světu, v němž je každý vývojář produktovým manažerem, který vede tým agentů.“
Asana nyní pomocí GPT‑6 Astra v nástroji Codex testuje funkce produktu před vydáním: Astra prochází platformu, zkouší různé vstupy a hlásí chyby lidským testerům. Hidalgo to vnímá jako základ nového životního cyklu vývoje softwaru, v němž mnoho relací cloudových agentů souběžně testuje funkce.
Celá studie je dostupná na blozích Asana(otevře se v novém okně) a StackAI(otevře se v novém okně).


