Asana: 76× помал трошок за модели во веб-тест со GPT‑6.1 Sol
Со GPT‑6 Astra во Codex, Asana го направи својот агент за прелистувач 76 пати поевтин и 5 пати побрз на тестовите, за да им понуди поспособни модели на клиентите.

76×
Пониски проценети трошоци за моделот со оптимизираниот работен тек на GPT-6.1 Sol
5×
Побрзи извршувања во прелистувач со оптимизираниот работен тек на GPT-6.1 Sol
0,47 $
Просечен проценет трошок за моделот со оптимизираниот работен тек на GPT-6.1 Sol
Со експерименти што ги спроведе GPT‑6 Astra во Codex, Asana го оптимизираше работниот тек на својот агент за прелистувач со GPT‑6.1 Sol, за да се извршува 76 пати поевтино и 5 пати побрзо.
Asana им помага на клиентите да ја автоматизираат работата во деловните апликации преку StackAI(се отвора во нов прозорец), платформа што ја презеде(се отвора во нов прозорец). Со StackAI, клиентите можат да создаваат работни текови што се движат низ веб-страници, пополнуваат формулари и собираат информации без пишување код. При обемот на работа на Asana, и малите неефикасности во овие работни текови се натрупуваат.
Д-р Френк Идалго, технолошки директор на StackAI во Asana, си постави цел да го направи агентот за прелистувач побрз и поевтин за користење. Му зададе на GPT‑6 Astra во Codex да го испита агентот, да тестира подобрувања и да ги спореди резултатите. Работата што, според неговата процена, би траела еден до два месеца ако ја вршел рачно, беше завршена за околу една недела.
Студијата на Asana со 144 извршувања(се отвора во нов прозорец) ги тестираше GPT‑6.1 Sol и уште три гранични модели, тука означени како модели A, B и C. Добиениот оптимизиран работен тек со GPT‑6.1 Sol имаше просечни проценети трошоци за моделот од 0,47 долари и траеше околу четири минути по извршување — 76 пати поевтино и 5 пати побрзо од првичната продукциска конфигурација со модел B.
„Вака изгледаат тимовите од луѓе и агенти во практика. Инженер го одреди правецот, GPT-6 Astra ги спроведе експериментите, а резултатите преку Command стигнаа во продукција. Ова покажува како Asana ги претвора тимовите од луѓе и агенти во реалност.“
За брзо да напредува, Идалго прво го искористи GPT‑6 Astra во Codex за да ја мапира базата на код и да објасни како агентот го составува секое барање до моделот. GPT‑6 Astra откри дека агентот ги кешира своите фиксни инструкции и дефиниции за алатките, но не и сѐ поголемата историја на собрани текстови од страници и слики од екранот. Затоа, со секое барање таа историја повторно се испраќаше по полна цена.
Агентот, исто така, ги отстрануваше постарите слики од екранот и го скратуваше текстот на речиси секој чекор. Секоја измена ја менуваше историјата, па самото кеширање на историјата немаше да помогне, а губењето на тие факти можеше да наложи агентот повторно да ги посети страниците што веќе ги прочитал.
Идалго ги разгледа поправките што ги предложи GPT‑6 Astra и избра три за тестирање:
Проширување на кеширањето и на историјата на прелистување на агентот
Зголемување на количината текст што може да ја задржи
Групно отстранување на сликите од екранот, наместо на секој чекор
GPT‑6 Astra започна со брзи тестови за да утврди кои променливи се важни. Бидејќи кодот не беше наменет за контролирани експерименти, потоа го рефакторираше за еден фронтенд и еден бекенд да можат паралелно да поддржуваат многу работни текови, секој со свои поставки.
Astra ја спроведе целата студија: лимити за историја од 120.000 и 480.000 знаци и шест политики за кеширање и слики од екранот, секоја тестирана по трипати на секој од четирите модели (видете ја табелата подолу). Политиката со најдобри резултати дозволуваше да се соберат 20 слики од екранот, по што се задржуваше само најновата. Така претходната историја остануваше непроменета подолго меѓу отстранувањата. Во комбинација со поголемиот лимит за историја, ова стана оптимизираниот работен тек. Секоја конфигурација ја извршуваше истата задача: собирање шест полиња за секоја од 32 книги од јавен демонстрациски каталог, што е типичен пример за задачите што некои клиенти на Asana ги извршуваат во StackAI.
Модел | Опис | Цена |
|---|---|---|
Модел A | Помал, поевтин модел од друга лабораторија за гранични модели, објавен есента 2025 година | Половина од цената на GPT‑6.1 Sol |
Модел B | Моделот што првично се користеше во продукција, од истата лабораторија како модел A, објавен летото 2026 година | Иста цена како GPT‑6.1 Sol |
Модел C | Ажурирана верзија на модел B, објавена есента 2026 година | Иста цена како GPT‑6.1 Sol |
GPT‑6.1 Sol | Модел на OpenAI |
GPT‑6 Astra ги извршуваше работните текови и ги испитуваше барањата, записите за користење и излезните резултати, а одделни сесии со моделот ја проверуваа работата. Барањата, трагите од податоците и резултатите од секоја сесија се евидентираа во Command(се отвора во нов прозорец), платформата на Asana за испорака на софтвер, за тимот потоа да може да ја разгледа целата студија. Од Command, наодите беа претворени во работни задачи, потоа во барања за спојување код, а измените беа пуштени во продукција.
„Ова би ми одзело еден до два месеца ако го правев рачно. Со GPT-6 Astra во Codex, траеше околу една недела: поставував цел со /goal пред спиење, а наутро ги разгледував резултатите.“
Кај модел B, оптимизацијата го намали проценетиот трошок за моделот од најмалку 36,21 долари (некои првични извршувања го достигнаа лимитот на чекори пред да завршат) на 1,24 долари по извршување — намалување од 29 пати. Оптимизираниот работен тек со GPT‑6.1 Sol беше уште 2,6 пати поевтин, со трошок од 0,47 долари. При секое извршување на оптимизираниот работен тек, задачата беше завршена и беше вратен точниот одговор.
Просечни вредности од 3 извршувања. ≥: почетната конфигурација вклучува извршувања прекинати поради лимит, па нејзината просечна вредност е долна граница.
Двата множителя десно ја прикажуваат споредбата со оптимизираниот модел B. Модел B беше тестиран во фаза 1, а модел C и Sol 6.1 во фаза 2 од истата студија (точкеста линија).
Само кај GPT‑6.1 Sol, со поголемиот лимит за историја, новата политика за кеширање и слики од екранот го намали трошокот 4 пати, од 1,97 на 0,47 долари по извршување. Секој повик беше околу 3 пати поевтин, бидејќи 89% од влезните податоци доаѓаа од кешот, по цена од 5% од цената за некеширани податоци. Извршувањата станаа и побрзи: од најмалку 22,5 минути со првичната конфигурација на модел B до околу четири минути со оптимизираниот работен тек на GPT‑6.1 Sol.
Просек од 3 извршувања, со линии за стандардното отстапување. ≥: просекот вклучува извршување прекинато поради лимит или незавршено извршување, па вистинската вредност е најмалку толку голема.
Столбовите се прикажани во сини нијанси. Споредете ги ефектите од кеширањето со столбот за поголемиот лимит од 480 илј. знаци.
Ознаките за извршувањата и линиите за стандардното отстапување се приближни реконструкции од изворната слика; изворните вредности на извршувањата и стандардните отстапувања не беа достапни.
Просек од 3 извршувања, со линии за стандардното отстапување. ≥: просекот вклучува извршување прекинато поради лимит или незавршено извршување, па вистинската вредност е најмалку толку голема.
Столбовите се прикажани во сини нијанси. Споредете ги ефектите од кеширањето со столбот за поголемиот лимит од 480 илј. знаци.
Ознаките за извршувањата и линиите за стандардното отстапување се приближни реконструкции од изворната слика; изворните вредности на извршувањата и стандардните отстапувања не беа достапни.
Истражувањето покажа и како управувањето со историјата влијае врз тоа дали агентот воопшто ќе даде одговор. Со повеќе простор за задржување на историјата на прелистување, бројот на извршувања во кои GPT‑6.1 Sol даде одговор се зголеми од три од 18 со помалиот лимит за историја на сите 18 со поголемиот лимит, секое со точен одговор. За Идалго, деловната вредност е во тоа клиентите да добијат пристап до побрзи и поспособни модели, а оперативните трошоци да останат одржливи.
„Порано трошокот го ограничуваше изборот на модели што можевме да им ги понудиме на клиентите за овие задачи. Со поефикасен агент можеме да им понудиме на клиентите подобар и побрз модел, а притоа да ги намалиме нашите оперативни трошоци.“
Asana ги пушти во употреба измените за навигација во прелистувач во StackAI и развива алатки за полесно повторување на слични експерименти. Со текот на времето, тимот планира да го вклучи ова тестирање во евалуациите на платформата, за клиентите и внатрешните тимови да можат да ги споредуваат трошокот, времето на извршување и квалитетот на одговорите при конфигурирање на своите агенти.
„Брзината на испорака веќе не е ограничувачкиот фактор; сега тоа е човечкото внимание. Блиску сме до свет во кој секој инженер е менаџер на производ што раководи со цел тим агенти.“
Asana сега го користи GPT‑6 Astra во Codex за тестирање на функционалностите на производот пред објавување: Astra се движи низ платформата, испробува различни внесувања и пријавува софтверски грешки за да ги разгледаат луѓето од контролата на квалитет. Идалго го гледа ова како основа за нов животен циклус на развој на софтвер, со многу сесии со агенти во облакот што паралелно тестираат функционалности.
Целосната студија е достапна на блоговите на Asana(се отвора во нов прозорец) и StackAI(се отвора во нов прозорец).


