Langsung ke konten utama
OpenAI

9 Oktober 2026

Asana: biaya model jadi 1/76 pada uji peramban GPT‑6.1 Sol

Dengan GPT‑6 Astra di Codex, Asana menurunkan biaya agen perambannya menjadi 1/76 dan mempercepatnya 5x dalam pengujian agar dapat menawarkan model yang lebih mumpuni kepada pelanggan.

Logo Asana putih di atas tekstur kertas berlapis berwarna biru.
Ukuran perusahaan: Enterprise
Wilayah: Amerika Utara
Industri: Teknologi
Produk: Codex

76x

Estimasi biaya model lebih rendah dengan alur kerja GPT-6.1 Sol yang teroptimasi

5x

Eksekusi peramban lebih cepat dengan alur kerja GPT-6.1 Sol yang teroptimasi

US$0,47

Rata-rata estimasi biaya model dengan alur kerja GPT-6.1 Sol yang teroptimasi

Memuat…

Dengan GPT‑6 Astra di Codex yang menjalankan eksperimen, Asana mengoptimalkan alur kerja agen perambannya pada GPT‑6.1 Sol sehingga biayanya turun menjadi 1/76 dan eksekusinya 5x lebih cepat.

Asana membantu pelanggan mengotomatiskan pekerjaan di berbagai aplikasi bisnis melalui StackAI⁠(terbuka di jendela baru), platform yang diakuisisinya⁠(terbuka di jendela baru). Dengan StackAI, pelanggan dapat membuat alur kerja untuk menavigasi situs web, mengisi formulir, dan mengumpulkan informasi tanpa menulis kode. Pada skala operasi Asana, inefisiensi kecil dalam alur kerja ini bisa menumpuk.

CTO StackAI di Asana, Frank Hidalgo, PhD, berupaya membuat agen peramban lebih cepat dan lebih murah untuk dijalankan. Ia mengarahkan GPT‑6 Astra di Codex untuk menyelidiki agen tersebut, menguji perbaikan, dan membandingkan hasilnya. Pekerjaan yang ia perkirakan membutuhkan satu hingga dua bulan jika dikerjakan secara manual selesai dalam sekitar satu minggu.

Studi Asana dengan 144 eksekusi⁠(terbuka di jendela baru) menguji GPT‑6.1 Sol dan tiga model terdepan lainnya, yang di sini disebut Model A, B, dan C. Alur kerja hasil optimasi pada GPT‑6.1 Sol menghasilkan estimasi biaya model rata-rata US$0,47 dan waktu sekitar empat menit per eksekusi. Biayanya menjadi 1/76 dan eksekusinya 5x lebih cepat dibandingkan konfigurasi produksi awal pada Model B.

“Inilah wujud nyata kerja tim manusia dan agen. Seorang engineer menetapkan arah, GPT-6 Astra menjalankan eksperimen, dan hasilnya diterapkan di lingkungan produksi melalui Command. Ini menunjukkan bagaimana Asana mewujudkan kolaborasi tim manusia dan agen.”
—Arnab Bose, CPO di Asana

Mengidentifikasi inefisiensi agen peramban dengan GPT‑6 Astra

Agar dapat bergerak cepat, Hidalgo mulai dengan menggunakan GPT‑6 Astra di Codex untuk memetakan basis kode dan menjelaskan cara agen menyusun setiap permintaan ke model. GPT‑6 Astra menemukan bahwa agen menyimpan instruksi tetap dan definisi alatnya dalam cache, tetapi tidak menyimpan riwayat teks halaman dan tangkapan layar yang terus bertambah. Akibatnya, setiap permintaan mengirim ulang riwayat tersebut dengan harga penuh.

Agen juga menghapus tangkapan layar lama dan memangkas teks pada hampir setiap langkah. Setiap pengeditan mengubah riwayat, sehingga menyimpan riwayat dalam cache saja tidak akan membantu. Hilangnya informasi tersebut juga bisa membuat agen harus mengunjungi kembali halaman yang sudah dibacanya.

Dari estimasi dua bulan riset menjadi satu minggu dengan GPT‑6 Astra

Hidalgo meninjau usulan perbaikan dari GPT‑6 Astra dan memilih tiga untuk diuji:

  • Memperluas penggunaan cache agar mencakup riwayat penjelajahan agen

  • Menambah jumlah teks yang dapat disimpan

  • Menghapus tangkapan layar secara berkelompok, bukan pada setiap langkah

GPT‑6 Astra memulai dengan pengujian cepat untuk menentukan variabel yang berpengaruh. Karena kode tersebut tidak dirancang untuk eksperimen terkontrol, Astra kemudian menata ulang kode agar satu frontend dan backend dapat mendukung banyak alur kerja secara paralel, masing-masing dengan pengaturannya sendiri.

Astra menjalankan studi lengkap: alokasi riwayat sebesar 120.000 dan 480.000 karakter serta enam kebijakan cache dan tangkapan layar, masing-masing diuji tiga kali pada keempat model (lihat tabel di bawah). Kebijakan dengan kinerja terbaik membiarkan tangkapan layar terkumpul hingga 20, lalu menghapus semuanya kecuali yang terbaru. Dengan cara ini, riwayat sebelumnya tetap utuh lebih lama di antara proses penghapusan. Kebijakan ini, dipadukan dengan alokasi riwayat yang lebih besar, menjadi alur kerja hasil optimasi. Setiap konfigurasi menjalankan tugas yang sama: mengumpulkan enam kolom data untuk masing-masing dari 32 buku dalam katalog demo publik. Tugas ini mewakili pekerjaan yang dijalankan sebagian pelanggan Asana di StackAI.

Model

Deskripsi

Harga

Model A

Model yang lebih kecil dan lebih murah dari laboratorium AI terdepan lainnya, dirilis pada musim gugur 2025

Setengah harga GPT‑6.1 Sol

Model B

Model yang semula digunakan di lingkungan produksi, dari laboratorium yang sama dengan Model A, dirilis pada musim panas 2026

Sama dengan harga GPT‑6.1 Sol

Model C

Versi terbaru Model B, dirilis pada musim gugur 2026

Sama dengan harga GPT‑6.1 Sol

GPT‑6.1 Sol

Model dari OpenAI

GPT‑6 Astra menjalankan alur kerja dan memeriksa permintaan, catatan penggunaan, serta outputnya. Sesi model terpisah kemudian meninjau pekerjaan tersebut. Permintaan, jejak data, dan hasil setiap sesi dicatat di Command⁠(terbuka di jendela baru), platform pengiriman perangkat lunak Asana, agar tim dapat meninjau keseluruhan studi setelahnya. Dari Command, temuan tersebut diubah menjadi tiket, lalu pull request, dan perubahannya diterapkan di lingkungan produksi.

“Pekerjaan ini akan memakan waktu satu hingga dua bulan jika saya kerjakan secara manual. Dengan GPT-6 Astra di Codex, waktunya hanya sekitar satu minggu: saya menetapkan /goal sebelum tidur dan meninjau hasilnya pada pagi hari.”
—Frank Hidalgo, PhD, CTO StackAI di Asana

Untuk Model B, optimasi ini menurunkan estimasi biaya model dari setidaknya US$36,21 (sebagian eksekusi awal mencapai batas langkah sebelum selesai) menjadi US$1,24 per eksekusi, atau sekitar 1/29 dari biaya awal. Alur kerja hasil optimasi pada GPT‑6.1 Sol bahkan 2,6x lebih hemat lagi, dengan biaya US$0,47. Setiap eksekusi alur kerja hasil optimasi berhasil menyelesaikan tugas dan memberikan jawaban yang benar.

Rata-rata dari 3 eksekusi. ≥: acuan mencakup eksekusi yang mencapai batas, sehingga rata-ratanya merupakan batas bawah.

Dua faktor perbandingan di sebelah kanan menggunakan Model B teroptimasi sebagai pembanding. Model B dijalankan pada tahap 1, sedangkan Model C dan Sol 6.1 pada tahap 2 dalam studi yang sama (garis titik-titik).

Khusus pada GPT‑6.1 Sol dengan alokasi riwayat yang lebih besar, kebijakan cache dan tangkapan layar baru menurunkan biaya menjadi seperempatnya, dari US$1,97 menjadi US$0,47 per eksekusi. Biaya setiap pemanggilan menjadi sekitar sepertiganya, karena 89% input berasal dari cache dengan tarif 5% dari harga input tanpa cache. Eksekusi juga menjadi lebih cepat: dari setidaknya 22,5 menit pada konfigurasi awal Model B menjadi sekitar empat menit dengan alur kerja hasil optimasi pada GPT‑6.1 Sol.

Rata-rata dari 3 eksekusi, dengan garis simpangan baku (SD). ≥: rata-rata mencakup eksekusi yang mencapai batas atau belum selesai, sehingga nilai sebenarnya setidaknya sebesar ini.

Batang menggunakan tema biru. Nilai dampak penggunaan cache dengan membandingkannya terhadap batang alokasi lebih besar sebesar 480 ribu.

Penanda eksekusi dan garis SD merupakan perkiraan hasil rekonstruksi dari gambar sumber; data nilai eksekusi dan simpangan baku aslinya tidak tersedia.

Rata-rata dari 3 eksekusi, dengan garis simpangan baku (SD). ≥: rata-rata mencakup eksekusi yang mencapai batas atau belum selesai, sehingga nilai sebenarnya setidaknya sebesar ini.

Batang menggunakan tema biru. Nilai dampak penggunaan cache dengan membandingkannya terhadap batang alokasi lebih besar sebesar 480 ribu.

Penanda eksekusi dan garis SD merupakan perkiraan hasil rekonstruksi dari gambar sumber; data nilai eksekusi dan simpangan baku aslinya tidak tersedia.

Investigasi ini juga menunjukkan bahwa pengelolaan riwayat memengaruhi berhasil tidaknya agen menghasilkan jawaban. Memberi GPT‑6.1 Sol lebih banyak ruang untuk menyimpan riwayat penjelajahan meningkatkan jumlah eksekusi yang menghasilkan jawaban: dari tiga dari 18 eksekusi dengan alokasi riwayat kecil menjadi seluruh 18 eksekusi dengan alokasi lebih besar, semuanya dengan jawaban yang benar. Bagi Hidalgo, nilai bisnisnya terletak pada pemberian akses ke model yang lebih cepat dan lebih mumpuni bagi pelanggan, sambil menjaga biaya operasional tetap berkelanjutan.

“Dulu, biaya membatasi pilihan model yang bisa kami tawarkan kepada pelanggan untuk beban kerja ini. Dengan membuat agen lebih efisien, kami dapat memberikan model yang lebih baik dan lebih cepat kepada pelanggan sekaligus menurunkan biaya operasional kami.”
—Frank Hidalgo, PhD, CTO StackAI di Asana

Memperluas skala eksperimen dan pengujian produk

Asana telah merilis perubahan navigasi peramban di StackAI dan sedang mengembangkan alat agar eksperimen serupa lebih mudah diulang. Ke depannya, tim berencana memasukkan pengujian ini ke dalam evaluasi platform, agar pelanggan dan tim internal dapat membandingkan biaya, waktu eksekusi, dan kualitas jawaban saat mengonfigurasi agen mereka.

“Kecepatan rilis bukan lagi kendala utama; keterbatasan perhatian manusia justru menjadi kendalanya. Kita mendekati masa ketika setiap engineer menjadi manajer produk yang memimpin sekumpulan agen.”
—Frank Hidalgo, PhD, CTO StackAI di Asana

Kini Asana menggunakan GPT‑6 Astra di Codex untuk menguji fitur produk sebelum dirilis: Astra menavigasi platform, mencoba berbagai input, dan melaporkan bug untuk ditinjau oleh tim QA manusia. Hidalgo memandang hal ini sebagai fondasi siklus pengembangan perangkat lunak baru, dengan banyak sesi agen berbasis cloud yang menguji fitur secara paralel.

Bergabung dengan era baru dunia kerja

Lebih dari 1 juta bisnis di seluruh dunia mencapai hasil yang bermakna dengan OpenAI.