Asana giảm 76 lần chi phí mô hình khi thử nghiệm với GPT‑6.1 Sol
Nhờ GPT‑6 Astra trong Codex, Asana giảm 76 lần chi phí và tăng tốc tác nhân trình duyệt gấp 5 lần khi thử nghiệm, giúp khách hàng tiếp cận các mô hình mạnh hơn.

76 lần
Chi phí mô hình ước tính thấp hơn với quy trình GPT-6.1 Sol đã tối ưu
5 lần
Lượt chạy trình duyệt nhanh hơn với quy trình GPT-6.1 Sol đã tối ưu
0,47 USD
Chi phí mô hình ước tính trung bình với quy trình GPT-6.1 Sol đã tối ưu
Nhờ GPT‑6 Astra trong Codex thực hiện các thử nghiệm, Asana đã tối ưu hóa quy trình của tác nhân trình duyệt trên GPT‑6.1 Sol, giảm chi phí 76 lần và tăng tốc gấp 5 lần.
Asana giúp khách hàng tự động hóa công việc trên các ứng dụng doanh nghiệp thông qua StackAI(mở trong cửa sổ mới), nền tảng mà công ty đã mua lại(mở trong cửa sổ mới). Với StackAI, khách hàng có thể xây dựng quy trình truy cập trang web, điền biểu mẫu và thu thập thông tin mà không cần viết mã. Ở quy mô của Asana, những điểm thiếu hiệu quả dù nhỏ trong các quy trình này cũng tích tụ thành vấn đề lớn.
Tiến sĩ Frank Hidalgo, Giám đốc công nghệ StackAI tại Asana, đặt mục tiêu giúp tác nhân trình duyệt chạy nhanh hơn với chi phí thấp hơn. Ông chỉ đạo GPT‑6 Astra trong Codex khảo sát tác nhân, thử nghiệm các cải tiến và so sánh kết quả. Công việc mà ông ước tính sẽ mất một đến hai tháng nếu làm thủ công nay chỉ mất khoảng một tuần.
Nghiên cứu gồm 144 lượt chạy của Asana(mở trong cửa sổ mới) đã thử nghiệm GPT‑6.1 Sol cùng ba mô hình tiên phong khác, ở đây gọi là Mô hình A, B và C. Quy trình được tối ưu hóa trên GPT‑6.1 Sol có chi phí mô hình ước tính trung bình là 0,47 USD và thời gian khoảng bốn phút mỗi lượt chạy, rẻ hơn 76 lần và nhanh hơn 5 lần so với cấu hình vận hành ban đầu trên Mô hình B.
“Đây chính là cách các nhóm gồm con người và tác nhân phối hợp trong thực tế. Một kỹ sư định hướng, GPT-6 Astra thực hiện thử nghiệm, rồi kết quả được đưa qua Command vào vận hành thực tế. Điều này cho thấy cách Asana biến mô hình nhóm làm việc gồm con người và tác nhân thành hiện thực.”
Để đẩy nhanh tiến độ, Hidalgo bắt đầu bằng việc dùng GPT‑6 Astra trong Codex để tìm hiểu cấu trúc mã nguồn và giải thích cách tác nhân tạo từng yêu cầu gửi đến mô hình. GPT‑6 Astra phát hiện tác nhân đã lưu chỉ dẫn cố định và định nghĩa công cụ vào bộ nhớ đệm, nhưng không lưu lịch sử văn bản trang web và ảnh chụp màn hình ngày càng dài. Vì vậy, mỗi yêu cầu đều gửi lại lịch sử này với mức giá đầy đủ.
Tác nhân còn xóa ảnh chụp màn hình cũ và cắt bớt văn bản ở gần như mọi bước. Mỗi lần chỉnh sửa đều làm thay đổi lịch sử, nên chỉ lưu lịch sử vào bộ nhớ đệm cũng không giúp ích. Việc mất thông tin còn có thể buộc tác nhân phải quay lại những trang đã đọc.
Hidalgo xem xét các giải pháp GPT‑6 Astra đề xuất và chọn ba giải pháp để thử nghiệm:
Lưu cả lịch sử duyệt web của tác nhân vào bộ nhớ đệm
Tăng lượng văn bản tác nhân có thể giữ lại
Xóa ảnh chụp màn hình theo đợt thay vì ở mỗi bước
GPT‑6 Astra bắt đầu bằng các thử nghiệm nhanh để xác định những biến số có ảnh hưởng. Do mã nguồn chưa được thiết kế cho thử nghiệm có đối chứng, mô hình đã tái cấu trúc mã để một frontend và backend có thể hỗ trợ nhiều quy trình chạy song song, mỗi quy trình có thiết lập riêng.
Astra thực hiện toàn bộ nghiên cứu: hai giới hạn lưu trữ lịch sử là 120.000 và 480.000 ký tự, cùng sáu chính sách về bộ nhớ đệm và ảnh chụp màn hình. Mỗi cấu hình được thử ba lần trên từng mô hình trong số bốn mô hình (xem bảng bên dưới). Chính sách hiệu quả nhất cho phép tích lũy 20 ảnh chụp màn hình rồi mới xóa bớt, chỉ giữ lại ảnh mới nhất. Cách này giữ nguyên lịch sử trước đó lâu hơn giữa các lần xóa. Kết hợp với giới hạn lưu trữ lịch sử lớn hơn, chính sách này tạo thành quy trình tối ưu. Mỗi cấu hình thực hiện cùng một nhiệm vụ: thu thập sáu trường thông tin cho từng cuốn trong số 32 cuốn sách từ một danh mục demo công khai, đại diện cho công việc mà một số khách hàng Asana thực hiện trên StackAI.
Mô hình | Mô tả | Giá |
|---|---|---|
Mô hình A | Mô hình nhỏ hơn, giá thấp hơn từ một phòng nghiên cứu AI tiên phong khác, ra mắt vào mùa thu năm 2025 | Giá bằng một nửa GPT‑6.1 Sol |
Mô hình B | Mô hình ban đầu được dùng trong môi trường vận hành thực tế, từ cùng phòng nghiên cứu với Mô hình A, ra mắt vào mùa hè năm 2026 | Giá bằng GPT‑6.1 Sol |
Mô hình C | Phiên bản cập nhật của Mô hình B, ra mắt vào mùa thu năm 2026 | Giá bằng GPT‑6.1 Sol |
GPT‑6.1 Sol | Mô hình của OpenAI |
GPT‑6 Astra chạy các quy trình, kiểm tra yêu cầu, bản ghi sử dụng và đầu ra; các phiên mô hình riêng biệt rà soát lại công việc. Yêu cầu, dấu vết dữ liệu và kết quả của từng phiên đều được ghi lại trong Command(mở trong cửa sổ mới), nền tảng triển khai phần mềm của Asana, để nhóm có thể xem lại toàn bộ nghiên cứu sau đó. Từ Command, các phát hiện được chuyển thành phiếu công việc, rồi thành pull request, và các thay đổi được đưa vào vận hành thực tế.
“Nếu làm thủ công, tôi sẽ mất một đến hai tháng. Với GPT-6 Astra trong Codex, công việc chỉ mất khoảng một tuần: tôi đặt /goal trước khi đi ngủ và xem lại kết quả vào sáng hôm sau.”
Với Mô hình B, việc tối ưu hóa đã giảm chi phí mô hình ước tính từ ít nhất 36,21 USD (một số lượt chạy ban đầu chạm giới hạn số bước trước khi hoàn tất) xuống 1,24 USD mỗi lượt, tức giảm 29 lần. Quy trình tối ưu trên GPT‑6.1 Sol còn rẻ hơn 2,6 lần nữa, chỉ ở mức 0,47 USD. Mọi lượt chạy trong quy trình tối ưu đều hoàn thành nhiệm vụ và trả về câu trả lời đúng.
Giá trị trung bình của 3 lượt chạy. ≥: cấu hình cơ sở có các lượt chạy chạm giới hạn, nên giá trị trung bình là cận dưới.
Hai hệ số bên phải được tính so với Mô hình B đã tối ưu. Mô hình B chạy ở giai đoạn 1; Mô hình C và Sol 6.1 chạy ở giai đoạn 2 của cùng nghiên cứu (đường chấm).
Riêng trên GPT‑6.1 Sol, với giới hạn lưu trữ lịch sử lớn hơn, chính sách mới về bộ nhớ đệm và ảnh chụp màn hình đã giảm chi phí 4 lần, từ 1,97 USD xuống 0,47 USD mỗi lượt chạy. Mỗi lần gọi rẻ hơn khoảng 3 lần vì 89% đầu vào đến từ bộ nhớ đệm, với giá chỉ bằng 5% giá đầu vào không được lưu đệm. Thời gian chạy cũng giảm: từ ít nhất 22,5 phút với cấu hình ban đầu trên Mô hình B xuống khoảng bốn phút với quy trình tối ưu trên GPT‑6.1 Sol.
Trung bình của 3 lượt chạy, với thanh sai số biểu thị độ lệch chuẩn (SD). ≥: giá trị trung bình có tính cả lượt chạy chạm giới hạn hoặc chưa hoàn tất, nên giá trị thực ít nhất bằng mức này.
Các cột dùng tông màu xanh dương. Đánh giá tác động của việc lưu đệm bằng cách so với cột có giới hạn lưu trữ lớn hơn, ở mức 480 nghìn.
Các điểm đánh dấu lượt chạy và thanh sai số SD được dựng lại gần đúng từ hình ảnh gốc; không có dữ liệu gốc về giá trị từng lượt chạy và độ lệch chuẩn.
Trung bình của 3 lượt chạy, với thanh sai số biểu thị độ lệch chuẩn (SD). ≥: giá trị trung bình có tính cả lượt chạy chạm giới hạn hoặc chưa hoàn tất, nên giá trị thực ít nhất bằng mức này.
Các cột dùng tông màu xanh dương. Đánh giá tác động của việc lưu đệm bằng cách so với cột có giới hạn lưu trữ lớn hơn, ở mức 480 nghìn.
Các điểm đánh dấu lượt chạy và thanh sai số SD được dựng lại gần đúng từ hình ảnh gốc; không có dữ liệu gốc về giá trị từng lượt chạy và độ lệch chuẩn.
Quá trình khảo sát còn cho thấy cách quản lý lịch sử ảnh hưởng đến việc tác nhân có đưa ra được câu trả lời hay không. Khi tăng không gian lưu lịch sử duyệt web cho GPT‑6.1 Sol, số lượt chạy đưa ra được câu trả lời tăng từ 3/18 với giới hạn nhỏ lên toàn bộ 18 lượt với giới hạn lớn hơn, và mọi câu trả lời đều đúng. Với Hidalgo, giá trị kinh doanh nằm ở việc giúp khách hàng tiếp cận các mô hình nhanh hơn, mạnh hơn mà vẫn giữ chi phí vận hành ở mức bền vững.
“Trước đây, chi phí hạn chế lựa chọn mô hình mà chúng tôi có thể cung cấp cho khách hàng để xử lý những công việc này. Bằng cách nâng cao hiệu quả của tác nhân, chúng tôi có thể mang đến cho khách hàng một mô hình tốt hơn, nhanh hơn, đồng thời giảm chi phí vận hành.”
Asana đã triển khai các thay đổi về điều hướng trình duyệt trong StackAI và đang phát triển công cụ để dễ dàng lặp lại những thử nghiệm tương tự. Về lâu dài, nhóm dự định tích hợp việc kiểm thử này vào quy trình đánh giá của nền tảng, để khách hàng và các nhóm nội bộ có thể so sánh chi phí, thời gian chạy và chất lượng câu trả lời khi cấu hình tác nhân.
“Tốc độ phát hành không còn là nút thắt; khả năng dành sự chú ý của con người mới là nút thắt. Chúng ta đang tiến gần đến một thế giới nơi mỗi kỹ sư đều là một nhà quản lý sản phẩm dẫn dắt cả một đội tác nhân.”
Asana hiện dùng GPT‑6 Astra trong Codex để kiểm thử tính năng sản phẩm trước khi phát hành: Astra thao tác trên nền tảng, thử nhiều đầu vào và báo lỗi cho nhân viên QA rà soát. Hidalgo xem đây là nền tảng cho một vòng đời phát triển phần mềm mới, với nhiều phiên tác nhân trên đám mây kiểm thử các tính năng song song.
Xem toàn bộ nghiên cứu trên blog của Asana(mở trong cửa sổ mới) và StackAI(mở trong cửa sổ mới).


