Bỏ qua nội dung chính
OpenAI

9 tháng 10, 2026

Asana giảm 76 lần chi phí mô hình khi thử nghiệm với GPT‑6.1 Sol

Nhờ GPT‑6 Astra trong Codex, Asana giảm 76 lần chi phí và tăng tốc tác nhân trình duyệt gấp 5 lần khi thử nghiệm, giúp khách hàng tiếp cận các mô hình mạnh hơn.

Logo Asana màu trắng trên nền giấy xếp lớp màu xanh dương.
Quy mô công ty: Doanh nghiệp
Khu vực: Bắc Mỹ
Ngành: Công nghệ
Sản phẩm: Codex

76 lần

Chi phí mô hình ước tính thấp hơn với quy trình GPT-6.1 Sol đã tối ưu

5 lần

Lượt chạy trình duyệt nhanh hơn với quy trình GPT-6.1 Sol đã tối ưu

0,47 USD

Chi phí mô hình ước tính trung bình với quy trình GPT-6.1 Sol đã tối ưu

Đang tải…

Nhờ GPT‑6 Astra trong Codex thực hiện các thử nghiệm, Asana đã tối ưu hóa quy trình của tác nhân trình duyệt trên GPT‑6.1 Sol, giảm chi phí 76 lần và tăng tốc gấp 5 lần.

Asana giúp khách hàng tự động hóa công việc trên các ứng dụng doanh nghiệp thông qua StackAI⁠(mở trong cửa sổ mới), nền tảng mà công ty đã mua lại⁠(mở trong cửa sổ mới). Với StackAI, khách hàng có thể xây dựng quy trình truy cập trang web, điền biểu mẫu và thu thập thông tin mà không cần viết mã. Ở quy mô của Asana, những điểm thiếu hiệu quả dù nhỏ trong các quy trình này cũng tích tụ thành vấn đề lớn.

Tiến sĩ Frank Hidalgo, Giám đốc công nghệ StackAI tại Asana, đặt mục tiêu giúp tác nhân trình duyệt chạy nhanh hơn với chi phí thấp hơn. Ông chỉ đạo GPT‑6 Astra trong Codex khảo sát tác nhân, thử nghiệm các cải tiến và so sánh kết quả. Công việc mà ông ước tính sẽ mất một đến hai tháng nếu làm thủ công nay chỉ mất khoảng một tuần.

Nghiên cứu gồm 144 lượt chạy của Asana⁠(mở trong cửa sổ mới) đã thử nghiệm GPT‑6.1 Sol cùng ba mô hình tiên phong khác, ở đây gọi là Mô hình A, B và C. Quy trình được tối ưu hóa trên GPT‑6.1 Sol có chi phí mô hình ước tính trung bình là 0,47 USD và thời gian khoảng bốn phút mỗi lượt chạy, rẻ hơn 76 lần và nhanh hơn 5 lần so với cấu hình vận hành ban đầu trên Mô hình B.

“Đây chính là cách các nhóm gồm con người và tác nhân phối hợp trong thực tế. Một kỹ sư định hướng, GPT-6 Astra thực hiện thử nghiệm, rồi kết quả được đưa qua Command vào vận hành thực tế. Điều này cho thấy cách Asana biến mô hình nhóm làm việc gồm con người và tác nhân thành hiện thực.”
—Arnab Bose, Giám đốc sản phẩm tại Asana

Tìm điểm thiếu hiệu quả của tác nhân trình duyệt bằng GPT‑6 Astra

Để đẩy nhanh tiến độ, Hidalgo bắt đầu bằng việc dùng GPT‑6 Astra trong Codex để tìm hiểu cấu trúc mã nguồn và giải thích cách tác nhân tạo từng yêu cầu gửi đến mô hình. GPT‑6 Astra phát hiện tác nhân đã lưu chỉ dẫn cố định và định nghĩa công cụ vào bộ nhớ đệm, nhưng không lưu lịch sử văn bản trang web và ảnh chụp màn hình ngày càng dài. Vì vậy, mỗi yêu cầu đều gửi lại lịch sử này với mức giá đầy đủ.

Tác nhân còn xóa ảnh chụp màn hình cũ và cắt bớt văn bản ở gần như mọi bước. Mỗi lần chỉnh sửa đều làm thay đổi lịch sử, nên chỉ lưu lịch sử vào bộ nhớ đệm cũng không giúp ích. Việc mất thông tin còn có thể buộc tác nhân phải quay lại những trang đã đọc.

Từ hai tháng nghiên cứu dự kiến xuống còn một tuần với GPT‑6 Astra

Hidalgo xem xét các giải pháp GPT‑6 Astra đề xuất và chọn ba giải pháp để thử nghiệm:

  • Lưu cả lịch sử duyệt web của tác nhân vào bộ nhớ đệm

  • Tăng lượng văn bản tác nhân có thể giữ lại

  • Xóa ảnh chụp màn hình theo đợt thay vì ở mỗi bước

GPT‑6 Astra bắt đầu bằng các thử nghiệm nhanh để xác định những biến số có ảnh hưởng. Do mã nguồn chưa được thiết kế cho thử nghiệm có đối chứng, mô hình đã tái cấu trúc mã để một frontend và backend có thể hỗ trợ nhiều quy trình chạy song song, mỗi quy trình có thiết lập riêng.

Astra thực hiện toàn bộ nghiên cứu: hai giới hạn lưu trữ lịch sử là 120.000 và 480.000 ký tự, cùng sáu chính sách về bộ nhớ đệm và ảnh chụp màn hình. Mỗi cấu hình được thử ba lần trên từng mô hình trong số bốn mô hình (xem bảng bên dưới). Chính sách hiệu quả nhất cho phép tích lũy 20 ảnh chụp màn hình rồi mới xóa bớt, chỉ giữ lại ảnh mới nhất. Cách này giữ nguyên lịch sử trước đó lâu hơn giữa các lần xóa. Kết hợp với giới hạn lưu trữ lịch sử lớn hơn, chính sách này tạo thành quy trình tối ưu. Mỗi cấu hình thực hiện cùng một nhiệm vụ: thu thập sáu trường thông tin cho từng cuốn trong số 32 cuốn sách từ một danh mục demo công khai, đại diện cho công việc mà một số khách hàng Asana thực hiện trên StackAI.

Mô hình

Mô tả

Giá

Mô hình A

Mô hình nhỏ hơn, giá thấp hơn từ một phòng nghiên cứu AI tiên phong khác, ra mắt vào mùa thu năm 2025

Giá bằng một nửa GPT‑6.1 Sol

Mô hình B

Mô hình ban đầu được dùng trong môi trường vận hành thực tế, từ cùng phòng nghiên cứu với Mô hình A, ra mắt vào mùa hè năm 2026

Giá bằng GPT‑6.1 Sol

Mô hình C

Phiên bản cập nhật của Mô hình B, ra mắt vào mùa thu năm 2026

Giá bằng GPT‑6.1 Sol

GPT‑6.1 Sol

Mô hình của OpenAI

GPT‑6 Astra chạy các quy trình, kiểm tra yêu cầu, bản ghi sử dụng và đầu ra; các phiên mô hình riêng biệt rà soát lại công việc. Yêu cầu, dấu vết dữ liệu và kết quả của từng phiên đều được ghi lại trong Command⁠(mở trong cửa sổ mới), nền tảng triển khai phần mềm của Asana, để nhóm có thể xem lại toàn bộ nghiên cứu sau đó. Từ Command, các phát hiện được chuyển thành phiếu công việc, rồi thành pull request, và các thay đổi được đưa vào vận hành thực tế.

“Nếu làm thủ công, tôi sẽ mất một đến hai tháng. Với GPT-6 Astra trong Codex, công việc chỉ mất khoảng một tuần: tôi đặt /goal trước khi đi ngủ và xem lại kết quả vào sáng hôm sau.”
—Tiến sĩ Frank Hidalgo, Giám đốc công nghệ StackAI tại Asana

Đưa chi phí mô hình xuống dưới 0,50 USD mỗi lượt chạy

Với Mô hình B, việc tối ưu hóa đã giảm chi phí mô hình ước tính từ ít nhất 36,21 USD (một số lượt chạy ban đầu chạm giới hạn số bước trước khi hoàn tất) xuống 1,24 USD mỗi lượt, tức giảm 29 lần. Quy trình tối ưu trên GPT‑6.1 Sol còn rẻ hơn 2,6 lần nữa, chỉ ở mức 0,47 USD. Mọi lượt chạy trong quy trình tối ưu đều hoàn thành nhiệm vụ và trả về câu trả lời đúng.

Giá trị trung bình của 3 lượt chạy. ≥: cấu hình cơ sở có các lượt chạy chạm giới hạn, nên giá trị trung bình là cận dưới.

Hai hệ số bên phải được tính so với Mô hình B đã tối ưu. Mô hình B chạy ở giai đoạn 1; Mô hình C và Sol 6.1 chạy ở giai đoạn 2 của cùng nghiên cứu (đường chấm).

Riêng trên GPT‑6.1 Sol, với giới hạn lưu trữ lịch sử lớn hơn, chính sách mới về bộ nhớ đệm và ảnh chụp màn hình đã giảm chi phí 4 lần, từ 1,97 USD xuống 0,47 USD mỗi lượt chạy. Mỗi lần gọi rẻ hơn khoảng 3 lần vì 89% đầu vào đến từ bộ nhớ đệm, với giá chỉ bằng 5% giá đầu vào không được lưu đệm. Thời gian chạy cũng giảm: từ ít nhất 22,5 phút với cấu hình ban đầu trên Mô hình B xuống khoảng bốn phút với quy trình tối ưu trên GPT‑6.1 Sol.

Trung bình của 3 lượt chạy, với thanh sai số biểu thị độ lệch chuẩn (SD). ≥: giá trị trung bình có tính cả lượt chạy chạm giới hạn hoặc chưa hoàn tất, nên giá trị thực ít nhất bằng mức này.

Các cột dùng tông màu xanh dương. Đánh giá tác động của việc lưu đệm bằng cách so với cột có giới hạn lưu trữ lớn hơn, ở mức 480 nghìn.

Các điểm đánh dấu lượt chạy và thanh sai số SD được dựng lại gần đúng từ hình ảnh gốc; không có dữ liệu gốc về giá trị từng lượt chạy và độ lệch chuẩn.

Trung bình của 3 lượt chạy, với thanh sai số biểu thị độ lệch chuẩn (SD). ≥: giá trị trung bình có tính cả lượt chạy chạm giới hạn hoặc chưa hoàn tất, nên giá trị thực ít nhất bằng mức này.

Các cột dùng tông màu xanh dương. Đánh giá tác động của việc lưu đệm bằng cách so với cột có giới hạn lưu trữ lớn hơn, ở mức 480 nghìn.

Các điểm đánh dấu lượt chạy và thanh sai số SD được dựng lại gần đúng từ hình ảnh gốc; không có dữ liệu gốc về giá trị từng lượt chạy và độ lệch chuẩn.

Quá trình khảo sát còn cho thấy cách quản lý lịch sử ảnh hưởng đến việc tác nhân có đưa ra được câu trả lời hay không. Khi tăng không gian lưu lịch sử duyệt web cho GPT‑6.1 Sol, số lượt chạy đưa ra được câu trả lời tăng từ 3/18 với giới hạn nhỏ lên toàn bộ 18 lượt với giới hạn lớn hơn, và mọi câu trả lời đều đúng. Với Hidalgo, giá trị kinh doanh nằm ở việc giúp khách hàng tiếp cận các mô hình nhanh hơn, mạnh hơn mà vẫn giữ chi phí vận hành ở mức bền vững.

“Trước đây, chi phí hạn chế lựa chọn mô hình mà chúng tôi có thể cung cấp cho khách hàng để xử lý những công việc này. Bằng cách nâng cao hiệu quả của tác nhân, chúng tôi có thể mang đến cho khách hàng một mô hình tốt hơn, nhanh hơn, đồng thời giảm chi phí vận hành.”
—Tiến sĩ Frank Hidalgo, Giám đốc công nghệ StackAI tại Asana

Mở rộng quy mô thử nghiệm và kiểm thử sản phẩm

Asana đã triển khai các thay đổi về điều hướng trình duyệt trong StackAI và đang phát triển công cụ để dễ dàng lặp lại những thử nghiệm tương tự. Về lâu dài, nhóm dự định tích hợp việc kiểm thử này vào quy trình đánh giá của nền tảng, để khách hàng và các nhóm nội bộ có thể so sánh chi phí, thời gian chạy và chất lượng câu trả lời khi cấu hình tác nhân.

“Tốc độ phát hành không còn là nút thắt; khả năng dành sự chú ý của con người mới là nút thắt. Chúng ta đang tiến gần đến một thế giới nơi mỗi kỹ sư đều là một nhà quản lý sản phẩm dẫn dắt cả một đội tác nhân.”
—Tiến sĩ Frank Hidalgo, Giám đốc công nghệ StackAI tại Asana

Asana hiện dùng GPT‑6 Astra trong Codex để kiểm thử tính năng sản phẩm trước khi phát hành: Astra thao tác trên nền tảng, thử nhiều đầu vào và báo lỗi cho nhân viên QA rà soát. Hidalgo xem đây là nền tảng cho một vòng đời phát triển phần mềm mới, với nhiều phiên tác nhân trên đám mây kiểm thử các tính năng song song.

Xem toàn bộ nghiên cứu trên blog của Asana⁠(mở trong cửa sổ mới) và StackAI⁠(mở trong cửa sổ mới).

Bước vào kỷ nguyên làm việc mới

Hơn 1 triệu doanh nghiệp trên khắp thế giới đang đạt được những kết quả thiết thực với OpenAI.