Bảng điểm cho kỷ nguyên AI
Câu hỏi tôi nghe từ các CFO ở khắp nơi rất đơn giản: làm thế nào để thu được nhiều giá trị hơn từ khoản chi cho AI?
Trong nhiều năm, thị trường đo lường thành công của phần mềm qua mức độ áp dụng: số ghế đã mua, người dùng hoạt động, giấy phép được gia hạn. Để hiểu giá trị của AI, cần một thước đo mạnh hơn: công việc đã hoàn thành.
Câu hỏi kinh tế cơ bản mà các CFO và lãnh đạo doanh nghiệp khác phải đối mặt là liệu giá trị của công việc AI hoàn thành có tăng nhanh hơn chi phí tạo ra nó hay không.
Để trả lời câu hỏi đó, cần nhìn sâu hơn một chỉ số như chi phí trên mỗi token. Một mô hình chi phí thấp hơn có thể có token rẻ hơn, nhưng để đạt kết quả tốt có thể cần nhiều lần thử hơn, nhiều thời gian hơn hoặc nhiều rà soát của con người hơn. Một mô hình có năng lực hơn có thể có token đắt hơn, nhưng hoàn thành cùng một tác vụ chỉ trong một lượt. Điều quan trọng là toàn bộ chi phí để tạo ra một kết quả thành công, đối chiếu với giá trị mà kết quả đó tạo ra.
Bảng điểm tối hậu cho kỷ nguyên AI có thể được nhìn nhận là “Trí tuệ hữu ích trên mỗi đô la”. Chỉ số này trả lời bốn câu hỏi chính:
- AI có đang hoàn thành công việc quan trọng không?
- Mỗi tác vụ thành công tốn bao nhiêu?
- Mọi người có thể tin cậy kết quả không?
- Mỗi đô la chi cho AI có tạo ra nhiều giá trị hơn khi mức sử dụng tăng lên không?
Hãy bắt đầu từ chính công việc.
AI đã giúp giải quyết bao nhiêu vấn đề của khách hàng? AI đã giúp đưa vào vận hành bao nhiêu thay đổi mã? AI đã rà soát bao nhiêu hợp đồng? AI đã trả lại cho mọi người bao nhiêu thời gian? Bao nhiêu quyết định đã tốt hơn nhờ có đúng bối cảnh vào đúng thời điểm?
Token tạo ra giá trị khi chúng chuyển hóa thành công việc mà con người có thể sử dụng. Khi các mô hình trở nên có năng lực hơn, chúng có thể đảm nhận các tác vụ dài hơn và phức tạp hơn: duy trì bối cảnh, suy luận qua nhiều bước, làm việc trên nhiều công cụ và thích ứng trong quá trình thực hiện.
Nơi tốt nhất để bắt đầu là một quy trình công việc. Hãy định nghĩa “hoàn tất” nghĩa là gì và đo lường kết quả đó trong hệ thống nơi công việc diễn ra.
Với đội ngũ hỗ trợ, “hoàn tất” có thể là một vấn đề của khách hàng đã được giải quyết. Với đội ngũ kỹ thuật, đó có thể là một thay đổi mã vượt qua các bài kiểm thử. Với đội ngũ pháp lý, đó có thể là một hợp đồng được rà soát chính xác và đúng hạn.
Hãy xét một đội ngũ tài chính đang chuẩn bị cho buổi rà soát dự báo. Phần lớn công việc diễn ra trước khi có quyết định cuối cùng: tìm bản dự báo mới nhất, chuyển dữ liệu vào Excel hoặc Sheets, xác định thay đổi, đối chiếu các tab, dựng lại trang trình bày và kiểm tra để mọi thứ khớp hoàn hảo.
ChatGPT Công việc có thể đảm nhận phần lớn quy trình đó, giúp đội ngũ có thêm thời gian tập trung vào những câu hỏi quan trọng: Điều gì đã thay đổi? Vì sao? Tiếp theo chúng ta nên làm gì?
Đó là trí tuệ hữu ích trên mỗi đô la trong thực tế. Nhiều công việc hơn được hoàn thành nhanh hơn, trong khi mọi người dành nhiều thời gian hơn để vận dụng phán đoán, sáng tạo và chuyên môn.
Câu hỏi tiếp theo là chi phí để hoàn thành tốt công việc đó.
Các tác vụ AI rất đa dạng. Một câu trả lời nhanh có thể cần ít năng lực tính toán. Một quy trình viết mã, nghiên cứu hoặc tài chính có thể đòi hỏi suy luận sâu hơn, sử dụng công cụ và nhiều hành động. Những tác vụ phức tạp hơn đó có thể cần nhiều năng lực tính toán hơn, nhưng cũng có thể tạo ra giá trị lớn hơn nhiều.
Ở cấp độ mô hình, chi phí cho mỗi tác vụ thành công phụ thuộc vào giá, lượng năng lực tính toán được sử dụng và khả năng đạt được kết quả đúng. Với doanh nghiệp, toàn bộ chi phí còn bao gồm thời gian của nhân viên, rà soát của con người, thử lại và làm lại.
Cách tính rất đơn giản:
- Cộng toàn bộ chi phí để hoàn thành công việc.
- Đếm các tác vụ đạt ngưỡng chất lượng yêu cầu.
- Chia toàn bộ chi phí cho số tác vụ thành công.
Đó là lý do mức giá thấp nhất trên mỗi token không phải lúc nào cũng tạo ra chi phí thấp nhất cho mỗi kết quả. Một mô hình tiên phong có thể mang lại giá trị tốt nhất ngay cả với yêu cầu thông thường nếu nó tạo ra câu trả lời đúng trong một lượt, giảm số lần thử lại, độ trễ, rà soát và tổng năng lực tính toán.
Một họ mô hình phân tầng cho khách hàng nhiều cách hơn để tối ưu phương trình này. GPT‑5.6, mà chúng tôi ra mắt tuần trước, có ba tầng: Sol là mô hình chủ lực; Terra cân bằng hiệu năng và chi phí; Luna là mô hình nhanh nhất và phải chăng nhất của chúng tôi.
Các tầng này là những điểm khởi đầu hữu ích. Cuối cùng, tính kinh tế của toàn bộ tác vụ nên quyết định mô hình phù hợp. Khách hàng có thể dùng Luna cho quy trình nhanh, khối lượng lớn; Terra cho công việc cần chiều sâu hơn; hoặc Sol khi khả năng suy luận mạnh hơn mang lại kết quả tốt nhất với ít lần thử hơn.
Chúng tôi huấn luyện GPT‑5.6 để tạo ra nhiều công việc hữu ích hơn từ mỗi token. Trên bảng xếp hạng Tác nhân Lập trình Artificial Analysis, GPT‑5.6 Sol với suy luận tối đa đã thiết lập chuẩn mực mới, đồng thời dùng ít token đầu ra hơn 54% so với một mô hình dẫn đầu khác. Biểu đồ dưới đây minh họa sự so sánh này.
DeepSWE v1.1: Các tác vụ kỹ thuật dài hạn; GPT‑5.6 Sol đạt mức cao mới là 72,7%, vượt mức 69,9% của Claude Fable 5, với chi phí API ước tính thấp hơn 36,2%.
Trên toàn bộ họ GPT‑5.6, mục tiêu vẫn như nhau: nhiều công việc thành công hơn trên mỗi đô la. Hiệu suất cao hơn giúp các tác vụ hiện có trở nên phải chăng hơn. Năng lực lớn hơn mở ra những loại công việc hoàn toàn mới.
Mỗi thế hệ mô hình mới nên cải thiện cả hai vế của phương trình đó. Khách hàng nên có thể hoàn thành nhiều công việc giá trị hơn, đồng thời chi phí để hoàn thành từng tác vụ tiếp tục giảm.
Thước đo thứ ba là độ tin cậy.
Việc áp dụng AI thường đi sâu dần theo từng giai đoạn. Đầu tiên, AI hỗ trợ soạn thảo. Sau đó, nó tìm bối cảnh và suy luận trên nhiều công cụ và dữ liệu. Theo thời gian, nó bắt đầu hành động, xử lý ngoại lệ và hoàn thành các quy trình công việc, trong khi con người cung cấp phán đoán và kiểm soát khi cần.
Mỗi bước tạo ra nhiều giá trị hơn và cũng đòi hỏi nhiều hơn ở hệ thống.
Độ tin cậy có giá trị kinh tế trực tiếp. Khi kết quả chính xác, có nguồn dẫn rõ ràng, nhất quán và được chuyển cấp phù hợp, mọi người mất ít thời gian hơn cho việc rà soát, chỉnh sửa và làm lại. Tác vụ thành công tốn ít chi phí hơn, và tổ chức có thêm tự tin để dùng AI trong các quy trình công việc quan trọng hơn.
Các đội ngũ có thể cụ thể hóa điều này bằng cách theo dõi ba kết quả:
- Sẵn sàng sử dụng: Kết quả đạt ngưỡng chất lượng ngay khi được bàn giao.
- Cần chỉnh sửa: Kết quả cần thêm một lần thử hoặc chỉnh sửa của con người.
- Cần chuyển cấp: Cần một người tham gia và hoàn tất công việc.
Những thước đo này kể một câu chuyện đầy đủ hơn so với chỉ độ chính xác của mô hình. Chúng cho thấy AI có thực sự giảm khối lượng công việc cần thiết để hoàn thành dự án hay không.
Độ tin cậy cũng đòi hỏi các ranh giới rõ ràng. Trước khi AI chuyển từ soạn thảo sang hành động, các tổ chức nên xác định:
- Hệ thống có thể truy cập dữ liệu nào.
- Hệ thống có thể sử dụng hoặc thay đổi những hệ thống nào.
- Khi nào con người cần rà soát hoặc phê duyệt một hành động.
An toàn, bảo mật, quyền riêng tư và kiểm soát tạo nền tảng cho việc sử dụng sâu hơn. Mọi người cần hiểu hệ thống vận hành ra sao, dữ liệu của họ được xử lý thế nào và các hành động của hệ thống được quản trị bằng cách nào.
ChatGPT Công việc được xây dựng trên nền tảng bảo mật, quyền riêng tư, tuân thủ và quản lý không gian làm việc của ChatGPT Enterprise. Điều này cho phép các tổ chức cung cấp cho AI nhiều bối cảnh hơn và quyền truy cập vào các quy trình công việc giá trị hơn, đồng thời duy trì mức giám sát phù hợp.
Năng lực giúp AI được dùng lần đầu. Độ tin cậy biến AI thành một phần trong cách công việc được hoàn thành.
Câu hỏi cuối cùng là liệu tính kinh tế có cải thiện khi mở rộng quy mô hay không.
Các công ty có thể đo lường điều này bằng cách theo dõi cùng một quy trình công việc theo thời gian. Theo dõi số tác vụ đạt ngưỡng chất lượng, tổng chi phí để hoàn thành chúng và chi phí trên mỗi tác vụ thành công. Nếu lượng công việc hoàn thành tăng nhanh hơn tổng chi phí trong khi chất lượng được giữ vững hoặc cải thiện, mỗi đô la AI đang tạo ra nhiều giá trị hơn.
Năng lực tính toán nằm ở trung tâm của phương trình này.
Năng lực tính toán thúc đẩy nghiên cứu và mọi tác vụ mà AI hoàn thành. Nó định hình chất lượng sản phẩm, tốc độ, độ tin cậy, khả năng sẵn có và chi phí. Năng lực tính toán cho huấn luyện xây dựng năng lực tương lai. Năng lực tính toán cho suy luận mang lại công việc hữu ích ngay hôm nay. Cả hai nên chuyển hóa thành kết quả tốt hơn cho khách hàng.
Mô hình tốt hơn, suy luận hiệu quả hơn, phần cứng chuyên dụng, mức sử dụng cao hơn, định tuyến thông minh hơn và thiết kế sản phẩm mạnh hơn đều cải thiện lợi tức trên năng lực tính toán. Mỗi thế hệ hạ tầng giúp huấn luyện các mô hình có năng lực hơn. Sau đó, thuật toán, phần cứng và phần mềm tốt hơn giúp phục vụ các mô hình đó hiệu quả hơn.
Khách hàng cảm nhận những cải thiện đó theo cách rất thực tế: câu trả lời tốt hơn, kết quả nhanh hơn, ít chỉnh sửa hơn, sản phẩm đáng tin cậy hơn và chi phí thấp hơn cho công việc họ cần hoàn thành.
Những lợi ích này cộng dồn theo thời gian. Hạ tầng tốt hơn thúc đẩy nghiên cứu nhanh hơn. Nghiên cứu tạo ra các mô hình có năng lực hơn và hiệu quả hơn. Mô hình tốt hơn cải thiện sản phẩm. Sản phẩm tốt hơn thúc đẩy việc áp dụng, học hỏi và doanh thu. Sự tăng trưởng đó hỗ trợ đầu tư liên tục vào thế hệ nghiên cứu, năng lực tính toán, triển khai và an toàn tiếp theo.
OpenAI kết nối các mảnh ghép này thông qua một nền tảng trí tuệ chung. Mọi người sử dụng nền tảng đó qua ChatGPT và ChatGPT Công việc. Nhà phát triển xây dựng trên nền tảng đó qua Codex và API. Doanh nghiệp triển khai nền tảng đó vào các hệ thống nơi công việc diễn ra.
Khi một lớp được cải thiện, mọi sản phẩm và khách hàng đều có thể hưởng lợi.
Khi kết hợp lại, bốn thước đo này cho chúng ta biết liệu trí tuệ hữu ích trên mỗi đô la có đang cải thiện hay không.
Công việc hữu ích cho chúng ta biết AI tạo ra gì. Chi phí trên mỗi tác vụ thành công cho chúng ta biết cần gì để đạt được kết quả. Độ tin cậy cho chúng ta biết bao nhiêu phần công việc có thể được mọi người tự tin sử dụng. Giá trị ở quy mô lớn cho chúng ta biết liệu mỗi đô la và mỗi đơn vị năng lực tính toán có hoàn thành được nhiều hơn theo thời gian hay không.
Mục tiêu là AI giúp mọi người làm nhiều công việc có ý nghĩa hơn, đưa ra quyết định tốt hơn và dành nhiều thời gian hơn cho những phần việc đòi hỏi phán đoán và sáng tạo rất riêng của con người.
Công việc của chúng tôi là cải thiện phương trình đó qua từng thế hệ: mô hình có năng lực hơn, kết quả nhanh hơn và đáng tin cậy hơn, cùng chi phí thấp hơn cho công việc khách hàng cần hoàn thành.
Đó là cách AI ngày càng hữu ích hơn cho nhiều người và tổ chức hơn theo thời gian.


