Bỏ qua nội dung chính
OpenAI

13 tháng 8, 2026

AI ứng dụng

Hướng dẫn xây dựng với GPT‑5.6

Bài học kỹ thuật từ các startup trong môi trường thực tế

Đang tải…

GPT‑5.6 thiết lập chuẩn mực mới về hiệu năng trên chi phí

Họ mô hình GPT‑5.6 giúp hiệu năng tác nhân ở cấp độ tiên phong trở nên dễ tiếp cận hơn rất nhiều, đồng thời mở rộng giới hạn của những điều có thể thực hiện.

Trong hướng dẫn này, chúng tôi trình bày cách các startup lựa chọn mô hình thông minh hơn và sử dụng những cơ chế điều khiển API mới hỗ trợ tính liên tục của quá trình suy luận, điều phối đa tác nhân và gọi công cụ theo chương trình để xây dựng các tác nhân nhanh hơn, mạnh hơn với chi phí chỉ bằng một phần nhỏ.

Trải nghiệm mặc định tốt hơn

Kể từ GPT‑5, mỗi thế hệ mô hình đều hướng tới xử lý các tác vụ dài hạn hơn với ít token hơn. GPT‑5.6 tiếp nối xu hướng đó: hiệu năng tác nhân cao hơn, chi phí thấp hơn mà chỉ cần thay đổi tối thiểu đối với hệ thống điều khiển nền tảng.

Hiệu quả chi phí tổng thể được cải thiện hơn nữa nhờ độ chính xác cao hơn ở mức nỗ lực suy luận thấp hơn. Ví dụ, trong Agents’ Last Exam, GPT‑5.6 Sol ở mức suy luận “thấp” vượt GPT‑5.5 ở mức suy luận “cao” khi giữ nguyên hệ thống điều khiển. Chúng tôi cũng ghi nhận những kết quả tương tự trong thử nghiệm thực tế: các startup báo cáo chi phí của nhiều quy trình đã giảm đáng kể khi hạ mức nỗ lực suy luận so với thiết lập mặc định trước đây.

Chúng tôi đưa GPT‑5.6 vào hệ thống điều khiển và mức nỗ lực suy luận thấp đã mang lại kết quả tốt nhất. Mô hình biết khi nào dữ liệu đơn giản là không tồn tại, không chạy theo những manh mối sai và tìm ra đáp án đúng với ít token hơn.
— Izzy Miller, Trưởng nhóm nghiên cứu AI, Hex(mở trong cửa sổ mới)

Lựa chọn mô hình

Trước đây, nâng cấp lên mô hình chủ lực với mức suy luận cao nhất hiện có thường là lựa chọn tốt nhất cho các trường hợp sử dụng dài hạn. Nguyên nhân chính là các mô hình này có khả năng xử lý ngữ cảnh dài và gọi công cụ tốt hơn đáng kể so với các mô hình được tối ưu hóa về chi phí. Điều này đã thay đổi với họ 5.6: nhờ có thêm tài nguyên tính toán khi kiểm thử, Luna và Terra thường có thể đạt hiệu năng tương đương GPT‑5.4 và 5.5 nhưng với chi phí thấp hơn đáng kể.

1 trong số 3
Luna duy trì 98% độ chính xác trích xuất của GPT‑5.5 với chi phí chỉ bằng một phần mười tám. Nhờ đó, các tác nhân của chúng tôi có thể hiểu tài liệu với chất lượng cao ở mức giá đủ thiết thực để triển khai trên nhiều quy trình hơn.
— Serhii Shchoholiev, Trưởng nhóm kỹ thuật tác nhân, Hypha(mở trong cửa sổ mới)

Hãy xét các tác vụ trong BrowseComp, một bài đánh giá dựa trên tìm kiếm nhằm kiểm tra khả năng tìm kiếm những dữ kiện ít người biết của mô hình. Ba tháng trước, GPT‑5.5 (Chuyên sâu) đạt 84,36% trong bài đánh giá này với tổng chi phí 33,27 USD. Khi ra mắt, GPT‑5.6 Luna (Chuyên sâu) mang lại hiệu năng gần như tương đương, đạt 84,04% với chi phí 1,33 USD. Kể từ đó, chúng tôi đã tiếp tục giảm giá. Tìm hiểu thêm về đợt giảm giá mới nhất của chúng tôi.

Các mô hình nhỏ hơn thuộc họ 5.6 rất phù hợp với khối lượng công việc lớn, những tương tác nhạy cảm với độ trễ và các bước lặp lại trong quy trình tác nhân. Ví dụ, nếu bạn điều hành một startup công nghệ pháp lý chuyên phân tích ghi chú viết tay trước khi tác nhân phân tích, giờ đây bạn có thể dùng Terra hoặc Luna để trích xuất thay vì dùng một mô hình tiên phong cho toàn bộ quy trình, qua đó tiết kiệm đáng kể chi phí.

Phát triển Responses API để thiết kế tác nhân hiệu quả hơn

Ngoài việc nâng cao hiệu năng mặc định của GPT‑5.6, chúng tôi còn bổ sung các thành phần nền tảng mới cho Responses API nhằm mang lại hiệu quả cao hơn nữa. Chúng tôi huấn luyện GPT‑5.6 xuyên suốt với ba cải tiến kiến trúc bổ trợ cho nhau, giúp tác nhân hoạt động hiệu quả hơn:

  1. Tái sử dụng công việc đã hoàn thành: bằng cách cho phép duy trì quá trình suy luận(mở trong cửa sổ mới) qua các lượt tương tác với mô hình và dùng tính năng Nén ngữ cảnh tích hợp(mở trong cửa sổ mới) để rút gọn các cuộc trò chuyện kéo dài, mô hình có thể duy trì tính nhất quán khi thực hiện những tác vụ dài hơn mà không bị nhầm lẫn hay phải tái dựng ngữ cảnh trước đó.
  2. Phân tách song song khi phù hợp: tính năng điều phối đa tác nhân tích hợp(mở trong cửa sổ mới) cho phép phối hợp nhiều tác nhân trên các luồng công việc song song để hoàn thành tác vụ phức tạp nhanh hơn.
  3. Chuyển công việc có tính xác định sang mã: dùng tính năng gọi công cụ theo chương trình(mở trong cửa sổ mới) để lọc, tổng hợp và điều phối đầu ra của công cụ bên ngoài cửa sổ ngữ cảnh của mô hình, dành token của mô hình cho việc phán đoán, đồng thời giảm chi phí, độ trễ và tình trạng suy giảm ngữ cảnh.

Khi dùng cùng nhau, chúng có thể tạo ra khác biệt rất lớn. Ví dụ, trên ARC-AGI-3, GPT‑5.6 Sol đạt 13,3% với hệ thống điều khiển tiêu chuẩn. Tuy nhiên, sau khi bật tính năng duy trì suy luận và Nén ngữ cảnh, điểm số tăng vọt lên 38,3% trong khi sử dụng ít hơn khoảng 6 lần số token đầu ra. Không thay đổi mô hình nhưng hiệu năng tăng gần gấp ba. Bạn có thể đọc thêm về nghiên cứu hệ thống điều khiển ARC-AGI-3 của chúng tôi tại đây.

Gọi công cụ theo chương trình

Quy trình tác nhân thường bao gồm hai loại công việc:

  1. Tác vụ đòi hỏi khả năng phán đoán
  2. Công việc chủ yếu là di chuyển, lọc và kết hợp dữ liệu

Khi một tác nhân truy xuất 100 hồ sơ, lọc theo ngày và xác định các giao dịch liên quan, mô hình không cần phải suy luận về mọi kết quả trung gian trong cửa sổ ngữ cảnh. Tính năng Gọi công cụ theo chương trình cho phép GPT‑5.6 viết JavaScript để điều phối công cụ, chạy song song các lệnh gọi độc lập và xử lý đầu ra bên ngoài cửa sổ ngữ cảnh. Nhờ đó, mô hình có thể tập trung vào phần thực sự cần trí tuệ: vận dụng khả năng phán đoán.

Trong nghiên cứu tài chính, phần khó là truy xuất hồ sơ một cách đáng tin cậy, phối hợp các công cụ và xử lý số liệu. Trong các đánh giá của chúng tôi, GPT‑5.6 dùng tính năng Gọi công cụ theo chương trình đạt chất lượng theo tiêu chí chấm điểm của chúng tôi nhưng sử dụng ít hơn 21% token đầu vào. Đó là khác biệt giữa một tác nhân có thể thảo luận về nghiên cứu tài chính và một tác nhân thực sự có thể tiến hành nghiên cứu.
— Alex Wang, AI ứng dụng, Rogo(mở trong cửa sổ mới)

Đa tác nhân

Với các tác vụ phức tạp có thể xử lý song song, việc phân bổ hành động và suy luận cho nhiều luồng công việc của tác nhân giúp hoàn thành tác vụ nhanh hơn và nâng cao năng lực xử lý. Trong những cấu hình này, tác nhân chính chịu trách nhiệm điều phối các tác nhân phụ và giao nhiệm vụ cho chúng. Các tác nhân phụ theo đuổi mục tiêu song song, sau đó chuyển kết quả về cho tác nhân chính để tổng hợp lần cuối. Các nhóm có thể bắt đầu tận dụng tính năng đa tác nhân tích hợp bằng cách bật chế độ đa tác nhân(mở trong cửa sổ mới) trong Responses API. Đây cũng là cách thiết lập năng lực Ultra trong ChatGPT hoạt động.

1 trong số 2
Qualia vận hành các nhóm tác nhân để giải quyết những bài toán nghiên cứu mở, và GPT‑5.6 Sol thực sự phù hợp. Mô hình cải thiện rõ rệt so với GPT‑5.5, hoàn thành nhanh hơn hầu hết các mô hình khác mà chúng tôi thử nghiệm và nhanh chóng trở thành mô hình OpenAI được chúng tôi ưu tiên sử dụng.
— E Chi, Nhà sáng lập, Quadrillion(mở trong cửa sổ mới)

Mặc dù GPT‑5.6 có khả năng xác định tốt số lượng tác nhân phụ phù hợp và thời điểm cần khởi tạo chúng, hành vi đa tác nhân vẫn có thể được định hướng rất linh hoạt. Việc hướng dẫn mô hình về thời điểm gọi tác nhân phụ có thể giúp chúng chỉ được khởi tạo trong những tình huống mà lượng token bổ sung sẽ mang lại hiệu năng tốt hơn.

Lưu trữ nội dung câu lệnh

Trên toàn bộ họ mô hình, TTL của bộ nhớ đệm câu lệnh đã được kéo dài lên tối thiểu 30 phút, đồng thời giờ đây có thể đặt các điểm ngắt bộ nhớ đệm một cách xác định trong cửa sổ ngữ cảnh của mô hình. Điều này đã giúp các startup tăng đáng kể tỷ lệ truy cập trúng bộ nhớ đệm.

Chúng tôi thêm các điểm ngắt bộ nhớ đệm và khóa riêng cho từng không gian làm việc vào một câu lệnh dùng chung dài 29.000 token, nhờ đó giảm 28% lượng đầu vào chưa được lưu vào bộ nhớ đệm. Khoảng thời gian lưu vào bộ nhớ đệm 30 phút cũng tạo ra bước đột phá lớn: các tác nhân của chúng tôi có thể tái sử dụng cùng ngữ cảnh qua nhiều lượt chạy thay vì bắt đầu lại từ đầu.
— Lorenzo Gentile, Kỹ sư AI, Ploy(mở trong cửa sổ mới)

Ngoài việc đặt các điểm ngắt bộ nhớ đệm, tiếp tục sử dụng một prompt_cache_key(mở trong cửa sổ mới) phù hợp sẽ tăng khả năng yêu cầu được chuyển đến cùng công cụ suy luận từng xử lý tiền tố đó, qua đó giảm độ trễ.

Kết luận

Điểm nổi bật trong các ví dụ này là bài toán kinh tế khi xây dựng tác nhân đã thay đổi sâu sắc đến mức nào.

Những trường hợp sử dụng trước đây cần mô hình tiên phong ở mọi bước giờ có thể đạt kết quả tương đương hoặc tốt hơn với chi phí chỉ bằng một phần nhỏ nhờ dùng các mô hình nhỏ hơn, điều chỉnh mức nỗ lực suy luận và đưa ra lựa chọn kiến trúc hiệu quả.

Chúng tôi rất háo hức chờ xem các bạn sẽ xây dựng nên những gì!

  • 2026
  • Nền tảng API

Giới thiệu về các tác giả

Hướng dẫn này do Samarth Madduru(mở trong cửa sổ mới), Prashant Mital(mở trong cửa sổ mới), Dave Leo(mở trong cửa sổ mới)Julien Reiman(mở trong cửa sổ mới) biên soạn dựa trên kinh nghiệm hợp tác chặt chẽ với các startup xây dựng trên GPT‑5.6, từ giai đoạn thử nghiệm ban đầu đến khi đưa vào vận hành thực tế.