Bỏ qua nội dung chính
OpenAI

29 tháng 7, 2026

Nghiên cứuẤn phẩm

Cách hai chế độ cài đặt giúp điểm ARC-AGI-3 của chúng tôi tăng gấp ba

Đang tải…

Video tua nhanh cảnh GPT‑5.6 Sol tìm cách giải các câu đố trong bài đánh giá ARC-AGI-3 bằng hệ thống điều khiển chính thức (bên trái) và hệ thống điều khiển dùng API Responses của chúng tôi (bên phải), có duy trì suy luận và bật Nén ngữ cảnh. Trên bảng xếp hạng của trò chơi này(mở trong cửa sổ mới), không mô hình tiên phong nào giải được cấp độ cao hơn cấp đầu tiên. Với hệ thống điều khiển của chúng tôi, GPT‑5.6 Sol giải được cả sáu cấp độ.

Khi lần đầu thấy điểm số thấp của GPT‑5.6 Sol trên bài đánh giá ARC-AGI-3(mở trong cửa sổ mới), chúng tôi rất bối rối.

GPT‑5.6 Sol đã giải được những bài toán mở tồn tại từ lâu như giả thuyết phủ kép chu trình(mở trong cửa sổ mới) và chinh phục các trò chơi như Pokémon FireRed. Nhưng trên ARC-AGI-3, một bài đánh giá gồm các trò chơi giải đố 2D, GPT‑5.6 Sol chỉ đạt 7,8%, còn GPT‑5.5 gần như không thể chơi được, với số điểm ít ỏi 0,4%.

Phải chăng các trò chơi giải đố 2D đặc biệt khó đối với mô hình của chúng tôi? Hay còn nguyên nhân nào khác?

Các bài đánh giá hiếm khi chỉ đo lường riêng mô hình AI. Chúng còn phản ánh những lựa chọn khó thấy hơn về chế độ cài đặt API, thiết kế hệ thống điều khiển và câu lệnh. Với ARC-AGI-3, chúng tôi phát hiện rằng việc bật hai chế độ cài đặt API dùng trong ChatGPT và Codex—duy trì suy luận và Nén ngữ cảnh—đã giúp điểm số trên tập tác vụ công khai tăng gấp ba, đồng thời giảm 6 lần số token đầu ra.

Với hệ thống điều khiển chính thức, GPT‑5.6 Sol đạt 13,3% trên tập công khai ARC-AGI-3. Khi duy trì suy luận và bật Nén ngữ cảnh, mô hình đạt 38,3%. Điểm số đo Hiệu quả hành động tương đối so với con người (RHAE(mở trong cửa sổ mới))một chỉ số so sánh hiệu suất của mô hình với mốc chuẩn của con người. Dựa trên nhật ký chơi chính thức(mở trong cửa sổ mới), chúng tôi ước tính người thử nghiệm trung bình đạt 48%. Các mô hình không được cho biết cách tính điểm và cũng không thể xem điểm trong suốt quá trìnhmỗi hành động chỉ trả về biểu diễn dạng văn bản của từng khung hình và cấp độ hiện tại.

ARC-AGI-3

ARC-AGI-3 là bài đánh giá được thiết kế để đo lường khả năng học hỏi và suy luận của các tác nhân AI. Các tác nhân khám phá những trò chơi 2D xa lạ và tự suy ra cơ chế hoạt động mà không có hướng dẫn rõ ràng. Bạn có thể chơi 25 trò chơi thử nghiệm tại arcprize.org/tasks(mở trong cửa sổ mới).

ARC-AGI-3 chủ ý sử dụng một hệ thống điều khiển tổng quát, không có công cụ hay tính năng đặc biệt. Theo lập luận của ARC, một hệ thống điều khiển đơn giản sẽ làm rõ hơn những hạn chế của mô hình và giúp việc so sánh các mô hình công bằng hơn. Ngược lại, các nhà phát triển thương mại tối ưu hóa hệ thống điều khiển theo tính năng và đặc điểm riêng của từng mô hình.

Trong lĩnh vực trò chơi, GPT‑5.6 Sol đã chinh phục Pokémon FireRed bằng hệ thống điều khiển chỉ dùng thị giác (do GPT_Plays_Pokemon(mở trong cửa sổ mới) phát trực tiếp), Slay the Spire bằng khả năng sử dụng máy tính của Codex (do EpochAI(mở trong cửa sổ mới) phát trực tiếp) và các màn đầu của Baba Is You (do Piotr Migdał & Piotr Grabowski(mở trong cửa sổ mới) chia sẻ). ARC-AGI-3 có gì khác biệt đến vậy?

GPT-5.6 Sol trong Codex hoàn thành một thử thách hằng ngày ngẫu nhiên của Slay the Spire 2.

Ethan Mollick trình diễn(mở trong cửa sổ mới) GPT‑5.6 Sol trong Codex chinh phục một thử thách hằng ngày ngẫu nhiên của Slay the Spire 2, trò chơi phát hành sau thời điểm giới hạn kiến thức của GPT‑5.6 Sol.

Lấy cảm hứng từ phân tích của ARC về những hạn chế của GPT‑5.5(mở trong cửa sổ mới), chúng tôi đã xem xét một số lần thử của GPT‑5.6 Sol. Giống như ARC, chúng tôi nhận thấy mô hình có vẻ không mấy thông minh. Mô hình mất rất nhiều thời gian cho từng hành động nhưng vẫn khó tiến triển.

Nhưng khi tìm hiểu sâu hơn, chúng tôi phát hiện phần lớn sự lúng túng không bắt nguồn từ bản thân mô hình mà từ các chế độ cài đặt của hệ thống điều khiển.

Trước tiên, chúng tôi nhận thấy toàn bộ suy luận riêng tư đều bị loại bỏ sau mỗi hành động trong trò chơi. Điều này có nghĩa là sau mỗi hành động, GPT‑5.6 Sol lại phải tìm hiểu trò chơi từ đầu vì không thể nhớ quá trình suy nghĩ trước đó. Mô hình vẫn có thể xem bản ghi các nước đi trước đây cùng những ghi chú ngắn, nhưng không thể thấy các kế hoạch, nhận định hay suy nghĩ dẫn đến chúng.

Thứ hai, chúng tôi nhận thấy hệ thống điều khiển dùng cửa sổ cắt bớt cuốn chiếu, khiến các hành động cũ dần biến mất khi lịch sử dài ra. Vì vậy, GPT‑5.6 Sol không chỉ không thể nhớ suy nghĩ trước đây mà còn dần quên cả những hành động đã thực hiện.

Hai đặc điểm này của hệ thống điều khiển—loại bỏ suy luận và cắt bớt cuốn chiếu—giúp lý giải vì sao GPT‑5.6 Sol gặp khó khăn khi học hỏi theo thời gian.

Tác nhân hoạt động hiệu quả nhất khi nhớ được những gì mình đã làm

Các mô hình của chúng tôi được huấn luyện để suy nghĩ bằng những thông điệp suy luận riêng tư trước khi đưa ra câu trả lời hoặc lệnh gọi công cụ. Những thông điệp suy nghĩ riêng tư này được lưu lại trong lịch sử hội thoại. Nếu cuộc hội thoại trở nên quá dài, chúng tôi sẽ tóm tắt rồi tiếp tục.

Sơ đồ minh họa cách suy luận của mô hình, lệnh gọi công cụ, lịch sử hội thoại và Nén ngữ cảnh phối hợp trong một tác vụ kéo dài.

Đây vừa là cách huấn luyện các mô hình, vừa là cách chúng được triển khai trong ChatGPT và Codex. Để mô phỏng sát hơn cấu hình vận hành thực tế, chúng tôi đã triển khai hệ thống điều khiển ARC-AGI-3 bằng API Responses(mở trong cửa sổ mới). API của chúng tôi giúp việc quản lý ngữ cảnh trở nên dễ dàng: với GPT‑5.6, thao tác truyền ID của phản hồi trước sẽ tự động duy trì suy luận qua các lượt và lệnh gọi công cụ.

Khi duy trì suy luận, chúng tôi nhận thấy hai thay đổi lớn. Thứ nhất, GPT‑5.6 Sol dành ít thời gian suy nghĩ hơn trước mỗi hành động vì không còn phải tìm hiểu lại trò chơi từ đầu ở mỗi lượt. Thứ hai, khi có thể nhớ lại những suy nghĩ trước đây, GPT‑5.6 Sol học hỏi theo thời gian hiệu quả hơn nhiều và biết vận dụng các chiến lược nhất quán.

Cải tiến tiếp theo đến từ việc thay thế cơ chế cắt bớt cuốn chiếu bằng Nén ngữ cảnh(mở trong cửa sổ mới), một chế độ cài đặt khác trong API Responses.

Hệ thống điều khiển ARC-AGI-3 xử lý giới hạn ngữ cảnh bằng cơ chế cắt bớt cuốn chiếu. Khi ngữ cảnh hội thoại vượt quá 175.000 ký tự, các thông điệp cũ nhất sẽ bị loại bỏ.

Cơ chế cắt bớt cuốn chiếu có hai nhược điểm. Thứ nhất, mô hình mất các quan sát và hành động trước đó. Thứ hai, trong phần lớn thời gian thực hiện tác vụ, mô hình phải hoạt động với cửa sổ ngữ cảnh gần đầy, điều này có thể làm giảm nhẹ hiệu suất.

Khi chúng tôi bật Nén ngữ cảnh trên ARC-AGI-3, GPT‑5.6 Sol duy trì tốt hơn những gì đã học về từng trò chơi trong các phiên chạy dài, đồng thời đạt điểm cao hơn với ít token đầu ra hơn.

Để minh họa tác dụng của việc duy trì suy luận và bật Nén ngữ cảnh, dưới đây là ảnh động cho thấy GPT‑5.6 Sol sử dụng cửa sổ ngữ cảnh 175K như thế nào khi giải một loạt câu đố ARC-AGI-3 bằng từng hệ thống điều khiển.

Hai cột ở giữa minh họa cách mỗi hệ thống điều khiển sử dụng cửa sổ ngữ cảnh của mô hình theo cách khác nhau. Nhờ ghi nhớ tốt hơn những gì đã xảy ra, GPT‑5.6 Sol suy nghĩ ít hơn cho mỗi hành động và tiến triển nhanh hơn nhiều. Lưu ý: cách triển khai của chúng tôi đặt giới hạn ở 175.000 token thay vì ký tự, nhưng kết quả khá tương đồng vì phần lớn văn bản là các lưới hành động được bộ tách token của chúng tôi mã hóa theo tỷ lệ 1:1.

Kết hợp lại, việc duy trì suy luận và Nén ngữ cảnh giúp GPT‑5.6 Sol (Max) đạt điểm cao hơn khoảng 3 lần với số token đầu ra ít hơn 6 lần.

Kết luận và khuyến nghị

Chúng tôi hy vọng các thử nghiệm này nhắc chúng ta rằng phép đánh giá hiếm khi chỉ đo lường riêng mô hình—chúng còn phản ánh một loạt lựa chọn khó thấy hơn về chế độ cài đặt API, thiết kế hệ thống điều khiển và câu lệnh. Đây không phải lần đầu điểm thấp trên một bài đánh giá công khai khiến chúng tôi bất ngờ, để rồi phát hiện trình chạy đánh giá đang dùng một hệ thống điều khiển tổng quát loại bỏ các thông điệp suy luận.

Nếu bạn là nhà phát triển API muốn tối đa hóa hiệu suất, chúng tôi khuyên bạn dùng chính những chế độ cài đặt đang được triển khai trong các sản phẩm của chúng tôi:

  • Sử dụng API Responses, không dùng API Chat Completions cũ
  • Duy trì suy luận
  • Sử dụng Nén ngữ cảnh

Nếu đang so sánh các mô hình, chúng tôi khuyên bạn dựa vào những phép đánh giá sử dụng các chế độ cài đặt trên, vì chúng phản ánh sát nhất cách dùng thực tế trong ChatGPT và Codex.

Chúng tôi cảm ơn ARC vì nhiều năm sáng tạo trong công tác đánh giá AGI, cũng như bài phân tích đã thôi thúc chúng tôi xem xét kỹ hơn vấn đề này.

Nếu muốn tự thử sức với các mô hình tiên phong, hãy chơi những trò chơi công khai tại arcprize.org/tasks(mở trong cửa sổ mới).

Tác giả

Ilan Bigio, Ted Sanders