GPT-6.1Sol
Trí thông minh gần ngang Astra với giá chỉ bằng một phần năm, duy trì hiệu năng tiên phong
Chúng tôi giới thiệu GPT‑6.1 Sol, bản nâng cấp của GPT‑6 Sol với hiệu năng đặc biệt mạnh mẽ trong lập trình tác nhân, sử dụng máy tính và công việc chuyên môn. Mô hình đưa Sol đến gần GPT‑6 Astra hơn trong các tác vụ khó, với giá token đầu vào và đầu ra chỉ bằng một phần năm mức giá tiêu chuẩn của Astra, giúp nhà phát triển có thêm dư địa xây dựng và vận hành tác nhân mạnh mẽ trong cùng ngân sách.
GPT‑6.1 Sol mang đến hiệu năng gần ngang Astra với mức giá của Sol, trở thành mô hình có tỷ lệ hiệu năng trên chi phí tốt nhất hiện nay. Đầu vào lưu trong bộ nhớ đệm chỉ có giá 0,10 USD mỗi triệu token—giảm 95% so với giá đầu vào tiêu chuẩn—giúp tiết kiệm hơn cho khối lượng công việc của tác nhân cần tái sử dụng ngữ cảnh qua nhiều yêu cầu.
GPT‑6 Astra vẫn là mô hình tiên phong có năng lực tổng thể cao nhất của chúng tôi. GPT‑6.1 Sol mang đến sự cân bằng mới giữa năng lực và chi phí cho những công việc quan trọng mà người dùng muốn thực hiện thường xuyên hơn, cũng như cho khách hàng API xây dựng và vận hành ứng dụng ở quy mô lớn.

GPT‑6.1 Sol cải thiện đáng kể so với GPT‑6 Sol trong các công việc chuyên môn phức tạp, từ viết và gỡ lỗi mã đến hiểu tài liệu và thực hiện quy trình nghiệp vụ nhiều bước. Trong một số bài đánh giá này, mô hình đạt hiệu năng gần ngang GPT‑6 Astra với chi phí thấp hơn đáng kể.
Trên DeepSWE v1.1, bài đánh giá các tác vụ kỹ thuật phần mềm phức tạp trong cơ sở mã thực tế, GPT‑6.1 Sol ngang bằng GPT‑6 Astra với chi phí khoảng một phần năm, đồng thời vượt điểm số cao nhất của GPT‑6 Sol tới 6,4 điểm phần trăm với mức nỗ lực suy luận và chi phí thấp hơn.
Trong DeepSWE 1.1(mở trong cửa sổ mới), các tác nhân AI giải quyết những tác vụ kỹ thuật phần mềm được thiết kế mới, đòi hỏi nhiều bước thực hiện trong thời gian dài.
Trên GDP.pdf, bài đo độ chính xác khi mô hình trả lời câu hỏi chuyên môn dựa trên tài liệu PDF phức tạp có bảng, biểu đồ, sơ đồ và chi tiết chữ nhỏ, GPT‑6.1 Sol đạt điểm cao hơn Opus 5.5 có cơ chế dự phòng với chi phí mỗi tác vụ chưa bằng một nửa ở các thiết lập suy luận được thử nghiệm. Mô hình cũng tiến gần hiệu năng hàng đầu của GPT‑6 Astra với chi phí mỗi tác vụ khoảng một phần năm.
Trong GDP.pdf(mở trong cửa sổ mới), các mô hình phải trả lời những yêu cầu thực tế về các tệp PDF phức tạp lấy từ quy trình làm việc chuyên môn trong lĩnh vực tài chính, y tế, pháp lý và bảy lĩnh vực chuyên môn khác.
Trên AutomationBench, bài đo khả năng hoàn thành chính xác quy trình nghiệp vụ nhiều bước của tác nhân, GPT‑6.1 Sol đạt điểm cao hơn Opus 5.5 tới 2,2 điểm phần trăm ở mức nỗ lực suy luận Vừa, với chi phí khoảng một phần ba. Điểm số này cũng cao hơn GPT‑6 Sol 4,8 điểm phần trăm ở cùng thiết lập.
In AutomationBench 1.0.6(mở trong cửa sổ mới), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol cũng tiến bộ đáng kể trong các tác vụ đòi hỏi tương tác với ứng dụng trên máy tính. Trên bộ ngoại tuyến của OSWorld 2.0, bài đánh giá tác nhân qua các quy trình sử dụng máy tính phức tạp, GPT‑6.1 Sol vượt GPT‑6 Sol bảy điểm phần trăm ở mức nỗ lực suy luận tối đa với chi phí chưa bằng một nửa. Mô hình chỉ kém Astra 2,1 điểm phần trăm ở mức nỗ lực suy luận tối đa, với chi phí mỗi tác vụ khoảng một phần bảy.
In OSWorld 2.0(mở trong cửa sổ mới), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Trên Terminal-Bench Science 0.1, bài đánh giá quy trình khoa học gồm phân tích dữ liệu, mô phỏng và chứng minh định lý, GPT‑6.1 Sol đạt điểm hơn gấp đôi GPT‑6 Sol ở mức nỗ lực suy luận tối đa với chi phí mỗi tác vụ chưa bằng một nửa. Ở mức nỗ lực tối đa, GPT‑6.1 Sol có chi phí trung bình 5,47 USD mỗi tác vụ, so với 23,21 USD ở Opus 5.5 và 23,80 USD ở Astra, mang lại năng lực khoa học mạnh mẽ với chi phí thấp hơn cả hai mô hình trên 75%.
GPT‑6 Astra vẫn đạt điểm cao nhất trong các mô hình được thử nghiệm với 68,1% và nên được dùng cho những tác vụ nghiên cứu khoa học khó nhất.
Trong Terminal-Bench Science 0.1(mở trong cửa sổ mới), các tác nhân hoàn thành quy trình nghiên cứu khoa học bằng mã và công cụ dòng lệnh, bao gồm phân tích dữ liệu, chạy mô phỏng và khớp mô hình với dữ liệu.
GPT‑6.1 Sol cũng cải thiện độ chính xác của thông tin khi xử lý các câu lệnh khó. Ở mức nỗ lực suy luận rất cao, tỷ lệ lỗi sai về thông tin là 4,1%, giảm từ 4,5% của GPT‑6 Sol và gần hơn với mức 4,0% của Astra ở cùng thiết lập, trong khi chi phí mỗi tác vụ thấp hơn Astra khoảng 83%.
Bài đánh giá này đo tỷ lệ câu trả lời có ít nhất một lỗi sai về thông tin trên các cuộc trò chuyện đã loại bỏ thông tin định danh, trong đó người dùng đã báo cáo lỗi của mô hình trước đó. Những câu lệnh được chủ ý chọn vì độ khó này không đại diện cho cách sử dụng thông thường.
Chúng tôi đánh giá độ chính xác của thông tin trên các cuộc trò chuyện ChatGPT đã loại bỏ thông tin định danh, trong đó người dùng đã báo cáo lỗi sai về thông tin của mô hình trước đó. Những cuộc trò chuyện dễ dẫn đến lỗi này không đại diện cho cách sử dụng thông thường, vốn ít gặp lỗi sai về thông tin hơn.
GPT‑6.1 Sol cải thiện đáng kể so với GPT‑6 Sol trong các bài đánh giá mức độ phù hợp với ý định và giá trị của con người, tiến gần hơn đến GPT‑6 Astra.
GPT‑6.1 Sol minh bạch hơn về giới hạn của mình và đáng tin cậy hơn trong việc tôn trọng ý định của người dùng cùng các ràng buộc an toàn. Trong các bài đánh giá khó, mô hình có tỷ lệ lỗi thấp hơn GPT‑6 Sol về việc minh bạch khi công cụ tìm kiếm bị lỗi, tuân thủ hạn chế rõ ràng và tránh kết quả không được cho phép khi thực hiện tác vụ bằng tác nhân. Chúng tôi không ghi nhận nỗ lực vượt qua hệ thống kiểm duyệt an toàn tự động nào, tương tự GPT‑6 Astra và GPT‑6 Sol.
Các bài đánh giá dưới đây chủ ý kiểm tra những tình huống khó và không đo tỷ lệ lỗi trong sử dụng thông thường.
Từ hôm nay, GPT‑6.1 Sol có sẵn cho mọi người dùng Plus, Pro, Business, Enterprise và Edu trong ChatGPT Công việc và Codex. Các mô hình này chưa có trong Trò chuyện. Nhà phát triển cũng có thể truy cập mô hình qua OpenAI API với tên gpt-6.1-sol. Giá API tiêu chuẩn là 2 USD mỗi triệu token đầu vào, 0,10 USD mỗi triệu token đầu vào lưu trong bộ nhớ đệm và 10 USD mỗi triệu token đầu ra.
Đồng thời, chúng tôi ra mắt GPT‑6 Astra Ultrafast, mô hình tiên phong nhanh nhất thế giới với tốc độ gấp tới 8 lần GPT‑6 Astra, cùng với GPT‑6.1 Sol Ultrafast. Các mô hình này có sẵn qua API, cũng như trong ChatGPT Công việc và Codex cho người dùng gói Pro mới có hạn mức sử dụng cao nhất của chúng tôi, với giá 500 USD/tháng. Với GPT‑6.1 Sol Ultrafast, nhà phát triển có thể có được trí thông minh gần ngang Astra với tốc độ gấp tới 8 lần, với chi phí API xấp xỉ GPT‑6 Astra trước đây.
Tác giả
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

