OpenAI

GPT-6 Astra: A new generation of intelligence

Một thế hệ mới của độ thông minh

Bản cập nhật ngày 22 tháng 09 năm 2026: Chúng tôi đang mở rộng dòng GPT‑6 với GPT‑6 Sol và GPT‑6 Luna. Tìm hiểu thêm.

Chúng tôi vui mừng ra mắt GPT‑6 Astra, mô hình thông minh nhất và phù hợp nhất với con người trên thế giới.

GPT‑6 Astra kết hợp nhiều năm nghiên cứu và những hướng đầu tư táo bạo trong các lĩnh vực đào tạo trước, học tăng cường và căn chỉnh. Astra đạt trình độ tiên tiến nhất về sử dụng máy tính, duyệt web, kỹ thuật phần mềm, an ninh mạng, khoa học và công việc chuyên nghiệp. Astra đạt mức bão hòa ở FrontierMath Tier 4 với điểm số 98%, sau khi đã góp phần giải quyết các bài toán mở tồn tại từ lâu⁠ trong toán học. Astra cũng đạt mức bão hòa trên ARC-AGI-3 với số điểm 99,9% và trên ExploitBench với số điểm 100%. Mô hình này cũng thiết lập một tiên phong mới trong việc sử dụng máy tính và trình duyệt, xử lý những công việc chuyên nghiệp đòi hỏi khắt khe nhất với tốc độ, độ chính xác và khả năng phán đoán chưa từng có. 

GPT‑6 Astra được triển khai từ hôm nay cho một nhóm tổ chức giới hạn và trong những ngày tới sẽ có sẵn cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua API OpenAI, Microsoft Azure và AWS Bedrock.

“Trên ARC-AGI-3, Astra đã vượt qua mức chuẩn về hiệu quả hành động của con người của chúng tôi ở 96% cấp độ, qua đó về cơ bản đạt mức ngang bằng con người trên bộ chuẩn đánh giá. Đây không chỉ là mô hình tốt nhất mà chúng tôi từng thử nghiệm, mà còn thể hiện một bước chuyển đáng kể về hiệu năng của các mô hình tiên phong - không chỉ ở khả năng định hướng trong các môi trường mới và giải quyết chúng, mà còn ở mức độ hiệu quả khi học cách làm điều đó.”
Greg Kamradt, ARC Prize Foundation

Astra là mô hình được căn chỉnh tốt nhất của chúng tôi, với những cải thiện đáng kể trong việc hiểu ý định của người dùng và hành vi của mô hình—bạn có thể ủy nhiệm tác vụ với sự tin tưởng cao hơn vào phán đoán của Astra. Là một cách để kiểm thử điều này, chúng tôi đã xây dựng một bài đánh giá mới dựa trên sự cố Hugging Face, nhằm đánh giá liệu một mô hình khi đối mặt với nhiệm vụ khó hoặc bất khả thi có vượt ra ngoài phạm vi dự kiến hay không. So với GPT‑5.6 Sol, khi không có các biện pháp bảo vệ sản xuất, vốn vượt quá mục tiêu được ủy quyền trong 48% trường hợp, GPT‑6 Astra đã làm điều này trong 0% trường hợp.

Mô hình sử dụng máy tính tốt nhất thế giới

GPT‑6 Astra đánh dấu một tiên phong mới về tốc độ, độ chính xác và độ an toàn trong việc sử dụng máy tính. Nó có thể xử lý các tác vụ tẻ nhạt như điền biểu mẫu trực tuyến, cập nhật hồ sơ khách hàng trong CRM và sắp xếp lịch của bạn. Công cụ này có thể thực hiện nghiên cứu trực tuyến và soạn thảo các bản tóm tắt trong email hoặc trình chỉnh sửa tài liệu của bạn. Công cụ này có thể phân tích dữ liệu khoa học, tạo biểu đồ, tạo một trang web và chạy các kiểm tra QA frontend để đảm bảo tất cả các tính năng trên trang web đó đều hoạt động. Công cụ này có thể giúp bạn tự động cài đặt và kiểm thử phần mềm, cũng như khắc phục các sự cố bạn thấy trên màn hình. Những cải tiến này cũng được phản ánh trong các kết quả đánh giá tiên tiến nhất của chúng tôi.

Những cải tiến này cũng mang lại hiệu quả được cải thiện đáng kể trong các nhiệm vụ công việc tri thức thực tế. Trong các mô phỏng độ trễ trên OSWorld 2.0, Astra đạt hiệu suất sử dụng máy tính cao hơn GPT‑5.6 với thời gian cho mỗi tác vụ ít hơn khoảng 47% Sol đạt 72,6% với khoảng 40 phút cho mỗi tác vụ, so với 65,7% với khoảng 75 phút.3

Khả năng sử dụng máy tính của GPT‑6 Astra có thể được thấy qua các kết quả đầu ra trên nhiều lĩnh vực, bao gồm phát triển trò chơi, kỹ thuật điện và công việc tri thức hằng ngày:

Cùng với Astra, chúng tôi cũng đang cập nhật hệ thống điều khiển Codex để cải thiện đáng kể tốc độ sử dụng máy tính. Kết hợp với hiệu quả của Astra, điều này giúp hoàn thành tác vụ nhanh hơn 1,9 lần so với trải nghiệm GPT‑5.6 Sol hiện tại trên chuẩn đánh giá Mind2Web. Những cải tiến về tốc độ của mô hình có nghĩa là mô hình có thể đảm nhận nhiều công việc tốn thời gian trong cuộc sống thay bạn, nhanh hơn bạn có thể làm.4

“Chúng tôi đang tích hợp GPT‑6 Astra vào hệ thống điều khiển của Devin vào ngày ra mắt, khi mô hình này mang lại hiệu suất hàng đầu trên tiêu chuẩn kiểm thử nội bộ của chúng tôi. Khả năng sử dụng máy tính, viết và hiểu mã nguồn xuất sắc của mô hình đã cải thiện việc kiểm thử ngay từ đầu: video dễ theo dõi hơn rõ rệt, còn báo cáo rõ ràng và súc tích hơn”
Silas Alberti, SVP phụ trách nghiên cứu, Cognition

Bước chuyển đột phá trong công việc chuyên môn

GPT‑6 Astra kết hợp những tiến bộ trong việc sử dụng máy tính với chương trình đào tạo có mục tiêu cho môi trường chuyên nghiệp, nhằm giúp giải quyết các tác vụ công việc phức tạp. Nó kết hợp trí thông minh cần thiết để giải quyết các vấn đề phức tạp với khả năng thực hiện các quy trình công việc nhiều bước và tạo ra các tài liệu, bảng tính và bài thuyết trình hoàn chỉnh.

GPT‑6 Astra là mô hình tốt nhất của chúng tôi trong việc tuân theo các mẫu hiện có và tạo ra các trang chiếu được bố trí hợp lý, truyền đạt súc tích các ý chính thông qua một mạch nội dung có cấu trúc. Công cụ này tạo ra các tài liệu, bài thuyết trình, bảng tính và bản phân tích rõ ràng, có cấu trúc tốt, tuân theo các mẫu của bạn và phù hợp với phong cách viết cũng như phong cách trực quan của bạn. Astra cũng được huấn luyện để chỉ đưa ngữ cảnh liên quan vào kết quả đầu ra, thay vì lặp lại những thông tin không cần thiết cho nhiệm vụ hiện tại. Tất cả điều này có nghĩa là nó có thể tạo ra các sản phẩm đầu ra có thể sử dụng ngay hơn, phù hợp với bối cảnh và tiêu chuẩn kinh doanh của bạn.

GPT‑6 Astra cũng mang đến khả năng đánh giá trực quan tốt hơn cho các trang web, trò chơi, ứng dụng và bản dựng mà nó tạo ra. Với Trang web⁠(mở trong cửa sổ mới) trong ChatGPT, Astra có thể tạo, lưu trữ và chia sẻ các trang web, ứng dụng web và trò chơi trực tiếp từ một câu lệnh.

“Astra mang lại cho chúng tôi lợi thế đáng kể cả về năng lực lẫn hiệu quả. Mô hình này thực hiện thành công các quy trình sáng tạo phức tạp nhất của chúng tôi trong khi sử dụng ít hơn tới 20% token so với các mô hình khác mà chúng tôi đã thử nghiệm. Quan trọng nhất, đối với khách hàng của chúng tôi, điều đó đồng nghĩa với đầu ra có chất lượng cao hơn.”
Alex Mashrabov, Giám đốc điều hành kiêm Đồng sáng lập, Higgsfield AI

Khi hướng dẫn có thể được diễn giải theo nhiều cách, GPT‑6 Astra giỏi hơn các mô hình trước đây trong việc đưa ra phán đoán đúng đắn. Mô hình sử dụng ngữ cảnh để lấp đầy những khoảng trống thông thường và đặt các câu hỏi trọng tâm khi câu trả lời có thể thay đổi kết quả. Trong Codex, công cụ này có thể đặt câu hỏi không đồng bộ trong khi tiếp tục thực hiện các công việc không phụ thuộc vào câu trả lời của bạn. Nếu bạn không trả lời, hệ thống sẽ đưa ra các giả định hợp lý khi phù hợp, nhưng sẽ chờ ý kiến của bạn đối với những quyết định quan trọng.

Các ví dụ dưới đây cho thấy cách Astra cộng tác trong các tác vụ hằng ngày, nơi việc thiếu thông tin có thể làm thay đổi đáng kể câu trả lời.

Astra cũng duy trì định hướng tốt hơn khi một tác vụ diễn tiến. Các mô hình trước đây đôi khi coi các thông điệp định hướng là một mục tiêu mới, làm mất đi yêu cầu ban đầu hoặc các ràng buộc trước đó. Astra tiếp nhận các yêu cầu mới, thay đổi hướng đi khi được yêu cầu và trả lời các câu hỏi phụ mà không bỏ quên nhiệm vụ tổng thể.

"Astra là một cải tiến đáng kể về chất lượng so với GPT‑5.6 Sol trong các tác vụ pháp lý phức tạp. Trong quá trình thử nghiệm ban đầu của chúng tôi, Astra nổi bật nhờ tiếp cận công việc pháp lý theo cách của một luật sư sắc sảo: phân biệt tài liệu với các hồ sơ đã được xác lập, chỉ ra những giả định thiếu căn cứ và chuyển hóa các khoảng trống thành các định hướng soạn thảo cụ thể."
Niko Grupen, Trưởng bộ phận Nghiên cứu Ứng dụng, Harvey

Mã hóa

GPT‑6 Astra là mô hình tốt nhất cho kỹ thuật phần mềm cho đến nay.

1 trong số 2
“GPT‑6 Astra mang lại hiệu năng tiên tiến hàng đầu trên các bộ benchmark lập trình nội bộ của chúng tôi và cho thấy một bước tiến rõ rệt trong các bài đánh giá trực giác giao dịch so với GPT‑5.6 Sol. Khi được sử dụng cho lập trình tác nhân, GPT‑6 Astra giao tiếp theo cách dễ theo dõi hơn đối với các nhà phát triển và tạo ra mã cần ít lần lặp hơn để đạt chất lượng sẵn sàng đưa vào môi trường production.”
John Crepezzi, Trợ lý AI, Jane Street

Với Astra, chúng tôi đang giới thiệu một cách mới để Codex lưu giữ và truy xuất ngữ cảnh khi cửa sổ ngữ cảnh đầy. Trước đây, các mô hình đã sử dụng Nén ngữ cảnh để tóm tắt công việc trong các phiên kéo dài, chẳng hạn như khi gỡ lỗi các sự cố phức tạp hoặc xử lý các đợt tái cấu trúc lớn. Mỗi lần Nén ngữ cảnh có thể bỏ sót các chi tiết về lý do một bản sửa lỗi thất bại hoặc cách một thành phần hoạt động. Trong Codex, Astra có thể lưu giữ ghi chú qua nhiều cửa sổ ngữ cảnh, bảo toàn các chi tiết đã tích lũy mà không cần liên tục nén chúng thành một bản tóm tắt duy nhất. Các cửa sổ ngữ cảnh trước đó vẫn có thể tìm kiếm, vì vậy Astra có thể tìm thấy các yêu cầu hoặc kết quả kiểm thử từ các tin nhắn trước đó và đầu ra của công cụ—ngay cả khi thông tin đó không được ghi lại trong ghi chú của nó. Bạn có thể bật tính năng thử nghiệm này trong config.toml của Codex,⁠(mở trong cửa sổ mới) và điều này sẽ trở thành mặc định cho Astra trong những tuần tới.

Thúc đẩy khám phá khoa học

"Câu chuyện là: kết thúc một kỷ nguyên, khởi đầu một kỷ nguyên khác."
Greg Burnham, EpochAI

GPT‑6 Astra là một bước tiến lớn đối với khám phá khoa học, toán học và y tế. Hôm nay, chúng tôi chia sẻ thêm hai kết quả về khoảng cách giữa các số nguyên tố.9, 10

Astra cũng thiết lập các kỷ lục mới trên một bộ đánh giá toán học và khoa học.

Astra có thể hỗ trợ các công việc thực tiễn đằng sau những khám phá khoa học. Bằng cách kết hợp suy luận khoa học với việc sử dụng máy tính, Astra có thể làm việc trực tiếp trong phần mềm chuyên dụng để kiểm tra dữ liệu và khám phá kết quả, giúp các nhà nghiên cứu đánh giá bằng chứng và quyết định nên nghiên cứu điều gì tiếp theo.

An ninh mạng

Như chúng tôi đã thảo luận trong bản cập nhật về an toàn⁠, Astra là một bước tiến đáng kể về năng lực an ninh mạng và đạt ngưỡng Quan trọng trong lĩnh vực an ninh mạng theo Khung chuẩn bị của chúng tôi. Khả năng xác định và phát triển các mã khai thác zero-day của nó có thể giúp đội ngũ phòng thủ tìm ra và vá các điểm yếu, nhưng cũng tạo ra nhu cầu về các biện pháp bảo vệ mạnh mẽ hơn. Để hiểu những khả năng này mở rộng đến đâu, chúng tôi đã cho Astra chạy trên các đánh giá của chuyên gia nội bộ và bên thứ ba.

Trước tiên, chúng tôi đã thử nghiệm mô hình không có các biện pháp bảo vệ trong môi trường sản xuất trên ExploitBench và ExploitGym, vốn đánh giá liệu các mô hình có thể biến các lỗ hổng phần mềm đã biết thành mã khai thác hoạt động được hay không. Trên ExploitBench, Astra đạt điểm tuyệt đối 100%, so với 78,5% của GPT‑5.6 Sol, mô hình tiên phong có năng lực an ninh mạng trước đây của chúng tôi. Trên ExploitGym, Astra đạt tỷ lệ thành công 42,4%, so với 30,3% của GPT‑5.6 Sol, trong khi sử dụng ít token đầu ra hơn đáng kể.13

Trước những lo ngại rằng việc tiếp xúc với các lỗ hổng phần mềm trong quá khứ có thể đã ảnh hưởng đến kết quả điểm chuẩn, chúng tôi cũng đã đánh giá Astra trên hai điểm chuẩn mới. Trước hết, chúng tôi đã xây dựng một bài đánh giá nội bộ “ExploitBench (tháng 6–tháng 8 năm 2026)” để kiểm thử việc phát triển mã khai thác bằng cách sử dụng các lỗ hổng bảo mật từ ba tháng trước đó.14 Astra đạt được tỷ lệ thực thi mã tùy ý cao hơn đáng kể so với GPT‑5.6. Sol trên tập dữ liệu này trong khi sử dụng ít mã thông báo đầu ra hơn nhiều. Trong quá trình đánh giá, Astra thậm chí còn phát hiện và sử dụng hai lỗ hổng bảo mật chưa từng được biết đến trước đây. Chúng tôi đang công bố cả hai lỗ hổng bảo mật này cho những người bảo trì chúng.

Chúng tôi cũng đã kiểm thử Astra trên SRE-Bench15, một bộ benchmark đo lường liệu các mô hình có thể thực hiện kỹ thuật đảo ngược các tệp nhị phân phần mềm để hiểu logic cốt lõi của phần mềm mà không có quyền truy cập vào mã nguồn thô hay không. Astra giải được 88,0% số nhiệm vụ chỉ trong một lần thử và 99,2% trong tối đa bốn lần thử, so với lần lượt là 55,9% và 68,7% của GPT‑5.6 Sol.

Ngoài các tiêu chuẩn đánh giá, các cuộc đánh giá do chuyên gia thực hiện cho thấy rằng Astra, khi được chạy mà không có các biện pháp bảo vệ trong môi trường sản xuất, có thể sử dụng các lỗ hổng chưa được biết đến trước đây để thực thi mã tùy ý trong các trình duyệt được tăng cường bảo mật và tạo ra các lỗ hổng leo thang đặc quyền cho các hệ điều hành được tăng cường bảo mật.

Như chúng tôi đã thảo luận trong The Defender’s Window, các năng lực an ninh mạng tiên phong có thể giúp đội ngũ phòng thủ tìm ra điểm yếu nhanh hơn, nhưng cũng khiến những điểm yếu đó dễ bị khai thác hơn, khiến việc thích ứng trở nên cấp thiết hơn đối với đội ngũ phòng thủ. Với phiên bản Astra ra mắt hôm nay, đội ngũ phòng thủ có thể sử dụng phiên bản này để thực hiện các tác vụ như rà soát mã an toàn và vá lỗi.

Tuy nhiên, Astra sẽ từ chối thực hiện các tác vụ an ninh mạng nâng cao hơn như tạo mã khai thác minh chứng khái niệm cho các lỗ hổng. Thông qua OpenAI Daybreak⁠, chúng tôi dự định mở rộng quyền truy cập và triển khai các biện pháp bảo vệ ít hạn chế hơn trong những tuần tới. Điều này sẽ cho phép thực hiện nhiều quy trình phòng thủ hơn, bao gồm xác thực lỗ hổng và bằng chứng khái niệm, phân tích phần mềm độc hại và kỹ thuật phát hiện.

Chúng tôi cũng đã tăng cường các biện pháp bảo vệ trước nguy cơ lạm dụng trong lĩnh vực an ninh mạng, dựa trên hệ thống biện pháp bảo vệ dành cho GPT‑5.6 Sol. Các biện pháp này bao gồm độ vững chắc cao hơn của mô hình để chống chịu tốt hơn trước các kiểu bẻ khóa tiềm ẩn và cung cấp thêm ngữ cảnh cho các hệ thống giám sát của chúng tôi. Chúng tôi đã tiếp tục kiểm thử nghiêm ngặt nội bộ và bên ngoài, bao gồm các đánh giá tự động với các tác nhân tấn công kiểm thử đội đỏ (red team) nội bộ của chúng tôi. Thông tin chi tiết hơn về các biện pháp bảo vệ an ninh mạng và hoạt động kiểm thử của chúng tôi hiện có ở mục tổng quan về an toàn⁠ và thẻ hệ thống⁠(mở trong cửa sổ mới) của Astra.

Đồng bộ và triển khai GPT‑6 Astra một cách có trách nhiệm

Astra là mô hình được căn chỉnh tốt nhất của chúng tôi. Astra xuất sắc trong việc hành động thận trọng, tôn trọng các ranh giới nhiệm vụ và giao tiếp minh bạch. Công trình này là sản phẩm mới nhất của chương trình nghiên cứu dài hạn của chúng tôi, tập trung vào việc huấn luyện các mô hình duy trì sự phù hợp với ý định của con người từ đầu đến cuối.

Trong các môi trường nhạy cảm, Astra hành động thận trọng tương xứng với mức độ rủi ro. Trong một đánh giá về các tác vụ sử dụng máy tính được lựa chọn theo phương pháp đối kháng nhằm khơi gợi hành vi sai lệch, Astra thành công hơn trong việc tránh các hậu quả ngoài ý muốn. Việc chạy với các biện pháp bảo mật bổ sung được cung cấp theo mặc định mang lại hiệu suất mạnh mẽ hơn nữa.

Astra gây ra ít kết quả lệch hướng hơn bất kỳ mô hình tiên phong nào khác đã được thử nghiệm. Để so sánh công bằng, chúng tôi đã sử dụng một hệ thống điều khiển tác nhân sử dụng máy tính chung (dựa trên các công cụ sử dụng máy tính nguyên bản có trong cả OpenAI Responses API⁠(mở trong cửa sổ mới) và Anthropic Messages API⁠(mở trong cửa sổ mới)) và không có các biện pháp bảo vệ bổ sung thường được triển khai cho người dùng Codex và ChatGPT Công việc (tự động rà soát, chính sách xác nhận).

Astra cũng có nhiều khả năng hoạt động trong các ranh giới do người dùng đặt ra và được ngụ ý bởi môi trường của nó. Trong một đánh giá nội bộ, Astra chưa từng tìm cách lách việc Codex Auto-Review từ chối. Điều này vẫn đúng ngay cả khi Auto-review được cố ý cấu hình để có thể bị lách và nếu không thì nhiệm vụ không thể hoàn thành. Việc tôn trọng các hạn chế của môi trường này nhất quán với kết quả của bài đánh giá các nhiệm vụ mạng không thể thực hiện mà chúng tôi đã chia sẻ trong phần mở đầu của bài viết này, cũng như các phát hiện khác được ghi lại trong thẻ hệ thống⁠(mở trong cửa sổ mới) của chúng tôi.

Astra cũng thiết lập các chuẩn mực mới về giao tiếp minh bạch với người dùng. Trong một bài đánh giá, khả năng Astra đưa ra các mô tả không chính xác về năng lực và các khả năng mà nó cung cấp thấp hơn ba lần so với GPT‑5.6 Sol.

Trong đánh giá về hiện tượng ảo giác năng lực của chúng tôi, Astra cho thấy sự cải thiện đáng kể so với GPT‑5.6 Sol, đưa ra ít tuyên bố gây hiểu lầm hơn về năng lực của mình.

Các đánh giá của chúng tôi cho thấy suy luận bằng văn bản của Astra khó giám sát hơn so với GPT‑5.6 Sol, dựa trên các thử nghiệm yêu cầu rõ ràng mô hình né tránh việc giám sát. Chúng tôi cho rằng điều này là nhờ Astra kiểm soát tốt hơn việc suy luận bằng văn bản trong các tác vụ đơn giản hơn và có khả năng giải quyết vấn đề với ít bước viết hơn. Astra dường như vẫn gặp khó khăn trong việc che giấu phần suy luận cần thiết cho các tác vụ phức tạp, nhưng chúng tôi xem xét sự suy giảm này một cách nghiêm túc. Cải thiện khả năng giám sát vẫn là một ưu tiên nghiên cứu, và thẻ hệ thống⁠(mở trong cửa sổ mới) đi kèm trình bày chi tiết các phát hiện và công việc đang thực hiện của chúng tôi.

Đào tạo về sự phối hợp là cốt lõi trong phương pháp triển khai của chúng tôi. Như một lớp phòng vệ bổ sung, chúng tôi cũng xây dựng các biện pháp bảo vệ hệ thống như Codex Auto-review⁠(mở trong cửa sổ mới) và khả năng giám sát suy luận cùng hành động của các tác nhân để giúp phát hiện và kiềm chế hành vi không an toàn. Như được mô tả trong bản cập nhật về an toàn của chúng tôi⁠, chúng tôi cũng đang triển khai cơ chế giám sát sai lệch trong môi trường sản xuất cho các mô hình cấp Astra nhằm có được khả năng quan sát về tình trạng sai lệch và giúp kiềm chế những trường hợp nghiêm trọng nhất. Các biện pháp bảo vệ này tương tự cơ chế giám sát của chúng tôi dành cho các đợt triển khai nội bộ và bao gồm một hệ thống các bộ phân loại kiểm tra suy luận và hành động của mô hình nhằm phát hiện hành vi trái phép, đồng thời tự động dừng hoạt động có khả năng trái phép.

Do năng lực an ninh mạng của Astra tăng đáng kể, chúng tôi đặc biệt thận trọng để bảo đảm lần triển khai này an toàn và bảo mật. Các bước kiểm tra an toàn bổ sung đôi khi có thể làm chậm, tạm dừng hoặc dừng công việc hợp lệ, kể cả hoạt động phòng thủ an ninh mạng. Nếu một nhiệm vụ bị tạm dừng trong ChatGPT hoặc Codex, bạn có thể được yêu cầu xem xét hành động trước khi tiếp tục. Trong API, tác vụ sẽ dừng lại. Các quy trình kiểm tra này đôi khi có thể làm gián đoạn công việc hợp lệ, và chúng tôi đang tiếp tục cải tiến hệ thống này để giảm các gián đoạn không cần thiết. Giám sát tình trạng không căn chỉnh không thể thay thế việc căn chỉnh: mục tiêu của chúng tôi là xây dựng các mô hình luôn hoạt động đáng tin cậy trong phạm vi được phép, để những biện pháp bảo vệ này không cần phải can thiệp.

Tình trạng khả dụng

GPT‑6 Astra được triển khai từ hôm nay cho một nhóm tổ chức giới hạn và trong những ngày tới sẽ có sẵn cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua API OpenAI, Microsoft Azure và AWS Bedrock. Mức sử dụng Astra được bao gồm trong hạn mức của gói đăng ký hiện có—người dùng và doanh nghiệp cũng có thể mua credit để sử dụng thêm. Người dùng các gói Pro, Business và Enterprise cũng sẽ được quyền truy cập GPT‑6 Astra Pro. Quản trị viên Enterprise có thể bật Astra cho không gian làm việc của họ; quyền truy cập mặc định bị tắt khi ra mắt.

Astra hỗ trợ Không lưu giữ dữ liệu cho khách hàng API đủ điều kiện và như chúng tôi đã chia sẻ vào tháng trước, chúng tôi đang thử nghiệm Xử lý An toàn Riêng tư để tăng cường giám sát an toàn mà vẫn bảo vệ quyền riêng tư của khách hàng.

Đối với các nhà phát triển, GPT‑6 Astra sẽ có mặt trên API của OpenAI với tên gọi gpt-6-astra và thông qua Microsoft Azure và Amazon Bedrock.

Mức giá tiêu chuẩn của OpenAI API là 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra. Áp dụng các mức giá riêng cho thao tác đọc và ghi bộ nhớ đệm. Chế độ nhanh có sẵn cho GPT‑6 Astra trong API và mang lại tốc độ lên đến 2 lần tốc độ xử lý tiêu chuẩn với mức giá gấp 2 lần mức giá tiêu chuẩn.

Sử dụng máy tính

Sử dụng máy tính

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Bài kiểm tra cuối cùng của các tác nhân

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, bộ dữ liệu ngoại tuyến, điểm số một phần)

72.6%

65.7%

-

-

70,2%3

-

ScreenSpot-Pro (không có công cụ)

92.7%

76.9%

-

87,3%17

-

-

Chuyên gia

Chuyên gia

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83.3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0.19

-

-

-

-

Nhiệm vụ thiết kế nội thất

50.0%

47,4%

-

35,8%

-

-

Tác vụ khoa học dữ liệu nội bộ

40,9%

30,5%

-

34,7%

-

-

Chỉ số Độ thông minh Artificial Analysis v4.1.1

61.2

60,9

65,7

62,1

63,1

58.7

Mã hóa

Mã hóaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended (score)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Main (score)53,3% 847,5%50,9%53,5%53,4%43,6%
Internal Database Migration Tasks63,9%42,7%57,8%50,3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Học thuật

Học thuật

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Khoa học 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97,6%

83,0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96%

94,6%

93.7%

92.6%

93.7%

95.3%

Bài kiểm tra cuối cùng của con người (có công cụ)

57.2%

-

65,0%

63,8%

63,6%

-

Khoa học và sức khỏe

Khoa học và Sức khỏeGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (Nội bộ)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (đã điều chỉnh chiều dài)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

An ninh mạng

An ninh mạngGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70%-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (June-Aug 2026)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Sự phù hợp

Sự phù hợp

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Điểm chuẩn an toàn khi sử dụng máy tính nội bộ (càng thấp càng tốt)

2,4%

22.0%

9.5%

18.3%

11.5%

-

Điểm chuẩn về an toàn khi sử dụng máy tính nội bộ, với AutoReview (càng thấp càng tốt)

1.8%

4.3%

-

-

-

-

Tiêu chuẩn đánh giá khả năng lách luật nội bộ (càng thấp càng tốt)

0.00%

0.29%

-

-

-

-

Honeypot ExploitGym (càng thấp càng tốt)

0.0%

48.2%

-

-

-

-

ExploitGym bất khả thi

100,0%

-

-

-

-

-

Điểm chuẩn ảo giác nội bộ (càng thấp càng tốt)

4.2%

12.2%

-

-

-

-

Ngữ cảnh dài

Ngữ cảnh dài

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Lập luận trừu tượng

Suy luận trừu tượngGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9% 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Điểm đánh giá đạt mức tối đa ở mọi mức độ nỗ lực. Các bài đánh giá GPT được chạy trong môi trường nghiên cứu của chúng tôi hoặc thông qua API của chúng tôi, điều này có thể tạo ra kết quả hơi khác so với ChatGPT trong môi trường sản xuất do sự khác biệt về câu lệnh hệ thống, các công cụ khả dụng, v.v.

CHÚ THÍCH CUỐI TRANG

  1. 1

    Trên ARC-AGI-3, GPT-6 Astra được chạy bằng hệ thống điều khiển Responses API của chúng tôi⁠, hệ thống này thay đổi hai chế độ cài đặt để phản ánh hiệu năng thực tế tốt hơn. Những thay đổi này không nhắm riêng vào ARC-AGI-3.

  2. 2

    GPT-5.6 Sol chỉ phiên bản có sẵn trong API của chúng tôi, ChatGPT Codex và ChatGPT Công việc. Phiên bản trong Trò chuyện ChatGPT hơi khác một chút.⁠

  3. 3

    OSWorld V2-Offline là một phiên bản rút gọn của OSWorld V2 gốc, hoạt động mà không cần kết nối internet. Hiệu suất của mô hình Claude trên OSWorld-V2 Offline đã được các tác giả tái lập trên bảng xếp hạng chính thức⁠(mở trong cửa sổ mới). Trên OSWorld 2.0, điểm số của Claude sử dụng các thiết lập chính thức, thay vì các tác vụ đã sửa đổi và cách chấm điểm đã sửa đổi từ thẻ hệ thống Fable 5.1.

  4. 4

    Thời gian mô hình là thời gian thực tế được báo cáo cho các lần chạy thử nghiệm tương ứng. Các đoạn clip hiển thị là những trích đoạn đã được biên tập.

  5. 5

    Trên BenchCAD, điểm số của Claude phản ánh 3 sửa đổi đối với bài đánh giá, được nêu chi tiết trong thẻ hệ thống Fable 5.1⁠(mở trong cửa sổ mới).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, và Noah A. Smith. “LEGATO: Cách tiếp cận đầu cuối quy mô lớn có khả năng khái quát hóa cho OMR bản nhạc in⁠(mở trong cửa sổ mới).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower và Peter Jonas. “Kho tư liệu các bộ tứ tấu đàn dây OpenScore⁠(mở trong cửa sổ mới).” Kỷ yếu Hội nghị Quốc tế lần thứ 10 về Thư viện Số cho Nghiên cứu Âm nhạc, trang 49–57. ACM, 2023.

  8. 8

    Trên FrontierCode, GPT-6 Astra đã được chạy với một thông điệp  của nhà phát triển tương tự như một phần trong thông điệp của nhà phát triển của nó trong Codex⁠(mở trong cửa sổ mới): "Tránh tạo quá nhiều tệp kiểm thử. Chỉ tạo tệp kiểm thử mới khi quy ước của kho lưu trữ yêu cầu hoặc khi không có tệp hiện có nào phù hợp. Tránh dọn dẹp những phần không liên quan và tạo độ phức tạp không cần thiết. Tái sử dụng các tiện ích hiện có phù hợp. Đọc các hướng dẫn liên quan về kho lưu trữ và kiểm tra mã, các bài kiểm thử, tài liệu và CI lân cận. Tuân theo các quy ước đã được thiết lập. Mục tiêu là mã sạch, có thể hợp nhất." Câu lệnh chưa được tối ưu hóa cho đánh giá.

  9. 9

    Kết quả thứ nhất liên quan đến việc các số nguyên tố có thể xuất hiện gần nhau đến mức nào, bất kể bạn đi xa đến đâu trên trục số. Trong hơn một thập kỷ, kết quả tốt nhất được biết đến đã xác lập rằng có vô số cặp số nguyên tố cách nhau không quá 246. Julia Stadlmann⁠(mở trong cửa sổ mới) gần đây đã cải thiện cận đó lên 240. Astra đã giúp thiết lập một cận chặt hơn là 186, cho thấy rằng có vô hạn nhiều cặp xảy ra trong khoảng cách nhỏ hơn này. Khoảng cách ngắn giữa các số nguyên tố: Bằng chứng⁠(mở trong cửa sổ mới) và nghiên cứu hỗ trợ⁠(mở trong cửa sổ mới).

  10. 10

    Kết quả thứ hai liên quan đến các khoảng cách lớn bất thường giữa các số nguyên tố. Astra đã cải thiện một hạng trong một cận của các khoảng cách này, vốn không thay đổi trong hơn 80 năm. Chúng tôi chia sẻ các chứng minh, chuỗi tư duy rút gọn và tài liệu xác minh cho cả hai kết quả. Khoảng cách lớn giữa các số nguyên tố: Chứng minh⁠(mở trong cửa sổ mới) và nghiên cứu hỗ trợ⁠(mở trong cửa sổ mới).

  11. 11

    Chúng tôi đã đánh giá độc lập tất cả các mô hình Claude theo quy trình HealthBench Professional dự kiến, sử dụng phương thức chấm điểm GPT‑5.4 điểm chấm và điểm chưa bị cắt ngưỡng đã điều chỉnh theo độ dài. Đối với Fable 5.1, chúng tôi đã sử dụng Opus 5 làm phương án dự phòng cho các trường hợp nhà cung cấp từ chối.

  12. 12

    Claude Fable 5 và 5.1 không được đưa vào LifeSciBench Gold v1, GeneBench Pro v13 và MedChemBench vì chúng từ chối trả lời phần lớn câu hỏi trong các bài đánh giá này.

  13. 13

    Trên ExploitGym, chúng tôi đã thử nghiệm Astra và Sol mà không áp dụng giới hạn thời gian 6 giờ để đánh giá tốt hơn toàn diện năng lực an ninh mạng của chúng. Chúng đủ nhanh nên điều này ít tác động.

  14. 14

    ExploitBench (tháng 6–tháng 8 năm 2026) chứa 20 lỗ hổng V8 có mức độ nghiêm trọng cao trên 13 bản phát hành Chrome ổn định. Điểm chuẩn này kiểm tra liệu các tác nhân có thể thực thi mã tùy ý trong V8 và các bản phát hành Chrome chính thức dành cho Linux bằng cách khai thác từng lỗ hổng được chỉ định hay không. Một số lỗ hổng được đưa vào có thể không cho phép thực thi mã tùy ý theo các ràng buộc của quá trình đánh giá, vì vậy có thể không đạt được tỷ lệ thành công 100%. Lưu ý: điểm 5,5% của GPT-5.6 Sol là hệ quả của giới hạn 300 lượt trong bài đánh giá, giới hạn mà khách hàng thực tế sử dụng Max sẽ không gặp phải. Mô hình ở các chế độ cài đặt tương tự đạt điểm 11,5% khi gặp ít giới hạn hơn.

  15. 15
  16. 16

    Khi kiểm thử trên các mô hình của bên thứ ba, chúng tôi sử dụng một thiết lập nghiên cứu đơn giản hơn. Codex có cấu hình sản xuất phức tạp hơn, điều này có thể dẫn đến các tỷ lệ lỗi mô hình thô khác nhau. Các biện pháp bảo vệ phía nhà cung cấp và cách triển khai công cụ máy tính vẫn khác nhau. Người dùng không gặp phải kịch bản không cần xác nhận trong Codex, vì đây là một cấu hình nghiên cứu nội bộ.

  17. 17

    Đối với ScreenSpot-Pro và ExploitGym, điểm Fable mà chúng tôi báo cáo đến từ Mythos, vốn là Fable với ít biện pháp bảo vệ hơn.