Một thế hệ mới của độ thông minh
Chúng tôi vui mừng ra mắt GPT‑6 Astra, mô hình thông minh nhất và phù hợp nhất với con người trên thế giới.
GPT‑6 Astra kết hợp nhiều năm nghiên cứu và những hướng đầu tư táo bạo trong các lĩnh vực đào tạo trước, học tăng cường và căn chỉnh. Astra đạt trình độ tiên tiến nhất về sử dụng máy tính, duyệt web, kỹ thuật phần mềm, an ninh mạng, khoa học và công việc chuyên nghiệp. Astra đạt mức bão hòa ở FrontierMath Tier 4 với điểm số 98%, sau khi đã góp phần giải quyết các bài toán mở tồn tại từ lâu trong toán học. Astra cũng đạt mức bão hòa trên ARC-AGI-3 với số điểm 99,9% và trên ExploitBench với số điểm 100%. Mô hình này cũng thiết lập một tiên phong mới trong việc sử dụng máy tính và trình duyệt, xử lý những công việc chuyên nghiệp đòi hỏi khắt khe nhất với tốc độ, độ chính xác và khả năng phán đoán chưa từng có.
GPT‑6 Astra được triển khai từ hôm nay cho một nhóm tổ chức giới hạn và trong những ngày tới sẽ có sẵn cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua API OpenAI, Microsoft Azure và AWS Bedrock.
Astra là mô hình được căn chỉnh tốt nhất của chúng tôi, với những cải thiện đáng kể trong việc hiểu ý định của người dùng và hành vi của mô hình—bạn có thể ủy nhiệm tác vụ với sự tin tưởng cao hơn vào phán đoán của Astra. Là một cách để kiểm thử điều này, chúng tôi đã xây dựng một bài đánh giá mới dựa trên sự cố Hugging Face, nhằm đánh giá liệu một mô hình khi đối mặt với nhiệm vụ khó hoặc bất khả thi có vượt ra ngoài phạm vi dự kiến hay không. So với GPT‑5.6 Sol, khi không có các biện pháp bảo vệ sản xuất, vốn vượt quá mục tiêu được ủy quyền trong 48% trường hợp, GPT‑6 Astra đã làm điều này trong 0% trường hợp.
Mô hình sử dụng máy tính tốt nhất thế giới
GPT‑6 Astra đánh dấu một tiên phong mới về tốc độ, độ chính xác và độ an toàn trong việc sử dụng máy tính. Nó có thể xử lý các tác vụ tẻ nhạt như điền biểu mẫu trực tuyến, cập nhật hồ sơ khách hàng trong CRM và sắp xếp lịch của bạn. Công cụ này có thể thực hiện nghiên cứu trực tuyến và soạn thảo các bản tóm tắt trong email hoặc trình chỉnh sửa tài liệu của bạn. Công cụ này có thể phân tích dữ liệu khoa học, tạo biểu đồ, tạo một trang web và chạy các kiểm tra QA frontend để đảm bảo tất cả các tính năng trên trang web đó đều hoạt động. Công cụ này có thể giúp bạn tự động cài đặt và kiểm thử phần mềm, cũng như khắc phục các sự cố bạn thấy trên màn hình. Những cải tiến này cũng được phản ánh trong các kết quả đánh giá tiên tiến nhất của chúng tôi.
Những cải tiến này cũng mang lại hiệu quả được cải thiện đáng kể trong các nhiệm vụ công việc tri thức thực tế. Trong các mô phỏng độ trễ trên OSWorld 2.0, Astra đạt hiệu suất sử dụng máy tính cao hơn GPT‑5.6 với thời gian cho mỗi tác vụ ít hơn khoảng 47% Sol đạt 72,6% với khoảng 40 phút cho mỗi tác vụ, so với 65,7% với khoảng 75 phút.3
Khả năng sử dụng máy tính của GPT‑6 Astra có thể được thấy qua các kết quả đầu ra trên nhiều lĩnh vực, bao gồm phát triển trò chơi, kỹ thuật điện và công việc tri thức hằng ngày:
Alongside Astra, we are also updating the Codex harness to significantly improve the speed of computer use. Combined with Astra’s efficiency, this translates to a 1.9x faster task completion compared to the current GPT‑5.6 Sol experience, on the Mind2Web benchmark. The model’s improvements on speed mean it can take on many time-consuming life tasks for you, faster than you can.4
Bước chuyển đột phá trong công việc chuyên môn
GPT‑6 Astra kết hợp những tiến bộ trong việc sử dụng máy tính với chương trình đào tạo có mục tiêu cho môi trường chuyên nghiệp, nhằm giúp giải quyết các tác vụ công việc phức tạp. Nó kết hợp trí thông minh cần thiết để giải quyết các vấn đề phức tạp với khả năng thực hiện các quy trình công việc nhiều bước và tạo ra các tài liệu, bảng tính và bài thuyết trình hoàn chỉnh.
GPT‑6 Astra là mô hình tốt nhất của chúng tôi trong việc tuân theo các mẫu hiện có và tạo ra các trang chiếu được bố trí hợp lý, truyền đạt súc tích các ý chính thông qua một mạch nội dung có cấu trúc. Công cụ này tạo ra các tài liệu, bài thuyết trình, bảng tính và bản phân tích rõ ràng, có cấu trúc tốt, tuân theo các mẫu của bạn và phù hợp với phong cách viết cũng như phong cách trực quan của bạn. Astra cũng được huấn luyện để chỉ đưa ngữ cảnh liên quan vào kết quả đầu ra, thay vì lặp lại những thông tin không cần thiết cho nhiệm vụ hiện tại. Tất cả điều này có nghĩa là nó có thể tạo ra các sản phẩm đầu ra có thể sử dụng ngay hơn, phù hợp với bối cảnh và tiêu chuẩn kinh doanh của bạn.
GPT‑6 Astra cũng mang đến khả năng đánh giá trực quan tốt hơn cho các trang web, trò chơi, ứng dụng và bản dựng mà nó tạo ra. Với Trang web(mở trong cửa sổ mới) trong ChatGPT, Astra có thể tạo, lưu trữ và chia sẻ các trang web, ứng dụng web và trò chơi trực tiếp từ một câu lệnh.
Khi hướng dẫn có thể được diễn giải theo nhiều cách, GPT‑6 Astra giỏi hơn các mô hình trước đây trong việc đưa ra phán đoán đúng đắn. Mô hình sử dụng ngữ cảnh để lấp đầy những khoảng trống thông thường và đặt các câu hỏi trọng tâm khi câu trả lời có thể thay đổi kết quả. Trong Codex, công cụ này có thể đặt câu hỏi không đồng bộ trong khi tiếp tục thực hiện các công việc không phụ thuộc vào câu trả lời của bạn. Nếu bạn không trả lời, hệ thống sẽ đưa ra các giả định hợp lý khi phù hợp, nhưng sẽ chờ ý kiến của bạn đối với những quyết định quan trọng.
Các ví dụ dưới đây cho thấy cách Astra cộng tác trong các tác vụ hằng ngày, nơi việc thiếu thông tin có thể làm thay đổi đáng kể câu trả lời.
Astra cũng duy trì định hướng tốt hơn khi một tác vụ diễn tiến. Các mô hình trước đây đôi khi coi các thông điệp định hướng là một mục tiêu mới, làm mất đi yêu cầu ban đầu hoặc các ràng buộc trước đó. Astra tiếp nhận các yêu cầu mới, thay đổi hướng đi khi được yêu cầu và trả lời các câu hỏi phụ mà không bỏ quên nhiệm vụ tổng thể.
Mã hóa
GPT‑6 Astra là mô hình tốt nhất cho kỹ thuật phần mềm cho đến nay.
“GPT‑6 Astra mang lại hiệu năng tiên tiến hàng đầu trên các bộ benchmark lập trình nội bộ của chúng tôi và cho thấy một bước tiến rõ rệt trong các bài đánh giá trực giác giao dịch so với GPT‑5.6 Sol. Khi được sử dụng cho lập trình tác nhân, GPT‑6 Astra giao tiếp theo cách dễ theo dõi hơn đối với các nhà phát triển và tạo ra mã cần ít lần lặp hơn để đạt chất lượng sẵn sàng đưa vào môi trường production.”
"Chúng tôi đã thử nghiệm Astra ở các mức nỗ lực thấp, vừa và cao trên một trong những bài đánh giá thế hệ đầu tiên của mình, và Astra vượt trội đáng kể so với GPT 5.6 Sol. Mức nỗ lực cao hơn mang lại nhiều lần lặp lại hơn trên một bản dựng mới, nhiều bước xác minh hơn thông qua kiểm thử trên trình duyệt và xu hướng thiên về thực thi mã thay vì áp dụng bản vá. Hiểu được cách một mô hình phân bổ nỗ lực giúp chúng tôi mang đến cho hàng triệu nhà phát triển một con đường nhanh hơn, đáng tin cậy hơn từ ý tưởng đến ứng dụng hoạt động.”
Với Astra, chúng tôi đang giới thiệu một cách mới để Codex lưu giữ và truy xuất ngữ cảnh khi cửa sổ ngữ cảnh đầy. Trước đây, các mô hình đã sử dụng Nén ngữ cảnh để tóm tắt công việc trong các phiên kéo dài, chẳng hạn như khi gỡ lỗi các sự cố phức tạp hoặc xử lý các đợt tái cấu trúc lớn. Mỗi lần Nén ngữ cảnh có thể bỏ sót các chi tiết về lý do một bản sửa lỗi thất bại hoặc cách một thành phần hoạt động. Trong Codex, Astra có thể lưu giữ ghi chú qua nhiều cửa sổ ngữ cảnh, bảo toàn các chi tiết đã tích lũy mà không cần liên tục nén chúng thành một bản tóm tắt duy nhất. Các cửa sổ ngữ cảnh trước đó vẫn có thể tìm kiếm, vì vậy Astra có thể tìm thấy các yêu cầu hoặc kết quả kiểm thử từ các tin nhắn trước đó và đầu ra của công cụ—ngay cả khi thông tin đó không được ghi lại trong ghi chú của nó. Bạn có thể bật tính năng thử nghiệm này trong config.toml của Codex,(mở trong cửa sổ mới) và điều này sẽ trở thành mặc định cho Astra trong những tuần tới.
Thúc đẩy khám phá khoa học
Astra có thể hỗ trợ các công việc thực tiễn đằng sau những khám phá khoa học. Bằng cách kết hợp suy luận khoa học với việc sử dụng máy tính, Astra có thể làm việc trực tiếp trong phần mềm chuyên dụng để kiểm tra dữ liệu và khám phá kết quả, giúp các nhà nghiên cứu đánh giá bằng chứng và quyết định nên nghiên cứu điều gì tiếp theo.
An ninh mạng
As we discussed in our safety update, Astra is a significant jump in cyber capabilities and meets the Critical threshold in cybersecurity under our Preparedness Framework. Its ability to identify and develop zero-day exploits can help defenders find and patch weaknesses, but it also creates a need for stronger safeguards. To understand how far these capabilities extend, we ran Astra on internal and third-party expert evaluations.
We first tested the model without production safeguards on ExploitBench and ExploitGym, which evaluate whether models can turn known software vulnerabilities into working exploits. On ExploitBench, Astra achieved a perfect score of 100%, compared with 78.5% for GPT‑5.6 Sol, our previous frontier cyber-capable model. On ExploitGym, Astra reached a 42.4% success rate, compared with 30.3% for GPT‑5.6 Sol, while using substantially fewer output tokens.13
Given concerns that exposure to historical software vulnerabilities may have affected benchmark results, we also evaluated Astra on two novel benchmarks. For one, we built an internal “ExploitBench (June–August 2026)” evaluation to test exploit development using vulnerabilities from the previous three months.14 Astra achieved substantially higher arbitrary code-execution rates than GPT‑5.6 Sol on this dataset while using far fewer output tokens. During the evaluation, Astra even discovered and used two previously unknown zero-day vulnerabilities. We are disclosing both vulnerabilities to their maintainers.
We also tested Astra on SRE-Bench15, a benchmark that measures whether models can reverse engineer software binaries to understand its core logic without access to raw source code. Astra solved 88.0% of tasks in a single attempt and 99.2% within four attempts, compared with 55.9% and 68.7% for GPT‑5.6 Sol, respectively.
Beyond benchmarks, expert-led assessments found that Astra, when run without production safeguards, could use previously unknown vulnerabilities to achieve arbitrary code execution in hardened browsers and create privilege-escalation exploits for hardened operating-systems.
As we discussed in The Defender’s Window, frontier cyber capabilities can help defenders find weaknesses faster, but they also make those weaknesses easier to exploit, raising the urgency for defenders to adapt. With the version of Astra launching today, defenders can use it to complete tasks such as secure code review and patching.
However, Astra will refuse to comply with more advanced cybersecurity tasks such as creating proof-of-concept exploits for vulnerabilities. Through OpenAI Daybreak, we plan to expand access and roll out less restrictive safeguards in the coming weeks. This will enable more defensive workflows, including vulnerability and proof-of-concept validation, malware analysis, and detection engineering.
We have also strengthened our protections against potential cyber misuse, building upon our safeguards stack for GPT‑5.6 Sol. These include stronger model robustness to better withstand potential jailbreaks and more context for our monitoring systems. We have continued rigorous internal and external testing, including automated evaluations with our internal red-teaming attackers. More details about our cyber safeguards and testing are available in the Astra safety overview and system card(mở trong cửa sổ mới)..
Đồng bộ và triển khai GPT‑6 Astra một cách có trách nhiệm
Astra là mô hình được căn chỉnh tốt nhất của chúng tôi. Astra xuất sắc trong việc hành động thận trọng, tôn trọng các ranh giới nhiệm vụ và giao tiếp minh bạch. Công trình này là sản phẩm mới nhất của chương trình nghiên cứu dài hạn của chúng tôi, tập trung vào việc huấn luyện các mô hình duy trì sự phù hợp với ý định của con người từ đầu đến cuối.
Trong các môi trường nhạy cảm, Astra hành động thận trọng tương xứng với mức độ rủi ro. Trong một đánh giá về các tác vụ sử dụng máy tính được lựa chọn theo phương pháp đối kháng nhằm khơi gợi hành vi sai lệch, Astra thành công hơn trong việc tránh các hậu quả ngoài ý muốn. Việc chạy với các biện pháp bảo mật bổ sung được cung cấp theo mặc định mang lại hiệu suất mạnh mẽ hơn nữa.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(mở trong cửa sổ mới) and Anthropic Messages API(mở trong cửa sổ mới)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra cũng có nhiều khả năng hoạt động trong các ranh giới do người dùng đặt ra và được ngụ ý bởi môi trường của nó. Trong một đánh giá nội bộ, Astra chưa từng tìm cách lách việc Codex Auto-Review từ chối. Điều này vẫn đúng ngay cả khi Auto-review được cố ý cấu hình để có thể bị lách và nếu không thì nhiệm vụ không thể hoàn thành. Việc tôn trọng các hạn chế của môi trường này nhất quán với kết quả của bài đánh giá các nhiệm vụ mạng không thể thực hiện mà chúng tôi đã chia sẻ trong phần mở đầu của bài viết này, cũng như các phát hiện khác được ghi lại trong thẻ hệ thống(mở trong cửa sổ mới) của chúng tôi.
Astra additionally sets new marks in transparent user communication. In one evaluation, Astra is three times less likely than GPT‑5.6 Sol to make inaccurate representations about its capabilities and affordances.
Trong đánh giá về hiện tượng ảo giác năng lực của chúng tôi, Astra cho thấy sự cải thiện đáng kể so với GPT‑5.6 Sol, đưa ra ít tuyên bố gây hiểu lầm hơn về năng lực của mình.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(mở trong cửa sổ mới) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(mở trong cửa sổ mới) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Tình trạng khả dụng
GPT‑6 Astra is rolling out today to a limited set of organizations and over the coming days will become available to all ChatGPT Plus, Pro, Business, and Enterprise users, as well as through the OpenAI API, Microsoft Azure, and AWS Bedrock. Astra usage is included within the existing subscription allowances—users and businesses will also be able to purchase credits for additional usage. Users on the Pro, Business, and Enterprise plans will also get access to GPT‑6 Astra Pro. Enterprise administrators can enable Astra for their workspace; access is off by default at launch.
Astra supports Zero Data Retention for eligible API customers, and as we shared last month, we're testing Private Safety Processing to strengthen safety monitoring while preserving customer privacy.
For developers, GPT‑6 Astra will be available in the OpenAI API as gpt-6-astra and through Microsoft Azure and Amazon Bedrock.
OpenAI API Standard pricing is $10 per million input tokens and $50 per million output tokens. Separate rates apply to cache reads and writes. Fast mode is available for GPT‑6 Astra in the API and delivers up to 2x the speed of Standard processing at 2x the Standard price.
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Học thuật
Học thuật | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Khoa học 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 87,8% | 73,2% | - |
GPQA Diamond | 96% | 94,6% | 93.7% | 92.6% | 93.7% | 95.3% |
Bài kiểm tra cuối cùng của con người (có công cụ) | 57.2% | - | 65,0% | 63,8% | 63,6% | - |
Sự phù hợp
Sự phù hợp | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Điểm chuẩn an toàn khi sử dụng máy tính nội bộ (càng thấp càng tốt) | 2,4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
Điểm chuẩn về an toàn khi sử dụng máy tính nội bộ, với AutoReview (càng thấp càng tốt) | 1.8% | 4.3% | - | - | - | - |
Tiêu chuẩn đánh giá khả năng lách luật nội bộ (càng thấp càng tốt) | 0.00% | 0.29% | - | - | - | - |
Honeypot ExploitGym (càng thấp càng tốt) | 0.0% | 48.2% | - | - | - | - |
ExploitGym bất khả thi | 100,0% | - | - | - | - | - |
Điểm chuẩn ảo giác nội bộ (càng thấp càng tốt) | 4.2% | 12.2% | - | - | - | - |
Ngữ cảnh dài
Ngữ cảnh dài | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Lập luận trừu tượng
| Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Điểm đánh giá đạt mức tối đa ở mọi mức độ nỗ lực. Các bài đánh giá GPT được chạy trong môi trường nghiên cứu của chúng tôi hoặc thông qua API của chúng tôi, điều này có thể tạo ra kết quả hơi khác so với ChatGPT trong môi trường sản xuất do sự khác biệt về câu lệnh hệ thống, các công cụ khả dụng, v.v.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(mở trong cửa sổ mới). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(mở trong cửa sổ mới).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(mở trong cửa sổ mới).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(mở trong cửa sổ mới).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(mở trong cửa sổ mới): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(mở trong cửa sổ mới) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(mở trong cửa sổ mới) and supporting research(mở trong cửa sổ mới).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(mở trong cửa sổ mới) and supporting research(mở trong cửa sổ mới).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(mở trong cửa sổ mới).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
