نسل جدیدی از هوشمندی
ما GPT‑۶ Astra، هوشمند ترین و همسو ترین مدل جهان را معرفی میکنیم.
GPT‑۶ Astra سالها پژوهش و سرمایهگذاریهای جسورانه در پیشآموزش، یادگیری تقویتی و همراستایی را گرد هم میآورد. Astra در استفاده از رایانه، مرور وب، مهندسی نرمافزار، امنیت سایبری، علوم و کارهای حرفهای عملکردی در سطح پیشرفتهترین مدلهای موجود دارد. Astra با کسب امتیاز ۹۸٪، FrontierMath Tier 4 را عملاً به سقف میرساند؛ این در حالی است که پیشتر نیز به حل مسائل باز و دیرپای ریاضیات کمک کرده است. Astra همچنین با امتیاز ۹۹.۹٪، ARC-AGI-3 را عملاً به سقف میرساند و در ExploitBench نیز امتیاز ۱۰۰٪ کسب میکند. همچنین، در استفاده از رایانه و مرور وب، مرز تازهای تعیین میکند و دشوارترین کارهای حرفهای را با سرعت، دقت و قضاوتی بیرقیب انجام میدهد.
GPT‑6 Astra امروز برای تعداد محدودی از سازمانها عرضه میشود و طی روزهای آینده برای همهٔ کاربران ChatGPT Plus، Pro، Business و Enterprise و همچنین از طریق OpenAI API، Microsoft Azure و AWS Bedrock در دسترس خواهد بود.
Astra همراستاترین مدل ما است و در درک نیت کاربر و رفتار مدل پیشرفتهای چشمگیری داشته است؛ بنابراین میتوانید با اعتماد بیشتری به قضاوت Astra، وظایف را به آن واگذار کنید. که بررسی میکند آیا مدلی که با وظیفهای دشوار یا ناممکن روبهرو میشود، از محدودهای که برایش در نظر گرفته شده فراتر میرود یا نه. در مقایسه با GPT‑۵.۶ Sol که بدون تدابیر حفاظتی محیط تولید در ۴۸٪ مواقع از هدف مجاز فراتر رفت، GPT‑۶ Astra در ۰٪ موارد چنین کاری کرد.
بهترین مدل جهان برای استفاده از رایانه
GPT‑۶ Astra پیشرو تازهای در سرعت، دقت و ایمنیِ کار با رایانه است. این ابزار میتواند کارهای زمانبر و خسته کنندهای مانند پر کردن فرمهای آنلاین، بروز رسانی سوابق مشتریان در CRM و سازمان دهی تقویم شما را انجام دهد. میتواند پژوهش آنلاین انجام دهد و پیشنویس خلاصهها را در ایمیل یا ویرایشگر سند تان تهیه کند. میتواند دادههای علمی را تحلیل کند، نمودار تولید کند، یک وبسایت ایجاد کرده و بررسیهای تضمین کیفیت فرانت اند را اجراء کند تا مطمئن شود همهٔ قابلیتهای آن سایت کار میکنند. میتواند به شما کمک کند نرم افزار را به صورت خودکار نصب و آزمایش کنید و مشکلاتی را که روی صفحه میبینید عیب یابی کنید. این بهبودها در نتایج ارزیابی پیشرفتهٔ ما نیز بازتاب یافتهاند.
این بهبودها همچنین به افزایش چشمگیر کارایی در وظایف واقعیِ دانشمحور منجر میشوند. در شبیهسازیهای تأخیر در OSWorld ۲.۰، Astra با صرف حدود ۴۷٪ زمان کمتر برای هر وظیفه نسبت به GPT‑۵.۶، عملکرد بهتری در استفاده از رایانه دارد Sol، با کسب امتیاز ۷۲.۶٪ در حدود ۴۰ دقیقه برای هر وظیفه، در مقایسه با ۶۵.۷٪ در حدود ۷۵ دقیقه.3
قابلیتهای استفاده از رایانه در GPT‑۶ Astra را میتوان در خروجیهای حوزههای مختلف، از جمله توسعه بازی، مهندسی برق و کارهای دانشی روزمره مشاهده کرد:
در کنار Astra، ما همچنین چارچوب آزمون Codex را بروز رسانی میکنیم تا سرعت استفاده از رایانه را به طور چشمگیری بهبود دهیم. در ترکیب با بهره وری Astra، این امر در معیار Mind۲Web به تکمیل وظایف با سرعت ۱.۹ برابر نسبت به تجربه فعلی GPT‑۵.۶ Sol منجر میشود. بهبودهای مدل در زمینه سرعت به این معناست که میتواند بسیاری از کارهای زمانبر زندگی را برای شما، سریعتر از آنچه خودتان میتوانید، انجام دهد.
تحولی چشمگیر در کار حرفهای
GPT‑6 Astra پیشرفتهای استفاده از رایانه را با آموزش هدفمند برای محیطهای حرفهای ترکیب میکند تا به انجام وظایف کاری پیچیده کمک کند. این مدل هوشمندی لازم برای مسائل پیچیده را با توانایی اجرای گردشکارهای چندمرحلهای و تولید اسناد، صفحات گسترده و ارائههای پرداختشده و آمادهٔ استفاده ترکیب میکند.
GPT‑۶ Astra بهترین مدل ما برای پیروی از قالبهای موجود و تولید اسلایدهایی با چیدمان مناسب است که نکات کلیدی را با روایتی ساختار یافته و به اختصار منتقل میکنند. این ابزار اسناد، ارائهها، صفحه گستردهها و تحلیلهایی شفاف و خوش ساختار ایجاد میکند که از الگوهای شما پیروی میکنند و با سبک نوشتاری و بصری شما همخوانی دارند. Astra همچنین طوری آموزش دیده است که به طور مشخص فقط زمینهٔ مرتبط را در خروجیها بیاورد، نه اینکه اطلاعاتی را که برای کارِ پیشرو ضروری نیستند تکرار کند. همهٔ اینها به این معناست که میتواند خروجیهایی قابل استفادهتر و آمادهتر تولید کند که با زمینهٔ کسب و کار و استانداردهای شما همخوانی دارند.
GPT‑6 Astra همچنین توان قضاوت بصری بهتری در وبسایتها، بازیها، برنامهها و رندرهایی که میسازد ارائه میدهد. با سایتها(در یک پنجره جدید باز میشود) در ChatGPT، Astra میتواند مستقیماً از طریق یک اعلان وبسایتها، اپلیکیشنهای وب و بازیها را ایجاد، میزبانی و به اشتراک بگذارد.
وقتی دستورالعملها جای تفسیر باقی میگذارند، GPT‑6 Astra در اتخاذ تصمیم درست از مدلهای پیشین بهتر عمل میکند. وقتی دستورالعملها جای تفسیر باقی میگذارند، GPT‑6 Astra در تصمیمگیری درست از مدلهای پیشین بهتر عمل میکند. در Codex، میتواند بهصورت ناهمگام سؤال بپرسد و به کاری که به پاسخ شما وابسته نیست ادامه دهد. اگر پاسخ ندهید، هرجا مناسب باشد با فرضهای معقول کار را پیش میبرد، اما برای تصمیمهای مهمی که پیامد قابلتوجهی دارند منتظر نظر شما میماند.
مثالهای زیر نشان میدهند که Astra چگونه در انجام کارهای روزمرهای با شما همکاری میکند که نبود برخی اطلاعات میتواند پاسخ را بهطور قابلتوجهی تغییر دهد.
Astra همچنین در حفظ جهتگیری، همزمان با تکامل یافتن وظیفه، عملکرد بهتری دارد. مدلهای قبلی گاهی پیامهای راهبری را بهعنوان هدفی جدید تلقی میکردند و درخواست اصلی یا محدودیتهای پیشین را از نظر دور میداشتند. Astra الزامات جدید را در نظر میگیرد، در صورت درخواست مسیر خود را تغییر میدهد و به پرسشهای جانبی پاسخ میدهد، بدون آنکه کار کلی را رها کند.
برنامهنویسی
GPT‑۶ Astra بهترین مدل تا به امروز برای مهندسی نرم افزار است.
«GPT‑6 Astra در بنچمارکهای داخلی کدنویسی ما عملکردی در سطح پیشرفتهترین مدلها ارائه میدهد و در مقایسه با GPT‑5.6 Sol، در ارزیابیهای شهود معاملاتی پیشرفتی آشکار نشان میدهد. هنگام استفاده برای کدنویسی عاملمحور، GPT‑6 Astra به شیوهای ارتباط برقرار میکند که دنبالکردنش برای توسعهدهندگان آسانتر است و کدی تولید میکند که برای رسیدن به کیفیت مناسب برای محیط عملیاتی، به تکرار کمتری نیاز دارد.»
«ما Astra را در سطح تلاش پایین، متوسط و بالا روی یکی از ارزیابی های نسل اول خود آزمایش کردیم و عملکرد آن به طور چشمگیری از GPT ۵.۶ Sol بهتر بود. تلاش بیشتر، تکرارهای بیشتری روی یک ساخت جدید، اعتبار سنجی بیشتر از طریق آزمایش در مرورگر، و گرایش به اجرای کد به جای apply-patch را فراهم میکند. درک اینکه یک مدل چگونه تلاش خود را صرف میکند، راهی است که از طریق آن مسیری سریعتر و قابل اعتمادتر از ایده تا اپلیکیشنِ عملیاتی در اختیار میلیونها سازنده قرار میدهیم.»
با Astra، روش تازهای برای Codex معرفی میکنیم تا وقتی پنجرهٔ زمینه پر میشود، زمینه را حفظ کند و دوباره به آن دسترسی پیدا کند. در گذشته، مدلها برای خلاصهکردن کار در نشستهای طولانی از فشردهسازی استفاده میکردند؛ مثلاً هنگام اشکالزدایی از مسائل پیچیده یا انجام بازآراییهای بزرگ. هر بار فشردهسازی ممکن است جزئیاتی دربارهٔ اینکه چرا یک اصلاح ناموفق بوده یا یک مؤلفه چگونه رفتار میکند، از قلم بیندازد. در Codex، Astra میتواند در چند پنجرهٔ زمینه یادداشت نگه دارد و جزئیات انباشتهشده را بدون اینکه بارها آنها را در یک خلاصهٔ واحد فشرده کند، حفظ کند. پنجرههای زمینهٔ قبلی همچنان قابل جستوجو میمانند؛ بنابراین Astra میتواند الزامات یا نتایج آزمون را از پیامهای قبلی و خروجی ابزارها پیدا کند—حتی اگر آن اطلاعات در یادداشتهایش ثبت نشده باشند. میتوانید این قابلیت آزمایشی را در فایل config.toml مربوط به Codex خود،(در یک پنجره جدید باز میشود) فعال کنید. و طی هفتههای آینده، برای Astra به حالت پیشفرض تبدیل خواهد شد.
پیشبرد اکتشافات علمی
GPT‑۶ Astra پیشرفتی بزرگ برای کشف علمی، ریاضیات و سلامت است. امروز، دو نتیجهٔ دیگر دربارهٔ فاصلههای میان اعداد اول را به اشتراک میگذاریم [WITH LINK]. آسترا همچنین در مجموعهای از ارزیابیهای علمی رکوردهای جدیدی ثبت میکند:
Astra میتواند در کارهای عملیِ زمینهساز کشف علمی کمک کند. با ترکیب استدلال علمی و استفاده از رایانه، میتواند مستقیماً در نرمافزارهای تخصصی کار کند، دادهها را بررسی و نتایج را کاوش کند و به پژوهشگران کمک کند شواهد را ارزیابی کنند و تصمیم بگیرند در گام بعد چه چیزی را بررسی کنند.
امنیت سایبری
Astra تحولی چشمگیر در قابلیتهای امنیت سایبری است. توانایی آن در شناسایی و توسعه اکسپلویتهای روز صفر میتواند به مدافعان کمک کند تا ضعفها را وصله کنند، اما در عین حال نیاز به ساز و کارهای حفاظتی قویتر را نیز ایجاد میکند. برای درک اینکه این قابلیتها تا چه اندازه گستردهاند، از ارزیابیهای تخصصی داخلی و ارزیابیهای تخصصی توسط اشخاص ثالث استفاده کردیم.
ابتدا Astra را روی ExploitBench و ExploitGym آزمایش کردیم؛ این معیارها میسنجند که آیا مدلها میتوانند در کد بیسهای آسیب پذیر به اجرای کد دلخواه دست یابند یا نه.
با توجه به نگرانیهای احتمالی مبنی بر اینکه مواجهه با آسیب پذیریهای نرم افزاری تاریخی ممکن است بر نتایج بنچمارک تأثیر گذاشته باشد، ما همچنین Astra را روی دو بنچمارک جدید ارزیابی کردیم. به عنوان یک نمونه، یک ارزیابی داخلی با نام «ExploitBench (ژوئن–اوت ۲۰۲۶)» ایجاد کردیم تا توسعه اکسپلویت را با استفاده از آسیب پذیریهای سه ماه پیشین آزمایش کنیم. [[fn:۲]] Astra در این مجموعه داده، ضمن استفاده از توکنهای خروجی بسیار کمتر، به نرخ اجراء کد دلخواه بسیار بالاتری نسبت به GPT‑۵.۶ Sol دست یافت. در جریان ارزیابی، Astra دو تکنیک پیش تر ناشناخته برای فرار از سند باکس هیپ Chrome V۸ را کشف کرد و به کار گرفت. ما هر دو آسیب پذیری را به نگه دارندگان آنها اطلاع میدهیم.
ما همچنین Astra را در SRE-Bench آزمایش کردیم؛ معیاری که میسنجد آیا مدلها میتوانند مهندسی معکوس نرم افزارهای دودویی را انجام دهند تا منطق اصلی آنها را درک کنند یا خیر. نویسندگان بنچمارک، نرم افزار را از صفر ساختند و کد منبع آن را خصوصی نگه داشتند. Astra در یک تلاش ۸۸.۰% از وظایف و ظرف چهار تلاش ۹۹.۲% از آنها را حل کرد؛ در مقایسه با ۵۵.۹% و ۶۸.۷% برای GPT‑۵.۶ Sol، به ترتیب.
فراتر از بنچمارکها، ارزیابیهای انجام شده به رهبری کارشناسان نشان داد که Astra میتواند از آسیب پذیریهای پیشتر ناشناخته برای دستیابی به اجراء کد دلخواه در مرورگرهای سخت سازی شده استفاده کند و بهره برداریهای ارتقای سطح دسترسی برای سیستم عاملهای سخت سازی شده ایجاد کند. در مجموع، این نتایج در تصمیم ما مبنی بر اینکه Astra طبق چارچوب آمادگی ما به آستانه بحرانی در امنیت سایبری رسیده است، مؤثر بودند.
همانطور که در پنجره مدافع بحث کردیم، قابلیتهای سایبری پیشرو میتوانند به مدافعان کمک کنند ضعفها را سریعتر پیدا کنند، اما همچنین بهره برداری از آن ضعفها را آسانتر میکنند و فوریتِ سازگاری مدافعان را افزایش میدهند.
در نسخهای از Astra که امروز عرضه میشود، از کارهای دفاعی مهمی مانند بازبینی امنیتی کد، اعمال وصله و مدل سازی تهدید پشتیبانی میکنیم. با این حال، Astra به طور پیش فرض از انجام وظایف پیشرفتهٔ امنیت سایبری مانند کشف اکسپلویت خودداری میکند. از طریق OpenAI Daybreak، در حال ارائه دسترسی با محدودیت کمتر به گروهی آلفا از مدافعان مورد اعتماد امنیت سایبری در برنامه OpenAI Daybreak هستیم. این امر دسترسی به جریانهای کاری دفاعی، از جمله اولویت بندی و اعتبار سنجی آسیب پذیری، تحلیل بد افزار، مهندسی تشخیص و اعتبارسنجی وصله را گسترش میدهد. ما قصد داریم دسترسی را از طریق Daybreak Blue بیش از پیش گسترش دهیم.
ما همچنین با تکیه بر مجموعه تمهیدات حفاظتی خود برای GPT‑۵.۶ Sol، اقدامات حفاظتیمان را در برابر سوء استفاده سایبری بالقوه تقویت کردهایم. این موارد شامل آموزش قویتر برای افزایش تاب آوری مدل در برابر تلاشهای احتمالی برای دور زدن محدودیتها و زمینه بیشتر برای سامانههای نظارتی ما هستند. آزمونهای دقیق داخلی و خارجی، از جمله آزمونهای خودکار با مهاجمان داخلی تیم قرمز خود، را ادامه دادهایم. جزئیات بیشتر درباره تمهیدات حفاظتی سایبری و آزمونهای ما در کارت سیستم Astra و وبلاگ ما در دسترس است.
همسو سازی و استقرار GPT‑۶ Astra به صورت مسئولانه
Astra همراستاترین مدل ما است. Astra در بهکارگیری دقت و احتیاط، رعایت حدود وظایف و برقراری ارتباط شفاف عالی عمل میکند. این کار، تازهترین دستاورد برنامه پژوهشی دیرینه ما است که بر آموزش مدلهایی متمرکز است که از ابتدا تا انتها با نیت انسانی همراستا باقی میمانند.
در محیطهای حساس، Astra با احتیاطی متناسب با میزان ریسک موجود اقدام میکند. در ارزیابیای از وظایف استفاده از رایانه که بهصورت خصمانه برای برانگیختن رفتار نادرست انتخاب شده بودند، Astra در جلوگیری از پیامدهای ناخواسته موفقتر بود. اجرا با تدابیر امنیتی اضافیای که بهصورت پیشفرض ارائه میشدند، عملکردی حتی قویتر به همراه داشت.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(در یک پنجره جدید باز میشود) and Anthropic Messages API(در یک پنجره جدید باز میشود)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra همچنین با احتمال بیشتری در چارچوب محدودیتهایی عمل میکند که کاربر تعیین کرده یا محیط بهطور ضمنی ایجاب میکند. در یک ارزیابی داخلی، Astra هرگز تلاش نکرد رد بازبینی خودکار Codex را دور بزند. این وضعیت حتی زمانی نیز برقرار بود که Auto-review عمداً بهگونهای پیکربندی شده بود که قابل دور زدن باشد و بدون دور زدن آن، تکمیل کار ناممکن بود. این رعایت محدودیتهای محیط با نتایج ارزیابی وظایف سایبری ناممکن ما، که در مقدمه این پست به اشتراک گذاشتیم، و دیگر یافتههای مستندشده در کارت سیستم(در یک پنجره جدید باز میشود) ما همخوانی دارد.
Astra همچنین کاهش چشمگیری در رفتار فریبکارانه نشان میدهد. افرادی که کار را واگذار میکنند، به درک روشنی از قابلیتهای یک مدل و گزارش دهی صادقانه از پیشرفت آن نیاز دارند. این کار یکی از جنبههای صداقت را اندازه گیری میکند؛ کاهش فریب عمدی همچنان تمرکز گسترده تری در کار همراستا سازی ماست.
در ارزیابی ما از توهم گویی درباره قابلیتها، Astra در مقایسه با GPT‑۵.۶ Sol بهبود چشمگیری نشان میدهد و ادعاهای گمراه کننده کمتری درباره قابلیتهای خود مطرح میکند.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(در یک پنجره جدید باز میشود) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(در یک پنجره جدید باز میشود) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
در دسترس بودن
GPT‑۶ Astra امروز برای سازمانها و مشتریان برنامه دسترسی مورد اعتماد ما عرضه میشود و طی چند روز آینده به طور گسترده برای افرادی که مشترک ChatGPT Plus، Pro، Business و Enterprise هستند در دسترس خواهد بود. استفاده از Astra در سقف استفاده فعلی طرحهای Pro با قیمت ۱۰۰ و دلار۲۰۰ و طرح Business با قیمت دلار۱۰۰ گنجانده شده است و هیچ محدودیت تعداد درخواست یا محدودیت اضافی ندارد. افرادی که اشتراک Plus با قیمت دلار۲۰ دارند و مشتریان طرح استاندارد Business میتوانند با محدودیتهای کمتر به GPT‑۶ Astra دسترسی داشته باشند و برای دسترسی بیشتر اعتبار خریداری کنند. مدیران Enterprise میتوانند Astra را برای فضای کاری خود فعال کنند؛ دسترسی در زمان عرضه به طور پیش فرض غیر فعال است.
کاربران Pro Lite، Pro، Business و Enterprise نیز میتوانند از GPT‑۶ Astra در چت استفاده کنند. Astra از عدم ذخیره داده برای مشتریان واجد شرایط API پشتیبانی میکند و همان طور که ماه گذشته اعلام کردیم، در حال آزمایش پردازش خصوصی ایمنی هستیم تا ضمن حفظ حریم خصوصی مشتریان، پایش ایمنی را تقویت کنیم.
برای توسعه دهندگان، GPT‑۶ Astra با نام gpt-۶-astra در API OpenAI در دسترس است و در AWS Bedrock نیز ارائه میشود. قیمت استاندارد API OpenAI، ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است. برای عملیات خواندن از کش و نوشتن در کش، نرخهای جداگانهای اعمال میشوند. حالت سریع برای GPT‑۶ Astra در API در دسترس است و با ۲ برابر قیمت استاندارد، سرعتی تا ۲.۵ برابر پردازش استاندارد ارائه میدهد.
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
همراستایی
همراستایی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable ۵.۱ | Claude Fable ۵ | Claude Opus ۵ | Gemini 3.8 Flash |
بنچمارک داخلی ایمنی استفاده از رایانه (هرچه کمتر باشد بهتر است) | ۲.۴% | 22.0% | ۹٫۵٪ | 18.3% | 11.5% | - |
معیار ایمنی استفاده داخلی از رایانه، با AutoReview (هرچه کمتر باشد بهتر است) | 1.8٪ | ۴٫۳٪ | - | - | - | - |
بنچمارک داخلیِ دور زدن (هرچه کمتر باشد بهتر است) | 0.00% | 0.29% | - | - | - | - |
هانی پات ExploitGym (هرچه کمتر باشد بهتر است) | 0.0% | 48.2% | - | - | - | - |
Impossible ExploitGym | ۱۰۰.۰٪ | - | - | - | - | - |
بنچمارک داخلی توهم (هرچه کمتر باشد بهتر است) | ۴.۲٪ | ۱۲.۲٪ | - | - | - | - |
متن طولانی
متن طولانی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable ۵.۱ | Claude Fable ۵ | Claude Opus ۵ | Gemini 3.8 Flash |
OpenAI MRCR v2 ۸ سوزن ۲۵۶ هزار–۵۱۲ هزار | ۱۰۰.۰٪ | ۹۱.۵٪ | - | - | - | - |
OpenAI MRCR v2 ۸ سوزن ۵۱۲ هزار–۱ میلیون | ۹۶.۳٪ | ۷۳.۸٪ | - | - | - | - |
استدلال انتزاعی
| Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
امتیازهای ارزیابی در هر سطحی از تلاش، حداکثر هستند. ارزیابیهای GPT در محیط تحقیقاتی ما یا از طریق API ما انجام شدند که ممکن است به دلیل تفاوت در پرامپتهای سیستمی، ابزارهای در دسترس و موارد مشابه، خروجی کمی متفاوت از محیط تولیدی ChatGPT ارائه دهند.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(در یک پنجره جدید باز میشود). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(در یک پنجره جدید باز میشود).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(در یک پنجره جدید باز میشود).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(در یک پنجره جدید باز میشود).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(در یک پنجره جدید باز میشود): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(در یک پنجره جدید باز میشود) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(در یک پنجره جدید باز میشود) and supporting research(در یک پنجره جدید باز میشود).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(در یک پنجره جدید باز میشود) and supporting research(در یک پنجره جدید باز میشود).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(در یک پنجره جدید باز میشود).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
