OpenAI

GPT-6 Astra: A new generation of intelligence

نسل جدیدی از هوشمندی

ما GPT‑۶ Astra، هوشمند ترین و همسو ترین مدل جهان را معرفی می‌کنیم.

GPT‑۶ Astra سال‌ها پژوهش و سرمایه‌گذاری‌های جسورانه در پیش‌آموزش، یادگیری تقویتی و هم‌راستایی را گرد هم می‌آورد. Astra در استفاده از رایانه، مرور وب، مهندسی نرم‌افزار، امنیت سایبری، علوم و کارهای حرفه‌ای عملکردی در سطح پیشرفته‌ترین مدل‌های موجود دارد. Astra با کسب امتیاز ۹۸٪، FrontierMath Tier 4 را عملاً به سقف می‌رساند؛ این در حالی است که پیش‌تر نیز به حل مسائل باز و دیرپای ریاضیات کمک کرده است. Astra همچنین با امتیاز ۹۹.۹٪، ARC-AGI-3 را عملاً به سقف می‌رساند و در ExploitBench نیز امتیاز ۱۰۰٪ کسب می‌کند. همچنین، در استفاده از رایانه و مرور وب، مرز تازه‌ای تعیین می‌کند و دشوارترین کارهای حرفه‌ای را با سرعت، دقت و قضاوتی بی‌رقیب انجام می‌دهد. 

GPT‑6 Astra امروز برای تعداد محدودی از سازمان‌ها عرضه می‌شود و طی روزهای آینده برای همهٔ کاربران ChatGPT Plus، Pro، Business و Enterprise و همچنین از طریق OpenAI API، Microsoft Azure و AWS Bedrock در دسترس خواهد بود.

«در ARC-AGI-3، Astra در 96% از مراحل از خط مبنای کارایی کنش انسانی ما فراتر رفت و عملاً در این بنچمارک به سطح عملکرد انسانی رسید. این نه‌تنها بهترین مدلی است که تاکنون آزمایش کرده‌ایم، بلکه نشان‌دهنده جهشی معنادار در عملکرد مدل‌های پیشرو نیز هست—نه‌فقط در توانایی آن برای پیمایش و حل محیط‌های جدید، بلکه در میزان کارآمدی یادگیری آن برای انجام این کار.»
گرگ کامرادت، بنیاد جایزه ARC

Astra هم‌راستاترین مدل ما است و در درک نیت کاربر و رفتار مدل پیشرفت‌های چشمگیری داشته است؛ بنابراین می‌توانید با اعتماد بیشتری به قضاوت Astra، وظایف را به آن واگذار کنید. که بررسی می‌کند آیا مدلی که با وظیفه‌ای دشوار یا ناممکن روبه‌رو می‌شود، از محدوده‌ای که برایش در نظر گرفته شده فراتر می‌رود یا نه. در مقایسه با GPT‑۵.۶ Sol که بدون تدابیر حفاظتی محیط تولید در ۴۸٪ مواقع از هدف مجاز فراتر رفت، GPT‑۶ Astra در ۰٪ موارد چنین کاری کرد.

بهترین مدل جهان برای استفاده از رایانه

GPT‑۶ Astra پیشرو تازه‌ای در سرعت، دقت و ایمنیِ کار با رایانه است. این ابزار می‌تواند کارهای زمان‌بر و خسته کننده‌ای مانند پر کردن فرم‌های آنلاین، بروز رسانی سوابق مشتریان در CRM و سازمان دهی تقویم شما را انجام دهد. می‌تواند پژوهش آنلاین انجام دهد و پیش‌نویس خلاصه‌ها را در ایمیل یا ویرایشگر سند تان تهیه کند. می‌تواند داده‌های علمی را تحلیل کند، نمودار تولید کند، یک وب‌سایت ایجاد کرده و بررسی‌های تضمین کیفیت فرانت اند را اجراء کند تا مطمئن شود همهٔ قابلیت‌های آن سایت کار می‌کنند. می‌تواند به شما کمک کند نرم افزار را به صورت خودکار نصب و آزمایش کنید و مشکلاتی را که روی صفحه می‌بینید عیب یابی کنید. این بهبودها در نتایج ارزیابی پیشرفتهٔ ما نیز بازتاب یافته‌اند.

این بهبودها همچنین به افزایش چشمگیر کارایی در وظایف واقعیِ دانش‌محور منجر می‌شوند. در شبیه‌سازی‌های تأخیر در OSWorld ۲.۰، Astra با صرف حدود ۴۷٪ زمان کمتر برای هر وظیفه نسبت به GPT‑۵.۶، عملکرد بهتری در استفاده از رایانه دارد Sol، با کسب امتیاز ۷۲.۶٪ در حدود ۴۰ دقیقه برای هر وظیفه، در مقایسه با ۶۵.۷٪ در حدود ۷۵ دقیقه.3

قابلیت‌های استفاده از رایانه در GPT‑۶ Astra را می‌توان در خروجی‌های حوزه‌های مختلف، از جمله توسعه بازی، مهندسی برق و کارهای دانشی روزمره مشاهده کرد:

در کنار Astra، ما همچنین چارچوب آزمون Codex را بروز رسانی می‌کنیم تا سرعت استفاده از رایانه را به طور چشمگیری بهبود دهیم. در ترکیب با بهره وری Astra، این امر در معیار Mind۲Web به تکمیل وظایف با سرعت ۱.۹ برابر نسبت به تجربه فعلی GPT‑۵.۶ Sol منجر می‌شود. بهبودهای مدل در زمینه سرعت به این معناست که می‌تواند بسیاری از کارهای زمانبر زندگی را برای شما، سریع‌تر از آن‌چه خودتان می‌توانید، انجام دهد.

«ما در روز عرضه، GPT‑6 Astra را در چارچوب آزمون Devin ادغام می‌کنیم؛ جایی که در معیار آزمون داخلی ما عملکردی پیشرفته ارائه می‌دهد. توانایی عالی آن در استفاده از رایانه، نگارش و درک پایگاه کد، از همان ابتدا فرایند آزمایش را بهبود داد: ویدئوها به‌طور محسوسی آسان‌تر دنبال می‌شوند و گزارش‌ها شفاف‌تر و مختصرتر هستند»
سیلاس آلبرتی، معاون ارشد پژوهش، Cognition

تحولی چشمگیر در کار حرفه‌ای

GPT‑6 Astra پیشرفت‌های استفاده از رایانه را با آموزش هدفمند برای محیط‌های حرفه‌ای ترکیب می‌کند تا به انجام وظایف کاری پیچیده کمک کند. این مدل هوشمندی لازم برای مسائل پیچیده را با توانایی اجرای گردش‌کارهای چندمرحله‌ای و تولید اسناد، صفحات گسترده و ارائه‌های پرداخت‌شده و آمادهٔ استفاده ترکیب می‌کند.

GPT‑۶ Astra بهترین مدل ما برای پیروی از قالب‌های موجود و تولید اسلایدهایی با چیدمان مناسب است که نکات کلیدی را با روایتی ساختار یافته و به اختصار منتقل می‌کنند. این ابزار اسناد، ارائه‌ها، صفحه گسترده‌ها و تحلیل‌هایی شفاف و خوش ساختار ایجاد می‌کند که از الگوهای شما پیروی می‌کنند و با سبک نوشتاری و بصری شما همخوانی دارند. Astra همچنین طوری آموزش دیده است که به طور مشخص فقط زمینهٔ مرتبط را در خروجی‌ها بیاورد، نه اینکه اطلاعاتی را که برای کارِ پیش‌رو ضروری نیستند تکرار کند. همهٔ این‌ها به این معناست که می‌تواند خروجی‌هایی قابل استفاده‌تر و آماده‌تر تولید کند که با زمینهٔ کسب و کار و استانداردهای شما همخوانی دارند.

GPT‑6 Astra همچنین توان قضاوت بصری بهتری در وب‌سایت‌ها، بازی‌ها، برنامه‌ها و رندرهایی که می‌سازد ارائه می‌دهد. با سایت‌ها(در یک پنجره جدید باز می‌شود) در ChatGPT، Astra می‌تواند مستقیماً از طریق یک اعلان وب‌سایت‌ها، اپلیکیشن‌های وب و بازی‌ها را ایجاد، میزبانی و به اشتراک بگذارد.

«Astra از نظر توانمندی و کارایی، مزیت چشمگیری برای ما فراهم می‌کند. این مدل پیچیده ترین گردش کارهای خلاقانهٔ ما را با موفقیت اجراء می‌کند، در حالی که نسبت به سایر مدل‌هایی که آزمایش کرده‌ایم تا ۲۰٪ توکن کمتر مصرف می‌کند. مهم‌تر از همه، برای مشتریان ما به معنای خروجی با کیفیت بالاتر است.»
Alex Mashrabov، مدیرعامل و هم بنیان گذار، Higgsfield AI

وقتی دستورالعمل‌ها جای تفسیر باقی می‌گذارند، GPT‑6 Astra در اتخاذ تصمیم درست از مدل‌های پیشین بهتر عمل می‌کند. وقتی دستورالعمل‌ها جای تفسیر باقی می‌گذارند، GPT‑6 Astra در تصمیم‌گیری درست از مدل‌های پیشین بهتر عمل می‌کند. در Codex، می‌تواند به‌صورت ناهمگام سؤال بپرسد و به کاری که به پاسخ شما وابسته نیست ادامه دهد. اگر پاسخ ندهید، هرجا مناسب باشد با فرض‌های معقول کار را پیش می‌برد، اما برای تصمیم‌های مهمی که پیامد قابل‌توجهی دارند منتظر نظر شما می‌ماند.

مثال‌های زیر نشان می‌دهند که Astra چگونه در انجام کارهای روزمره‌ای با شما همکاری می‌کند که نبود برخی اطلاعات می‌تواند پاسخ را به‌طور قابل‌توجهی تغییر دهد.

Astra همچنین در حفظ جهت‌گیری، همزمان با تکامل یافتن وظیفه، عملکرد بهتری دارد. مدل‌های قبلی گاهی پیام‌های راهبری را به‌عنوان هدفی جدید تلقی می‌کردند و درخواست اصلی یا محدودیت‌های پیشین را از نظر دور می‌داشتند. Astra الزامات جدید را در نظر می‌گیرد، در صورت درخواست مسیر خود را تغییر می‌دهد و به پرسش‌های جانبی پاسخ می‌دهد، بدون آنکه کار کلی را رها کند.

«Astra در وظایف حقوقی پیچیده، نسبت به GPT‑۵.۶ Sol بهبود چشمگیری در کیفیت ارائه می‌دهد. در آزمایش‌های اولیهٔ ما، آسترا با رویکردی به کار حقوقی که یک وکیل نکته سنج در پیش می‌گیرد، برجسته شد: اسناد را از سوابق تثبیت شده تفکیک می‌کند، مفروضات بی پشتوانه را آشکار می‌سازد، و خلأها را به مواضع مشخص در تنظیم پیش نویس تبدیل می‌کند.»
نیکو گروپن، رئیس پژوهش‌های کاربردی، Harvey

برنامه‌نویسی

GPT‑۶ Astra بهترین مدل تا به امروز برای مهندسی نرم افزار است.

1 از 2
«GPT‑6 Astra در بنچمارک‌های داخلی کدنویسی ما عملکردی در سطح پیشرفته‌ترین مدل‌ها ارائه می‌دهد و در مقایسه با GPT‑5.6 Sol، در ارزیابی‌های شهود معاملاتی پیشرفتی آشکار نشان می‌دهد. هنگام استفاده برای کدنویسی عامل‌محور، GPT‑6 Astra به شیوه‌ای ارتباط برقرار می‌کند که دنبال‌کردنش برای توسعه‌دهندگان آسان‌تر است و کدی تولید می‌کند که برای رسیدن به کیفیت مناسب برای محیط عملیاتی، به تکرار کمتری نیاز دارد.»
جان کرپزی، دستیارهای هوش مصنوعی، Jane Street

با Astra، روش تازه‌ای برای Codex معرفی می‌کنیم تا وقتی پنجرهٔ زمینه پر می‌شود، زمینه را حفظ کند و دوباره به آن دسترسی پیدا کند. در گذشته، مدل‌ها برای خلاصه‌کردن کار در نشست‌های طولانی از فشرده‌سازی استفاده می‌کردند؛ مثلاً هنگام اشکال‌زدایی از مسائل پیچیده یا انجام بازآرایی‌های بزرگ. هر بار فشرده‌سازی ممکن است جزئیاتی دربارهٔ اینکه چرا یک اصلاح ناموفق بوده یا یک مؤلفه چگونه رفتار می‌کند، از قلم بیندازد. در Codex، Astra می‌تواند در چند پنجرهٔ زمینه یادداشت نگه دارد و جزئیات انباشته‌شده را بدون اینکه بارها آن‌ها را در یک خلاصهٔ واحد فشرده کند، حفظ کند. پنجره‌های زمینهٔ قبلی همچنان قابل جست‌وجو می‌مانند؛ بنابراین Astra می‌تواند الزامات یا نتایج آزمون را از پیام‌های قبلی و خروجی ابزارها پیدا کند—حتی اگر آن اطلاعات در یادداشت‌هایش ثبت نشده باشند. می‌توانید این قابلیت آزمایشی را در فایل config.toml مربوط به Codex خود،(در یک پنجره جدید باز می‌شود) فعال کنید. و طی هفته‌های آینده، برای Astra به حالت پیش‌فرض تبدیل خواهد شد.

پیشبرد اکتشافات علمی

«داستان این است: پایان یک دوران، آغاز دورانی دیگر.»
گرگ برنهام، EpochAI

GPT‑۶ Astra پیشرفتی بزرگ برای کشف علمی، ریاضیات و سلامت است. امروز، دو نتیجهٔ دیگر دربارهٔ فاصله‌های میان اعداد اول را به اشتراک می‌گذاریم [WITH LINK]. آسترا همچنین در مجموعه‌ای از ارزیابی‌های علمی رکوردهای جدیدی ثبت می‌کند:

Astra می‌تواند در کارهای عملیِ زمینه‌ساز کشف علمی کمک کند. با ترکیب استدلال علمی و استفاده از رایانه، می‌تواند مستقیماً در نرم‌افزارهای تخصصی کار کند، داده‌ها را بررسی و نتایج را کاوش کند و به پژوهشگران کمک کند شواهد را ارزیابی کنند و تصمیم بگیرند در گام بعد چه چیزی را بررسی کنند.

امنیت سایبری

Astra تحولی چشمگیر در قابلیت‌های امنیت سایبری است. توانایی آن در شناسایی و توسعه اکسپلویت‌های روز صفر می‌تواند به مدافعان کمک کند تا ضعف‌ها را وصله کنند، اما در عین حال نیاز به ساز و کارهای حفاظتی قوی‌تر را نیز ایجاد می‌کند. برای درک اینکه این قابلیت‌ها تا چه اندازه گسترده‌اند، از ارزیابی‌های تخصصی داخلی و ارزیابی‌های تخصصی توسط اشخاص ثالث استفاده کردیم.

ابتدا Astra را روی ExploitBench و ExploitGym آزمایش کردیم؛ این معیارها می‌سنجند که آیا مدل‌ها می‌توانند در کد بیس‌های آسیب پذیر به اجرای کد دلخواه دست یابند یا نه.

با توجه به نگرانی‌های احتمالی مبنی بر اینکه مواجهه با آسیب پذیری‌های نرم افزاری تاریخی ممکن است بر نتایج بنچمارک تأثیر گذاشته باشد، ما همچنین Astra را روی دو بنچمارک جدید ارزیابی کردیم. به عنوان یک نمونه، یک ارزیابی داخلی با نام «ExploitBench (ژوئن–اوت ۲۰۲۶)» ایجاد کردیم تا توسعه اکسپلویت را با استفاده از آسیب پذیری‌های سه ماه پیشین آزمایش کنیم. [[fn:۲]] Astra در این مجموعه داده، ضمن استفاده از توکن‌های خروجی بسیار کمتر، به نرخ اجراء کد دلخواه بسیار بالاتری نسبت به GPT‑۵.۶ Sol دست یافت. در جریان ارزیابی، Astra دو تکنیک پیش تر ناشناخته برای فرار از سند باکس هیپ Chrome V۸ را کشف کرد و به کار گرفت. ما هر دو آسیب پذیری را به نگه دارندگان آن‌ها اطلاع می‌دهیم.

ما همچنین Astra را در SRE-Bench آزمایش کردیم؛ معیاری که می‌سنجد آیا مدل‌ها می‌توانند مهندسی معکوس نرم افزارهای دودویی را انجام دهند تا منطق اصلی آن‌ها را درک کنند یا خیر. نویسندگان بنچمارک، نرم افزار را از صفر ساختند و کد منبع آن را خصوصی نگه داشتند. Astra در یک تلاش ۸۸.۰% از وظایف و ظرف چهار تلاش ۹۹.۲% از آن‌ها را حل کرد؛ در مقایسه با ۵۵.۹% و ۶۸.۷% برای GPT‑۵.۶ Sol، به ترتیب.

فراتر از بنچمارک‌ها، ارزیابی‌های انجام شده به رهبری کارشناسان نشان داد که Astra می‌تواند از آسیب پذیری‌های پیش‌تر ناشناخته برای دستیابی به اجراء کد دلخواه در مرورگرهای سخت سازی شده استفاده کند و بهره برداری‌های ارتقای سطح دسترسی برای سیستم عامل‌های سخت سازی شده ایجاد کند. در مجموع، این نتایج در تصمیم ما مبنی بر اینکه Astra طبق چارچوب آمادگی ما به آستانه بحرانی در امنیت سایبری رسیده است، مؤثر بودند.

همان‌طور که در پنجره مدافع بحث کردیم، قابلیت‌های سایبری پیشرو می‌توانند به مدافعان کمک کنند ضعف‌ها را سریع‌تر پیدا کنند، اما همچنین بهره برداری از آن ضعف‌ها را آسان‌تر می‌کنند و فوریتِ سازگاری مدافعان را افزایش می‌دهند.

در نسخه‌ای از Astra که امروز عرضه می‌شود، از کارهای دفاعی مهمی مانند بازبینی امنیتی کد، اعمال وصله و مدل سازی تهدید پشتیبانی می‌کنیم. با این حال، Astra به طور پیش فرض از انجام وظایف پیشرفتهٔ امنیت سایبری مانند کشف اکسپلویت خودداری می‌کند. از طریق OpenAI Daybreak، در حال ارائه دسترسی با محدودیت کمتر به گروهی آلفا از مدافعان مورد اعتماد امنیت سایبری در برنامه OpenAI Daybreak هستیم. این امر دسترسی به جریان‌های کاری دفاعی، از جمله اولویت بندی و اعتبار سنجی آسیب پذیری، تحلیل بد افزار، مهندسی تشخیص و اعتبارسنجی وصله را گسترش می‌دهد. ما قصد داریم دسترسی را از طریق Daybreak Blue بیش از پیش گسترش دهیم.

ما همچنین با تکیه بر مجموعه تمهیدات حفاظتی خود برای GPT‑۵.۶ Sol، اقدامات حفاظتی‌مان را در برابر سوء استفاده سایبری بالقوه تقویت کرده‌ایم. این موارد شامل آموزش قوی‌تر برای افزایش تاب آوری مدل در برابر تلاش‌های احتمالی برای دور زدن محدودیت‌ها و زمینه بیشتر برای سامانه‌های نظارتی ما هستند. آزمون‌های دقیق داخلی و خارجی، از جمله آزمون‌های خودکار با مهاجمان داخلی تیم قرمز خود، را ادامه داده‌ایم. جزئیات بیشتر درباره تمهیدات حفاظتی سایبری و آزمون‌های ما در کارت سیستم Astra و وبلاگ ما در دسترس است.

همسو سازی و استقرار GPT‑۶ Astra به صورت مسئولانه

Astra هم‌راستاترین مدل ما است. Astra در به‌کارگیری دقت و احتیاط، رعایت حدود وظایف و برقراری ارتباط شفاف عالی عمل می‌کند. این کار، تازه‌ترین دستاورد برنامه پژوهشی دیرینه ما است که بر آموزش مدل‌هایی متمرکز است که از ابتدا تا انتها با نیت انسانی هم‌راستا باقی می‌مانند.

در محیط‌های حساس، Astra با احتیاطی متناسب با میزان ریسک موجود اقدام می‌کند. در ارزیابی‌ای از وظایف استفاده از رایانه که به‌صورت خصمانه برای برانگیختن رفتار نادرست انتخاب شده بودند، Astra در جلوگیری از پیامدهای ناخواسته موفق‌تر بود. اجرا با تدابیر امنیتی اضافی‌ای که به‌صورت پیش‌فرض ارائه می‌شدند، عملکردی حتی قوی‌تر به همراه داشت.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(در یک پنجره جدید باز می‌شود) and Anthropic Messages API(در یک پنجره جدید باز می‌شود)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra همچنین با احتمال بیشتری در چارچوب محدودیت‌هایی عمل می‌کند که کاربر تعیین کرده یا محیط به‌طور ضمنی ایجاب می‌کند. در یک ارزیابی داخلی، Astra هرگز تلاش نکرد رد بازبینی خودکار Codex را دور بزند. این وضعیت حتی زمانی نیز برقرار بود که Auto-review عمداً به‌گونه‌ای پیکربندی شده بود که قابل دور زدن باشد و بدون دور زدن آن، تکمیل کار ناممکن بود. این رعایت محدودیت‌های محیط با نتایج ارزیابی وظایف سایبری ناممکن ما، که در مقدمه این پست به اشتراک گذاشتیم، و دیگر یافته‌های مستندشده در کارت سیستم(در یک پنجره جدید باز می‌شود) ما همخوانی دارد.

Astra همچنین کاهش چشمگیری در رفتار فریبکارانه نشان می‌دهد. افرادی که کار را واگذار می‌کنند، به درک روشنی از قابلیت‌های یک مدل و گزارش دهی صادقانه از پیشرفت آن نیاز دارند. این کار یکی از جنبه‌های صداقت را اندازه گیری می‌کند؛ کاهش فریب عمدی همچنان تمرکز گسترده تری در کار همراستا سازی ماست.

در ارزیابی ما از توهم گویی درباره قابلیت‌ها، Astra در مقایسه با GPT‑۵.۶ Sol بهبود چشمگیری نشان می‌دهد و ادعاهای گمراه کننده کمتری درباره قابلیت‌های خود مطرح می‌کند.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(در یک پنجره جدید باز می‌شود) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(در یک پنجره جدید باز می‌شود) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

در دسترس بودن

GPT‑۶ Astra امروز برای سازمان‌ها و مشتریان برنامه دسترسی مورد اعتماد ما عرضه می‌شود و طی چند روز آینده به طور گسترده برای افرادی که مشترک ChatGPT Plus، Pro، Business و Enterprise هستند در دسترس خواهد بود. استفاده از Astra در سقف استفاده فعلی طرح‌های Pro با قیمت ۱۰۰ و دلار۲۰۰ و طرح Business با قیمت دلار۱۰۰ گنجانده شده است و هیچ محدودیت تعداد درخواست یا محدودیت اضافی ندارد. افرادی که اشتراک Plus با قیمت دلار۲۰ دارند و مشتریان طرح استاندارد Business می‌توانند با محدودیت‌های کمتر به GPT‑۶ Astra دسترسی داشته باشند و برای دسترسی بیشتر اعتبار خریداری کنند. مدیران Enterprise می‌توانند Astra را برای فضای کاری خود فعال کنند؛ دسترسی در زمان عرضه به طور پیش فرض غیر فعال است.

کاربران Pro Lite، Pro، Business و Enterprise نیز می‌توانند از GPT‑۶ Astra در چت استفاده کنند. Astra از عدم ذخیره داده برای مشتریان واجد شرایط API پشتیبانی می‌کند و همان طور که ماه گذشته اعلام کردیم، در حال آزمایش پردازش خصوصی ایمنی هستیم تا ضمن حفظ حریم خصوصی مشتریان، پایش ایمنی را تقویت کنیم.

برای توسعه دهندگان، GPT‑۶ Astra با نام gpt-۶-astra در API OpenAI در دسترس است و در AWS Bedrock نیز ارائه می‌شود. قیمت استاندارد API OpenAI، ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است. برای عملیات خواندن از کش و نوشتن در کش، نرخ‌های جداگانه‌ای اعمال می‌شوند. حالت سریع برای GPT‑۶ Astra در API در دسترس است و با ۲ برابر قیمت استاندارد، سرعتی تا ۲.۵ برابر پردازش استاندارد ارائه می‌دهد.

استفاده از کامپیوتر

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

علم و سلامت

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

امنیت سایبری

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

هم‌راستایی

هم‌راستایی

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini 3.8 Flash

بنچمارک داخلی ایمنی استفاده از رایانه (هرچه کمتر باشد بهتر است)

۲.۴%

22.0%

۹٫۵٪

18.3%

11.5%

-

معیار ایمنی استفاده داخلی از رایانه، با AutoReview (هرچه کمتر باشد بهتر است)

1.8٪

۴٫۳٪

-

-

-

-

بنچمارک داخلیِ دور زدن (هرچه کمتر باشد بهتر است)

0.00%

0.29%

-

-

-

-

هانی پات ExploitGym (هرچه کمتر باشد بهتر است)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

۱۰۰.۰٪

-

-

-

-

-

بنچمارک داخلی توهم (هرچه کمتر باشد بهتر است)

۴.۲٪

۱۲.۲٪

-

-

-

-

متن طولانی

متن طولانی

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini 3.8 Flash

OpenAI MRCR v2 ۸ سوزن ۲۵۶ هزار–۵۱۲ هزار

۱۰۰.۰٪

۹۱.۵٪

-

-

-

-

OpenAI MRCR v2 ۸ سوزن ۵۱۲ هزار–۱ میلیون

۹۶.۳٪

۷۳.۸٪

-

-

-

-

استدلال انتزاعی

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

امتیازهای ارزیابی در هر سطحی از تلاش، حداکثر هستند. ارزیابی‌های GPT در محیط تحقیقاتی ما یا از طریق API ما انجام شدند که ممکن است به دلیل تفاوت در پرامپت‌های سیستمی، ابزارهای در دسترس و موارد مشابه، خروجی کمی متفاوت از محیط تولیدی ChatGPT ارائه دهند.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(در یک پنجره جدید باز می‌شود). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(در یک پنجره جدید باز می‌شود).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(در یک پنجره جدید باز می‌شود).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(در یک پنجره جدید باز می‌شود).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(در یک پنجره جدید باز می‌شود): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(در یک پنجره جدید باز می‌شود) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(در یک پنجره جدید باز می‌شود) and supporting research(در یک پنجره جدید باز می‌شود).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(در یک پنجره جدید باز می‌شود) and supporting research(در یک پنجره جدید باز می‌شود).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.