OpenAI

GPT-6 Astra: A new generation of intelligence

نسل جدیدی از هوشمندی

بروز رسانی در ۲۲ سپتامبر ۲۰۲۶: ما خانواده GPT‑۶ خود را با GPT‑۶ Sol و GPT‑۶ Luna گسترش می‌دهیم. بیشتر بدانید.

ما GPT‑۶ Astra، هوشمند ترین و همسو ترین مدل جهان را معرفی می‌کنیم.

GPT‑۶ Astra سال‌ها پژوهش و سرمایه‌گذاری‌های جسورانه در پیش‌آموزش، یادگیری تقویتی و هم‌راستایی را گرد هم می‌آورد. Astra در استفاده از رایانه، مرور وب، مهندسی نرم‌افزار، امنیت سایبری، علوم و کارهای حرفه‌ای عملکردی در سطح پیشرفته‌ترین مدل‌های موجود دارد. Astra با کسب امتیاز ۹۸٪، FrontierMath Tier 4 را عملاً به سقف می‌رساند؛ این در حالی است که پیش‌تر نیز به حل مسائل باز و دیرپای⁠ ریاضیات کمک کرده است. Astra همچنین با امتیاز ۹۹.۹٪، ARC-AGI-3 را عملاً به سقف می‌رساند و در ExploitBench نیز امتیاز ۱۰۰٪ کسب می‌کند. همچنین، در استفاده از رایانه و مرور وب، مرز تازه‌ای تعیین می‌کند و دشوارترین کارهای حرفه‌ای را با سرعت، دقت و قضاوتی بی‌رقیب انجام می‌دهد. 

GPT‑6 Astra امروز برای تعداد محدودی از سازمان‌ها عرضه می‌شود و طی روزهای آینده برای همهٔ کاربران ChatGPT Plus، Pro، Business و Enterprise و همچنین از طریق OpenAI API، Microsoft Azure و AWS Bedrock در دسترس خواهد بود.

«در ARC-AGI-3، Astra در 96% از مراحل از خط مبنای کارایی کنش انسانی ما فراتر رفت و عملاً در این بنچمارک به سطح عملکرد انسانی رسید. این نه‌تنها بهترین مدلی است که تاکنون آزمایش کرده‌ایم، بلکه نشان‌دهنده جهشی معنادار در عملکرد مدل‌های پیشرو نیز هست—نه‌فقط در توانایی آن برای پیمایش و حل محیط‌های جدید، بلکه در میزان کارآمدی یادگیری آن برای انجام این کار.»
گرگ کامرادت، بنیاد جایزه ARC

Astra هم‌راستاترین مدل ما است و در درک نیت کاربر و رفتار مدل پیشرفت‌های چشمگیری داشته است؛ بنابراین می‌توانید با اعتماد بیشتری به قضاوت Astra، وظایف را به آن واگذار کنید. که بررسی می‌کند آیا مدلی که با وظیفه‌ای دشوار یا ناممکن روبه‌رو می‌شود، از محدوده‌ای که برایش در نظر گرفته شده فراتر می‌رود یا نه. در مقایسه با GPT‑۵.۶ Sol که بدون تدابیر حفاظتی محیط تولید در ۴۸٪ مواقع از هدف مجاز فراتر رفت، GPT‑۶ Astra در ۰٪ موارد چنین کاری کرد.

بهترین مدل جهان برای استفاده از رایانه

GPT‑۶ Astra پیشرو تازه‌ای در سرعت، دقت و ایمنیِ کار با رایانه است. این ابزار می‌تواند کارهای زمان‌بر و خسته کننده‌ای مانند پر کردن فرم‌های آنلاین، بروز رسانی سوابق مشتریان در CRM و سازمان دهی تقویم شما را انجام دهد. می‌تواند پژوهش آنلاین انجام دهد و پیش‌نویس خلاصه‌ها را در ایمیل یا ویرایشگر سند تان تهیه کند. می‌تواند داده‌های علمی را تحلیل کند، نمودار تولید کند، یک وب‌سایت ایجاد کرده و بررسی‌های تضمین کیفیت فرانت اند را اجراء کند تا مطمئن شود همهٔ قابلیت‌های آن سایت کار می‌کنند. می‌تواند به شما کمک کند نرم افزار را به صورت خودکار نصب و آزمایش کنید و مشکلاتی را که روی صفحه می‌بینید عیب یابی کنید. این بهبودها در نتایج ارزیابی پیشرفتهٔ ما نیز بازتاب یافته‌اند.

این بهبودها همچنین به افزایش چشمگیر کارایی در وظایف واقعیِ دانش‌محور منجر می‌شوند. در شبیه‌سازی‌های تأخیر در OSWorld ۲.۰، Astra با صرف حدود ۴۷٪ زمان کمتر برای هر وظیفه نسبت به GPT‑۵.۶، عملکرد بهتری در استفاده از رایانه دارد Sol، با کسب امتیاز ۷۲.۶٪ در حدود ۴۰ دقیقه برای هر وظیفه، در مقایسه با ۶۵.۷٪ در حدود ۷۵ دقیقه.3

قابلیت‌های استفاده از رایانه در GPT‑۶ Astra را می‌توان در خروجی‌های حوزه‌های مختلف، از جمله توسعه بازی، مهندسی برق و کارهای دانشی روزمره مشاهده کرد:

در کنار Astra، ما همچنین چارچوب آزمون Codex را بروز رسانی می‌کنیم تا سرعت استفاده از رایانه را به طور چشمگیری بهبود دهیم. در ترکیب با بهره وری Astra، این امر در معیار Mind۲Web به تکمیل وظایف با سرعت ۱.۹ برابر نسبت به تجربه فعلی GPT‑۵.۶ Sol منجر می‌شود. بهبودهای مدل در زمینه سرعت به این معناست که می‌تواند بسیاری از کارهای زمانبر زندگی را برای شما، سریع‌تر از آن‌چه خودتان می‌توانید، انجام دهد.4

«ما در روز عرضه، GPT‑6 Astra را در چارچوب آزمون Devin ادغام می‌کنیم؛ جایی که در معیار آزمون داخلی ما عملکردی پیشرفته ارائه می‌دهد. توانایی عالی آن در استفاده از رایانه، نگارش و درک پایگاه کد، از همان ابتدا فرایند آزمایش را بهبود داد: ویدئوها به‌طور محسوسی آسان‌تر دنبال می‌شوند و گزارش‌ها شفاف‌تر و مختصرتر هستند»
سیلاس آلبرتی، معاون ارشد پژوهش، Cognition

تحولی چشمگیر در کار حرفه‌ای

GPT‑6 Astra پیشرفت‌های استفاده از رایانه را با آموزش هدفمند برای محیط‌های حرفه‌ای ترکیب می‌کند تا به انجام وظایف کاری پیچیده کمک کند. این مدل هوشمندی لازم برای مسائل پیچیده را با توانایی اجرای گردش‌کارهای چندمرحله‌ای و تولید اسناد، صفحات گسترده و ارائه‌های پرداخت‌شده و آمادهٔ استفاده ترکیب می‌کند.

GPT‑۶ Astra بهترین مدل ما برای پیروی از قالب‌های موجود و تولید اسلایدهایی با چیدمان مناسب است که نکات کلیدی را با روایتی ساختار یافته و به اختصار منتقل می‌کنند. این ابزار اسناد، ارائه‌ها، صفحه گسترده‌ها و تحلیل‌هایی شفاف و خوش ساختار ایجاد می‌کند که از الگوهای شما پیروی می‌کنند و با سبک نوشتاری و بصری شما همخوانی دارند. Astra همچنین طوری آموزش دیده است که به طور مشخص فقط زمینهٔ مرتبط را در خروجی‌ها بیاورد، نه اینکه اطلاعاتی را که برای کارِ پیش‌رو ضروری نیستند تکرار کند. همهٔ این‌ها به این معناست که می‌تواند خروجی‌هایی قابل استفاده‌تر و آماده‌تر تولید کند که با زمینهٔ کسب و کار و استانداردهای شما همخوانی دارند.

GPT‑6 Astra همچنین توان قضاوت بصری بهتری در وب‌سایت‌ها، بازی‌ها، برنامه‌ها و رندرهایی که می‌سازد ارائه می‌دهد. با سایت‌ها⁠(در یک پنجره جدید باز می‌شود) در ChatGPT، Astra می‌تواند مستقیماً از طریق یک اعلان وب‌سایت‌ها، اپلیکیشن‌های وب و بازی‌ها را ایجاد، میزبانی و به اشتراک بگذارد.

«Astra از نظر توانمندی و کارایی، مزیت چشمگیری برای ما فراهم می‌کند. این مدل پیچیده ترین گردش کارهای خلاقانهٔ ما را با موفقیت اجراء می‌کند، در حالی که نسبت به سایر مدل‌هایی که آزمایش کرده‌ایم تا ۲۰٪ توکن کمتر مصرف می‌کند. مهم‌تر از همه، برای مشتریان ما به معنای خروجی با کیفیت بالاتر است.»
Alex Mashrabov، مدیرعامل و هم بنیان گذار، Higgsfield AI

وقتی دستورالعمل‌ها جای تفسیر باقی می‌گذارند، GPT‑6 Astra در اتخاذ تصمیم درست از مدل‌های پیشین بهتر عمل می‌کند. وقتی دستورالعمل‌ها جای تفسیر باقی می‌گذارند، GPT‑6 Astra در تصمیم‌گیری درست از مدل‌های پیشین بهتر عمل می‌کند. در Codex، می‌تواند به‌صورت ناهمگام سؤال بپرسد و به کاری که به پاسخ شما وابسته نیست ادامه دهد. اگر پاسخ ندهید، هرجا مناسب باشد با فرض‌های معقول کار را پیش می‌برد، اما برای تصمیم‌های مهمی که پیامد قابل‌توجهی دارند منتظر نظر شما می‌ماند.

مثال‌های زیر نشان می‌دهند که Astra چگونه در انجام کارهای روزمره‌ای با شما همکاری می‌کند که نبود برخی اطلاعات می‌تواند پاسخ را به‌طور قابل‌توجهی تغییر دهد.

Astra همچنین در حفظ جهت‌گیری، همزمان با تکامل یافتن وظیفه، عملکرد بهتری دارد. مدل‌های قبلی گاهی پیام‌های راهبری را به‌عنوان هدفی جدید تلقی می‌کردند و درخواست اصلی یا محدودیت‌های پیشین را از نظر دور می‌داشتند. Astra الزامات جدید را در نظر می‌گیرد، در صورت درخواست مسیر خود را تغییر می‌دهد و به پرسش‌های جانبی پاسخ می‌دهد، بدون آنکه کار کلی را رها کند.

«Astra در وظایف حقوقی پیچیده، نسبت به GPT‑۵.۶ Sol بهبود چشمگیری در کیفیت ارائه می‌دهد. در آزمایش‌های اولیهٔ ما، آسترا با رویکردی به کار حقوقی که یک وکیل نکته سنج در پیش می‌گیرد، برجسته شد: اسناد را از سوابق تثبیت شده تفکیک می‌کند، مفروضات بی پشتوانه را آشکار می‌سازد، و خلأها را به مواضع مشخص در تنظیم پیش نویس تبدیل می‌کند.»
نیکو گروپن، رئیس پژوهش‌های کاربردی، Harvey

برنامه‌نویسی

GPT‑۶ Astra بهترین مدل تا به امروز برای مهندسی نرم افزار است.

1 از 2
«GPT‑6 Astra در بنچمارک‌های داخلی کدنویسی ما عملکردی در سطح پیشرفته‌ترین مدل‌ها ارائه می‌دهد و در مقایسه با GPT‑5.6 Sol، در ارزیابی‌های شهود معاملاتی پیشرفتی آشکار نشان می‌دهد. هنگام استفاده برای کدنویسی عامل‌محور، GPT‑6 Astra به شیوه‌ای ارتباط برقرار می‌کند که دنبال‌کردنش برای توسعه‌دهندگان آسان‌تر است و کدی تولید می‌کند که برای رسیدن به کیفیت مناسب برای محیط عملیاتی، به تکرار کمتری نیاز دارد.»
جان کرپزی، دستیارهای هوش مصنوعی، Jane Street

با Astra، روش تازه‌ای برای Codex معرفی می‌کنیم تا وقتی پنجرهٔ زمینه پر می‌شود، زمینه را حفظ کند و دوباره به آن دسترسی پیدا کند. در گذشته، مدل‌ها برای خلاصه‌کردن کار در نشست‌های طولانی از فشرده‌سازی استفاده می‌کردند؛ مثلاً هنگام اشکال‌زدایی از مسائل پیچیده یا انجام بازآرایی‌های بزرگ. هر بار فشرده‌سازی ممکن است جزئیاتی دربارهٔ اینکه چرا یک اصلاح ناموفق بوده یا یک مؤلفه چگونه رفتار می‌کند، از قلم بیندازد. در Codex، Astra می‌تواند در چند پنجرهٔ زمینه یادداشت نگه دارد و جزئیات انباشته‌شده را بدون اینکه بارها آن‌ها را در یک خلاصهٔ واحد فشرده کند، حفظ کند. پنجره‌های زمینهٔ قبلی همچنان قابل جست‌وجو می‌مانند؛ بنابراین Astra می‌تواند الزامات یا نتایج آزمون را از پیام‌های قبلی و خروجی ابزارها پیدا کند—حتی اگر آن اطلاعات در یادداشت‌هایش ثبت نشده باشند. می‌توانید این قابلیت آزمایشی را در فایل config.toml مربوط به Codex خود،⁠(در یک پنجره جدید باز می‌شود) فعال کنید. و طی هفته‌های آینده، برای Astra به حالت پیش‌فرض تبدیل خواهد شد.

پیشبرد اکتشافات علمی

«داستان این است: پایان یک دوران، آغاز دورانی دیگر.»
گرگ برنهام، EpochAI

GPT‑۶ Astra پیشرفتی بزرگ در کشف علمی، ریاضیات و سلامت است. امروز، دو نتیجهٔ دیگر دربارهٔ فاصله‌های میان اعداد اول را به اشتراک می‌گذاریم.9،‏ 10

Astra همچنین در مجموعه‌ای از ارزیابی‌های ریاضی و علمی رکوردهای جدیدی ثبت می‌کند.

Astra می‌تواند در کارهای عملیِ زمینه‌ساز کشف علمی کمک کند. با ترکیب استدلال علمی و استفاده از رایانه، می‌تواند مستقیماً در نرم‌افزارهای تخصصی کار کند، داده‌ها را بررسی و نتایج را کاوش کند و به پژوهشگران کمک کند شواهد را ارزیابی کنند و تصمیم بگیرند در گام بعد چه چیزی را بررسی کنند.

امنیت سایبری

همان‌طور که در به‌روزرسانی ایمنی⁠‌مان توضیح دادیم، Astra جهشی چشمگیر در توانمندی‌های سایبری به شمار می‌رود و در حوزه امنیت سایبری، معیار آستانه‌ی بحرانی را مطابق چارچوب آمادگی ما برآورده می‌کند. توانایی آن در کشف و توسعه روش‌های بهره‌برداری از آسیب‌پذیری‌های روز صفر می‌تواند به مدافعان کمک کند این ضعف‌ها را شناسایی و برطرف کنند، اما در عین حال نیاز به تدابیر حفاظتی قوی‌تر را نیز به همراه دارد. برای سنجش گستره این توانمندی‌ها، Astra را در مجموعه‌ای از ارزیابی‌های تخصصی داخلی و ارزیابی‌های انجام‌شده توسط طرف‌های ثالث آزمودیم.

ابتدا مدل را بدون تدابیر حفاظتی محیط عملیاتی روی ExploitBench و ExploitGym آزمایش کردیم؛ این بنچمارک‌ها می‌سنجند که آیا مدل‌ها می‌توانند آسیب‌پذیری‌های شناخته‌شدهٔ نرم‌افزار را به اکسپلویت‌های عملی تبدیل کنند یا نه. در ExploitBench، Astra امتیاز کامل ۱۰۰% را کسب کرد، در مقایسه با امتیاز ۷۸.۵% برای GPT‑۵.۶ Sol، مدل پیشین ما با قابلیت‌های سایبری پیشرو. در ExploitGym، Astra با استفاده از تعداد بسیار کمتری توکن خروجی، به نرخ موفقیت ۴۲.۴٪ دست یافت؛ در حالی که نرخ موفقیت GPT‑۵.۶ Sol برابر با ۳۰.۳٪ بود.13

با توجه به نگرانی‌ها مبنی بر اینکه مواجهه با آسیب‌پذیری‌های نرم‌افزاری گذشته ممکن است بر نتایج بنچمارک تأثیر گذاشته باشد، Astra را روی دو بنچمارک جدید نیز ارزیابی کردیم. برای یکی از آن‌ها، ارزیابی داخلی «ExploitBench (ژوئن تا اوت ۲۰۲۶)» را طراحی کردیم تا توسعهٔ اکسپلویت را با استفاده از آسیب‌پذیری‌های سه ماه گذشته آزمایش کنیم.14 Astra در این مجموعه‌داده، با استفاده از توکن‌های خروجی بسیار کمتر به نرخ اجرای کد دلخواه به‌مراتب بالاتری از GPT‑5.6 Sol دست یافت. در جریان ارزیابی، Astra حتی دو آسیب‌پذیری روز صفر را که پیش‌تر ناشناخته بودند کشف کرد و به کار گرفت. هر دو آسیب‌پذیری را به توسعه‌دهندگان مسئول نگهداری آن‌ها اطلاع می‌دهیم.

ما همچنین Astra را در SRE-Bench15 آزمایش کردیم؛ بنچمارکی که می‌سنجد آیا مدل‌ها می‌توانند بدون دسترسی به کد منبع خام، باینری‌های نرم‌افزاری را مهندسی معکوس کنند و منطق اصلی آن‌ها را درک کنند یا نه. Astra در یک تلاش ۸۸.۰٪ از وظایف و ظرف چهار تلاش ۹۹.۲٪ از آن‌ها را حل کرد؛ این ارقام برای GPT‑۵.۶ Sol به‌ترتیب ۵۵.۹٪ و ۶۸.۷٪ بودند.

فراتر از بنچمارک‌ها، ارزیابی‌های انجام‌شده به رهبری کارشناسان نشان داد که Astra، هنگامی که بدون تمهیدات حفاظتی محیط تولید اجرا شود، می‌تواند از آسیب‌پذیری‌های پیش‌تر ناشناخته برای دستیابی به اجرای کد دلخواه در مرورگرهای مقاوم‌سازی‌شده استفاده کند و اکسپلویت‌های ارتقای سطح دسترسی برای سیستم‌عامل‌های مقاوم‌سازی‌شده ایجاد کند.

همان‌طور که در پنجره مدافع بحث کردیم، قابلیت‌های پیشرفتهٔ سایبری می‌توانند به مدافعان کمک کنند ضعف‌ها را سریع‌تر پیدا کنند، اما در عین حال بهره‌برداری از آن ضعف‌ها را هم آسان‌تر می‌کنند و لزوم سازگاری سریع‌تر مدافعان را افزایش می‌دهند. با نسخهٔ Astra که امروز عرضه می‌شود، مدافعان می‌توانند از آن برای انجام کارهایی مانند بازبینی امنیتی کد و اعمال وصله استفاده کنند.

با این حال، Astra از انجام وظایف پیشرفته‌تر امنیت سایبری، مانند ساخت نمونه‌های اثبات مفهوم برای بهره‌برداری از آسیب‌پذیری‌ها، خودداری می‌کند. از طریق OpenAI Daybreak⁠، قصد داریم در هفته‌های آینده دسترسی را گسترش دهیم و سازوکارهای حفاظتی با محدودیت‌های کمتر را عرضه کنیم. این امر امکان استفاده از گردش‌کارهای دفاعی بیشتری را فراهم می‌کند، از جمله اعتبارسنجی آسیب‌پذیری‌ها و نمونه‌های اثبات مفهوم، تحلیل بدافزار و مهندسی تشخیص

همچنین با تکیه بر لایه‌های حفاظتی GPT‑5.6 Sol، تدابیر خود را برای مقابله با سوءاستفاده‌های احتمالی سایبری تقویت کرده‌ایم. این اقدامات شامل افزایش مقاومت مدل در برابر تلاش‌های احتمالی برای دور زدن سازوکارهای ایمنی و فراهم کردن اطلاعات زمینه‌ای بیشتر برای سامانه‌های پایش ماست. آزمون‌های دقیق داخلی و خارجی، از جمله ارزیابی‌های خودکار با کمک متخصصان داخلی تیم قرمز ما که نقش مهاجم را شبیه‌سازی می‌کنند، را ادامه داده‌ایم. برای آگاهی از جزئیات بیشتر درباره تدابیر حفاظتی سایبری و آزمون‌های ما، به نمای کلی ایمنی⁠ و کارت سیستم⁠(در یک پنجره جدید باز می‌شود) Astra مراجعه کنید.

همسو سازی و استقرار GPT‑۶ Astra به صورت مسئولانه

Astra هم‌راستاترین مدل ما است. Astra در به‌کارگیری دقت و احتیاط، رعایت حدود وظایف و برقراری ارتباط شفاف عالی عمل می‌کند. این کار، تازه‌ترین دستاورد برنامه پژوهشی دیرینه ما است که بر آموزش مدل‌هایی متمرکز است که از ابتدا تا انتها با نیت انسانی هم‌راستا باقی می‌مانند.

در محیط‌های حساس، Astra با احتیاطی متناسب با میزان ریسک موجود اقدام می‌کند. در ارزیابی‌ای از وظایف استفاده از رایانه که به‌صورت خصمانه برای برانگیختن رفتار نادرست انتخاب شده بودند، Astra در جلوگیری از پیامدهای ناخواسته موفق‌تر بود. اجرا با تدابیر امنیتی اضافی‌ای که به‌صورت پیش‌فرض ارائه می‌شدند، عملکردی حتی قوی‌تر به همراه داشت.

Astra نسبت به هر مدل پیشروی دیگری که آزمایش شده است، پیامدهای ناهم‌راستای کمتری ایجاد می‌کند. برای مقایسه‌ای منصفانه، ما از یک چارچوب آزمون عمومیِ عامل کامپیوتری استفاده کردیم (بر اساس ابزارهای بومیِ استفاده از کامپیوتر که هم در API پاسخ‌های OpenAI⁠(در یک پنجره جدید باز می‌شود) و هم در API پیام‌های Anthropic⁠(در یک پنجره جدید باز می‌شود) در دسترس هستند) و بدون محافظت‌های اضافی‌ای که معمولاً برای کاربران Codex و ChatGPT کار به‌کار گرفته می‌شوند (بازبینی خودکار، خط‌مشی تأیید).

Astra همچنین با احتمال بیشتری در چارچوب محدودیت‌هایی عمل می‌کند که کاربر تعیین کرده یا محیط به‌طور ضمنی ایجاب می‌کند. در یک ارزیابی داخلی، Astra هرگز تلاش نکرد رد بازبینی خودکار Codex را دور بزند. این وضعیت حتی زمانی نیز برقرار بود که Auto-review عمداً به‌گونه‌ای پیکربندی شده بود که قابل دور زدن باشد و بدون دور زدن آن، تکمیل کار ناممکن بود. این رعایت محدودیت‌های محیط با نتایج ارزیابی وظایف سایبری ناممکن ما، که در مقدمه این پست به اشتراک گذاشتیم، و دیگر یافته‌های مستندشده در کارت سیستم⁠(در یک پنجره جدید باز می‌شود) ما همخوانی دارد.

Astra همچنین در زمینه ارتباط شفاف با کاربران، معیارهای تازه‌ای تعیین می‌کند. در یکی از ارزیابی‌ها، احتمال بروز این رفتار در Astra سه برابر کمتر از GPT‑5.6 بود. در یکی از ارزیابی‌ها، Astra در مقایسه با GPT‑5.6 Sol سه برابر کمتر احتمال داشت درباره توانمندی‌ها و امکانات خود اطلاعات نادرستی ارائه دهد.

در ارزیابی ما از توهم گویی درباره قابلیت‌ها، Astra در مقایسه با GPT‑۵.۶ Sol بهبود چشمگیری نشان می‌دهد و ادعاهای گمراه کننده کمتری درباره قابلیت‌های خود مطرح می‌کند.

ارزیابی‌های ما نشان دادند که پایش استدلال مکتوب Astra دشوارتر از استدلال مکتوب GPT‑5.6 Sol است؛ این نتیجه بر اساس آزمون‌هایی به دست آمده که صراحتاً از مدل خواسته بودند از پایش بگریزد. این موضوع را به کنترل بیشتر Astra بر استدلال مکتوب در وظایف ساده‌تر و توانایی آن در حل مسائل با مراحل مکتوب کمتر نسبت می‌دهیم. Astra همچنان ظاهراً در پنهان‌کردن استدلال موردنیاز برای وظایف پیچیده مشکل دارد، اما ما این کاهش را جدی می‌گیریم. بهبود قابلیت نظارت همچنان یک اولویت پژوهشی است و کارت سیستم⁠(در یک پنجره جدید باز می‌شود) همراه، یافته‌ها و فعالیت‌های مستمر ما را شرح می‌دهد.

آموزش هم‌سوسازی، یکی از ارکان اصلی رویکرد ما در استقرار مدل‌هاست. برای افزودن یک لایه حفاظتی دیگر، از سازوکارهای ایمنی در سطح سیستم نیز استفاده می‌کنیم؛ مانند بازبینی خودکار⁠(در یک پنجره جدید باز می‌شود) Codex و پایش نحوه استدلال و عملکرد عامل‌ها، تا رفتارهای ناایمن زودتر شناسایی و مهار شوند. همان‌طور که در به‌روزرسانی ایمنی⁠‌مان توضیح دادیم، در مدل‌های هم‌رده Astra از پایش ناهم‌سویی در محیط عملیاتی نیز استفاده می‌کنیم تا دید بهتری از موارد ناهم‌سویی داشته باشیم و شدیدترین نمونه‌های آن را مهار کنیم. این سازوکارهای حفاظتی مشابه پایشی هستند که در استقرارهای داخلی خود انجام می‌دهیم و از مجموعه‌ای از طبقه‌بندها استفاده می‌کنند تا استدلال و اقدامات مدل را از نظر رفتارهای غیرمجاز بررسی کرده و فعالیت‌های مشکوک به غیرمجاز بودن را به‌طور خودکار متوقف کنند.

با توجه به افزایش چشمگیر قابلیت‌های امنیت سایبری Astra، ما با دقت ویژه‌ای عمل می‌کنیم تا این استقرار ایمن و امن باشد. بررسی‌های ایمنیِ اضافی گاهی می‌توانند کارهای مشروع، از جمله امنیت سایبری دفاعی، را کند، موقتاً متوقف یا متوقف کنند. اگر وظیفه‌ای در ChatGPT یا Codex متوقف شود، ممکن است از شما خواسته شود پیش از ادامه، اقدام را بازبینی کنید. در API، وظیفه متوقف خواهد شد. این بررسی‌ها گاهی ممکن است کارهای مجاز را مختل کنند، و ما همچنان به بهبود و اصلاح مداوم این سیستم ادامه می‌دهیم تا وقفه‌های غیر ضروری را کاهش دهیم. پایش ناهم‌راستایی نمی‌تواند جایگزین هم‌راستاسازی شود: هدف ما ساخت مدل‌هایی است که به‌طور قابل اعتماد در محدوده مجاز خود باقی بمانند، تا این تمهیدات حفاظتی نیازی به مداخله نداشته باشند.

در دسترس بودن

GPT‑6 Astra اکنون برای مجموعۀ محدودی از سازمان‌ها عرضه می‌شود و طی روزهای آینده برای همۀ کاربران ChatGPT Plus، Pro، Business و Enterprise، و همچنین از طریق OpenAI API، Microsoft Azure و AWS Bedrock در دسترس خواهد بود. استفاده از Astra در سهمیه‌های فعلی اشتراک لحاظ شده است—علاوه بر این، کاربران و کسب‌وکارها می‌توانند برای استفادهٔ بیشتر اعتبار بخرند. کاربران طرح‌های Pro، Business و Enterprise نیز به GPT‑6 Astra Pro دسترسی خواهند داشت. مدیران Enterprise می‌توانند Astra را برای فضای کاری خود فعال کنند؛ در زمان عرضه، دسترسی به‌طور پیش‌فرض غیرفعال است.

Astra از قابلیت «عدم نگهداری داده» برای مشتریان واجد شرایط API پشتیبانی می‌کند و همان‌طور که ماه گذشته اعلام کردیم، در حال آزمایش Private Safety Processing هستیم تا ضمن حفظ حریم خصوصی مشتریان، پایش ایمنی را تقویت کنیم.

برای توسعه‌دهندگان، GPT‑6 Astra با شناسه‌ی gpt-6-astra در API ‏OpenAI و همچنین از طریق Microsoft Azure و Amazon Bedrock در دسترس خواهد بود.

قیمت استاندارد API OpenAI، ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است. برای خواندن از کش و نوشتن در کش، نرخ‌های جداگانه‌ای اعمال می‌شود حالت سریع برای GPT‑۶ Astra در API در دسترس است و با قیمتی دو برابر حالت استاندارد، تا دو برابر سرعت پردازش استاندارد را ارائه می‌دهد.

استفاده از کامپیوتر

استفاده از کامپیوتر

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini ۳.۸ Flash

آخرین آزمون عامل‌ها

۵۹.۳%

53.6%

-

۴۸.۷%

۵۵.۵%

-

OSWorld ۲.۰ (نسخهٔ ۲۰۲۶.۰۸.۰۸، مجموعهٔ آفلاین، امتیاز جزئی)

72.6%

۶۵.۷٪

-

-

۷۰٫۲٪3

-

ScreenSpot-Pro (بدون ابزار)

92.7%

۷۶٫۹٪

-

۸۷٫۳٪17

-

-

حرفه‌ای

حرفه‌ای

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini ۳.۸ Flash

AutomationBench

۴۱٫۴٪

۱۸٫۱٪

۳۱.۴%

۱۷.۴%

۲۶.۹%

-

BenchCAD

۹۵.۹%

83.3%

۸۴٫۳٪ 5

۶۷.۵% 5

۸۲٫۱٪ 5

-

BrowseComp

۹۱.۵٪

۹۰.۴٪

-

۸۷.۴٪

۹۰.۸%

-

کوارتت‌های زهی OpenScore (1 - OMR-NED)

0.84

0.19

-

-

-

-

وظایف طراحی (داخلی)

50.0%

۴۷.۴%

-

۳۵.۸%

-

-

وظایف داخلی علم داده

۴۰.۹%

۳۰.۵%

-

۳۴.۷٪

-

-

شاخص هوشمندی تحلیل هوش مصنوعی نسخه ۴.۱.۱

61.2

۶۰٫۹

۶۵.۷

62.1

۶۳.۱

58.7

برنامه‌نویسی

برنامه‌نویسیGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%"DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (امتیاز)64.5% 860.6%63.6%64.9%63.6%56.3%"FrontierCode 1.1 Main (امتیاز)53.3% 847.5%50.9%53.5%53.4%43.6%"وظایف داخلی انتقال پایگاه داده63.9%42.7%57.8%50.3%--
شاخص عامل برنامه‌نویسی Artificial Analysis نسخه ۱.۴67.065.1-67.268.161.2

دانشگاهی

دانشگاهی

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini ۳.۸ Flash

Terminal-Bench علوم ۰.۱

۶۴.۶%

۲۲٫۴٪

۵۲٫۶٪

21.4%

30.0%

-

FrontierMath رده ۴ (نسخه ۲)

۹۷.۶%

۸۳.۰٪

۸۷.۸%

۹۰.۲%

۷۳.۲%

-

GPQA Diamond

۹۶.۰٪

۹۴.۶%

93.7%

92.6%

93.7%

95.3%

آخرین آزمون بشریت (با ابزارها)

57.2%

-

۶۵.۰%

۶۳.۸%

۶۳.۶٪

-

علم و سلامت

علم و سلامتGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (تعدیل‌شده بر اساس طول پاسخ)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

امنیت سایبری

امنیت سایبریGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (ژوئن تا اوت ۲۰۲۶)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro۸۵.۴%۷۹.۱%----

هم‌راستایی

هم‌راستایی

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini 3.8 Flash

بنچمارک داخلی ایمنی استفاده از رایانه (هرچه کمتر باشد بهتر است)

۲.۴%

22.0%

۹٫۵٪

18.3%

11.5%

-

معیار ایمنی استفاده داخلی از رایانه، با AutoReview (هرچه کمتر باشد بهتر است)

1.8٪

۴٫۳٪

-

-

-

-

بنچمارک داخلیِ دور زدن (هرچه کمتر باشد بهتر است)

0.00%

0.29%

-

-

-

-

هانی پات ExploitGym (هرچه کمتر باشد بهتر است)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

۱۰۰.۰٪

-

-

-

-

-

بنچمارک داخلی توهم (هرچه کمتر باشد بهتر است)

۴.۲٪

۱۲.۲٪

-

-

-

-

متن طولانی

متن طولانی

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable ۵.۱

Claude Fable ۵

Claude Opus ۵

Gemini 3.8 Flash

OpenAI MRCR v2 ۸ سوزن ۲۵۶ هزار–۵۱۲ هزار

۱۰۰.۰٪

۹۱.۵٪

-

-

-

-

OpenAI MRCR v2 ۸ سوزن ۵۱۲ هزار–۱ میلیون

۹۶.۳٪

۷۳.۸٪

-

-

-

-

استدلال انتزاعی

استدلال انتزاعیGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

امتیازهای ارزیابی در هر سطحی از تلاش، حداکثر هستند. ارزیابی‌های GPT در محیط تحقیقاتی ما یا از طریق API ما انجام شدند که ممکن است به دلیل تفاوت در پرامپت‌های سیستمی، ابزارهای در دسترس و موارد مشابه، خروجی کمی متفاوت از محیط تولیدی ChatGPT ارائه دهند.

پاورقی‌ها

  1. 1

    در ARC-AGI-۳، GPT-۶ Astra با چارچوب آزمون API پاسخ‌های ما⁠ اجرا شد که دو تنظیم را تغییر می‌دهد تا تطابق بهتری با عملکرد در دنیای واقعی داشته باشد. این تغییرات به‌طور خاص ARC-AGI-۳ را هدف قرار نمی‌دهند.

  2. 2

    GPT-5.6 Sol به نسخه‌ای اشاره دارد که در API ما، ChatGPT Codex و ChatGPT کار در دسترس است. نسخه موجود در چت ChatGPT کمی متفاوت است.⁠

  3. 3

    OSWorld V2-Offline زیرمجموعه‌ای از OSWorld V2 اصلی است که بدون دسترسی به اینترنت کار می‌کند. عملکرد مدل Claude در OSWorld-V۲ Offline توسط نویسندگان در جدول رتبه‌بندی رسمی⁠(در یک پنجره جدید باز می‌شود) بازتولید شد. در OSWorld ۲.۰، برای محاسبهٔ امتیازهای Claude از تنظیمات رسمی استفاده می‌شود، نه از وظایف تغییریافته و نمره‌دهی تغییریافتهٔ کارت سیستم Fable ۵.۱.

  4. 4

    زمان‌های مدل، زمان‌های سپری‌شدهٔ گزارش‌شده برای اجرای نمایش‌های متناظر هستند. کلیپ‌های نمایش‌داده‌شده گزیده‌های ویرایش‌شده هستند.

  5. 5

    در BenchCAD، امتیازهای Claude بازتاب‌دهنده ۳ تغییر در ارزیابی هستند که در کارت سیستم Fable ۵.۱⁠(در یک پنجره جدید باز می‌شود) شرح داده شده‌اند.

  6. 6

    گوانگ یانگ، ویکتوریا ایبرت، ناظف تامر، برایان سی‌یوان ژنگ، لوئیزا پوتزوبون، و نوآ اِی. اسمیت. «LEGATO: رویکردی تعمیم‌پذیر، انتهابه‌انتها و در مقیاس بزرگ برای OMR حروف‌چینی‌شده⁠(در یک پنجره جدید باز می‌شود).» arXiv:2506.19065، 2025.

  7. 7

    Mark R. H. Gotham، Maureen Redbond، Bruno Bower، و Peter Jonas. «پیکرهٔ کوارتت‌های زهی OpenScore⁠(در یک پنجره جدید باز می‌شود).» مجموعه مقالات دهمین کنفرانس بین‌المللی کتابخانه‌های دیجیتال برای موسیقی‌شناسی، صص. 49–57. ACM، 2023.

  8. 8

    در FrontierCode، GPT-6 Astra با پیامی از توسعه‌دهنده اجرا شد که مشابه بخشی از پیام توسعه‌دهندهٔ آن در Codex⁠(در یک پنجره جدید باز می‌شود) بود: "از ایجاد تعداد بیش از حد فایل‌های آزمایشی پرهیز کنید. فقط زمانی یک فایل آزمایشی جدید ایجاد کنید که قراردادهای محل نگهداری آن را ایجاب کند یا هیچ فایل موجودی محل مناسبی نباشد. از پاک‌سازی‌های نامرتبط و پیچیدگی غیرضروری پرهیز کنید. از ابزارهای کمکی موجود و مناسب استفادهٔ مجدد کنید. دستورالعمل‌های مرتبط محل نگهداری را بخوانید و کد، آزمون‌ها، مستندات و CI نزدیک را بررسی کنید. از قواعد جاافتاده پیروی کنید. هدف، کدی تمیز و قابل ادغام است." اعلان برای ارزیابی بهینه‌سازی نشده بود.

  9. 9

    اولی به این می‌پردازد که اعداد اول، هرقدر هم روی خط اعداد پیش بروید، تا چه حد می‌توانند نزدیک به هم ظاهر شوند. برای بیش از یک دهه، بهترین نتیجهٔ شناخته‌شده ثابت می‌کرد که بی‌نهایت جفت از اعداد اول وجود دارند که اختلافشان حداکثر ۲۴۶ است. یولیا اشتادلمن⁠(در یک پنجره جدید باز می‌شود) اخیراً آن کران را به ۲۴۰ بهبود داد. آسترا کمک کرد کران قوی‌تری برابر با ۱۸۶ تعیین شود، که نشان می‌دهد بی‌نهایت جفت درون این فاصلهٔ کوچک‌تر رخ می‌دهند. شکاف‌های کوتاه بین اعداد اول: اثبات⁠(در یک پنجره جدید باز می‌شود) و پژوهش‌های پشتیبان⁠(در یک پنجره جدید باز می‌شود).

  10. 10

    مورد دوم مربوط به فاصله‌های به‌طور غیرمعمول بزرگ میان اعداد اول است. آسترا عبارتی را در کرانی برای این فاصله‌ها بهبود داد؛ عبارتی که بیش از 80 سال بدون تغییر مانده بود. ما اثبات‌ها، زنجیره تفکر خلاصه‌شده و مستندات راستی‌آزمایی را برای هر دو نتیجه به اشتراک می‌گذاریم. شکاف‌های بزرگ بین اعداد اول: اثبات⁠(در یک پنجره جدید باز می‌شود) و پژوهش‌های پشتیبان⁠(در یک پنجره جدید باز می‌شود).

  11. 11

    ما همه مدل‌های Claude را به‌طور مستقل و مطابق با رویهٔ موردنظر HealthBench Professional ارزیابی کردیم و با استفاده از GPT‑۵.۴ نمره‌دهی و امتیازهای تعدیل‌شده بر اساس طول و بدون برش. برای Fable 5.1، در موارد امتناع ارائه‌دهنده، از Opus 5 به‌عنوان گزینهٔ پشتیبان استفاده کردیم.

  12. 12

    Claude Fable 5 و 5.1 در LifeSciBench Gold v1، GeneBench Pro v13 و MedChemBench گنجانده نشده‌اند، زیرا از پاسخ دادن به اکثر پرسش‌ها در این ارزیابی‌ها خودداری می‌کنند.

  13. 13

    در ExploitGym، ما Astra و Sol را بدون محدودیت زمانی ۶ ساعته آزمایش کردیم تا قابلیت‌های کامل سایبری آن‌ها را بهتر ارزیابی کنیم. آن‌ها آن‌قدر سریع هستند که تأثیر چندانی ندارد.

  14. 14

    در ارزیابی ExploitBench (ژوئن – اوت ۲۰۲۶)، ۲۰ آسیب‌پذیری امنیتی مهم در موتور V8 در ۱۳ نسخه پایدار Chrome بررسی شده است. این آزمون ارزیابی می‌کند که آیا عامل‌ها قادرند با بهره‌برداری از هر آسیب‌پذیری مشخص، به قابلیت اجرای کد دلخواه در V8 و نسخه‌های رسمی Chrome برای لینوکس دست پیدا کنند. برخی از آسیب‌پذیری‌های بررسی‌شده ممکن است در چارچوب محدودیت‌های ارزیابی، به اجرای کد دلخواه منجر نشوند؛ بنابراین رسیدن به موفقیت ۱۰۰٪ تضمین‌شده نیست. توجه: امتیاز ۵٫۵٪ GPT-5.6 Sol ناشی از اثر محدودیت ۳۰۰ نوبتی در این ارزیابی است؛ محدودیتی که کاربران واقعی استفاده‌کننده از طرح max با آن مواجه نیستند. این مدل در شرایط مشابه و با محدودیت‌های کمتر، امتیاز ۱۱٫۵٪ به دست آورد.

  15. 15
  16. 16

    هنگامی که مدل‌های شخص ثالث را آزمایش می‌کنیم، از یک تنظیم پژوهشی ساده‌تر استفاده می‌کنیم. Codex پیکربندی تولیدی پیچیده‌تری دارد که می‌تواند به نرخ‌های متفاوت خطای مدل خام منجر شود. تدابیر حفاظتی سمت ارائه‌دهنده و پیاده‌سازی‌های ابزار رایانه نیز همچنان متفاوت‌اند. کاربران سناریوی بدون تأیید را در Codex تجربه نمی‌کنند، زیرا این یک پیکربندی پژوهشی داخلی است.

  17. 17

    برای ScreenSpot-Pro و ExploitGym، امتیازهای Fable که گزارش می‌کنیم از Mythos به دست می‌آیند؛ یعنی Fable با تدابیر حفاظتی کمتر.