نسل جدیدی از هوشمندی
بروز رسانی در ۲۲ سپتامبر ۲۰۲۶: ما خانواده GPT‑۶ خود را با GPT‑۶ Sol و GPT‑۶ Luna گسترش میدهیم. بیشتر بدانید.
ما GPT‑۶ Astra، هوشمند ترین و همسو ترین مدل جهان را معرفی میکنیم.
GPT‑۶ Astra سالها پژوهش و سرمایهگذاریهای جسورانه در پیشآموزش، یادگیری تقویتی و همراستایی را گرد هم میآورد. Astra در استفاده از رایانه، مرور وب، مهندسی نرمافزار، امنیت سایبری، علوم و کارهای حرفهای عملکردی در سطح پیشرفتهترین مدلهای موجود دارد. Astra با کسب امتیاز ۹۸٪، FrontierMath Tier 4 را عملاً به سقف میرساند؛ این در حالی است که پیشتر نیز به حل مسائل باز و دیرپای ریاضیات کمک کرده است. Astra همچنین با امتیاز ۹۹.۹٪، ARC-AGI-3 را عملاً به سقف میرساند و در ExploitBench نیز امتیاز ۱۰۰٪ کسب میکند. همچنین، در استفاده از رایانه و مرور وب، مرز تازهای تعیین میکند و دشوارترین کارهای حرفهای را با سرعت، دقت و قضاوتی بیرقیب انجام میدهد.
GPT‑6 Astra امروز برای تعداد محدودی از سازمانها عرضه میشود و طی روزهای آینده برای همهٔ کاربران ChatGPT Plus، Pro، Business و Enterprise و همچنین از طریق OpenAI API، Microsoft Azure و AWS Bedrock در دسترس خواهد بود.
Astra همراستاترین مدل ما است و در درک نیت کاربر و رفتار مدل پیشرفتهای چشمگیری داشته است؛ بنابراین میتوانید با اعتماد بیشتری به قضاوت Astra، وظایف را به آن واگذار کنید. که بررسی میکند آیا مدلی که با وظیفهای دشوار یا ناممکن روبهرو میشود، از محدودهای که برایش در نظر گرفته شده فراتر میرود یا نه. در مقایسه با GPT‑۵.۶ Sol که بدون تدابیر حفاظتی محیط تولید در ۴۸٪ مواقع از هدف مجاز فراتر رفت، GPT‑۶ Astra در ۰٪ موارد چنین کاری کرد.
بهترین مدل جهان برای استفاده از رایانه
GPT‑۶ Astra پیشرو تازهای در سرعت، دقت و ایمنیِ کار با رایانه است. این ابزار میتواند کارهای زمانبر و خسته کنندهای مانند پر کردن فرمهای آنلاین، بروز رسانی سوابق مشتریان در CRM و سازمان دهی تقویم شما را انجام دهد. میتواند پژوهش آنلاین انجام دهد و پیشنویس خلاصهها را در ایمیل یا ویرایشگر سند تان تهیه کند. میتواند دادههای علمی را تحلیل کند، نمودار تولید کند، یک وبسایت ایجاد کرده و بررسیهای تضمین کیفیت فرانت اند را اجراء کند تا مطمئن شود همهٔ قابلیتهای آن سایت کار میکنند. میتواند به شما کمک کند نرم افزار را به صورت خودکار نصب و آزمایش کنید و مشکلاتی را که روی صفحه میبینید عیب یابی کنید. این بهبودها در نتایج ارزیابی پیشرفتهٔ ما نیز بازتاب یافتهاند.
این بهبودها همچنین به افزایش چشمگیر کارایی در وظایف واقعیِ دانشمحور منجر میشوند. در شبیهسازیهای تأخیر در OSWorld ۲.۰، Astra با صرف حدود ۴۷٪ زمان کمتر برای هر وظیفه نسبت به GPT‑۵.۶، عملکرد بهتری در استفاده از رایانه دارد Sol، با کسب امتیاز ۷۲.۶٪ در حدود ۴۰ دقیقه برای هر وظیفه، در مقایسه با ۶۵.۷٪ در حدود ۷۵ دقیقه.3
قابلیتهای استفاده از رایانه در GPT‑۶ Astra را میتوان در خروجیهای حوزههای مختلف، از جمله توسعه بازی، مهندسی برق و کارهای دانشی روزمره مشاهده کرد:
در کنار Astra، ما همچنین چارچوب آزمون Codex را بروز رسانی میکنیم تا سرعت استفاده از رایانه را به طور چشمگیری بهبود دهیم. در ترکیب با بهره وری Astra، این امر در معیار Mind۲Web به تکمیل وظایف با سرعت ۱.۹ برابر نسبت به تجربه فعلی GPT‑۵.۶ Sol منجر میشود. بهبودهای مدل در زمینه سرعت به این معناست که میتواند بسیاری از کارهای زمانبر زندگی را برای شما، سریعتر از آنچه خودتان میتوانید، انجام دهد.4
تحولی چشمگیر در کار حرفهای
GPT‑6 Astra پیشرفتهای استفاده از رایانه را با آموزش هدفمند برای محیطهای حرفهای ترکیب میکند تا به انجام وظایف کاری پیچیده کمک کند. این مدل هوشمندی لازم برای مسائل پیچیده را با توانایی اجرای گردشکارهای چندمرحلهای و تولید اسناد، صفحات گسترده و ارائههای پرداختشده و آمادهٔ استفاده ترکیب میکند.
GPT‑۶ Astra بهترین مدل ما برای پیروی از قالبهای موجود و تولید اسلایدهایی با چیدمان مناسب است که نکات کلیدی را با روایتی ساختار یافته و به اختصار منتقل میکنند. این ابزار اسناد، ارائهها، صفحه گستردهها و تحلیلهایی شفاف و خوش ساختار ایجاد میکند که از الگوهای شما پیروی میکنند و با سبک نوشتاری و بصری شما همخوانی دارند. Astra همچنین طوری آموزش دیده است که به طور مشخص فقط زمینهٔ مرتبط را در خروجیها بیاورد، نه اینکه اطلاعاتی را که برای کارِ پیشرو ضروری نیستند تکرار کند. همهٔ اینها به این معناست که میتواند خروجیهایی قابل استفادهتر و آمادهتر تولید کند که با زمینهٔ کسب و کار و استانداردهای شما همخوانی دارند.
GPT‑6 Astra همچنین توان قضاوت بصری بهتری در وبسایتها، بازیها، برنامهها و رندرهایی که میسازد ارائه میدهد. با سایتها(در یک پنجره جدید باز میشود) در ChatGPT، Astra میتواند مستقیماً از طریق یک اعلان وبسایتها، اپلیکیشنهای وب و بازیها را ایجاد، میزبانی و به اشتراک بگذارد.
وقتی دستورالعملها جای تفسیر باقی میگذارند، GPT‑6 Astra در اتخاذ تصمیم درست از مدلهای پیشین بهتر عمل میکند. وقتی دستورالعملها جای تفسیر باقی میگذارند، GPT‑6 Astra در تصمیمگیری درست از مدلهای پیشین بهتر عمل میکند. در Codex، میتواند بهصورت ناهمگام سؤال بپرسد و به کاری که به پاسخ شما وابسته نیست ادامه دهد. اگر پاسخ ندهید، هرجا مناسب باشد با فرضهای معقول کار را پیش میبرد، اما برای تصمیمهای مهمی که پیامد قابلتوجهی دارند منتظر نظر شما میماند.
مثالهای زیر نشان میدهند که Astra چگونه در انجام کارهای روزمرهای با شما همکاری میکند که نبود برخی اطلاعات میتواند پاسخ را بهطور قابلتوجهی تغییر دهد.
Astra همچنین در حفظ جهتگیری، همزمان با تکامل یافتن وظیفه، عملکرد بهتری دارد. مدلهای قبلی گاهی پیامهای راهبری را بهعنوان هدفی جدید تلقی میکردند و درخواست اصلی یا محدودیتهای پیشین را از نظر دور میداشتند. Astra الزامات جدید را در نظر میگیرد، در صورت درخواست مسیر خود را تغییر میدهد و به پرسشهای جانبی پاسخ میدهد، بدون آنکه کار کلی را رها کند.
برنامهنویسی
GPT‑۶ Astra بهترین مدل تا به امروز برای مهندسی نرم افزار است.
«GPT‑6 Astra در بنچمارکهای داخلی کدنویسی ما عملکردی در سطح پیشرفتهترین مدلها ارائه میدهد و در مقایسه با GPT‑5.6 Sol، در ارزیابیهای شهود معاملاتی پیشرفتی آشکار نشان میدهد. هنگام استفاده برای کدنویسی عاملمحور، GPT‑6 Astra به شیوهای ارتباط برقرار میکند که دنبالکردنش برای توسعهدهندگان آسانتر است و کدی تولید میکند که برای رسیدن به کیفیت مناسب برای محیط عملیاتی، به تکرار کمتری نیاز دارد.»
«ما Astra را در سطح تلاش پایین، متوسط و بالا روی یکی از ارزیابی های نسل اول خود آزمایش کردیم و عملکرد آن به طور چشمگیری از GPT ۵.۶ Sol بهتر بود. تلاش بیشتر، تکرارهای بیشتری روی یک ساخت جدید، اعتبار سنجی بیشتر از طریق آزمایش در مرورگر، و گرایش به اجرای کد به جای apply-patch را فراهم میکند. درک اینکه یک مدل چگونه تلاش خود را صرف میکند، راهی است که از طریق آن مسیری سریعتر و قابل اعتمادتر از ایده تا اپلیکیشنِ عملیاتی در اختیار میلیونها سازنده قرار میدهیم.»
با Astra، روش تازهای برای Codex معرفی میکنیم تا وقتی پنجرهٔ زمینه پر میشود، زمینه را حفظ کند و دوباره به آن دسترسی پیدا کند. در گذشته، مدلها برای خلاصهکردن کار در نشستهای طولانی از فشردهسازی استفاده میکردند؛ مثلاً هنگام اشکالزدایی از مسائل پیچیده یا انجام بازآراییهای بزرگ. هر بار فشردهسازی ممکن است جزئیاتی دربارهٔ اینکه چرا یک اصلاح ناموفق بوده یا یک مؤلفه چگونه رفتار میکند، از قلم بیندازد. در Codex، Astra میتواند در چند پنجرهٔ زمینه یادداشت نگه دارد و جزئیات انباشتهشده را بدون اینکه بارها آنها را در یک خلاصهٔ واحد فشرده کند، حفظ کند. پنجرههای زمینهٔ قبلی همچنان قابل جستوجو میمانند؛ بنابراین Astra میتواند الزامات یا نتایج آزمون را از پیامهای قبلی و خروجی ابزارها پیدا کند—حتی اگر آن اطلاعات در یادداشتهایش ثبت نشده باشند. میتوانید این قابلیت آزمایشی را در فایل config.toml مربوط به Codex خود،(در یک پنجره جدید باز میشود) فعال کنید. و طی هفتههای آینده، برای Astra به حالت پیشفرض تبدیل خواهد شد.
پیشبرد اکتشافات علمی
Astra میتواند در کارهای عملیِ زمینهساز کشف علمی کمک کند. با ترکیب استدلال علمی و استفاده از رایانه، میتواند مستقیماً در نرمافزارهای تخصصی کار کند، دادهها را بررسی و نتایج را کاوش کند و به پژوهشگران کمک کند شواهد را ارزیابی کنند و تصمیم بگیرند در گام بعد چه چیزی را بررسی کنند.
امنیت سایبری
همانطور که در بهروزرسانی ایمنیمان توضیح دادیم، Astra جهشی چشمگیر در توانمندیهای سایبری به شمار میرود و در حوزه امنیت سایبری، معیار آستانهی بحرانی را مطابق چارچوب آمادگی ما برآورده میکند. توانایی آن در کشف و توسعه روشهای بهرهبرداری از آسیبپذیریهای روز صفر میتواند به مدافعان کمک کند این ضعفها را شناسایی و برطرف کنند، اما در عین حال نیاز به تدابیر حفاظتی قویتر را نیز به همراه دارد. برای سنجش گستره این توانمندیها، Astra را در مجموعهای از ارزیابیهای تخصصی داخلی و ارزیابیهای انجامشده توسط طرفهای ثالث آزمودیم.
ابتدا مدل را بدون تدابیر حفاظتی محیط عملیاتی روی ExploitBench و ExploitGym آزمایش کردیم؛ این بنچمارکها میسنجند که آیا مدلها میتوانند آسیبپذیریهای شناختهشدهٔ نرمافزار را به اکسپلویتهای عملی تبدیل کنند یا نه. در ExploitBench، Astra امتیاز کامل ۱۰۰% را کسب کرد، در مقایسه با امتیاز ۷۸.۵% برای GPT‑۵.۶ Sol، مدل پیشین ما با قابلیتهای سایبری پیشرو. در ExploitGym، Astra با استفاده از تعداد بسیار کمتری توکن خروجی، به نرخ موفقیت ۴۲.۴٪ دست یافت؛ در حالی که نرخ موفقیت GPT‑۵.۶ Sol برابر با ۳۰.۳٪ بود.13
با توجه به نگرانیها مبنی بر اینکه مواجهه با آسیبپذیریهای نرمافزاری گذشته ممکن است بر نتایج بنچمارک تأثیر گذاشته باشد، Astra را روی دو بنچمارک جدید نیز ارزیابی کردیم. برای یکی از آنها، ارزیابی داخلی «ExploitBench (ژوئن تا اوت ۲۰۲۶)» را طراحی کردیم تا توسعهٔ اکسپلویت را با استفاده از آسیبپذیریهای سه ماه گذشته آزمایش کنیم.14 Astra در این مجموعهداده، با استفاده از توکنهای خروجی بسیار کمتر به نرخ اجرای کد دلخواه بهمراتب بالاتری از GPT‑5.6 Sol دست یافت. در جریان ارزیابی، Astra حتی دو آسیبپذیری روز صفر را که پیشتر ناشناخته بودند کشف کرد و به کار گرفت. هر دو آسیبپذیری را به توسعهدهندگان مسئول نگهداری آنها اطلاع میدهیم.
ما همچنین Astra را در SRE-Bench15 آزمایش کردیم؛ بنچمارکی که میسنجد آیا مدلها میتوانند بدون دسترسی به کد منبع خام، باینریهای نرمافزاری را مهندسی معکوس کنند و منطق اصلی آنها را درک کنند یا نه. Astra در یک تلاش ۸۸.۰٪ از وظایف و ظرف چهار تلاش ۹۹.۲٪ از آنها را حل کرد؛ این ارقام برای GPT‑۵.۶ Sol بهترتیب ۵۵.۹٪ و ۶۸.۷٪ بودند.
فراتر از بنچمارکها، ارزیابیهای انجامشده به رهبری کارشناسان نشان داد که Astra، هنگامی که بدون تمهیدات حفاظتی محیط تولید اجرا شود، میتواند از آسیبپذیریهای پیشتر ناشناخته برای دستیابی به اجرای کد دلخواه در مرورگرهای مقاومسازیشده استفاده کند و اکسپلویتهای ارتقای سطح دسترسی برای سیستمعاملهای مقاومسازیشده ایجاد کند.
همانطور که در پنجره مدافع بحث کردیم، قابلیتهای پیشرفتهٔ سایبری میتوانند به مدافعان کمک کنند ضعفها را سریعتر پیدا کنند، اما در عین حال بهرهبرداری از آن ضعفها را هم آسانتر میکنند و لزوم سازگاری سریعتر مدافعان را افزایش میدهند. با نسخهٔ Astra که امروز عرضه میشود، مدافعان میتوانند از آن برای انجام کارهایی مانند بازبینی امنیتی کد و اعمال وصله استفاده کنند.
با این حال، Astra از انجام وظایف پیشرفتهتر امنیت سایبری، مانند ساخت نمونههای اثبات مفهوم برای بهرهبرداری از آسیبپذیریها، خودداری میکند. از طریق OpenAI Daybreak، قصد داریم در هفتههای آینده دسترسی را گسترش دهیم و سازوکارهای حفاظتی با محدودیتهای کمتر را عرضه کنیم. این امر امکان استفاده از گردشکارهای دفاعی بیشتری را فراهم میکند، از جمله اعتبارسنجی آسیبپذیریها و نمونههای اثبات مفهوم، تحلیل بدافزار و مهندسی تشخیص
همچنین با تکیه بر لایههای حفاظتی GPT‑5.6 Sol، تدابیر خود را برای مقابله با سوءاستفادههای احتمالی سایبری تقویت کردهایم. این اقدامات شامل افزایش مقاومت مدل در برابر تلاشهای احتمالی برای دور زدن سازوکارهای ایمنی و فراهم کردن اطلاعات زمینهای بیشتر برای سامانههای پایش ماست. آزمونهای دقیق داخلی و خارجی، از جمله ارزیابیهای خودکار با کمک متخصصان داخلی تیم قرمز ما که نقش مهاجم را شبیهسازی میکنند، را ادامه دادهایم. برای آگاهی از جزئیات بیشتر درباره تدابیر حفاظتی سایبری و آزمونهای ما، به نمای کلی ایمنی و کارت سیستم(در یک پنجره جدید باز میشود) Astra مراجعه کنید.
همسو سازی و استقرار GPT‑۶ Astra به صورت مسئولانه
Astra همراستاترین مدل ما است. Astra در بهکارگیری دقت و احتیاط، رعایت حدود وظایف و برقراری ارتباط شفاف عالی عمل میکند. این کار، تازهترین دستاورد برنامه پژوهشی دیرینه ما است که بر آموزش مدلهایی متمرکز است که از ابتدا تا انتها با نیت انسانی همراستا باقی میمانند.
در محیطهای حساس، Astra با احتیاطی متناسب با میزان ریسک موجود اقدام میکند. در ارزیابیای از وظایف استفاده از رایانه که بهصورت خصمانه برای برانگیختن رفتار نادرست انتخاب شده بودند، Astra در جلوگیری از پیامدهای ناخواسته موفقتر بود. اجرا با تدابیر امنیتی اضافیای که بهصورت پیشفرض ارائه میشدند، عملکردی حتی قویتر به همراه داشت.
Astra نسبت به هر مدل پیشروی دیگری که آزمایش شده است، پیامدهای ناهمراستای کمتری ایجاد میکند. برای مقایسهای منصفانه، ما از یک چارچوب آزمون عمومیِ عامل کامپیوتری استفاده کردیم (بر اساس ابزارهای بومیِ استفاده از کامپیوتر که هم در API پاسخهای OpenAI(در یک پنجره جدید باز میشود) و هم در API پیامهای Anthropic(در یک پنجره جدید باز میشود) در دسترس هستند) و بدون محافظتهای اضافیای که معمولاً برای کاربران Codex و ChatGPT کار بهکار گرفته میشوند (بازبینی خودکار، خطمشی تأیید).
Astra همچنین با احتمال بیشتری در چارچوب محدودیتهایی عمل میکند که کاربر تعیین کرده یا محیط بهطور ضمنی ایجاب میکند. در یک ارزیابی داخلی، Astra هرگز تلاش نکرد رد بازبینی خودکار Codex را دور بزند. این وضعیت حتی زمانی نیز برقرار بود که Auto-review عمداً بهگونهای پیکربندی شده بود که قابل دور زدن باشد و بدون دور زدن آن، تکمیل کار ناممکن بود. این رعایت محدودیتهای محیط با نتایج ارزیابی وظایف سایبری ناممکن ما، که در مقدمه این پست به اشتراک گذاشتیم، و دیگر یافتههای مستندشده در کارت سیستم(در یک پنجره جدید باز میشود) ما همخوانی دارد.
Astra همچنین در زمینه ارتباط شفاف با کاربران، معیارهای تازهای تعیین میکند. در یکی از ارزیابیها، احتمال بروز این رفتار در Astra سه برابر کمتر از GPT‑5.6 بود. در یکی از ارزیابیها، Astra در مقایسه با GPT‑5.6 Sol سه برابر کمتر احتمال داشت درباره توانمندیها و امکانات خود اطلاعات نادرستی ارائه دهد.
در ارزیابی ما از توهم گویی درباره قابلیتها، Astra در مقایسه با GPT‑۵.۶ Sol بهبود چشمگیری نشان میدهد و ادعاهای گمراه کننده کمتری درباره قابلیتهای خود مطرح میکند.
ارزیابیهای ما نشان دادند که پایش استدلال مکتوب Astra دشوارتر از استدلال مکتوب GPT‑5.6 Sol است؛ این نتیجه بر اساس آزمونهایی به دست آمده که صراحتاً از مدل خواسته بودند از پایش بگریزد. این موضوع را به کنترل بیشتر Astra بر استدلال مکتوب در وظایف سادهتر و توانایی آن در حل مسائل با مراحل مکتوب کمتر نسبت میدهیم. Astra همچنان ظاهراً در پنهانکردن استدلال موردنیاز برای وظایف پیچیده مشکل دارد، اما ما این کاهش را جدی میگیریم. بهبود قابلیت نظارت همچنان یک اولویت پژوهشی است و کارت سیستم(در یک پنجره جدید باز میشود) همراه، یافتهها و فعالیتهای مستمر ما را شرح میدهد.
آموزش همسوسازی، یکی از ارکان اصلی رویکرد ما در استقرار مدلهاست. برای افزودن یک لایه حفاظتی دیگر، از سازوکارهای ایمنی در سطح سیستم نیز استفاده میکنیم؛ مانند بازبینی خودکار(در یک پنجره جدید باز میشود) Codex و پایش نحوه استدلال و عملکرد عاملها، تا رفتارهای ناایمن زودتر شناسایی و مهار شوند. همانطور که در بهروزرسانی ایمنیمان توضیح دادیم، در مدلهای همرده Astra از پایش ناهمسویی در محیط عملیاتی نیز استفاده میکنیم تا دید بهتری از موارد ناهمسویی داشته باشیم و شدیدترین نمونههای آن را مهار کنیم. این سازوکارهای حفاظتی مشابه پایشی هستند که در استقرارهای داخلی خود انجام میدهیم و از مجموعهای از طبقهبندها استفاده میکنند تا استدلال و اقدامات مدل را از نظر رفتارهای غیرمجاز بررسی کرده و فعالیتهای مشکوک به غیرمجاز بودن را بهطور خودکار متوقف کنند.
با توجه به افزایش چشمگیر قابلیتهای امنیت سایبری Astra، ما با دقت ویژهای عمل میکنیم تا این استقرار ایمن و امن باشد. بررسیهای ایمنیِ اضافی گاهی میتوانند کارهای مشروع، از جمله امنیت سایبری دفاعی، را کند، موقتاً متوقف یا متوقف کنند. اگر وظیفهای در ChatGPT یا Codex متوقف شود، ممکن است از شما خواسته شود پیش از ادامه، اقدام را بازبینی کنید. در API، وظیفه متوقف خواهد شد. این بررسیها گاهی ممکن است کارهای مجاز را مختل کنند، و ما همچنان به بهبود و اصلاح مداوم این سیستم ادامه میدهیم تا وقفههای غیر ضروری را کاهش دهیم. پایش ناهمراستایی نمیتواند جایگزین همراستاسازی شود: هدف ما ساخت مدلهایی است که بهطور قابل اعتماد در محدوده مجاز خود باقی بمانند، تا این تمهیدات حفاظتی نیازی به مداخله نداشته باشند.
در دسترس بودن
GPT‑6 Astra اکنون برای مجموعۀ محدودی از سازمانها عرضه میشود و طی روزهای آینده برای همۀ کاربران ChatGPT Plus، Pro، Business و Enterprise، و همچنین از طریق OpenAI API، Microsoft Azure و AWS Bedrock در دسترس خواهد بود. استفاده از Astra در سهمیههای فعلی اشتراک لحاظ شده است—علاوه بر این، کاربران و کسبوکارها میتوانند برای استفادهٔ بیشتر اعتبار بخرند. کاربران طرحهای Pro، Business و Enterprise نیز به GPT‑6 Astra Pro دسترسی خواهند داشت. مدیران Enterprise میتوانند Astra را برای فضای کاری خود فعال کنند؛ در زمان عرضه، دسترسی بهطور پیشفرض غیرفعال است.
Astra از قابلیت «عدم نگهداری داده» برای مشتریان واجد شرایط API پشتیبانی میکند و همانطور که ماه گذشته اعلام کردیم، در حال آزمایش Private Safety Processing هستیم تا ضمن حفظ حریم خصوصی مشتریان، پایش ایمنی را تقویت کنیم.
برای توسعهدهندگان، GPT‑6 Astra با شناسهی gpt-6-astra در API OpenAI و همچنین از طریق Microsoft Azure و Amazon Bedrock در دسترس خواهد بود.
قیمت استاندارد API OpenAI، ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است. برای خواندن از کش و نوشتن در کش، نرخهای جداگانهای اعمال میشود حالت سریع برای GPT‑۶ Astra در API در دسترس است و با قیمتی دو برابر حالت استاندارد، تا دو برابر سرعت پردازش استاندارد را ارائه میدهد.
حرفهای
حرفهای | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable ۵.۱ | Claude Fable ۵ | Claude Opus ۵ | Gemini ۳.۸ Flash |
AutomationBench | ۴۱٫۴٪ | ۱۸٫۱٪ | ۳۱.۴% | ۱۷.۴% | ۲۶.۹% | - |
BenchCAD | ۹۵.۹% | 83.3% | ۸۴٫۳٪ 5 | ۶۷.۵% 5 | ۸۲٫۱٪ 5 | - |
BrowseComp | ۹۱.۵٪ | ۹۰.۴٪ | - | ۸۷.۴٪ | ۹۰.۸% | - |
کوارتتهای زهی OpenScore (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
وظایف طراحی (داخلی) | 50.0% | ۴۷.۴% | - | ۳۵.۸% | - | - |
وظایف داخلی علم داده | ۴۰.۹% | ۳۰.۵% | - | ۳۴.۷٪ | - | - |
شاخص هوشمندی تحلیل هوش مصنوعی نسخه ۴.۱.۱ | 61.2 | ۶۰٫۹ | ۶۵.۷ | 62.1 | ۶۳.۱ | 58.7 |
برنامهنویسی
| برنامهنویسی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1%"DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% | ||||||
| FrontierCode 1.1 Extended (امتیاز) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3%"FrontierCode 1.1 Main (امتیاز) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6%"وظایف داخلی انتقال پایگاه داده | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| شاخص عامل برنامهنویسی Artificial Analysis نسخه ۱.۴ | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
دانشگاهی
دانشگاهی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable ۵.۱ | Claude Fable ۵ | Claude Opus ۵ | Gemini ۳.۸ Flash |
Terminal-Bench علوم ۰.۱ | ۶۴.۶% | ۲۲٫۴٪ | ۵۲٫۶٪ | 21.4% | 30.0% | - |
FrontierMath رده ۴ (نسخه ۲) | ۹۷.۶% | ۸۳.۰٪ | ۸۷.۸% | ۹۰.۲% | ۷۳.۲% | - |
GPQA Diamond | ۹۶.۰٪ | ۹۴.۶% | 93.7% | 92.6% | 93.7% | 95.3% |
آخرین آزمون بشریت (با ابزارها) | 57.2% | - | ۶۵.۰% | ۶۳.۸% | ۶۳.۶٪ | - |
همراستایی
همراستایی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable ۵.۱ | Claude Fable ۵ | Claude Opus ۵ | Gemini 3.8 Flash |
بنچمارک داخلی ایمنی استفاده از رایانه (هرچه کمتر باشد بهتر است) | ۲.۴% | 22.0% | ۹٫۵٪ | 18.3% | 11.5% | - |
معیار ایمنی استفاده داخلی از رایانه، با AutoReview (هرچه کمتر باشد بهتر است) | 1.8٪ | ۴٫۳٪ | - | - | - | - |
بنچمارک داخلیِ دور زدن (هرچه کمتر باشد بهتر است) | 0.00% | 0.29% | - | - | - | - |
هانی پات ExploitGym (هرچه کمتر باشد بهتر است) | 0.0% | 48.2% | - | - | - | - |
Impossible ExploitGym | ۱۰۰.۰٪ | - | - | - | - | - |
بنچمارک داخلی توهم (هرچه کمتر باشد بهتر است) | ۴.۲٪ | ۱۲.۲٪ | - | - | - | - |
متن طولانی
متن طولانی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable ۵.۱ | Claude Fable ۵ | Claude Opus ۵ | Gemini 3.8 Flash |
OpenAI MRCR v2 ۸ سوزن ۲۵۶ هزار–۵۱۲ هزار | ۱۰۰.۰٪ | ۹۱.۵٪ | - | - | - | - |
OpenAI MRCR v2 ۸ سوزن ۵۱۲ هزار–۱ میلیون | ۹۶.۳٪ | ۷۳.۸٪ | - | - | - | - |
استدلال انتزاعی
| استدلال انتزاعی | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
امتیازهای ارزیابی در هر سطحی از تلاش، حداکثر هستند. ارزیابیهای GPT در محیط تحقیقاتی ما یا از طریق API ما انجام شدند که ممکن است به دلیل تفاوت در پرامپتهای سیستمی، ابزارهای در دسترس و موارد مشابه، خروجی کمی متفاوت از محیط تولیدی ChatGPT ارائه دهند.
پاورقیها
- 1
در ARC-AGI-۳، GPT-۶ Astra با چارچوب آزمون API پاسخهای ما اجرا شد که دو تنظیم را تغییر میدهد تا تطابق بهتری با عملکرد در دنیای واقعی داشته باشد. این تغییرات بهطور خاص ARC-AGI-۳ را هدف قرار نمیدهند.
- 2
GPT-5.6 Sol به نسخهای اشاره دارد که در API ما، ChatGPT Codex و ChatGPT کار در دسترس است. نسخه موجود در چت ChatGPT کمی متفاوت است.
- 3
OSWorld V2-Offline زیرمجموعهای از OSWorld V2 اصلی است که بدون دسترسی به اینترنت کار میکند. عملکرد مدل Claude در OSWorld-V۲ Offline توسط نویسندگان در جدول رتبهبندی رسمی(در یک پنجره جدید باز میشود) بازتولید شد. در OSWorld ۲.۰، برای محاسبهٔ امتیازهای Claude از تنظیمات رسمی استفاده میشود، نه از وظایف تغییریافته و نمرهدهی تغییریافتهٔ کارت سیستم Fable ۵.۱.
- 4
- 5
در BenchCAD، امتیازهای Claude بازتابدهنده ۳ تغییر در ارزیابی هستند که در کارت سیستم Fable ۵.۱(در یک پنجره جدید باز میشود) شرح داده شدهاند.
- 6
گوانگ یانگ، ویکتوریا ایبرت، ناظف تامر، برایان سییوان ژنگ، لوئیزا پوتزوبون، و نوآ اِی. اسمیت. «LEGATO: رویکردی تعمیمپذیر، انتهابهانتها و در مقیاس بزرگ برای OMR حروفچینیشده(در یک پنجره جدید باز میشود).» arXiv:2506.19065، 2025.
- 7
Mark R. H. Gotham، Maureen Redbond، Bruno Bower، و Peter Jonas. «پیکرهٔ کوارتتهای زهی OpenScore(در یک پنجره جدید باز میشود).» مجموعه مقالات دهمین کنفرانس بینالمللی کتابخانههای دیجیتال برای موسیقیشناسی، صص. 49–57. ACM، 2023.
- 8
در FrontierCode، GPT-6 Astra با پیامی از توسعهدهنده اجرا شد که مشابه بخشی از پیام توسعهدهندهٔ آن در Codex(در یک پنجره جدید باز میشود) بود: "از ایجاد تعداد بیش از حد فایلهای آزمایشی پرهیز کنید. فقط زمانی یک فایل آزمایشی جدید ایجاد کنید که قراردادهای محل نگهداری آن را ایجاب کند یا هیچ فایل موجودی محل مناسبی نباشد. از پاکسازیهای نامرتبط و پیچیدگی غیرضروری پرهیز کنید. از ابزارهای کمکی موجود و مناسب استفادهٔ مجدد کنید. دستورالعملهای مرتبط محل نگهداری را بخوانید و کد، آزمونها، مستندات و CI نزدیک را بررسی کنید. از قواعد جاافتاده پیروی کنید. هدف، کدی تمیز و قابل ادغام است." اعلان برای ارزیابی بهینهسازی نشده بود.
- 9
اولی به این میپردازد که اعداد اول، هرقدر هم روی خط اعداد پیش بروید، تا چه حد میتوانند نزدیک به هم ظاهر شوند. برای بیش از یک دهه، بهترین نتیجهٔ شناختهشده ثابت میکرد که بینهایت جفت از اعداد اول وجود دارند که اختلافشان حداکثر ۲۴۶ است. یولیا اشتادلمن(در یک پنجره جدید باز میشود) اخیراً آن کران را به ۲۴۰ بهبود داد. آسترا کمک کرد کران قویتری برابر با ۱۸۶ تعیین شود، که نشان میدهد بینهایت جفت درون این فاصلهٔ کوچکتر رخ میدهند. شکافهای کوتاه بین اعداد اول: اثبات(در یک پنجره جدید باز میشود) و پژوهشهای پشتیبان(در یک پنجره جدید باز میشود).
- 10
مورد دوم مربوط به فاصلههای بهطور غیرمعمول بزرگ میان اعداد اول است. آسترا عبارتی را در کرانی برای این فاصلهها بهبود داد؛ عبارتی که بیش از 80 سال بدون تغییر مانده بود. ما اثباتها، زنجیره تفکر خلاصهشده و مستندات راستیآزمایی را برای هر دو نتیجه به اشتراک میگذاریم. شکافهای بزرگ بین اعداد اول: اثبات(در یک پنجره جدید باز میشود) و پژوهشهای پشتیبان(در یک پنجره جدید باز میشود).
- 11
- 12
- 13
- 14
در ارزیابی ExploitBench (ژوئن – اوت ۲۰۲۶)، ۲۰ آسیبپذیری امنیتی مهم در موتور V8 در ۱۳ نسخه پایدار Chrome بررسی شده است. این آزمون ارزیابی میکند که آیا عاملها قادرند با بهرهبرداری از هر آسیبپذیری مشخص، به قابلیت اجرای کد دلخواه در V8 و نسخههای رسمی Chrome برای لینوکس دست پیدا کنند. برخی از آسیبپذیریهای بررسیشده ممکن است در چارچوب محدودیتهای ارزیابی، به اجرای کد دلخواه منجر نشوند؛ بنابراین رسیدن به موفقیت ۱۰۰٪ تضمینشده نیست. توجه: امتیاز ۵٫۵٪ GPT-5.6 Sol ناشی از اثر محدودیت ۳۰۰ نوبتی در این ارزیابی است؛ محدودیتی که کاربران واقعی استفادهکننده از طرح max با آن مواجه نیستند. این مدل در شرایط مشابه و با محدودیتهای کمتر، امتیاز ۱۱٫۵٪ به دست آورد.
- 15
جرمی اسپنس و همکاران. «چالش بعدی برای امنیت سایبری عاملمحور: یک محک واقعگرایانه و عاری از آلودگی برای مهندسی معکوس(در یک پنجره جدید باز میشود).» arXiv:2608.11469v1, 2026.
- 16
هنگامی که مدلهای شخص ثالث را آزمایش میکنیم، از یک تنظیم پژوهشی سادهتر استفاده میکنیم. Codex پیکربندی تولیدی پیچیدهتری دارد که میتواند به نرخهای متفاوت خطای مدل خام منجر شود. تدابیر حفاظتی سمت ارائهدهنده و پیادهسازیهای ابزار رایانه نیز همچنان متفاوتاند. کاربران سناریوی بدون تأیید را در Codex تجربه نمیکنند، زیرا این یک پیکربندی پژوهشی داخلی است.
- 17
