معرفی GPT‑6 Sol و Luna
راههای بیشتر برای بهکارگیری هوشمندی پیشرو در کارهای روزمرهتان.
اوایل این ماه، GPT‑6 Astra را معرفی کردیم؛ هوشمندترین و همسوترین مدل جهان. هرچند پروژههای بسیار دشوار و مهم همچنان به تمام ظرفیت Astra نیاز دارند، کارها در مقیاسها، ضربآهنگها و بودجههای متفاوتی انجام میشوند.
به همین دلیل، جهان GPT‑6 را با GPT‑6 Sol و GPT‑6 Luna گسترش میدهیم. GPT‑6 Astra نسل تازهای از هوشمندی را معرفی کرد؛ این مدلها با پیشبرد مرز بهرهوری هزینه، دسترسی به مزایای آن هوشمندی را گسترش میدهند. GPT‑6 Sol و Luna را با روشهایی مشابه GPT‑6 Astra آموزش دادیم تا پیشرفتهای زیربنای عملکرد پیشرو Astra در کار حرفهای، صحت اطلاعات، کدنویسی، کار با رایانه و همسوسازی به مدلهایی سریعتر و مقرونبهصرفهتر منتقل شوند.
مدلهای GPT‑6 در سراسر منحنی هزینه–هوشمندی پیشتازند و قابلیتهای استثنایی هر رده را با زیرساختی ترکیب میکنند که آنها را در مقیاس وسیع و بهشکلی کارآمد ارائه میدهد. بهبودهای حافظهٔ نهان و استنتاج، ارائهٔ این مدلها را با هزینهای کمتر ممکن کردهاند و ما با کاهش ۵۰ درصدی قیمت API برای Sol و Luna نسبت به قیمتگذاری تبلیغاتی GPT‑5.6، این صرفهجویی را مستقیماً به کاربران و مشتریان منتقل میکنیم. این بهبودها در کنار هم، استفادهٔ گسترده از هوش مصنوعی پیشرفته را برای وظایف و کاربردهای روزمرهٔ بیشتری عملی میکنند.
مدل | ورودی | خروجی | کاهش قیمت |
GPT‑6 Sol | $4 ← $2 | $20 ← $10 | ۵۰٪ ارزانتر |
GPT‑6 Luna | $0.20 ← $0.10 | $1.20 ← $0.50 | ۵۰٪ ارزانتر |
قیمتها بهازای هر ۱ میلیون توکن هستند.
GPT‑6 Astra همچنان از هر نظر بهترین مدل ماست. وقتی بهترین نتایج و تجربهای بیکموکاست میخواهید، آن را انتخاب کنید.
GPT‑6 Sol و Luna، ارتقای هوشمندی و بهرهوری هزینه را در قابلیتهایی که بیشترین کاربرد را برای انجام کارهای پیچیده دارند، به مدلهایی میآورند که از قبل میشناسید و استفاده میکنید.
GPT‑6 Sol میتواند وظایف کاری دشوار را انجام دهد و با سقف استفادهٔ بالاتر و هزینهٔ کمتر، فضای بیشتری برای تکرار و اصلاح در اختیارتان بگذارد. همچنین در مقایسه با مدلهای رقیب همقیمت، هوشمندی بیشتر و نتایج بهتری ارائه میدهد.
در AutomationBench، که گردشکارهای تجاری میان برنامهها را میآزماید، GPT‑6 Sol با تلاش بسیار بالا و تنها ۹٪ هزینهٔ هر وظیفهٔ Opus 5، از Claude Opus 5 با تلاش Max بهتر عمل میکند. GPT‑6 Luna در سطح تلاش بالا، با هزینهٔ هر وظیفهٔ ۵۸٪ کمتر، نسبت به مدل پیشین خود ۵٫۴ واحد درصد بهبود دارد.
در AutomationBench 1.0.6(در یک پنجره جدید باز میشود)، عاملهای هوش مصنوعی در گردشکارهای سرتاسری با استفاده از ۴۷ ابزار در حوزههای فروش، بازاریابی، عملیات، پشتیبانی، مالی و منابع انسانی آزمایش میشوند. نقطهدادهٔ Claude Fable 5.1 هزینهٔ واقعی آن را کمتر نشان میدهد، زیرا هزینهٔ استفاده از Opus 5 بهعنوان پشتیبان در حدود ۴۰٪ وظایف را در نظر نمیگیرد.
GPT‑6 Sol همچنین با هزینهای بسیار کمتر از Claude Fable 5.1 پیشی میگیرد و حتی GPT‑6 Astra با تلاش کم را نیز شکست میدهد.
مدل (و سطح تلاش) | امتیاز | هزینهٔ هر وظیفه |
|---|---|---|
GPT‑6 Sol (بسیار بالا) | 33.2% | $0.27 |
GPT‑6 Astra (کم) | 30.3% | ۳٫۹ برابر GPT‑6 Sol |
Claude Opus 5 (Max) | 26.9% | ۱۱٫۱ برابر GPT‑6 Sol |
Claude Fable 5.1 با پشتیبان Opus 5 (Max) | 31.4% | >۸٫۹ برابر GPT‑6 Sol (هزینهٔ پشتیبان گزارش نشده است) |
در آزمون نهایی عاملها که عاملها را در گردشکارهای پیچیدهٔ حرفهای ارزیابی میکند، GPT‑6 Sol با تلاش Max امتیاز ۵۶٫۴٪ را کسب میکند؛ بالاتر از بهترین امتیاز Claude Opus 5 در این ارزیابی و با هزینهٔ هر وظیفهٔ ۶۰٪ کمتر.
در آزمون نهایی عاملها V1(در یک پنجره جدید باز میشود)، عاملهای هوش مصنوعی در وظایف بلندمدت و ارزشمند اقتصادی در ۵۵ زیربخش ارزیابی میشوند که بیشتر حوزههای اصلی کار حرفهای رایانهمحور را پوشش میدهند.
سودمندی هر پاسخ به درستی واقعیتهای آن بستگی دارد و ما همچنان در افزایش قابلیت اطمینان اطلاعات پیشرفت میکنیم. در ارزیابی داخلی صحت اطلاعات ما که بر گفتوگوهای واقعی و هویتزداییشدهای مبتنی است که کاربران در آنها اشتباه مدلهایمان را گزارش کردهاند، GPT‑6 Sol تقریباً نصف مدل پیشین خود اشتباه میکند و با هزینهای بسیار کمتر به قابلیت اطمینان Astra نزدیک میشود. GPT‑6 Luna نیز بهبود چشمگیری دارد؛ در سطوح تلاش بالاتر، با حدود یکصدم هزینه با GPT‑5.6 Sol برابری میکند.
در اینجا صحت اطلاعات را در گفتوگوهای هویتزداییشدهٔ ChatGPT ارزیابی میکنیم که کاربران در آنها خطای اطلاعاتی یک مدل قبلی را گزارش کرده بودند. این گفتوگوهای خطازا نمایندهٔ استفادهٔ معمول نیستند؛ خطاهای اطلاعاتی در استفادهٔ معمول نادرترند. امتیازها با توجه به طول تعدیل نشدهاند، اما بررسیهای ما در سطوح مختلف پرگویی تقریباً هیچ وابستگیای به طول پاسخ نشان نداد.
امسال، عاملهای کدنویسی انجام وظایفی پیچیدهتر، گستردهتر و طولانیتر از همیشه را آغاز کردهاند. در OpenAI، استفادهٔ داخلی ما بهصورت نمایی رشد کرده است. بر اساس قیمتهای API، ارزش مصرف روزانهٔ توکن برای پژوهشگر میانه از ۶۰۰ دلار و برای پژوهشگران صدک نودم از ۷٬۰۰۰ دلار فراتر رفته است (شتابدهی به پژوهش: نگاهی از درون OpenAI). با بر عهده گرفتن وظایف طولانیتر و دشوارتر توسط عاملهای کدنویسی، هزینهٔ استفادهٔ مداوم اهمیت بیشتری پیدا میکند. GPT‑6 Sol و Luna عملکرد قدرتمند کدنویسی را با قیمتهای پایینتر API ترکیب میکنند تا توسعهدهندگان فضای بیشتری برای تکرار و اصلاح داشته باشند و تیمها با اطمینان بیشتری وظایف بلندپروازانهتر را به Codex بسپارند.
در FrontierCode که بررسی میکند آیا عاملهای کدنویسی تغییرات آمادهٔ ادغام در پایگاههای کد واقعی تولید میکنند یا نه، GPT‑6 Sol نسبت به GPT‑5.6 Sol بهبود چشمگیری دارد و با هزینهای بسیار کمتر با Claude Fable 5.1 در سطح تلاش بسیار بالا برابری میکند.
در FrontierCode 1.1 Main(در یک پنجره جدید باز میشود)، عاملهای هوش مصنوعی کدی مینویسند که افزون بر درستی، از نظر «قابلیت ادغام» نیز ارزیابی میشود؛ برای مثال کیفیت آزمونها، رعایت محدوده، سبک کد و پایبندی به استانداردهای پایگاه کد.
در DeepSWE v1.1، که عملکرد در وظایف پیچیدهٔ مهندسی نرمافزار در پایگاههای کد واقعی را میسنجد، GPT‑6 Sol با تلاش Max امتیاز ۶۸٫۸٪ میگیرد؛ تنها ۱٫۱ واحد درصد کمتر از بهترین امتیاز Claude Fable 5 در این ارزیابی، یعنی ۶۹٫۹٪ با تلاش بسیار بالا، و با هزینهٔ هر وظیفهٔ حدود ۸۰٪ کمتر.
GPT‑6 Luna با تلاش Max امتیاز ۶۶٫۶٪ میگیرد که با Claude Opus 5 و Fable 5 در سطح تلاش متوسط قابل مقایسه است. در این مقایسهها، هزینهٔ هر وظیفه برای Luna از Opus 5 حدود ۹۳٪ و از Fable 5 حدود ۹۶٪ کمتر است.
در DeepSWE 1.1(در یک پنجره جدید باز میشود)، عاملهای هوش مصنوعی وظایف اصیل و بلندمدت مهندسی نرمافزار را حل میکنند.
با اینکه GPT‑6 Astra همچنان بهترین مدل جهان برای کار با رایانه است، GPT‑6 Sol و Luna عملکردی مقرونبهصرفهتر از مدلهای پیشین خود ارائه میدهند. در نسخهٔ آفلاین OSWorld 2.0، GPT‑6 Sol با تلاش بسیار بالا امتیازی مشابه Claude Opus 5 با تلاش متوسط کسب میکند—۶۰٫۵٪ در برابر ۶۰٫۳٪—و هزینهٔ هر وظیفهٔ آن حدود ۸۰٪ کمتر است. GPT‑6 Luna در سطح Max با یکدهم هزینه میتواند از GPT‑5.6 Sol در سطح متوسط پیشی بگیرد.
در OSWorld 2.0(در یک پنجره جدید باز میشود)، عاملهای هوش مصنوعی گردشکارهای بلندمدت کار با رایانه را در وظایف روزمره و حرفهای انجام میدهند. ما پاداش جزئی مجموعهٔ آفلاین نسخهٔ v2026.08.08 را گزارش میکنیم.
سبک ارتباطی بهبودیافتهٔ GPT‑6 Astra را نیز به Sol و Luna آوردهایم؛ تغییری که بهنظرمان بهویژه در گفتوگوهای فنی و کدنویسی محسوس خواهد بود. انتظار شفافیت بیشتر، اصطلاحات تخصصی کمتر، عبارتهای نامأنوس و جزئیات کمارزش کمتر و در مجموع پاسخهایی اندکی کوتاهتر را داشته باشید، بیآنکه از محتوای مفید کاسته شود.
با اینکه سبک امری سلیقهای است، ما در اینجا پاسخ GPT‑6 Sol را ترجیح میدهیم. این پاسخ به آن سرعت نتیجهگیری نمیکند، برای تکرار جزئیاتی که شاید برای پرسشگر بدیهی باشند وقت کمتری میگذارد (مثلاً اینکه وبسایت چهار صفحه دارد)، از عبارتهای مبهم کمتری استفاده میکند (مانند «حالوهوای بنتو» و «بازطراحی… بر پایهٔ آن سیستم»)، دربارهٔ مواردی که بررسی کرده یا نکرده صریحتر است و جزئیات اجرایی غیرضروری مانند اعلان ابزار تصویر خود را بیان نمیکند.
در کنار کاهش قیمت توکنها، به توسعهدهندگانی که محصولات خود را بر پایهٔ GPT‑6 میسازند کمک میکنیم در هزینهٔ زمینهای که برنامههایشان دوباره استفاده میکنند نیز بیشتر صرفهجویی کنند. ذخیرهسازی پرامپت در حافظهٔ نهان را برای GPT‑6 بهبود دادهایم تا بهطور پیشفرض نرخ برخورد بالاتری با حافظهٔ نهان داشته باشد؛ در نتیجه عاملها میتوانند از زمینهٔ بیشتری دوباره استفاده کنند، سریعتر پاسخ دهند و برای خواندن توکنهای ورودی ذخیرهشده ۹۰٪ تخفیف بگیرند.
توسعهدهندگان همچنین راههای بیشتری برای سنجش و بهینهسازی عملکرد حافظهٔ نهان خود دارند:
نظارت و عیبیابی. داشبورد ذخیرهسازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز میشود) نشان میدهد چه مقدار از ورودی ذخیره شده و این مقدار چگونه در طول زمان تغییر میکند. ابزار عیبیابی(در یک پنجره جدید باز میشود) توضیح میدهد چه فرصتهایی برای ذخیرهسازی در حافظهٔ نهان از دست رفتهاند و چه چیزهایی باید اصلاح شوند.
تنظیم میزان تلاش استدلال و دسترسی ابزارها بدون از بین بردن حافظهٔ نهان. برای وظایف دشوارتر میزان تلاش استدلال(در یک پنجره جدید باز میشود) را افزایش دهید یا برای پرسشهای تکمیلی سادهتر آن را کاهش دهید و همزمان با تغییر نیازهای عامل خود، ابزارها را فعال یا غیرفعال کنید(در یک پنجره جدید باز میشود). اکنون هر دو کنترل، زمینهٔ قبلی را برای استفادهٔ دوباره از حافظهٔ نهان حفظ میکنند.
بهینهسازی پیشوندهایی که در حافظهٔ نهان ذخیره میشوند. نقاط توقف صریح به توسعهدهندگان امکان میدهند محل پایان پیشوندهای اعلان ذخیرهشده در حافظهٔ نهان را انتخاب کنند. این قابلیت کنترل بیشتری بر استفادهٔ دوباره از حافظهٔ نهان به توسعهدهندگان میدهد و میتواند عملکرد را بهبود بخشد.
GitHub گزارش میدهد که طی چند ماه گذشته، این بهبودها در میلیاردها درخواست به مدلهای OpenAI، سهم توکنهای اعلان نیازمند پردازش تازه را بیش از ۵۰٪ کاهش داده و به Copilot کمک کردهاند سریعتر پاسخ دهد.
GPT‑6 Sol و Luna بر دستاوردهای همسوسازی معرفیشده با Astra، همسوترین مدل ما تا امروز، بنا شدهاند. در ارزیابیهای همسوسازی ما، Sol و Luna هر دو نسبت به نمونههای GPT‑5.6 خود بهبود نشان میدهند؛ از جمله نرخ پایینتر ادعاهای گمراهکننده دربارهٔ کار کدنویسیشان.
ارزیابیهای زیر عمداً موقعیتهای دشوار را میآزمایند و نرخ شکست در استفادهٔ معمول را اندازه نمیگیرند. برای نتایج کامل، کارت سیستم(در یک پنجره جدید باز میشود) را ببینید.
GPT‑6 Sol و GPT‑6 Luna از امروز در ChatGPT کار و Codex برای همهٔ کاربران Plus، Pro، Business، Enterprise و Edu در دسترساند. کاربران Free و Go میتوانند در برنامهٔ دسکتاپ به GPT‑6 Luna دسترسی داشته باشند. این مدلها هنوز در چت در دسترس نیستند. در API پلتفرم OpenAI، این مدلها با نامهای gpt-6-sol و gpt-6-luna در دسترساند.
برای حفظ پایداری سرویس برای همه، قصد داریم این مدلها را در طول امروز بهتدریج در ChatGPT عرضه کنیم. اگر مدلهای جدید را در ChatGPT کار یا Codex نمیبینید، لطفاً بعداً دوباره امتحان کنید.
ارزیابیهای GPT در محیط پژوهشی ما یا از طریق API انجام شدند؛ بهدلیل تفاوت در اعلانهای سیستمی، ابزارهای موجود و موارد دیگر، خروجی این محیطها ممکن است کمی با نسخهٔ عملیاتی ChatGPT تفاوت داشته باشد. ارزیابی مدلهای رقیب از گزارشهای عمومی گرفته شده است. هرجا امتیاز Claude Fable 5.1 موجود نبود، امتیاز Claude Fable 5 گزارش شده است.


