پرش به محتوای اصلی
OpenAI

معرفی GPT‑6 Sol و Luna

راه‌های بیشتر برای به‌کارگیری هوشمندی پیشرو در کارهای روزمره‌تان.

در حال بارگذاری…

اوایل این ماه، GPT‑6 Astra را معرفی کردیم؛ هوشمندترین و همسوترین مدل جهان. هرچند پروژه‌های بسیار دشوار و مهم همچنان به تمام ظرفیت Astra نیاز دارند، کارها در مقیاس‌ها، ضرب‌آهنگ‌ها و بودجه‌های متفاوتی انجام می‌شوند.

به همین دلیل، جهان GPT‑6 را با GPT‑6 Sol و GPT‑6 Luna گسترش می‌دهیم. GPT‑6 Astra نسل تازه‌ای از هوشمندی را معرفی کرد؛ این مدل‌ها با پیش‌برد مرز بهره‌وری هزینه، دسترسی به مزایای آن هوشمندی را گسترش می‌دهند. GPT‑6 Sol و Luna را با روش‌هایی مشابه GPT‑6 Astra آموزش دادیم تا پیشرفت‌های زیربنای عملکرد پیشرو Astra در کار حرفه‌ای، صحت اطلاعات، کدنویسی، کار با رایانه و همسوسازی به مدل‌هایی سریع‌تر و مقرون‌به‌صرفه‌تر منتقل شوند.

مدل‌های GPT‑6 در سراسر منحنی هزینه–هوشمندی پیشتازند و قابلیت‌های استثنایی هر رده را با زیرساختی ترکیب می‌کنند که آن‌ها را در مقیاس وسیع و به‌شکلی کارآمد ارائه می‌دهد. بهبودهای حافظهٔ نهان و استنتاج، ارائهٔ این مدل‌ها را با هزینه‌ای کمتر ممکن کرده‌اند و ما با کاهش ۵۰ درصدی قیمت API برای Sol و Luna نسبت به قیمت‌گذاری تبلیغاتی GPT‑5.6، این صرفه‌جویی را مستقیماً به کاربران و مشتریان منتقل می‌کنیم. این بهبودها در کنار هم، استفادهٔ گسترده از هوش مصنوعی پیشرفته را برای وظایف و کاربردهای روزمرهٔ بیشتری عملی می‌کنند.

قیمت‌گذاری API مدل GPT‑6

مدل

ورودی

خروجی

کاهش قیمت

GPT‑6 Sol
در برابر GPT‑5.6 Sol

$4 ← $2

$20 ← $10

۵۰٪ ارزان‌تر

GPT‑6 Luna
در برابر GPT‑5.6 Luna

$0.20 ← $0.10

$1.20 ← $0.50

۵۰٪ ارزان‌تر

قیمت‌ها به‌ازای هر ۱ میلیون توکن هستند.

GPT‑6 Astra همچنان از هر نظر بهترین مدل ماست. وقتی بهترین نتایج و تجربه‌ای بی‌کم‌وکاست می‌خواهید، آن را انتخاب کنید.

پیشرفتی در سراسر خانوادهٔ مدل‌ها

GPT‑6 Sol و Luna، ارتقای هوشمندی و بهره‌وری هزینه را در قابلیت‌هایی که بیشترین کاربرد را برای انجام کارهای پیچیده دارند، به مدل‌هایی می‌آورند که از قبل می‌شناسید و استفاده می‌کنید.

کار حرفه‌ای

GPT‑6 Sol می‌تواند وظایف کاری دشوار را انجام دهد و با سقف استفادهٔ بالاتر و هزینهٔ کمتر، فضای بیشتری برای تکرار و اصلاح در اختیارتان بگذارد. همچنین در مقایسه با مدل‌های رقیب هم‌قیمت، هوشمندی بیشتر و نتایج بهتری ارائه می‌دهد.

در AutomationBench، که گردش‌کارهای تجاری میان برنامه‌ها را می‌آزماید، GPT‑6 Sol با تلاش بسیار بالا و تنها ۹٪ هزینهٔ هر وظیفهٔ Opus 5، از Claude Opus 5 با تلاش Max بهتر عمل می‌کند. GPT‑6 Luna در سطح تلاش بالا، با هزینهٔ هر وظیفهٔ ۵۸٪ کمتر، نسبت به مدل پیشین خود ۵٫۴ واحد درصد بهبود دارد.

در AutomationBench 1.0.6⁠(در یک پنجره جدید باز می‌شود)، عامل‌های هوش مصنوعی در گردش‌کارهای سرتاسری با استفاده از ۴۷ ابزار در حوزه‌های فروش، بازاریابی، عملیات، پشتیبانی، مالی و منابع انسانی آزمایش می‌شوند. نقطه‌دادهٔ Claude Fable 5.1 هزینهٔ واقعی آن را کمتر نشان می‌دهد، زیرا هزینهٔ استفاده از Opus 5 به‌عنوان پشتیبان در حدود ۴۰٪ وظایف را در نظر نمی‌گیرد.

GPT‑6 Sol همچنین با هزینه‌ای بسیار کمتر از Claude Fable 5.1 پیشی می‌گیرد و حتی GPT‑6 Astra با تلاش کم را نیز شکست می‌دهد.

مدل (و سطح تلاش)

امتیاز

هزینهٔ هر وظیفه

GPT‑6 Sol (بسیار بالا)

33.2%

$0.27

GPT‑6 Astra (کم)

30.3%

۳٫۹ برابر GPT‑6 Sol

Claude Opus 5 (Max)

26.9%

۱۱٫۱ برابر GPT‑6 Sol

Claude Fable 5.1 با پشتیبان Opus 5 (Max)

31.4%

>۸٫۹ برابر GPT‑6 Sol

(هزینهٔ پشتیبان گزارش نشده است)

در آزمون نهایی عامل‌ها که عامل‌ها را در گردش‌کارهای پیچیدهٔ حرفه‌ای ارزیابی می‌کند، GPT‑6 Sol با تلاش Max امتیاز ۵۶٫۴٪ را کسب می‌کند؛ بالاتر از بهترین امتیاز Claude Opus 5 در این ارزیابی و با هزینهٔ هر وظیفهٔ ۶۰٪ کمتر.

در آزمون نهایی عامل‌ها V1⁠(در یک پنجره جدید باز می‌شود)، عامل‌های هوش مصنوعی در وظایف بلندمدت و ارزشمند اقتصادی در ۵۵ زیربخش ارزیابی می‌شوند که بیشتر حوزه‌های اصلی کار حرفه‌ای رایانه‌محور را پوشش می‌دهند.

صحت اطلاعات

سودمندی هر پاسخ به درستی واقعیت‌های آن بستگی دارد و ما همچنان در افزایش قابلیت اطمینان اطلاعات پیشرفت می‌کنیم. در ارزیابی داخلی صحت اطلاعات ما که بر گفت‌وگوهای واقعی و هویت‌زدایی‌شده‌ای مبتنی است که کاربران در آن‌ها اشتباه مدل‌هایمان را گزارش کرده‌اند، GPT‑6 Sol تقریباً نصف مدل پیشین خود اشتباه می‌کند و با هزینه‌ای بسیار کمتر به قابلیت اطمینان Astra نزدیک می‌شود. GPT‑6 Luna نیز بهبود چشمگیری دارد؛ در سطوح تلاش بالاتر، با حدود یک‌صدم هزینه با GPT‑5.6 Sol برابری می‌کند.

در اینجا صحت اطلاعات را در گفت‌وگوهای هویت‌زدایی‌شدهٔ ChatGPT ارزیابی می‌کنیم که کاربران در آن‌ها خطای اطلاعاتی یک مدل قبلی را گزارش کرده بودند. این گفت‌وگوهای خطازا نمایندهٔ استفادهٔ معمول نیستند؛ خطاهای اطلاعاتی در استفادهٔ معمول نادرترند. امتیازها با توجه به طول تعدیل نشده‌اند، اما بررسی‌های ما در سطوح مختلف پرگویی تقریباً هیچ وابستگی‌ای به طول پاسخ نشان نداد.

کدنویسی

امسال، عامل‌های کدنویسی انجام وظایفی پیچیده‌تر، گسترده‌تر و طولانی‌تر از همیشه را آغاز کرده‌اند. در OpenAI، استفادهٔ داخلی ما به‌صورت نمایی رشد کرده است. بر اساس قیمت‌های API، ارزش مصرف روزانهٔ توکن برای پژوهشگر میانه از ۶۰۰ دلار و برای پژوهشگران صدک نودم از ۷٬۰۰۰ دلار فراتر رفته است (شتاب‌دهی به پژوهش: نگاهی از درون OpenAI⁠). با بر عهده گرفتن وظایف طولانی‌تر و دشوارتر توسط عامل‌های کدنویسی، هزینهٔ استفادهٔ مداوم اهمیت بیشتری پیدا می‌کند. GPT‑6 Sol و Luna عملکرد قدرتمند کدنویسی را با قیمت‌های پایین‌تر API ترکیب می‌کنند تا توسعه‌دهندگان فضای بیشتری برای تکرار و اصلاح داشته باشند و تیم‌ها با اطمینان بیشتری وظایف بلندپروازانه‌تر را به Codex بسپارند.

در FrontierCode که بررسی می‌کند آیا عامل‌های کدنویسی تغییرات آمادهٔ ادغام در پایگاه‌های کد واقعی تولید می‌کنند یا نه، GPT‑6 Sol نسبت به GPT‑5.6 Sol بهبود چشمگیری دارد و با هزینه‌ای بسیار کمتر با Claude Fable 5.1 در سطح تلاش بسیار بالا برابری می‌کند.

در FrontierCode 1.1 Main⁠(در یک پنجره جدید باز می‌شود)، عامل‌های هوش مصنوعی کدی می‌نویسند که افزون بر درستی، از نظر «قابلیت ادغام» نیز ارزیابی می‌شود؛ برای مثال کیفیت آزمون‌ها، رعایت محدوده، سبک کد و پایبندی به استانداردهای پایگاه کد.

در DeepSWE v1.1، که عملکرد در وظایف پیچیدهٔ مهندسی نرم‌افزار در پایگاه‌های کد واقعی را می‌سنجد، GPT‑6 Sol با تلاش Max امتیاز ۶۸٫۸٪ می‌گیرد؛ تنها ۱٫۱ واحد درصد کمتر از بهترین امتیاز Claude Fable 5 در این ارزیابی، یعنی ۶۹٫۹٪ با تلاش بسیار بالا، و با هزینهٔ هر وظیفهٔ حدود ۸۰٪ کمتر.

GPT‑6 Luna با تلاش Max امتیاز ۶۶٫۶٪ می‌گیرد که با Claude Opus 5 و Fable 5 در سطح تلاش متوسط قابل مقایسه است. در این مقایسه‌ها، هزینهٔ هر وظیفه برای Luna از Opus 5 حدود ۹۳٪ و از Fable 5 حدود ۹۶٪ کمتر است.

در DeepSWE 1.1⁠(در یک پنجره جدید باز می‌شود)، عامل‌های هوش مصنوعی وظایف اصیل و بلندمدت مهندسی نرم‌افزار را حل می‌کنند.

کار با رایانه

با اینکه GPT‑6 Astra همچنان بهترین مدل جهان برای کار با رایانه است، GPT‑6 Sol و Luna عملکردی مقرون‌به‌صرفه‌تر از مدل‌های پیشین خود ارائه می‌دهند. در نسخهٔ آفلاین OSWorld 2.0، GPT‑6 Sol با تلاش بسیار بالا امتیازی مشابه Claude Opus 5 با تلاش متوسط کسب می‌کند—۶۰٫۵٪ در برابر ۶۰٫۳٪—و هزینهٔ هر وظیفهٔ آن حدود ۸۰٪ کمتر است. GPT‑6 Luna در سطح Max با یک‌دهم هزینه می‌تواند از GPT‑5.6 Sol در سطح متوسط پیشی بگیرد.

در OSWorld 2.0⁠(در یک پنجره جدید باز می‌شود)، عامل‌های هوش مصنوعی گردش‌کارهای بلندمدت کار با رایانه را در وظایف روزمره و حرفه‌ای انجام می‌دهند. ما پاداش جزئی مجموعهٔ آفلاین نسخهٔ v2026.08.08 را گزارش می‌کنیم.

سبک همکاری

سبک ارتباطی بهبودیافتهٔ GPT‑6 Astra را نیز به Sol و Luna آورده‌ایم؛ تغییری که به‌نظرمان به‌ویژه در گفت‌وگوهای فنی و کدنویسی محسوس خواهد بود. انتظار شفافیت بیشتر، اصطلاحات تخصصی کمتر، عبارت‌های نامأنوس و جزئیات کم‌ارزش کمتر و در مجموع پاسخ‌هایی اندکی کوتاه‌تر را داشته باشید، بی‌آنکه از محتوای مفید کاسته شود.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

با اینکه سبک امری سلیقه‌ای است، ما در اینجا پاسخ GPT‑6 Sol را ترجیح می‌دهیم. این پاسخ به آن سرعت نتیجه‌گیری نمی‌کند، برای تکرار جزئیاتی که شاید برای پرسشگر بدیهی باشند وقت کمتری می‌گذارد (مثلاً اینکه وب‌سایت چهار صفحه دارد)، از عبارت‌های مبهم کمتری استفاده می‌کند (مانند «حال‌وهوای بنتو» و «بازطراحی… بر پایهٔ آن سیستم»)، دربارهٔ مواردی که بررسی کرده یا نکرده صریح‌تر است و جزئیات اجرایی غیرضروری مانند اعلان ابزار تصویر خود را بیان نمی‌کند.

بهبود حافظهٔ نهان برای عامل‌ها و گفت‌وگوهای طولانی

در کنار کاهش قیمت توکن‌ها، به توسعه‌دهندگانی که محصولات خود را بر پایهٔ GPT‑6 می‌سازند کمک می‌کنیم در هزینهٔ زمینه‌ای که برنامه‌هایشان دوباره استفاده می‌کنند نیز بیشتر صرفه‌جویی کنند. ذخیره‌سازی پرامپت در حافظهٔ نهان را برای GPT‑6 بهبود داده‌ایم تا به‌طور پیش‌فرض نرخ برخورد بالاتری با حافظهٔ نهان داشته باشد؛ در نتیجه عامل‌ها می‌توانند از زمینهٔ بیشتری دوباره استفاده کنند، سریع‌تر پاسخ دهند و برای خواندن توکن‌های ورودی ذخیره‌شده ۹۰٪ تخفیف بگیرند.

توسعه‌دهندگان همچنین راه‌های بیشتری برای سنجش و بهینه‌سازی عملکرد حافظهٔ نهان خود دارند:

GitHub گزارش می‌دهد که طی چند ماه گذشته، این بهبودها در میلیاردها درخواست به مدل‌های OpenAI، سهم توکن‌های اعلان نیازمند پردازش تازه را بیش از ۵۰٪ کاهش داده و به Copilot کمک کرده‌اند سریع‌تر پاسخ دهد.

ادامهٔ بهبود همسوسازی

GPT‑6 Sol و Luna بر دستاوردهای همسوسازی معرفی‌شده با Astra، همسوترین مدل ما تا امروز، بنا شده‌اند. در ارزیابی‌های همسوسازی ما، Sol و Luna هر دو نسبت به نمونه‌های GPT‑5.6 خود بهبود نشان می‌دهند؛ از جمله نرخ پایین‌تر ادعاهای گمراه‌کننده دربارهٔ کار کدنویسی‌شان.

ارزیابی‌های زیر عمداً موقعیت‌های دشوار را می‌آزمایند و نرخ شکست در استفادهٔ معمول را اندازه نمی‌گیرند. برای نتایج کامل، کارت سیستم⁠(در یک پنجره جدید باز می‌شود) را ببینید.

دسترسی‌پذیری

GPT‑6 Sol و GPT‑6 Luna از امروز در ChatGPT کار و Codex برای همهٔ کاربران Plus، Pro، Business، Enterprise و Edu در دسترس‌اند. کاربران Free و Go می‌توانند در برنامهٔ دسکتاپ به GPT‑6 Luna دسترسی داشته باشند. این مدل‌ها هنوز در چت در دسترس نیستند. در API پلتفرم OpenAI، این مدل‌ها با نام‌های gpt-6-sol و gpt-6-luna در دسترس‌اند.

برای حفظ پایداری سرویس برای همه، قصد داریم این مدل‌ها را در طول امروز به‌تدریج در ChatGPT عرضه کنیم. اگر مدل‌های جدید را در ChatGPT کار یا Codex نمی‌بینید، لطفاً بعداً دوباره امتحان کنید.


ارزیابی‌های GPT در محیط پژوهشی ما یا از طریق API انجام شدند؛ به‌دلیل تفاوت در اعلان‌های سیستمی، ابزارهای موجود و موارد دیگر، خروجی این محیط‌ها ممکن است کمی با نسخهٔ عملیاتی ChatGPT تفاوت داشته باشد. ارزیابی مدل‌های رقیب از گزارش‌های عمومی گرفته شده است. هرجا امتیاز Claude Fable 5.1 موجود نبود، امتیاز Claude Fable 5 گزارش شده است.

نویسنده

OpenAI