پرش به محتوای اصلی
OpenAI

GPT-6.1Sol

هوشمندی نزدیک به Astra با یک‌پنجم قیمت، برای عملکردی پایدار در سطح پیشرو

GPT‑6.1 Sol را معرفی می‌کنیم؛ نسخهٔ ارتقایافتهٔ GPT‑6 Sol با عملکردی فوق‌العاده قدرتمند در کدنویسی عامل‌محور و همچنین کار با رایانه و کارهای حرفه‌ای. این مدل در وظایف دشوار، Sol را به GPT‑6 Astra نزدیک‌تر می‌کند، آن هم با یک‌پنجم قیمت استاندارد توکن‌های ورودی و خروجی Astra؛ بنابراین توسعه‌دهندگان با همان بودجه، دست بازتری برای ساخت و اجرای عامل‌های توانمند دارند.

GPT‑6.1 Sol عملکردی نزدیک به Astra را با قیمت Sol ارائه می‌دهد و از نظر نسبت عملکرد به هزینه، به‌صرفه‌ترین مدل موجود امروز است. هزینهٔ ورودی ذخیره‌شده در حافظهٔ نهان فقط ۰٫۱۰ دلار به‌ازای هر یک میلیون توکن است؛ یعنی ۹۵٪ تخفیف نسبت به قیمت استاندارد ورودی. این قیمت، بارهای کاری عامل‌محوری را که در درخواست‌های مکرر به استفادهٔ مجدد از زمینه نیاز دارند، مقرون‌به‌صرفه‌تر می‌کند.

GPT‑6 Astra در مجموع همچنان توانمندترین مدل پیشرو ماست. GPT‑6.1 Sol توازن تازه‌ای میان توانمندی و هزینه ایجاد می‌کند؛ هم برای کارهای مهمی که کاربران می‌خواهند بیشتر انجام دهند و هم برای مشتریان API که برنامه‌ها را در مقیاس گسترده می‌سازند و اجرا می‌کنند.

سه کارت مدل: GPT-6 Astra، هوشمندترین مدل ما برای بهترین نتایج، با هزینهٔ ورودی ۱۰ دلار، خروجی ۵۰ دلار و ورودی ذخیره‌شده در حافظهٔ نهان ۱ دلار؛ GPT-6.1 Sol، هوشمندی نزدیک به Astra با یک‌پنجم قیمت، با هزینهٔ ورودی ۲ دلار، خروجی ۱۰ دلار و ورودی ذخیره‌شده در حافظهٔ نهان ۰٫۱۰ دلار؛ GPT-6 Luna، انجام سریع و بهینهٔ کارهای روزمره در مقیاس گسترده، با هزینهٔ ورودی ۰٫۱۰ دلار، خروجی ۰٫۵۰ دلار و ورودی ذخیره‌شده در حافظهٔ نهان ۰٫۰۱ دلار.

Sol توانمندتر در انجام وظایف گوناگون

GPT‑6.1 Sol در کارهای حرفه‌ای پیچیده، از نوشتن و اشکال‌زدایی کد تا درک اسناد و اجرای گردش‌کارهای چندمرحله‌ای کسب‌وکار، نسبت به GPT‑6 Sol پیشرفت چشمگیری دارد. در چندین مورد از این ارزیابی‌ها، با هزینه‌ای به‌مراتب کمتر به عملکرد GPT‑6 Astra نزدیک می‌شود.

کدنویسی

در DeepSWE v1.1 که وظایف پیچیدهٔ مهندسی نرم‌افزار را در پایگاه‌های کد واقعی ارزیابی می‌کند، GPT‑6.1 Sol با حدود یک‌پنجم هزینه به عملکرد GPT‑6 Astra می‌رسد. همچنین با تلاش استدلالی و هزینهٔ کمتر، بهترین امتیاز GPT‑6 Sol را ۶٫۴ واحد درصد پشت سر می‌گذارد.

در DeepSWE 1.1⁠⁠(در یک پنجره جدید باز می‌شود)، عامل‌های هوش مصنوعی وظایف جدید و بلندمدت مهندسی نرم‌افزار را انجام می‌دهند.

کارهای حرفه‌ای

در GDP.pdf که دقت پاسخ مدل‌ها به پرسش‌های حرفه‌ای با استفاده از اسناد پیچیدهٔ PDF، شامل جدول‌ها، نمودارها، طرح‌ها و جزئیات ریزنوشت را می‌سنجد، GPT‑6.1 Sol در تنظیمات استدلالیِ آزمایش‌شده، با کمتر از نصف هزینهٔ هر وظیفه، امتیازی بالاتر از Opus 5.5 با گزینه‌های جایگزین کسب می‌کند. همچنین با حدود یک‌پنجم هزینهٔ هر وظیفه، به عملکرد برتر GPT‑6 Astra نزدیک می‌شود.

در GDP.pdf⁠(در یک پنجره جدید باز می‌شود)، مدل‌ها باید به درخواست‌های واقعی دربارهٔ فایل‌های PDF پیچیده‌ای پاسخ دهند که از فرایندهای کاری حرفه‌ای در حوزه‌های مالی، سلامت، حقوق و هفت حوزهٔ تخصصی دیگر برگرفته شده‌اند.

در AutomationBench که تکمیل صحیح گردش‌کارهای چندمرحله‌ای کسب‌وکار توسط عامل‌ها را می‌سنجد، GPT‑6.1 Sol در سطح تلاش استدلالی متوسط، با حدود یک‌سوم هزینه، ۲٫۲ واحد درصد بیشتر از Opus 5.5 امتیاز می‌گیرد. این امتیاز همچنین ۴٫۸ واحد درصد بالاتر از امتیاز GPT‑6 Sol با همان تنظیمات است.

In AutomationBench 1.0.6⁠⁠(در یک پنجره جدید باز می‌شود), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

کار با رایانه

GPT‑6.1 Sol در وظایفی که به تعامل با برنامه‌های رایانه‌ای نیاز دارند نیز پیشرفت چشمگیری داشته است. در مجموعهٔ آفلاین OSWorld 2.0 که عامل‌ها را در گردش‌کارهای دشوارِ کار با رایانه ارزیابی می‌کند، GPT‑6.1 Sol با حداکثر تلاش استدلالی و کمتر از نصف هزینه، هفت واحد درصد بهتر از GPT‑6 Sol عمل می‌کند. با حداکثر تلاش استدلالی، فاصلهٔ امتیاز آن با Astra به ۲٫۱ واحد درصد می‌رسد، درحالی‌که هزینهٔ هر وظیفه حدود یک‌هفتم است.

In OSWorld 2.0⁠⁠(در یک پنجره جدید باز می‌شود), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

پژوهش علمی

در Terminal-Bench Science 0.1 که گردش‌کارهای علمی شامل تحلیل داده، شبیه‌سازی و اثبات قضیه را ارزیابی می‌کند، GPT‑6.1 Sol با حداکثر تلاش استدلالی و کمتر از نصف هزینهٔ هر وظیفه، بیش از دو برابر GPT‑6 Sol امتیاز می‌گیرد. با حداکثر تلاش، هزینهٔ متوسط هر وظیفه برای GPT‑6.1 Sol برابر با ۵٫۴۷ دلار است؛ در مقایسه با ۲۳٫۲۱ دلار برای Opus 5.5 و ۲۳٫۸۰ دلار برای Astra. به این ترتیب، توانمندی علمی چشمگیری با بیش از ۷۵٪ هزینهٔ کمتر نسبت به هر یک از این دو مدل ارائه می‌دهد.

GPT‑6 Astra همچنان با امتیاز ۶۸٫۱٪ بالاترین امتیاز را در میان مدل‌های آزمایش‌شده دارد و برای دشوارترین وظایف پژوهش علمی باید از آن استفاده کرد.

در Terminal-Bench Science 0.1⁠(در یک پنجره جدید باز می‌شود)، عامل‌ها با استفاده از کد و ابزارهای ترمینال، فرایندهای پژوهش علمی، از جمله تحلیل داده‌ها، اجرای شبیه‌سازی‌ها و برازش مدل‌ها را به انجام می‌رسانند.

صحت اطلاعات

GPT‑6.1 Sol دقت اطلاعات در پاسخ به پرامپت‌های دشوار را نیز بهبود می‌بخشد. در سطح تلاش استدلالی بسیار بالا، نرخ خطای اطلاعاتی آن ۴٫۱٪ است؛ کمتر از نرخ ۴٫۵٪ در GPT‑6 Sol و نزدیک‌تر به نرخ ۴٫۰٪ در Astra با همان تنظیمات. در عین حال، هزینهٔ هر وظیفه حدود ۸۳٪ کمتر از Astra است.

این ارزیابی، سهم پاسخ‌های دارای دست‌کم یک خطای اطلاعاتی را در گفتگوهای هویت‌زدایی‌شده‌ای می‌سنجد که در آن‌ها کاربران خطای مدل قبلی را گزارش کرده‌اند. این پرامپت‌ها عمداً دشوار انتخاب شده‌اند و نمایندهٔ استفادهٔ معمول نیستند.

ما صحت اطلاعات را با استفاده از گفتگوهای هویت‌زدایی‌شدهٔ ChatGPT ارزیابی می‌کنیم که در آن‌ها کاربران خطایی در اطلاعات ارائه‌شده توسط مدل قبلی گزارش کرده بودند. این گفتگوهای خطازا نمایندهٔ استفادهٔ معمول نیستند؛ در استفادهٔ معمول، خطاهای اطلاعاتی نادرترند.

عرضهٔ ایمن GPT‑6.1 Sol

GPT‑6.1 Sol در ارزیابی‌های همسویی ما نسبت به GPT‑6 Sol پیشرفت چشمگیری نشان می‌دهد و به GPT‑6 Astra نزدیک‌تر می‌شود.

GPT‑6.1 Sol دربارهٔ محدودیت‌های خود شفاف‌تر است و در رعایت قصد کاربر و محدودیت‌های ایمنی قابل‌اعتمادتر عمل می‌کند. در ارزیابی‌های چالش‌برانگیز، نرخ شکست آن در شفافیت دربارهٔ خرابی ابزارهای جستجو، رعایت محدودیت‌های صریح و پرهیز از پیامدهای غیرمجاز هنگام انجام وظایف عامل‌محور، کمتر از GPT‑6 Sol است. هیچ تلاشی برای دور زدن بازبین خودکار ایمنی مشاهده نکردیم؛ نتیجه‌ای مشابه GPT‑6 Astra و GPT‑6 Sol.

ارزیابی‌های زیر عمداً شرایط چالش‌برانگیز را می‌آزمایند و نرخ شکست در استفادهٔ معمول را اندازه‌گیری نمی‌کنند.

قیمت و دسترسی

GPT‑6.1 Sol از امروز در ChatGPT کار و Codex برای همهٔ کاربران Plus، ‏Pro، ‏Business، ‏Enterprise و Edu در دسترس است. این مدل‌ها هنوز در چت در دسترس نیستند. توسعه‌دهندگان می‌توانند از طریق API ‏OpenAI نیز با شناسهٔ gpt-6.1-sol به آن دسترسی داشته باشند. قیمت‌های استاندارد آن در API به‌ازای هر یک میلیون توکن عبارت‌اند از: ۲ دلار برای ورودی، ۰٫۱۰ دلار برای ورودی ذخیره‌شده در حافظهٔ نهان و ۱۰ دلار برای خروجی.

هم‌زمان، GPT‑6 Astra Ultrafast، سریع‌ترین مدل پیشرو جهان با سرعتی تا ۸ برابر GPT‑6 Astra، و همچنین GPT‑6.1 Sol Ultrafast را عرضه می‌کنیم. این مدل‌ها در API و همچنین در ChatGPT کار و Codex برای کاربران ردهٔ جدید Pro با بالاترین سقف استفاده، به قیمت ماهانه ۵۰۰ دلار در دسترس‌اند. با GPT‑6.1 Sol Ultrafast، توسعه‌دهندگان می‌توانند با هزینه‌ای تقریباً برابر با هزینهٔ قبلی GPT‑6 Astra در API، به هوشمندی نزدیک به Astra با سرعتی تا ۸ برابر دست یابند.

نویسنده

OpenAI

ارزیابی‌های GPT در محیط پژوهشی ما یا از طریق API ما انجام شده‌اند. به‌دلیل تفاوت در دستورهای سیستمی، ابزارهای در دسترس، میزان تلاش و موارد دیگر، خروجی این محیط‌ها ممکن است اندکی با نسخهٔ عمومی ChatGPT متفاوت باشد. ارزیابی مدل‌های رقبا از گزارش‌های عمومی برگرفته شده است.