GPT-6.1Sol
هوشمندی نزدیک به Astra با یکپنجم قیمت، برای عملکردی پایدار در سطح پیشرو
GPT‑6.1 Sol را معرفی میکنیم؛ نسخهٔ ارتقایافتهٔ GPT‑6 Sol با عملکردی فوقالعاده قدرتمند در کدنویسی عاملمحور و همچنین کار با رایانه و کارهای حرفهای. این مدل در وظایف دشوار، Sol را به GPT‑6 Astra نزدیکتر میکند، آن هم با یکپنجم قیمت استاندارد توکنهای ورودی و خروجی Astra؛ بنابراین توسعهدهندگان با همان بودجه، دست بازتری برای ساخت و اجرای عاملهای توانمند دارند.
GPT‑6.1 Sol عملکردی نزدیک به Astra را با قیمت Sol ارائه میدهد و از نظر نسبت عملکرد به هزینه، بهصرفهترین مدل موجود امروز است. هزینهٔ ورودی ذخیرهشده در حافظهٔ نهان فقط ۰٫۱۰ دلار بهازای هر یک میلیون توکن است؛ یعنی ۹۵٪ تخفیف نسبت به قیمت استاندارد ورودی. این قیمت، بارهای کاری عاملمحوری را که در درخواستهای مکرر به استفادهٔ مجدد از زمینه نیاز دارند، مقرونبهصرفهتر میکند.
GPT‑6 Astra در مجموع همچنان توانمندترین مدل پیشرو ماست. GPT‑6.1 Sol توازن تازهای میان توانمندی و هزینه ایجاد میکند؛ هم برای کارهای مهمی که کاربران میخواهند بیشتر انجام دهند و هم برای مشتریان API که برنامهها را در مقیاس گسترده میسازند و اجرا میکنند.

GPT‑6.1 Sol در کارهای حرفهای پیچیده، از نوشتن و اشکالزدایی کد تا درک اسناد و اجرای گردشکارهای چندمرحلهای کسبوکار، نسبت به GPT‑6 Sol پیشرفت چشمگیری دارد. در چندین مورد از این ارزیابیها، با هزینهای بهمراتب کمتر به عملکرد GPT‑6 Astra نزدیک میشود.
در DeepSWE v1.1 که وظایف پیچیدهٔ مهندسی نرمافزار را در پایگاههای کد واقعی ارزیابی میکند، GPT‑6.1 Sol با حدود یکپنجم هزینه به عملکرد GPT‑6 Astra میرسد. همچنین با تلاش استدلالی و هزینهٔ کمتر، بهترین امتیاز GPT‑6 Sol را ۶٫۴ واحد درصد پشت سر میگذارد.
در DeepSWE 1.1(در یک پنجره جدید باز میشود)، عاملهای هوش مصنوعی وظایف جدید و بلندمدت مهندسی نرمافزار را انجام میدهند.
در GDP.pdf که دقت پاسخ مدلها به پرسشهای حرفهای با استفاده از اسناد پیچیدهٔ PDF، شامل جدولها، نمودارها، طرحها و جزئیات ریزنوشت را میسنجد، GPT‑6.1 Sol در تنظیمات استدلالیِ آزمایششده، با کمتر از نصف هزینهٔ هر وظیفه، امتیازی بالاتر از Opus 5.5 با گزینههای جایگزین کسب میکند. همچنین با حدود یکپنجم هزینهٔ هر وظیفه، به عملکرد برتر GPT‑6 Astra نزدیک میشود.
در GDP.pdf(در یک پنجره جدید باز میشود)، مدلها باید به درخواستهای واقعی دربارهٔ فایلهای PDF پیچیدهای پاسخ دهند که از فرایندهای کاری حرفهای در حوزههای مالی، سلامت، حقوق و هفت حوزهٔ تخصصی دیگر برگرفته شدهاند.
در AutomationBench که تکمیل صحیح گردشکارهای چندمرحلهای کسبوکار توسط عاملها را میسنجد، GPT‑6.1 Sol در سطح تلاش استدلالی متوسط، با حدود یکسوم هزینه، ۲٫۲ واحد درصد بیشتر از Opus 5.5 امتیاز میگیرد. این امتیاز همچنین ۴٫۸ واحد درصد بالاتر از امتیاز GPT‑6 Sol با همان تنظیمات است.
In AutomationBench 1.0.6(در یک پنجره جدید باز میشود), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol در وظایفی که به تعامل با برنامههای رایانهای نیاز دارند نیز پیشرفت چشمگیری داشته است. در مجموعهٔ آفلاین OSWorld 2.0 که عاملها را در گردشکارهای دشوارِ کار با رایانه ارزیابی میکند، GPT‑6.1 Sol با حداکثر تلاش استدلالی و کمتر از نصف هزینه، هفت واحد درصد بهتر از GPT‑6 Sol عمل میکند. با حداکثر تلاش استدلالی، فاصلهٔ امتیاز آن با Astra به ۲٫۱ واحد درصد میرسد، درحالیکه هزینهٔ هر وظیفه حدود یکهفتم است.
In OSWorld 2.0(در یک پنجره جدید باز میشود), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
در Terminal-Bench Science 0.1 که گردشکارهای علمی شامل تحلیل داده، شبیهسازی و اثبات قضیه را ارزیابی میکند، GPT‑6.1 Sol با حداکثر تلاش استدلالی و کمتر از نصف هزینهٔ هر وظیفه، بیش از دو برابر GPT‑6 Sol امتیاز میگیرد. با حداکثر تلاش، هزینهٔ متوسط هر وظیفه برای GPT‑6.1 Sol برابر با ۵٫۴۷ دلار است؛ در مقایسه با ۲۳٫۲۱ دلار برای Opus 5.5 و ۲۳٫۸۰ دلار برای Astra. به این ترتیب، توانمندی علمی چشمگیری با بیش از ۷۵٪ هزینهٔ کمتر نسبت به هر یک از این دو مدل ارائه میدهد.
GPT‑6 Astra همچنان با امتیاز ۶۸٫۱٪ بالاترین امتیاز را در میان مدلهای آزمایششده دارد و برای دشوارترین وظایف پژوهش علمی باید از آن استفاده کرد.
در Terminal-Bench Science 0.1(در یک پنجره جدید باز میشود)، عاملها با استفاده از کد و ابزارهای ترمینال، فرایندهای پژوهش علمی، از جمله تحلیل دادهها، اجرای شبیهسازیها و برازش مدلها را به انجام میرسانند.
GPT‑6.1 Sol دقت اطلاعات در پاسخ به پرامپتهای دشوار را نیز بهبود میبخشد. در سطح تلاش استدلالی بسیار بالا، نرخ خطای اطلاعاتی آن ۴٫۱٪ است؛ کمتر از نرخ ۴٫۵٪ در GPT‑6 Sol و نزدیکتر به نرخ ۴٫۰٪ در Astra با همان تنظیمات. در عین حال، هزینهٔ هر وظیفه حدود ۸۳٪ کمتر از Astra است.
این ارزیابی، سهم پاسخهای دارای دستکم یک خطای اطلاعاتی را در گفتگوهای هویتزداییشدهای میسنجد که در آنها کاربران خطای مدل قبلی را گزارش کردهاند. این پرامپتها عمداً دشوار انتخاب شدهاند و نمایندهٔ استفادهٔ معمول نیستند.
ما صحت اطلاعات را با استفاده از گفتگوهای هویتزداییشدهٔ ChatGPT ارزیابی میکنیم که در آنها کاربران خطایی در اطلاعات ارائهشده توسط مدل قبلی گزارش کرده بودند. این گفتگوهای خطازا نمایندهٔ استفادهٔ معمول نیستند؛ در استفادهٔ معمول، خطاهای اطلاعاتی نادرترند.
GPT‑6.1 Sol در ارزیابیهای همسویی ما نسبت به GPT‑6 Sol پیشرفت چشمگیری نشان میدهد و به GPT‑6 Astra نزدیکتر میشود.
GPT‑6.1 Sol دربارهٔ محدودیتهای خود شفافتر است و در رعایت قصد کاربر و محدودیتهای ایمنی قابلاعتمادتر عمل میکند. در ارزیابیهای چالشبرانگیز، نرخ شکست آن در شفافیت دربارهٔ خرابی ابزارهای جستجو، رعایت محدودیتهای صریح و پرهیز از پیامدهای غیرمجاز هنگام انجام وظایف عاملمحور، کمتر از GPT‑6 Sol است. هیچ تلاشی برای دور زدن بازبین خودکار ایمنی مشاهده نکردیم؛ نتیجهای مشابه GPT‑6 Astra و GPT‑6 Sol.
ارزیابیهای زیر عمداً شرایط چالشبرانگیز را میآزمایند و نرخ شکست در استفادهٔ معمول را اندازهگیری نمیکنند.
GPT‑6.1 Sol از امروز در ChatGPT کار و Codex برای همهٔ کاربران Plus، Pro، Business، Enterprise و Edu در دسترس است. این مدلها هنوز در چت در دسترس نیستند. توسعهدهندگان میتوانند از طریق API OpenAI نیز با شناسهٔ gpt-6.1-sol به آن دسترسی داشته باشند. قیمتهای استاندارد آن در API بهازای هر یک میلیون توکن عبارتاند از: ۲ دلار برای ورودی، ۰٫۱۰ دلار برای ورودی ذخیرهشده در حافظهٔ نهان و ۱۰ دلار برای خروجی.
همزمان، GPT‑6 Astra Ultrafast، سریعترین مدل پیشرو جهان با سرعتی تا ۸ برابر GPT‑6 Astra، و همچنین GPT‑6.1 Sol Ultrafast را عرضه میکنیم. این مدلها در API و همچنین در ChatGPT کار و Codex برای کاربران ردهٔ جدید Pro با بالاترین سقف استفاده، به قیمت ماهانه ۵۰۰ دلار در دسترساند. با GPT‑6.1 Sol Ultrafast، توسعهدهندگان میتوانند با هزینهای تقریباً برابر با هزینهٔ قبلی GPT‑6 Astra در API، به هوشمندی نزدیک به Astra با سرعتی تا ۸ برابر دست یابند.

