مرکزی مواد پر جائیں
OpenAI

GPT-6.1Sol

پانچویں حصے کی قیمت پر Astra کے قریب ذہانت، مسلسل جدید ترین کارکردگی کے لیے

ہم GPT‑6.1 Sol متعارف کرا رہے ہیں، جو GPT‑6 Sol کا بہتر ورژن ہے اور ایجنٹک کوڈنگ کے ساتھ ساتھ کمپیوٹر کے استعمال اور پیشہ ورانہ کام میں غیر معمولی کارکردگی پیش کرتا ہے. یہ مشکل کاموں میں Sol کو GPT‑6 Astra کے قریب لاتا ہے، وہ بھی Astra کے ان پٹ اور آؤٹ پٹ ٹوکن کی معیاری قیمتوں کے پانچویں حصے پر. یوں ڈویلپرز کو اسی بجٹ میں قابل ایجنٹ بنانے اور چلانے کی زیادہ گنجائش ملتی ہے.

GPT‑6.1 Sol، Sol کی قیمت پر Astra کے قریب کارکردگی فراہم کرتا ہے، اور اس طرح آج دستیاب ماڈلز میں اپنی کارکردگی کے لحاظ سے سب سے کم خرچ ماڈل ہے. کیش شدہ ان پٹ کی قیمت صرف $0.10 فی دس لاکھ ٹوکن ہے، یعنی معیاری ان پٹ قیمت سے 95% کم. اس سے ایجنٹ پر مبنی وہ کام زیادہ کفایتی ہو جاتے ہیں جن میں بار بار کی درخواستوں کے لیے سیاق و سباق کو دوبارہ استعمال کرنا پڑتا ہے.

GPT‑6 Astra مجموعی طور پر اب بھی ہمارا سب سے قابل جدید ترین ماڈل ہے. GPT‑6.1 Sol صلاحیت اور لاگت کا ایک نیا توازن فراہم کرتا ہے، ان اہم کاموں کے لیے جنہیں صارفین زیادہ بار کرنا چاہتے ہیں اور ان API صارفین کے لیے جو بڑے پیمانے پر ایپلی کیشنز بنا اور چلا رہے ہیں.

تین ماڈل کارڈ: GPT-6 Astra، بہترین نتائج کے لیے ہمارا سب سے ذہین ماڈل، ان پٹ $10، آؤٹ پٹ $50 اور کیش شدہ ان پٹ $1؛ GPT-6.1 Sol، پانچویں حصے کی قیمت پر Astra کے قریب ذہانت، ان پٹ $2، آؤٹ پٹ $10 اور کیش شدہ ان پٹ $0.10؛ GPT-6 Luna، بڑے پیمانے پر روزمرہ کام تیزی اور مؤثر انداز میں کرنے کے لیے، ان پٹ $0.10، آؤٹ پٹ $0.50 اور کیش شدہ ان پٹ $0.01.

مختلف کاموں میں زیادہ قابل Sol

کوڈ لکھنے اور اس کی خامیاں دور کرنے سے لے کر دستاویزات سمجھنے اور کئی مرحلوں والے کاروباری سلسلۂ کار انجام دینے تک، GPT‑6.1 Sol پیچیدہ پیشہ ورانہ کاموں میں GPT‑6 Sol کے مقابلے میں نمایاں بہتری لاتا ہے. ان میں سے کئی جانچوں میں یہ بہت کم لاگت پر GPT‑6 Astra کی کارکردگی کے قریب پہنچتا ہے.

کوڈنگ

DeepSWE v1.1 حقیقی کوڈ بیس میں سافٹ ویئر انجینئرنگ کے پیچیدہ کاموں کو پرکھتا ہے. اس پر GPT‑6.1 Sol تقریباً پانچویں حصے کی لاگت پر GPT‑6 Astra کی برابری کرتا ہے، جبکہ کم ریزننگ کوشش اور کم لاگت پر GPT‑6 Sol کے بہترین اسکور سے 6.4 فی صد پوائنٹس آگے نکل جاتا ہے.

DeepSWE 1.1⁠⁠(نئی ونڈو میں کھلتا ہے) میں، مصنوعی ذہانت کے ایجنٹ سافٹ ویئر انجینئرنگ کے ایسے نئے کام انجام دیتے ہیں جن کی تکمیل کے لیے طویل وقت درکار ہوتا ہے.

پیشہ ورانہ کام

GDP.pdf یہ پرکھتا ہے کہ ماڈل جدولوں، چارٹوں، خاکوں اور باریک حروف میں درج تفصیلات سمیت پیچیدہ PDF دستاویزات کی مدد سے پیشہ ورانہ سوالوں کے کتنے درست جواب دیتے ہیں. آزمائی گئی ریزننگ ترتیبات میں GPT‑6.1 Sol، متبادل طریقوں کے ساتھ استعمال کیے گئے Opus 5.5 سے زیادہ اسکور حاصل کرتا ہے، جبکہ فی کام لاگت نصف سے بھی کم ہے. یہ تقریباً پانچویں حصے کی فی کام لاگت پر GPT‑6 Astra کی اعلیٰ ترین کارکردگی کے قریب بھی پہنچتا ہے.

GDP.pdf⁠(نئی ونڈو میں کھلتا ہے) میں، ماڈلز کو مالیات، صحت، قانون اور سات دیگر پیشہ ورانہ شعبوں کے عملی کاموں سے لی گئی پیچیدہ پی ڈی ایف دستاویزات کے بارے میں حقیقی حالات پر مبنی سوالات کے جواب دینے ہوتے ہیں.

AutomationBench یہ پرکھتا ہے کہ ایجنٹ کئی مرحلوں والے کاروباری سلسلۂ کار درست طور پر مکمل کرتے ہیں یا نہیں. اس پر اوسط ریزننگ کوشش کے ساتھ GPT‑6.1 Sol، Opus 5.5 سے 2.2 فی صد پوائنٹس زیادہ اسکور حاصل کرتا ہے، وہ بھی تقریباً ایک تہائی لاگت پر. یہ اسکور اسی ترتیب پر GPT‑6 Sol سے بھی 4.8 فی صد پوائنٹس زیادہ ہے.

In AutomationBench 1.0.6⁠⁠(نئی ونڈو میں کھلتا ہے), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

کمپیوٹر کا استعمال

GPT‑6.1 Sol ایسے کاموں میں بھی نمایاں پیش رفت کرتا ہے جن کے لیے کمپیوٹر ایپلی کیشنز کے ساتھ تعامل ضروری ہوتا ہے. OSWorld 2.0 کا آف لائن مجموعہ کمپیوٹر کے استعمال کے مشکل سلسلۂ کار پر ایجنٹوں کو پرکھتا ہے. اس پر زیادہ سے زیادہ ریزننگ کوشش کے ساتھ GPT‑6.1 Sol، GPT‑6 Sol سے سات فی صد پوائنٹس بہتر کارکردگی دکھاتا ہے، جبکہ لاگت نصف سے بھی کم ہے. زیادہ سے زیادہ ریزننگ کوشش پر یہ Astra کے اسکور سے صرف 2.1 فی صد پوائنٹس پیچھے رہتا ہے، جبکہ فی کام لاگت تقریباً ساتواں حصہ ہے.

In OSWorld 2.0⁠⁠(نئی ونڈو میں کھلتا ہے), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

سائنسی تحقیق

Terminal-Bench Science 0.1 ڈیٹا کے تجزیے، نقل کاری اور قضیوں کے اثبات سمیت سائنسی سلسلۂ کار کو پرکھتا ہے. اس پر زیادہ سے زیادہ ریزننگ کوشش کے ساتھ GPT‑6.1 Sol، GPT‑6 Sol کے اسکور سے دو گنا سے بھی زیادہ حاصل کرتا ہے، جبکہ فی کام لاگت نصف سے بھی کم ہے. زیادہ سے زیادہ کوشش پر GPT‑6.1 Sol کی اوسط فی کام لاگت $5.47 ہے، جبکہ Opus 5.5 کی $23.21 اور Astra کی $23.80 ہے. یوں یہ دونوں ماڈلز سے 75% سے بھی کم لاگت پر نمایاں سائنسی صلاحیت فراہم کرتا ہے.

آزمائے گئے ماڈلز میں GPT‑6 Astra اب بھی 68.1% کے ساتھ سب سے زیادہ اسکور حاصل کرتا ہے، اور سائنسی تحقیق کے مشکل ترین کاموں کے لیے اسے استعمال کرنا چاہیے.

Terminal-Bench Science 0.1⁠(نئی ونڈو میں کھلتا ہے) میں، ایجنٹ کوڈ اور ٹرمینل کے اوزار استعمال کرکے سائنسی تحقیق کے کام مکمل کرتے ہیں، جن میں ڈیٹا کا تجزیہ، نقالی کے تجربات چلانا اور ماڈلز کو ڈیٹا کے مطابق ڈھالنا شامل ہے.

حقائق کی درستگی

GPT‑6.1 Sol مشکل ہدایات پر بھی حقائق کی درستگی بہتر بناتا ہے. انتہائی بلند ریزننگ کوشش پر اس کی حقائقی غلطیوں کی شرح 4.1% ہے، جو GPT‑6 Sol کی 4.5% شرح سے کم اور اسی ترتیب پر Astra کی 4.0% شرح کے زیادہ قریب ہے، جبکہ فی کام لاگت Astra سے تقریباً 83% کم ہے.

یہ جانچ ان جوابات کا تناسب ناپتی ہے جن میں کم از کم ایک حقائقی غلطی ہو. اس کے لیے شناختی معلومات سے پاک وہ گفتگوئیں استعمال کی جاتی ہیں جن میں صارفین نے پہلے کے ماڈل کی غلطی کی نشاندہی کی تھی. جان بوجھ کر مشکل رکھی گئی یہ ہدایات عام استعمال کی نمائندگی نہیں کرتیں.

ہم حقائق کی درستگی کو ChatGPT کی ایسی گفتگوؤں پر پرکھتے ہیں جن سے شناختی معلومات ہٹا دی گئی ہیں اور جن میں صارفین نے پچھلے ماڈل کی کسی حقائقی غلطی کی نشاندہی کی تھی. غلطیوں کا باعث بننے والی یہ گفتگوئیں عام استعمال کی نمائندگی نہیں کرتیں، جہاں حقائقی غلطیاں زیادہ کم ہوتی ہیں.

GPT‑6.1 Sol کو محفوظ انداز میں دستیاب کرنا

ہماری مطابقت کی جانچوں میں GPT‑6.1 Sol، GPT‑6 Sol کے مقابلے میں نمایاں بہتری دکھاتا ہے، جس سے یہ GPT‑6 Astra کے قریب آ جاتا ہے.

GPT‑6.1 Sol اپنی حدود کے بارے میں زیادہ شفاف ہے اور صارف کی منشا اور حفاظتی حدود کا احترام کرنے میں زیادہ قابل اعتماد ہے. مشکل جانچوں میں تلاش کے خراب ٹولز کے بارے میں شفافیت، واضح پابندیوں کی پاسداری اور ایجنٹ پر مبنی کاموں کے دوران غیر مجاز نتائج سے بچنے کے معاملے میں اس کی ناکامی کی شرح GPT‑6 Sol سے کم ہے. GPT‑6 Astra اور GPT‑6 Sol کی طرح، ہمیں خودکار حفاظتی جائزہ کار کو چکمہ دینے کی کوئی کوشش نظر نہیں آئی.

ذیل کی جانچیں جان بوجھ کر مشکل حالات کو پرکھتی ہیں اور عام استعمال میں ناکامی کی شرح نہیں ناپتیں.

قیمتیں اور دستیابی

GPT‑6.1 Sol آج سے ChatGPT کام اور Codex میں تمام Plus، Pro، Business، Enterprise اور Edu صارفین کے لیے دستیاب ہے. یہ ماڈل ابھی چیٹ میں دستیاب نہیں ہیں. ڈویلپرز اسے OpenAI API کے ذریعے gpt-6.1-sol کے نام سے بھی استعمال کر سکتے ہیں. اس کی معیاری API قیمتیں فی دس لاکھ ٹوکن کے لیے ان پٹ پر $2، کیش شدہ ان پٹ پر $0.10 اور آؤٹ پٹ پر $10 ہیں.

اس کے ساتھ ہم GPT‑6 Astra Ultrafast بھی متعارف کرا رہے ہیں، جو دنیا کا تیز ترین جدید ترین ماڈل ہے اور GPT‑6 Astra سے 8 گنا تک تیز ہے. اس کے علاوہ GPT‑6.1 Sol Ultrafast بھی متعارف کرایا جا رہا ہے. یہ API کے ساتھ ساتھ ChatGPT کام اور Codex میں بھی ہمارے نئے Pro درجے کے صارفین کے لیے دستیاب ہیں، جو $500 ماہانہ میں سب سے زیادہ استعمال کی سہولت دیتا ہے. GPT‑6.1 Sol Ultrafast کے ساتھ ڈویلپرز تقریباً اتنے ہی API خرچ پر، جتنا پہلے GPT‑6 Astra پر ہوتا تھا، 8 گنا تک رفتار کے ساتھ Astra کے قریب ذہانت حاصل کر سکتے ہیں.

مصنف

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.