GPT-6.1Sol
पाँचवें हिस्से की कीमत पर Astra के करीब की बुद्धिमत्ता, लगातार अत्याधुनिक प्रदर्शन के लिए
हम पेश कर रहे हैं GPT‑6.1 Sol, जो GPT‑6 Sol का उन्नत संस्करण है. यह एजेंटिक कोडिंग के साथ-साथ कंप्यूटर उपयोग और पेशेवर कार्यों में भी असाधारण प्रदर्शन करता है. कठिन कार्यों में यह Sol को GPT‑6 Astra के करीब लाता है, और इसके इनपुट व आउटपुट टोकन की कीमतें Astra की मानक कीमतों का पाँचवाँ हिस्सा हैं. इससे डेवलपर उसी बजट में अधिक सक्षम एजेंट बना और चला सकते हैं.
GPT‑6.1 Sol, Sol की कीमत पर Astra के करीब का प्रदर्शन देता है. अपने प्रदर्शन के लिहाज़ से यह आज उपलब्ध सबसे किफ़ायती मॉडल है. कैश किए गए इनपुट की लागत सिर्फ़ $0.10 प्रति दस लाख टोकन है—मानक इनपुट कीमत से 95% कम. इससे ऐसे एजेंटिक कार्य अधिक किफ़ायती होते हैं जिनमें बार-बार किए जाने वाले अनुरोधों में संदर्भ का पुनः उपयोग होता है.
GPT‑6 Astra समग्र रूप से हमारा सबसे सक्षम अत्याधुनिक मॉडल बना हुआ है. GPT‑6.1 Sol क्षमता और लागत का नया संतुलन देता है—उन उपयोगकर्ताओं के लिए जो महत्वपूर्ण काम अधिक बार करना चाहते हैं, और उन एपीआई ग्राहकों के लिए जो बड़े पैमाने पर एप्लिकेशन बनाते और चलाते हैं.

GPT‑6.1 Sol जटिल पेशेवर कार्यों में GPT‑6 Sol से काफ़ी बेहतर है—कोड लिखने और उसकी त्रुटियाँ दूर करने से लेकर दस्तावेज़ समझने और कई चरणों वाली व्यावसायिक कार्यप्रक्रियाएँ पूरी करने तक. इनमें से कई मूल्यांकनों में यह काफ़ी कम लागत पर GPT‑6 Astra के प्रदर्शन के करीब पहुँचता है.
DeepSWE v1.1 वास्तविक कोडबेस में जटिल सॉफ़्टवेयर इंजीनियरिंग कार्यों का मूल्यांकन करता है. इसमें GPT‑6.1 Sol लगभग पाँचवें हिस्से की लागत पर GPT‑6 Astra की बराबरी करता है. साथ ही, कम रीज़निंग प्रयास और लागत पर GPT‑6 Sol के सर्वोत्तम स्कोर से 6.4 प्रतिशत अंक अधिक हासिल करता है.
डीपएसडब्ल्यूई 1.1(एक नई विंडो में खुलेगा) में, एआई एजेंट सॉफ़्टवेयर इंजीनियरिंग के मौलिक कार्य हल करते हैं, जिन्हें पूरा करने के लिए लंबे समय तक काम करना पड़ता है.
GDP.pdf मापता है कि मॉडल तालिकाओं, चार्ट, आरेखों और बारीक विवरणों वाले जटिल पीडीएफ दस्तावेज़ों से पेशेवर सवालों के कितने सटीक उत्तर देते हैं. जाँची गई सभी रीज़निंग सेटिंग में GPT‑6.1 Sol, वैकल्पिक व्यवस्थाओं वाले Opus 5.5 से अधिक स्कोर हासिल करता है, वह भी प्रति कार्य आधे से कम लागत पर. यह प्रति कार्य लगभग पाँचवें हिस्से की लागत पर GPT‑6 Astra के अत्याधुनिक प्रदर्शन के करीब भी पहुँचता है.
GDP.pdf(एक नई विंडो में खुलेगा) में, मॉडलों को वित्त, स्वास्थ्य सेवा, कानून और सात अन्य पेशेवर क्षेत्रों की कार्यप्रक्रियाओं से लिए गए जटिल पीडीएफ दस्तावेज़ों पर वास्तविक परिस्थितियों से जुड़े निर्देशों के उत्तर देने होते हैं.
AutomationBench मापता है कि एजेंट कई चरणों वाली व्यावसायिक कार्यप्रक्रियाएँ सही ढंग से पूरी करते हैं या नहीं. इसमें मीडियम रीज़निंग प्रयास पर GPT‑6.1 Sol, Opus 5.5 से 2.2 प्रतिशत अंक अधिक हासिल करता है, वह भी लगभग एक-तिहाई लागत पर. यह स्कोर समान सेटिंग पर GPT‑6 Sol से भी 4.8 प्रतिशत अंक अधिक है.
In AutomationBench 1.0.6(एक नई विंडो में खुलेगा), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol ने उन कार्यों में भी उल्लेखनीय प्रगति की है जिनमें कंप्यूटर एप्लिकेशन का इस्तेमाल करना पड़ता है. OSWorld 2.0 का ऑफ़लाइन सेट कंप्यूटर उपयोग की कठिन कार्यप्रक्रियाओं पर एजेंटों का मूल्यांकन करता है. इसमें अधिकतम रीज़निंग प्रयास पर GPT‑6.1 Sol, GPT‑6 Sol से सात प्रतिशत अंक अधिक हासिल करता है, वह भी आधे से कम लागत पर. अधिकतम रीज़निंग प्रयास पर यह Astra के स्कोर से मात्र 2.1 प्रतिशत अंक पीछे रहता है, जबकि इसकी प्रति कार्य लागत लगभग सातवाँ हिस्सा है.
In OSWorld 2.0(एक नई विंडो में खुलेगा), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Terminal-Bench Science 0.1 डेटा विश्लेषण, सिमुलेशन और प्रमेय सिद्ध करने जैसी वैज्ञानिक कार्यप्रक्रियाओं का मूल्यांकन करता है. इसमें अधिकतम रीज़निंग प्रयास पर GPT‑6.1 Sol, GPT‑6 Sol से दोगुने से अधिक स्कोर हासिल करता है, वह भी प्रति कार्य आधे से कम लागत पर. अधिकतम प्रयास पर GPT‑6.1 Sol की औसत लागत $5.47 प्रति कार्य है, जबकि Opus 5.5 की $23.21 और Astra की $23.80 है. यानी यह दोनों मॉडलों से 75% से भी कम लागत पर मज़बूत वैज्ञानिक क्षमता देता है.
GPT‑6 Astra अब भी जाँचे गए मॉडलों में 68.1% के साथ सर्वोच्च स्कोर हासिल करता है और सबसे कठिन वैज्ञानिक शोध कार्यों के लिए इसका उपयोग करना चाहिए.
टर्मिनल-बेंच साइंस 0.1(एक नई विंडो में खुलेगा) में, एजेंट कोड और टर्मिनल उपकरणों की मदद से वैज्ञानिक अनुसंधान की कार्यप्रक्रियाएँ पूरी करते हैं. इनमें डेटा का विश्लेषण करना, सिमुलेशन चलाना और डेटा के अनुरूप मॉडलों का समायोजन करना शामिल है.
GPT‑6.1 Sol कठिन प्रॉम्प्ट पर तथ्यात्मक सटीकता भी बढ़ाता है. एक्स्ट्रा हाई रीज़निंग प्रयास पर इसकी तथ्यात्मक त्रुटि दर 4.1% है, जो GPT‑6 Sol के 4.5% से कम और समान सेटिंग पर Astra के 4.0% के करीब है. साथ ही, इसकी प्रति कार्य लागत Astra से लगभग 83% कम है.
यह मूल्यांकन उन उत्तरों का अनुपात मापता है जिनमें कम-से-कम एक तथ्यात्मक त्रुटि है. इसके लिए पहचान संबंधी जानकारी हटाए गए ऐसे वार्तालाप इस्तेमाल होते हैं जिनमें उपयोगकर्ताओं ने पिछले मॉडल की त्रुटि चिह्नित की थी. जानबूझकर चुने गए ये कठिन प्रॉम्प्ट सामान्य उपयोग के प्रतिनिधि नहीं हैं.
हम उन ChatGPT वार्तालापों पर तथ्यात्मक सटीकता का मूल्यांकन करते हैं जिनसे पहचान संबंधी जानकारी हटा दी गई है और जिनमें उपयोगकर्ताओं ने किसी पिछले मॉडल की तथ्यात्मक त्रुटि चिह्नित की थी. त्रुटियाँ उत्पन्न करने वाले ये वार्तालाप सामान्य उपयोग के प्रतिनिधि नहीं हैं, जिसमें तथ्यात्मक त्रुटियाँ कम होती हैं.
हमारे संरेखण मूल्यांकनों में GPT‑6.1 Sol, GPT‑6 Sol से काफ़ी बेहतर प्रदर्शन करता है, जिससे यह GPT‑6 Astra के करीब पहुँचता है.
GPT‑6.1 Sol अपनी सीमाओं के बारे में अधिक पारदर्शी है और उपयोगकर्ता की मंशा व सुरक्षा सीमाओं का पालन करने में अधिक भरोसेमंद है. चुनौतीपूर्ण मूल्यांकनों में इसकी विफलता दर GPT‑6 Sol से कम है—चाहे खराब खोज टूल की जानकारी देना हो, स्पष्ट प्रतिबंधों का पालन करना हो या एजेंटिक कार्यों में अनधिकृत परिणामों से बचना हो. हमें स्वचालित सुरक्षा समीक्षक को दरकिनार करने का कोई प्रयास नहीं मिला, ठीक GPT‑6 Astra और GPT‑6 Sol की तरह.
नीचे दिए गए मूल्यांकन जानबूझकर चुनौतीपूर्ण स्थितियों को परखते हैं. ये सामान्य उपयोग में विफलता दर नहीं मापते.
GPT‑6.1 Sol आज से सभी Plus, Pro, Business, Enterprise और Edu उपयोगकर्ताओं के लिए ChatGPT वर्क और Codex में उपलब्ध है. ये मॉडल अभी चैट में उपलब्ध नहीं हैं. डेवलपर OpenAI एपीआई में भी gpt-6.1-sol के नाम से इसका उपयोग कर सकते हैं. इसकी मानक एपीआई कीमतें प्रति दस लाख टोकन के लिए इनपुट पर $2, कैश किए गए इनपुट पर $0.10 और आउटपुट पर $10 हैं.
साथ ही, हम GPT‑6 Astra Ultrafast और GPT‑6.1 Sol Ultrafast भी पेश कर रहे हैं. GPT‑6 Astra Ultrafast दुनिया का सबसे तेज़ अत्याधुनिक मॉडल है, जो GPT‑6 Astra से 8 गुना तक तेज़ है. ये एपीआई में और हमारे नए, सर्वाधिक उपयोग सीमा वाले $500/माह के Pro स्तर के उपयोगकर्ताओं के लिए ChatGPT वर्क और Codex में उपलब्ध हैं. GPT‑6.1 Sol Ultrafast के साथ डेवलपर लगभग उतने ही एपीआई खर्च में Astra के करीब की बुद्धिमत्ता और 8 गुना तक गति पा सकते हैं, जितना पहले GPT‑6 Astra पर खर्च होता था.
लेखक
GPT का मूल्यांकन हमारे शोध परिवेश में या हमारे एपीआई के ज़रिए किया गया. सिस्टम प्रॉम्प्ट, उपलब्ध टूल, प्रयास के स्तर आदि में अंतर के कारण इनके उत्तर सामान्य इस्तेमाल वाले ChatGPT से थोड़े अलग हो सकते हैं. प्रतिस्पर्धी मॉडलों के मूल्यांकन सार्वजनिक रूप से उपलब्ध रिपोर्टों से लिए गए हैं.

