पेश हैं GPT‑6 Sol और Luna
अपने रोज़मर्रा के काम में अत्याधुनिक इंटेलिजेंस को शामिल करने के और भी तरीके.
इस महीने की शुरुआत में, हमने GPT‑6 Astra पेश किया, जो दुनिया का सबसे इंटेलिजेंट और अलाइन्ड मॉडल है. हालांकि सबसे मुश्किल और ज़रूरी प्रोजेक्ट्स के लिए अभी भी Astra की पूरी क्षमता की ज़रूरत होती है, लेकिन काम अलग-अलग स्तरों, रफ़्तार और बजट पर होता है.
इसीलिए हम GPT‑6 Sol और GPT‑6 Luna. के साथ GPT‑6 परिवार को बढ़ा रहे हैं. GPT‑6 Astra ने इंटेलिजेंस की एक नई पीढ़ी पेश की थी—ये मॉडल लागत-दक्षता की अत्याधुनिक सीमाओं को आगे बढ़ाकर उस इंटेलिजेंस के फ़ायदों को फैलाने में मदद करते हैं. हमने GPT‑6 Sol और Luna को भी GPT‑6 Astra जैसे ही तरीकों से ट्रेन किया है, जिससे Astra की बेहतरीन परफ़ॉर्मेंस, जैसे प्रोफ़ेशनल काम, तथ्यों की सटीकता, कोडिंग, कंप्यूटर का इस्तेमाल और अलाइनमेंट, की ख़ूबियाँ अब तेज़ और सस्ते मॉडल्स में भी मिलेंगी.
GPT‑6 मॉडल कॉस्ट–इंटेलिजेंस कर्व में सबसे आगे हैं. ये हर लेवल पर बेहतरीन क्षमताएँ देते हैं और साथ ही ऐसा इंफ़्रास्ट्रक्चर भी देते हैं जो बड़े पैमाने पर कुशलतापूर्वक काम करता है. कैशिंग और इंफ़रेंस में सुधार की वजह से हम इन मॉडल्स को कम लागत पर उपलब्ध करा पा रहे हैं. हम इस बचत का सीधा फ़ायदा यूज़र और कस्टमर को दे रहे हैं—इसके लिए हम Sol और Luna के API की कीमतों में उनके GPT‑5.6 प्रमोशनल प्राइस के मुकाबले 50% की कटौती कर रहे हैं. इन सुधारों की बदौलत, एडवांस्ड AI बड़े पैमाने पर रोज़मर्रा के ज़्यादा टास्क और ऐप्लिकेशन के लिए प्रैक्टिकल बन गया है.
मॉडल | इनपुट | आउटपुट | कीमत में कमी |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% सस्ता |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% सस्ता |
कीमतें प्रति 1 मिलियन टोकन के लिए हैं.
GPT‑6 Astra हर मामले में हमारा सबसे बेहतरीन मॉडल बना हुआ है. जब आपको सबसे अच्छे नतीजे और बिना किसी समझौते वाला अनुभव चाहिए हो, तो इसे चुनें.
GPT‑6 Sol और Luna उन मॉडल्स में इंटेलिजेंस अपग्रेड और लागत-दक्षता लाते हैं जिन्हें आप पहले से पहचानते हैं और इस्तेमाल करते हैं. ये उन क्षमताओं में सुधार करते हैं जो मुश्किल काम पूरे करने के लिए सबसे ज़्यादा उपयोगी हैं.
GPT‑6 Sol मुश्किल काम कर सकता है और आपको ज़्यादा इस्तेमाल की लिमिट और कम लागत के साथ काम में सुधार करने की ज़्यादा आज़ादी देता है. साथ ही, यह इसी कीमत वाले दूसरे मॉडल के मुकाबले ज़्यादा इंटेलिजेंस और बेहतर नतीजे देता है.
AutomationBench पर, अलग-अलग ऐप्स में बिज़नेस वर्कफ़्लो के टेस्ट में, xhigh प्रयास पर GPT‑6 Sol ने मैक्स प्रयास पर Claude Opus 5 से बेहतर परफ़ॉर्म किया, जबकि इसकी लागत Opus 5 की प्रति टास्क लागत का सिर्फ़ 9% थी. हाई प्रयास पर, GPT‑6 Luna ने अपने पिछले वर्जन के मुकाबले 5.4 प्रतिशत पॉइंट्स का सुधार किया और इसकी प्रति टास्क लागत भी 58% कम रही.
इस AutomationBench 1.0.6(एक नई विंडो में खुलेगा)में, AI एजेंट्स को सेल्स, मार्केटिंग, ऑपरेशंस, सपोर्ट, फ़ाइनेंस और HR जैसे क्षेत्रों में 47 टूल्स का इस्तेमाल करके एंड-टू-एंड वर्कफ़्लो पर टेस्ट किया जाता है. Claude Fable 5.1 के लिए दिया गया डेटा पॉइंट इसकी असल लागत को कम करके दिखाता है, क्योंकि इसमें Opus 5 फ़ॉलबैक की लागत शामिल नहीं है, जो लगभग 40% टास्क में हुए थे.
GPT‑6 Sol बहुत कम लागत पर Claude Fable 5.1 से बेहतर परफ़ॉर्म करता है और लो-प्रयास वाले GPT‑6 Astra को भी मात देता है.
मॉडल (और प्रयास) | स्कोर | प्रति टास्क लागत |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (लो) | 30.3% | 3.9 गुना GPT‑6 Sol |
Claude Opus 5 (मैक्स) | 26.9% | 11.1 गुना GPT‑6 Sol |
Opus 5 फ़ॉलबैक सहित Claude Fable 5.1 (मैक्स) | 31.4% | >8.9 गुना GPT‑6 Sol (फ़ॉलबैक लागत की रिपोर्ट नहीं दी गई) |
Agents’ Last Exam में, जो एजेंट के मुश्किल प्रोफ़ेशनल वर्कफ़्लो का मूल्यांकन करता है, GPT‑6 Sol ने मैक्स प्रयास पर 56.4% स्कोर किया. यह स्कोर Claude Opus 5 के सबसे ज़्यादा स्कोर से बेहतर है, और इसमें प्रति टास्क लागत भी 60% कम है.
इस Agents’ Last Exam V1(एक नई विंडो में खुलेगा)में, AI एजेंटों का मूल्यांकन लंबे समय तक चलने वाले और आर्थिक तौर से मूल्यवान टास्क के आधार पर किया जाता है. ये काम 55 अलग-अलग इंडस्ट्री से जुड़े होते हैं और इनमें कंप्यूटर पर किए जाने वाले ज़्यादातर मुख्य प्रोफ़ेशनल काम शामिल होते हैं.
किसी जवाब की उपयोगिता सही जानकारी पर निर्भर करती है, और हम जानकारी की विश्वसनीयता को बेहतर बनाने की दिशा में लगातार काम कर रहे हैं. हमारे इंटरनल फ़ैक्ट-चेकिंग मूल्यांकन के आधार पर, जो असल दुनिया की उन बातचीत पर आधारित है जिनमें यूज़र ने हमारे मॉडल की गलतियों को फ़्लैग किया था, GPT‑6 Sol अपने पिछले वर्जन की तुलना में लगभग आधी गलतियाँ करता है और बहुत कम लागत में Astra-लेवल की विश्वसनीयता के करीब पहुँच जाता है. GPT‑6 Luna में भी काफ़ी सुधार हुआ है; ज़्यादा मेहनत वाले काम में यह GPT‑5.6 Sol के बराबर काम करता है, जबकि इसकी लागत उसका लगभग सौवाँ हिस्सा ही है.
यहाँ हम उन ChatGPT बातचीत की सच्चाई की जाँच करते हैं जिनसे पहचान हटा दी गई है और जिनमें यूज़र्स ने पिछले मॉडल की किसी तथ्यात्मक गलती को फ़्लैग किया था. गलतियों वाली ये बातचीत आम इस्तेमाल का सही उदाहरण नहीं हैं, क्योंकि आम तौर पर ऐसी तथ्यात्मक गलतियाँ कम ही होती हैं. स्कोर लंबाई के अनुसार कंट्रोल नहीं किए गए हैं; हालाँकि, हमारी जाँच से पता चला कि जवाब की लंबाई का इस पर लगभग कोई असर नहीं पड़ता है.
इस साल, कोडिंग एजेंट्स ने पहले से कहीं ज़्यादा मुश्किल, बड़े और लंबे समय तक चलने वाले टास्क करने शुरू कर दिए हैं. OpenAI में, हमारे अंदरूनी इस्तेमाल में बहुत तेज़ी से बढ़ोतरी हुई है. API की कीमतों के हिसाब से देखें तो, रोज़ाना टोकन का इस्तेमाल औसत रिसर्चर के लिए $600 और 90वें परसेंटाइल वाले रिसर्चर्स के लिए $7,000 से ज़्यादा हो गया है (Research acceleration: The view inside OpenAI). जैसे-जैसे कोडिंग एजेंट्स ज़्यादा लंबे और मुश्किल टास्क करने लगे हैं, लगातार इस्तेमाल की लागत ज़्यादा मायने रखने लगी है. GPT‑6 Sol और Luna बेहतरीन कोडिंग परफ़ॉर्मेंस को कम API कीमतों के साथ जोड़ते हैं, जिससे डेवलपर्स को बदलाव करने और नई चीज़ें आज़माने की ज़्यादा आज़ादी मिलती है, और टीम को Codex से और भी बड़े और मुश्किल काम करवाने का भरोसा मिलता है.
FrontierCode पर, जो यह मूल्यांकन करता है कि क्या कोडिंग एजेंट ऐसे बदलाव करते हैं जिन्हें असली कोडबेस में मर्ज किया जा सके, GPT‑6 Sol ने GPT‑5.6 Sol के मुकाबले काफ़ी बेहतर परफ़ॉर्म किया है और यह बहुत कम लागत में Claude Fable 5.1 xhigh के बराबर नतीजे देने के काबिल है.
इस FrontierCode 1.1 Main(एक नई विंडो में खुलेगा)में, AI एजेंट ऐसा कोड लिखते हैं जिसे न सिर्फ़ सही होने के आधार पर, बल्कि "मर्ज होने की क्षमता" के आधार पर भी आंका जाता है: जैसे कि टेस्ट की क्वालिटी, दायरे का अनुशासन, कोड का स्टाइल और कोडबेस के स्टैंडर्ड्स का पालन.
DeepSWE v1.1 पर, जो असली कोडबेस में मुश्किल सॉफ़्टवेयर-इंजीनियरिंग टास्क पर परफ़ॉर्मेंस को टेस्ट करता है, GPT‑6 Sol ने मैक्स प्रयास पर 68.8% स्कोर किया. यह स्कोर मूल्यांकन में Claude Fable 5 के सबसे ज़्यादा स्कोर—जो xhigh प्रयास पर 69.9% था—से 1.1 प्रतिशत पॉइंट कम है, जबकि हर टास्क की लागत लगभग 80% कम है.
GPT‑6 Luna मैक्स प्रयास पर 66.6% स्कोर करता है, जो Claude Opus 5 और Fable 5 के मीडियम प्रयास वाले स्कोर के बराबर है. इन तुलनाओं में, Luna के हर टास्क की लागत Opus 5 से 93% और Fable 5 से 96% कम है.
इस DeepSWE 1.1(एक नई विंडो में खुलेगा)में, AI एजेंट ओरिजिनल और लंबे समय तक चलने वाले सॉफ़्टवेयर इंजीनियरिंग टास्क को हल करते हैं.
हालांकि कंप्यूटर इस्तेमाल के लिए GPT‑6 Astra दुनिया का सबसे अच्छा मॉडल बना हुआ है, लेकिन GPT‑6 Sol और Luna अपने पिछले वर्जन की तुलना में कम लागत में बेहतर परफ़ॉर्मेंस देते हैं. OSWorld 2.0 ऑफ़लाइन पर, GPT‑6 Sol xhigh प्रयास के साथ Claude Opus 5 के मीडियम प्रयास वाले स्कोर के बराबर स्कोर हासिल करता है—60.5% बनाम 60.3%—और इसमें प्रति टास्क लागत लगभग 80% कम आती है. GPT‑6 Luna (मैक्स), GPT‑5.6 Sol (मीडियम) से बेहतर परफ़ॉर्मेंस दे सकता है, जबकि इसकी लागत उससे दस गुना कम है.
इस OSWorld 2.0(एक नई विंडो में खुलेगा)में, AI एजेंट रोज़मर्रा और प्रोफ़ेशनल टास्क से जुड़े लंबे समय तक चलने वाले कंप्यूटर के इस्तेमाल वाले वर्कफ़्लो को पूरा करने की कोशिश करते हैं. हम v2026.08.08 रिलीज़ के ऑफ़लाइन सेट पर मिले अधूरे रिवॉर्ड की जानकारी दे रहे हैं.
हमने Sol और Luna में GPT‑6 Astra के बेहतर बातचीत के तरीके को भी शामिल किया है. हमें लगता है कि तकनीकी और कोडिंग से जुड़ी बातचीत में यह बदलाव ख़ास तौर पर नज़र आएगा. अब आपको ज़्यादा साफ़-सुथरी बातें, कम मुश्किल शब्द, कम अजीब तरह के वाक्य, कम गैर-ज़रूरी जानकारी और कुल मिलाकर थोड़े छोटे जवाब मिलेंगे, लेकिन जानकारी की अहमियत बनी रहेगी.
हालांकि स्टाइल हर किसी की अपनी पसंद पर निर्भर करता है, लेकिन हमें यहाँ GPT‑6 Sol का जवाब ज़्यादा पसंद आया. यह इतनी जल्दी किसी नतीजे पर नहीं पहुँचता, ऐसी जानकारी दोहराने में कम समय लगाता है जो पूछने वाले के लिए पहले से ही स्पष्ट हो सकती हैं (जैसे, वेबसाइट में चार पेज हैं), कम अस्पष्ट भाषा का इस्तेमाल करता है (जैसे, “बेंटो फ़ील”, “उस सिस्टम के आस-पास रीशेपिंग…”), यह साफ़-साफ़ बताता है कि उसने क्या चेक किया और क्या नहीं, और बिना ज़रूरत के इम्प्लीमेंटेशन की जानकारी, जैसे अपने इमेज टूल का प्रॉम्प्ट, शेयर नहीं करता.
टोकन की कम कीमतों के साथ-साथ, हम GPT‑6 पर काम करने वाले डेवलपर्स को उनके ऐप्लिकेशन द्वारा दोबारा इस्तेमाल किए जाने वाले कॉन्टेक्स्ट पर ज़्यादा बचत करने में मदद कर रहे हैं. हमने GPT‑6 के लिए प्रॉम्प्ट कैशिंग को बेहतर बनाया है ताकि डिफ़ॉल्ट तौर से ज़्यादा कैश हिट रेट मिल सकें. इससे एजेंट ज़्यादा कॉन्टेक्स्ट का दोबारा इस्तेमाल कर पाते हैं, तेज़ी से जवाब दे पाते हैं और कैश किए गए इनपुट-टोकन रीड पर 90% तक की छूट का फ़ायदा उठा पाते हैं.
डेवलपर्स के पास अपनी कैशिंग परफ़ॉर्मेंस को मापने और उसे बेहतर बनाने के और भी तरीके हैं:
मॉनिटर करें और पता लगाएँ. प्रॉम्प्ट कैशिंग डैशबोर्ड(एक नई विंडो में खुलेगा) दिखाता है कि कितना इनपुट कैश किया गया है और समय के साथ इसमें क्या बदलाव आते हैं. डायग्नोस्टिक्स टूल(एक नई विंडो में खुलेगा) कैशिंग के उन मौकों के बारे में बताता है जिनका फ़ायदा नहीं उठाया गया और यह भी बताता है कि क्या ठीक करने की ज़रूरत है.
कैश को खराब किए बिना, रीज़निंग के प्रयास और टूल की उपलब्धता को एडजस्ट करें. मुश्किल टास्क के लिए रीज़निंग के प्रयास(एक नई विंडो में खुलेगा) बढ़ाएँ या आसान फ़ॉलो-अप के लिए इसे कम करें, और अपने एजेंट की ज़रूरतों के हिसाब से टूल एनेबल या डिसेबल करें(एक नई विंडो में खुलेगा). अब दोनों कंट्रोल कैश के दोबारा इस्तेमाल के लिए पहले के कॉन्टेक्स्ट को बनाए रखते हैं.
ऑप्टिमाइज़ करें कि कौन से प्रीफ़िक्स कैश किए जाएँ. स्पष्ट ब्रेकपॉइंट डेवलपर्स को यह चुनने देते हैं कि कैश किए गए प्रॉम्प्ट प्रीफ़िक्स कहां ख़त्म हों. इससे डेवलपर्स को कैश के दोबारा इस्तेमाल पर ज़्यादा कंट्रोल मिलता है और परफ़ॉर्मेंस बेहतर हो सकती है.
GitHub की रिपोर्ट है कि पिछले कुछ महीनों में, इन सुधारों की वजह से OpenAI मॉडल के लिए अरबों अनुरोधों में से उन प्रॉम्प्ट टोकन का हिस्सा 50% से ज़्यादा कम हो गया है जिन्हें नए सिरे से प्रोसेस करने की ज़रूरत होती है, जिससे Copilot तेज़ी से जवाब दे पाता है.
GPT‑6 Sol और Luna, Astra के साथ शुरू किए गए अलाइनमेंट के काम को आगे बढ़ाते हैं; Astra अब तक का हमारा सबसे ज़्यादा अलाइन किया गया मॉडल है. हमारे अलाइनमेंट मूल्यांकनों में, Sol और Luna दोनों ही अपने GPT‑5.6 वर्जन के मुकाबले बेहतर नतीजे दिखाते हैं, जिसमें उनके कोडिंग के काम के बारे में गुमराह करने वाले दावों की कम दर भी शामिल है.
नीचे दिए गए मूल्यांकन जान-बूझकर मुश्किल स्थितियों की जाँच करते हैं और सामान्य इस्तेमाल में असफ़लता की दर को नहीं मापते हैं. पूरे नतीजों के लिए सिस्टम कार्ड(एक नई विंडो में खुलेगा) देखें.
GPT‑6 Sol और GPT‑6 Luna आज से सभी Plus, Pro, Business, Enterprise और Edu यूज़र्स के लिए ChatGPT वर्क और Codex में उपलब्ध हैं. Free और Go यूज़र्स डेस्कटॉप ऐप में GPT‑6 Luna को एक्सेस कर सकते हैं. ये मॉडल अभी चैट में उपलब्ध नहीं हैं. OpenAI API में, ये gpt-6-solऔर gpt-6-luna के तौर पर उपलब्ध हैं.
सभी के लिए सर्विस को स्टेबल बनाए रखने के लिए, हम पूरे दिन धीरे-धीरे ChatGPT में इन मॉडल्स को रोल आउट करने की योजना बना रहे हैं. अगर आपको ChatGPT वर्क या Codex में नए मॉडल्स नहीं दिखते हैं, तो कृपया बाद में फिर से कोशिश करें.
GPT का मूल्यांकन हमारे रिसर्च एनवायरनमेंट में या हमारे API के ज़रिए किया गया. सिस्टम प्रॉम्प्ट और उपलब्ध टूल, आदि में अंतर होने के कारण, इससे मिलने वाला आउटपुट प्रोडक्शन ChatGPT से थोड़ा अलग हो सकता है. कॉम्पिटिटर मॉडल का मूल्यांकन सार्वजनिक तौर से उपलब्ध रिपोर्ट से लिया गया. जब Claude Fable 5.1 के स्कोर उपलब्ध नहीं थे, तब Claude Fable 5 के स्कोर बताए गए.


