स्किप करके मेन कंटेंट पर जाऍं
OpenAI

पेश हैं GPT‑6 Sol और Luna

अपने रोज़मर्रा के काम में अत्याधुनिक इंटेलिजेंस को शामिल करने के और भी तरीके.

लोड किया जा रहा है...

इस महीने की शुरुआत में, हमने GPT‑6 Astra पेश किया, जो दुनिया का सबसे इंटेलिजेंट और अलाइन्ड मॉडल है. हालांकि सबसे मुश्किल और ज़रूरी प्रोजेक्ट्स के लिए अभी भी Astra की पूरी क्षमता की ज़रूरत होती है, लेकिन काम अलग-अलग स्तरों, रफ़्तार और बजट पर होता है.

इसीलिए हम GPT‑6 Sol और GPT‑6 Luna. के साथ GPT‑6 परिवार को बढ़ा रहे हैं. GPT‑6 Astra ने इंटेलिजेंस की एक नई पीढ़ी पेश की थी—ये मॉडल लागत-दक्षता की अत्याधुनिक सीमाओं को आगे बढ़ाकर उस इंटेलिजेंस के फ़ायदों को फैलाने में मदद करते हैं. हमने GPT‑6 Sol और Luna को भी GPT‑6 Astra जैसे ही तरीकों से ट्रेन किया है, जिससे Astra की बेहतरीन परफ़ॉर्मेंस, जैसे प्रोफ़ेशनल काम, तथ्यों की सटीकता, कोडिंग, कंप्यूटर का इस्तेमाल और अलाइनमेंट, की ख़ूबियाँ अब तेज़ और सस्ते मॉडल्स में भी मिलेंगी.

GPT‑6 मॉडल कॉस्ट–इंटेलिजेंस कर्व में सबसे आगे हैं. ये हर लेवल पर बेहतरीन क्षमताएँ देते हैं और साथ ही ऐसा इंफ़्रास्ट्रक्चर भी देते हैं जो बड़े पैमाने पर कुशलतापूर्वक काम करता है. कैशिंग और इंफ़रेंस में सुधार की वजह से हम इन मॉडल्स को कम लागत पर उपलब्ध करा पा रहे हैं. हम इस बचत का सीधा फ़ायदा यूज़र और कस्टमर को दे रहे हैं—इसके लिए हम Sol और Luna के API की कीमतों में उनके GPT‑5.6 प्रमोशनल प्राइस के मुकाबले 50% की कटौती कर रहे हैं. इन सुधारों की बदौलत, एडवांस्ड AI बड़े पैमाने पर रोज़मर्रा के ज़्यादा टास्क और ऐप्लिकेशन के लिए प्रैक्टिकल बन गया है.

GPT‑6 API प्राइसिंग

मॉडल

इनपुट

आउटपुट

कीमत में कमी

GPT‑6 Sol
बनाम GPT‑5.6 Sol

$4 → $2

$20 → $10

50% सस्ता

GPT‑6 Luna
बनाम GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% सस्ता

कीमतें प्रति 1 मिलियन टोकन के लिए हैं.

GPT‑6 Astra हर मामले में हमारा सबसे बेहतरीन मॉडल बना हुआ है. जब आपको सबसे अच्छे नतीजे और बिना किसी समझौते वाला अनुभव चाहिए हो, तो इसे चुनें.

पूरी मॉडल फ़ैमिली में एक कदम आगे

GPT‑6 Sol और Luna उन मॉडल्स में इंटेलिजेंस अपग्रेड और लागत-दक्षता लाते हैं जिन्हें आप पहले से पहचानते हैं और इस्तेमाल करते हैं. ये उन क्षमताओं में सुधार करते हैं जो मुश्किल काम पूरे करने के लिए सबसे ज़्यादा उपयोगी हैं.

प्रोफ़ेशनल काम

GPT‑6 Sol मुश्किल काम कर सकता है और आपको ज़्यादा इस्तेमाल की लिमिट और कम लागत के साथ काम में सुधार करने की ज़्यादा आज़ादी देता है. साथ ही, यह इसी कीमत वाले दूसरे मॉडल के मुकाबले ज़्यादा इंटेलिजेंस और बेहतर नतीजे देता है.

AutomationBench पर, अलग-अलग ऐप्स में बिज़नेस वर्कफ़्लो के टेस्ट में, xhigh प्रयास पर GPT‑6 Sol ने मैक्स प्रयास पर Claude Opus 5 से बेहतर परफ़ॉर्म किया, जबकि इसकी लागत Opus 5 की प्रति टास्क लागत का सिर्फ़ 9% थी. हाई प्रयास पर, GPT‑6 Luna ने अपने पिछले वर्जन के मुकाबले 5.4 प्रतिशत पॉइंट्स का सुधार किया और इसकी प्रति टास्क लागत भी 58% कम रही.

इस AutomationBench 1.0.6⁠(एक नई विंडो में खुलेगा)में, AI एजेंट्स को सेल्स, मार्केटिंग, ऑपरेशंस, सपोर्ट, फ़ाइनेंस और HR जैसे क्षेत्रों में 47 टूल्स का इस्तेमाल करके एंड-टू-एंड वर्कफ़्लो पर टेस्ट किया जाता है. Claude Fable 5.1 के लिए दिया गया डेटा पॉइंट इसकी असल लागत को कम करके दिखाता है, क्योंकि इसमें Opus 5 फ़ॉलबैक की लागत शामिल नहीं है, जो लगभग 40% टास्क में हुए थे.

GPT‑6 Sol बहुत कम लागत पर Claude Fable 5.1 से बेहतर परफ़ॉर्म करता है और लो-प्रयास वाले GPT‑6 Astra को भी मात देता है.

मॉडल (और प्रयास)

स्कोर

प्रति टास्क लागत

GPT‑6 Sol (xhigh)

33.2%

$0.27

GPT‑6 Astra (लो)

30.3%

3.9 गुना GPT‑6 Sol

Claude Opus 5 (मैक्स)

26.9%

11.1 गुना GPT‑6 Sol

Opus 5 फ़ॉलबैक सहित Claude Fable 5.1 (मैक्स)

31.4%

>8.9 गुना GPT‑6 Sol

(फ़ॉलबैक लागत की रिपोर्ट नहीं दी गई)

Agents’ Last Exam में, जो एजेंट के मुश्किल प्रोफ़ेशनल वर्कफ़्लो का मूल्यांकन करता है, GPT‑6 Sol ने मैक्स प्रयास पर 56.4% स्कोर किया. यह स्कोर Claude Opus 5 के सबसे ज़्यादा स्कोर से बेहतर है, और इसमें प्रति टास्क लागत भी 60% कम है.

इस Agents’ Last Exam V1⁠(एक नई विंडो में खुलेगा)में, AI एजेंटों का मूल्यांकन लंबे समय तक चलने वाले और आर्थिक तौर से मूल्यवान टास्क के आधार पर किया जाता है. ये काम 55 अलग-अलग इंडस्ट्री से जुड़े होते हैं और इनमें कंप्यूटर पर किए जाने वाले ज़्यादातर मुख्य प्रोफ़ेशनल काम शामिल होते हैं.

तथ्यात्मकता

किसी जवाब की उपयोगिता सही जानकारी पर निर्भर करती है, और हम जानकारी की विश्वसनीयता को बेहतर बनाने की दिशा में लगातार काम कर रहे हैं. हमारे इंटरनल फ़ैक्ट-चेकिंग मूल्यांकन के आधार पर, जो असल दुनिया की उन बातचीत पर आधारित है जिनमें यूज़र ने हमारे मॉडल की गलतियों को फ़्लैग किया था, GPT‑6 Sol अपने पिछले वर्जन की तुलना में लगभग आधी गलतियाँ करता है और बहुत कम लागत में Astra-लेवल की विश्वसनीयता के करीब पहुँच जाता है. GPT‑6 Luna में भी काफ़ी सुधार हुआ है; ज़्यादा मेहनत वाले काम में यह GPT‑5.6 Sol के बराबर काम करता है, जबकि इसकी लागत उसका लगभग सौवाँ हिस्सा ही है.

यहाँ हम उन ChatGPT बातचीत की सच्चाई की जाँच करते हैं जिनसे पहचान हटा दी गई है और जिनमें यूज़र्स ने पिछले मॉडल की किसी तथ्यात्मक गलती को फ़्लैग किया था. गलतियों वाली ये बातचीत आम इस्तेमाल का सही उदाहरण नहीं हैं, क्योंकि आम तौर पर ऐसी तथ्यात्मक गलतियाँ कम ही होती हैं. स्कोर लंबाई के अनुसार कंट्रोल नहीं किए गए हैं; हालाँकि, हमारी जाँच से पता चला कि जवाब की लंबाई का इस पर लगभग कोई असर नहीं पड़ता है.

कोडिंग

इस साल, कोडिंग एजेंट्स ने पहले से कहीं ज़्यादा मुश्किल, बड़े और लंबे समय तक चलने वाले टास्क करने शुरू कर दिए हैं. OpenAI में, हमारे अंदरूनी इस्तेमाल में बहुत तेज़ी से बढ़ोतरी हुई है. API की कीमतों के हिसाब से देखें तो, रोज़ाना टोकन का इस्तेमाल औसत रिसर्चर के लिए $600 और 90वें परसेंटाइल वाले रिसर्चर्स के लिए $7,000 से ज़्यादा हो गया है (Research acceleration: The view inside OpenAI⁠). जैसे-जैसे कोडिंग एजेंट्स ज़्यादा लंबे और मुश्किल टास्क करने लगे हैं, लगातार इस्तेमाल की लागत ज़्यादा मायने रखने लगी है. GPT‑6 Sol और Luna बेहतरीन कोडिंग परफ़ॉर्मेंस को कम API कीमतों के साथ जोड़ते हैं, जिससे डेवलपर्स को बदलाव करने और नई चीज़ें आज़माने की ज़्यादा आज़ादी मिलती है, और टीम को Codex से और भी बड़े और मुश्किल काम करवाने का भरोसा मिलता है.

FrontierCode पर, जो यह मूल्यांकन करता है कि क्या कोडिंग एजेंट ऐसे बदलाव करते हैं जिन्हें असली कोडबेस में मर्ज किया जा सके, GPT‑6 Sol ने GPT‑5.6 Sol के मुकाबले काफ़ी बेहतर परफ़ॉर्म किया है और यह बहुत कम लागत में Claude Fable 5.1 xhigh के बराबर नतीजे देने के काबिल है.

इस FrontierCode 1.1 Main⁠(एक नई विंडो में खुलेगा)में, AI एजेंट ऐसा कोड लिखते हैं जिसे न सिर्फ़ सही होने के आधार पर, बल्कि "मर्ज होने की क्षमता" के आधार पर भी आंका जाता है: जैसे कि टेस्ट की क्वालिटी, दायरे का अनुशासन, कोड का स्टाइल और कोडबेस के स्टैंडर्ड्स का पालन.

DeepSWE v1.1 पर, जो असली कोडबेस में मुश्किल सॉफ़्टवेयर-इंजीनियरिंग टास्क पर परफ़ॉर्मेंस को टेस्ट करता है, GPT‑6 Sol ने मैक्स प्रयास पर 68.8% स्कोर किया. यह स्कोर मूल्यांकन में Claude Fable 5 के सबसे ज़्यादा स्कोर—जो xhigh प्रयास पर 69.9% था—से 1.1 प्रतिशत पॉइंट कम है, जबकि हर टास्क की लागत लगभग 80% कम है.

GPT‑6 Luna मैक्स प्रयास पर 66.6% स्कोर करता है, जो Claude Opus 5 और Fable 5 के मीडियम प्रयास वाले स्कोर के बराबर है. इन तुलनाओं में, Luna के हर टास्क की लागत Opus 5 से 93% और Fable 5 से 96% कम है.

इस DeepSWE 1.1⁠(एक नई विंडो में खुलेगा)में, AI एजेंट ओरिजिनल और लंबे समय तक चलने वाले सॉफ़्टवेयर इंजीनियरिंग टास्क को हल करते हैं.

कंप्यूटर का इस्तेमाल

हालांकि कंप्यूटर इस्तेमाल के लिए GPT‑6 Astra दुनिया का सबसे अच्छा मॉडल बना हुआ है, लेकिन GPT‑6 Sol और Luna अपने पिछले वर्जन की तुलना में कम लागत में बेहतर परफ़ॉर्मेंस देते हैं. OSWorld 2.0 ऑफ़लाइन पर, GPT‑6 Sol xhigh प्रयास के साथ Claude Opus 5 के मीडियम प्रयास वाले स्कोर के बराबर स्कोर हासिल करता है—60.5% बनाम 60.3%—और इसमें प्रति टास्क लागत लगभग 80% कम आती है. GPT‑6 Luna (मैक्स), GPT‑5.6 Sol (मीडियम) से बेहतर परफ़ॉर्मेंस दे सकता है, जबकि इसकी लागत उससे दस गुना कम है.

इस OSWorld 2.0⁠(एक नई विंडो में खुलेगा)में, AI एजेंट रोज़मर्रा और प्रोफ़ेशनल टास्क से जुड़े लंबे समय तक चलने वाले कंप्यूटर के इस्तेमाल वाले वर्कफ़्लो को पूरा करने की कोशिश करते हैं. हम v2026.08.08 रिलीज़ के ऑफ़लाइन सेट पर मिले अधूरे रिवॉर्ड की जानकारी दे रहे हैं.

सहयोग का स्टाइल

हमने Sol और Luna में GPT‑6 Astra के बेहतर बातचीत के तरीके को भी शामिल किया है. हमें लगता है कि तकनीकी और कोडिंग से जुड़ी बातचीत में यह बदलाव ख़ास तौर पर नज़र आएगा. अब आपको ज़्यादा साफ़-सुथरी बातें, कम मुश्किल शब्द, कम अजीब तरह के वाक्य, कम गैर-ज़रूरी जानकारी और कुल मिलाकर थोड़े छोटे जवाब मिलेंगे, लेकिन जानकारी की अहमियत बनी रहेगी.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

हालांकि स्टाइल हर किसी की अपनी पसंद पर निर्भर करता है, लेकिन हमें यहाँ GPT‑6 Sol का जवाब ज़्यादा पसंद आया. यह इतनी जल्दी किसी नतीजे पर नहीं पहुँचता, ऐसी जानकारी दोहराने में कम समय लगाता है जो पूछने वाले के लिए पहले से ही स्पष्ट हो सकती हैं (जैसे, वेबसाइट में चार पेज हैं), कम अस्पष्ट भाषा का इस्तेमाल करता है (जैसे, “बेंटो फ़ील”, “उस सिस्टम के आस-पास रीशेपिंग…”), यह साफ़-साफ़ बताता है कि उसने क्या चेक किया और क्या नहीं, और बिना ज़रूरत के इम्प्लीमेंटेशन की जानकारी, जैसे अपने इमेज टूल का प्रॉम्प्ट, शेयर नहीं करता.

एजेंट्स और लंबी बातचीत के लिए कैशिंग को बेहतर बनाना

टोकन की कम कीमतों के साथ-साथ, हम GPT‑6 पर काम करने वाले डेवलपर्स को उनके ऐप्लिकेशन द्वारा दोबारा इस्तेमाल किए जाने वाले कॉन्टेक्स्ट पर ज़्यादा बचत करने में मदद कर रहे हैं. हमने GPT‑6 के लिए प्रॉम्प्ट कैशिंग को बेहतर बनाया है ताकि डिफ़ॉल्ट तौर से ज़्यादा कैश हिट रेट मिल सकें. इससे एजेंट ज़्यादा कॉन्टेक्स्ट का दोबारा इस्तेमाल कर पाते हैं, तेज़ी से जवाब दे पाते हैं और कैश किए गए इनपुट-टोकन रीड पर 90% तक की छूट का फ़ायदा उठा पाते हैं.

डेवलपर्स के पास अपनी कैशिंग परफ़ॉर्मेंस को मापने और उसे बेहतर बनाने के और भी तरीके हैं:

GitHub की रिपोर्ट है कि पिछले कुछ महीनों में, इन सुधारों की वजह से OpenAI मॉडल के लिए अरबों अनुरोधों में से उन प्रॉम्प्ट टोकन का हिस्सा 50% से ज़्यादा कम हो गया है जिन्हें नए सिरे से प्रोसेस करने की ज़रूरत होती है, जिससे Copilot तेज़ी से जवाब दे पाता है.

अलाइनमेंट को बेहतर बनाना जारी रखना

GPT‑6 Sol और Luna, Astra के साथ शुरू किए गए अलाइनमेंट के काम को आगे बढ़ाते हैं; Astra अब तक का हमारा सबसे ज़्यादा अलाइन किया गया मॉडल है. हमारे अलाइनमेंट मूल्यांकनों में, Sol और Luna दोनों ही अपने GPT‑5.6 वर्जन के मुकाबले बेहतर नतीजे दिखाते हैं, जिसमें उनके कोडिंग के काम के बारे में गुमराह करने वाले दावों की कम दर भी शामिल है.

नीचे दिए गए मूल्यांकन जान-बूझकर मुश्किल स्थितियों की जाँच करते हैं और सामान्य इस्तेमाल में असफ़लता की दर को नहीं मापते हैं. पूरे नतीजों के लिए सिस्टम कार्ड⁠(एक नई विंडो में खुलेगा) देखें.

उपलब्धता

GPT‑6 Sol और GPT‑6 Luna आज से सभी Plus, Pro, Business, Enterprise और Edu यूज़र्स के लिए ChatGPT वर्क और Codex में उपलब्ध हैं. Free और Go यूज़र्स डेस्कटॉप ऐप में GPT‑6 Luna को एक्सेस कर सकते हैं. ये मॉडल अभी चैट में उपलब्ध नहीं हैं. OpenAI API में, ये gpt-6-solऔर gpt-6-luna के तौर पर उपलब्ध हैं.

सभी के लिए सर्विस को स्टेबल बनाए रखने के लिए, हम पूरे दिन धीरे-धीरे ChatGPT में इन मॉडल्स को रोल आउट करने की योजना बना रहे हैं. अगर आपको ChatGPT वर्क या Codex में नए मॉडल्स नहीं दिखते हैं, तो कृपया बाद में फिर से कोशिश करें.


GPT का मूल्यांकन हमारे रिसर्च एनवायरनमेंट में या हमारे API के ज़रिए किया गया. सिस्टम प्रॉम्प्ट और उपलब्ध टूल, आदि में अंतर होने के कारण, इससे मिलने वाला आउटपुट प्रोडक्शन ChatGPT से थोड़ा अलग हो सकता है. कॉम्पिटिटर मॉडल का मूल्यांकन सार्वजनिक तौर से उपलब्ध रिपोर्ट से लिया गया. जब Claude Fable 5.1 के स्कोर उपलब्ध नहीं थे, तब Claude Fable 5 के स्कोर बताए गए.

लेखक

OpenAI