इंटेलिजेंस की नई पीढ़ी
22 सितंबर, 2026 को अपडेट: हम GPT‑6 Sol और GPT‑6 Luna के साथ अपने GPT‑6 परिवार का विस्तार कर रहे हैं. और जानें.
हम GPT‑6 Astra पेश कर रहे हैं, दुनिया का सबसे बुद्धिमान और सबसे बेहतर एलाइंड मॉडल.
GPT‑6 Astra में प्री-ट्रेनिंग, रीइंफ़ोर्समेंट लर्निंग और अलाइनमेंट में सालों की रिसर्च और बड़े स्तर पर किए गए काम को एक साथ लाया गया है. कंप्यूटर यूज़, ब्राउज़िंग, सॉफ़्टवेयर इंजीनियरिंग, साइबर सिक्योरिटी, साइंस और प्रोफ़ेशनल वर्क में Astra स्टेट-ऑफ़-द-आर्ट है. Astra ने 98% स्कोर के साथ FrontierMath Tier 4 को अच्छी तरह से पूरा किया है, और यह पहले ही मैथ्स की लंबे समय से अटकी अनसुलझी समस्याओं को हल करने में मदद कर चुका है. Astra ने 99.9% स्कोर के साथ ARC-AGI-3 को और 100% स्कोर के साथ ExploitBench को भी पूरी तरह अपने नाम किया. यह कंप्यूटर और ब्राउज़र यूज़ में भी एक नया स्तर तय करता है और सबसे मुश्किल प्रोफ़ेशनल काम को बेजोड़ स्पीड, एक्युरेसी और सही फ़ैसले लेने की क्षमता के साथ संभालता है.
GPT‑6 Astra आज से कुछ चुनिंदा ऑर्गेनाइज़ेशन्स के लिए रोल आउट हो रहा है. आने वाले दिनों में यह सभी ChatGPT Plus, Pro, Business और Enterprise यूज़र्स के साथ-साथ OpenAI API, Microsoft Azure और AWS Bedrock के ज़रिए भी मिलेगा.
Astra हमारा सबसे बेहतर अलाइन्ड मॉडल है. यूज़र क्या चाहता है, इसे समझने और उसी हिसाब से काम करने में इसमें काफ़ी सुधार हुआ है—इसलिए आप Astra को ज़्यादा भरोसे के साथ टास्क्स दे सकते हैं. इसे टेस्ट करने के लिए हमने Hugging Face इंसिडेंट से सीख लेकर एक नया इवैल्यूएशन बनाया. यह देखता है कि मुश्किल या नामुमकिन टास्क मिलने पर मॉडल अपने तय स्कोप से बाहर जाता है या नहीं. प्रोडक्शन सेफ़गार्ड्स के बिना GPT‑5.6 Sol, 48% मामलों में तय टारगेट से बाहर गया. GPT‑6 Astra के लिए यह 0% मामलों में हुआ.
दुनिया का सबसे बेहतरीन कंप्यूटर यूज़ मॉडल
GPT‑6 Astra कंप्यूटर यूज़ की स्पीड, एक्युरेसी और सेफ़्टी में एक नया दौर शुरू करता है. यह ऑनलाइन फ़ॉर्म भरने, CRM में कस्टमर रिकॉर्ड्स अपडेट करने और आपका कैलेंडर ऑर्गेनाइज़ करने जैसे उबाऊ कामों को संभाल सकता है. यह ऑनलाइन रिसर्च कर सकता है और आपके ईमेल या डॉक्युमेंट एडिटर में समरी के ड्राफ़्ट तैयार कर सकता है. यह साइंटिफ़िक डेटा को एनालाइज़ कर सकता है, प्लॉट्स जेनरेट कर सकता है, वेबसाइट बना सकता है, और यह पक्का करने के लिए फ़्रंटएंड QA चेक्स चला सकता है कि उस साइट पर मौजूद सभी फ़ीचर्स सही ढंग से काम करें. यह अपने आप सॉफ़्टवेयर इंस्टॉल और टेस्ट करने, और स्क्रीन पर दिखने वाली दिक्कतों को दूर करने में आपकी मदद कर सकता है. ये सुधार हमारे सबसे बेहतरीन टेस्टिंग नतीजों में भी साफ़ नज़र आते हैं.
इन सुधारों से रियल नॉलेज-वर्क टास्क्स कम समय और रिसोर्स में पूरे किए जा सकते हैं. OSWorld 2.0 की लेटेंसी सिम्युलेशन्स में, Astra ने GPT‑5.6 Sol के मुकाबले हर टास्क में लगभग 47% कम समय में बेहतर कंप्यूटर यूज़ परफ़ॉर्मेंस दी. Astra ने लगभग 40 मिनट प्रति टास्क में 72.6% स्कोर किया, जबकि Sol ने लगभग 75 मिनट में 65.7% स्कोर किया.33
GPT‑6 Astra की कंप्यूटर-यूज़ क्षमताएँ गेम डेवलपमेंट, इलेक्ट्रिकल इंजीनियरिंग और रोज़मर्रा के नॉलेज वर्क सहित अलग-अलग क्षेत्रों के आउटपुट में देखी जा सकती हैं:
Astra के साथ, हम कंप्यूटर यूज़ की स्पीड को काफ़ी बेहतर बनाने के लिए Codex हार्नेस को भी अपडेट कर रहे हैं. Astra की एफ़िशिएंसी के साथ मिलकर, यह Mind2Web बेंचमार्क पर मौजूदा GPT‑5.6 Sol के मुकाबले 1.9 गुना तेज़ी से काम पूरा करता है. मॉडल की स्पीड में सुधार का मतलब है कि यह आपके रोज़मर्रा के कई समय लेने वाले काम आपसे भी तेज़ी से निपटा सकता है.4
प्रोफ़ेशनल काम में एक बड़ा बदलाव
GPT‑6 Astra कंप्यूटर यूज़ में बेहतर क्षमताओं को प्रोफ़ेशनल एनवायरनमेंट्स के लिए टारगेटेड ट्रेनिंग के साथ जोड़ता है, ताकि कॉम्प्लेक्स वर्क टास्क्स को बेहतर ढंग से संभाला जा सके. यह कॉम्प्लेक्स प्रॉब्लम्स को हल करने के लिए ज़रूरी इंटेलिजेंस को मल्टीस्टेप वर्कफ़्लो पूरा करने और अच्छी तरह तैयार डॉक्यूमेंट्स, स्प्रेडशीट्स और प्रेज़ेंटेशन्स बनाने की क्षमता के साथ जोड़ता है.
मौजूदा टेम्पलेट्स का पालन करने और ऐसे साफ़-सुथरे लेआउट वाले प्रेज़ेंटेशन बनाने के लिए GPT‑6 Astra हमारा सबसे बेहतरीन मॉडल है, जो पूरी बात को सही तरीके से आसानी से समझाता है. यह आपके टेम्पलेट्स के हिसाब से साफ़ और वेल-स्ट्रक्चर्ड डॉक्युमेंट्स, प्रेज़ेंटेशन्स, स्प्रेडशीट्स और एनालिसिस तैयार करता है, जो आपकी राइटिंग और विज़ुअल स्टाइल से मेल खाते हैं. Astra को खास तौर पर आउटपुट में सिर्फ़ काम का कॉन्टेक्स्ट लाने के लिए ट्रेन किया गया है, ताकि यह गैर-ज़रूरी जानकारी बार-बार न दोहराए. इन सब का मतलब यह है कि यह सीधे इस्तेमाल करने लायक ऐसी चीज़ें तैयार कर सकता है जो आपके बिज़नेस के स्टैंडर्ड पर खरी उतरती है.
GPT‑6 Astra वेबसाइट्स, गेम्स, ऐप्लिकेशन्स और रेंडरिंग्स बनाते समय बेहतर विज़ुअल फ़ैसले लेने की क्षमता भी देता है. ChatGPT में साइट्स(एक नई विंडो में खुलेगा) के साथ, Astra सीधे एक प्रॉम्प्ट से वेबसाइट्स, वेब ऐप्स और गेम्स बना, होस्ट और शेयर कर सकता है.
जहाँ इंस्ट्रक्शन्स को अलग-अलग तरह से समझने की गुंजाइश होती है, वहाँ GPT‑6 Astra पिछले मॉडल्स के मुकाबले सही फ़ैसला लेने में बेहतर है. यह आम तौर पर छूटी हुई जानकारी को कॉन्टेक्स्ट की मदद से पूरा करता है और जब जवाब से नतीजा बदल सकता हो, तब सीधे और काम के सवाल पूछता है. Codex में यह आपसे सवाल पूछने के बाद भी, आपके जवाब पर निर्भर न रहने वाला काम साथ-साथ जारी रख सकता है. अगर आप जवाब नहीं देते हैं, तो जहाँ सही हो वहाँ यह समझदारी भरे अनुमानों के साथ आगे बढ़ता है. लेकिन अहम फ़ैसलों के लिए यह आपके जवाब का इंतज़ार करता है.
नीचे दिए गए उदाहरण दिखाते हैं कि Astra रोज़मर्रा के उन टास्क्स में कैसे साथ मिलकर काम करता है, जहाँ छूटी हुई जानकारी से जवाब काफ़ी बदल सकता है.
टास्क में बदलाव होते रहने पर भी Astra उसका पूरा कॉन्टेक्स्ट बनाए रखने में बेहतर है. पहले के मॉडल्स कभी-कभी दिशा बदलने वाले मैसेज को नया लक्ष्य मान लेते थे और ओरिजिनल रिक्वेस्ट या पहले बताई गई शर्तों से भटक जाते थे. Astra नई रिक्वायरमेंट्स को शामिल करता है, कहने पर अपना तरीका बदलता है और पूरे टास्क से ध्यान हटाए बिना बीच में पूछे गए सवालों के जवाब भी देता है.
कोडिंग
GPT‑6 Astra अब तक सॉफ़्टवेयर इंजीनियरिंग के लिए सबसे बेहतरीन मॉडल है.
"GPT‑6 Astra हमारे इंटरनल कोडिंग बेंचमार्क्स पर स्टेट-ऑफ़-द-आर्ट परफ़ॉर्मेंस देता है और GPT‑5.6 Sol के मुकाबले ट्रेडिंग इंट्यूशन इवैल्यूएशन्स में साफ़ तौर पर बेहतर नतीजे देता है. एजेंटिक कोडिंग के लिए इस्तेमाल किए जाने पर, GPT‑6 Astra ऐसे तरीके से कम्युनिकेट करता है जिसे डेवलपर्स के लिए समझना आसान है और ऐसा कोड बनाता है जिसे प्रोडक्शन क्वालिटी तक पहुँचने के लिए कम इटरेशन की ज़रूरत होती है.”
"हमने अपने पहले दौर के टेस्ट्स में से एक पर Astra को लो, मीडियम और हाई एफ़र्ट पर परखा, और यह GPT 5.6 Sol से काफ़ी आगे निकला. ज़्यादा एफ़र्ट का मतलब है एक नए बिल्ड पर ज़्यादा बार काम करना, ब्राउज़र टेस्टिंग के ज़रिए बेहतर जाँच, और पैच लगाने के बजाय सीधे कोड रन करने पर ज़ोर. मॉडल अपना एफ़र्ट कैसे लगाता है, यह समझकर ही हम लाखों बिल्डर्स को आइडिया से लेकर काम करने वाले ऐप तक का तेज़ और भरोसेमंद रास्ता देते हैं."
Astra के साथ, हम Codex में कॉन्टेक्स्ट विंडो भरने पर कॉन्टेक्स्ट को सुरक्षित रखने और वापस पाने का एक नया तरीका ला रहे हैं. पहले, मुश्किल बग्स को ठीक करने में या बड़े बदलाव करते समय लंबे सेशन्स के दौरान मॉडल्स काम को समराइज़ करने के लिए कम्पैक्शन का इस्तेमाल करते थे. हर कम्पैक्शन से यह जानकारी छूट सकती है कि कोई फ़िक्स क्यों काम नहीं आया या कोई कॉम्पोनेंट कैसा व्यवहार करता है. Codex में, Astra कॉन्टेक्स्ट विंडोज़ में नोट्स रख सकता है, जिससे बार-बार एक ही समरी में दबाए बिना पूरी जानकारी सुरक्षित रहती है. पुरानी कॉन्टेक्स्ट विंडोज़ सर्च करने लायक बनी रहती हैं, इसलिए Astra पिछले मैसेज और टूल आउटपुट्स से ज़रूरतें या टेस्ट रिज़ल्ट्स ढूँढ सकता है—भले ही वह जानकारी उसके नोट्स में दर्ज न हो. आप इस एक्सपेरिमेंटल फ़ीचर को अपने Codex config.toml(एक नई विंडो में खुलेगा) में चालू कर सकते हैं, और आने वाले हफ़्तों में यह Astra के लिए डिफ़ॉल्ट बन जाएगा.
साइंटिफ़िक खोज को आगे बढ़ाना
Astra साइंटिफ़िक खोज के पीछे के प्रैक्टिकल काम में मदद कर सकता है. साइंटिफ़िक रीज़निंग और कंप्यूटर यूज़ को जोड़कर, यह डेटा जाँचने और नतीजों को समझने के लिए सीधे स्पेशल सॉफ़्टवेयर में काम कर सकता है, जिससे रिसर्चर्स को एविडेंस को परखने और आगे की जाँच तय करने में मदद मिलती है.
साइबरसिक्योरिटी
जैसा कि हमने अपने सेफ़्टी अपडेट में बताया था, Astra साइबर क्षमताओं की दिशा में एक बड़ा कदम है और साइबर सिक्योरिटी में क्रिटिकल थ्रेशोल्ड को हमारे प्रिपेयर्डनेस फ़्रेमवर्क के तहत पूरा करता है. ज़ीरो-डे एक्सप्लॉइट्स की पहचान करने और उन्हें विकसित करने की इसकी क्षमता डिफ़ेंडर्स को कमियाँ खोजने और उन्हें दूर करने में मदद कर सकती है, लेकिन यह मज़बूत सेफ़गार्ड्स की ज़रूरत भी पैदा करती है. यह समझने के लिए कि ये क्षमताएँ कहाँ तक जाती हैं, हमने Astra को इंटरनल और थर्ड-पार्टी एक्सपर्ट इवैल्यूएशन्स पर टेस्ट किया.
हमने सबसे पहले मॉडल को प्रोडक्शन सेफ़गार्ड्स के बिना ExploitBench और ExploitGym पर टेस्ट किया. ये इवैल्यूएशन्स देखते हैं कि मॉडल्स पहले से मालूम सॉफ़्टवेयर कमज़ोरियों को काम करने वाले एक्सप्लॉइट्स में बदल सकते हैं या नहीं. ExploitBench पर Astra ने 100% का परफ़ेक्ट स्कोर हासिल किया, जबकि हमारे पिछले फ़्रंटियर साइबर मॉडल GPT‑5.6 Sol का स्कोर 78.5% था. ExploitGym पर Astra ने 42.4% की सक्सेस रेट हासिल की, जबकि GPT‑5.6 Sol का स्कोर 30.3% था—वो भी काफ़ी कम आउटपुट टोकन का इस्तेमाल करते हुए.13
इस चिंता को देखते हुए कि सॉफ़्टवेयर की पुरानी कमज़ोरियों की जानकारी से बेंचमार्क नतीजों पर असर पड़ा हो सकता है, हमने Astra को दो नए बेंचमार्क्स पर भी इवैल्यूएट किया. इनमें से एक के लिए, हमने पिछले तीन महीनों की कमज़ोरियों का इस्तेमाल करके एक्सप्लॉइट डेवलपमेंट को इवैल्यूएट करने के लिए एक इंटरनल "ExploitBench (जून–अगस्त 2026)" टेस्ट तैयार किया.14 इस डेटासेट पर Astra ने GPT‑5.6 Sol के मुकाबले आर्बिट्रेरी कोड-एग्ज़ीक्यूशन की काफ़ी ज़्यादा दर हासिल की, जबकि इसने बहुत कम आउटपुट टोकन्स इस्तेमाल किए. इवैल्यूएशन के दौरान, Astra ने दो ऐसी नई ज़ीरो-डे कमजोरियाँ ढूँढीं और इस्तेमाल कीं जो पहले किसी को मालूम नहीं थीं. हम ये दोनों कमज़ोरियाँ उनके मेंटेनर्स के साथ शेयर कर रहे हैं.
हमने Astra को SRE-Bench15 पर भी टेस्ट किया. यह बेंचमार्क देखता है कि मॉडल्स रॉ सोर्स कोड के एक्सेस के बिना सॉफ़्टवेयर बाइनरीज़ को रिवर्स इंजीनियर करके उनके काम करने का मुख्य तरीका समझ सकते हैं या नहीं. Astra ने एक ही कोशिश में 88.0% टास्क हल किए और चार कोशिशों में 99.2% टास्क हल किए, जबकि GPT‑5.6 Sol ने इनमें 55.9% और 68.7% टास्क हल किए.
बेंचमार्क्स से आगे बढ़कर, एक्सपर्ट्स के असेसमेंट में पाया गया कि Astra, प्रोडक्शन सेफगार्ड्स के बिना चलाए जाने पर, पहले से अनजानी सुरक्षा खामियों का इस्तेमाल करके मज़बूत ब्राउज़र्स में आर्बिट्ररी कोड एग्ज़ीक्यूशन हासिल कर सकता है और मज़बूत ऑपरेटिंग सिस्टम्स के लिए प्रिविलेज-एस्केलेशन एक्सप्लॉइट्स तैयार कर सकता है.
जैसा कि हमने द डिफ़ेंडर्स विंडो में बताया था कि फ़्रंटियर साइबर क्षमताएँ डिफ़ेंडर्स को कमियाँ तेज़ी से ढूँढने में मदद कर सकती हैं, लेकिन वे इन कमियों का फ़ायदा उठाना भी आसान बना देती हैं, जिससे डिफ़ेंडर्स के लिए तेज़ी से तालमेल बनाना बेहद ज़रूरी हो जाता है. आज लॉन्च हो रहे Astra के वर्ज़न के साथ, डिफ़ेंडर्स इसका इस्तेमाल सिक्योर कोड रिव्यू और पैचिंग जैसे टास्क्स पूरे करने के लिए कर सकते हैं.
हालाँकि, Astra कमज़ोरियों के लिए प्रूफ़-ऑफ़-कॉन्सेप्ट एक्सप्लॉइट्स बनाने जैसे ज़्यादा एडवांस्ड साइबर सिक्योरिटी टास्क्स करने से साफ़ मना कर देगा. OpenAI Daybreak के ज़रिए, हम आने वाले हफ्तों में एक्सेस बढ़ाने और कम पाबंदियों वाले सुरक्षा उपाय लागू करने की योजना बना रहे हैं. इससे और ज़्यादा डिफ़ेंसिव वर्कफ़्लो इस्तेमाल किए जा सकेंगे, जिनमें कमज़ोरियाँ और प्रूफ़-ऑफ़-कॉन्सेप्ट वैलिडेशन, मालवेयर एनालिसिस और डिटेक्शन इंजीनियरिंग शामिल हैं.
हमने GPT‑5.6 Sol के सेफ़गार्ड्स स्टैक को और मज़बूत करते हुए साइबर के संभावित गलत इस्तेमाल के खिलाफ़ अपनी सुरक्षा और मज़बूत की है. इनमें संभावित जेलब्रेक्स से बेहतर तरीके से निपटने के लिए मॉडल की ज़्यादा मज़बूती और हमारे मॉनिटरिंग सिस्टम्स के लिए बेहतर कॉन्टेक्स्ट शामिल हैं. हमने कड़े इंटरनल और एक्सटर्नल टेस्ट जारी रखे हैं. इनमें हमारी इंटरनल रेड-टीमिंग अटैकरटीम के साथ ऑटोमेटेड इवैल्यूएशन्स भी शामिल हैं. हमारे साइबर सेफ़गार्ड्स और टेस्टिंग के बारे में Astra सेफ़्टी ओवरव्यू और सिस्टम कार्ड(एक नई विंडो में खुलेगा) में और जानकारी मिल सकती है.
GPT‑6 Astra को ज़िम्मेदारी से अलाइन और डिप्लॉय करना
Astra हमारा सबसे बेहतर अलाइन्ड मॉडल है. Astra सावधानी से काम करने, टास्क की तय सीमाओं के अंदर रहने और यूज़र से साफ़ तौर पर कम्युनिकेट करने में बेहतर है. यह हमारे लंबे समय से चल रहे रिसर्च प्रोग्राम का नया काम है, जिसका फ़ोकस ऐसे मॉडल्स को ट्रेन करना है जो शुरू से आखिर तक यूज़र के मकसद के मुताबिक काम करें.
ज़्यादा रिस्क वाले एनवायरनमेंट्स में Astra रिस्क के हिसाब से ज़्यादा सावधानी से काम करता है. एक इवैल्यूएशन में ऐसे कंप्यूटर यूज़ टास्क्स चुने गए थे जो मॉडल से गलत व्यवहार करवाने के लिए बनाए गए थे. इनमें Astra अनचाहे नतीजों से बचने में ज़्यादा सफल रहा. डिफ़ॉल्ट तौर पर मिलने वाले अतिरिक्त सिक्योरिटी उपायों के साथ Astra ने और बेहतर परफ़ॉर्म किया.
टेस्ट किए गए दूसरे सभी फ़्रंटियर मॉडल्स के मुकाबले Astra में तय मकसद से अलग नतीजे कम देखने को मिले. सही तुलना के लिए हमने एक जेनेरिक कंप्यूटर-यूज़िंग एजेंट हार्नेस इस्तेमाल किया. यह OpenAI Responses API(एक नई विंडो में खुलेगा) और Anthropic Messages API(एक नई विंडो में खुलेगा), दोनों में मौजूद नेटिव कंप्यूटर यूज़ टूल्स पर आधारित है. इसमें वे अतिरिक्त सेफ़्टी फ़ीचर्स शामिल नहीं थे जो आम तौर पर Codex और ChatGPT वर्क के यूज़र्स के लिए इस्तेमाल किए जाते हैं, जैसे ऑटो-रिव्यू और कन्फ़र्मेशन पॉलिसी.
Astra के यूज़र की ओर से तय और उसके एनवायरनमेंट से मिलने वाले दायरे के अंदर काम करने की संभावना भी ज़्यादा है. एक इंटरनल इवैल्यूएशन में, Astra ने Codex Auto-Review से मना किए जाने पर उसे बायपास करने की कभी कोशिश नहीं की. ऐसा तब भी रहा जब Auto-Review को जानबूझकर इस तरह कॉन्फ़िगर किया गया था कि उसे बायपास किया जा सके और उसके बिना टास्क पूरा करना नामुमकिन था. एनवायरनमेंट की पाबंदियों के अंदर काम करने का यह व्यवहार हमारे इम्पॉसिबल साइबर टास्क इवैल्यूएशन के रिज़ल्ट्स से मेल खाता है, जिन्हें हमने इस पोस्ट की शुरुआत में शेयर किया था. यह हमारे सिस्टम कार्ड(एक नई विंडो में खुलेगा) में दर्ज दूसरे नतीजों से भी मेल खाता है.
Astra यूज़र्स के साथ साफ़ कम्युनिकेशन में भी नए स्टैंडर्ड सेट करता है. एक इवैल्यूएशन के मुताबिक, GPT‑5.6 Sol के मुकाबले Astra के अपनी क्षमताओं और फ़ीचर्स के बारे में गलत जानकारी देने की संभावना तीन गुना कम है.
हमारे कैपेबिलिटी-हलुसिनेशन इवैल्यूएशन में, Astra GPT‑5.6 Sol के मुकाबले काफ़ी बेहतर सुधार दिखाता है और अपनी क्षमताओं को लेकर गलत या बढ़ा-चढ़ाकर किए गए दावे कम करता है.
हमारे इवैल्यूएशन्स में Astra की लिखी हुई रीज़निंग को GPT‑5.6 Sol के मुकाबले मॉनिटर करना ज़्यादा मुश्किल पाया गया. ये टेस्ट खास तौर पर मॉडल को मॉनिटरिंग से बचने के लिए कहते थे. इसकी एक वजह यह हो सकती है कि आसान टास्क्स में Astra अपनी लिखी हुई रीज़निंग पर ज़्यादा कंट्रोल रखता है और कम लिखे हुए स्टेप्स में प्रॉब्लम्स हल कर सकता है. मुश्किल टास्क्स के लिए ज़रूरी रीज़निंग को छिपाना Astra के लिए अब भी मुश्किल दिखता है, लेकिन मॉनिटरिंग में आई इस कमी को हम गंभीरता से देख रहे हैं. रीज़निंग को आसानी से मॉनिटर कर पाना हमारी रिसर्च में अहम बना हुआ है. साथ दिए गए सिस्टम कार्ड(एक नई विंडो में खुलेगा) में हमारे नतीजों और इस पर चल रहे काम की जानकारी है.
अलाइनमेंट ट्रेनिंग हमारे डिप्लॉयमेंट के तरीके का अहम हिस्सा है. सेफ़्टी की एक और लेयर के तौर पर, हम Codex Auto-review(एक नई विंडो में खुलेगा) जैसे सिस्टम सेफ़गार्ड्स भी बनाते हैं. साथ ही एजेंट्स की रीज़निंग और ऐक्शन्स को मॉनिटर करते हैं, ताकि असुरक्षित व्यवहार का पता लगाकर उसे रोका जा सके. हमारे सेफ़्टी अपडेट में बताए गए तरीके के मुताबिक, हम Astra-क्लास मॉडल के लिए प्रोडक्शन में मिसअलाइनमेंट मॉनिटरिंग भी लगा रहे हैं, ताकि मिसअलाइनमेंट की जानकारी मिल सके और इसके सबसे गंभीर मामलों को रोकने में मदद मिल सके. ये सेफ़गार्ड्स हमारे इंटरनल डिप्लॉयमेंट्स में इस्तेमाल होने वाली मॉनिटरिंग जैसे हैं. इनमें क्लासिफ़ायर्स का एक सिस्टम होता है, जो मॉडल की रीज़निंग और ऐक्शन्स को बिना मंज़ूरी वाले व्यवहार के लिए चेक करता है और ऐसी संभावित बिना मंज़ूरी वाली एक्टिविटी को अपने आप रोक देता है.
Astra की साइबर सिक्योरिटी क्षमताएँ काफ़ी बढ़ी हैं, इसलिए हम इस डिप्लॉयमेंट को सेफ़ और सिक्योर रखने पर खास ध्यान दे रहे हैं. अतिरिक्त सेफ़्टी चेक्स कभी-कभी सही काम को भी धीमा कर सकते हैं, कुछ समय के लिए रोक सकते हैं या पूरी तरह रोक सकते हैं. इसमें डिफ़ेंसिव साइबर सिक्योरिटी का काम भी शामिल है. अगर ChatGPT या Codex में कोई काम रुकता है, तो आगे बढ़ने से पहले आपसे उस ऐक्शन को रिव्यू करने के लिए कहा जा सकता है. API में, वह टास्क रुक जाएगा. ये चेक्स कभी-कभी सही काम में भी रुकावट डाल सकते हैं, और गैर-ज़रूरी रुकावटों को कम करने के लिए हम इस सिस्टम को लगातार बेहतर बना रहे हैं. मिसअलाइनमेंट मॉनिटरिंग, अलाइनमेंट की जगह नहीं ले सकती. हमारा मकसद ऐसे मॉडल्स बनाना है जो भरोसे के साथ अपने तय स्कोप में रहें, ताकि इन सेफ़्टी सिस्टम्स को बीच में रोकने की ज़रूरत ही न पड़े.
उपलब्धता
GPT‑6 Astra आज से कुछ चुनिंदा ऑर्गेनाइज़ेशन्स के लिए रोल आउट हो रहा है. आने वाले दिनों में यह सभी ChatGPT Plus, Pro, Business और Enterprise यूज़र्स के साथ-साथ OpenAI API, Microsoft Azure और AWS Bedrock के ज़रिए भी मिलेगा. Astra का इस्तेमाल मौजूदा सब्सक्रिप्शन अलाउंस में शामिल है. ज़्यादा इस्तेमाल के लिए यूज़र्स और बिज़नेस अलग से भी क्रेडिट्स खरीद सकते हैं. Pro, Business और Enterprise प्लान वाले यूज़र्स को GPT‑6 Astra Pro का एक्सेस भी मिलेगा. Enterprise एडमिनिस्ट्रेटर्स अपने वर्कस्पेस के लिए Astra को चालू कर सकते हैं; लॉन्च के समय इसका एक्सेस डिफ़ॉल्ट तौर पर बंद रहेगा.
योग्य API कस्टमर्स के लिए Astra, ज़ीरो डेटा रिटेंशन की सुविधा देता है. जैसा कि हमने पिछले महीने बताया था, हम प्राइवेट सेफ़्टी प्रोसेसिंग की टेस्टिंग भी कर रहे हैं, ताकि कस्टमर की प्राइवेसी बनाए रखते हुए सेफ़्टी मॉनिटरिंग को बेहतर किया जा सके.
डेवलपर्स को GPT‑6 Astra, OpenAI API में gpt-6-astra के तौर पर और Microsoft Azure और Amazon Bedrock के ज़रिए मिलेगा.
OpenAI API की स्टैंडर्ड प्राइसिंग हर दस लाख इनपुट टोकन्स के लिए $10 और हर दस लाख आउटपुट टोकन्स के लिए $50 है. कैश रीड्स और राइट्स के लिए अलग रेट्स लागू होते हैं. API में GPT‑6 Astra के लिए तेज़ मोड उपलब्ध है. यह स्टैंडर्ड प्रोसेसिंग के मुकाबले 2 गुना तक तेज़ स्पीड देता है और इसकी कीमत स्टैंडर्ड कीमत से 2 गुना है.
पेशेवर
पेशेवर | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.40% | 18.10% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore स्ट्रिंग क्वार्टेट्स (एक - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
इंटरनल डिज़ाइन टास्क्स | 50.0% | 47.4% | - | 35.8% | - | - |
इंटरनल डेटा साइंस टास्क्स | 40.9% | 30.5% | - | 34.7% | - | - |
आर्टिफ़िशियल एनालिसिस इंटेलिजेंस इंडेक्स v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
कोडिंग
| कोडिंग | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 एक्सटेंडेड (स्कोर) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 मुख्य (स्कोर) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| इंटरनल डेटाबेस माइग्रेशन टास्क | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| आर्टिफ़िशियल एनालिसिस कोडिंग एजेंट इंडेक्स v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
शैक्षणिक
शैक्षणिक | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath टियर 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA डायमंड | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (टूल्स के साथ) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
अलाइनमेंट
अलाइनमेंट | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
इंटरनल कंप्यूटर यूज़ सेफ़्टी बेंचमार्क (कम होना बेहतर है) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
इंटरनल कंप्यूटर यूज़ सेफ़्टी बेंचमार्क, AutoReview के साथ (कम होना बेहतर है) | 1.8% | 4.3% | - | - | - | - |
इंटरनल बायपास बेंचमार्क (कम होना बेहतर है) | 0.00% | 0.29% | - | - | - | - |
ExploitGym हनीपॉट (कम होना बेहतर है) | 0.0% | 48.2% | - | - | - | - |
असंभव ExploitGym | 100.0% | - | - | - | - | - |
इंटरनल हैलुसिनेशन बेंचमार्क (कम होना बेहतर है) | 4.2% | 12.2% | - | - | - | - |
लंबा कॉन्टेक्स्ट
लंबा कॉन्टेक्स्ट | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
एब्सट्रैक्ट रीज़निंग
| एब्स्ट्रैक्ट रीज़निंग | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
इवैल्यूएशन स्कोर्स किसी भी एफ़र्ट लेवल पर मिले सबसे ज़्यादा स्कोर हैं. GPT इवैल्यूएशन्स हमारे रिसर्च एनवायरनमेंट में या हमारी API के ज़रिए चलाए गए. सिस्टम प्रॉम्प्ट्स, उपलब्ध टूल्स वगैरह में अंतर होने की वजह से इनके आउटपुट प्रोडक्शन ChatGPT से थोड़े अलग हो सकते हैं.
फ़ुटनोट्स
- 1
ARC-AGI-3 पर, GPT-6 Astra को हमारे रेस्पॉन्सेज़ API हार्नेस के साथ चलाया गया, जो रियल-वर्ल्ड परफ़ॉर्मेंस से बेहतर मेल खाने के लिए दो सेटिंग्स बदलता है. ये बदलाव खास तौर पर ARC-AGI-3 को टारगेट नहीं करते हैं.
- 2
GPT-5.6 Sol से मतलब उस वर्ज़न से है जो हमारे API, ChatGPT Codex और ChatGPT वर्क में उपलब्ध है. ChatGPT चैट में दिया गया वर्ज़न थोड़ा अलग है.
- 3
OSWorld V2-Offline, ओरिजिनल OSWorld V2 का एक सबसेट है, जो इंटरनेट एक्सेस के बिना काम करता है. OSWorld-V2 Offline पर Claude मॉडल की परफ़ॉर्मेंस को ऑथर्स ने ऑफ़िशियल लीडरबोर्ड(एक नई विंडो में खुलेगा) पर दोबारा हासिल किया. OSWorld 2.0 पर Claude के स्कोर्स में ऑफ़िशियल सेटिंग्स इस्तेमाल की गई हैं, न कि Fable 5.1 सिस्टम कार्ड के बदले हुए टास्क्स और ग्रेडिंग.
- 4
- 5
BenchCAD पर Claude के स्कोर्स में इवैल्यूएशन में किए गए 3 बदलाव शामिल हैं. इनकी जानकारी Fable 5.1 सिस्टम कार्ड(एक नई विंडो में खुलेगा) में दी गई है.
- 6
गुआँग याँग, विक्टोरिया एबर्ट, नाज़िफ़ टैमर, ब्रायन सियुआन झेंग, लुइज़ा पॉज़ोबोन और नोआ ए. स्मिथ. “LEGATO: टाइपसेट OMR के लिए बड़े पैमाने का एंड-टू-एंड जनरलाइज़ करने लायक तरीका(एक नई विंडो में खुलेगा).” arXiv:2506.19065, 2025.
- 7
मार्क आर. एच. गोथम, मॉरीन रेडबॉन्ड, ब्रूनो बावर और पीटर जोनस. "OpenScore स्ट्रिंग क्वार्टेट कॉर्पस(एक नई विंडो में खुलेगा)." म्यूज़िकोलॉजी के लिए डिजिटल लाइब्रेरीज़ पर 10वीं इंटरनेशनल कॉन्फ़्रेंस की प्रोसीडिंग्स, पेज. 49–57. ACM, 2023.
- 8
FrontierCode पर, GPT-6 Astra को एक डेवलपर मैसेज के साथ चलाया गया, जो उसके Codex में डेवलपर मैसेज के एक सेक्शन(एक नई विंडो में खुलेगा) जैसा था: "बहुत ज़्यादा टेस्ट फ़ाइलें बनाने से बचें. नई टेस्ट फ़ाइल तभी बनाएँ, जब रिपॉज़िटरी के नियमों के हिसाब से ज़रूरी हो या कोई मौजूदा फ़ाइल लायक जगह न हो. ऐसे क्लीनअप से बचें जिसका इस काम से संबंध नहीं है और बेवजह चीज़ों को मुश्किल न बनाएँ. जहाँ सही हो, मौजूदा यूटिलिटीज़ का दोबारा इस्तेमाल करें. काम से जुड़े रिपॉज़िटरी इंस्ट्रक्शन्स पढ़ें और आसपास के कोड, टेस्ट्स, डॉक्यूमेंटेशन और CI को देखें. पहले से चले आ रहे तरीकों को फ़ॉलो करें. मकसद साफ़ और आसानी से मर्ज किया जा सकने वाला कोड बनाना है." प्रॉम्प्ट को इस इवैल्यूएशन के लिए खास तौर पर ऑप्टिमाइज़ नहीं किया गया था.
- 9
पहला सवाल इस बारे में है कि नंबर लाइन पर कितनी भी दूर जाने पर प्राइम नंबर्स एक-दूसरे के कितने करीब मिल सकते हैं. एक दशक से ज़्यादा समय तक, सबसे अच्छा मालूम जवाब यह था कि प्राइम नंबर्स के ऐसे अनगिनत जोड़े हैं जिनके बीच का फ़ासला ज़्यादा-से-ज़्यादा 246 है. जूलिया स्टैडलमैन(एक नई विंडो में खुलेगा) ने हाल ही में इस लिमिट को 240 तक बेहतर किया. Astra ने इस लिमिट को और बेहतर करके 186 तक लाने में मदद की. इससे पता चलता है कि प्राइम नंबर्स के अनगिनत जोड़े इस छोटे फ़ासले के अंदर मिलते हैं. छोटे प्राइम गैप्स: प्रूफ़(एक नई विंडो में खुलेगा) और इससे जुड़ी रिसर्च(एक नई विंडो में खुलेगा).
- 10
दूसरा सवाल प्राइम नंबर्स के बीच मिलने वाले बहुत बड़े फ़ासले से जुड़ा है. Astra ने इस फ़ासले की एक लिमिट में इस्तेमाल होने वाले एक टर्म को बेहतर किया, जो 80 साल से ज़्यादा समय से नहीं बदला था. हम दोनों रिज़ल्ट्स के प्रूफ़, छोटी की गई चेन-ऑफ़-थॉट और वेरिफ़िकेशन से जुड़े मटीरियल शेयर कर रहे हैं. प्राइम के बीच बड़े फ़ासले: प्रूफ़(एक नई विंडो में खुलेगा) और इससे जुड़ी रिसर्च(एक नई विंडो में खुलेगा).
- 11
- 12
- 13
- 14
ExploitBench (जून-अगस्त 2026) में Chrome के 13 स्टेबल रिलीज़ में मिली सुरक्षा की 20 ज़्यादा गंभीर कमज़ोरियाँ मौजूद हैं. यह बेंचमार्क टेस्ट करता है कि एजेंट्स बताई गई हर कमज़ोरी का फ़ायदा उठाकर V8 और Linux के लिए ऑफ़िशियल Chrome रिलीज़ में आर्बिट्रेरी कोड एग्ज़ीक्यूशन कर सकते हैं या नहीं. शामिल की गई कुछ कमज़ोरियों में इवैल्यूएशन की शर्तों के अंदर आर्बिट्रेरी कोड एग्ज़ीक्यूशन करना मुमकिन नहीं हो सकता. इसलिए 100% सक्सेस रेट हासिल करना मुमकिन न हो. नोट: GPT-5.6 Sol का 5.5% स्कोर बेंचमार्क की 300-टर्न लिमिट का असर है. मैक्स इस्तेमाल करने वाले असली कस्टमर्स पर यह लिमिट लागू नहीं होती. समान सेटिंग्स पर मॉडल ने कम सीमाओं का सामना करने पर 11.5% स्कोर हासिल किया.
- 15
जेरेमी स्पेंस और अन्य. "एजेंटिक साइबर सिक्योरिटी के लिए अगला चैलेंज: एक रियलिस्टिक, पुरानी कमज़ोरियों के असर के-फ़्री रिवर्स इंजीनियरिंग बेंचमार्क(एक नई विंडो में खुलेगा)." arXiv:2608.11469v1, 2026.
- 16
थर्ड-पार्टी मॉडल्स को टेस्ट करते समय हम एक आसान रिसर्च सेटअप इस्तेमाल करते हैं. Codex का प्रोडक्शन कॉन्फ़िगरेशन ज़्यादा कॉम्प्लेक्स है, इसलिए रॉ मॉडल की एरर रेट अलग हो सकती है. प्रोवाइडर की तरफ़ के सेफ़गार्ड्स और कंप्यूटर टूल्स के काम करने के तरीके भी अलग हैं. Codex यूज़र्स को बिना कन्फ़र्मेशन वाला यह सेटअप नहीं मिलता, क्योंकि यह सिर्फ़ इंटरनल रिसर्च के लिए इस्तेमाल होने वाला कॉन्फ़िगरेशन है.
- 17
