OpenAI

GPT-6 Astra: A new generation of intelligence

इंटेलिजेंस की नई पीढ़ी

22 सितंबर, 2026 को अपडेट: हम GPT‑6 Sol और GPT‑6 Luna के साथ अपने GPT‑6 परिवार का विस्तार कर रहे हैं. और जानें.

हम GPT‑6 Astra पेश कर रहे हैं, दुनिया का सबसे बुद्धिमान और सबसे बेहतर एलाइंड मॉडल.

GPT‑6 Astra में प्री-ट्रेनिंग, रीइंफ़ोर्समेंट लर्निंग और अलाइनमेंट में सालों की रिसर्च और बड़े स्तर पर किए गए काम को एक साथ लाया गया है. कंप्यूटर यूज़, ब्राउज़िंग, सॉफ़्टवेयर इंजीनियरिंग, साइबर सिक्योरिटी, साइंस और प्रोफ़ेशनल वर्क में Astra स्टेट-ऑफ़-द-आर्ट है. Astra ने 98% स्कोर के साथ FrontierMath Tier 4 को अच्छी तरह से पूरा किया है, और यह पहले ही मैथ्स की लंबे समय से अटकी अनसुलझी समस्याओं⁠ को हल करने में मदद कर चुका है. Astra ने 99.9% स्कोर के साथ ARC-AGI-3 को और 100% स्कोर के साथ ExploitBench को भी पूरी तरह अपने नाम किया. यह कंप्यूटर और ब्राउज़र यूज़ में भी एक नया स्तर तय करता है और सबसे मुश्किल प्रोफ़ेशनल काम को बेजोड़ स्पीड, एक्युरेसी और सही फ़ैसले लेने की क्षमता के साथ संभालता है. 

GPT‑6 Astra आज से कुछ चुनिंदा ऑर्गेनाइज़ेशन्स के लिए रोल आउट हो रहा है. आने वाले दिनों में यह सभी ChatGPT Plus, Pro, Business और Enterprise यूज़र्स के साथ-साथ OpenAI API, Microsoft Azure और AWS Bedrock के ज़रिए भी मिलेगा.

"ARC-AGI-3 पर Astra ने 96% लेवल्स में हमारे ह्यूमन ऐक्शन-एफ़िशिएंसी बेसलाइन को पीछे छोड़ दिया और बेंचमार्क पर लगभग इंसानी लेवल तक पहुँच गया. यह न सिर्फ़ हमारे द्वारा अब तक टेस्ट किया गया सबसे अच्छा मॉडल है, बल्कि फ़्रंटियर-मॉडल परफ़ॉर्मेंस में भी एक बड़ा बदलाव दिखाता है - यह नए एनवायरनमेंट्स को समझने और उनमें प्रॉब्लम्स हल करने के साथ-साथ, यह सब करना कितनी एफ़िशिएंसी से सीखता है, उसमें भी काफ़ी आगे है."
ग्रेग कामराड्ट, ARC Prize Foundation

Astra हमारा सबसे बेहतर अलाइन्ड मॉडल है. यूज़र क्या चाहता है, इसे समझने और उसी हिसाब से काम करने में इसमें काफ़ी सुधार हुआ है—इसलिए आप Astra को ज़्यादा भरोसे के साथ टास्क्स दे सकते हैं. इसे टेस्ट करने के लिए हमने Hugging Face इंसिडेंट से सीख लेकर एक नया इवैल्यूएशन बनाया. यह देखता है कि मुश्किल या नामुमकिन टास्क मिलने पर मॉडल अपने तय स्कोप से बाहर जाता है या नहीं. प्रोडक्शन सेफ़गार्ड्स के बिना GPT‑5.6 Sol, 48% मामलों में तय टारगेट से बाहर गया. GPT‑6 Astra के लिए यह 0% मामलों में हुआ.

दुनिया का सबसे बेहतरीन कंप्यूटर यूज़ मॉडल

GPT‑6 Astra कंप्यूटर यूज़ की स्पीड, एक्युरेसी और सेफ़्टी में एक नया दौर शुरू करता है. यह ऑनलाइन फ़ॉर्म भरने, CRM में कस्टमर रिकॉर्ड्स अपडेट करने और आपका कैलेंडर ऑर्गेनाइज़ करने जैसे उबाऊ कामों को संभाल सकता है. यह ऑनलाइन रिसर्च कर सकता है और आपके ईमेल या डॉक्युमेंट एडिटर में समरी के ड्राफ़्ट तैयार कर सकता है. यह साइंटिफ़िक डेटा को एनालाइज़ कर सकता है, प्लॉट्स जेनरेट कर सकता है, वेबसाइट बना सकता है, और यह पक्का करने के लिए फ़्रंटएंड QA चेक्स चला सकता है कि उस साइट पर मौजूद सभी फ़ीचर्स सही ढंग से काम करें. यह अपने आप सॉफ़्टवेयर इंस्टॉल और टेस्ट करने, और स्क्रीन पर दिखने वाली दिक्कतों को दूर करने में आपकी मदद कर सकता है. ये सुधार हमारे सबसे बेहतरीन टेस्टिंग नतीजों में भी साफ़ नज़र आते हैं.

इन सुधारों से रियल नॉलेज-वर्क टास्क्स कम समय और रिसोर्स में पूरे किए जा सकते हैं. OSWorld 2.0 की लेटेंसी सिम्युलेशन्स में, Astra ने GPT‑5.6 Sol के मुकाबले हर टास्क में लगभग 47% कम समय में बेहतर कंप्यूटर यूज़ परफ़ॉर्मेंस दी. Astra ने लगभग 40 मिनट प्रति टास्क में 72.6% स्कोर किया, जबकि Sol ने लगभग 75 मिनट में 65.7% स्कोर किया.33

GPT‑6 Astra की कंप्यूटर-यूज़ क्षमताएँ गेम डेवलपमेंट, इलेक्ट्रिकल इंजीनियरिंग और रोज़मर्रा के नॉलेज वर्क सहित अलग-अलग क्षेत्रों के आउटपुट में देखी जा सकती हैं:

Astra के साथ, हम कंप्यूटर यूज़ की स्पीड को काफ़ी बेहतर बनाने के लिए Codex हार्नेस को भी अपडेट कर रहे हैं. Astra की एफ़िशिएंसी के साथ मिलकर, यह Mind2Web बेंचमार्क पर मौजूदा GPT‑5.6 Sol के मुकाबले 1.9 गुना तेज़ी से काम पूरा करता है. मॉडल की स्पीड में सुधार का मतलब है कि यह आपके रोज़मर्रा के कई समय लेने वाले काम आपसे भी तेज़ी से निपटा सकता है.4

"हम लॉन्च के दिन GPT‑6 Astra को Devin के हार्नेस में इंटीग्रेट कर रहे हैं, जहाँ यह हमारे इंटरनल टेस्टिंग बेंचमार्क पर स्टेट-ऑफ़-द-आर्ट परफ़ॉर्मेंस देता है. इसकी बेहतरीन कंप्यूटर यूज़, राइटिंग और कोडबेस को समझने की क्षमता से टेस्टिंग शुरू से ही बेहतर हो गई: वीडियो को समझना साफ़ तौर पर आसान है और रिपोर्ट्स ज़्यादा साफ़ हैं और कम शब्दों में बात कहती हैं"
साइलास अल्बर्टी, SVP रिसर्च, Cognition

प्रोफ़ेशनल काम में एक बड़ा बदलाव

GPT‑6 Astra कंप्यूटर यूज़ में बेहतर क्षमताओं को प्रोफ़ेशनल एनवायरनमेंट्स के लिए टारगेटेड ट्रेनिंग के साथ जोड़ता है, ताकि कॉम्प्लेक्स वर्क टास्क्स को बेहतर ढंग से संभाला जा सके. यह कॉम्प्लेक्स प्रॉब्लम्स को हल करने के लिए ज़रूरी इंटेलिजेंस को मल्टीस्टेप वर्कफ़्लो पूरा करने और अच्छी तरह तैयार डॉक्यूमेंट्स, स्प्रेडशीट्स और प्रेज़ेंटेशन्स बनाने की क्षमता के साथ जोड़ता है.

मौजूदा टेम्पलेट्स का पालन करने और ऐसे साफ़-सुथरे लेआउट वाले प्रेज़ेंटेशन बनाने के लिए GPT‑6 Astra हमारा सबसे बेहतरीन मॉडल है, जो पूरी बात को सही तरीके से आसानी से समझाता है. यह आपके टेम्पलेट्स के हिसाब से साफ़ और वेल-स्ट्रक्चर्ड डॉक्युमेंट्स, प्रेज़ेंटेशन्स, स्प्रेडशीट्स और एनालिसिस तैयार करता है, जो आपकी राइटिंग और विज़ुअल स्टाइल से मेल खाते हैं. Astra को खास तौर पर आउटपुट में सिर्फ़ काम का कॉन्टेक्स्ट लाने के लिए ट्रेन किया गया है, ताकि यह गैर-ज़रूरी जानकारी बार-बार न दोहराए. इन सब का मतलब यह है कि यह सीधे इस्तेमाल करने लायक ऐसी चीज़ें तैयार कर सकता है जो आपके बिज़नेस के स्टैंडर्ड पर खरी उतरती है.

GPT‑6 Astra वेबसाइट्स, गेम्स, ऐप्लिकेशन्स और रेंडरिंग्स बनाते समय बेहतर विज़ुअल फ़ैसले लेने की क्षमता भी देता है. ChatGPT में साइट्स⁠(एक नई विंडो में खुलेगा) के साथ, Astra सीधे एक प्रॉम्प्ट से वेबसाइट्स, वेब ऐप्स और गेम्स बना, होस्ट और शेयर कर सकता है.

"Astra हमें क्षमता और एफ़िशिएंसी दोनों में बड़ी बढ़त देता है. यह हमारे सबसे जटिल क्रिएटिव वर्कफ़्लो को आसानी से पूरा करता है, वो भी हमारे टेस्ट किए गए दूसरे मॉडल्स के मुकाबले 20% तक कम टोकन्स इस्तेमाल करके. सबसे ज़रूरी बात यह है कि हमारे कस्टमर्स के लिए इसका मतलब है और भी बेहतर क्वालिटी का आउटपुट."
एलेक्स मशराबोव, CEO और को-फ़ाउंडर, Higgsfield AI

जहाँ इंस्ट्रक्शन्स को अलग-अलग तरह से समझने की गुंजाइश होती है, वहाँ GPT‑6 Astra पिछले मॉडल्स के मुकाबले सही फ़ैसला लेने में बेहतर है. यह आम तौर पर छूटी हुई जानकारी को कॉन्टेक्स्ट की मदद से पूरा करता है और जब जवाब से नतीजा बदल सकता हो, तब सीधे और काम के सवाल पूछता है. Codex में यह आपसे सवाल पूछने के बाद भी, आपके जवाब पर निर्भर न रहने वाला काम साथ-साथ जारी रख सकता है. अगर आप जवाब नहीं देते हैं, तो जहाँ सही हो वहाँ यह समझदारी भरे अनुमानों के साथ आगे बढ़ता है. लेकिन अहम फ़ैसलों के लिए यह आपके जवाब का इंतज़ार करता है.

नीचे दिए गए उदाहरण दिखाते हैं कि Astra रोज़मर्रा के उन टास्क्स में कैसे साथ मिलकर काम करता है, जहाँ छूटी हुई जानकारी से जवाब काफ़ी बदल सकता है.

टास्क में बदलाव होते रहने पर भी Astra उसका पूरा कॉन्टेक्स्ट बनाए रखने में बेहतर है. पहले के मॉडल्स कभी-कभी दिशा बदलने वाले मैसेज को नया लक्ष्य मान लेते थे और ओरिजिनल रिक्वेस्ट या पहले बताई गई शर्तों से भटक जाते थे. Astra नई रिक्वायरमेंट्स को शामिल करता है, कहने पर अपना तरीका बदलता है और पूरे टास्क से ध्यान हटाए बिना बीच में पूछे गए सवालों के जवाब भी देता है.

"मुश्किल लीगल टास्क्स में Astra, GPT‑5.6 Sol के मुकाबले क्वालिटी में एक बड़ा सुधार है. हमारी शुरुआती टेस्टिंग में, Astra इस वजह से अलग नज़र आया कि वह लीगल काम को उसी तरह अपनाता है जैसे एक समझदार वकील करता है: यह डॉक्युमेंट्स को पक्के रिकॉर्ड्स से अलग करता है, बिना आधार वाली बातों को सामने लाता है, और कमियों को ड्राफ़्ट में मज़बूती से इस्तेमाल करता है."
Niko Grupen, एप्लाइड रिसर्च के प्रमुख, Harvey

कोडिंग

GPT‑6 Astra अब तक सॉफ़्टवेयर इंजीनियरिंग के लिए सबसे बेहतरीन मॉडल है.

2 में से 1
"GPT‑6 Astra हमारे इंटरनल कोडिंग बेंचमार्क्स पर स्टेट-ऑफ़-द-आर्ट परफ़ॉर्मेंस देता है और GPT‑5.6 Sol के मुकाबले ट्रेडिंग इंट्यूशन इवैल्यूएशन्स में साफ़ तौर पर बेहतर नतीजे देता है. एजेंटिक कोडिंग के लिए इस्तेमाल किए जाने पर, GPT‑6 Astra ऐसे तरीके से कम्युनिकेट करता है जिसे डेवलपर्स के लिए समझना आसान है और ऐसा कोड बनाता है जिसे प्रोडक्शन क्वालिटी तक पहुँचने के लिए कम इटरेशन की ज़रूरत होती है.”
जॉन क्रेपेज़ी, AI असिस्टेंट्स, Jane Street

Astra के साथ, हम Codex में कॉन्टेक्स्ट विंडो भरने पर कॉन्टेक्स्ट को सुरक्षित रखने और वापस पाने का एक नया तरीका ला रहे हैं. पहले, मुश्किल बग्स को ठीक करने में या बड़े बदलाव करते समय लंबे सेशन्स के दौरान मॉडल्स काम को समराइज़ करने के लिए कम्पैक्शन का इस्तेमाल करते थे. हर कम्पैक्शन से यह जानकारी छूट सकती है कि कोई फ़िक्स क्यों काम नहीं आया या कोई कॉम्पोनेंट कैसा व्यवहार करता है. Codex में, Astra कॉन्टेक्स्ट विंडोज़ में नोट्स रख सकता है, जिससे बार-बार एक ही समरी में दबाए बिना पूरी जानकारी सुरक्षित रहती है. पुरानी कॉन्टेक्स्ट विंडोज़ सर्च करने लायक बनी रहती हैं, इसलिए Astra पिछले मैसेज और टूल आउटपुट्स से ज़रूरतें या टेस्ट रिज़ल्ट्स ढूँढ सकता है—भले ही वह जानकारी उसके नोट्स में दर्ज न हो. आप इस एक्सपेरिमेंटल फ़ीचर को अपने Codex config.toml⁠(एक नई विंडो में खुलेगा) में चालू कर सकते हैं, और आने वाले हफ़्तों में यह Astra के लिए डिफ़ॉल्ट बन जाएगा.

साइंटिफ़िक खोज को आगे बढ़ाना

"कहानी यह है: एक दौर का अंत, दूसरे की शुरुआत।"
ग्रेग बर्नहैम, EpochAI

GPT‑6 Astra साइंटिफ़िक खोज, मैथ्स और हेल्थ को आगे बढ़ाने की दिशा में एक बड़ा कदम है. आज, हम अभाज्य संख्याओं के बीच के अंतरालों पर दो और परिणाम साझा कर रहे हैं।9 और 10

Astra ने मैथ्स और साइंस के कई इवैल्यूएशन्स में नए रिकॉर्ड भी बनाए हैं.

Astra साइंटिफ़िक खोज के पीछे के प्रैक्टिकल काम में मदद कर सकता है. साइंटिफ़िक रीज़निंग और कंप्यूटर यूज़ को जोड़कर, यह डेटा जाँचने और नतीजों को समझने के लिए सीधे स्पेशल सॉफ़्टवेयर में काम कर सकता है, जिससे रिसर्चर्स को एविडेंस को परखने और आगे की जाँच तय करने में मदद मिलती है.

साइबरसिक्योरिटी

जैसा कि हमने अपने सेफ़्टी अपडेट⁠ में बताया था, Astra साइबर क्षमताओं की दिशा में एक बड़ा कदम है और साइबर सिक्योरिटी में क्रिटिकल थ्रेशोल्ड को हमारे प्रिपेयर्डनेस फ़्रेमवर्क के तहत पूरा करता है. ज़ीरो-डे एक्सप्लॉइट्स की पहचान करने और उन्हें विकसित करने की इसकी क्षमता डिफ़ेंडर्स को कमियाँ खोजने और उन्हें दूर करने में मदद कर सकती है, लेकिन यह मज़बूत सेफ़गार्ड्स की ज़रूरत भी पैदा करती है. यह समझने के लिए कि ये क्षमताएँ कहाँ तक जाती हैं, हमने Astra को इंटरनल और थर्ड-पार्टी एक्सपर्ट इवैल्यूएशन्स पर टेस्ट किया.

हमने सबसे पहले मॉडल को प्रोडक्शन सेफ़गार्ड्स के बिना ExploitBench और ExploitGym पर टेस्ट किया. ये इवैल्यूएशन्स देखते हैं कि मॉडल्स पहले से मालूम सॉफ़्टवेयर कमज़ोरियों को काम करने वाले एक्सप्लॉइट्स में बदल सकते हैं या नहीं. ExploitBench पर Astra ने 100% का परफ़ेक्ट स्कोर हासिल किया, जबकि हमारे पिछले फ़्रंटियर साइबर मॉडल GPT‑5.6 Sol का स्कोर 78.5% था. ExploitGym पर Astra ने 42.4% की सक्सेस रेट हासिल की, जबकि GPT‑5.6 Sol का स्कोर 30.3% था—वो भी काफ़ी कम आउटपुट टोकन का इस्तेमाल करते हुए.13

इस चिंता को देखते हुए कि सॉफ़्टवेयर की पुरानी कमज़ोरियों की जानकारी से बेंचमार्क नतीजों पर असर पड़ा हो सकता है, हमने Astra को दो नए बेंचमार्क्स पर भी इवैल्यूएट किया. इनमें से एक के लिए, हमने पिछले तीन महीनों की कमज़ोरियों का इस्तेमाल करके एक्सप्लॉइट डेवलपमेंट को इवैल्यूएट करने के लिए एक इंटरनल "ExploitBench (जून–अगस्त 2026)" टेस्ट तैयार किया.14 इस डेटासेट पर Astra ने GPT‑5.6 Sol के मुकाबले आर्बिट्रेरी कोड-एग्ज़ीक्यूशन की काफ़ी ज़्यादा दर हासिल की, जबकि इसने बहुत कम आउटपुट टोकन्स इस्तेमाल किए. इवैल्यूएशन के दौरान, Astra ने दो ऐसी नई ज़ीरो-डे कमजोरियाँ ढूँढीं और इस्तेमाल कीं जो पहले किसी को मालूम नहीं थीं. हम ये दोनों कमज़ोरियाँ उनके मेंटेनर्स के साथ शेयर कर रहे हैं.

हमने Astra को SRE-Bench15 पर भी टेस्ट किया. यह बेंचमार्क देखता है कि मॉडल्स रॉ सोर्स कोड के एक्सेस के बिना सॉफ़्टवेयर बाइनरीज़ को रिवर्स इंजीनियर करके उनके काम करने का मुख्य तरीका समझ सकते हैं या नहीं. Astra ने एक ही कोशिश में 88.0% टास्क हल किए और चार कोशिशों में 99.2% टास्क हल किए, जबकि GPT‑5.6 Sol ने इनमें 55.9% और 68.7% टास्क हल किए.

बेंचमार्क्स से आगे बढ़कर, एक्सपर्ट्स के असेसमेंट में पाया गया कि Astra, प्रोडक्शन सेफगार्ड्स के बिना चलाए जाने पर, पहले से अनजानी सुरक्षा खामियों का इस्तेमाल करके मज़बूत ब्राउज़र्स में आर्बिट्ररी कोड एग्ज़ीक्यूशन हासिल कर सकता है और मज़बूत ऑपरेटिंग सिस्टम्स के लिए प्रिविलेज-एस्केलेशन एक्सप्लॉइट्स तैयार कर सकता है.

जैसा कि हमने द डिफ़ेंडर्स विंडो में बताया था कि फ़्रंटियर साइबर क्षमताएँ डिफ़ेंडर्स को कमियाँ तेज़ी से ढूँढने में मदद कर सकती हैं, लेकिन वे इन कमियों का फ़ायदा उठाना भी आसान बना देती हैं, जिससे डिफ़ेंडर्स के लिए तेज़ी से तालमेल बनाना बेहद ज़रूरी हो जाता है. आज लॉन्च हो रहे Astra के वर्ज़न के साथ, डिफ़ेंडर्स इसका इस्तेमाल सिक्योर कोड रिव्यू और पैचिंग जैसे टास्क्स पूरे करने के लिए कर सकते हैं.

हालाँकि, Astra कमज़ोरियों के लिए प्रूफ़-ऑफ़-कॉन्सेप्ट एक्सप्लॉइट्स बनाने जैसे ज़्यादा एडवांस्ड साइबर सिक्योरिटी टास्क्स करने से साफ़ मना कर देगा. OpenAI Daybreak⁠ के ज़रिए, हम आने वाले हफ्तों में एक्सेस बढ़ाने और कम पाबंदियों वाले सुरक्षा उपाय लागू करने की योजना बना रहे हैं. इससे और ज़्यादा डिफ़ेंसिव वर्कफ़्लो इस्तेमाल किए जा सकेंगे, जिनमें कमज़ोरियाँ और प्रूफ़-ऑफ़-कॉन्सेप्ट वैलिडेशन, मालवेयर एनालिसिस और डिटेक्शन इंजीनियरिंग शामिल हैं.

हमने GPT‑5.6 Sol के सेफ़गार्ड्स स्टैक को और मज़बूत करते हुए साइबर के संभावित गलत इस्तेमाल के खिलाफ़ अपनी सुरक्षा और मज़बूत की है. इनमें संभावित जेलब्रेक्स से बेहतर तरीके से निपटने के लिए मॉडल की ज़्यादा मज़बूती और हमारे मॉनिटरिंग सिस्टम्स के लिए बेहतर कॉन्टेक्स्ट शामिल हैं. हमने कड़े इंटरनल और एक्सटर्नल टेस्ट जारी रखे हैं. इनमें हमारी इंटरनल रेड-टीमिंग अटैकरटीम के साथ ऑटोमेटेड इवैल्यूएशन्स भी शामिल हैं. हमारे साइबर सेफ़गार्ड्स और टेस्टिंग के बारे में Astra सेफ़्टी ओवरव्यू⁠ और सिस्टम कार्ड⁠(एक नई विंडो में खुलेगा) में और जानकारी मिल सकती है.

GPT‑6 Astra को ज़िम्मेदारी से अलाइन और डिप्लॉय करना

Astra हमारा सबसे बेहतर अलाइन्ड मॉडल है. Astra सावधानी से काम करने, टास्क की तय सीमाओं के अंदर रहने और यूज़र से साफ़ तौर पर कम्युनिकेट करने में बेहतर है. यह हमारे लंबे समय से चल रहे रिसर्च प्रोग्राम का नया काम है, जिसका फ़ोकस ऐसे मॉडल्स को ट्रेन करना है जो शुरू से आखिर तक यूज़र के मकसद के मुताबिक काम करें.

ज़्यादा रिस्क वाले एनवायरनमेंट्स में Astra रिस्क के हिसाब से ज़्यादा सावधानी से काम करता है. एक इवैल्यूएशन में ऐसे कंप्यूटर यूज़ टास्क्स चुने गए थे जो मॉडल से गलत व्यवहार करवाने के लिए बनाए गए थे. इनमें Astra अनचाहे नतीजों से बचने में ज़्यादा सफल रहा. डिफ़ॉल्ट तौर पर मिलने वाले अतिरिक्त सिक्योरिटी उपायों के साथ Astra ने और बेहतर परफ़ॉर्म किया.

टेस्ट किए गए दूसरे सभी फ़्रंटियर मॉडल्स के मुकाबले Astra में तय मकसद से अलग नतीजे कम देखने को मिले. सही तुलना के लिए हमने एक जेनेरिक कंप्यूटर-यूज़िंग एजेंट हार्नेस इस्तेमाल किया. यह OpenAI Responses API⁠(एक नई विंडो में खुलेगा) और Anthropic Messages API⁠(एक नई विंडो में खुलेगा), दोनों में मौजूद नेटिव कंप्यूटर यूज़ टूल्स पर आधारित है. इसमें वे अतिरिक्त सेफ़्टी फ़ीचर्स शामिल नहीं थे जो आम तौर पर Codex और ChatGPT वर्क के यूज़र्स के लिए इस्तेमाल किए जाते हैं, जैसे ऑटो-रिव्यू और कन्फ़र्मेशन पॉलिसी.

Astra के यूज़र की ओर से तय और उसके एनवायरनमेंट से मिलने वाले दायरे के अंदर काम करने की संभावना भी ज़्यादा है. एक इंटरनल इवैल्यूएशन में, Astra ने Codex Auto-Review से मना किए जाने पर उसे बायपास करने की कभी कोशिश नहीं की. ऐसा तब भी रहा जब Auto-Review को जानबूझकर इस तरह कॉन्फ़िगर किया गया था कि उसे बायपास किया जा सके और उसके बिना टास्क पूरा करना नामुमकिन था. एनवायरनमेंट की पाबंदियों के अंदर काम करने का यह व्यवहार हमारे इम्पॉसिबल साइबर टास्क इवैल्यूएशन के रिज़ल्ट्स से मेल खाता है, जिन्हें हमने इस पोस्ट की शुरुआत में शेयर किया था. यह हमारे सिस्टम कार्ड⁠(एक नई विंडो में खुलेगा) में दर्ज दूसरे नतीजों से भी मेल खाता है.

Astra यूज़र्स के साथ साफ़ कम्युनिकेशन में भी नए स्टैंडर्ड सेट करता है. एक इवैल्यूएशन के मुताबिक, GPT‑5.6 Sol के मुकाबले Astra के अपनी क्षमताओं और फ़ीचर्स के बारे में गलत जानकारी देने की संभावना तीन गुना कम है.

हमारे कैपेबिलिटी-हलुसिनेशन इवैल्यूएशन में, Astra GPT‑5.6 Sol के मुकाबले काफ़ी बेहतर सुधार दिखाता है और अपनी क्षमताओं को लेकर गलत या बढ़ा-चढ़ाकर किए गए दावे कम करता है.

हमारे इवैल्यूएशन्स में Astra की लिखी हुई रीज़निंग को GPT‑5.6 Sol के मुकाबले मॉनिटर करना ज़्यादा मुश्किल पाया गया. ये टेस्ट खास तौर पर मॉडल को मॉनिटरिंग से बचने के लिए कहते थे. इसकी एक वजह यह हो सकती है कि आसान टास्क्स में Astra अपनी लिखी हुई रीज़निंग पर ज़्यादा कंट्रोल रखता है और कम लिखे हुए स्टेप्स में प्रॉब्लम्स हल कर सकता है. मुश्किल टास्क्स के लिए ज़रूरी रीज़निंग को छिपाना Astra के लिए अब भी मुश्किल दिखता है, लेकिन मॉनिटरिंग में आई इस कमी को हम गंभीरता से देख रहे हैं. रीज़निंग को आसानी से मॉनिटर कर पाना हमारी रिसर्च में अहम बना हुआ है. साथ दिए गए सिस्टम कार्ड⁠(एक नई विंडो में खुलेगा) में हमारे नतीजों और इस पर चल रहे काम की जानकारी है.

अलाइनमेंट ट्रेनिंग हमारे डिप्लॉयमेंट के तरीके का अहम हिस्सा है. सेफ़्टी की एक और लेयर के तौर पर, हम Codex Auto-review⁠(एक नई विंडो में खुलेगा) जैसे सिस्टम सेफ़गार्ड्स भी बनाते हैं. साथ ही एजेंट्स की रीज़निंग और ऐक्शन्स को मॉनिटर करते हैं, ताकि असुरक्षित व्यवहार का पता लगाकर उसे रोका जा सके. हमारे सेफ़्टी अपडेट⁠ में बताए गए तरीके के मुताबिक, हम Astra-क्लास मॉडल के लिए प्रोडक्शन में मिसअलाइनमेंट मॉनिटरिंग भी लगा रहे हैं, ताकि मिसअलाइनमेंट की जानकारी मिल सके और इसके सबसे गंभीर मामलों को रोकने में मदद मिल सके. ये सेफ़गार्ड्स हमारे इंटरनल डिप्लॉयमेंट्स में इस्तेमाल होने वाली मॉनिटरिंग जैसे हैं. इनमें क्लासिफ़ायर्स का एक सिस्टम होता है, जो मॉडल की रीज़निंग और ऐक्शन्स को बिना मंज़ूरी वाले व्यवहार के लिए चेक करता है और ऐसी संभावित बिना मंज़ूरी वाली एक्टिविटी को अपने आप रोक देता है.

Astra की साइबर सिक्योरिटी क्षमताएँ काफ़ी बढ़ी हैं, इसलिए हम इस डिप्लॉयमेंट को सेफ़ और सिक्योर रखने पर खास ध्यान दे रहे हैं. अतिरिक्त सेफ़्टी चेक्स कभी-कभी सही काम को भी धीमा कर सकते हैं, कुछ समय के लिए रोक सकते हैं या पूरी तरह रोक सकते हैं. इसमें डिफ़ेंसिव साइबर सिक्योरिटी का काम भी शामिल है. अगर ChatGPT या Codex में कोई काम रुकता है, तो आगे बढ़ने से पहले आपसे उस ऐक्शन को रिव्यू करने के लिए कहा जा सकता है. API में, वह टास्क रुक जाएगा. ये चेक्स कभी-कभी सही काम में भी रुकावट डाल सकते हैं, और गैर-ज़रूरी रुकावटों को कम करने के लिए हम इस सिस्टम को लगातार बेहतर बना रहे हैं. मिसअलाइनमेंट मॉनिटरिंग, अलाइनमेंट की जगह नहीं ले सकती. हमारा मकसद ऐसे मॉडल्स बनाना है जो भरोसे के साथ अपने तय स्कोप में रहें, ताकि इन सेफ़्टी सिस्टम्स को बीच में रोकने की ज़रूरत ही न पड़े.

उपलब्‍धता

GPT‑6 Astra आज से कुछ चुनिंदा ऑर्गेनाइज़ेशन्स के लिए रोल आउट हो रहा है. आने वाले दिनों में यह सभी ChatGPT Plus, Pro, Business और Enterprise यूज़र्स के साथ-साथ OpenAI API, Microsoft Azure और AWS Bedrock के ज़रिए भी मिलेगा. Astra का इस्तेमाल मौजूदा सब्सक्रिप्शन अलाउंस में शामिल है. ज़्यादा इस्तेमाल के लिए यूज़र्स और बिज़नेस अलग से भी क्रेडिट्स खरीद सकते हैं. Pro, Business और Enterprise प्लान वाले यूज़र्स को GPT‑6 Astra Pro का एक्सेस भी मिलेगा. Enterprise एडमिनिस्ट्रेटर्स अपने वर्कस्पेस के लिए Astra को चालू कर सकते हैं; लॉन्च के समय इसका एक्सेस डिफ़ॉल्ट तौर पर बंद रहेगा.

योग्य API कस्टमर्स के लिए Astra, ज़ीरो डेटा रिटेंशन की सुविधा देता है. जैसा कि हमने पिछले महीने बताया था, हम प्राइवेट सेफ़्टी प्रोसेसिंग की टेस्टिंग भी कर रहे हैं, ताकि कस्टमर की प्राइवेसी बनाए रखते हुए सेफ़्टी मॉनिटरिंग को बेहतर किया जा सके.

डेवलपर्स को GPT‑6 Astra, OpenAI API में gpt-6-astra के तौर पर और Microsoft Azure और Amazon Bedrock के ज़रिए मिलेगा.

OpenAI API की स्टैंडर्ड प्राइसिंग हर दस लाख इनपुट टोकन्स के लिए $10 और हर दस लाख आउटपुट टोकन्स के लिए $50 है. कैश रीड्स और राइट्स के लिए अलग रेट्स लागू होते हैं. API में GPT‑6 Astra के लिए तेज़ मोड उपलब्ध है. यह स्टैंडर्ड प्रोसेसिंग के मुकाबले 2 गुना तक तेज़ स्पीड देता है और इसकी कीमत स्टैंडर्ड कीमत से 2 गुना है.

कंप्यूटर उपयोग

कंप्यूटर उपयोग

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

एजेंटों की अंतिम परीक्षा

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, ऑफ़लाइन सेट, अधूरा स्कोर)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (कोई टूल नहीं)

92.7%

76.90%

-

87.3%17

-

-

पेशेवर

पेशेवर

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.40%

18.10%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore स्ट्रिंग क्वार्टेट्स (एक - OMR-NED)

0.84

0.19

-

-

-

-

इंटरनल डिज़ाइन टास्क्स

50.0%

47.4%

-

35.8%

-

-

इंटरनल डेटा साइंस टास्क्स

40.9%

30.5%

-

34.7%

-

-

आर्टिफ़िशियल एनालिसिस इंटेलिजेंस इंडेक्स v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

कोडिंग

कोडिंगGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 एक्सटेंडेड (स्कोर)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 मुख्य (स्कोर)53.3% 847.5%50.9%53.5%53.4%43.6%
इंटरनल डेटाबेस माइग्रेशन टास्क63.9%42.7%57.8%50.3%--
आर्टिफ़िशियल एनालिसिस कोडिंग एजेंट इंडेक्स v1.467.065.1-67.268.161.2

शैक्षणिक

शैक्षणिक

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath टियर 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA डायमंड

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (टूल्स के साथ)

57.2%

-

65.0%

63.8%

63.6%

-

विज्ञान और हेल्थ

साइंस और हेल्थGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (इंटरनल)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench प्रोफ़ेशनल (लेंग्थ-एडजस्टेड)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

साइबरसिक्योरिटी

साइबर सिक्योरिटीGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (जून-अगस्त 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

अलाइनमेंट

अलाइनमेंट

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

इंटरनल कंप्यूटर यूज़ सेफ़्टी बेंचमार्क (कम होना बेहतर है)

2.4%

22.0%

9.5%

18.3%

11.5%

-

इंटरनल कंप्यूटर यूज़ सेफ़्टी बेंचमार्क, AutoReview के साथ (कम होना बेहतर है)

1.8%

4.3%

-

-

-

-

इंटरनल बायपास बेंचमार्क (कम होना बेहतर है)

0.00%

0.29%

-

-

-

-

ExploitGym हनीपॉट (कम होना बेहतर है)

0.0%

48.2%

-

-

-

-

असंभव ExploitGym

100.0%

-

-

-

-

-

इंटरनल हैलुसिनेशन बेंचमार्क (कम होना बेहतर है)

4.2%

12.2%

-

-

-

-

लंबा कॉन्टेक्स्ट

लंबा कॉन्टेक्स्ट

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

एब्सट्रैक्ट रीज़निंग

एब्स्ट्रैक्ट रीज़निंगGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

इवैल्यूएशन स्कोर्स किसी भी एफ़र्ट लेवल पर मिले सबसे ज़्यादा स्कोर हैं. GPT इवैल्यूएशन्स हमारे रिसर्च एनवायरनमेंट में या हमारी API के ज़रिए चलाए गए. सिस्टम प्रॉम्प्ट्स, उपलब्ध टूल्स वगैरह में अंतर होने की वजह से इनके आउटपुट प्रोडक्शन ChatGPT से थोड़े अलग हो सकते हैं.

फ़ुटनोट्स

  1. 1

    ARC-AGI-3 पर, GPT-6 Astra को हमारे रेस्पॉन्सेज़ API हार्नेस⁠ के साथ चलाया गया, जो रियल-वर्ल्ड परफ़ॉर्मेंस से बेहतर मेल खाने के लिए दो सेटिंग्स बदलता है. ये बदलाव खास तौर पर ARC-AGI-3 को टारगेट नहीं करते हैं.

  2. 2

    GPT-5.6 Sol से मतलब उस वर्ज़न से है जो हमारे API, ChatGPT Codex और ChatGPT वर्क में उपलब्ध है. ChatGPT चैट में दिया गया वर्ज़न थोड़ा अलग है.⁠

  3. 3

    OSWorld V2-Offline, ओरिजिनल OSWorld V2 का एक सबसेट है, जो इंटरनेट एक्सेस के बिना काम करता है. OSWorld-V2 Offline पर Claude मॉडल की परफ़ॉर्मेंस को ऑथर्स ने ऑफ़िशियल लीडरबोर्ड⁠(एक नई विंडो में खुलेगा) पर दोबारा हासिल किया. OSWorld 2.0 पर Claude के स्कोर्स में ऑफ़िशियल सेटिंग्स इस्तेमाल की गई हैं, न कि Fable 5.1 सिस्टम कार्ड के बदले हुए टास्क्स और ग्रेडिंग.

  4. 4

    मॉडल समय से मतलब संबंधित डेमो रन के लिए रिपोर्ट किए गए कुल समय से है. दिखाए गए क्लिप्स एडिट किए गए छोटे हिस्से हैं.

  5. 5

    BenchCAD पर Claude के स्कोर्स में इवैल्यूएशन में किए गए 3 बदलाव शामिल हैं. इनकी जानकारी Fable 5.1 सिस्टम कार्ड⁠(एक नई विंडो में खुलेगा) में दी गई है.

  6. 6

    गुआँग याँग, विक्टोरिया एबर्ट, नाज़िफ़ टैमर, ब्रायन सियुआन झेंग, लुइज़ा पॉज़ोबोन और नोआ ए. स्मिथ. “LEGATO: टाइपसेट OMR के लिए बड़े पैमाने का एंड-टू-एंड जनरलाइज़ करने लायक तरीका⁠(एक नई विंडो में खुलेगा).” arXiv:2506.19065, 2025.

  7. 7

    मार्क आर. एच. गोथम, मॉरीन रेडबॉन्ड, ब्रूनो बावर और पीटर जोनस. "OpenScore स्ट्रिंग क्वार्टेट कॉर्पस⁠(एक नई विंडो में खुलेगा)." म्यूज़िकोलॉजी के लिए डिजिटल लाइब्रेरीज़ पर 10वीं इंटरनेशनल कॉन्फ़्रेंस की प्रोसीडिंग्स, पेज. 49–57. ACM, 2023.

  8. 8

    FrontierCode पर, GPT-6 Astra को एक डेवलपर मैसेज के साथ चलाया गया, जो उसके Codex में डेवलपर मैसेज के एक सेक्शन⁠(एक नई विंडो में खुलेगा) जैसा था: "बहुत ज़्यादा टेस्ट फ़ाइलें बनाने से बचें. नई टेस्ट फ़ाइल तभी बनाएँ, जब रिपॉज़िटरी के नियमों के हिसाब से ज़रूरी हो या कोई मौजूदा फ़ाइल लायक जगह न हो. ऐसे क्लीनअप से बचें जिसका इस काम से संबंध नहीं है और बेवजह चीज़ों को मुश्किल न बनाएँ. जहाँ सही हो, मौजूदा यूटिलिटीज़ का दोबारा इस्तेमाल करें. काम से जुड़े रिपॉज़िटरी इंस्ट्रक्शन्स पढ़ें और आसपास के कोड, टेस्ट्स, डॉक्यूमेंटेशन और CI को देखें. पहले से चले आ रहे तरीकों को फ़ॉलो करें. मकसद साफ़ और आसानी से मर्ज किया जा सकने वाला कोड बनाना है." प्रॉम्प्ट को इस इवैल्यूएशन के लिए खास तौर पर ऑप्टिमाइज़ नहीं किया गया था.

  9. 9

    पहला सवाल इस बारे में है कि नंबर लाइन पर कितनी भी दूर जाने पर प्राइम नंबर्स एक-दूसरे के कितने करीब मिल सकते हैं. एक दशक से ज़्यादा समय तक, सबसे अच्छा मालूम जवाब यह था कि प्राइम नंबर्स के ऐसे अनगिनत जोड़े हैं जिनके बीच का फ़ासला ज़्यादा-से-ज़्यादा 246 है. जूलिया स्टैडलमैन⁠(एक नई विंडो में खुलेगा) ने हाल ही में इस लिमिट को 240 तक बेहतर किया. Astra ने इस लिमिट को और बेहतर करके 186 तक लाने में मदद की. इससे पता चलता है कि प्राइम नंबर्स के अनगिनत जोड़े इस छोटे फ़ासले के अंदर मिलते हैं. छोटे प्राइम गैप्स: प्रूफ़⁠(एक नई विंडो में खुलेगा) और इससे जुड़ी रिसर्च⁠(एक नई विंडो में खुलेगा).

  10. 10

    दूसरा सवाल प्राइम नंबर्स के बीच मिलने वाले बहुत बड़े फ़ासले से जुड़ा है. Astra ने इस फ़ासले की एक लिमिट में इस्तेमाल होने वाले एक टर्म को बेहतर किया, जो 80 साल से ज़्यादा समय से नहीं बदला था. हम दोनों रिज़ल्ट्स के प्रूफ़, छोटी की गई चेन-ऑफ़-थॉट और वेरिफ़िकेशन से जुड़े मटीरियल शेयर कर रहे हैं. प्राइम के बीच बड़े फ़ासले: प्रूफ़⁠(एक नई विंडो में खुलेगा) और इससे जुड़ी रिसर्च⁠(एक नई विंडो में खुलेगा).

  11. 11

    हमने सभी Claude मॉडल्स को तय HealthBench प्रोफ़ेशनल प्रोसेस के मुताबिक अलग से इवैल्यूएट किया. इसमें GPT‑5.4 ग्रेडिंग और लेंग्थ-एडजस्टेड, अनक्लिप्ड स्कोर्स इस्तेमाल किए गए. Fable 5.1 के लिए, प्रोवाइडर के जवाब देने से मना करने पर हमने Opus 5 फ़ॉलबैक इस्तेमाल किया.

  12. 12

    Claude Fable 5 और 5.1 को LifeSciBench Gold v1, GeneBench Pro v13 और MedChemBench में शामिल नहीं किया गया है, क्योंकि इन इवैल्यूएशन्स में ये ज़्यादातर सवालों के जवाब देने से मना कर देते हैं.

  13. 13

    ExploitGym पर हमने Astra और Sol को 6 घंटे की टाइम लिमिट के बिना टेस्ट किया, ताकि उनकी पूरी साइबर क्षमताओं को बेहतर तरीके से टेस्ट किया जा सके. दोनों इतने तेज़ हैं कि टाइम लिमिट हटाने से रिज़ल्ट पर बहुत कम असर पड़ता है.

  14. 14

    ExploitBench (जून-अगस्त 2026) में Chrome के 13 स्टेबल रिलीज़ में मिली सुरक्षा की 20 ज़्यादा गंभीर कमज़ोरियाँ मौजूद हैं. यह बेंचमार्क टेस्ट करता है कि एजेंट्स बताई गई हर कमज़ोरी का फ़ायदा उठाकर V8 और Linux के लिए ऑफ़िशियल Chrome रिलीज़ में आर्बिट्रेरी कोड एग्ज़ीक्यूशन कर सकते हैं या नहीं. शामिल की गई कुछ कमज़ोरियों में इवैल्यूएशन की शर्तों के अंदर आर्बिट्रेरी कोड एग्ज़ीक्यूशन करना मुमकिन नहीं हो सकता. इसलिए 100% सक्सेस रेट हासिल करना मुमकिन न हो. नोट: GPT-5.6 Sol का 5.5% स्कोर बेंचमार्क की 300-टर्न लिमिट का असर है. मैक्स इस्तेमाल करने वाले असली कस्टमर्स पर यह लिमिट लागू नहीं होती. समान सेटिंग्स पर मॉडल ने कम सीमाओं का सामना करने पर 11.5% स्कोर हासिल किया.

  15. 15
  16. 16

    थर्ड-पार्टी मॉडल्स को टेस्ट करते समय हम एक आसान रिसर्च सेटअप इस्तेमाल करते हैं. Codex का प्रोडक्शन कॉन्फ़िगरेशन ज़्यादा कॉम्प्लेक्स है, इसलिए रॉ मॉडल की एरर रेट अलग हो सकती है. प्रोवाइडर की तरफ़ के सेफ़गार्ड्स और कंप्यूटर टूल्स के काम करने के तरीके भी अलग हैं. Codex यूज़र्स को बिना कन्फ़र्मेशन वाला यह सेटअप नहीं मिलता, क्योंकि यह सिर्फ़ इंटरनल रिसर्च के लिए इस्तेमाल होने वाला कॉन्फ़िगरेशन है.

  17. 17

    ScreenSpot-Pro और ExploitGym के लिए, हमारे रिपोर्ट किए गए Fable स्कोर्स Mythos से हैं, जो कम सेफ़गार्ड्स वाला Fable है.