सादर करत आहोत GPT‑6 Sol आणि Luna
तुमच्या दैनंदिन कामात अत्याधुनिक बुद्धिमत्ता आणण्याचे आणखी मार्ग.
या महिन्याच्या सुरुवातीला आम्ही जगातील सर्वात बुद्धिमान आणि अलाइन केलेले मॉडेल, GPT‑6 Astra, सादर केले. सर्वाधिक आव्हानात्मक आणि महत्त्वाच्या प्रकल्पांसाठी अजूनही Astra ची पूर्ण क्षमता आवश्यक असली, तरी कामाचे प्रमाण, गती आणि अंदाजपत्रक वेगवेगळे असतात.
म्हणूनच आम्ही GPT‑6 Sol आणि GPT‑6 Luna. यांचा समावेश करून GPT‑6 विश्वाचा विस्तार करत आहोत. GPT‑6 Astra ने बुद्धिमत्तेची नवी पिढी सादर केली. खर्चाच्या कार्यक्षमतेमध्ये अत्याधुनिक प्रगती करून ही मॉडेल त्या बुद्धिमत्तेचे लाभ अधिक व्यापकपणे उपलब्ध करून देतात. GPT‑6 Astra साठी वापरलेल्या पद्धतींसारख्याच पद्धतींनी आम्ही GPT‑6 Sol आणि Luna यांना प्रशिक्षित केले. त्यामुळे व्यावसायिक काम, तथ्यात्मक अचूकता, कोडिंग, कॉम्प्यूटरचा वापर आणि अलाइनमेंट यांमधील Astra च्या अत्याधुनिक कामगिरीमागील प्रगती अधिक वेगवान आणि परवडणाऱ्या मॉडेलमध्ये आली आहे.
GPT‑6 मॉडेल खर्च-बुद्धिमत्ता आलेखावर आघाडीवर आहेत. प्रत्येक स्तरावरील अपवादात्मक क्षमता आणि त्या मोठ्या प्रमाणावर कार्यक्षमतेने पुरवणारी पायाभूत सुविधा यांचा ती संगम घडवतात. कॅशिंग आणि अनुमान प्रक्रियेतील सुधारणांमुळे ही मॉडेल कमी खर्चात पुरवता येतात. GPT‑5.6 च्या प्रचारात्मक किमतींच्या तुलनेत Sol आणि Luna च्या API किमती 50% कमी करून ही बचत आम्ही थेट वापरकर्ते आणि ग्राहकांपर्यंत पोहोचवत आहोत. या सर्व सुधारणांमुळे प्रगत एआय अधिक दैनंदिन कामांसाठी आणि मोठ्या प्रमाणावरील अनुप्रयोगांसाठी व्यवहार्य बनते.
मॉडेल | इनपुट | आउटपुट | किमतीतील कपात |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% स्वस्त |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% स्वस्त |
किमती प्रति 10 लाख टोकन आहेत.
GPT‑6 Astra हे सर्व बाबतींत आमचे सर्वोत्तम मॉडेल आहे. सर्वोत्तम परिणाम आणि कोणतीही तडजोड नसलेला अनुभव हवा असेल, तेव्हा हे मॉडेल निवडा.
गुंतागुंतीची कामे पूर्ण करण्यासाठी सर्वाधिक उपयुक्त असलेल्या क्षमतांमध्ये GPT‑6 Sol आणि Luna, तुम्ही आधीपासून ओळखत आणि वापरत असलेल्या मॉडेलना अधिक बुद्धिमत्ता आणि खर्चाची कार्यक्षमता देतात.
GPT‑6 Sol अवघड कामे हाताळू शकते. अधिक वापरमर्यादा आणि कमी खर्चामुळे तुम्हाला पुनरावृत्तीने सुधारणा करण्यासाठी अधिक वाव मिळतो, तसेच समान किंमतीच्या स्पर्धक मॉडेलपेक्षा अधिक बुद्धिमत्ता आणि चांगले परिणाम मिळतात.
विविध ॲप्समधील व्यावसायिक कार्यप्रवाहांची चाचणी घेणाऱ्या AutomationBench मध्ये, अतिउच्च प्रयत्नांवर GPT‑6 Sol हे कमाल प्रयत्नांवरील Claude Opus 5 पेक्षा सरस ठरते आणि त्याचा प्रतिकार्य खर्च Opus 5 च्या केवळ 9% आहे. उच्च प्रयत्नांवर GPT‑6 Luna आपल्या पूर्वसुरीपेक्षा 5.4 टक्के गुणांनी सुधारते, तर प्रति टास्क खर्च 58% कमी असतो.
AutomationBench 1.0.6(नवीन विंडोमध्ये उघडेल) मध्ये विक्री, मार्केटिंग, संचालन, सहाय्य, वित्त आणि मनुष्यबळ या क्षेत्रांतील 47 टूल्स वापरणाऱ्या सुरुवातीपासून शेवटपर्यंतच्या कार्यप्रवाहांवर AI एजंटची चाचणी केली जाते. Claude Fable 5.1 साठीचा आकडा त्याचा प्रत्यक्ष खर्च कमी दाखवतो, कारण सुमारे 40% टास्क्समध्ये वापरलेल्या Opus 5 फॉलबॅकचा खर्च त्यात समाविष्ट नाही.
GPT‑6 Sol हे खूपच कमी खर्चात Claude Fable 5.1 पेक्षाही सरस ठरते आणि कमी प्रयत्नांवरील GPT‑6 Astra लाही मागे टाकते.
मॉडेल (आणि प्रयत्न) | गुण | प्रति टास्क खर्च |
|---|---|---|
GPT‑6 Sol (अतिउच्च) | 33.2% | $0.27 |
GPT‑6 Astra (कमी) | 30.3% | GPT‑6 Sol च्या 3.9 पट |
Claude Opus 5 (कमाल) | 26.9% | GPT‑6 Sol च्या 11.1 पट |
Opus 5 पर्यायासह Claude Fable 5.1 (Max) | 31.4% | GPT‑6 Sol च्या >8.9 पट (पर्यायाचा खर्च नोंदवलेला नाही) |
गुंतागुंतीच्या व्यावसायिक कार्यप्रवाहांवर एजंटचे मूल्यमापन करणाऱ्या Agents’ Last Exam मध्ये, कमाल प्रयत्नांवरील GPT‑6 Sol ला 56.4% गुण मिळतात. हे मूल्यमापनातील Claude Opus 5 च्या सर्वोच्च गुणांपेक्षा अधिक असून प्रति टास्क खर्च 60% कमी आहे.
Agents’ Last Exam V1(नवीन विंडोमध्ये उघडेल) मध्ये 55 उपउद्योगांतील दीर्घकालीन आणि आर्थिकदृष्ट्या मूल्यवान कामांवर AI एजंटचे मूल्यमापन केले जाते. यात कॉम्प्यूटरवर केल्या जाणाऱ्या व्यावसायिक कामाच्या बहुतेक प्रमुख क्षेत्रांचा समावेश आहे.
उत्तराची उपयुक्तता तथ्ये अचूक असण्यावर अवलंबून असते आणि आम्ही तथ्यात्मक विश्वासार्हतेत सातत्याने प्रगती करत आहोत. वापरकर्त्यांनी आमच्या मॉडेलच्या चुका नोंदवलेल्या, ओळख काढून टाकलेल्या प्रत्यक्ष संभाषणांवर आधारित आमच्या अंतर्गत तथ्यात्मक मूल्यमापनात GPT‑6 Sol आपल्या पूर्वसुरीच्या तुलनेत सुमारे निम्म्या चुका करते. खूपच कमी खर्चात तिची विश्वासार्हता Astra च्या जवळ पोहोचते. GPT‑6 Luna मध्येही लक्षणीय सुधारणा झाली आहे. अधिक प्रयत्नांच्या स्तरांवर ती सुमारे शंभरपट कमी खर्चात GPT‑5.6 Sol इतकी कामगिरी करते.
येथे आम्ही ओळख काढून टाकलेल्या अशा ChatGPT संभाषणांवर तथ्यात्मक अचूकतेचे मूल्यमापन करतो, ज्यांत वापरकर्त्यांनी आधीच्या मॉडेलची तथ्यात्मक चूक नोंदवली होती. चुका घडवून आणणारी ही संभाषणे सामान्य वापराचे प्रतिनिधित्व करत नाहीत, कारण सामान्य वापरात तथ्यात्मक चुका तुलनेने दुर्मीळ असतात. उत्तराच्या लांबीनुसार गुण नियंत्रित केलेले नाहीत. मात्र, शब्दबंबाळपणाच्या आमच्या चाचण्यांत उत्तराच्या लांबीशी जवळपास कोणताही संबंध आढळला नाही.
यावर्षी कोडिंग एजंटनी पूर्वीपेक्षा अधिक गुंतागुंतीची, व्यापक आणि दीर्घकालीन कामे हाताळण्यास सुरुवात केली आहे. OpenAI मधील आमचा अंतर्गत वापर घातांकीय वेगाने वाढला आहे. API किमतींनुसार मूल्य मोजल्यास, मध्यम संशोधकाचा दैनंदिन टोकन वापर $600 पेक्षा, तर 90व्या पर्सेंटाइलमधील संशोधकांचा वापर $7,000 पेक्षा अधिक झाला आहे (संशोधनाला गती: OpenAI मधील दृश्य). कोडिंग एजंट अधिक दीर्घ आणि आव्हानात्मक कामे हाती घेत असल्याने सातत्यपूर्ण वापराचा खर्च अधिक महत्त्वाचा ठरतो. GPT‑6 Sol आणि Luna भक्कम कोडिंग कामगिरीसोबत कमी API किमती देतात. त्यामुळे विकसकांना पुनरावृत्तीने सुधारणा करण्यासाठी अधिक वाव मिळतो आणि Codex कडे अधिक महत्त्वाकांक्षी कामे सोपवण्याचा संघांचा आत्मविश्वास वाढतो.
कोडिंग एजंटनी केलेले बदल प्रत्यक्ष कोडबेसमध्ये मर्ज करण्यासाठी तयार आहेत का, याचे मूल्यमापन करणाऱ्या FrontierCode मध्ये GPT‑6 Sol ने GPT‑5.6 Sol च्या तुलनेत लक्षणीय सुधारणा केली आहे आणि खूपच कमी खर्चात अतिउच्च प्रयत्नांवरील Claude Fable 5.1 इतकी कामगिरी केली आहे.
FrontierCode 1.1 Main(नवीन विंडोमध्ये उघडेल) मध्ये AI एजंटनी लिहिलेल्या कोडचे केवळ अचूकतेवरच नव्हे, तर तो मर्ज करण्यायोग्य आहे का यावरही मूल्यमापन केले जाते. उदाहरणार्थ, चाचण्यांची गुणवत्ता, व्याप्तीचे भान, कोडची शैली आणि कोडबेसच्या मानकांचे पालन.
प्रत्यक्ष कोडसंचांतील गुंतागुंतीच्या सॉफ्टवेअर अभियांत्रिकी कामांवरील कामगिरी तपासणाऱ्या DeepSWE v1.1 मध्ये, कमाल प्रयत्नांवरील GPT‑6 Sol ला 68.8% गुण मिळतात. हे मूल्यमापनातील Claude Fable 5 च्या सर्वोच्च 69.9% गुणांपेक्षा केवळ 1.1 टक्के गुणांनी कमी आहे, तेही अतिउच्च प्रयत्नांवर आणि सुमारे 80% कमी प्रति टास्क खर्चात.
कमाल प्रयत्नांवरील GPT‑6 Luna ला 66.6% गुण मिळतात, जे मध्यम प्रयत्नांवरील Claude Opus 5 आणि Fable 5 यांच्या तोडीचे आहेत. या तुलनांमध्ये Luna चा प्रति टास्क खर्च Opus 5 पेक्षा 93% आणि Fable 5 पेक्षा 96% कमी आहे.
DeepSWE 1.1(नवीन विंडोमध्ये उघडेल) मध्ये AI एजंट दीर्घकालीन आणि मूळ सॉफ्टवेअर इंजिनिअरिंगची कामे सोडवतात.
कॉम्प्यूटरच्या वापरासाठी GPT‑6 Astra हे जगातील सर्वोत्तम मॉडेल असले, तरी GPT‑6 Sol आणि Luna त्यांच्या पूर्वसुरींपेक्षा अधिक खर्च-कार्यक्षम कामगिरी देतात. OSWorld 2.0 ऑफलाइन मध्ये अतिउच्च प्रयत्नांवरील GPT‑6 Sol ला मध्यम प्रयत्नांवरील Claude Opus 5 इतकेच गुण मिळतात, अनुक्रमे 60.5% आणि 60.3%, तेही सुमारे 80% कमी प्रति टास्क खर्चात. GPT‑6 Luna (Max) ही GPT‑5.6 Sol (मध्यम) पेक्षा दहापट कमी खर्चात सरस ठरते.
OSWorld 2.0(नवीन विंडोमध्ये उघडेल) मध्ये AI एजंट दैनंदिन आणि व्यावसायिक कामांतील दीर्घकालीन कॉम्प्यूटर-वापर कार्यप्रवाह पूर्ण करण्याचा प्रयत्न करतात. आम्ही v2026.08.08 आवृत्तीच्या ऑफलाइन सेटमधील अंशतः रिवॉर्डचा अहवाल देत आहोत.
GPT‑6 Astra ची सुधारित संवादशैली आम्ही Sol आणि Luna मध्येही आणली आहे. तांत्रिक आणि कोडिंगविषयक संभाषणांमध्ये ही सुधारणा विशेषतः जाणवेल, असे आम्हाला वाटते. आशय न गमावता अधिक स्पष्टता, कमी तांत्रिक परिभाषा, कमी विचित्र शब्दप्रयोग, कमी मूल्याचे तपशील कमी प्रमाणात आणि एकूणच किंचित लहान उत्तरे अपेक्षित आहेत.
शैली व्यक्तिनिष्ठ असली, तरी येथे आम्हाला GPT‑6 Sol चे उत्तर अधिक पसंत आहे. ते घाईने निष्कर्ष काढत नाही, प्रश्नकर्त्याला कदाचित स्पष्टपणे माहीत असलेले तपशील पुन्हा सांगण्यात कमी वेळ घालवते, जसे की वेबसाइटवर चार पाने आहेत. ते “बेंटोसारखा भास” आणि “त्या सिस्टमभोवती फेररचना करणे” यांसारखी संदिग्ध भाषा कमी वापरते, काय तपासले आणि काय तपासले नाही हे अधिक स्पष्टपणे सांगते आणि इमेज टूलसाठीच्या प्रॉम्प्टसारखे अंमलबजावणीचे अनावश्यक तपशील देत नाही.
टोकनच्या कमी किमतींसोबतच, GPT‑6 वर निर्मिती करणाऱ्या डेव्हलपर्सना त्यांच्या ॲप्लिकेशन्सने पुन्हा वापरलेल्या संदर्भावरील खर्च आणखी कमी करण्यास आम्ही मदत करत आहोत. GPT‑6 साठीचे प्रॉम्प्ट कॅशिंग आम्ही सुधारले आहे, जेणेकरून पूर्वनिर्धारितपणे कॅश जुळण्याचे प्रमाण अधिक मिळेल. यामुळे एजंट अधिक संदर्भ पुन्हा वापरू शकतात, जलद प्रतिसाद देऊ शकतात आणि कॅश केलेले इनपुट टोकन वाचताना 90% सवलत मिळवू शकतात.
डेव्हलपर्सकडे आता कॅशिंगची कामगिरी मोजण्यासाठी आणि सुधारण्यासाठी आणखी मार्ग आहेत:
निरीक्षण आणि निदान करा. प्रॉम्प्ट कॅशिंग डॅशबोर्ड(नवीन विंडोमध्ये उघडेल) किती इनपुट कॅश केले आहे आणि कालांतराने त्यात कसा बदल होतो, हे दाखवतो. निदानाचे टूल(नवीन विंडोमध्ये उघडेल) कॅशिंगच्या संधी का हुकल्या आणि काय दुरुस्त करावे, हे स्पष्ट करण्यास मदत करते.
कॅश न मोडता रीझनिंगचे प्रयत्न आणि टूल्सची उपलब्धता बदला. अवघड कामांसाठी रीझनिंगचे प्रयत्न(नवीन विंडोमध्ये उघडेल) वाढवा किंवा सोप्या पुढील प्रश्नांसाठी ते कमी करा. तसेच, एजंटच्या गरजा बदलतील त्यानुसार टूल्स सक्षम किंवा अक्षम करा(नवीन विंडोमध्ये उघडेल). दोन्ही नियंत्रणे आता कॅशमध्ये पुन्हा वापरण्यासाठी आधीचा संदर्भ सेव्ह करतात.
कोणते उपसर्ग कॅश करायचे ते ऑप्टिमाइझ करा. स्पष्ट विभाजनबिंदूंमुळे कॅश केलेल्या प्रॉम्प्टचे उपसर्ग कुठे संपतील, हे डेव्हलपर्सना निवडता येते. यामुळे डेव्हलपर्सना कॅशच्या पुनर्वापरावर अधिक नियंत्रण मिळते आणि कामगिरी सुधारू शकते.
GitHub च्या अहवालानुसार, गेल्या अनेक महिन्यांत या सुधारणांनी OpenAI मॉडेलकडे आलेल्या अब्जावधी विनंत्यांमध्ये नव्याने प्रक्रिया करावी लागणाऱ्या प्रॉम्प्ट टोकनचे प्रमाण 50% पेक्षा अधिक कमी केले आहे. त्यामुळे Copilot अधिक जलद प्रतिसाद देऊ शकते.
GPT‑6 Sol आणि Luna हे आजवरचे आमचे सर्वाधिक अलाइन केलेले मॉडेल Astra सोबत सादर केलेल्या अलाइनमेंट विषयक कामावर आधारित आहेत. आमच्या अलाइनमेंट मूल्यमापनांमध्ये Sol आणि Luna दोन्ही त्यांच्या GPT‑5.6 समकक्षांपेक्षा सुधारले आहेत. यात त्यांच्या कोडिंग कामाविषयी दिशाभूल करणाऱ्या दाव्यांचे कमी प्रमाणही समाविष्ट आहे.
खालील मूल्यमापने हेतुपुरस्सर आव्हानात्मक परिस्थिती तपासतात आणि सामान्य वापरातील अपयशाचे प्रमाण मोजत नाहीत. संपूर्ण परिणामांसाठी सिस्टम कार्ड(नवीन विंडोमध्ये उघडेल) पहा.
GPT‑6 Sol आणि GPT‑6 Luna आजपासून सर्व Plus, Pro, Business, Enterprise आणि Edu वापरकर्त्यांसाठी ChatGPT वर्क आणि Codex मध्ये उपलब्ध आहेत. Free आणि Go वापरकर्ते डेस्कटॉप ॲपमध्ये GPT‑6 Luna वापरू शकतात. ही मॉडेल अद्याप चॅटमध्ये उपलब्ध नाहीत. OpenAI API मध्ये ती gpt-6-sol आणि gpt-6-luna या नावांनी उपलब्ध आहेत.
सर्वांसाठी सेवा स्थिर ठेवण्यासाठी ही मॉडेल दिवसभरात टप्प्याटप्प्याने ChatGPT मध्ये उपलब्ध करण्याची आमची योजना आहे. ChatGPT वर्क किंवा Codex मध्ये नवीन मॉडेल दिसत नसतील, तर कृपया नंतर पुन्हा प्रयत्न करा.
GPT चे मूल्यमापन आमच्या संशोधन वातावरणात किंवा API द्वारे करण्यात आले. सिस्टम प्रॉम्प्ट, उपलब्ध टूल्स इत्यादींमधील फरकांमुळे त्यातील आउटपुट प्रत्यक्ष वापरातील ChatGPT पेक्षा किंचित वेगळे असू शकते. स्पर्धक मॉडेलची मूल्यमापने सार्वजनिकरीत्या उपलब्ध अहवालांतून घेतली आहेत. Claude Fable 5.1 चे गुण उपलब्ध नसताना Claude Fable 5 चे गुण नोंदवले आहेत.


