मुख्य मजकूराकडे जा
OpenAI

सादर करत आहोत GPT‑6 Sol आणि Luna

तुमच्या दैनंदिन कामात अत्याधुनिक बुद्धिमत्ता आणण्याचे आणखी मार्ग.

लोड होत आहे...

या महिन्याच्या सुरुवातीला आम्ही जगातील सर्वात बुद्धिमान आणि अलाइन केलेले मॉडेल, GPT‑6 Astra, सादर केले. सर्वाधिक आव्हानात्मक आणि महत्त्वाच्या प्रकल्पांसाठी अजूनही Astra ची पूर्ण क्षमता आवश्यक असली, तरी कामाचे प्रमाण, गती आणि अंदाजपत्रक वेगवेगळे असतात.

म्हणूनच आम्ही GPT‑6 Sol आणि GPT‑6 Luna. यांचा समावेश करून GPT‑6 विश्वाचा विस्तार करत आहोत. GPT‑6 Astra ने बुद्धिमत्तेची नवी पिढी सादर केली. खर्चाच्या कार्यक्षमतेमध्ये अत्याधुनिक प्रगती करून ही मॉडेल त्या बुद्धिमत्तेचे लाभ अधिक व्यापकपणे उपलब्ध करून देतात. GPT‑6 Astra साठी वापरलेल्या पद्धतींसारख्याच पद्धतींनी आम्ही GPT‑6 Sol आणि Luna यांना प्रशिक्षित केले. त्यामुळे व्यावसायिक काम, तथ्यात्मक अचूकता, कोडिंग, कॉम्प्यूटरचा वापर आणि अलाइनमेंट यांमधील Astra च्या अत्याधुनिक कामगिरीमागील प्रगती अधिक वेगवान आणि परवडणाऱ्या मॉडेलमध्ये आली आहे.

GPT‑6 मॉडेल खर्च-बुद्धिमत्ता आलेखावर आघाडीवर आहेत. प्रत्येक स्तरावरील अपवादात्मक क्षमता आणि त्या मोठ्या प्रमाणावर कार्यक्षमतेने पुरवणारी पायाभूत सुविधा यांचा ती संगम घडवतात. कॅशिंग आणि अनुमान प्रक्रियेतील सुधारणांमुळे ही मॉडेल कमी खर्चात पुरवता येतात. GPT‑5.6 च्या प्रचारात्मक किमतींच्या तुलनेत Sol आणि Luna च्या API किमती 50% कमी करून ही बचत आम्ही थेट वापरकर्ते आणि ग्राहकांपर्यंत पोहोचवत आहोत. या सर्व सुधारणांमुळे प्रगत एआय अधिक दैनंदिन कामांसाठी आणि मोठ्या प्रमाणावरील अनुप्रयोगांसाठी व्यवहार्य बनते.

GPT‑6 API किंमत

मॉडेल

इनपुट

आउटपुट

किमतीतील कपात

GPT‑6 Sol
विरुद्ध GPT‑5.6 Sol

$4 → $2

$20 → $10

50% स्वस्त

GPT‑6 Luna
विरुद्ध GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% स्वस्त

किमती प्रति 10 लाख टोकन आहेत.

GPT‑6 Astra हे सर्व बाबतींत आमचे सर्वोत्तम मॉडेल आहे. सर्वोत्तम परिणाम आणि कोणतीही तडजोड नसलेला अनुभव हवा असेल, तेव्हा हे मॉडेल निवडा.

संपूर्ण मॉडेल कुटुंबाची पुढची पायरी

गुंतागुंतीची कामे पूर्ण करण्यासाठी सर्वाधिक उपयुक्त असलेल्या क्षमतांमध्ये GPT‑6 Sol आणि Luna, तुम्ही आधीपासून ओळखत आणि वापरत असलेल्या मॉडेलना अधिक बुद्धिमत्ता आणि खर्चाची कार्यक्षमता देतात.

व्यावसायिक काम

GPT‑6 Sol अवघड कामे हाताळू शकते. अधिक वापरमर्यादा आणि कमी खर्चामुळे तुम्हाला पुनरावृत्तीने सुधारणा करण्यासाठी अधिक वाव मिळतो, तसेच समान किंमतीच्या स्पर्धक मॉडेलपेक्षा अधिक बुद्धिमत्ता आणि चांगले परिणाम मिळतात.

विविध ॲप्समधील व्यावसायिक कार्यप्रवाहांची चाचणी घेणाऱ्या AutomationBench मध्ये, अतिउच्च प्रयत्नांवर GPT‑6 Sol हे कमाल प्रयत्नांवरील Claude Opus 5 पेक्षा सरस ठरते आणि त्याचा प्रतिकार्य खर्च Opus 5 च्या केवळ 9% आहे. उच्च प्रयत्नांवर GPT‑6 Luna आपल्या पूर्वसुरीपेक्षा 5.4 टक्के गुणांनी सुधारते, तर प्रति टास्क खर्च 58% कमी असतो.

AutomationBench 1.0.6⁠(नवीन विंडोमध्ये उघडेल) मध्ये विक्री, मार्केटिंग, संचालन, सहाय्य, वित्त आणि मनुष्यबळ या क्षेत्रांतील 47 टूल्स वापरणाऱ्या सुरुवातीपासून शेवटपर्यंतच्या कार्यप्रवाहांवर AI एजंटची चाचणी केली जाते. Claude Fable 5.1 साठीचा आकडा त्याचा प्रत्यक्ष खर्च कमी दाखवतो, कारण सुमारे 40% टास्क्समध्ये वापरलेल्या Opus 5 फॉलबॅकचा खर्च त्यात समाविष्ट नाही.

GPT‑6 Sol हे खूपच कमी खर्चात Claude Fable 5.1 पेक्षाही सरस ठरते आणि कमी प्रयत्नांवरील GPT‑6 Astra लाही मागे टाकते.

मॉडेल (आणि प्रयत्न)

गुण

प्रति टास्क खर्च

GPT‑6 Sol (अतिउच्च)

33.2%

$0.27

GPT‑6 Astra (कमी)

30.3%

GPT‑6 Sol च्या 3.9 पट

Claude Opus 5 (कमाल)

26.9%

GPT‑6 Sol च्या 11.1 पट

Opus 5 पर्यायासह Claude Fable 5.1 (Max)

31.4%

GPT‑6 Sol च्या >8.9 पट

(पर्यायाचा खर्च नोंदवलेला नाही)

गुंतागुंतीच्या व्यावसायिक कार्यप्रवाहांवर एजंटचे मूल्यमापन करणाऱ्या Agents’ Last Exam मध्ये, कमाल प्रयत्नांवरील GPT‑6 Sol ला 56.4% गुण मिळतात. हे मूल्यमापनातील Claude Opus 5 च्या सर्वोच्च गुणांपेक्षा अधिक असून प्रति टास्क खर्च 60% कमी आहे.

Agents’ Last Exam V1⁠(नवीन विंडोमध्ये उघडेल) मध्ये 55 उपउद्योगांतील दीर्घकालीन आणि आर्थिकदृष्ट्या मूल्यवान कामांवर AI एजंटचे मूल्यमापन केले जाते. यात कॉम्प्यूटरवर केल्या जाणाऱ्या व्यावसायिक कामाच्या बहुतेक प्रमुख क्षेत्रांचा समावेश आहे.

तथ्यात्मक अचूकता

उत्तराची उपयुक्तता तथ्ये अचूक असण्यावर अवलंबून असते आणि आम्ही तथ्यात्मक विश्वासार्हतेत सातत्याने प्रगती करत आहोत. वापरकर्त्यांनी आमच्या मॉडेलच्या चुका नोंदवलेल्या, ओळख काढून टाकलेल्या प्रत्यक्ष संभाषणांवर आधारित आमच्या अंतर्गत तथ्यात्मक मूल्यमापनात GPT‑6 Sol आपल्या पूर्वसुरीच्या तुलनेत सुमारे निम्म्या चुका करते. खूपच कमी खर्चात तिची विश्वासार्हता Astra च्या जवळ पोहोचते. GPT‑6 Luna मध्येही लक्षणीय सुधारणा झाली आहे. अधिक प्रयत्नांच्या स्तरांवर ती सुमारे शंभरपट कमी खर्चात GPT‑5.6 Sol इतकी कामगिरी करते.

येथे आम्ही ओळख काढून टाकलेल्या अशा ChatGPT संभाषणांवर तथ्यात्मक अचूकतेचे मूल्यमापन करतो, ज्यांत वापरकर्त्यांनी आधीच्या मॉडेलची तथ्यात्मक चूक नोंदवली होती. चुका घडवून आणणारी ही संभाषणे सामान्य वापराचे प्रतिनिधित्व करत नाहीत, कारण सामान्य वापरात तथ्यात्मक चुका तुलनेने दुर्मीळ असतात. उत्तराच्या लांबीनुसार गुण नियंत्रित केलेले नाहीत. मात्र, शब्दबंबाळपणाच्या आमच्या चाचण्यांत उत्तराच्या लांबीशी जवळपास कोणताही संबंध आढळला नाही.

कोडिंग

यावर्षी कोडिंग एजंटनी पूर्वीपेक्षा अधिक गुंतागुंतीची, व्यापक आणि दीर्घकालीन कामे हाताळण्यास सुरुवात केली आहे. OpenAI मधील आमचा अंतर्गत वापर घातांकीय वेगाने वाढला आहे. API किमतींनुसार मूल्य मोजल्यास, मध्यम संशोधकाचा दैनंदिन टोकन वापर $600 पेक्षा, तर 90व्या पर्सेंटाइलमधील संशोधकांचा वापर $7,000 पेक्षा अधिक झाला आहे (संशोधनाला गती: OpenAI मधील दृश्य⁠). कोडिंग एजंट अधिक दीर्घ आणि आव्हानात्मक कामे हाती घेत असल्याने सातत्यपूर्ण वापराचा खर्च अधिक महत्त्वाचा ठरतो. GPT‑6 Sol आणि Luna भक्कम कोडिंग कामगिरीसोबत कमी API किमती देतात. त्यामुळे विकसकांना पुनरावृत्तीने सुधारणा करण्यासाठी अधिक वाव मिळतो आणि Codex कडे अधिक महत्त्वाकांक्षी कामे सोपवण्याचा संघांचा आत्मविश्वास वाढतो.

कोडिंग एजंटनी केलेले बदल प्रत्यक्ष कोडबेसमध्ये मर्ज करण्यासाठी तयार आहेत का, याचे मूल्यमापन करणाऱ्या FrontierCode मध्ये GPT‑6 Sol ने GPT‑5.6 Sol च्या तुलनेत लक्षणीय सुधारणा केली आहे आणि खूपच कमी खर्चात अतिउच्च प्रयत्नांवरील Claude Fable 5.1 इतकी कामगिरी केली आहे.

FrontierCode 1.1 Main⁠(नवीन विंडोमध्ये उघडेल) मध्ये AI एजंटनी लिहिलेल्या कोडचे केवळ अचूकतेवरच नव्हे, तर तो मर्ज करण्यायोग्य आहे का यावरही मूल्यमापन केले जाते. उदाहरणार्थ, चाचण्यांची गुणवत्ता, व्याप्तीचे भान, कोडची शैली आणि कोडबेसच्या मानकांचे पालन.

प्रत्यक्ष कोडसंचांतील गुंतागुंतीच्या सॉफ्टवेअर अभियांत्रिकी कामांवरील कामगिरी तपासणाऱ्या DeepSWE v1.1 मध्ये, कमाल प्रयत्नांवरील GPT‑6 Sol ला 68.8% गुण मिळतात. हे मूल्यमापनातील Claude Fable 5 च्या सर्वोच्च 69.9% गुणांपेक्षा केवळ 1.1 टक्के गुणांनी कमी आहे, तेही अतिउच्च प्रयत्नांवर आणि सुमारे 80% कमी प्रति टास्क खर्चात.

कमाल प्रयत्नांवरील GPT‑6 Luna ला 66.6% गुण मिळतात, जे मध्यम प्रयत्नांवरील Claude Opus 5 आणि Fable 5 यांच्या तोडीचे आहेत. या तुलनांमध्ये Luna चा प्रति टास्क खर्च Opus 5 पेक्षा 93% आणि Fable 5 पेक्षा 96% कमी आहे.

DeepSWE 1.1⁠(नवीन विंडोमध्ये उघडेल) मध्ये AI एजंट दीर्घकालीन आणि मूळ सॉफ्टवेअर इंजिनिअरिंगची कामे सोडवतात.

कॉम्प्यूटरचा वापर

कॉम्प्यूटरच्या वापरासाठी GPT‑6 Astra हे जगातील सर्वोत्तम मॉडेल असले, तरी GPT‑6 Sol आणि Luna त्यांच्या पूर्वसुरींपेक्षा अधिक खर्च-कार्यक्षम कामगिरी देतात. OSWorld 2.0 ऑफलाइन मध्ये अतिउच्च प्रयत्नांवरील GPT‑6 Sol ला मध्यम प्रयत्नांवरील Claude Opus 5 इतकेच गुण मिळतात, अनुक्रमे 60.5% आणि 60.3%, तेही सुमारे 80% कमी प्रति टास्क खर्चात. GPT‑6 Luna (Max) ही GPT‑5.6 Sol (मध्यम) पेक्षा दहापट कमी खर्चात सरस ठरते.

OSWorld 2.0⁠(नवीन विंडोमध्ये उघडेल) मध्ये AI एजंट दैनंदिन आणि व्यावसायिक कामांतील दीर्घकालीन कॉम्प्यूटर-वापर कार्यप्रवाह पूर्ण करण्याचा प्रयत्न करतात. आम्ही v2026.08.08 आवृत्तीच्या ऑफलाइन सेटमधील अंशतः रिवॉर्डचा अहवाल देत आहोत.

सहकार्याची शैली

GPT‑6 Astra ची सुधारित संवादशैली आम्ही Sol आणि Luna मध्येही आणली आहे. तांत्रिक आणि कोडिंगविषयक संभाषणांमध्ये ही सुधारणा विशेषतः जाणवेल, असे आम्हाला वाटते. आशय न गमावता अधिक स्पष्टता, कमी तांत्रिक परिभाषा, कमी विचित्र शब्दप्रयोग, कमी मूल्याचे तपशील कमी प्रमाणात आणि एकूणच किंचित लहान उत्तरे अपेक्षित आहेत.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

शैली व्यक्तिनिष्ठ असली, तरी येथे आम्हाला GPT‑6 Sol चे उत्तर अधिक पसंत आहे. ते घाईने निष्कर्ष काढत नाही, प्रश्नकर्त्याला कदाचित स्पष्टपणे माहीत असलेले तपशील पुन्हा सांगण्यात कमी वेळ घालवते, जसे की वेबसाइटवर चार पाने आहेत. ते “बेंटोसारखा भास” आणि “त्या सिस्टमभोवती फेररचना करणे” यांसारखी संदिग्ध भाषा कमी वापरते, काय तपासले आणि काय तपासले नाही हे अधिक स्पष्टपणे सांगते आणि इमेज टूलसाठीच्या प्रॉम्प्टसारखे अंमलबजावणीचे अनावश्यक तपशील देत नाही.

एजंट आणि दीर्घ संभाषणांसाठी कॅशिंगमध्ये सुधारणा

टोकनच्या कमी किमतींसोबतच, GPT‑6 वर निर्मिती करणाऱ्या डेव्हलपर्सना त्यांच्या ॲप्लिकेशन्सने पुन्हा वापरलेल्या संदर्भावरील खर्च आणखी कमी करण्यास आम्ही मदत करत आहोत. GPT‑6 साठीचे प्रॉम्प्ट कॅशिंग आम्ही सुधारले आहे, जेणेकरून पूर्वनिर्धारितपणे कॅश जुळण्याचे प्रमाण अधिक मिळेल. यामुळे एजंट अधिक संदर्भ पुन्हा वापरू शकतात, जलद प्रतिसाद देऊ शकतात आणि कॅश केलेले इनपुट टोकन वाचताना 90% सवलत मिळवू शकतात.

डेव्हलपर्सकडे आता कॅशिंगची कामगिरी मोजण्यासाठी आणि सुधारण्यासाठी आणखी मार्ग आहेत:

GitHub च्या अहवालानुसार, गेल्या अनेक महिन्यांत या सुधारणांनी OpenAI मॉडेलकडे आलेल्या अब्जावधी विनंत्यांमध्ये नव्याने प्रक्रिया करावी लागणाऱ्या प्रॉम्प्ट टोकनचे प्रमाण 50% पेक्षा अधिक कमी केले आहे. त्यामुळे Copilot अधिक जलद प्रतिसाद देऊ शकते.

अलाइनमेंटमध्ये सातत्याने सुधारणा

GPT‑6 Sol आणि Luna हे आजवरचे आमचे सर्वाधिक अलाइन केलेले मॉडेल Astra सोबत सादर केलेल्या अलाइनमेंट विषयक कामावर आधारित आहेत. आमच्या अलाइनमेंट मूल्यमापनांमध्ये Sol आणि Luna दोन्ही त्यांच्या GPT‑5.6 समकक्षांपेक्षा सुधारले आहेत. यात त्यांच्या कोडिंग कामाविषयी दिशाभूल करणाऱ्या दाव्यांचे कमी प्रमाणही समाविष्ट आहे.

खालील मूल्यमापने हेतुपुरस्सर आव्हानात्मक परिस्थिती तपासतात आणि सामान्य वापरातील अपयशाचे प्रमाण मोजत नाहीत. संपूर्ण परिणामांसाठी सिस्टम कार्ड⁠(नवीन विंडोमध्ये उघडेल) पहा.

उपलब्धता

GPT‑6 Sol आणि GPT‑6 Luna आजपासून सर्व Plus, Pro, Business, Enterprise आणि Edu वापरकर्त्यांसाठी ChatGPT वर्क आणि Codex मध्ये उपलब्ध आहेत. Free आणि Go वापरकर्ते डेस्कटॉप ॲपमध्ये GPT‑6 Luna वापरू शकतात. ही मॉडेल अद्याप चॅटमध्ये उपलब्ध नाहीत. OpenAI API मध्ये ती gpt-6-sol आणि gpt-6-luna या नावांनी उपलब्ध आहेत.

सर्वांसाठी सेवा स्थिर ठेवण्यासाठी ही मॉडेल दिवसभरात टप्प्याटप्प्याने ChatGPT मध्ये उपलब्ध करण्याची आमची योजना आहे. ChatGPT वर्क किंवा Codex मध्ये नवीन मॉडेल दिसत नसतील, तर कृपया नंतर पुन्हा प्रयत्न करा.


GPT चे मूल्यमापन आमच्या संशोधन वातावरणात किंवा API द्वारे करण्यात आले. सिस्टम प्रॉम्प्ट, उपलब्ध टूल्स इत्यादींमधील फरकांमुळे त्यातील आउटपुट प्रत्यक्ष वापरातील ChatGPT पेक्षा किंचित वेगळे असू शकते. स्पर्धक मॉडेलची मूल्यमापने सार्वजनिकरीत्या उपलब्ध अहवालांतून घेतली आहेत. Claude Fable 5.1 चे गुण उपलब्ध नसताना Claude Fable 5 चे गुण नोंदवले आहेत.

लेखक

OpenAI