GPT-6.1Sol
सातत्यपूर्ण अत्याधुनिक कामगिरीसाठी पाचपट कमी किमतीत Astra च्या जवळपासची बुद्धिमत्ता
आम्ही सादर करत आहोत GPT‑6.1 Sol, ही GPT‑6 Sol ची सुधारित आवृत्ती एजंटीक कोडिंगसोबतच संगणक वापर आणि व्यावसायिक कामातही उत्कृष्ट कामगिरी करते. कठीण कामांमध्ये ते Sol ला GPT‑6 Astra च्या जवळ नेते, तेही Astra च्या प्रमाणित इनपुट आणि आउटपुट टोकन दरांच्या एक-पंचमांश दरात. त्यामुळे विकासकांना त्याच अर्थसंकल्पात सक्षम एजंट तयार करण्यासाठी आणि चालवण्यासाठी अधिक वाव मिळतो.
GPT‑6.1 Sol हे Sol च्या किमतीत Astra च्या जवळपासची कामगिरी देते. त्यामुळे या कामगिरीच्या पातळीवर आज उपलब्ध असलेले ते सर्वाधिक किफायतशीर मॉडेल आहे. कॅश केलेल्या इनपुटचा खर्च प्रति दहा लाख टोकन फक्त $0.10 आहे—प्रमाणित इनपुट दरांवर 95% सवलत. त्यामुळे वारंवार येणाऱ्या विनंत्यांमध्ये संदर्भ पुन्हा वापरावा लागणाऱ्या एजंट-आधारित कामांसाठी ते अधिक परवडणारे ठरते.
एकूण क्षमतेच्या दृष्टीने GPT‑6 Astra हेच आमचे सर्वात सक्षम अत्याधुनिक मॉडेल आहे. वारंवार महत्त्वाची कामे करू इच्छिणाऱ्या वापरकर्त्यांना आणि मोठ्या प्रमाणावर अनुप्रयोग तयार करून चालवणाऱ्या एपीआय ग्राहकांना GPT‑6.1 Sol क्षमता व खर्च यांचा नवा समतोल देते.

संहिता लिहिणे व त्यातील त्रुटी दूर करणे, दस्तऐवज समजून घेणे आणि अनेक टप्प्यांच्या व्यावसायिक कार्यप्रक्रिया पार पाडणे अशा गुंतागुंतीच्या व्यावसायिक कामांमध्ये GPT‑6.1 Sol हे GPT‑6 Sol पेक्षा लक्षणीय सुधारणा घडवते. यांपैकी अनेक मूल्यमापनांमध्ये ते लक्षणीयरीत्या कमी खर्चात GPT‑6 Astra च्या कामगिरीच्या जवळ पोहोचते.
प्रत्यक्ष संहितासंचांमधील गुंतागुंतीच्या सॉफ्टवेअर अभियांत्रिकी कामांचे मूल्यमापन करणाऱ्या DeepSWE v1.1 मध्ये GPT‑6.1 Sol हे साधारण एक-पंचमांश खर्चात GPT‑6 Astra ची बरोबरी करते. त्याचवेळी कमी रीझनिंग प्रयत्न आणि खर्चात ते GPT‑6 Sol च्या सर्वोत्तम गुणांपेक्षा 6.4 टक्के गुण अधिक मिळवते.
DeepSWE 1.1(नवीन विंडोमध्ये उघडेल) या चाचणीत, कृत्रिम बुद्धिमत्तेवर आधारित एजंट सॉफ्टवेअर अभियांत्रिकीतील नव्याने तयार केलेली, दीर्घकाळ काम करावे लागणारी कार्ये पूर्ण करतात.
तक्ते, आलेख, आकृत्या आणि बारीक अक्षरांतील तपशील असलेले गुंतागुंतीचे पीडीएफ दस्तऐवज वापरून मॉडेल व्यावसायिक प्रश्नांची किती अचूक उत्तरे देतात, हे GDP.pdf मोजते. यात तपासलेल्या रीझनिंग पातळ्यांवर GPT‑6.1 Sol हे पर्यायी मॉडेलची मदत घेणाऱ्या Opus 5.5 पेक्षा अधिक गुण मिळवते, तेही प्रति काम निम्म्याहून कमी खर्चात. ते प्रति काम साधारण एक-पंचमांश खर्चात GPT‑6 Astra च्या सर्वोत्तम कामगिरीच्या जवळही पोहोचते.
GDP.pdf(नवीन विंडोमध्ये उघडेल) या चाचणीत, मॉडेल्सना वित्त, आरोग्यसेवा, कायदा आणि इतर सात व्यावसायिक क्षेत्रांतील कार्यप्रक्रियांमधून घेतलेल्या गुंतागुंतीच्या पीडीएफ दस्तऐवजांविषयी प्रत्यक्ष कामात विचारल्या जाणाऱ्या प्रश्नांची उत्तरे द्यावी लागतात.
एजंट अनेक टप्प्यांच्या व्यावसायिक कार्यप्रक्रिया योग्यरीत्या पूर्ण करतात का हे मोजणाऱ्या AutomationBench मध्ये, मध्यम रीझनिंग प्रयत्नांच्या पातळीवर GPT‑6.1 Sol हे Opus 5.5 पेक्षा 2.2 टक्के गुण अधिक मिळवते, तेही साधारण एक-तृतीयांश खर्चात. हे गुण त्याच पातळीवरील GPT‑6 Sol च्या गुणांपेक्षाही 4.8 टक्के गुण अधिक आहेत.
In AutomationBench 1.0.6(नवीन विंडोमध्ये उघडेल), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
संगणक अनुप्रयोगांशी संवाद साधावा लागणाऱ्या कामांमध्येही GPT‑6.1 Sol लक्षणीय प्रगती करते. संगणक वापराच्या कठीण कार्यप्रक्रियांवर एजंटचे मूल्यमापन करणाऱ्या OSWorld 2.0 च्या ऑफलाइन संचात, कमाल रीझनिंग प्रयत्नांच्या पातळीवर GPT‑6.1 Sol हे GPT‑6 Sol पेक्षा सात टक्के गुण अधिक मिळवते, तेही निम्म्याहून कमी खर्चात. कमाल रीझनिंग प्रयत्नांच्या पातळीवर त्याचे गुण Astra पेक्षा केवळ 2.1 टक्के गुणांनी कमी आहेत, तर प्रति काम खर्च साधारण एक-सप्तमांश आहे.
In OSWorld 2.0(नवीन विंडोमध्ये उघडेल), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
डेटा विश्लेषण, अनुकरण आणि प्रमेय सिद्ध करणे अशा वैज्ञानिक कार्यप्रक्रियांचे मूल्यमापन करणाऱ्या Terminal-Bench Science 0.1 मध्ये GPT‑6.1 Sol हे कमाल रीझनिंग प्रयत्नांच्या पातळीवर GPT‑6 Sol च्या दुपटीहून अधिक गुण मिळवते, तेही प्रति काम निम्म्याहून कमी खर्चात. कमाल प्रयत्नांच्या पातळीवर GPT‑6.1 Sol चा प्रति काम सरासरी खर्च $5.47 आहे, तर Opus 5.5 चा $23.21 आणि Astra चा $23.80 आहे. म्हणजेच या दोन्ही मॉडेलपेक्षा 75% हून कमी खर्चात ते भरीव वैज्ञानिक क्षमता देते.
तपासलेल्या मॉडेलपैकी GPT‑6 Astra अजूनही 68.1% या सर्वोच्च गुणांसह आघाडीवर आहे. सर्वात कठीण वैज्ञानिक संशोधनाच्या कामांसाठी तेच वापरावे.
Terminal-Bench Science 0.1(नवीन विंडोमध्ये उघडेल) या चाचणीत, एजंट कोड आणि टर्मिनल साधनांचा वापर करून वैज्ञानिक संशोधनातील कार्यप्रक्रिया पूर्ण करतात. यात डेटाचे विश्लेषण करणे, सिम्युलेशन चालवणे आणि डेटाशी मॉडेल्स जुळवणे यांचा समावेश होतो.
GPT‑6.1 Sol कठीण सूचनांवरील तथ्यात्मक अचूकताही सुधारते. अतिउच्च रीझनिंग प्रयत्नांच्या पातळीवर त्याचे तथ्यात्मक चुकांचे प्रमाण 4.1% आहे. हे GPT‑6 Sol च्या 4.5% पेक्षा कमी आणि त्याच पातळीवरील Astra च्या 4.0% च्या जवळ आहे, तर प्रति काम खर्च Astra पेक्षा सुमारे 83% कमी आहे.
वापरकर्त्यांनी आधीच्या मॉडेलची चूक निदर्शनास आणून दिलेल्या संभाषणांमधून ओळख पटवणारी माहिती काढून टाकून, किमान एक तथ्यात्मक चूक असलेल्या उत्तरांचे प्रमाण या मूल्यमापनात मोजले जाते. जाणीवपूर्वक निवडलेल्या या कठीण सूचना नेहमीच्या वापराचे प्रतिनिधित्व करत नाहीत.
वापरकर्त्यांनी आधीच्या मॉडेलची तथ्यात्मक चूक निदर्शनास आणून दिलेल्या ChatGPT संभाषणांमधून ओळख पटवणारी माहिती काढून टाकून आम्ही तथ्यात्मक अचूकता तपासतो. चुका घडवून आणणारी ही संभाषणे नेहमीच्या वापराचे प्रतिनिधित्व करत नाहीत; नेहमीच्या वापरात तथ्यात्मक चुका अधिक दुर्मीळ असतात.
आमच्या अपेक्षांशी सुसंगत वर्तनाच्या मूल्यमापनांमध्ये GPT‑6.1 Sol हे GPT‑6 Sol पेक्षा लक्षणीय सुधारणा दाखवते आणि GPT‑6 Astra च्या जवळ पोहोचते.
GPT‑6.1 Sol स्वतःच्या मर्यादांबाबत अधिक पारदर्शक आहे आणि वापरकर्त्याचा हेतू व सुरक्षिततेच्या मर्यादा पाळण्यात अधिक विश्वासार्ह आहे. कठीण मूल्यमापनांमध्ये बंद पडलेल्या शोध साधनांबाबत पारदर्शक राहणे, स्पष्ट निर्बंध पाळणे आणि एजंट-आधारित कामांत अनधिकृत परिणाम टाळणे या बाबतीत त्याचे अपयशाचे प्रमाण GPT‑6 Sol पेक्षा कमी आहे. GPT‑6 Astra आणि GPT‑6 Sol प्रमाणेच स्वयंचलित सुरक्षा पुनरावलोककाला बगल देण्याचा एकही प्रयत्न आम्हाला आढळला नाही.
खालील मूल्यमापने जाणीवपूर्वक कठीण परिस्थिती तपासतात; ती नेहमीच्या वापरातील अपयशाचे प्रमाण मोजत नाहीत.
GPT‑6.1 Sol आजपासून सर्व Plus, Pro, Business, Enterprise आणि Edu वापरकर्त्यांना ChatGPT वर्क आणि Codex मध्ये उपलब्ध आहे. ही मॉडेल अद्याप चॅटमध्ये उपलब्ध नाहीत. विकासक ते OpenAI एपीआयद्वारे gpt-6.1-sol या नावानेही वापरू शकतात. त्याचे प्रमाणित एपीआय दर प्रति दहा लाख इनपुट टोकन $2, प्रति दहा लाख कॅश केलेले इनपुट टोकन $0.10 आणि प्रति दहा लाख आउटपुट टोकन $10 आहेत.
यासोबतच आम्ही GPT‑6 Astra Ultrafast सादर करत आहोत. हे जगातील सर्वात वेगवान अत्याधुनिक मॉडेल असून GPT‑6 Astra पेक्षा 8 पटपर्यंत वेगवान आहे. तसेच, आम्ही GPT‑6.1 Sol Ultrafast देखील सादर करत आहोत. ही मॉडेल एपीआयमध्ये उपलब्ध आहेत. तसेच, दरमहा $500 किमतीच्या आमच्या नव्या, सर्वाधिक वापरमर्यादा असलेल्या Pro स्तरावरील वापरकर्त्यांना ती ChatGPT वर्क आणि Codex मध्येही उपलब्ध आहेत. GPT‑6.1 Sol Ultrafast सह विकासकांना Astra च्या जवळपासची बुद्धिमत्ता 8 पटपर्यंत वेगाने मिळते, तेही पूर्वी GPT‑6 Astra साठी येणाऱ्या एपीआय खर्चाच्या जवळपास त्याच खर्चात.
लेखक
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

