मुख्य मजकूराकडे जा
OpenAI

GPT-6.1Sol

सातत्यपूर्ण अत्याधुनिक कामगिरीसाठी पाचपट कमी किमतीत Astra च्या जवळपासची बुद्धिमत्ता

आम्ही सादर करत आहोत GPT‑6.1 Sol, ही GPT‑6 Sol ची सुधारित आवृत्ती एजंटीक कोडिंगसोबतच संगणक वापर आणि व्यावसायिक कामातही उत्कृष्ट कामगिरी करते. कठीण कामांमध्ये ते Sol ला GPT‑6 Astra च्या जवळ नेते, तेही Astra च्या प्रमाणित इनपुट आणि आउटपुट टोकन दरांच्या एक-पंचमांश दरात. त्यामुळे विकासकांना त्याच अर्थसंकल्पात सक्षम एजंट तयार करण्यासाठी आणि चालवण्यासाठी अधिक वाव मिळतो.

GPT‑6.1 Sol हे Sol च्या किमतीत Astra च्या जवळपासची कामगिरी देते. त्यामुळे या कामगिरीच्या पातळीवर आज उपलब्ध असलेले ते सर्वाधिक किफायतशीर मॉडेल आहे. कॅश केलेल्या इनपुटचा खर्च प्रति दहा लाख टोकन फक्त $0.10 आहे—प्रमाणित इनपुट दरांवर 95% सवलत. त्यामुळे वारंवार येणाऱ्या विनंत्यांमध्ये संदर्भ पुन्हा वापरावा लागणाऱ्या एजंट-आधारित कामांसाठी ते अधिक परवडणारे ठरते.

एकूण क्षमतेच्या दृष्टीने GPT‑6 Astra हेच आमचे सर्वात सक्षम अत्याधुनिक मॉडेल आहे. वारंवार महत्त्वाची कामे करू इच्छिणाऱ्या वापरकर्त्यांना आणि मोठ्या प्रमाणावर अनुप्रयोग तयार करून चालवणाऱ्या एपीआय ग्राहकांना GPT‑6.1 Sol क्षमता व खर्च यांचा नवा समतोल देते.

तीन मॉडेलची माहितीपत्रके: GPT-6 Astra, सर्वोत्तम परिणामांसाठी आमचे सर्वाधिक बुद्धिमान मॉडेल, इनपुट $10, आउटपुट $50 आणि कॅश केलेले इनपुट $1; GPT-6.1 Sol, पाचपट कमी किमतीत Astra च्या जवळपासची बुद्धिमत्ता, इनपुट $2, आउटपुट $10 आणि कॅश केलेले इनपुट $0.10; GPT-6 Luna, मोठ्या प्रमाणावरील दैनंदिन कामासाठी वेगवान आणि कार्यक्षम, इनपुट $0.10, आउटपुट $0.50 आणि कॅश केलेले इनपुट $0.01.

विविध कामांमध्ये अधिक सक्षम Sol

संहिता लिहिणे व त्यातील त्रुटी दूर करणे, दस्तऐवज समजून घेणे आणि अनेक टप्प्यांच्या व्यावसायिक कार्यप्रक्रिया पार पाडणे अशा गुंतागुंतीच्या व्यावसायिक कामांमध्ये GPT‑6.1 Sol हे GPT‑6 Sol पेक्षा लक्षणीय सुधारणा घडवते. यांपैकी अनेक मूल्यमापनांमध्ये ते लक्षणीयरीत्या कमी खर्चात GPT‑6 Astra च्या कामगिरीच्या जवळ पोहोचते.

कोडिंग

प्रत्यक्ष संहितासंचांमधील गुंतागुंतीच्या सॉफ्टवेअर अभियांत्रिकी कामांचे मूल्यमापन करणाऱ्या DeepSWE v1.1 मध्ये GPT‑6.1 Sol हे साधारण एक-पंचमांश खर्चात GPT‑6 Astra ची बरोबरी करते. त्याचवेळी कमी रीझनिंग प्रयत्न आणि खर्चात ते GPT‑6 Sol च्या सर्वोत्तम गुणांपेक्षा 6.4 टक्के गुण अधिक मिळवते.

DeepSWE 1.1⁠⁠(नवीन विंडोमध्ये उघडेल) या चाचणीत, कृत्रिम बुद्धिमत्तेवर आधारित एजंट सॉफ्टवेअर अभियांत्रिकीतील नव्याने तयार केलेली, दीर्घकाळ काम करावे लागणारी कार्ये पूर्ण करतात.

व्यावसायिक काम

तक्ते, आलेख, आकृत्या आणि बारीक अक्षरांतील तपशील असलेले गुंतागुंतीचे पीडीएफ दस्तऐवज वापरून मॉडेल व्यावसायिक प्रश्नांची किती अचूक उत्तरे देतात, हे GDP.pdf मोजते. यात तपासलेल्या रीझनिंग पातळ्यांवर GPT‑6.1 Sol हे पर्यायी मॉडेलची मदत घेणाऱ्या Opus 5.5 पेक्षा अधिक गुण मिळवते, तेही प्रति काम निम्म्याहून कमी खर्चात. ते प्रति काम साधारण एक-पंचमांश खर्चात GPT‑6 Astra च्या सर्वोत्तम कामगिरीच्या जवळही पोहोचते.

GDP.pdf⁠(नवीन विंडोमध्ये उघडेल) या चाचणीत, मॉडेल्सना वित्त, आरोग्यसेवा, कायदा आणि इतर सात व्यावसायिक क्षेत्रांतील कार्यप्रक्रियांमधून घेतलेल्या गुंतागुंतीच्या पीडीएफ दस्तऐवजांविषयी प्रत्यक्ष कामात विचारल्या जाणाऱ्या प्रश्नांची उत्तरे द्यावी लागतात.

एजंट अनेक टप्प्यांच्या व्यावसायिक कार्यप्रक्रिया योग्यरीत्या पूर्ण करतात का हे मोजणाऱ्या AutomationBench मध्ये, मध्यम रीझनिंग प्रयत्नांच्या पातळीवर GPT‑6.1 Sol हे Opus 5.5 पेक्षा 2.2 टक्के गुण अधिक मिळवते, तेही साधारण एक-तृतीयांश खर्चात. हे गुण त्याच पातळीवरील GPT‑6 Sol च्या गुणांपेक्षाही 4.8 टक्के गुण अधिक आहेत.

In AutomationBench 1.0.6⁠⁠(नवीन विंडोमध्ये उघडेल), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

संगणक वापर

संगणक अनुप्रयोगांशी संवाद साधावा लागणाऱ्या कामांमध्येही GPT‑6.1 Sol लक्षणीय प्रगती करते. संगणक वापराच्या कठीण कार्यप्रक्रियांवर एजंटचे मूल्यमापन करणाऱ्या OSWorld 2.0 च्या ऑफलाइन संचात, कमाल रीझनिंग प्रयत्नांच्या पातळीवर GPT‑6.1 Sol हे GPT‑6 Sol पेक्षा सात टक्के गुण अधिक मिळवते, तेही निम्म्याहून कमी खर्चात. कमाल रीझनिंग प्रयत्नांच्या पातळीवर त्याचे गुण Astra पेक्षा केवळ 2.1 टक्के गुणांनी कमी आहेत, तर प्रति काम खर्च साधारण एक-सप्तमांश आहे.

In OSWorld 2.0⁠⁠(नवीन विंडोमध्ये उघडेल), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

वैज्ञानिक संशोधन

डेटा विश्लेषण, अनुकरण आणि प्रमेय सिद्ध करणे अशा वैज्ञानिक कार्यप्रक्रियांचे मूल्यमापन करणाऱ्या Terminal-Bench Science 0.1 मध्ये GPT‑6.1 Sol हे कमाल रीझनिंग प्रयत्नांच्या पातळीवर GPT‑6 Sol च्या दुपटीहून अधिक गुण मिळवते, तेही प्रति काम निम्म्याहून कमी खर्चात. कमाल प्रयत्नांच्या पातळीवर GPT‑6.1 Sol चा प्रति काम सरासरी खर्च $5.47 आहे, तर Opus 5.5 चा $23.21 आणि Astra चा $23.80 आहे. म्हणजेच या दोन्ही मॉडेलपेक्षा 75% हून कमी खर्चात ते भरीव वैज्ञानिक क्षमता देते.

तपासलेल्या मॉडेलपैकी GPT‑6 Astra अजूनही 68.1% या सर्वोच्च गुणांसह आघाडीवर आहे. सर्वात कठीण वैज्ञानिक संशोधनाच्या कामांसाठी तेच वापरावे.

Terminal-Bench Science 0.1⁠(नवीन विंडोमध्ये उघडेल) या चाचणीत, एजंट कोड आणि टर्मिनल साधनांचा वापर करून वैज्ञानिक संशोधनातील कार्यप्रक्रिया पूर्ण करतात. यात डेटाचे विश्लेषण करणे, सिम्युलेशन चालवणे आणि डेटाशी मॉडेल्स जुळवणे यांचा समावेश होतो.

तथ्यात्मक अचूकता

GPT‑6.1 Sol कठीण सूचनांवरील तथ्यात्मक अचूकताही सुधारते. अतिउच्च रीझनिंग प्रयत्नांच्या पातळीवर त्याचे तथ्यात्मक चुकांचे प्रमाण 4.1% आहे. हे GPT‑6 Sol च्या 4.5% पेक्षा कमी आणि त्याच पातळीवरील Astra च्या 4.0% च्या जवळ आहे, तर प्रति काम खर्च Astra पेक्षा सुमारे 83% कमी आहे.

वापरकर्त्यांनी आधीच्या मॉडेलची चूक निदर्शनास आणून दिलेल्या संभाषणांमधून ओळख पटवणारी माहिती काढून टाकून, किमान एक तथ्यात्मक चूक असलेल्या उत्तरांचे प्रमाण या मूल्यमापनात मोजले जाते. जाणीवपूर्वक निवडलेल्या या कठीण सूचना नेहमीच्या वापराचे प्रतिनिधित्व करत नाहीत.

वापरकर्त्यांनी आधीच्या मॉडेलची तथ्यात्मक चूक निदर्शनास आणून दिलेल्या ChatGPT संभाषणांमधून ओळख पटवणारी माहिती काढून टाकून आम्ही तथ्यात्मक अचूकता तपासतो. चुका घडवून आणणारी ही संभाषणे नेहमीच्या वापराचे प्रतिनिधित्व करत नाहीत; नेहमीच्या वापरात तथ्यात्मक चुका अधिक दुर्मीळ असतात.

GPT‑6.1 Sol सुरक्षितपणे वापरात आणणे

आमच्या अपेक्षांशी सुसंगत वर्तनाच्या मूल्यमापनांमध्ये GPT‑6.1 Sol हे GPT‑6 Sol पेक्षा लक्षणीय सुधारणा दाखवते आणि GPT‑6 Astra च्या जवळ पोहोचते.

GPT‑6.1 Sol स्वतःच्या मर्यादांबाबत अधिक पारदर्शक आहे आणि वापरकर्त्याचा हेतू व सुरक्षिततेच्या मर्यादा पाळण्यात अधिक विश्वासार्ह आहे. कठीण मूल्यमापनांमध्ये बंद पडलेल्या शोध साधनांबाबत पारदर्शक राहणे, स्पष्ट निर्बंध पाळणे आणि एजंट-आधारित कामांत अनधिकृत परिणाम टाळणे या बाबतीत त्याचे अपयशाचे प्रमाण GPT‑6 Sol पेक्षा कमी आहे. GPT‑6 Astra आणि GPT‑6 Sol प्रमाणेच स्वयंचलित सुरक्षा पुनरावलोककाला बगल देण्याचा एकही प्रयत्न आम्हाला आढळला नाही.

खालील मूल्यमापने जाणीवपूर्वक कठीण परिस्थिती तपासतात; ती नेहमीच्या वापरातील अपयशाचे प्रमाण मोजत नाहीत.

किंमत आणि उपलब्धता

GPT‑6.1 Sol आजपासून सर्व Plus, Pro, Business, Enterprise आणि Edu वापरकर्त्यांना ChatGPT वर्क आणि Codex मध्ये उपलब्ध आहे. ही मॉडेल अद्याप चॅटमध्ये उपलब्ध नाहीत. विकासक ते OpenAI एपीआयद्वारे gpt-6.1-sol या नावानेही वापरू शकतात. त्याचे प्रमाणित एपीआय दर प्रति दहा लाख इनपुट टोकन $2, प्रति दहा लाख कॅश केलेले इनपुट टोकन $0.10 आणि प्रति दहा लाख आउटपुट टोकन $10 आहेत.

यासोबतच आम्ही GPT‑6 Astra Ultrafast सादर करत आहोत. हे जगातील सर्वात वेगवान अत्याधुनिक मॉडेल असून GPT‑6 Astra पेक्षा 8 पटपर्यंत वेगवान आहे. तसेच, आम्ही GPT‑6.1 Sol Ultrafast देखील सादर करत आहोत. ही मॉडेल एपीआयमध्ये उपलब्ध आहेत. तसेच, दरमहा $500 किमतीच्या आमच्या नव्या, सर्वाधिक वापरमर्यादा असलेल्या Pro स्तरावरील वापरकर्त्यांना ती ChatGPT वर्क आणि Codex मध्येही उपलब्ध आहेत. GPT‑6.1 Sol Ultrafast सह विकासकांना Astra च्या जवळपासची बुद्धिमत्ता 8 पटपर्यंत वेगाने मिळते, तेही पूर्वी GPT‑6 Astra साठी येणाऱ्या एपीआय खर्चाच्या जवळपास त्याच खर्चात.

लेखक

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.