GPT‑5.6 अत्याधुनिक बुद्धिमत्ता व कार्यक्षमतेचा संगम कसा साधते
लोक आमची मॉडेल ज्या विविध कामांसाठी वापरतात, त्या संपूर्ण श्रेणीत क्षमता आणि खर्च यांचा समतोल साधण्यासाठी आम्ही GPT‑5.6 मॉडेल समूह तयार केला. आमचे फ्लॅगशिप मॉडेल GPT‑5.6 Sol Max रीझनिंगसह Artificial Analysis Coding Agent Index वर Claude Fable 5 पेक्षा निम्म्याहून कमी खर्चात उत्तम कामगिरी करते. Terra बुद्धिमत्ता बेंचमार्कवर GPT‑5.5 इतकीच कामगिरी निम्म्या किमतीत करते, तर Luna हे आमचे सर्वांत वेगवान व परवडणारे मॉडेल असून त्याची किंमत Sol पेक्षा 80% कमी आहे. ही कार्यक्षमता साध्य करण्यासाठी आमच्या संशोधन आणि तांत्रिक संघांनी तंत्ररचनेच्या प्रत्येक प्रमुख स्तरावर लक्षणीय ऑप्टिमायझेशन केले आहे. या सुधारणांमध्ये आमची मॉडेल, इन्फरन्स (आउटपुट तयार करण्यासाठी आम्ही मॉडेल कशी चालवतो) आणि Codex व ChatGPT वर्क या दोन्हींकडून वापरला जाणारा आमचा एजंटिक हार्नेस समाविष्ट आहे.
गेल्या चार वर्षांत आमच्या मॉडेलचा वापर 1 अब्ज सक्रिय वापरकर्ते आणि 20 लाखांहून अधिक व्यवसायांपर्यंत वाढवताना बुद्धिमत्तेचे लाभ सर्वांपर्यंत पोहोचवण्यासाठी कार्यक्षमता केंद्रस्थानी राहिली आहे. आर्टिफिशियल जनरल इंटेलिजन्सचा लाभ संपूर्ण मानवजातीला मिळेल, याची खात्री करणे हे आमचे ध्येय आहे. या वर्षांमध्ये खर्च-बुद्धिमत्ता वक्राच्या प्रत्येक टप्प्यावर सर्वोत्तम कामगिरी करणारी मॉडेल देण्यासाठी आम्ही संपूर्ण तंत्ररचनेत अधिक व्यापक ऑप्टिमायझेशन सातत्याने शक्य करण्याचे काम केले आहे. GPT‑5.6 द्वारे आम्ही आतापर्यंतची सर्वोत्तम प्रति-टोकन बुद्धिमत्ता कार्यक्षमता साध्य केली. त्याला प्रत्येक टोकनमधून अधिक काम साध्य करण्यासाठी प्रशिक्षित केले आहे. प्रशिक्षणात आम्ही कामाचे यश आणि कार्यक्षमता या दोन्हींसाठी ऑप्टिमायझेशन करतो, जेणेकरून मॉडेल एखादे काम पूर्ण करण्यासाठी अधिक थेट मार्ग घेईल.
या लेखात मॉडेलच्या पलीकडे जाऊन तंत्ररचनेच्या आणखी दोन प्रमुख भागांतील प्रगतीद्वारे आम्ही कार्यक्षमता कशी साधली ते सांगितले आहे: 1) त्याच हार्डवेअरमधून अधिक आउटपुट मिळवण्यासाठी भार संतुलन, अनुमानाधारित डीकोडिंग, कॅशिंग आणि कर्नेल ऑप्टिमायझेशन यांसारख्या प्रक्रिया सुधारून केलेले इन्फरन्स ऑप्टिमायझेशन आणि 2) कॉन्टेक्स्टची अनावश्यक वाढ, टूलचा वापर व पुनरावृत्त काम यांचे अधिक चांगले व्यवस्थापन करणारा आमचा एजंटिक हार्नेस. यांपैकी अनेक लाभ स्वायत्तपणे साध्य करण्यात GPT‑5.6 Sol ने बजावलेली भूमिकाही आम्ही सांगू. स्वतंत्रपणे पाहता एखादी सुधारणा मर्यादित वाटू शकते, पण या यशांचा एकत्रित परिणाम आम्हाला बुद्धिमत्ता आणि कार्यक्षमता या दोन्हींच्या अत्याधुनिक स्तरावर पोहोचू देतो.
संगणकीय संसाधने मर्यादित असलेल्या आणि मॉडेलची मागणी क्षमतेपेक्षा वेगाने वाढत असलेल्या जगात, प्रत्येक प्रणालीच्या रचनेत कार्यक्षमता केंद्रस्थानी असते. प्रतिसाद तयार करण्यासाठी प्रशिक्षित मॉडेल चालवणाऱ्या आमच्या इन्फरन्स तंत्ररचनेसाठी हे विशेषतः खरे आहे. वापरकर्त्यांना अपेक्षित असलेली बुद्धिमत्ता, प्रतिसाद विलंब, उपलब्धता आणि विश्वासार्हता कायम ठेवून त्याच हार्डवेअरवर अधिक टोकन पुरवणे हे आमचे मुख्य उद्दिष्ट आहे.
हे साध्य करण्यासाठी संपूर्ण प्रणाली ऑप्टिमाइझ करावी लागते. स्वतंत्रपणे पाहता एखादे मॉडेल अत्यंत कार्यक्षम असू शकते, पण विनंत्यांचे वितरण अयोग्य असल्यास, हार्डवेअर निष्क्रिय राहिल्यास किंवा डेटाच्या हालचालीमुळे गणना मंदावल्यास ते पुरवणे तरीही खर्चिक ठरू शकते. प्रत्येक स्तरावरील सुधारणांचे लाभ एकत्रित होतात. हे लाभ राउटिंग (विनंत्या कुठे पाठवल्या जातात), शेड्युलिंग (त्या कधी पाठवल्या जातात), कर्नेल (GPU वर चालणारे सॉफ्टवेअर), कॅशिंग (सेव्ह करून पुन्हा वापरलेले काम) आणि मॉडेल अंमलबजावणी (GPU कोडचा क्रम) यांच्या ऑप्टिमायझेशनमधून मिळतात. Codex मधील GPT‑5.6 Sol ने या सर्व ऑप्टिमायझेशनमध्ये महत्त्वाची भूमिका बजावली.
पहिले महत्त्वाचे उदाहरण म्हणजे भार संतुलन. जागतिक स्तरावर आम्ही भौगोलिक स्थान, उपलब्ध क्षमता आणि ॲक्सेलरेटरचा प्रकार (मॉडेल चालवणारा GPU किंवा विशेष चिपचा प्रकार) यांसारख्या घटकांच्या आधारे विनंत्या मार्गस्थ करतो. क्लस्टरमध्ये आम्ही भार, कॉन्टेक्स्टची लांबी, कॅशेची उपलब्धता आणि विनंतीचे इतर गुणधर्म यांच्या आधारे मॉडेल इन्स्टन्समध्ये कामाचे वितरण करतो. त्यानंतर प्रत्येक इन्स्टन्समध्ये ॲक्सेलरेटर, मॉडेलची उपनेटवर्क आणि संगणकीय कोअर यांच्यात कामाचे कार्यक्षम विभाजन करावे लागते. Codex मधील GPT‑5.6 Sol आम्हाला उत्पादनातील ट्रॅफिकचे विश्लेषण करणे, पूर्वी दुर्लक्षित राहिलेले असंतुलनाचे स्रोत ओळखणे, नवीन राउटिंग धोरणांची चाचणी घेणे आणि हे अनुभवाधारित नियम सतत सुधारण्यात मदत करते. केवळ या भार संतुलन सुधारणांमुळेच आमची मॉडेल पुरवण्याचा खर्च मोठ्या प्रमाणात कमी झाला.
मॉडेलचा फॉरवर्ड पास, म्हणजे इनपुटचे पुढील टोकनच्या अंदाजात रूपांतर करणारी गणना, ऑप्टिमाइझ करण्यासाठीही आम्ही GPT‑5.6 Sol वापरले. स्वतंत्र क्रिया वेगवान असल्या, तरी मेमरीची अतिरिक्त हालचाल, समक्रमण आणि डेटाची अकार्यक्षम मांडणी यांमुळे GPU निष्क्रिय राहू शकतात. हे टाळण्यासाठी GPT‑5.6 Sol ने आधीच गणना करता येईल, टाळता येईल किंवा समांतर करता येईल असे काम शोधले. Codex वापरून GPT‑5.6 Sol ने आमचे उत्पादन कर्नेल स्वायत्तपणे पुन्हा लिहून ऑप्टिमाइझ केले. मॉडेलमधील गणिती क्रिया करणारा हा मुख्य कोड आहे. हे काही अंशी शक्य झाले कारण OpenAI कडून देखभाल केल्या जाणाऱ्या Triton(नवीन विंडोमध्ये उघडेल) आणि Gluon(नवीन विंडोमध्ये उघडेल) या दोन मुक्त-स्रोत GPU प्रोग्रामिंग भाषांमध्ये कर्नेल प्रभावीपणे लिहिण्यासाठी आणि सुधारण्यासाठी आम्ही GPT‑5.6 ला प्रशिक्षित केले आहे. या प्रयत्नांसह GPT‑5.6 Sol ने केलेल्या व्यापक कर्नेल सुधारणांमुळे सुरुवातीपासून शेवटपर्यंतचा सेवा खर्च 20% कमी झाला. GPT‑5.6 Sol ने लिहिलेल्या कर्नेलची अचूकता तपासण्यासाठी आम्ही मुक्त-स्रोत साधन FpSan(नवीन विंडोमध्ये उघडेल) (फ्लोटिंग-पॉइंट सॅनिटायझर) यांसारख्या पडताळणी साधनांमध्येही मोठी गुंतवणूक केली आहे.
स्पेक्युलेटिव्ह डीकोडिंग हे वेग आणि कार्यक्षमता सुधारण्यासाठी आणखी एक साधन आहे. या तंत्रात, मुख्य मॉडेलसोबत एक लहान मसुदा (किंवा "स्पेक्युलेटर") मॉडेल चालवले जाते, जे मुख्य मॉडेलला समांतरपणे सत्यापित करण्यासाठी अनेक टोकन्स प्रस्तावित करते. जेव्हा ते प्रस्ताव स्वीकारले जातात, तेव्हा प्रणाली एकाच मुख्य-मॉडेल पासमधून अनेक आउटपुट टोकन्स तयार करू शकते, ज्यामुळे खर्चिक अनुक्रमिक गणनेचे प्रमाण कमी होते. GPT‑5.6 Sol ने त्याच्या आर्किटेक्चरवर शेकडो प्रयोग डिझाइन करून आणि चालवून, आकार, रचना आणि वैशिष्ट्यांमधील बदलांची चाचणी करून स्वतःच्या मसुदा मॉडेलमध्ये सुधारणा केली. याव्यतिरिक्त, GPT‑5.6 Sol ने स्पेक्युलेटर प्रशिक्षण प्रक्रिया सुरू केली आणि तिचे निरीक्षण केले, तसेच हार्डवेअरमधील बिघाड आणि प्रशिक्षणातील अस्थिरता यांसारख्या समस्या उद्भवल्यावर स्वायत्तपणे हस्तक्षेप केला. या सुधारणांमुळे टोकन-निर्मितीची कार्यक्षमता 15% पेक्षा जास्त वाढली.
कॅशेमध्ये नसलेल्या इनपुट टोकनवर प्रक्रिया करताना मॉडेल एका संगणकीयदृष्ट्या गहन पासमध्ये की-व्हॅल्यू (KV) कॅशे तयार करते; आउटपुट तयार करताना ते या कॅशेमधून वारंवार वाचते आणि तिचा विस्तार करते. बॅचिंग, शार्डिंग आणि KV व्यवस्थापन यांसारखी सेवा पुरवण्यासाठीची सर्वोत्तम संरचना कामाच्या स्वरूपावर मोठ्या प्रमाणात अवलंबून असते—प्रॉम्प्ट व आउटपुटची लांबी, बॅचचा आकार, कॅशे यशाचे प्रमाण, क्वेरीची वैशिष्ट्ये आणि बरेच काही. मात्र, पूर्वी कॉन्फिगरेशन स्पेस इतका मोठा होता की त्यात पद्धतशीरपणे बदल करणे शक्य नव्हते, ज्यामुळे अभियंत्यांना व्यापक अनुभवांवर अवलंबून राहावे लागत असे. Codex मधील GPT‑5.6 Sol मुळे आम्ही उत्पादनातील कार्यभारांचे विश्लेषण करू शकलो, संभाव्य संरचना तयार करून त्यांचे मूल्यमापन करू शकलो आणि प्रत्येक परिस्थितीसाठी इंजिन व मॉडेलची संरचना अत्यंत सूक्ष्मपणे ऑप्टिमाइझ करू शकलो. यामुळे कार्यभारानुसार ऑप्टिमायझेशनची नवी पातळी व्यवहार्य होते आणि त्याच हार्डवेअरमधून अधिक उपयुक्त इन्फरन्स मिळतो.
इन्फरन्स ऑप्टिमायझेशन हे सातत्याने चालणारे अभिप्राय चक्र आहे. आम्ही उत्पादनातील वर्तन मोजतो, सर्वांत मोठ्या त्रुटी ओळखतो, बदल अंमलात आणतो आणि ते एखाद्या स्वतंत्र बेंचमार्कऐवजी संपूर्ण प्रणाली सुधारतात याची पडताळणी करतो. GPT‑5.6 Sol आणि Codex त्या चक्राच्या प्रत्येक भागाला गती देतात. यामुळे आमचा संघ अधिक कल्पना तपासू शकतो, बदलत्या कार्यभारांना जलद प्रतिसाद देऊ शकतो आणि वापरकर्त्यांसाठी कमी प्रतिसाद विलंब, अधिक क्षमता व कमी खर्च असलेली इन्फरन्स तंत्ररचना तयार करू शकतो.
ChatGPT वर्क आणि Codex मॉडेल विनंत्या व टूल कॉलच्या मालिकेद्वारे गुंतागुंतीची कामे पूर्ण करतात. वापरकर्त्याच्या विनंतीपासून अंतिम प्रतिसादापर्यंतच्या एका संवादात Codex स्रोत कोड तपासू शकतो, डिप्लॉयमेंट इतिहास शोधू शकतो, घटना अहवाल वाचू शकतो, फाइल संपादित करू शकतो आणि चाचण्या चालवू शकतो. प्रत्येक टप्प्यासाठी स्वतंत्र विनंती लागू शकते.
कॉन्टेक्स्ट तयार करणे, डेटा पाठवणे, इन्फरन्स चालवणे, टूल्स कॉल करणे आणि प्रक्रिया सुरू करणे या सर्वांसाठी वेळ व संगणकीय संसाधने लागतात. एखाद्या कामासाठी मॉडेलकडे 30 विनंत्या कराव्या लागल्यास, प्रत्येक विनंतीला लागणारा एक अतिरिक्त सेकंदही एकत्रितपणे मोठा विलंब निर्माण करतो. एकूण कार्यप्रदर्शन सुधारण्यासाठी केवळ मॉडेल अधिक वेगवान करणे पुरेसे नसते; संपूर्ण प्रणालीतील पुनरावृत्त काम कमी करावे लागते.
वापरकर्त्याच्या एका संवादात मॉडेल आणि टूलमधील अनेक पुनरावृत्ती असू शकतात. पुनरावृत्ती होणाऱ्या भागातील कोणताही खर्च अनेकदा करावा लागू शकतो.
या गुणकांचा विचार करून आम्ही आमचा एजंटिक हार्नेस तयार केला. हा आमची मॉडेल, टूल्स आणि वापरकर्त्याचे पर्यावरण जोडणारा Rust ऑर्केस्ट्रेशन स्तर आहे. आता कॉन्टेक्स्टची अनावश्यक वाढ टाळणे, टूल्स लोड करणे आणि काम पुन्हा वापरणे यांमुळे प्रत्येक विनंती अधिक कार्यक्षम कशी होते ते पाहू.
एजंटना अधिक टूल्स, कौशल्ये, प्लगइन आणि संभाषण इतिहास उपलब्ध करून दिल्यास कॉन्टेक्स्ट विंडो सहज मोठी होऊ शकते. यामुळे खर्च वाढतो, मॉडेलचे लक्ष विचलित होते आणि अनावश्यक रीझनिंग घडते. विलंबित शोधाद्वारे हार्नेस हा अतिरिक्त भार कमी करू शकतो. त्यामुळे इंटिग्रेशन, कस्टम MCP टूल्स कौशल्ये आणि प्लगइन गरज असेल तेव्हाच उपलब्ध होतात. स्वतंत्र टूल्स आणि MCP इंटिग्रेशनने अनपेक्षितपणे कॉन्टेक्स्ट विंडो व्यापू नये, याचीही हार्नेस खात्री करतो. मॉडेलने वेगळी मर्यादा मागितली नाही, तर टूल्सचे आउटपुट डीफॉल्टनुसार कमाल 10,000 टोकनपर्यंत मर्यादित असते.
आधी नमूद केल्याप्रमाणे, एजंट लूप एका संवादात त्याच सूचना, संभाषणाचा इतिहास, टूलच्या व्याख्या आणि आधीचे परिणाम GPU कडे अनेकदा पाठवू शकतो. या पुनरावृत्त इनपुटवर प्रक्रिया करणे खर्चिक असते, त्यामुळे प्रॉम्प्ट कॅशिंग आधी प्रक्रिया केलेल्या प्रॉम्प्ट प्रेफिक्सशी संबंधित गणना पुन्हा वापरते. तो प्रेफिक्स सेव्ह करण्यासाठी, हार्नेस मॉडेलला दिसणारा संपूर्ण इतिहास केवळ शेवटी अपेंड करता येईल असा ठेवतो: नवीन संदेश, टूलचे परिणाम आणि पर्यावरणातील अपडेट आधीच्या कॉन्टेक्स्टमध्ये घालण्याऐवजी शेवटी जोडले जातात. टूल्सही निश्चित क्रमाने सादर केली जातात, तर मंजुरी धोरणांसारख्या रनटाइम सेटिंग साधनांच्या व्याख्यांमध्ये समाविष्ट न करता अंमलबजावणीदरम्यान लागू केल्या जातात. या रचनेमुळे Codex आणि ChatGPT वर्कमध्ये प्रॉम्प्ट-कॅश यशस्वी होण्याचे एकूण प्रमाण उच्च राहते.
वाढीव वाहतुकीमुळे नेटवर्कवरून काय पाठवले जाते ते बदलते; प्रॉम्प्ट कॅशिंगमुळे मॉडेलला कोणती गणना पुन्हा करणे टाळता येईल ते बदलते. रुंदी संकल्पनात्मक आहे आणि अतिरिक्त संक्षेपण स्तर दाखवलेला नाही.
GPT‑5.6 द्वारे मिळवलेली कार्यक्षमता ही संशोधन, इन्फरन्स आणि आमचा एजंटिक हार्नेस यांसह संपूर्ण तंत्ररचनेत अनेक वर्षे सातत्याने झालेल्या सुधारणांचा एकत्रित परिणाम आहे. यांपैकी अनेक सुधारणा साध्य करण्यात GPT‑5.6 ने बजावलेल्या भूमिकेमुळे ऑप्टिमायझेशनचा वेग आणखी वाढेल, असा आम्हाला विश्वास आहे. आमच्या तंत्ररचनेतील मूलभूत सुधारणांसोबत कर्नेल ऑप्टिमायझेशनसारख्या क्षेत्रांतही आम्ही अधिक व्यापक ऑप्टिमायझेशन करत राहू. पडद्यामागे सातत्याने सुरू असलेल्या या सुधारणा अधिक व्यापकपणे उपलब्ध आणि किफायतशीर बुद्धिमत्तेच्या रूपात वापरकर्ते व ग्राहकांपर्यंत पोहोचवण्यासाठी आम्ही उत्सुक आहोत.
या लेखातील योगदानाबद्दल तांत्रिक कर्मचारी Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson आणि Steve Coffey यांचे विशेष आभार.


