લોકો જે વિવિધ કાર્યો માટે અમારાં મોડલો વાપરે છે, તેમાં ક્ષમતા અને ખર્ચ વચ્ચે સંતુલન રહે તે રીતે અમે GPT‑5.6 મોડલ પરિવાર ડિઝાઇન કર્યો છે. મહત્તમ રિઝનિંગ સાથે અમારું ફ્લેગશિપ મોડેલ GPT‑5.6 Sol, આર્ટિફિશિયલ એનાલિસિસ કોડિંગ એજન્ટ ઇન્ડેક્સમાં અડધાથી ઓછા ખર્ચે Claude Fable 5 કરતાં વધુ સારું પ્રદર્શન કરે છે. Terra અડધી કિંમતે ઇન્ટેલિજન્સના બેન્ચમાર્કમાં GPT‑5.5 જેટલું સારું પ્રદર્શન કરે છે અને Luna અમારું સૌથી ઝડપી તથા સૌથી સસ્તું મોડલ છે, જેની કિંમત Sol કરતાં 80% ઓછી છે. આ કાર્યક્ષમતા મેળવવા માટે અમારી સંશોધન અને ટેક્નિકલ ટીમોએ ટેક્નોલોજી માળખાના દરેક મુખ્ય સ્તરે નોંધપાત્ર ઑપ્ટિમાઇઝેશન કર્યું છે. આ સુધારાઓ અમારાં મોડલો, અનુમાન (આઉટપુટ બનાવવા અમે મોડલો કેવી રીતે ચલાવીએ છીએ) અને Codex તથા ChatGPT વર્ક બંનેમાં વપરાતી અમારી એજન્ટ આધારિત કાર્યપ્રણાલી સુધી વિસ્તરે છે.
છેલ્લાં ચાર વર્ષમાં અમારાં મોડલોને 1 અબજ સક્રિય વપરાશકર્તાઓ અને 20 લાખથી વધુ વ્યવસાયો સુધી વિસ્તાર્યાં છે. આ દરમિયાન ઇન્ટેલિજન્સના લાભ દરેક સુધી પહોંચાડવા માટે કાર્યક્ષમતા કેન્દ્રસ્થાને રહી છે. અમારું ધ્યેય એ સુનિશ્ચિત કરવાનું છે કે આર્ટિફિશિયલ જનરલ ઇન્ટેલિજન્સ સમગ્ર માનવતાને લાભ આપે. આ વર્ષો દરમિયાન અમે ખર્ચ અને ઇન્ટેલિજન્સના દરેક સ્તરે સર્વોત્તમ પ્રદર્શન કરતા મોડલો આપી શકીએ તે માટે અમારા સમગ્ર ટેક્નોલોજી માળખામાં સતત વધુ ઑપ્ટિમાઇઝેશન મેળવવા કામ કર્યું છે. GPT‑5.6 વડે અમે અત્યાર સુધીની ટોકન દીઠ સર્વોચ્ચ ઇન્ટેલિજન્સ કાર્યક્ષમતા મેળવી છે. તેને દરેક ટોકનથી વધુ કામ કરવા માટે તાલીમ આપવામાં આવી છે. તાલીમ દરમિયાન અમે કાર્યની સફળતા અને કાર્યક્ષમતા બંને માટે ઑપ્ટિમાઇઝ કરીએ છીએ, જેથી મોડલ કાર્ય પૂર્ણ કરવા વધુ સીધો માર્ગ અપનાવે.
આ લેખ અમારાં મોડલોથી આગળ જઈને ટેક્નોલોજી માળખાના અન્ય બે મુખ્ય ભાગોમાં થયેલી પ્રગતિ દ્વારા અમે કાર્યક્ષમતા કેવી રીતે મેળવી તે સમજાવે છે: 1) અનુમાન—સમાન હાર્ડવેરથી વધુ આઉટપુટ મેળવવા લોડ બૅલેન્સિંગ, અનુમાનાત્મક ડિકોડિંગ, કૅશિંગ અને કર્નલ ઑપ્ટિમાઇઝેશન જેવી પ્રક્રિયાઓ સુધારવી; અને 2) અમારી એજન્ટ આધારિત કાર્યપ્રણાલી—સંદર્ભના બિનજરૂરી વિસ્તાર, ટૂલના ઉપયોગ અને પુનરાવર્તિત કામનું વધુ સારું સંચાલન કરવું. આમાંના અનેક લાભ સ્વાયત્ત રીતે પ્રાપ્ત કરવામાં GPT‑5.6 Solની ભૂમિકા વિશે પણ અમે જણાવીશું. કોઈ એક સુધારો મર્યાદિત લાગી શકે, પરંતુ આ લાભો ભેગા થઈને અમને ઇન્ટેલિજન્સ અને કાર્યક્ષમતા બંનેમાં અત્યાધુનિક પરિણામો આપવા સક્ષમ બનાવે છે.
કમ્પ્યુટિંગ ક્ષમતા મર્યાદિત હોય અને મોડલની માંગ ક્ષમતા કરતાં વધુ ઝડપથી વધતી હોય તેવી દુનિયામાં દરેક સિસ્ટમની ડિઝાઇન માટે કાર્યક્ષમતા પાયાનું તત્ત્વ છે. આ ખાસ કરીને અમારા અનુમાન ટેક્નોલોજી માળખા માટે સાચું છે, જે પ્રતિભાવો બનાવવા તાલીમ પામેલા મોડલો ચલાવે છે. વપરાશકર્તાઓ અપેક્ષા રાખે તેવી ઇન્ટેલિજન્સ, વિલંબતા, ઉપલબ્ધતા અને વિશ્વસનીયતા જાળવીને સમાન હાર્ડવેરથી વધુ ટોકનો પ્રદાન કરવા એ અમારું મુખ્ય લક્ષ્ય છે.
આ હાંસલ કરવા માટે સમગ્ર સિસ્ટમને ઑપ્ટિમાઇઝ કરવી જરૂરી છે. કોઈ મોડલ એકલું ખૂબ કાર્યક્ષમ હોઈ શકે છે, છતાં વિનંતીઓનું વિતરણ યોગ્ય ન હોય, હાર્ડવેર નિષ્ક્રિય રહે કે ડેટાની હેરફેર ગણતરીને ધીમી પાડે તો તેને પ્રદાન કરવું ખર્ચાળ બની શકે છે. દરેક સ્તરના સુધારા ભેગા થઈને મોટો લાભ આપે છે. આ લાભ રૂટિંગ (વિનંતી ક્યાં મોકલાય છે), શેડ્યૂલિંગ (વિનંતી ક્યારે મોકલાય છે), કર્નલ (GPU પર ચાલતું સૉફ્ટવેર), કૅશિંગ (સાચવીને ફરી વપરાતું કામ) અને મોડલ અમલીકરણ (GPU કોડનો ક્રમ) ઑપ્ટિમાઇઝ કરવાથી મળે છે. Codexમાં GPT‑5.6 Solએ આ તમામ ઑપ્ટિમાઇઝેશનમાં મહત્ત્વપૂર્ણ ભૂમિકા ભજવી છે.
પહેલું મહત્ત્વપૂર્ણ ઉદાહરણ લોડ બૅલેન્સિંગ છે. વૈશ્વિક સ્તરે અમે ભૌગોલિક સ્થાન, ઉપલબ્ધ ક્ષમતા અને પ્રવેગકના પ્રકાર (મોડલ ચલાવતા GPU અથવા વિશિષ્ટ ચિપનો પ્રકાર) જેવા પરિબળોના આધારે વિનંતીઓ મોકલીએ છીએ. ક્લસ્ટરની અંદર અમે લોડ, સંદર્ભની લંબાઈ, કૅશની ઉપલબ્ધતા અને વિનંતીના અન્ય ગુણધર્મોના આધારે મોડલ ઇન્સ્ટન્સમાં કામ વહેંચીએ છીએ. ત્યારબાદ દરેક ઇન્સ્ટન્સની અંદર પ્રવેગકો, મોડલનાં પેટા-નેટવર્ક અને કમ્પ્યુટિંગ કોર વચ્ચે કામ કાર્યક્ષમ રીતે વહેંચવું પડે છે. Codexમાં GPT‑5.6 Sol અમને પ્રોડક્શન ટ્રાફિકનું વિશ્લેષણ કરવા, અગાઉ ધ્યાન બહાર રહેલા અસંતુલનના સ્રોત શોધવા, નવી રૂટિંગ વ્યૂહરચનાઓ ચકાસવા અને આ અંદાજી નિયમોને સતત સુધારવામાં મદદ કરે છે. ફક્ત લોડ બૅલેન્સિંગના આ સુધારાઓથી જ અમારાં મોડલો પ્રદાન કરવાનો ખર્ચ ઘણો ઘટ્યો.
અમે મોડલના ફૉર્વર્ડ પાસને ઑપ્ટિમાઇઝ કરવા પણ GPT‑5.6 Solનો ઉપયોગ કર્યો. આ એવી ગણતરી છે જે ઇનપુટને આગામી ટોકનની આગાહીમાં ફેરવે છે. અલગ-અલગ કામગીરી ઝડપી હોય તો પણ મેમરીની વધુ પડતી હેરફેર, સમન્વય અને ડેટાની બિનકાર્યક્ષમ ગોઠવણી GPUને નિષ્ક્રિય રાખી શકે છે. આ ટાળવા માટે GPT‑5.6 Solએ અગાઉથી ગણતરી કરી શકાય, ટાળી શકાય અથવા સમાંતર ચલાવી શકાય તેવું કામ શોધ્યું. Codexની મદદથી GPT‑5.6 Solએ અમારા પ્રોડક્શન કર્નલ સ્વાયત્ત રીતે ફરી લખીને ઑપ્ટિમાઇઝ કર્યા. કર્નલ એ મોડલ બનાવતી ગાણિતિક કામગીરી ચલાવતો મુખ્ય કોડ છે. આ અંશતઃ એટલા માટે શક્ય બન્યું કે અમે GPT‑5.6ને OpenAI દ્વારા જાળવવામાં આવતી બે ઓપન-સોર્સ GPU પ્રોગ્રામિંગ ભાષાઓ Triton(નવી વિન્ડોમાં ખૂલે છે) અને Gluon(નવી વિન્ડોમાં ખૂલે છે)માં કર્નલ લખવા અને સુધારવામાં અસરકારક બનવાની તાલીમ આપી છે. GPT‑5.6 Solના કર્નલ સંબંધિત વ્યાપક સુધારાઓ સાથેના આ પ્રયાસોથી શરૂઆતથી અંત સુધીનો સેવા ખર્ચ 20% ઘટ્યો. GPT‑5.6 Solએ લખેલા કર્નલની શુદ્ધતા ચકાસવામાં મદદ મળે તે માટે અમે ઓપન-સોર્સ ટૂલ FpSan(નવી વિન્ડોમાં ખૂલે છે) (ફ્લોટિંગ-પોઇન્ટ સૅનિટાઇઝર) જેવા ચકાસણી ટૂલમાં પણ ભારે રોકાણ કર્યું છે.
અનુમાનાત્મક ડિકોડિંગ ઝડપ અને કાર્યક્ષમતા સુધારવાનું બીજું સાધન છે. આ ટેકનિકમાં મુખ્ય મોડલની સાથે નાનું ડ્રાફ્ટ (અથવા “અનુમાનક”) મોડલ ચલાવવામાં આવે છે, જે મુખ્ય મોડલને સમાંતર રીતે ચકાસવા માટે અનેક ટોકનો સૂચવે છે. આ સૂચનો સ્વીકારાય ત્યારે સિસ્ટમ મુખ્ય મોડલના એક જ પાસથી અનેક આઉટપુટ ટોકનો બનાવી શકે છે, જેથી ખર્ચાળ ક્રમિક ગણતરીનું પ્રમાણ ઘટે છે. GPT‑5.6 Solએ પોતાની રચના પર સેંકડો પ્રયોગો ડિઝાઇન કરીને અને ચલાવીને તથા કદ, માળખું અને સુવિધાઓમાં ફેરફાર ચકાસીને પોતાના ડ્રાફ્ટ મોડલને સુધાર્યું. વધુમાં, GPT‑5.6 Solએ અનુમાનકની તાલીમ પ્રક્રિયા શરૂ કરીને તેનું નિરીક્ષણ કર્યું અને હાર્ડવેરની નિષ્ફળતા તથા તાલીમની અસ્થિરતા જેવી સમસ્યાઓ ઊભી થાય ત્યારે સ્વાયત્ત રીતે હસ્તક્ષેપ કર્યો. આનાથી થયેલા સુધારાઓએ ટોકન બનાવવાની કાર્યક્ષમતા 15%થી વધુ વધારી.
કૅશ ન કરેલા ઇનપુટ ટોકનોની પ્રક્રિયા કરતી વખતે મોડલ એક ભારે કમ્પ્યુટિંગ પાસમાં કી-વેલ્યૂ (KV) કૅશ બનાવે છે. આઉટપુટ બનાવતી વખતે તે વારંવાર એ કૅશ વાંચે છે અને તેનું વિસ્તરણ કરે છે. સેવા માટે બૅચિંગ, શાર્ડિંગ અને KV વ્યવસ્થાપન જેવી શ્રેષ્ઠ ગોઠવણી કાર્યભાર પર ઘણી આધારિત હોય છે—પ્રોમ્પ્ટ અને આઉટપુટની લંબાઈ, બૅચનું કદ, કૅશ હિટ દર, ક્વેરીના ગુણધર્મો વગેરે. પરંતુ ગોઠવણીની શક્યતાઓ અગાઉ વ્યવસ્થિત રીતે સુધારવા માટે ઘણી વિશાળ હતી, તેથી એન્જિનિયરોને વ્યાપક અંદાજિત નિયમો પર આધાર રાખવો પડતો હતો. Codexમાં GPT‑5.6 Sol વડે અમે પ્રોડક્શન કાર્યભારનું વિશ્લેષણ કરી શક્યા, સંભવિત ગોઠવણીઓ બનાવીને મૂલ્યાંકન કરી શક્યા અને દરેક પરિસ્થિતિ માટે એન્જિન તથા મોડલની ગોઠવણીને અત્યંત ઑપ્ટિમાઇઝ કરી શક્યા. આનાથી કાર્યભારને અનુરૂપ નવા સ્તરનું ઑપ્ટિમાઇઝેશન વ્યવહારુ બને છે અને સમાન હાર્ડવેરથી વધુ ઉપયોગી અનુમાન મેળવી શકાય છે.
અનુમાન ઑપ્ટિમાઇઝેશન સતત ચાલતું પ્રતિસાદ ચક્ર છે. અમે પ્રોડક્શનનું વર્તન માપીએ છીએ, સૌથી મોટી ખામીઓ શોધીએ છીએ, ફેરફારો અમલમાં મૂકીએ છીએ અને ચકાસીએ છીએ કે તેઓ માત્ર કોઈ અલગ બેન્ચમાર્કને નહીં, પરંતુ સમગ્ર સિસ્ટમને સુધારે છે. GPT‑5.6 Sol અને Codex આ ચક્રના દરેક ભાગને વેગ આપે છે. આથી અમારી ટીમ વધુ વિચારો અજમાવી શકે છે, બદલાતા કાર્યભારને વધુ ઝડપથી પ્રતિસાદ આપી શકે છે અને વપરાશકર્તાઓ માટે ઓછા વિલંબ, વધુ ક્ષમતા અને ઓછા ખર્ચવાળું અનુમાન ટેક્નોલોજી માળખું બનાવી શકે છે.
ChatGPT વર્ક અને Codex મોડલ વિનંતીઓ તથા ટૂલ કૉલની શ્રેણી દ્વારા જટિલ કાર્યો પૂર્ણ કરે છે. વપરાશકર્તાની વિનંતીથી અંતિમ પ્રતિભાવ સુધીના એક જ સંવાદી વારામાં Codex સ્રોત કોડ તપાસી શકે છે, ડિપ્લોયમેન્ટનો ઇતિહાસ શોધી શકે છે, ઘટનાના અહેવાલો વાંચી શકે છે, ફાઇલમાં ફેરફાર કરી શકે છે અને પરીક્ષણો ચલાવી શકે છે. દરેક પગલા માટે એક વિનંતીની જરૂર પડી શકે છે.
સંદર્ભ તૈયાર કરવો, ડેટા મોકલવો, અનુમાન ચલાવવું, ટૂલ્સ કૉલ કરવા અને પ્રક્રિયાઓ શરૂ કરવી—આ બધામાં સમય અને કમ્પ્યુટિંગ શક્તિ લાગે છે. જો કોઈ કાર્ય માટે 30 મોડલ વિનંતીઓ જરૂરી હોય, તો દરેક વિનંતી દીઠ વધારાની એક સેકન્ડનો સમય નોંધપાત્ર બની જાય છે. એકંદર કામગીરી સુધારવા માટે માત્ર મોડલને ઝડપી બનાવવું પૂરતું નથી; સમગ્ર સિસ્ટમમાં પુનરાવર્તિત કામ ઘટાડવું પડે છે.
વપરાશકર્તાનો એક સંવાદી વારો મોડલ અને ટૂલની અનેક પુનરાવર્તિત પ્રક્રિયાઓ સમાવી શકે છે. પુનરાવર્તિત ભાગની અંદરનો કોઈ પણ ખર્ચ ઘણી વાર ચૂકવવો પડી શકે છે.
આ બહુગુણક અસરોને ધ્યાનમાં રાખીને અમે અમારી એજન્ટ આધારિત કાર્યપ્રણાલી ડિઝાઇન કરી છે. તે Rustમાં બનેલું ઑર્કેસ્ટ્રેશન સ્તર છે, જે અમારા મોડલો, ટૂલ્સ અને વપરાશકર્તાના પર્યાવરણને જોડે છે. હવે આપણે જોઈશું કે સંદર્ભને બિનજરૂરી રીતે વધતો અટકાવવાથી, ટૂલ્સ લોડ કરવાથી અને કામનો ફરી ઉપયોગ કરવાથી દરેક વિનંતી વધુ કાર્યક્ષમ કેવી રીતે બને છે.
એજન્ટોને વધુ ટૂલ્સ, કુશળતાઓ, પ્લગઇન્સ અને વાર્તાલાપના ઇતિહાસની ઍક્સેસ મળતાં સંદર્ભ વિન્ડો સહેલાઈથી વિસ્તરી શકે છે. તેનાથી ખર્ચ વધે છે, મોડલનું ધ્યાન ભટકે છે અને બિનજરૂરી રિઝનિંગ થાય છે. કાર્યપ્રણાલી વિલંબિત શોધ દ્વારા આ વધારાનો ભાર ઘટાડી શકે છે, જેથી એકીકરણો, કસ્ટમ MCP ટૂલ્સ, કુશળતાઓ અને પ્લગઇન જરૂર પડે ત્યારે જ ઉપલબ્ધ થાય છે. કાર્યપ્રણાલી કોઈ એક ટૂલ્સ કે MCP એકીકરણને અણધારી રીતે સંદર્ભ વિન્ડો વાપરી નાખતાં પણ અટકાવે છે. મોડલ અલગ મર્યાદાની વિનંતી ન કરે ત્યાં સુધી ટૂલનું આઉટપુટ મૂળભૂત રીતે વધુમાં વધુ 10,000 ટોકનો સુધી મર્યાદિત રહે છે.
અગાઉ જણાવ્યા મુજબ, એજન્ટ લૂપ એક જ સંવાદી વારા દરમિયાન સમાન સૂચનાઓ, વાર્તાલાપનો ઇતિહાસ, ટૂલની વ્યાખ્યાઓ અને અગાઉનાં પરિણામો GPUને ઘણી વાર મોકલી શકે છે. આ પુનરાવર્તિત ઇનપુટની પ્રક્રિયા ખર્ચાળ છે, તેથી પ્રોમ્પ્ટ કૅશિંગ અગાઉ પ્રક્રિયા કરાયેલા પ્રોમ્પ્ટ પ્રીફિક્સ સાથે સંકળાયેલી ગણતરીનો ફરી ઉપયોગ કરે છે. તે પ્રીફિક્સ જાળવવા માટે કાર્યપ્રણાલી મોડલને દેખાતા સમગ્ર ઇતિહાસને માત્ર અંતે ઉમેરવા યોગ્ય રાખે છે: નવા સંદેશા, ટૂલનાં પરિણામો અને પર્યાવરણનાં અપડેટ અગાઉના સંદર્ભમાં દાખલ કરવાને બદલે અંતે ઉમેરવામાં આવે છે. ટૂલ્સને પણ નિર્ધારિત ક્રમમાં રજૂ કરવામાં આવે છે, જ્યારે મંજૂરી નીતિઓ જેવી રનટાઇમ સેટિંગ્સને ટૂલની વ્યાખ્યાઓમાં સમાવવાને બદલે અમલ દરમિયાન લાગુ કરવામાં આવે છે. આ ડિઝાઇન પસંદગી Codex અને ChatGPT વર્કના પ્રોમ્પ્ટ કૅશનો એકંદર હિટ દર ઊંચો રાખવામાં ફાળો આપે છે.
ક્રમિક પરિવહન નેટવર્ક પરથી શું પસાર થાય છે તે બદલે છે, જ્યારે પ્રોમ્પ્ટ કૅશિંગ મોડલને કઈ ગણતરી ફરી કરવાનું ટાળવા દે છે તે બદલે છે. પહોળાઈઓ માત્ર સમજાવવા માટે છે અને વધારાનું સંકોચન સ્તર દર્શાવ્યું નથી.
GPT‑5.6થી અમે આપેલો કાર્યક્ષમતાનો લાભ સંશોધન, અનુમાન અને અમારી એજન્ટ આધારિત કાર્યપ્રણાલી સહિત સમગ્ર ટેક્નોલોજી માળખામાં વર્ષોથી થયેલા સંચિત સુધારાનું પરિણામ છે. આમાંના ઘણા સુધારા લાવવામાં GPT‑5.6ની ભૂમિકાને કારણે અમને ઑપ્ટિમાઇઝેશનની ગતિ કેવી રીતે વધશે તે અંગે વિશ્વાસ છે. અમારા ટેક્નોલોજી માળખામાં પાયાના સુધારા કરવાની સાથે અમે કર્નલ ઑપ્ટિમાઇઝેશન જેવા ક્ષેત્રોમાં પણ વધુ ઑપ્ટિમાઇઝેશન કરતા રહીશું. આંતરિક સ્તરે સતત થતા આ સુધારાઓને વધુ વ્યાપક રીતે ઉપલબ્ધ અને ખર્ચ-કાર્યક્ષમ ઇન્ટેલિજન્સના રૂપમાં અમારા વપરાશકર્તાઓ અને ગ્રાહકો સુધી પહોંચાડવા માટે અમે ઉત્સુક છીએ.
આ લેખમાં યોગદાન આપવા બદલ ટેક્નિકલ સ્ટાફના સભ્યો મેથ્યુ ફેરારી, ફિલિપ ટિલેટ, અહમદ ઇબ્રાહિમ, જો ગર્શેન્સન અને સ્ટીવ કોફીનો વિશેષ આભાર.


