GPT‑5.6: ബുദ്ധിശക്തിയുടെയും കാര്യക്ഷമതയുടെയും സമന്വയം
ആളുകൾ ഞങ്ങളുടെ മോഡലുകൾ ഉപയോഗിക്കുന്ന വിവിധ ആവശ്യങ്ങൾക്ക് അനുയോജ്യമായ രീതിയിൽ ശേഷിയും ചെലവും പരമാവധി സന്തുലിതമാക്കിയാണ് ഞങ്ങൾ GPT‑5.6 മോഡൽ കുടുംബം രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്. ഞങ്ങളുടെ ഫ്ലാഗ്ഷിപ്പ് മോഡലായ GPT‑5.6 Sol മാക്സ് റീസണിംഗോടെ, Claude Fable 5-നെ അപേക്ഷിച്ച് പകുതിയിൽ താഴെ ചെലവിൽ ആർട്ടിഫിഷ്യൽ അനാലിസിസ് കോഡിംഗ് ഏജന്റ് ഇൻഡക്സിൽ മുന്നിലെത്തുന്നു. Terra പകുതി വിലയിൽ GPT‑5.5‑ന്റെ അത്രയും തന്നെ ബുദ്ധിശക്തി കാഴ്ചവെക്കുന്നു. ഞങ്ങളുടെ ഏറ്റവും വേഗമേറിയതും ലാഭകരവുമായ മോഡലായ Luna-യ്ക്ക്; Sol-ന്റെ വിലയേക്കാൾ 80% കുറവാണ്. ഈ കാര്യക്ഷമത ലഭ്യമാക്കുന്നതിനായി, ഞങ്ങളുടെ ഗവേഷണ, സാങ്കേതിക ടീമുകൾ സിസ്റ്റത്തിന്റെ എല്ലാ പ്രധാന ഘട്ടങ്ങളിലും നിർണായകമായ ഒപ്റ്റിമൈസേഷനുകൾ നടത്തിയിട്ടുണ്ട്. ഞങ്ങളുടെ മോഡലുകൾ, ഇൻഫറൻസ് (ഔട്ട്പുട്ട് നിർമ്മിക്കാൻ മോഡൽ പ്രവർത്തിപ്പിക്കുന്ന രീതി), Codex, ChatGPT Work ഉപയോഗിക്കുന്ന ഏജന്റിക് ഹാർനെസ് എന്നിവയിലുടനീളം ഈ മെച്ചപ്പെടുത്തലുകൾ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്.
കഴിഞ്ഞ നാല് വർഷത്തിനിടെ ഞങ്ങളുടെ മോഡലുകളുടെ ഉപയോഗം 100 കോടി സജീവ ഉപയോക്താക്കളിലേക്കും 20 ലക്ഷത്തിലധികം സ്ഥാപനങ്ങളിലേക്കും വളർന്നപ്പോൾ, ബുദ്ധിശേഷിയുടെ പ്രയോജനങ്ങൾ എല്ലാവരിലേക്കും എത്തിക്കുന്നതിൽ കാര്യക്ഷമത നിർണായകമായിരുന്നു. ആർട്ടിഫിഷ്യൽ ജനറൽ ഇന്റലിജൻസ് മനുഷ്യരാശിക്കാകെ പ്രയോജനപ്പെടുന്നുവെന്ന് ഉറപ്പാക്കുകയാണ് ഞങ്ങളുടെ ദൗത്യം. ചെലവ്-ബുദ്ധിശേഷി വക്രത്തിലെ ഓരോ ഘട്ടത്തിലും മികച്ച പ്രകടനമുള്ള മോഡലുകൾ നൽകാൻ, ഈ വർഷങ്ങളിലുടനീളം സാങ്കേതിക ശേഖരത്തിൽ തുടർച്ചയായി കൂടുതൽ ഒപ്റ്റിമൈസേഷനുകൾ സാധ്യമാക്കാൻ ഞങ്ങൾ പ്രവർത്തിച്ചു. ഓരോ ടോക്കണിലും കൂടുതൽ ജോലി ചെയ്യാൻ പരിശീലിപ്പിച്ച GPT‑5.6‑ലൂടെ, ഇതുവരെയുള്ളതിൽ ഏറ്റവും ഉയർന്ന ടോക്കൺ-അടിസ്ഥാന ബുദ്ധിശേഷി കാര്യക്ഷമത ഞങ്ങൾ കൈവരിച്ചു. പരിശീലനത്തിൽ ജോലിയുടെ വിജയവും കാര്യക്ഷമതയും ഒരുപോലെ ഒപ്റ്റിമൈസ് ചെയ്ത്, ജോലി പൂർത്തിയാക്കാൻ കൂടുതൽ നേരിട്ടുള്ള വഴി സ്വീകരിക്കുന്നവിധം മോഡലിനെ രൂപപ്പെടുത്തുന്നു.
മോഡലുകൾക്കപ്പുറം, സാങ്കേതിക ശേഖരത്തിലെ മറ്റ് രണ്ട് പ്രധാന ഭാഗങ്ങളിലെ പുരോഗതിയിലൂടെ കാര്യക്ഷമതയ്ക്കായി ഞങ്ങൾ രൂപകൽപ്പന ചെയ്തത് ഈ ലേഖനം വിശദീകരിക്കുന്നു: 1) അതേ ഹാർഡ്വെയറിൽനിന്ന് കൂടുതൽ ഔട്ട്പുട്ട് നേടാൻ ലോഡ് ബാലൻസിങ്, ഊഹാധിഷ്ഠിത ഡീകോഡിംഗ്, കാഷിംഗ്, കേർണൽ ഒപ്റ്റിമൈസേഷൻ തുടങ്ങിയ പ്രക്രിയകൾ മെച്ചപ്പെടുത്തുന്ന ഇൻഫറൻസ്; 2) സന്ദർഭപ്പെരുപ്പം, ഉപകരണ ഉപയോഗം, ആവർത്തിക്കുന്ന ജോലി എന്നിവ കൂടുതൽ നന്നായി കൈകാര്യം ചെയ്യുന്ന ഞങ്ങളുടെ ഏജന്റ് അധിഷ്ഠിത ഹാർനെസ്. ഈ നേട്ടങ്ങളിൽ പലതും സ്വയം കൈവരിക്കുന്നതിൽ GPT‑5.6 Sol വഹിച്ച പങ്കും ഞങ്ങൾ പങ്കുവയ്ക്കും. ഒറ്റപ്പെട്ട ഓരോ മെച്ചപ്പെടുത്തലും പരിമിതമായി തോന്നാമെങ്കിലും, അവ ഒന്നിനുമേൽ ഒന്നായി ചേർന്ന് ബുദ്ധിശേഷിയിലും കാര്യക്ഷമതയിലും അത്യാധുനിക നിലവാരം നൽകാൻ ഞങ്ങളെ പ്രാപ്തരാക്കുന്നു.
കംപ്യൂട്ടിങ് ശേഷിയേക്കാൾ വേഗത്തിൽ മോഡലുകളുടെ ആവശ്യം വളരുന്ന, ശേഷി പരിമിതമായ ലോകത്ത് എല്ലാ സിസ്റ്റം രൂപകൽപ്പനകളുടെയും കേന്ദ്രം കാര്യക്ഷമതയാണ്. പരിശീലിപ്പിച്ച മോഡലുകൾ പ്രവർത്തിപ്പിച്ച് മറുപടികൾ സൃഷ്ടിക്കുന്ന ഞങ്ങളുടെ ഇൻഫറൻസ് സാങ്കേതിക ശേഖരത്തിൽ ഇത് പ്രത്യേകിച്ചും ശരിയാണ്. ഉപയോക്താക്കൾ പ്രതീക്ഷിക്കുന്ന ബുദ്ധിശേഷി, പ്രതികരണവേഗം, ലഭ്യത, വിശ്വാസ്യത എന്നിവ നിലനിർത്തിക്കൊണ്ട് അതേ ഹാർഡ്വെയറിൽ കൂടുതൽ ടോക്കണുകൾ നൽകുകയാണ് ഞങ്ങളുടെ പ്രധാന ലക്ഷ്യം.
ഇത് നേടാൻ മുഴുവൻ സിസ്റ്റവും ഒപ്റ്റിമൈസ് ചെയ്യണം. ഒറ്റയ്ക്ക് നോക്കുമ്പോൾ ഒരു മോഡൽ വളരെ കാര്യക്ഷമമായിരിക്കാം. എന്നാൽ അഭ്യർഥനകൾ മോശമായി വിതരണം ചെയ്യുകയോ ഹാർഡ്വെയർ നിഷ്ക്രിയമായിരിക്കുകയോ ഡാറ്റാ നീക്കം കണക്കുകൂട്ടലിന്റെ വേഗം കുറയ്ക്കുകയോ ചെയ്താൽ അത് പ്രവർത്തിപ്പിക്കുന്നത് ചെലവേറിയതാകും. ഓരോ പാളിയിലെയും മെച്ചപ്പെടുത്തലുകൾ ഒന്നിനുമേൽ ഒന്നായി നേട്ടം വർധിപ്പിക്കുന്നു. റൂട്ടിങ് (അഭ്യർഥനകൾ എവിടേക്ക് അയയ്ക്കണം), ഷെഡ്യൂളിങ് (എപ്പോൾ അയയ്ക്കണം), കേർണലുകൾ (GPU-കളിൽ പ്രവർത്തിക്കുന്ന സോഫ്റ്റ്വെയർ), കാഷിംഗ് (സംരക്ഷിച്ച് വീണ്ടും ഉപയോഗിക്കുന്ന ജോലി), മോഡൽ നടപ്പാക്കൽ (GPU കോഡിന്റെ ക്രമം) എന്നിവയിലെ ഒപ്റ്റിമൈസേഷനുകളിൽനിന്നാണ് ഈ നേട്ടങ്ങൾ ലഭിക്കുന്നത്. ഈ ഒപ്റ്റിമൈസേഷനുകളിലെല്ലാം Codex-ലെ GPT‑5.6 Sol നിർണായക പങ്കുവഹിച്ചു.
ലോഡ് ബാലൻസിങ്ങാണ് ആദ്യത്തെ പ്രധാന ഉദാഹരണം. ആഗോളതലത്തിൽ, ഭൂമിശാസ്ത്രപരമായ സ്ഥാനം, ലഭ്യമായ ശേഷി, ആക്സിലറേറ്ററിന്റെ തരം (മോഡൽ പ്രവർത്തിപ്പിക്കുന്ന GPU-ന്റെയോ പ്രത്യേക ചിപ്പിന്റെയോ തരം) തുടങ്ങിയ ഘടകങ്ങളെ അടിസ്ഥാനമാക്കിയാണ് അഭ്യർഥനകൾ റൂട്ട് ചെയ്യുന്നത്. ഒരു ക്ലസ്റ്ററിനുള്ളിൽ, ലോഡ്, സന്ദർഭ ദൈർഘ്യം, കാഷിന്റെ ലഭ്യത, അഭ്യർഥനയുടെ മറ്റ് സവിശേഷതകൾ എന്നിവയെ അടിസ്ഥാനമാക്കി മോഡൽ ഇൻസ്റ്റൻസുകൾക്കിടയിൽ ജോലി വിതരണം ചെയ്യുന്നു. തുടർന്ന് ഓരോ ഇൻസ്റ്റൻസിനുള്ളിലും ആക്സിലറേറ്ററുകൾ, മോഡലിന്റെ ഉപശൃംഖലകൾ, കംപ്യൂട്ടിങ് കോറുകൾ എന്നിവയ്ക്കിടയിൽ ജോലി കാര്യക്ഷമമായി വിഭജിക്കണം. ഉൽപ്പാദന ട്രാഫിക് വിശകലനം ചെയ്യാനും മുമ്പ് ശ്രദ്ധിക്കാതെപോയ അസന്തുലിതാവസ്ഥയുടെ ഉറവിടങ്ങൾ കണ്ടെത്താനും പുതിയ റൂട്ടിങ് തന്ത്രങ്ങൾ പരിശോധിക്കാനും ഈ പ്രായോഗിക നിയമങ്ങൾ തുടർച്ചയായി മെച്ചപ്പെടുത്താനും Codex-ലെ GPT‑5.6 Sol ഞങ്ങളെ സഹായിക്കുന്നു. ലോഡ് ബാലൻസിങ്ങിലെ ഈ മെച്ചപ്പെടുത്തലുകൾ മാത്രം ഞങ്ങളുടെ മോഡലുകൾ നൽകുന്നതിനുള്ള ചെലവ് ഗണ്യമായി കുറച്ചു.
ഇൻപുട്ടുകളെ അടുത്ത ടോക്കൺ പ്രവചനങ്ങളാക്കി മാറ്റുന്ന കണക്കുകൂട്ടലായ മോഡലിന്റെ ഫോർവേഡ് പാസ് ഒപ്റ്റിമൈസ് ചെയ്യാനും ഞങ്ങൾ GPT‑5.6 Sol ഉപയോഗിച്ചു. ഓരോ പ്രവർത്തനവും വേഗത്തിലാണെങ്കിലും, അമിതമായ മെമ്മറി നീക്കം, സമന്വയം, കാര്യക്ഷമമല്ലാത്ത ഡാറ്റാ വിന്യാസം എന്നിവ GPU-കളെ നിഷ്ക്രിയമാക്കാം. ഇത് ഒഴിവാക്കാൻ, മുൻകൂട്ടി കണക്കാക്കാനോ ഒഴിവാക്കാനോ സമാന്തരമായി നടത്താനോ കഴിയുന്ന ജോലികൾ GPT‑5.6 Sol കണ്ടെത്തി. മോഡലിനെ രൂപപ്പെടുത്തുന്ന ഗണിത പ്രവർത്തനങ്ങൾ നിർവഹിക്കുന്ന മുഖ്യ കോഡായ ഞങ്ങളുടെ ഉൽപ്പാദന കേർണലുകൾ GPT‑5.6 Sol, Codex ഉപയോഗിച്ച് സ്വയം മാറ്റിയെഴുതി ഒപ്റ്റിമൈസ് ചെയ്തു. OpenAI പരിപാലിക്കുന്ന രണ്ട് സ്വതന്ത്ര-ഉറവിട GPU പ്രോഗ്രാമിംഗ് ഭാഷകളായ Triton(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു), Gluon(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) എന്നിവയിൽ കേർണലുകൾ എഴുതാനും മെച്ചപ്പെടുത്താനും GPT‑5.6‑നെ കാര്യക്ഷമമായി പരിശീലിപ്പിച്ചതാണ് ഇത് വിജയിച്ചതിന്റെ ഒരു കാരണം. ഈ ശ്രമങ്ങളും GPT‑5.6 Sol കൈവരിച്ച വിപുലമായ കേർണൽ പുരോഗതികളും ചേർന്ന് തുടക്കംമുതൽ അവസാനംവരെയുള്ള സേവനച്ചെലവ് 20% കുറച്ചു. GPT‑5.6 Sol എഴുതിയ കേർണലുകളുടെ കൃത്യത സാധൂകരിക്കാൻ സഹായിക്കുന്ന, സ്വതന്ത്ര-ഉറവിട ഉപകരണമായ FpSan(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) (ഫ്ലോട്ടിങ്-പോയിന്റ് സാനിറ്റൈസർ) പോലുള്ള പരിശോധനാ ഉപകരണങ്ങളിലും ഞങ്ങൾ വൻതോതിൽ നിക്ഷേപിച്ചിട്ടുണ്ട്.
വേഗവും കാര്യക്ഷമതയും മെച്ചപ്പെടുത്താനുള്ള മറ്റൊരു മാർഗമാണ് ഊഹാധിഷ്ഠിത ഡീകോഡിംഗ്. പ്രധാന മോഡലിനൊപ്പം ഒരു ചെറിയ കരട് മോഡൽ (അഥവാ “ഊഹമോഡൽ”) പ്രവർത്തിപ്പിക്കുകയും പ്രധാന മോഡലിന് സമാന്തരമായി പരിശോധിക്കാനായി നിരവധി ടോക്കണുകൾ നിർദേശിക്കുകയും ചെയ്യുന്നതാണ് ഈ രീതി. ആ നിർദേശങ്ങൾ അംഗീകരിക്കുമ്പോൾ, പ്രധാന മോഡലിന്റെ ഒരൊറ്റ പാസിൽനിന്ന് സിസ്റ്റത്തിന് നിരവധി ഔട്ട്പുട്ട് ടോക്കണുകൾ സൃഷ്ടിക്കാനാകും. ഇത് ചെലവേറിയ ക്രമാനുഗത കണക്കുകൂട്ടലിന്റെ അളവ് കുറയ്ക്കുന്നു. വലുപ്പം, ഘടന, സവിശേഷതകൾ എന്നിവയിലെ മാറ്റങ്ങൾ പരിശോധിച്ച്, വാസ്തുവിദ്യയിൽ നൂറുകണക്കിന് പരീക്ഷണങ്ങൾ രൂപകൽപ്പന ചെയ്ത് പ്രവർത്തിപ്പിച്ചുകൊണ്ട് GPT‑5.6 Sol സ്വന്തം കരട് മോഡൽ മെച്ചപ്പെടുത്തി. കൂടാതെ, ഊഹമോഡലിന്റെ പരിശീലന പ്രക്രിയ GPT‑5.6 Sol ആരംഭിക്കുകയും നിരീക്ഷിക്കുകയും ചെയ്തു. ഹാർഡ്വെയർ തകരാറുകളും പരിശീലന അസ്ഥിരതയും ഉൾപ്പെടെയുള്ള പ്രശ്നങ്ങൾ ഉണ്ടായപ്പോൾ അത് സ്വയം ഇടപെട്ടു. തത്ഫലമായുണ്ടായ മെച്ചപ്പെടുത്തലുകൾ ടോക്കൺ സൃഷ്ടിക്കൽ കാര്യക്ഷമത 15%-ത്തിലധികം വർധിപ്പിച്ചു.
കാഷ് ചെയ്യാത്ത ഇൻപുട്ട് ടോക്കണുകൾ പ്രോസസ് ചെയ്യുമ്പോൾ, കണക്കുകൂട്ടൽ ഏറെ ആവശ്യമായ ഒരൊറ്റ പാസിൽ മോഡൽ കീ-വാല്യു (KV) കാഷ് നിർമ്മിക്കുന്നു. ഔട്ട്പുട്ട് സൃഷ്ടിക്കുമ്പോൾ ആ കാഷിൽനിന്ന് ആവർത്തിച്ച് വായിക്കുകയും അത് വികസിപ്പിക്കുകയും ചെയ്യുന്നു. ബാച്ചിങ്, ഷാർഡിങ്, KV കൈകാര്യം ചെയ്യൽ തുടങ്ങിയ സേവനത്തിനുള്ള മികച്ച ക്രമീകരണം ജോലിഭാരത്തെ ശക്തമായി ആശ്രയിക്കുന്നു: പ്രോംപ്റ്റിന്റെയും ഔട്ട്പുട്ടിന്റെയും ദൈർഘ്യം, ബാച്ച് വലുപ്പം, കാഷ് ഹിറ്റ് നിരക്ക്, ക്വറിയുടെ സവിശേഷതകൾ തുടങ്ങിയവയെല്ലാം നിർണായകമാണ്. എന്നാൽ ക്രമീകരണ സാധ്യതകൾ മുമ്പ് ചിട്ടയായി മെച്ചപ്പെടുത്താനാവാത്തവിധം വിപുലമായിരുന്നതിനാൽ, എഞ്ചിനീയർമാർക്ക് പൊതുവായ പ്രായോഗിക നിയമങ്ങളെ ആശ്രയിക്കേണ്ടിവന്നു. Codex-ലെ GPT‑5.6 Sol ഉപയോഗിച്ച് ഉൽപ്പാദന ജോലിഭാരങ്ങൾ വിശകലനം ചെയ്യാനും സാധ്യതയുള്ള ക്രമീകരണങ്ങൾ സൃഷ്ടിച്ച് വിലയിരുത്താനും ഓരോ സാഹചര്യത്തിനും എൻജിനും മോഡലും ക്രമീകരിക്കുന്ന രീതി പരമാവധി ഒപ്റ്റിമൈസ് ചെയ്യാനും ഞങ്ങൾക്ക് കഴിഞ്ഞു. ഇത് ജോലിഭാരത്തിനനുസരിച്ചുള്ള പുതിയ തലത്തിലുള്ള ഒപ്റ്റിമൈസേഷൻ പ്രായോഗികമാക്കുകയും അതേ ഹാർഡ്വെയറിൽനിന്ന് കൂടുതൽ പ്രയോജനകരമായ ഇൻഫറൻസ് ലഭ്യമാക്കുകയും ചെയ്യുന്നു.
ഇൻഫറൻസ് ഒപ്റ്റിമൈസേഷൻ തുടർച്ചയായ ഒരു പ്രതികരണചക്രമാണ്. ഉൽപ്പാദനത്തിലെ പ്രവർത്തനം ഞങ്ങൾ അളക്കുന്നു, ഏറ്റവും വലിയ പോരായ്മകൾ കണ്ടെത്തുന്നു, മാറ്റങ്ങൾ നടപ്പാക്കുന്നു, അവ ഒറ്റപ്പെട്ട മാനദണ്ഡപരിശോധനയെയല്ല മുഴുവൻ സിസ്റ്റത്തെയും മെച്ചപ്പെടുത്തുന്നുവെന്ന് ഉറപ്പാക്കുന്നു. GPT‑5.6 Sol-ഉം Codex-ഉം ആ ചക്രത്തിന്റെ എല്ലാ ഭാഗങ്ങളും വേഗത്തിലാക്കുന്നു. അതുവഴി ഞങ്ങളുടെ സംഘത്തിന് കൂടുതൽ ആശയങ്ങൾ പരീക്ഷിക്കാനും മാറുന്ന ജോലിഭാരങ്ങളോട് വേഗത്തിൽ പ്രതികരിക്കാനും ഉപയോക്താക്കൾക്ക് കുറഞ്ഞ പ്രതികരണസമയം, കൂടുതൽ ശേഷി, കുറഞ്ഞ ചെലവ് എന്നിവ നൽകുന്ന ഇൻഫറൻസ് സാങ്കേതിക ശേഖരം സൃഷ്ടിക്കാനും കഴിയും.
മോഡൽ അഭ്യർഥനകളുടെയും ഉപകരണ വിളികളുടെയും ഒരു പരമ്പരയിലൂടെ ChatGPT Work-ഉം Codex-ഉം സങ്കീർണമായ ജോലികൾ പൂർത്തിയാക്കുന്നു. ഉപയോക്താവിന്റെ അഭ്യർഥന മുതൽ അന്തിമ മറുപടി വരെയുള്ള ഒരൊറ്റ ഘട്ടത്തിൽ, Codex ഉറവിട കോഡ് പരിശോധിക്കുകയും വിന്യാസ ചരിത്രം തിരയുകയും സംഭവ റിപ്പോർട്ടുകൾ വായിക്കുകയും ഫയൽ തിരുത്തുകയും പരിശോധനകൾ പ്രവർത്തിപ്പിക്കുകയും ചെയ്തേക്കാം. ഓരോ ഘട്ടത്തിനും ഓരോ അഭ്യർഥന ആവശ്യമായേക്കാം.
സന്ദർഭം തയ്യാറാക്കൽ, ഡാറ്റ കൈമാറ്റം, ഇൻഫറൻസ് പ്രവർത്തിപ്പിക്കൽ, ഉപകരണങ്ങൾ വിളിക്കൽ, പ്രക്രിയകൾ ആരംഭിക്കൽ എന്നിവയ്ക്കെല്ലാം സമയവും കംപ്യൂട്ടിങ് ശേഷിയും വേണം. ഒരു ജോലിക്ക് 30 മോഡൽ അഭ്യർഥനകൾ വേണമെങ്കിൽ, ഓരോന്നിലുമുള്ള ഒരു അധിക സെക്കൻഡ് വലിയ കാലതാമസമായി മാറും. മൊത്തത്തിലുള്ള പ്രകടനം മെച്ചപ്പെടുത്താൻ മോഡലിന്റെ വേഗം മാത്രം കൂട്ടിയാൽ പോരാ; സിസ്റ്റത്തിലുടനീളമുള്ള ആവർത്തിച്ച ജോലി കുറയ്ക്കണം.
ഉപയോക്താവിന്റെ ഒറ്റ അഭ്യർഥനയിൽ മോഡലിന്റെയും ഉപകരണങ്ങളുടെയും നിരവധി ആവർത്തനങ്ങൾ ഉണ്ടാകാം. ആവർത്തിക്കുന്ന മേഖലയിൽ വരുന്ന ഏത് ചെലവും പലതവണ നൽകേണ്ടിവരാം.
ഞങ്ങളുടെ മോഡലുകളെയും ഉപകരണങ്ങളെയും ഉപയോക്താവിന്റെ പരിസ്ഥിതിയെയും ബന്ധിപ്പിക്കുന്ന റസ്റ്റ് ഓർക്കസ്ട്രേഷൻ പാളിയായ ഏജന്റ് അധിഷ്ഠിത ഹാർനെസ് രൂപകൽപ്പന ചെയ്യുന്നതിൽ ഈ ഗുണിതഫലങ്ങൾ നിർണായകമായിരുന്നു. സന്ദർഭപ്പെരുപ്പം ഒഴിവാക്കൽ, ഉപകരണങ്ങൾ ലോഡ് ചെയ്യൽ, മുൻ ജോലി വീണ്ടും ഉപയോഗിക്കൽ എന്നിവ ഓരോ അഭ്യർഥനയെയും കൂടുതൽ കാര്യക്ഷമമാക്കുന്നത് അടുത്തതായി വിശദീകരിക്കാം.
ഏജന്റുമാർക്ക് കൂടുതൽ ഉപകരണങ്ങൾ, കഴിവുകൾ, പ്ലഗിനുകൾ, സംഭാഷണ ചരിത്രം എന്നിവയിലേക്ക് പ്രവേശനം ലഭിക്കുമ്പോൾ സന്ദർഭ പരിധികൾ എളുപ്പത്തിൽ വികസിക്കാം. ഇത് ചെലവ് കൂട്ടുകയും മോഡലിന്റെ ശ്രദ്ധ തെറ്റിക്കുകയും അനാവശ്യമായ റീസണിങ്ങിന് ഇടയാക്കുകയും ചെയ്യുന്നു. ആവശ്യമുള്ളപ്പോൾ മാത്രം സംയോജനങ്ങളും ഇഷ്ടാനുസൃത എംസിപി ഉപകരണങ്ങളും കഴിവുകളും പ്ലഗിനുകളും ലഭ്യമാക്കുന്ന വൈകിയുള്ള കണ്ടെത്തലിലൂടെ ഹാർനെസിന് ഈ അധികഭാരം കുറയ്ക്കാനാകും. ഓരോ ഉപകരണവും എംസിപി സംയോജനവും അപ്രതീക്ഷിതമായി സന്ദർഭ പരിധി ഉപയോഗിച്ചുതീർക്കുന്നതും ഹാർനെസ് തടയുന്നു. മോഡൽ മറ്റൊരു പരിധി ആവശ്യപ്പെടാത്തപക്ഷം ഉപകരണത്തിന്റെ ഔട്ട്പുട്ട് സ്വതവേ 10,000 ടോക്കണായി പരിമിതപ്പെടുത്തുന്നു.
മുമ്പ് സൂചിപ്പിച്ചതുപോലെ, ഒരു ഏജന്റ് ലൂപ്പിന് ഒരൊറ്റ അഭ്യർഥനയ്ക്കുള്ളിൽ ഒരേ നിർദേശങ്ങളും സംഭാഷണ ചരിത്രവും ഉപകരണ നിർവചനങ്ങളും മുൻ ഫലങ്ങളും GPU-കളിലേക്ക് പലതവണ അയയ്ക്കാനാകും. ആവർത്തിക്കുന്ന ഈ ഇൻപുട്ടുകൾ പ്രോസസ് ചെയ്യുന്നത് ചെലവേറിയതിനാൽ, മുമ്പ് പ്രോസസ് ചെയ്ത പ്രോംപ്റ്റിന്റെ പ്രിഫിക്സുമായി ബന്ധപ്പെട്ട കണക്കുകൂട്ടൽ പ്രോംപ്റ്റ് കാഷിംഗ് വീണ്ടും ഉപയോഗിക്കുന്നു. ആ പ്രിഫിക്സ് നിലനിർത്താൻ, മോഡലിന് ദൃശ്യമാകുന്ന ചരിത്രമെല്ലാം അവസാനം മാത്രം ചേർക്കാവുന്ന രീതിയിലാണ് ഹാർനെസ് കൈകാര്യം ചെയ്യുന്നത്: പുതിയ സന്ദേശങ്ങളും ഉപകരണ ഫലങ്ങളും പരിസ്ഥിതി അപ്ഡേറ്റുകളും പഴയ സന്ദർഭത്തിനിടയിൽ ചേർക്കാതെ അവസാനം കൂട്ടിച്ചേർക്കുന്നു. ഉപകരണങ്ങളും സ്ഥിരമായ ക്രമത്തിലാണ് അവതരിപ്പിക്കുന്നത്. അംഗീകാര നയങ്ങൾ പോലുള്ള റൺടൈം ക്രമീകരണങ്ങൾ ഉപകരണ നിർവചനങ്ങളിൽ ഉൾപ്പെടുത്തുന്നതിനു പകരം പ്രവർത്തനസമയത്ത് പ്രയോഗിക്കുന്നു. Codex-ലെയും ChatGPT Work-ലെയും മൊത്തത്തിലുള്ള ഉയർന്ന പ്രോംപ്റ്റ്-കാഷെ ഹിറ്റ് നിരക്കുകൾക്ക് ഈ രൂപകൽപ്പനാ തീരുമാനം സഹായിക്കുന്നു.
ഇൻക്രിമെന്റൽ കൈമാറ്റം നെറ്റ്വർക്കിലൂടെ അയക്കുന്ന വിവരങ്ങളിൽ മാറ്റം വരുത്തുമ്പോൾ, പ്രോംപ്റ്റ് കാഷിംഗ് മോഡലിന് വീണ്ടും വീണ്ടും കണക്കുകൂട്ടുന്നത് ഒഴിവാക്കാൻ സഹായിക്കുന്നു. വീതികൾ ആശയപരമാണ്; അധിക കംപ്രഷൻ പാളി കാണിച്ചിട്ടില്ല.
GPT‑5.6 ഉപയോഗിച്ച് ഞങ്ങൾ കൈവരിച്ച കാര്യക്ഷമതാ നേട്ടങ്ങൾ ഗവേഷണം, ഇൻഫറൻസ്, ഞങ്ങളുടെ ഏജന്റ് അധിഷ്ഠിത ഹാർനെസ് എന്നിവയുൾപ്പെടെ സാങ്കേതിക ശേഖരത്തിലുടനീളം വർഷങ്ങളായി ഒന്നിനുമേൽ ഒന്നായി നടത്തിയ മെച്ചപ്പെടുത്തലുകളുടെ ഫലമാണ്. ഈ മെച്ചപ്പെടുത്തലുകളിൽ പലതും കൈവരിക്കാൻ GPT‑5.6 വഹിച്ച പങ്ക്, ഒപ്റ്റിമൈസേഷനുകളുടെ വേഗം ഇനിയും കൂടുമെന്ന പ്രതീക്ഷ ഞങ്ങൾക്ക് നൽകുന്നു. ഞങ്ങളുടെ സാങ്കേതിക ശേഖരത്തിലെ അടിസ്ഥാനപരമായ മെച്ചപ്പെടുത്തലുകൾക്കൊപ്പം കേർണൽ ഒപ്റ്റിമൈസേഷൻ പോലുള്ള മേഖലകളിലും കൂടുതൽ ഒപ്റ്റിമൈസേഷനുകൾ തുടരും. പശ്ചാത്തലത്തിൽ തുടർന്നുകൊണ്ടിരിക്കുന്ന ഈ മെച്ചപ്പെടുത്തലുകൾ കൂടുതൽ വ്യാപകമായി ലഭ്യവും ചെലവുകുറഞ്ഞതുമായ ബുദ്ധിശേഷിയായി ഉപയോക്താക്കൾക്കും ഉപഭോക്താക്കൾക്കും നൽകാൻ ഞങ്ങൾ ആഗ്രഹിക്കുന്നു.
ഈ ലേഖനത്തിലേക്കുള്ള സംഭാവനകൾക്ക് സാങ്കേതിക ജീവനക്കാരായ മാത്യു ഫെരാരി, ഫിലിപ്പ് ടിലെ, അഹമ്മദ് ഇബ്രാഹിം, ജോ ഗെർഷൻസൺ, സ്റ്റീവ് കോഫി എന്നിവർക്ക് പ്രത്യേക നന്ദി.


