പ്രധാന ഉള്ളടക്കത്തിലേക്ക് നീങ്ങുക
OpenAI

പ്രതികരണക്ഷമമായ വോയ്സ് AI-ക്കായി ആറുമാസത്തിൽ തത്സമയ സിസ്റ്റം നിർമിച്ചതെങ്ങനെ

സാങ്കേതിക ജീവനക്കാരായ ജസ്റ്റിൻ ഉബെർട്ടിയും സഹാൻ മൽക്കാനിയും എഴുതിയത്.

ലോഡിംഗ്…

വോയ്‌സ് AI-യെ സംബന്ധിച്ചിടത്തോളം, എപ്പോൾ സംസാരിക്കണമെന്ന് അറിയുന്നത് കാഴ്ചയിൽ തോന്നുന്നതിനേക്കാൾ പ്രയാസമുള്ള കാര്യമാണ്. മനുഷ്യർ സംസാരിക്കുമ്പോൾ വളരെ പെട്ടെന്ന് തന്നെ മറ്റൊരാൾക്ക് സംസാരിക്കാനുള്ള അവസരം തടസ്സമില്ലാതെ നൽകുന്നു, എന്നാൽ മുൻപുണ്ടായിരുന്ന വോയ്‌സ് AI സിസ്റ്റങ്ങൾക്ക് ഈ താളം നിലനിർത്താൻ കഴിഞ്ഞിരുന്നില്ല. ടേൺ ഡിറ്റക്ടറുകൾ എന്നറിയപ്പെടുന്ന ചെറിയ മോഡലുകളെ ആശ്രയിച്ചായിരുന്നു അവയുടെ പ്രവർത്തനം. എന്നാൽ ഇവയ്ക്ക് വളരെ ദുഷ്കരമായൊരു ദൗത്യമാണ് ഉണ്ടായിരുന്നത്: പ്രവചനം വേഗത്തിലായാൽ ഉപയോക്താവിന്റെ സംസാരം പാതിയിൽ മുറിഞ്ഞുപോകും; വൈകിയാലോ, മറുപടി ലഭിക്കാൻ വൈകുന്നതായി അനുഭവപ്പെടുകയും ചെയ്യും. ഈ ഡിറ്റക്ടർ ഒരു തീരുമാനമെടുത്തതിന് ശേഷം മാത്രമേ അതിലും വലിയ LLM-ന് പ്രവർത്തിക്കാൻ സാധിച്ചിരുന്നുള്ളൂ.

ഞങ്ങളുടെ മൂന്നാംതലമുറ വോയ്സ് സിസ്റ്റമായ GPT‑Live, ഓഡിയോ പാതയിൽനിന്ന് ഊഴ ഡിറ്റക്ടറെ ഒഴിവാക്കുന്നു. ഇതിന്റെ വോയ്സ് മോഡൽ ഫുൾ-ഡ്യൂപ്ലെക്സാണ്. അതായത് ഒരേസമയം കേൾക്കാനും സംസാരിക്കാനും കഴിയും. ഇത് പ്രത്യേക ഡിറ്റക്ടറിന്റെ ആവശ്യം ഇല്ലാതാക്കി സംഭാഷണം കൂടുതൽ ഉടനടിയുള്ളതും സ്വാഭാവികവുമാക്കുന്നു. കൂടുതൽ ആഴത്തിലുള്ള റീസണിങ്ങോ ടൂൾ ഉപയോഗമോ ആവശ്യമായാൽ സംഭാഷണത്തിന്റെ ഒഴുക്ക് തടസ്സപ്പെടുത്താതെ GPT‑Live‑ന് GPT‑5.5 പോലുള്ള ഞങ്ങളുടെ അത്യാധുനിക മോഡലുകളുടെ സഹായവും തേടാം. ഈ ശേഷികൾ ചേർന്ന് GPT‑Live‑ന് സംഭാഷണ പ്രതികരണവേഗത്തിന്റെയും ബുദ്ധിശേഷിയുടെയും അഭൂതപൂർവമായ സംയോജനം നൽകുന്നു.

ഈ അനുഭവം വലിയ തോതിൽ നൽകാൻ കുറഞ്ഞ ലേറ്റൻസിക്കായി മെച്ചപ്പെടുത്തിയ പുതിയ സിസ്റ്റം വാസ്തുവിദ്യ ആവശ്യമായിരുന്നു. സാധാരണ അഭ്യർഥന-പ്രതികരണ ഇൻഫറൻസിൽനിന്ന് വ്യത്യസ്തമായി, ഞങ്ങളുടെ സിസ്റ്റം വരുന്ന ഓഡിയോ വോയ്സ് മോഡലിലേക്കും പുറത്തുവരുന്ന സംസാരം ഉപയോക്താവിലേക്കും സ്ട്രീം ചെയ്യുന്നു. ചുമതലക്കൈമാറ്റം പ്രത്യേക അസമകാലിക പാതയിലാണ് കൈകാര്യം ചെയ്യുന്നത്. കഴിഞ്ഞ ആറുമാസത്തിനിടെ സംസാരം തുടക്കംമുതൽ അവസാനംവരെ സുഗമമായി ഒഴുകാൻ മോഡൽ ഇൻഫറൻസ്, സന്ദർഭ പരിപാലനം, മീഡിയ കൈമാറ്റം എന്നിവ പുനർരൂപകൽപ്പന ചെയ്തു.

പ്രധാന വോയ്സ് പാതയ്ക്കും ആപ്ലിക്കേഷൻ പ്രവർത്തനയുക്തിക്കും ഇടയിൽ വ്യക്തമായ അതിരും ഈ വാസ്തുവിദ്യ സൃഷ്ടിക്കുന്നു. പ്രതികരണവേഗത്തെ ബാധിക്കാതെ ആപ്ലിക്കേഷന്റെ പെരുമാറ്റം ഇഷ്ടാനുസൃതമാക്കാൻ ഇത് എളുപ്പമാക്കുന്നു. ChatGPT ഡെസ്ക്ടോപ്പ് ആപ്പിൽ കമ്പ്യൂട്ടർ നിയന്ത്രിക്കാനും ഏജന്റുമാരെ ഏകോപിപ്പിക്കാനും പുതുതായി അവതരിപ്പിച്ച ശേഷിയുൾപ്പെടെ ChatGPT വോയ്സിലെ വർധിച്ചുവരുന്ന സവിശേഷതകൾക്ക് ഈ അടിത്തറ കരുത്തേകുന്നു.

മുൻകാല ഊഴാധിഷ്ഠിത സിസ്റ്റങ്ങൾക്ക് ഞങ്ങളുടെ ആവശ്യങ്ങൾ നിറവേറ്റാനാകാതിരുന്നതിന്റെ കാരണവും ഓരോ പാളിയിലും പ്രതികരണവേഗം ഉറപ്പാക്കാൻ പുതിയ സിസ്റ്റം എങ്ങനെ രൂപകൽപ്പന ചെയ്തുവെന്നും ഈ ലേഖനത്തിൽ വിശദീകരിക്കുന്നു. അവസ്ഥാധിഷ്ഠിത ഇൻഫറൻസ്, ചലനാത്മക സന്ദർഭ പരിപാലനം, അസമകാലിക ചുമതലക്കൈമാറ്റം, പ്രോട്ടോക്കോൾതല മെച്ചപ്പെടുത്തൽ എന്നിവ ഒരുമിച്ച് GPT‑Live‑നെ യഥാർഥത്തിൽ തത്സമയമാക്കുന്നത് എങ്ങനെയെന്ന് നോക്കാം.

ഊഴമെടുക്കലിൽനിന്ന് സ്ട്രീമിങ്ങിലേക്ക്

മുൻകാല വോയ്സ് വാസ്തുവിദ്യകൾ ടെക്സ്റ്റ് LLM-കളുടെ ഊഴാധിഷ്ഠിത സ്വഭാവം പിന്തുടർന്നു. എന്നാൽ ഓരോ ഊഴവും ടെക്സ്റ്റിനു പകരം പ്രത്യേക ഓഡിയോ ഭാഗമായാണ് പ്രതിനിധീകരിച്ചത്. ശൃംഖലാബദ്ധ സിസ്റ്റങ്ങളിൽ ശബ്ദം-ടെക്സ്റ്റ് പരിവർത്തനം, LLM, ടെക്സ്റ്റ്-ശബ്ദ പരിവർത്തനം എന്നിവ ഒന്നിനുപിന്നാലെ മറ്റൊന്നായി പ്രവർത്തിച്ചു. ഈ ക്രമം ലേറ്റൻസി കൂട്ടുകയും സ്വരഭാവം, സംസാരവേഗം തുടങ്ങിയ സൂചനകൾ അവഗണിക്കുകയും ചെയ്തു.

സ്പീച്ച്-ടു-സ്പീച്ച് മോഡലുകൾ ഓഡിയോ നേരിട്ട് പ്രോസസ്സ് ചെയ്ത് ഈ സമീപനം മെച്ചപ്പെടുത്തി. സംസാരം സ്വാഭാവികമായി മനസ്സിലാക്കാനും സൃഷ്ടിക്കാനും മോഡലിനെ പരിശീലിപ്പിച്ചതിലൂടെ പകർപ്പിൽ നഷ്ടമാകുന്ന വിശദാംശങ്ങൾ നിലനിർത്താനും വേഗത്തിൽ പ്രതികരിക്കാനും കഴിഞ്ഞു. എന്നാൽ പോലും, ഇൻഫറൻസ് എപ്പോൾ തുടങ്ങണമെന്ന് തീരുമാനിക്കാൻ സിസ്റ്റം ടേൺ ഡിറ്റക്ടറിനെ തന്നെയാണ് ആശ്രയിച്ചിരുന്നത്. ആശയവിനിമയത്തിന്റെ കൂടുതൽ ഭാഗം മോഡൽ കൈകാര്യം ചെയ്തെങ്കിലും അത് ഊഴാധിഷ്ഠിതമായി തുടർന്നു.

GPT‑Live സംഭാഷണത്തിന്റെ നിയന്ത്രണം വോയ്സ് മോഡലിന് നൽകുന്നു. ഓഡിയോ മോഡലിലേക്കും പുറത്തേക്കും ഒഴുകുമ്പോൾ ആഴത്തിലുള്ള റീസണിങ്ങും ടൂൾ ഉപയോഗവും അസമകാലികമായി നടക്കുന്നു. തടസ്സമില്ലാത്ത മീഡിയ ചക്രം നിലനിർത്തുകയാണ് സിസ്റ്റത്തിന്റെ പ്രധാന ദൗത്യം. അത്യാധുനിക മോഡലുകളെ വിളിക്കുന്നതും സംഭാഷണം സ്ഥിരമായി സൂക്ഷിക്കുന്നതും പോലുള്ള മറ്റ് പ്രവർത്തനങ്ങൾ തത്സമയ പാതയ്ക്ക് പുറത്താണ് നടക്കുന്നത്.

GPT-Live-ന്റെ തത്സമയ ഫ്രണ്ട്‌എൻഡ് വോയ്സ് മോഡൽ, ബാക്ക്‌എൻഡ് റീസണിംഗ് മോഡലിലേക്കുള്ള അസമകാലിക ചുമതലക്കൈമാറ്റം, ടൂൾ ഉപയോഗം, ഉപയോക്താവുമായുള്ള ദ്വിദിശാ ഓഡിയോ എന്നിവ കാണിക്കുന്ന രേഖാചിത്രം.

തുടർച്ചയായ ഇൻഫറൻസ് സാധ്യമാക്കൽ

ഈ മീഡിയ ചക്രം തടസ്സമില്ലാതെ നിലനിർത്തുന്നത് എല്ലായ്പ്പോഴും എളുപ്പമല്ല. കൈമാറ്റത്തിലോ പ്രോസസ്സിങ്ങിലോ ഇൻഫറൻസിലോ ഉള്ള ഏത് കാലതാമസവും കേൾക്കാവുന്ന ഇടവേളയോ വൈകല്യമോ ആകാം. മുൻകാലത്തെ ഊഴാധിഷ്ഠിത സിസ്റ്റത്തിന് ഓഡിയോ ഭാഗം എത്തുന്ന സമയത്തിലെ ചെറിയ വ്യതിയാനങ്ങൾ സഹിക്കാമായിരുന്നു. എന്നാൽ തത്സമയ മീഡിയ സിസ്റ്റം ഓരോ ഓഡിയോ ഫ്രെയിമും സമയക്രമം പാലിച്ച് എത്തിക്കണം.

ChatGPT വോയ്സിലും Realtime API-യിലും മുമ്പ് നടത്തിയ പ്രവർത്തനം പ്രധാനപ്പെട്ടൊരു അടിത്തറ നൽകി. കുറഞ്ഞതും കൂടുതൽ പ്രവചനീയവുമായ ലേറ്റൻസിയിൽ ഓഡിയോയും വീഡിയോയും നേരിട്ട് ഞങ്ങളുടെ സിസ്റ്റങ്ങളിലേക്ക് സ്ട്രീം ചെയ്യാനും പുറത്തേക്ക് അയയ്ക്കാനും കഴിയുന്നവിധം വോയ്സ് അടിസ്ഥാനസൗകര്യം ഞങ്ങൾ പുനർനിർമിച്ചിരുന്നു. തുടർച്ചയായ സംഭാഷണത്തിനായി നിർമിച്ച പുതിയ അവസ്ഥാധിഷ്ഠിത ഇൻഫറൻസ് സിസ്റ്റത്തിലൂടെ മോഡൽവരെ മീഡിയ സ്ട്രീം ചെയ്ത് GPT‑Live ആ രൂപകൽപ്പനയെ കൂടുതൽ മുന്നോട്ടുകൊണ്ടുപോയി.

എന്നാൽ സ്ട്രീമിങ് ഇൻഫറൻസ് പരിഹാരത്തിന്റെ ഒരു ഭാഗം മാത്രമായിരുന്നു. പ്രൊഡക്ഷനിൽ ഇത് നന്നായി പ്രവർത്തിക്കാൻ ക്ലയന്റിൽനിന്ന് ഇൻഫറൻസ് ഘടനയിലേക്ക് വിശ്വസനീയമായി ഓഡിയോ എത്തിക്കണമെന്നും അവസ്ഥാധിഷ്ഠിത പ്രവർത്തനത്തിന്റെ വെല്ലുവിളികൾ പരിഹരിക്കണമെന്നും ഉണ്ടായിരുന്നു.

മീഡിയ പ്രവാഹം കൂടുതൽ വേഗതയുള്ളതാക്കുന്നു

മീഡിയ പ്രവാഹത്തെ ആപ്ലിക്കേഷന്റെയും ബിസിനസിന്റെയും പ്രവർത്തനയുക്തിയിൽനിന്ന് പ്രത്യേകം വേർതിരിക്കുക എന്നതായിരുന്നു ഞങ്ങളുടെ ആദ്യ തീരുമാനങ്ങളിലൊന്ന്. ക്ലയന്റിനും വോയ്സ് മോഡലിനുമിടയിൽ സമർപ്പിത അതിവേഗ പാതയിലൂടെയാണ് ഓഡിയോ നീങ്ങുന്നത്. ചുമതലക്കൈമാറ്റം, ടൂൾ ഉപയോഗം, മറ്റ് ആപ്ലിക്കേഷൻ പ്രവർത്തനങ്ങൾ എന്നിവ അസമകാലിക RPC അതിരിന് പിന്നിലാണ് നടക്കുന്നത്. വേഗം കുറഞ്ഞ ടൂൾ കോളോ ബാക്ക്‌എൻഡ് സേവനമോ അതിന്റെ ഫലം വൈകിപ്പിച്ചേക്കാം, എന്നാൽ മീഡിയ പ്രവാഹം തടയാനാകില്ല.

ഇഷ്ടാനുസൃതമാക്കലിന് വ്യക്തമായൊരു അതിരും ഈ വേർതിരിവ് സിസ്റ്റത്തിന് നൽകുന്നു. ഓഡിയോയുടെ പ്രവാഹം നിലനിർത്തുന്ന മീഡിയ ഫ്രണ്ട്‌എൻഡിനെ ബാധിക്കാതെ ആപ്ലിക്കേഷനുകൾക്ക് ടൂളുകളും നയങ്ങളും ബാക്ക്‌എൻഡ് പെരുമാറ്റവും മാറ്റാം. തത്സമയ പാത ചെറുതും പ്രവചനീയവുമായി തുടരുകയും തത്സമയം നടക്കേണ്ട പ്രവർത്തനത്തിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുകയും ചെയ്യുന്നു.

മുൻപുണ്ടായിരുന്ന Python asyncio സംവിധാനം മാറ്റി, മീഡിയ ഫ്രണ്ട്‌എൻഡും ഇൻഫറൻസ് പ്രവർത്തനയുക്തിയും Go-യിൽ എഴുതി. ഇത് ഫ്രെയിം വിതരണത്തിന്റെ സുഗമത ഗണ്യമായി മെച്ചപ്പെടുത്തി. പുതിയ സിസ്റ്റത്തിന്റെ p95 മുൻ സിസ്റ്റത്തിന്റെ p50-ന് തുല്യമായി.

കൈമാറ്റത്തിനുള്ള അടിത്തറ WebRTC നൽകുന്നു. കുറഞ്ഞ ലേറ്റൻസിയുള്ള മീഡിയയ്ക്കായി രൂപകൽപ്പന ചെയ്തതിനാൽ പാക്കറ്റ് നഷ്ടം, ക്ലോക്ക് വ്യതിയാനം, ക്ലയന്റ് കണക്ഷനിലെ മാറ്റങ്ങൾ എന്നിവയ്ക്കിടയിലും ഇതിന് പ്രവർത്തനം തുടരാം. പാക്കറ്റുകൾ വൈകിയെത്തിയാൽ ഇടവേളകൾ ഒഴിവാക്കാൻ WebRTC-ക്ക് ഓഡിയോ സൂക്ഷ്മമായി നീട്ടാനും പിന്നീട് തത്സമയ നിലയിലെത്താൻ പ്ലേബാക്ക് അൽപ്പനേരം വേഗത്തിലാക്കാനും കഴിയും.

സിസ്റ്റത്തിലുടനീളം ബഫറിങ്ങും തടസ്സവും പരമാവധി കുറച്ചുകൊണ്ട് സംഭാഷണത്തിൽ ആളുകൾ പ്രതീക്ഷിക്കുന്ന ഒരു സെക്കൻഡിൽ താഴെയുള്ള പ്രതികരണവേഗം നൽകാനാകും.

അവസ്ഥ നിലനിർത്തിയുള്ള സംഭാഷണം തുടരൽ

അവസ്ഥാധിഷ്ഠിത ഇൻഫറൻസിന് അതിന്റേതായ പ്രവർത്തനപരമായ വിട്ടുവീഴ്ചകളുണ്ട്. ഒരു വോയ്സ് സെഷൻ ഏറെനേരം സജീവമായിരിക്കാം. എന്നാൽ അതിന്റെ സന്ദർഭം തുടർച്ചയായി വളരുകയും ആവശ്യാനുസരണം മോഡൽ ഇൻസ്റ്റൻസുകൾ ആരംഭിക്കുകയും അവസാനിക്കുകയും ചെയ്യും.

ഈ പ്രശ്നങ്ങൾ പരിഹരിക്കാൻ മോഡൽ ഇൻസ്റ്റൻസുകൾക്കിടയിൽ തടസ്സമില്ലാത്ത കൈമാറ്റ സംവിധാനം നിർമിച്ചു. മാറ്റം ആവശ്യമായാൽ നിലവിലുള്ളതിനൊപ്പം പകരം മോഡൽ ഇൻസ്റ്റൻസ് സജ്ജമാക്കി, ഇപ്പോഴത്തെ സെഷൻ സന്ദർഭം മുൻകൂട്ടി നൽകി, രണ്ടിലും സമാന്തരമായി ഇൻഫറൻസ് പ്രവർത്തിപ്പിച്ച്, പുതിയത് പൂർണമായി സജ്ജമാകുമ്പോൾ അതിലേക്ക് മാറാം.

അതേ അടിസ്ഥാന സംവിധാനം ചലനാത്മക സന്ദർഭ കമ്പാക്ഷനെയും പിന്തുണയ്ക്കുന്നു. സംഭാഷണം മുന്നോട്ട് പോകുന്തോറും, അതിൽ ശേഖരിക്കപ്പെടുന്ന വിവരങ്ങൾ മോഡലിന്റെ സന്ദർഭപരിധിയേക്കാൾ കൂടുതലായേക്കാം. കമ്പാക്ഷൻ വഴി സന്ദർഭത്തിന്റെ വലുപ്പം കുറച്ച് പരിധിക്കുള്ളിലാക്കാൻ സാധിക്കുമെങ്കിലും, ഈ പ്രവർത്തനത്തിന് സമയമെടുക്കും. കൂടാതെ, ഇത് മുൻപത്തെ സന്ദർഭത്തിൽ മാറ്റം വരുത്തുന്നതിനാൽ, മുൻപ് പ്രോസസ്സ് ചെയ്ത ടോക്കണുകളുടെ അറ്റൻഷൻ കീകളും മൂല്യങ്ങളും സൂക്ഷിക്കുന്ന മോഡലിന്റെ കീ-വാല്യൂ (KV) കാഷെയെ ഇത് അസാധുവാക്കുന്നു. ആ അവസ്ഥ പുനർനിർമ്മിക്കുന്നതിന് ഒരു പുതിയ പ്രീഫിൽ ആവശ്യമായി വരികയും, അത് കൂടുതൽ കാലതാമസം ഉണ്ടാക്കുകയും ചെയ്യുന്നു.

അതിനു പകരം കമ്പാക്ഷനെ നിയന്ത്രിതമായ മറ്റൊരു മാറ്റമായി കണക്കാക്കുന്നു. ആദ്യ മോഡൽ ഇൻസ്റ്റൻസ് സംഭാഷണം തുടരുമ്പോൾ, സിസ്റ്റം സന്ദർഭം ഒതുക്കുകയും പുതിയ സന്ദർഭത്തോടെ പകരം മോഡൽ ഇൻസ്റ്റൻസ് തയ്യാറാക്കുകയും ചെയ്യുന്നു. ആ ഇൻസ്റ്റൻസ് സജ്ജമായാൽ മീഡിയയ്ക്ക് തടസ്സമുണ്ടാകാതെ അതിലേക്ക് മാറാം. ആവശ്യമുള്ളപ്പോഴെല്ലാം കമ്പാക്ഷൻ നടത്തി ദീർഘകാല കോളുകൾ പിന്തുണയ്ക്കാൻ ഇതിലൂടെ സിസ്റ്റത്തിന് കഴിയും.

ഇൻഫറൻസ് സെർവർ A-യിൽനിന്ന് ഇൻഫറൻസ് സെർവർ B-യിലേക്ക് നീങ്ങുന്ന ഒതുക്കിയ സ്നാപ്പ്ഷോട്ട് കാണിക്കുന്ന രേഖാചിത്രം. കൈമാറ്റത്തിനുമുമ്പ് അത് മുൻകൂട്ടി ലഭ്യമാക്കി നിലവിലെ അവസ്ഥയിലെത്തിക്കുന്നു.

ഭാരമേറിയ പ്രവർത്തനങ്ങൾ തത്സമയ പാതയ്ക്ക് പുറത്തായതിനാൽ കൈമാറ്റത്തിനിടയിലും സംഭാഷണത്തിന്റെ താളം തെറ്റില്ല.

സംഭാഷണം തടയാതെയുള്ള ചുമതലക്കൈമാറ്റം

നിലവിലുള്ള അത്യാധുനിക മോഡലുകളെ പ്രയോജനപ്പെടുത്താനുള്ള GPT‑Live‑ന്റെ കഴിവ് അതിന് വലിയ കരുത്ത് നൽകുന്നു; ഇത് "സംസാരത്തെ" കൂടുതൽ ആഴത്തിലുള്ള "ചിന്തയിൽ" നിന്ന് കാര്യക്ഷമമായി വേർതിരിക്കുന്നു. എന്നാൽ ഈ രണ്ട് മോഡൽ വാസ്തുവിദ്യയെ ഒരൊറ്റ സിസ്റ്റമായി തോന്നിപ്പിക്കാൻ, പരസ്പരം ബന്ധപ്പെട്ട രണ്ട് എഞ്ചിനീയറിംഗ് പ്രശ്നങ്ങൾ പരിഹരിക്കേണ്ടതുണ്ടായിരുന്നു.

ആഴത്തിലുള്ള ജോലിക്കായുള്ള ചുമതല കൈമാറ്റം

GPT-Live വേഗമേറിയതും സ്വാഭാവികവുമായ പ്രതികരണങ്ങൾ നൽകുന്നു, അതേസമയം പശ്ചാത്തലത്തിൽ GPT-5.5 തിരച്ചില്‍ കൈകാര്യം ചെയ്യുന്നു

ട്രാൻസ്ക്രിപ്റ്റ്
GPT-5.5 ഇൻസ്റ്റന്റ് ഉപയോഗിച്ചുള്ള GPT-Live-1 ഇൻസ്റ്റൻ്റ് ഉദാഹരണ സംഭാഷണം

ആദ്യം, നിലവിലുള്ള സംഭാഷണത്തിൽ ഉപയോഗപ്രദമാകുന്ന രീതിയിൽ ഫലങ്ങൾ വളരെ വേഗത്തിൽ തിരികെ ലഭിക്കേണ്ടതുണ്ട്. അതിനാൽ റൂട്ടിംഗ്, പ്രോംപ്റ്റ് പ്രോസസിംഗ് മുതൽ ഇൻഫറൻസും ടൂൾ കോളുകളും വരെയുള്ള മുഴുവൻ ഡെലിഗേഷൻ പാതയിലെയും ലേറ്റൻസി ഞങ്ങൾ പരമാവധി കുറയ്ക്കേണ്ടി വന്നു. അതേസമയം, സിസ്റ്റത്തിലെ മറ്റ് ഭാഗങ്ങൾക്ക് ഇപ്പോഴും ഘടനാപരമായ മെസ്സേജുകൾ ആവശ്യമായതിനാൽ, നടന്നു കൊണ്ടിരിക്കുന്ന സംഭാഷണത്തെ അവയ്ക്ക് മനസ്സിലാകുന്ന രീതിയിൽ പ്രതിനിധീകരിക്കാനും ഞങ്ങൾക്ക് കഴിഞ്ഞു.

ചുമതലക്കൈമാറ്റം സ്വാഭാവികമായി തോന്നുന്നത്ര വേഗത്തിലാക്കൽ

ചുമതല കൈമാറുമ്പോൾ, അത്യാധുനിക മോഡൽ സംഭാഷണത്തിന് പ്രയോജനകരമായത് സൃഷ്ടിക്കുന്നതുവരെയുള്ള സമയം കുറയ്ക്കുകയാണ് ലക്ഷ്യം. അത്യാധുനിക മോഡൽ റീസണിങ് നടത്തുകയോ ടൂളുകൾ ഉപയോഗിക്കുകയോ ചെയ്യുമ്പോൾ വോയ്സ് മോഡലിന് അൽപ്പനേരം സംഭാഷണം മുന്നോട്ടുകൊണ്ടുപോകാം. എന്നാൽ പരിധിയില്ലാത്ത കാലതാമസം മറയ്ക്കാനാകില്ല. അതിനാൽ റൂട്ടിങ്, പ്രോംപ്റ്റ് പ്രോസസ്സിങ്, ഇൻഫറൻസ്, ടൂൾ കോളുകൾ എന്നിവയടങ്ങിയ പൂർണ ചുമതലക്കൈമാറ്റ ചക്രത്തെ പ്രതികരണ സമയപരിധിയുടെ ഭാഗമായി കണക്കാക്കി.

ചുമതലക്കൈമാറ്റം അഭ്യർഥിക്കുന്നതിനുമുമ്പ് അത്യാധുനിക മോഡലും അതിന് ആവശ്യമായ ടൂളുകളും സജ്ജമാക്കുന്നതാണ് ആദ്യ മെച്ചപ്പെടുത്തൽ. ഒരു വോയ്സ് സെഷൻ ആരംഭിക്കുമ്പോൾ ആപ്ലിക്കേഷൻ സെർവർ അത്യാധുനിക മോഡലിനായി ഇൻഫറൻസ് സെഷൻ സൃഷ്ടിക്കുകയും ആദ്യ സംഭാഷണ സന്ദർഭം മുൻകൂട്ടി നൽകുകയും ചെയ്യുന്നു. അങ്ങനെ ആദ്യമായി കൈമാറുന്ന അഭ്യർഥനയ്ക്കുമുമ്പ് പ്രോംപ്റ്റ് പൂർണമായി പ്രോസസ്സ് ചെയ്തിട്ടുണ്ടെന്ന് ഉറപ്പാക്കുന്നു.

തുടർന്ന് വോയ്സ് കൺവേഴ്സേഷൻ നീളുന്നിടത്തോളം ആ ഇൻഫറൻസ് സെഷൻ ലഭ്യമാക്കി നിലനിർത്തുകയും തുടർന്നുള്ള അഭ്യർഥനകൾക്ക് സ്ഥിരമായ സെഷൻ അഫിനിറ്റി ഉപയോഗിക്കുകയും ചെയ്യുന്നു. പ്രോംപ്റ്റ് കാഷിങ്ങിനൊപ്പം ഈ വിദ്യകൾ ലേറ്റൻസി മെച്ചപ്പെടുത്തുന്നു. അതേസമയം വർക്കർ തകരാറിൽനിന്ന് എളുപ്പം മുക്തമാകാനും കഴിയും.

റീസണിങ് ശ്രമം, ഔട്ട്പുട്ട് പരിധികൾ, ടൂൾ സ്കീമകൾ, മോഡലും ടൂളും തമ്മിലുള്ള ആവർത്തിച്ചുള്ള കൈമാറ്റങ്ങൾ എന്നിവയും സംഭാഷണത്തിന് പ്രയോജനകരമായ ഫലം ലഭിക്കുന്ന സമയത്തെ ബാധിക്കുന്നു. വേഗത്തിലുള്ള പ്രതികരണത്തിനായി ഇവ ക്രമീകരിച്ചു. ചുമതലക്കൈമാറ്റ പാതയിൽ ആവശ്യമായ പ്രവർത്തനം പരമാവധി കുറച്ചതിലൂടെ അത്യാധുനിക മോഡലുകളിൽനിന്നുള്ള ഫലങ്ങൾ വോയ്സ് മോഡലിന് വേഗത്തിൽ ഉൾപ്പെടുത്താനായി.

തുടർച്ചയായ സംസാരത്തിൽനിന്ന് വേർതിരിച്ച ഊഴങ്ങൾ കണ്ടെത്തൽ

വോയ്സ് മോഡൽ തുടർച്ചയായ സംസാര സ്ട്രീമുകളിൽ പ്രവർത്തിക്കുന്നെങ്കിലും, ChatGPT‑യുടെ സംഭാഷണ ഉപയോക്തൃസമ്പർക്കമുഖവും വിശകലന, സുരക്ഷാ അടിസ്ഥാനസൗകര്യങ്ങളുടെ ചില ഭാഗങ്ങളും ഉൾപ്പെടെ ചുറ്റുമുള്ള പല സിസ്റ്റങ്ങളും ഇപ്പോഴും ഉപയോക്താവിന്റെയും അസിസ്റ്റന്റിന്റെയും ഊഴങ്ങളായാണ് പ്രവർത്തിക്കുന്നത്. അതിനാൽ പരസ്പരം ഇടകലരുന്നതും ചിലപ്പോൾ അവ്യക്തവുമായ സംഭാഷണത്തെ ആപ്ലിക്കേഷൻ സെർവർ വേർതിരിച്ച സന്ദേശങ്ങളാക്കുന്നു.

ഓഡിയോ എത്തുമ്പോൾ ഭാഗിക പകർപ്പുകളും സമയസൂചനകളും ഉപയോഗിച്ച് ആരാണ് സംസാരിക്കുന്നതെന്ന് സെർവർ അനുമാനിക്കുകയും സന്ദേശങ്ങളുടെ ക്യൂ സൃഷ്ടിക്കുകയും ചെയ്യുന്നു. ഏറ്റവും പുതിയ സന്ദേശം താൽക്കാലികമായി തുടരും. കൂടുതൽ സംസാരം എത്തുമ്പോൾ അതിന്റെ വാചകവും സമയവും സംസാരിക്കുന്നയാളുടെ നിർണയവും മാറാം. സംസാരിക്കുന്നയാളെ വിശ്വസനീയമായി നിർണയിക്കാൻ വേണ്ടത്ര നേരം അയാൾ സംസാരിച്ചുകഴിഞ്ഞാൽ സെർവർ ബന്ധപ്പെട്ട സന്ദേശം അന്തിമമാക്കുന്നു.

ഒരേസമയം പലരും സംസാരിക്കുന്നത് ഇത് കൂടുതൽ സങ്കീർണമാക്കുന്നു. ഉപയോക്താവ് സംസാരിക്കുമ്പോൾ അസിസ്റ്റന്റ് നൽകുന്ന “ഊം” അല്ലെങ്കിൽ “ശരി” പോലുള്ള ഹ്രസ്വ പ്രതികരണം പ്രത്യേക സന്ദേശമാകണമെന്നില്ല. എന്നാൽ അസിസ്റ്റന്റിന്റെ അർഥവത്തായ ഇടപെടൽ പലപ്പോഴും പ്രത്യേക സന്ദേശമാകണം. അതുപോലെ, ഉപയോക്താവ് ഇടയിൽ സംസാരിച്ചാലും പ്രദർശിപ്പിക്കുന്ന അസിസ്റ്റന്റ് പ്രതികരണങ്ങളുടെ യുക്തിബന്ധത്തിന് മുൻഗണന നൽകുന്നു.

ഓരോ വിഭജന നയവും പുതുമയ്ക്കും ഉറപ്പിനുമിടയിൽ വിട്ടുവീഴ്ച ചെയ്യുന്നു. വളരെ നേരത്തേ അന്തിമമാക്കിയാൽ ചരിത്രം ശിഥിലമാകുകയും ക്രമം അസ്ഥിരമാകുകയും ചെയ്യും. ഏറെ കാത്തിരുന്നാൽ പകർപ്പുകളും അവയെ ആശ്രയിക്കുന്ന സവിശേഷതകളും വൈകും. അതിനാൽ സിസ്റ്റം സംഭാഷണത്തിന്റെ പരസ്പരബന്ധമുള്ള രണ്ട് കാഴ്ചകൾ നിലനിർത്തുന്നു: ഇപ്പോഴത്തെ അവസ്ഥയുടെ താൽക്കാലിക കാഴ്ചയും പറഞ്ഞ കാര്യങ്ങളുടെ ആധികാരിക രേഖയും. ആപ്ലിക്കേഷന്റെ ഉപയോക്തൃസമ്പർക്കമുഖത്തിലെ സംഭാഷണ കാഴ്ചയ്ക്ക് പുതുക്കലുകൾ കൈകാര്യം ചെയ്യാനാകുന്നതിനാൽ അത് താൽക്കാലിക കാഴ്ച ഉപയോഗിക്കുന്നു. എന്നാൽ വിശകലന പൈപ്പ്‌ലൈനിൽ രേഖപ്പെടുത്താൻ അന്തിമ പകർപ്പ് ആവശ്യമാണ്.

തത്സമയ വോയ്സ് പാതയിൽ ഊഴക്രമം അടിച്ചേൽപ്പിക്കാതെ, സംഭാഷണത്തിന്റെ സ്ഥിരമായ കാഴ്ച ഇതിലൂടെ ChatGPT‑യുടെ മറ്റു ഭാഗങ്ങൾക്ക് ലഭിക്കുന്നു.

വേഗമേറിയ പ്രോട്ടോക്കോൾ ഉപയോഗിച്ച് സെഷനുകൾ ആരംഭിക്കൽ

ഉപയോക്താവ് ബട്ടൺ അമർത്തുന്ന നിമിഷംതന്നെ പ്രതികരണവേഗം പ്രസക്തമാകുന്നു. GPT‑Live-ൽ സംഭാഷണം ആരംഭിക്കുന്നതിനുമുമ്പ് സിസ്റ്റം മീഡിയ പാത സ്ഥാപിക്കുകയും മോഡലിലേക്ക് ഓഡിയോ നൽകിത്തുടങ്ങുകയും വേണം. അതിനാൽ ആരംഭക്രമത്തിലെ ഓരോ ഭാഗവും നിർണായക പാതയിലാകുന്നു.

മുകളിൽ സൂചിപ്പിച്ചതുപോലെ WebRTC ശക്തമായ തത്സമയ അടിത്തറ നൽകുന്നു. എന്നാൽ സാധാരണ WebRTC സെഷൻ ആരംഭിക്കാൻ പ്രതീക്ഷിച്ചതിലും കൂടുതൽ പ്രോട്ടോക്കോൾ ഹാൻഡ്‌ഷേക്കുകളും നെറ്റ്‌വർക്ക് റൗണ്ട് ട്രിപ്പുകളും ആവശ്യമാണ്. QUIC പോലുള്ള പിൽക്കാല പ്രോട്ടോക്കോളുകളെ രൂപപ്പെടുത്തിയ റൗണ്ട് ട്രിപ്പുകൾ കുറയ്ക്കാനുള്ള ശ്രദ്ധയ്ക്കും മുമ്പുള്ളതാണ് WebRTC. അതിനാൽ അതിന്റെ അടിസ്ഥാന പ്രോട്ടോക്കോളുകൾ ഒരുമിച്ച് ഉപയോഗിക്കുമ്പോൾ ചില പ്രവർത്തനങ്ങൾ ആവർത്തിക്കാറുണ്ട്. ഉദാഹരണത്തിന്, പൂർണ WebRTC ഘടനയിൽ ആവശ്യമില്ലാത്തപ്പോഴും ഓരോ പ്രോട്ടോക്കോളിലും അതിന്റേതായ സേവനനിഷേധ ആക്രമണ പ്രതിരോധ സംവിധാനം ഉണ്ടായിരുന്നു.

ഈ ഘടന വിശകലനം ചെയ്ത് WebRTC സംക്ഷിപ്ത റൗണ്ട്‌ട്രിപ്പ് പ്രോട്ടോക്കോൾ (WARP(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)) വികസിപ്പിച്ചു. ഇത് മീഡിയ, ഡാറ്റ സ്റ്റാർട്ടപ്പുകളെ ആറ് നെറ്റ്‌വർക്ക് റൗണ്ട് ട്രിപ്പുകളിൽ നിന്ന് വെറും ഒന്നായി കുറയ്ക്കുന്നു. മുൻകാല സംവിധാനങ്ങളുമായി പൊരുത്തപ്പെടുന്ന പ്രോട്ടോക്കോൾ മെച്ചപ്പെടുത്തലുകളിലൂടെയാണ് WARP ഇത് സാധ്യമാക്കുന്നത്: ICE-യ്ക്കൊപ്പം DTLS ഹാൻഡ്‌ഷേക്ക് ചേർത്തയയ്ക്കൽ (SPED(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)), വേഗമേറിയ DTLS 1.3(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഹാൻഡ്‌ഷേക്ക് ഉപയോഗിക്കൽ, SCTP ഹാൻഡ്‌ഷേക്ക് മുൻകൂട്ടി ധാരണയിലെത്തിക്കൽ (SNAP(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു)), DCEP(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഉപയോഗിക്കുന്നതിനുപകരം ഡാറ്റാ ചാനലുകൾ മുൻകൂട്ടി ധാരണയിലെത്തിക്കൽ.

വിശാലമായ സാങ്കേതിക പരിസ്ഥിതിക്ക് ഈ പ്രവർത്തനം പ്രയോജനപ്പെടാൻ WebRTC സമൂഹത്തിലെ സഹപ്രവർത്തകരുമായി ചേർന്ന് തുറന്ന സവിശേഷവിവരണങ്ങളുടെ ഒരു കൂട്ടമായാണ് WARP രൂപകൽപ്പന ചെയ്തത്. IETF-യുടെ TSVWG പ്രവർത്തകസംഘത്തിലൂടെ നിർദേശങ്ങൾ മുന്നോട്ടുകൊണ്ടുപോകുന്നു. libwebrtc-ലും Pion-ലും WARP പിന്തുണ ഇതിനകം ചേർത്തിട്ടുണ്ട്. മറ്റ് WebRTC സംവിധാനങ്ങളിലും പ്രവർത്തനം പുരോഗമിക്കുന്നു.

സാധാരണ WebRTC ഹാൻഡ്‌ഷേക്കും WARP സഹിതമുള്ള WebRTC-യും താരതമ്യം ചെയ്യുന്ന ചിത്രം. കുറച്ച് റൗണ്ട് ട്രിപ്പുകളിൽ WARP മീഡിയയും ഡാറ്റയും സജ്ജമാക്കുന്നതായി കാണിക്കുന്നു.

മീഡിയ ഹാൻഡ്‌ഷേക്ക് മെച്ചപ്പെടുത്തിയതിനുശേഷം ഒരു കാലതാമസം മാത്രം വ്യക്തമായി ശേഷിച്ചു: WebRTC ബന്ധിപ്പിക്കുന്നതിനുമുമ്പ് SDP പരാമീറ്ററുകൾ പങ്കിടാനുള്ള സിഗ്നലിങ് കൈമാറ്റം. ആ കൈമാറ്റത്തെ നിർണായക പാതയിൽനിന്ന് ഒഴിവാക്കാൻ ഇൻസ്റ്റൻ്റ് കണക്റ്റ് എന്ന് ഞങ്ങൾ വിളിക്കുന്ന സംവിധാനം വികസിപ്പിച്ചു. സെർവർ ശേഷി മാറ്റിവയ്ക്കാതെയും നിലവിലെ WebRTC സംവിധാനങ്ങളിൽ മാറ്റം വരുത്താതെയും ഇത് ഈ പാരാമീറ്ററുകളിൽ മുൻകൂട്ടി ധാരണയിലെത്തുന്നു.

സാധാരണ സിഗ്നലിങ് പ്രവാഹത്തിനൊപ്പം ഇൻസ്റ്റൻ്റ് കണക്റ്റും പ്രവർത്തിക്കുന്നു. മുൻകൂട്ടി ധാരണയിലെത്തിയ പാരാമീറ്ററുകൾ സാധുവാണെങ്കിൽ ആദ്യ മീഡിയ പാക്കറ്റ് എത്തുമ്പോൾ സെർവറിന് സെഷൻ സൃഷ്ടിക്കാം. അവ പഴയതോ അസാധുവോ ആണെങ്കിൽ സിഗ്നലിങ് പ്രവാഹം ഇതിനകം തുടങ്ങിയിട്ടുണ്ടാകും. അതിനാൽ അധിക ലേറ്റൻസിയില്ലാതെ ക്ലയന്റിന് സാധാരണ രീതിയിലേക്ക് മടങ്ങാം.

ഇൻസ്റ്റൻ്റ് കണക്റ്റും WARP-ഉം ചേർന്ന് ഉപയോക്താവിന്റെ ഉദ്ദേശ്യം മുതൽ തത്സമയ മീഡിയ പ്രവാഹം വരെയുള്ള സമയം ഗണ്യമായി കുറയ്ക്കുന്നു. SDP കൈമാറ്റം നിർണായക പാതയ്ക്ക് പുറത്താകുകയും WARP കൈമാറ്റ ഹാൻഡ്‌ഷേക്ക് ചുരുക്കുകയും ചെയ്തതിനാൽ ഒരൊറ്റ UDP പാക്കറ്റ് ഉപയോഗിച്ച് ക്ലയന്റിന് ഇപ്പോൾ സെഷൻ ആരംഭിക്കാം. സെർവറിന് ഉടൻ പ്രതികരിക്കാനാകുന്നതിനാൽ ഉപയോക്താവിന് യഥാർഥത്തിൽ പ്രസക്തമായ കേൾക്കലും പ്രതികരിക്കലും സിസ്റ്റത്തിന്റെ മറ്റു ഭാഗങ്ങൾക്ക് ആരംഭിക്കാം.

യഥാർഥ ഡാറ്റ ഉപയോഗിച്ച് പ്രൊഡക്ഷനിൽ GPT‑Live സുരക്ഷിതമായി പരിശോധിക്കൽ

കടലാസിൽ വേഗമേറിയതായി തോന്നുന്ന സിസ്റ്റം യഥാർഥ വോയ്സ് ട്രാഫിക്കിൽ മുടങ്ങാം. ഉപയോക്താക്കളുമായി GPT‑Live സംവദിക്കാൻ അനുവദിക്കുന്നതിനുമുമ്പ്, പ്രൊഡക്ഷനിലെ ChatGPT വോയ്സ് സെഷനുകളുടെ ചെറിയൊരു പങ്ക് ക്രമേണ വർധിപ്പിച്ച് നിലവിലെ അഡ്വാൻസ്ഡ് വോയ്സ് മോഡ് അനുഭവത്തിലേക്കും പുതിയ സിസ്റ്റത്തിലേക്കും ഒരേസമയം തിരിച്ചുവിട്ടുള്ള നിശ്ശബ്ദ പരിശോധന നടത്തി. അഡ്വാൻസ്ഡ് വോയ്സ് മോഡ് പതിവുപോലെ ഉപയോക്താക്കളെ സേവിച്ചപ്പോൾ, സമാന്തര പാത വായിക്കാൻ മാത്രം കഴിയുന്ന രീതിയിൽ ഇൻഫറൻസ് പ്രവർത്തിപ്പിച്ചു. ഉപയോക്താക്കൾ കേൾക്കുന്നതിൽ മാറ്റമില്ലാതെ, യഥാർഥ ക്ലയന്റുകൾ, നെറ്റ്‌വർക്കുകൾ, സെഷൻ ദൈർഘ്യങ്ങൾ, ഭൂമിശാസ്ത്രപരമായ വിതരണം എന്നിവയിൽ സിസ്റ്റം പരീക്ഷിക്കാൻ ഇതിലൂടെ കഴിഞ്ഞു.

GPU ത്രൂപുട്ട് മാത്രമായി ശേഷിയെ കണക്കാക്കാനാകില്ലെന്നതായിരുന്നു ആദ്യ പാഠങ്ങളിലൊന്ന്. വോയ്സ് സെഷനുകൾ തുറന്നിരിക്കുകയും ഫ്രെയിമുകൾ തുടർച്ചയായി അയയ്ക്കുകയും ചെയ്യുന്നതിനാൽ, CPU ഭാഗത്തെ സ്ട്രീം ഹാൻഡ്‌ലറുകളും ക്യൂകളും നെറ്റ്‌വർക്ക് പാതകളും ഇൻഫറൻസിനൊപ്പം വിപുലീകരിക്കണം. യഥാർഥ ലോഡിൽ, ഞങ്ങളുടെ ലോഡ് പരിശോധന പ്രവചിച്ചതിലും നേരത്തേ ഒരു സഹായഘടകം പരമാവധി ശേഷിയിലെത്തി. ഇതോടെ ഇൻഫറൻസ് അഭ്യർഥനകൾ കെട്ടിക്കിടക്കുകയും ലേറ്റൻസി കൂടിക്കൊണ്ടിരിക്കുകയും ചെയ്തു. ശേഷിയെക്കുറിച്ചുള്ള ചോദ്യം “ഒരു GPU-ക്ക് എത്ര അഭ്യർഥനകൾ കൈകാര്യം ചെയ്യാനാകും?” എന്നതിൽനിന്ന് “ഓരോ ഫ്രെയിമും സമയക്രമം പാലിക്കുമ്പോൾ സിസ്റ്റത്തിന് ഒരേസമയം എത്ര സെഷനുകൾ നിലനിർത്താനാകും?” എന്നാക്കി.

ഭൂമിശാസ്ത്രത്തിന് പ്രഥമ പരിഗണന നൽകേണ്ടതുണ്ടെന്നും പരിശോധന വ്യക്തമാക്കി. വിദൂര ശേഷിയിലേക്ക് ഒരു സെഷൻ തിരിച്ചുവിടുന്നത് ആരംഭത്തിലും സ്ട്രീമിങ്ങിലും പല ഘട്ടങ്ങളിൽ കാലതാമസം സൃഷ്ടിക്കാം. പ്രാദേശിക ശേഷിയും ട്രാഫിക് നിയന്ത്രണ ക്രമീകരണവും ചേർത്ത് മോഡൽ വിന്യാസങ്ങൾ സാധൂകരിക്കാനും ഉറവിടത്തിന്റെ ഭൂമിശാസ്ത്രമനുസരിച്ച് ലേറ്റൻസി വേർതിരിച്ച് പരിശോധിക്കാനും തുടങ്ങി. ഇൻഫറൻസ് ഉപയോക്താക്കളോട് അടുപ്പിച്ചത് സഹായിച്ചു. എന്നാൽ സമഗ്ര പ്രതികരണവേഗം മോഡൽ സെർവറിനെ മാത്രമല്ല, പാതയിലെ ഓരോ സേവനത്തെയും ആശ്രയിക്കുന്നുവെന്ന വിശാലമായ പാഠവും ഇത് ഉറപ്പിച്ചു.

യാഥാർഥ്യസമാനമായ സെഷൻ ജീവിതചക്രങ്ങളിൽ മാത്രമാണ് മറ്റു ചില തകരാറുകൾ പ്രത്യക്ഷപ്പെട്ടത്. ദീർഘകാല സെഷനുകൾ മെമ്മറിയിലും നിലനിൽക്കുന്ന സംഭരണത്തിലും സമ്മർദമുണ്ടാക്കി. പുനഃകണക്ഷനുകൾ കമ്പാക്ഷനും അവസ്ഥ പുനഃസ്ഥാപിക്കലും പരീക്ഷിച്ചു. സാധാരണ ക്ലയന്റ് വിച്ഛേദങ്ങൾ ഷട്ട്‌ഡൗൺ ഹാൻഡ്‌ഷേക്കിലെ മത്സരാവസ്ഥകൾ വെളിപ്പെടുത്തി. സമയം, സഞ്ചിതാവസ്ഥ, സേവന അതിരുകൾക്കപ്പുറമുള്ള പെരുമാറ്റം എന്നിവയെ ആശ്രയിച്ചിരുന്നതിനാൽ ഹ്രസ്വ ലോഡ് പരിശോധനകളിൽ ഈ പ്രശ്നങ്ങൾ അപൂർവമായിരുന്നു.

ഒടുവിൽ, നിരീക്ഷണക്ഷമതയും വിന്യാസ നിയന്ത്രണങ്ങളും മെച്ചപ്പെടുത്താൻ പ്രൊഡക്ഷൻ പരിശോധന ഞങ്ങളെ നിർബന്ധിച്ചു. വ്യത്യസ്ത ലേറ്റൻസി ഉറവിടങ്ങൾ കൂട്ടിക്കലർത്തിയ മെട്രിക്കുകളും തകരാറിലായ ഒറ്റപ്പെട്ട എൻജിനുകളെ മൊത്തക്കണക്കുകൾ മറച്ച ഡാഷ്ബോർഡുകളും പരിശോധിച്ച സിസ്റ്റങ്ങളും വിന്യസിച്ച സിസ്റ്റങ്ങളും തമ്മിലുള്ള ക്രമീകരണ വ്യതിയാനവും കണ്ടെത്തി. പ്രതികരണമായി കൂടുതൽ സൂക്ഷ്മമായ ടെലിമെട്രി, വിശ്വസനീയമെന്ന് അറിയാവുന്ന ക്രമീകരണങ്ങളുമായുള്ള സാധൂകരണം, ഘട്ടംഘട്ടമായ വർധന, ഓരോ പാതയും വേഗത്തിൽ ഒറ്റപ്പെടുത്താനോ പ്രവർത്തനരഹിതമാക്കാനോ ഉള്ള സൗകര്യം എന്നിവ ചേർത്തു. സിസ്റ്റത്തിന് എത്ര ട്രാഫിക് സ്വീകരിക്കാനാകുമെന്നതിനൊപ്പം തകരാർ എത്ര വേഗത്തിൽ കണ്ടെത്താനും നിയന്ത്രിക്കാനും അതിൽനിന്ന് മുക്തമാകാനും കഴിയുമെന്നതിന്റെ പ്രാരംഭ സമാരംഭ പരിശീലനമായി നിശ്ശബ്ദ പരിശോധന മാറി.

ക്ലയന്റുമുതൽ മോഡൽ വരെ വേഗത്തിലുള്ള പ്രതികരണം

ChatGPT സ്കെയിലിലേക്ക് GPT‑Live എത്തിക്കുന്നതിന് ഒരു അടിസ്ഥാന തത്വത്തെ അടിസ്ഥാനമാക്കി നിർമ്മിച്ച തികച്ചും പുതിയൊരു സിസ്റ്റം ആവശ്യമായിരുന്നു: ശബ്ദം തടസ്സമില്ലാതെ ഒഴുകണം. സ്ട്രീമിംഗ് ഇൻഫറൻസ് ഫുൾ-ഡ്യൂപ്ലക്സ് മോഡലിലേക്ക് ആവശ്യമായ ഓഡിയോ നൽകിക്കൊണ്ടിരിക്കുന്നു. ഒരു സമർപ്പിത മീഡിയ പാത ഫ്രെയിമുകൾ കൃത്യമായി നൽകുന്നുവെന്ന് ഉറപ്പാക്കുന്നു. അസമകാലിക ചുമതലക്കൈമാറ്റം വഴി ആഴത്തിലുള്ള പ്രോസസിംഗ് സമാന്തരമായി നടത്താൻ അനുവദിക്കുന്നു. മെച്ചപ്പെടുത്തിയ കൈമാറ്റ സംവിധാനം ഉപയോക്താവിലേക്ക് എത്തുമ്പോഴേക്കും ഈ അനുഭവം തികച്ചും വേഗതയുള്ളതാക്കി മാറ്റുന്നു.

GPT‑Live-ന്റെ അടിസ്ഥാന വാസ്തുവിദ്യ തത്സമയ ആശയവിനിമയത്തിനുള്ള വിശാലമായ പ്ലാറ്റ്ഫോമായി ഇതിനകം വളരുകയാണ്. സംഭാഷണത്തിൽനിന്ന് ഏജന്റുമാരുടെ ഏകോപനത്തിലേക്ക് ChatGPT വോയ്സ് വികസിക്കുമ്പോൾ ഇതാണ് അതിന് കരുത്തേകുന്നത്. വരാനിരിക്കുന്ന GPT‑Live API-യുടെ അടിത്തറയും ഇതായിരിക്കും. കാലക്രമേണ, ശബ്ദസംഭാഷണത്തിന് തത്സമയ അനുഭവം നൽകുന്ന ഉടനടിയുള്ള പ്രതികരണം നഷ്ടപ്പെടുത്താതെ കൂടുതൽ ഉപകരണങ്ങളിലേക്കും ആപ്പുകളിലേക്കും മാധ്യമരീതികളിലേക്കും വോയ്സ് അനുഭവങ്ങൾ വ്യാപിപ്പിക്കാൻ ഇത് സഹായിക്കും.

ഇത്തരം എൻജിനീയറിങ് പ്രശ്നങ്ങളാണ് നിങ്ങൾ പരിഹരിക്കാൻ ആഗ്രഹിക്കുന്നതെങ്കിൽ, ഞങ്ങളോടൊപ്പം പ്രവർത്തിക്കൂ.

രചയിതാവ്

Justin Uberti, Zahan Malkani