ஆறு மாதங்களில் உடனடியாகப் பதிலளிக்கும் குரல் AI நிகழ்நேர முறைமையை உருவாக்கியது எப்படி
தொழில்நுட்பப் பணியாளர்களான ஜஸ்டின் உபெர்டி மற்றும் ஜஹான் மல்கானி எழுதியது
குரல் AI-ஐப் பொறுத்தவரை, எப்போது பேச வேண்டும் என்பதை அறிவது தோன்றுவதைவிடக் கடினம். மனிதர்கள் ஒரு வினாடியின் சிறு பகுதியில் இயல்பாகப் பேச்சை ஒரு நபரிடமிருந்து மற்றவருக்கு மாற்றுகின்றனர். ஆனால் முந்தைய குரல் AI முறைமைகளால் இந்தத் தாளத்திற்கு ஈடுகொடுக்க முடியவில்லை. அவற்றின் முறைசார்ந்த கட்டமைப்பு, முறை கண்டறிவான்கள் எனப்படும் சிறிய மாடல்களைச் சார்ந்திருந்தது. அவற்றின் கடினமான பணி இதுதான்: மிக விரைவாக ஊகித்தால் பயனர் பேச்சு துண்டிக்கப்படும்; தாமதமாக ஊகித்தால் பதில் மந்தமாக உணரப்படும். கண்டறிவான் முடிவெடுத்த பிறகே, மிகப் பெரிய LLM தனது பணியைத் தொடங்க முடிந்தது.
எங்கள் மூன்றாம் தலைமுறைக் குரல் முறைமையான GPT‑Live, ஆடியோப் பாதையிலிருந்து முறை கண்டறிவானை நீக்குகிறது. அதன் குரல் மாடல் முழு இருவழித் திறனுடையது. அதாவது, அதனால் ஒரே நேரத்தில் கேட்கவும் பேசவும் முடியும். இதனால் தனிக் கண்டறிவான் தேவையில்லாமல் போவதுடன், உரையாடல் மேலும் உடனடியாகவும் இயல்பாகவும் உணரப்படுகிறது. ஆழமான ரீஸனிங் அல்லது கருவிப் பயன்பாடு தேவைப்படும்போது, உரையாடலின் ஓட்டத்தைத் தடுக்காமல் GPT‑5.5 போன்ற எங்கள் அதிநவீன மாடல்களையும் GPT‑Live அணுக முடியும். இந்தத் திறன்கள் ஒன்றிணைந்து, இதுவரை இல்லாத உரையாடல் பதிலளிப்பையும் நுண்ணறிவையும் GPT‑Live‑க்கு வழங்குகின்றன.
இந்த அனுபவத்தைப் பெருமளவில் வழங்க, குறைந்த தாமதத்திற்காக மேம்படுத்தப்பட்ட புதிய முறைமைக் கட்டமைப்பு தேவைப்பட்டது. வழக்கமான கோரிக்கை-பதில் அனுமானத்தைப் போலல்லாமல், எங்கள் முறைமை உள்வரும் ஆடியோவைக் குரல் மாடலுக்குள் ஸ்ட்ரீம் செய்து, வெளியேறும் பேச்சைப் பயனருக்குத் திருப்பி அனுப்புகிறது. அதே நேரம், பணிப்பகிர்வைத் தனி ஒத்திசைவற்ற பாதையில் கையாளுகிறது. கடந்த ஆறு மாதங்களில், பேச்சு தொடக்கம் முதல் முடிவு வரை சீராகப் பாய்வதற்காக மாடல் அனுமானம், சூழல் மேலாண்மை மற்றும் ஊடகப் பரிமாற்றத்தை மறுவடிவமைத்தோம்.
முக்கியக் குரல் பாதைக்கும் செயலித் தர்க்கத்திற்கும் இடையிலான தெளிவான எல்லையையும் இந்தக் கட்டமைப்பு உருவாக்குகிறது. பதிலளிப்பைப் பாதிக்காமல் செயலியின் நடத்தையைத் தனிப்பயனாக்க இது எளிதாக்குகிறது. ChatGPT கணினிச் செயலியில் உங்கள் கணினியைக் கட்டுப்படுத்தவும் முகவர்களை ஒருங்கிணைக்கவும் புதிதாக அறிமுகமான திறன் உட்பட, ChatGPT வாய்ஸில் வளர்ந்துவரும் பல திறன்களை இந்த அடித்தளம் இயக்குகிறது.
முந்தைய முறைசார்ந்த முறைமைகளால் ஏன் எங்கள் தேவைகளை நிறைவேற்ற முடியவில்லை என்பதையும், ஒவ்வொரு அடுக்கிலும் உடனடியாகப் பதிலளிக்கப் புதிய முறைமையை எவ்வாறு வடிவமைத்தோம் என்பதையும் இந்தப் பதிவில் விளக்குகிறோம். நிலைசார் அனுமானம், இயங்குநிலைச் சூழல் மேலாண்மை, ஒத்திசைவற்ற பணிப்பகிர்வு மற்றும் நெறிமுறை அளவிலான மேம்படுத்தல் ஆகியவை ஒன்றிணைந்து GPT‑Live‑ஐ உண்மையிலேயே நேரலையாக உணரச்செய்வதைப் பார்ப்போம்.
முந்தைய குரல் கட்டமைப்புகள் உரை LLM-களின் முறைசார்ந்த இயல்பைப் பின்பற்றின. ஆனால் ஒவ்வொரு முறையும் உரைக்குப் பதிலாகத் தனித்த ஆடியோத் தொகுதியாகக் குறிப்பிடப்பட்டது. தொடர்நிலை முறைமைகளில், பேச்சிலிருந்து உரை, LLM மற்றும் உரையிலிருந்து பேச்சு ஆகியவை ஒன்றன்பின் ஒன்றாக இயங்கின. தாமதத்தை அதிகரித்ததுடன், குரல் தொனி மற்றும் பேச்சு வேகம் போன்ற குறிப்புகளையும் இந்த வரிசை புறக்கணித்தது.
ஸ்பீச்-டு-ஸ்பீச் மாடல்கள் ஆடியோவை நேரடியாகச் செயலாக்கி, இந்த அணுகுமுறையை மேம்படுத்தின. பேச்சை நேரடியாகப் புரிந்துகொண்டு உருவாக்குமாறு மாடலைப் பயிற்றுவித்ததால், உரைமாற்றத்தில் இழக்கப்படும் விவரங்களைப் பாதுகாத்து மேலும் விரைவாகப் பதிலளிக்க முடிந்தது. ஆனால் அனுமானம் எப்போது தொடங்கலாம் என்பதைத் தீர்மானிக்க, முறைமை இன்னும் முறை கண்டறிவானைச் சார்ந்திருந்தது. உரையாடலின் அதிகப் பகுதியை மாடல் கையாண்டாலும், உரையாடல் முறைசார்ந்ததாகவே இருந்தது.
உரையாடலின் கட்டுப்பாட்டைக் குரல் மாடலிடம் GPT‑Live வழங்குகிறது: மாடலுக்கு உள்ளேயும் வெளியேயும் ஆடியோ பாய்கிறது; ஆழமான ரீஸனிங்கும் கருவிப் பயன்பாடும் ஒத்திசைவின்றி நடைபெறுகின்றன. தடையற்ற ஊடகச் சுழற்சியைத் தொடரச் செய்வதே முறைமையின் முதன்மைப் பணி ஆகும். அதிநவீன மாடல்களை அழைப்பது, உரையாடலை நிலையாகச் சேமிப்பது போன்ற பிற பணிகள் நேரலைப் பாதைக்கு வெளியே நடைபெறுகின்றன.
இந்த ஊடகச் சுழற்சியைத் தடையின்றி வைத்திருப்பது எப்போதும் எளிதல்ல. பரிமாற்றம், செயலாக்கம் அல்லது அனுமானத்தில் ஏற்படும் எந்தத் தாமதமும் கேட்கக்கூடிய இடைவெளியாகவோ ஒலிச் சிதைவாகவோ மாறலாம். முந்தைய முறைசார்ந்த முறைமை, ஆடியோத் தொகுதி வந்தடையும் நேரத்தில் ஓரளவு மாறுபாட்டைத் தாங்கக்கூடியதாக இருந்தது. ஆனால், நேரலை ஊடக முறைமை ஒவ்வொரு ஆடியோ ஃபிரேமையும் கால அட்டவணைப்படி வழங்க வேண்டும்.
ChatGPT வாய்ஸ் மற்றும் Realtime API குறித்த முந்தைய பணி எங்களுக்கு முக்கியமான அடித்தளத்தை வழங்கியது. ஆடியோவையும் வீடியோவையும் குறைவான, மேலும் கணிக்கக்கூடிய தாமதத்துடன் எங்கள் முறைமைகளுக்கு நேரடியாக உள்ளேயும் வெளியேயும் ஸ்ட்ரீம் செய்வதற்காக, ஏற்கெனவே எங்கள் குரல் உள்கட்டமைப்பை மீண்டும் உருவாக்கியிருந்தோம். தொடர்ச்சியான உரையாடலுக்காக உருவாக்கப்பட்ட புதிய நிலைசார் அனுமான முறைமையின் மூலம் ஊடகத்தை மாடல் வரை ஸ்ட்ரீம் செய்து, GPT‑Live அந்த வடிவமைப்பை மேலும் முன்னெடுத்தது.
இருப்பினும், தீர்வின் ஒரு பகுதியாக மட்டுமே ஸ்ட்ரீமிங் அனுமானம் இருந்தது. தயாரிப்புச் சூழலில் இது சிறப்பாக இயங்க, கிளையன்ட்டிலிருந்து அனுமான அடுக்கு வரை ஆடியோ நம்பகமாகச் சென்றடைவதை உறுதிசெய்வதுடன், நிலைசார் செயல்பாட்டின் சவால்களையும் கையாள வேண்டியிருந்தது.
ஊடக ஓட்டத்தைச் செயலி மற்றும் வணிகத் தர்க்கத்திலிருந்து திட்டமிட்டுத் தனியாகப் பிரிப்பது நாங்கள் ஆரம்பத்தில் எடுத்த முடிவுகளில் ஒன்று. கிளையன்ட்டுக்கும் குரல் மாடலுக்கும் இடையே பிரத்யேக விரைவுப் பாதையில் ஆடியோ நகர்கிறது. பணிப்பகிர்வு, கருவிப் பயன்பாடு மற்றும் பிற செயலிப் பணிகள் ஒத்திசைவற்ற RPC எல்லைக்குப் பின்னால் நடைபெறுகின்றன. மெதுவான கருவி அழைப்பு அல்லது பின்புறச் சேவை அதன் சொந்த முடிவைத் தாமதப்படுத்தலாம்; ஆனால் ஊடக ஓட்டத்தை முடக்க முடியாது.
இந்தப் பிரிப்பு, தனிப்பயனாக்கத்திற்கான தெளிவான எல்லையையும் முறைமைக்கு வழங்குகிறது. ஆடியோவின் இயக்கத்தைத் தொடரச் செய்யும் ஊடக முன்புறத்தைப் பாதிக்காமல், செயலிகள் தங்கள் கருவிகள், கொள்கைகள் மற்றும் பின்புற நடத்தையை மாற்றலாம். நேரலைப் பாதை சிறியதாகவும், கணிக்கக்கூடியதாகவும், நிகழ்நேரத்தில் நடக்க வேண்டிய பணியில் கவனம் செலுத்துவதாகவும் உள்ளது.
முந்தைய Python asyncio செயலாக்கத்திற்குப் பதிலாக, ஊடக முன்புறத்தையும் அனுமானத் தர்க்கத்தையும் Go-இல் எழுதினோம். இது ஃபிரேம் வழங்கலின் சீரான தன்மையைப் பெரிதும் மேம்படுத்தியது. புதிய முறைமையின் p95, முந்தைய முறைமையின் p50-க்கு இணையாக இருந்தது.
பரிமாற்றத்திற்கான அடித்தளத்தை WebRTC வழங்குகிறது. இது குறைந்த தாமதமுள்ள ஊடகத்திற்காக வடிவமைக்கப்பட்டது. தொகுப்பு இழப்பு, கடிகார விலகல் மற்றும் கிளையன்ட் இணைப்பு மாற்றங்களின்போதும் தொடர்ந்து இயங்கக்கூடியது. தொகுப்புகள் தாமதமாக வந்தால், இடைவெளிகளைத் தவிர்க்க WebRTC ஆடியோவை நுட்பமாக நீட்டித்து, பின்னர் நிகழ்நேரத்தை மீண்டும் எட்டுவதற்காக இயக்கத்தைச் சிறிது நேரம் வேகப்படுத்தும்.
முறைமை முழுவதும் இடையகப்படுத்தலையும் முடக்கத்தையும் குறைப்பதன் மூலம், உரையாடலில் மனிதர்கள் எதிர்பார்க்கும் ஒரு வினாடிக்கும் குறைவான பதிலளிப்பை வழங்க முடிகிறது.
நிலைசார் அனுமானத்திற்கெனத் தனித்த செயல்பாட்டு சமரசங்கள் உள்ளன. நீண்ட நேரம் செயலில் குரல் அமர்வு இருக்கலாம். ஆனால் அதன் சூழல் தொடர்ந்து வளர்கிறது; தேவைக்கேற்ப மாடல் நிகழ்வுகள் தொடங்கவும் நிறுத்தவும் செய்கின்றன.
இந்தக் கவலைகளைத் தீர்க்க, மாடல் நிகழ்வுகளுக்கு இடையே தடையற்ற ஒப்படைப்பு முறையை உருவாக்கினோம். மாற்றம் தேவைப்படும்போது, தற்போதைய மாடல் நிகழ்வுடன் மாற்று நிகழ்வையும் தயார்படுத்தி, நடப்பு அமர்வுச் சூழலை அதில் முன்கூட்டியே நிரப்பி, இரண்டிலும் இணையாக அனுமானத்தை இயக்கி, புதிய நிகழ்வு முழுமையாகத் தயாரானதும் அதற்கு மாறலாம்.
இதே அடிப்படை முறை இயங்குநிலைச் சூழல் சுருக்குதலையும் ஆதரிக்கிறது. உரையாடல் தொடரும்போது, அதன் திரண்ட சூழல் இறுதியில் மாடலின் சூழல் வரம்பை மீறலாம். வரம்புக்குள் பொருந்துமாறு சூழலின் அளவைச் சுருக்குதல் குறைக்கலாம்; ஆனால் அந்தச் செயல்பாட்டிற்கு நேரம் தேவை. மேலும், இது கடந்தகாலச் சூழலை மாற்றுவதால், முன்னர் செயலாக்கப்பட்ட டோக்கன்களின் கவன ஈர்ப்பு விசைகளையும் மதிப்புகளையும் சேமிக்கும் மாடலின் விசை-மதிப்பு (KV) தற்காலிகச் சேமிப்பையும் செல்லாததாக்குகிறது. அந்த நிலையை மீண்டும் உருவாக்கப் புதிய முன்நிரப்பல் தேவைப்படுவதால், கூடுதல் தாமதம் ஏற்படுகிறது.
அதற்குப் பதிலாக, சுருக்குதலையும் நிர்வகிக்கப்படும் மற்றொரு மாற்றமாகக் கருதுகிறோம். அசல் மாடல் நிகழ்வு தொடர்ந்து உரையாடும்போது, சூழலை முறைமை சுருக்கி, புதிய சூழலுடன் மாற்று மாடல் நிகழ்வைத் தயார்படுத்துகிறது. அந்த நிகழ்வு தயாரானதும், ஊடகத்தில் எந்தத் தடையும் இல்லாமல் அதற்கு மாறலாம். தேவைப்படும் போதெல்லாம் சுருக்குவதன் மூலம், நீண்ட நேர அழைப்புகளை ஆதரிக்க இது முறைமைக்கு உதவுகிறது.
கடினமான பணி நேரலைப் பாதைக்கு வெளியே நடப்பதால், ஒப்படைப்பின்போதும் உரையாடலின் ஓட்டம் சிறிதும் தடுமாறாது.
ஏற்கெனவே உள்ள அதிநவீன மாடல்களை அழைக்கும் GPT‑Live‑இன் திறன் அதற்குப் பெரும் ஆற்றலை வழங்குகிறது; இதன் மூலம் “பேசுவது” ஆழமான “சிந்தனையிலிருந்து” நடைமுறையில் பிரிக்கப்படுகிறது. ஆனால் இந்த இரு-மாடல் கட்டமைப்பை ஒரே முறைமையாக உணரச்செய்ய, தொடர்புடைய இரு பொறியியல் சிக்கல்களைத் தீர்க்க வேண்டியிருந்தது.
ஆழமான பணிக்கான ஒப்படைப்பு
GPT-Live வேகமான, இயல்பான பதில்களை வழங்குகிறது; அதே நேரத்தில் GPT-5.5 பின்னணியில் தேடலைக் கையாளுகிறது
முதலில், நடந்துகொண்டிருக்கும் உரையாடலில் பயனளிக்கும் அளவுக்கு முடிவுகள் விரைவாகத் திரும்ப வேண்டும். எனவே வழிநடத்தல், ப்ராம்ப்ட் செயலாக்கம், அனுமானம், கருவி அழைப்புகள் என முழுப் பணிப்பகிர்வுப் பாதையிலும் தாமதத்தைக் குறைக்க வேண்டியிருந்தது. அதே நேரத்தில், தயாரிப்பின் பிற பகுதிகளிலுள்ள முறைமைகளுக்கு இன்னும் தனித்தனி செய்திகள் தேவைப்படுகின்றன. எனவே நடந்துகொண்டிருக்கும் உரையாடலை அவை புரிந்துகொள்ளக்கூடிய வடிவில் பிரதிபலிக்க வேண்டியிருந்தது.
ஒரு பணி அனுப்பப்படும்போது, அதிநவீன மாடல் உரையாடலுக்குப் பயனுள்ள ஒன்றை உருவாக்கும் வரையிலான நேரத்தைக் குறைக்கிறோம். அதிநவீன மாடல் ரீஸனிங் செய்யும்போதோ கருவிகளைப் பயன்படுத்தும்போதோ, குரல் மாடல் உரையாடலைச் சிறிது நேரம் தொடரச் செய்யலாம். ஆனால் வரம்பின்றி மெதுவாக வரும் பதிலை அதனால் மறைக்க முடியாது. எனவே வழிநடத்தல், ப்ராம்ப்ட் செயலாக்கம், அனுமானம் மற்றும் கருவி அழைப்புகள் அடங்கிய முழுப் பணிப்பகிர்வுச் சுழற்சியையும் பதிலளிப்பு நேரக் கட்டுப்பாட்டின் ஒரு பகுதியாகக் கருதினோம்.
பணிப்பகிர்வு கோரப்படுவதற்கு முன்பே அதிநவீன மாடலையும் அதற்குத் தேவையான கருவிகளையும் அமைப்பது முதல் மேம்படுத்தலாகும். குரல் அமர்வு தொடங்கும்போது, செயலிச் சேவையகம் அதிநவீன மாடலுக்கான அனுமான அமர்வை உருவாக்கி, தொடக்க உரையாடல் சூழலை அதில் முன்கூட்டியே நிரப்புகிறது. இதனால் முதல் பணிப்பகிர்வுக் கோரிக்கைக்கு முன்பே ப்ராம்ப்ட் முழுமையாகச் செயலாக்கப்பட்டிருக்கும்.
பின்னர், குரல் உரையாடல் நீடிக்கும் வரை அந்த அனுமான அமர்வைக் கிடைக்குமாறு வைத்திருந்து, அடுத்தடுத்த கோரிக்கைகளுக்கு நிலையான அமர்வுப் பிணைப்பைப் பயன்படுத்துகிறோம். ப்ராம்ப்ட் தற்காலிகச் சேமிப்புடன் சேர்ந்து, இந்த நுட்பங்கள் தாமதத்தைக் குறைக்கின்றன; அதே நேரம் பணியாளர் செயலிழப்பிலிருந்து எளிதாக மீளவும் முடிகிறது.
ரீஸனிங் முயற்சி, வெளியீட்டு வரம்புகள், கருவித் திட்டவடிவங்கள் மற்றும் மாடல்-கருவி சுற்றுப் பயணங்களும் உரையாடலுக்குப் பயனுள்ள முடிவு கிடைக்கும் நேரத்தைப் பாதிக்கின்றன. விரைவான பதில்களைப் பெற இவற்றைச் சரிசெய்தோம். பணிப்பகிர்வுப் பாதையில் தேவைப்படும் பணியைக் குறைத்ததன் மூலம், எங்கள் அதிநவீன மாடல்களின் முடிவுகளைக் குரல் மாடல் விரைவாகப் பயன்படுத்த வழிவகுத்தோம்.
தொடர்ச்சியான பேச்சு ஸ்ட்ரீம்களில் குரல் மாடல் இயங்கினாலும், அதைச் சுற்றியுள்ள பல முறைமைகள் இன்னும் பயனர் மற்றும் உதவியாளர் முறைகளில் இயங்குகின்றன. ChatGPT‑இன் உரையாடல் இடைமுகமும் எங்கள் பகுப்பாய்வு மற்றும் பாதுகாப்பு உள்கட்டமைப்பின் சில பகுதிகளும் இதில் அடங்கும். எனவே ஒன்றோடொன்று மேலிடும், சில நேரங்களில் தெளிவற்ற உரையாடலைச் செயலிச் சேவையகம் தனித்தனி செய்திகளாகப் பிரிக்கிறது.
ஆடியோ வந்தடையும்போது, யார் பேசிக்கொண்டிருக்கிறார் என்பதை ஊகித்து செய்தி வரிசையை உருவாக்க, பகுதி உரைமாற்றங்களையும் நேரச் சைகைகளையும் சேவையகம் பயன்படுத்துகிறது. மிகப் புதிய செய்தி தற்காலிகமானதாகவே இருக்கும்; மேலும் பேச்சு வந்தடையும்போது அதன் உரை, நேரம் மற்றும் பேசுபவர் ஒதுக்கீடு அனைத்தும் மாறலாம். பேசுபவர் யார் என்பதை நம்பகமாகக் கூறும் அளவுக்கு அவர் தொடர்ந்து பேசியதும், தொடர்புடைய செய்தியைச் சேவையகம் இறுதிசெய்கிறது.
பேசுபவர்கள் ஒரே நேரத்தில் பேசுவது இதை மேலும் சிக்கலாக்குகிறது. பயனர் பேசிக்கொண்டிருக்கும்போது உதவியாளர் சுருக்கமாகத் தெரிவிக்கும் ஒப்புதல், எடுத்துக்காட்டாக “ம் ஹூம்” அல்லது “சரி”, தனிச் செய்தியாக வேண்டியதில்லை. ஆனால் கருத்துள்ள உதவியாளர் குறுக்கீடு பெரும்பாலும் தனிச் செய்தியாக இருக்க வேண்டும். அதேபோல், பயனர் நடுவில் பேசினாலும் காட்டப்படும் உதவியாளர் பதில்கள் தொடர்ச்சியாக இருப்பதற்கு முன்னுரிமை அளிக்கிறோம்.
ஒவ்வொரு பிரிப்புக் கொள்கையும் உடனடித் தன்மைக்கும் உறுதிக்கும் இடையில் சமரசம் செய்கிறது. மிக விரைவாக இறுதிசெய்வது துண்டுபட்ட வரலாற்றையும் நிலையற்ற வரிசையையும் உருவாக்கும்; அதிக நேரம் காத்திருப்பது உரைமாற்றங்களையும் அவற்றைச் சார்ந்த அம்சங்களையும் தாமதப்படுத்தும். எனவே உரையாடலின் தொடர்புடைய இரு பார்வைகளை முறைமை பராமரிக்கிறது: தற்போதைய நிலையைக் குறித்த ஊகப் பார்வை மற்றும் பேசப்பட்டவற்றின் அதிகாரப்பூர்வப் பதிவு. செயலி இடைமுகத்திலுள்ள உரையாடல் பார்வையால் புதுப்பிப்புகளைக் கையாள முடியும் என்பதால், அது ஊகப் பார்வையைப் பயன்படுத்துகிறது. ஆனால் பகுப்பாய்வுச் செயலாக்கத் தொடரில் பதிவிட இறுதி உரைமாற்றம் தேவை.
இதனால், நேரலைக் குரல் பாதையில் முறைமாறிப் பேசுவதைக் கட்டாயப்படுத்தாமல், ChatGPT‑இன் பிற பகுதிகளுக்கு உரையாடலின் நிலையான பார்வை கிடைக்கிறது.
பொத்தானை பயனர் கிளிக் செய்யும் கணத்திலேயே பதிலளிப்பு தொடங்குகிறது. GPT‑Live-இல் உரையாடல் தொடங்குவதற்கு முன், ஊடகப் பாதையை முறைமை நிறுவி மாடலுக்கு ஆடியோவை வழங்கத் தொடங்க வேண்டும். இதனால் தொடக்க வரிசையின் ஒவ்வொரு பகுதியும் முக்கியப் பாதையில் அமைகிறது.
மேலே குறிப்பிட்டபடி, வலுவான நிகழ்நேர அடித்தளத்தை WebRTC வழங்குகிறது. ஆனால் வழக்கமான WebRTC அமர்வைத் தொடங்க எதிர்பாராத அளவுக்கு அதிகமான நெறிமுறைக் கைகுலுக்கல்களும் நெட்வொர்க் சுற்றுப் பயணங்களும் தேவைப்படுகின்றன. QUIC போன்ற பிற்கால நெறிமுறைகளை வடிவமைத்த சுற்றுப் பயணங்களைக் குறைக்கும் கவனம் உருவாவதற்கு முன்பே WebRTC தோன்றியது. இதன் விளைவாக, அதன் அடிப்படை நெறிமுறைகள் ஒன்றாகப் பயன்படுத்தப்படும்போது சில நேரங்களில் ஒரே பணியை மீண்டும் செய்கின்றன. எடுத்துக்காட்டாக, முழு WebRTC அடுக்கின் சூழலில் தேவைப்படாத போதிலும், ஒவ்வொரு நெறிமுறையும் தனக்கெனச் சேவை மறுப்புத் தாக்குதல் எதிர்ப்பு முறையைக் கொண்டிருந்தது.
அடுக்கை ஆய்வு செய்து WebRTC சுருக்கப்பட்ட சுற்றுப் பயண நெறிமுறையை (WARP(புதிய சாளரத்தில் திறக்கும்)) உருவாக்கினோம். இது ஊடகம் மற்றும் தரவின் தொடக்கத்தை ஆறு நெட்வொர்க் சுற்றுப் பயணங்களிலிருந்து ஒன்றாகக் குறைக்கிறது. பின்னோக்கி இணக்கமான நெறிமுறை மேம்பாடுகள் மூலம் WARP இதைச் செய்கிறது: ICE மீது DTLS கைகுலுக்கலை இணைத்தனுப்புதல் (SPED(புதிய சாளரத்தில் திறக்கும்)), வேகமான DTLS 1.3(புதிய சாளரத்தில் திறக்கும்) கைகுலுக்கலைப் பயன்படுத்துதல், SCTP கைகுலுக்கலை முன்கூட்டியே ஒப்பந்தம் செய்தல் (SNAP(புதிய சாளரத்தில் திறக்கும்)) மற்றும் DCEP(புதிய சாளரத்தில் திறக்கும்)-ஐப் பயன்படுத்தாமல் தரவுத் தடங்களை முன்கூட்டியே ஒப்பந்தம் செய்தல்.
இந்தப் பணியால் விரிவான சூழல் அமைப்பும் பயனடைவதற்காக, WebRTC சமூகத்தின் கூட்டாளர்களுடன் இணைந்து WARP-ஐத் திறந்த விவரக்குறிப்புகளின் தொகுப்பாக வடிவமைத்தோம். IETF-இன் TSVWG பணிக்குழு மூலம் முன்மொழிவுகளை முன்னெடுத்து வருகிறோம். libwebrtc மற்றும் Pion இரண்டிலும் WARP ஆதரவு ஏற்கெனவே சேர்க்கப்பட்டுள்ளது; பிற WebRTC செயலாக்கங்களிலும் பணிகள் நடைபெறுகின்றன.
ஊடகக் கைகுலுக்கலை மேம்படுத்திய பிறகு, எஞ்சியிருந்த ஒரு தாமதம் தெளிவாகத் தெரிந்தது: WebRTC இணைவதற்கு முன் SDP அளவுருக்களைப் பகிரப் பயன்படுத்தப்படும் சைகைப் பரிமாற்றம். அந்தப் பரிமாற்றத்தை முக்கியப் பாதையிலிருந்து அகற்ற, “உடனடி இணைப்பு” என நாங்கள் அழைக்கும் முறையை உருவாக்கினோம். சேவையகத் திறனை முன்பதிவு செய்யாமலும், ஏற்கெனவே உள்ள WebRTC செயலாக்கங்களை மாற்றாமலும், இந்த அளவுருக்களை இது முன்கூட்டியே ஒப்பந்தம் செய்கிறது.
நிலையான சைகை ஓட்டத்துடன் இணையாக உடனடி இணைப்பு இயங்குகிறது. முன்கூட்டியே ஒப்பந்தம் செய்யப்பட்ட அளவுருக்கள் செல்லுபடியாக இருந்தால், முதல் ஊடகத் தொகுப்பு வந்ததும் சேவையகம் அமர்வை உருவாக்கலாம். அவை காலாவதியானவையாகவோ செல்லாதவையாகவோ இருந்தால், சைகை ஓட்டம் ஏற்கெனவே நடந்துகொண்டிருக்கும். எனவே கூடுதல் தாமதமின்றி கிளையன்ட் மாற்று முறைக்குத் திரும்பலாம்.
உடனடி இணைப்பும் WARP-உம் சேர்ந்து, பயனரின் நோக்கத்திலிருந்து நேரலை ஊடக ஓட்டம் வரையிலான நேரத்தைப் பெருமளவு குறைக்கின்றன. SDP பரிமாற்றம் முக்கியப் பாதைக்கு வெளியே நகர்த்தப்பட்டு, பரிமாற்றக் கைகுலுக்கலை WARP சுருக்குவதால், கிளையன்ட் இப்போது ஒரே UDP தொகுப்புடன் அமர்வைத் தொடங்க முடியும். சேவையகம் உடனடியாகப் பதிலளிக்க முடிவதால், பயனர் உண்மையில் விரும்பும் கேட்டல் மற்றும் பதிலளித்தல் பணியை முறைமையின் பிற பகுதிகள் தொடங்கலாம்.
கோட்பாட்டில் ஒரு முறைமை வேகமாகத் தோன்றினாலும், உண்மையான குரல் போக்குவரத்தில் முடங்கக்கூடும். GPT‑Live பயனர்களுடன் உரையாட அனுமதிப்பதற்கு முன், தயாரிப்புச் சூழலிலுள்ள ChatGPT வாய்ஸ் அமர்வுகளில் சிறியதாகத் தொடங்கி படிப்படியாக அதிகரித்த ஒரு பகுதியை, ஏற்கெனவே இருந்த அட்வான்ஸ்ட் வாய்ஸ் மோடு அனுபவத்திற்கும் எங்கள் புதிய முறைமைக்கும் அனுப்பும் அமைதிச் சோதனையை நடத்தினோம். அட்வான்ஸ்ட் வாய்ஸ் மோடு வழக்கம்போல் பயனர்களுக்குச் சேவையளித்தது; அதே நேரம், படிக்க மட்டும் அனுமதிக்கப்பட்ட முறையில் அனுமானத்தை நிழல் பாதை இயக்கியது. பயனர்கள் கேட்டதில் எந்த மாற்றமும் இல்லாமல், உண்மையான கிளையன்ட்கள், நெட்வொர்க்குகள், அமர்வு நீளங்கள் மற்றும் புவியியல் பரவலுக்கு முறைமையை இது உட்படுத்தியது.
திறனை GPU த்ரூபுட் அளவுக்கு மட்டும் சுருக்கிப் பார்க்க முடியாது என்பது முதலில் கிடைத்த பாடங்களில் ஒன்று. குரல் அமர்வுகள் நீண்ட நேரம் திறந்திருந்து ஃபிரேம்களைத் தொடர்ந்து அனுப்புவதால், CPU சார்ந்த ஸ்ட்ரீம் ஹேண்ட்லர்கள், வரிசைகள் மற்றும் நெட்வொர்க் பாதைகளும் அனுமானத்துடன் சேர்ந்து அளவிடப்பட வேண்டும். உண்மையான சுமையில், எங்கள் சுமைச் சோதனை மதிப்பீடுகள் கணித்ததைவிட முன்னதாக ஒரு துணைக் கூறு முழுத் திறனை எட்டியது. இதனால் அனுமானக் கோரிக்கைகள் குவிந்து, தாமதம் மேலும் அதிகரித்தது. திறன் குறித்த கேள்வியை “ஒரு GPU எத்தனை கோரிக்கைகளைக் கையாள முடியும்?” என்பதிலிருந்து “ஒவ்வொரு ஃபிரேமையும் கால அட்டவணைப்படி வைத்தபடி, ஒரே நேரத்தில் எத்தனை அமர்வுகளை முறைமையால் தாங்க முடியும்?” என மாற்றினோம்.
புவியியலையும் முதன்மையான கவலையாக இந்தச் சோதனை மாற்றியது. தொலைதூரத் திறனுக்கு ஓர் அமர்வை அனுப்புவது, தொடக்கத்திலும் ஸ்ட்ரீமிங்கின்போதும் பல கட்டங்களில் தாமதத்தைச் சேர்க்கலாம். மாடல் வெளியீடுகளைப் பிராந்தியத் திறன் மற்றும் போக்குவரத்து வழிநடத்தல் உள்ளமைவுடன் சேர்த்து சரிபார்க்கத் தொடங்கினோம். பின்னர், மூலப் புவியியல் அடிப்படையில் தாமதத்தைப் பிரித்துப் பார்த்தோம். அனுமானத்தைப் பயனர்களுக்கு அருகே நகர்த்தியது உதவியது. ஆனால் இது ஒரு விரிவான பாடத்தையும் உறுதிப்படுத்தியது: தொடக்கம் முதல் முடிவு வரையிலான பதிலளிப்பு, மாடல் சேவையகத்தை மட்டும் அல்லாமல் பாதையிலுள்ள ஒவ்வொரு சேவையையும் சார்ந்துள்ளது.
நடைமுறைக்கு நெருக்கமான அமர்வு வாழ்க்கைச் சுழற்சிகளில் மட்டுமே பிற தோல்விகள் தோன்றின. நினைவகம் மற்றும் நிலைத்தன்மை சார்ந்த அழுத்தத்தை நீண்ட நேரம் இயங்கிய அமர்வுகள் வெளிப்படுத்தின. மீண்டும் இணைப்புகள் சுருக்குதலையும் நிலை மீட்டமைப்பையும் சோதித்தன. வழக்கமான கிளையன்ட் துண்டிப்புகள், நிறுத்த ஒத்திசைவுக் கைகுலுக்கலில் இருந்த போட்டி நிலைகளை வெளிப்படுத்தின. நேரம், குவிந்த நிலை மற்றும் சேவை எல்லைகளைக் கடந்த நடத்தை ஆகியவற்றைச் சார்ந்திருந்ததால், குறுகிய சுமைச் சோதனைகளில் இச்சிக்கல்கள் அரிதாகவே தோன்றின.
இறுதியாக, கண்காணிப்புத் திறனையும் வெளியீட்டுக் கட்டுப்பாடுகளையும் மேம்படுத்த தயாரிப்புச் சூழல் சோதனை எங்களைத் தூண்டியது. வெவ்வேறு தாமத மூலங்களை ஒன்றாகக் கலந்த அளவீடுகள், தனித்தனியாகச் சரியாக இயங்காத எஞ்சின்களைத் திரட்டப்பட்ட மதிப்புகள் மூலம் மறைத்த முகப்புப் பலகைகள், சோதிக்கப்பட்ட மற்றும் பயன்படுத்தப்பட்ட முறைமைகளுக்கு இடையிலான உள்ளமைவு விலகல் ஆகியவற்றைக் கண்டறிந்தோம். இதற்குப் பதிலாக, மேலும் நுணுக்கமான தொலைஅளவீடு, சரியாக இயங்குவது உறுதிசெய்யப்பட்ட உள்ளமைவுகளுடன் ஒப்பிட்டுச் சரிபார்த்தல், கட்டம் கட்டமாகப் போக்குவரத்தை அதிகரித்தல் மற்றும் தனிப்பட்ட பாதைகளை விரைவாகத் தனிமைப்படுத்தவோ முடக்கவோ கூடிய திறன் ஆகியவற்றைச் சேர்த்தோம். முறைமை எவ்வளவு போக்குவரத்தை ஏற்கும் என்பதற்கு மட்டுமல்லாமல், தோல்வியை எவ்வளவு விரைவாகக் கண்டறிந்து, கட்டுப்படுத்தி, மீள முடியும் என்பதற்குமான ஆரம்ப வெளியீட்டு ஒத்திகையாகவும் அமைதிச் சோதனை மாறியது.
GPT‑Live-ஐ ChatGPT அளவுக்குக் கொண்டுவர, “குரல் தடையின்றிப் பாய வேண்டும்” என்ற அடிப்படைக் கொள்கையை மையமாகக் கொண்ட முற்றிலும் புதிய முறைமை தேவைப்பட்டது. ஸ்ட்ரீமிங் அனுமானம், முழு இருவழி மாடலுக்கு ஆடியோ தொடர்ந்து கிடைப்பதை உறுதிசெய்கிறது. பிரத்யேக ஊடகப் பாதை, ஃபிரேம்கள் நம்பகமாகச் சென்றடைவதை உறுதிசெய்கிறது. ஒத்திசைவற்ற பணிப்பகிர்வு, ஆழமான சிந்தனையை இணையாக இயக்குகிறது. மேம்படுத்தப்பட்ட பரிமாற்றம், பயனர் வரை அனுபவம் உடனடியாகப் பதிலளிப்பதை உறுதிசெய்கிறது.
GPT‑Live-இன் பின்னணிக் கட்டமைப்பு, நிகழ்நேரத் தொடர்புக்கான விரிவான தளமாக ஏற்கெனவே உருவெடுத்து வருகிறது. உரையாடலிலிருந்து ஏஜென்டிக் ஒருங்கிணைப்புக்கு விரிவடையும் ChatGPT வாய்ஸை இது இயக்குகிறது; வரவிருக்கும் GPT‑Live API-க்கும் இது அடித்தளமாக அமையும். காலப்போக்கில், குரல் உரையாடலை நேரலையாக உணரச்செய்யும் உடனடித் தன்மையை இழக்காமல், அதிகச் சாதனங்கள், செயலிகள் மற்றும் புலன்வழிகளில் குரல் அனுபவங்கள் விரிவடைய இது உதவும்.
இத்தகைய பொறியியல் சிக்கல்களையே நீங்கள் தீர்க்க விரும்பினால், எங்களுடன் இணைந்து பணியாற்றுங்கள்.

