ಆರು ತಿಂಗಳಲ್ಲಿ ಸ್ಪಂದನಶೀಲ ಧ್ವನಿ AIಗಾಗಿ ನೈಜ-ಸಮಯದ ವ್ಯವಸ್ಥೆ ನಿರ್ಮಿಸಿದ ಬಗೆ
ತಾಂತ್ರಿಕ ಸಿಬ್ಬಂದಿ ಸದಸ್ಯರಾದ ಜಸ್ಟಿನ್ ಉಬರ್ಟಿ ಮತ್ತು ಜಹಾನ್ ಮಲ್ಕಾನಿ ಅವರಿಂದ.
ಧ್ವನಿ AIಗೆ ಯಾವಾಗ ಮಾತನಾಡಬೇಕೆಂದು ತಿಳಿಯುವುದು ತೋರುವುದಕ್ಕಿಂತ ಕಷ್ಟ. ಮನುಷ್ಯರು ಕ್ಷಣಾರ್ಧದಲ್ಲಿ ಸಹಜವಾಗಿ ಒಬ್ಬರಿಂದ ಮತ್ತೊಬ್ಬರಿಗೆ ಮಾತಿನ ಸರದಿಯನ್ನು ಹಸ್ತಾಂತರಿಸುತ್ತಾರೆ. ಆದರೆ ಹಿಂದಿನ ಧ್ವನಿ AI ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಈ ಲಯವನ್ನು ಅನುಸರಿಸಲಾಗಲಿಲ್ಲ. ಅವುಗಳ ಸರದಿ-ಆಧಾರಿತ ವಾಸ್ತುಶಿಲ್ಪವು ಸರದಿ ಪತ್ತೆಕಾರಕಗಳೆಂಬ ಸಣ್ಣ ಮಾಡೆಲ್ಗಳನ್ನು ಅವಲಂಬಿಸಿತ್ತು. ಅವುಗಳ ಕೆಲಸ ಕಠಿಣವಾಗಿತ್ತು: ತುಂಬ ಬೇಗ ಊಹಿಸಿದರೆ ಬಳಕೆದಾರರ ಮಾತು ತುಂಡಾಗುತ್ತದೆ; ತಡವಾಗಿ ಊಹಿಸಿದರೆ ಪ್ರತಿಕ್ರಿಯೆ ನಿಧಾನವೆನಿಸುತ್ತದೆ. ಪತ್ತೆಕಾರಕ ನಿರ್ಧಾರ ಕೈಗೊಂಡ ಬಳಿಕವಷ್ಟೇ ಹೆಚ್ಚು ದೊಡ್ಡದಾದ LLM ಕೆಲಸ ಆರಂಭಿಸಬಹುದಿತ್ತು.
ನಮ್ಮ ಮೂರನೇ ತಲೆಮಾರಿನ ಧ್ವನಿ ವ್ಯವಸ್ಥೆಯಾದ GPT‑Live, ಆಡಿಯೊ ಮಾರ್ಗದಿಂದ ಸರದಿ ಪತ್ತೆಕಾರಕವನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ. ಇದರ ಧ್ವನಿ ಮಾಡೆಲ್ ಪೂರ್ಣ-ದ್ವಿಮುಖವಾಗಿದ್ದು, ಒಂದೇ ಸಮಯದಲ್ಲಿ ಕೇಳಬಲ್ಲದು ಮತ್ತು ಮಾತನಾಡಬಲ್ಲದು. ಇದರಿಂದ ಪ್ರತ್ಯೇಕ ಪತ್ತೆಕಾರಕದ ಅಗತ್ಯವಿಲ್ಲದೆ, ಸಂಭಾಷಣೆಯು ಹೆಚ್ಚು ತಕ್ಷಣದ ಮತ್ತು ಸಹಜ ಅನುಭವ ನೀಡುತ್ತದೆ. ಆಳವಾದ ರೀಜನಿಂಗ್ ಅಥವಾ ಸಾಧನ ಬಳಕೆ ಅಗತ್ಯವಾದಾಗ, ಸಂಭಾಷಣೆಯ ಹರಿವಿಗೆ ಅಡ್ಡಿಯಾಗದಂತೆ GPT‑Live ನಮ್ಮ GPT‑5.5ನಂತಹ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ಗಳ ಸಲಹೆಯನ್ನೂ ಪಡೆಯಬಲ್ಲದು. ಈ ಸಾಮರ್ಥ್ಯಗಳು ಒಟ್ಟಾಗಿ GPT‑Liveಗೆ ಸಂಭಾಷಣೆಯ ಸ್ಪಂದನಶೀಲತೆ ಮತ್ತು ಬುದ್ಧಿಮತ್ತೆಯ ಅಭೂತಪೂರ್ವ ಸಂಯೋಜನೆಯನ್ನು ನೀಡುತ್ತವೆ.
ಈ ಅನುಭವವನ್ನು ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ನೀಡಲು, ಕಡಿಮೆ ವಿಳಂಬಕ್ಕಾಗಿ ಸುಧಾರಿಸಿದ ಹೊಸ ವ್ಯವಸ್ಥೆಯ ವಾಸ್ತುಶಿಲ್ಪ ಅಗತ್ಯವಾಯಿತು. ಸಾಮಾನ್ಯ ವಿನಂತಿ-ಪ್ರತಿಕ್ರಿಯೆ ಇನ್ಫರೆನ್ಸ್ಗೆ ಭಿನ್ನವಾಗಿ, ನಮ್ಮ ವ್ಯವಸ್ಥೆಯು ಒಳಬರುವ ಆಡಿಯೊವನ್ನು ಧ್ವನಿ ಮಾಡೆಲ್ಗೆ ಮತ್ತು ಹೊರಹೋಗುವ ಮಾತನ್ನು ಬಳಕೆದಾರರಿಗೆ ಸ್ಟ್ರೀಮ್ ಮಾಡುತ್ತಾ, ಪ್ರತ್ಯೇಕ ಅಸಮಕಾಲಿಕ ಮಾರ್ಗದಲ್ಲಿ ನಿಯೋಜನೆಯನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ. ಕಳೆದ ಆರು ತಿಂಗಳಲ್ಲಿ, ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗೆ ಮಾತು ಸುಗಮವಾಗಿ ಹರಿಯಲು ಮಾಡೆಲ್ ಇನ್ಫರೆನ್ಸ್, ಸಂದರ್ಭ ನಿರ್ವಹಣೆ ಮತ್ತು ಮಾಧ್ಯಮ ಸಾಗಣೆಯನ್ನು ಮರುರೂಪಿಸಿದೆವು.
ಈ ವಾಸ್ತುಶಿಲ್ಪವು ಪ್ರಮುಖ ಧ್ವನಿ ಮಾರ್ಗ ಮತ್ತು ಆ್ಯಪ್ ತರ್ಕದ ನಡುವೆ ಸ್ಪಷ್ಟ ಗಡಿಯನ್ನೂ ರೂಪಿಸುತ್ತದೆ. ಇದರಿಂದ ಸ್ಪಂದನಶೀಲತೆಗೆ ಧಕ್ಕೆಯಾಗದಂತೆ ಆ್ಯಪ್ನ ವರ್ತನೆಯನ್ನು ಸುಲಭವಾಗಿ ಗ್ರಾಹಕೀಯಗೊಳಿಸಬಹುದು. ಈ ಅಡಿಪಾಯವು ChatGPT ವಾಯ್ಸ್ನಲ್ಲಿ ಹೆಚ್ಚುತ್ತಿರುವ ಸಾಮರ್ಥ್ಯಗಳಿಗೆ ಶಕ್ತಿ ನೀಡುತ್ತದೆ. ChatGPT ಡೆಸ್ಕ್ಟಾಪ್ ಆ್ಯಪ್ನಲ್ಲಿ ನಿಮ್ಮ ಕಂಪ್ಯೂಟರ್ ನಿಯಂತ್ರಿಸುವ ಮತ್ತು ನಿಮ್ಮ ಏಜೆಂಟ್ಗಳನ್ನು ಸಮನ್ವಯಗೊಳಿಸುವ ಹೊಸ ಸಾಮರ್ಥ್ಯವೂ ಇದರಲ್ಲಿ ಸೇರಿದೆ.
ಹಿಂದಿನ ಸರದಿ-ಆಧಾರಿತ ವ್ಯವಸ್ಥೆಗಳು ನಮ್ಮ ಅಗತ್ಯಗಳನ್ನು ಏಕೆ ಪೂರೈಸಲಿಲ್ಲ ಮತ್ತು ಪ್ರತಿಯೊಂದು ಪದರದಲ್ಲೂ ಸ್ಪಂದನಶೀಲವಾಗಿರುವಂತೆ ಹೊಸ ವ್ಯವಸ್ಥೆಯನ್ನು ಹೇಗೆ ರೂಪಿಸಿದೆವು ಎಂಬುದನ್ನು ಈ ಲೇಖನದಲ್ಲಿ ವಿವರಿಸುತ್ತೇವೆ. GPT‑Live ನಿಜವಾಗಿಯೂ ನೇರ ಅನುಭವ ನೀಡಲು ಒಟ್ಟಾಗಿ ಕೆಲಸ ಮಾಡುವ ಸ್ಥಿತಿಯುಕ್ತ ಇನ್ಫರೆನ್ಸ್, ಕ್ರಿಯಾತ್ಮಕ ಸಂದರ್ಭ ನಿರ್ವಹಣೆ, ಅಸಮಕಾಲಿಕ ನಿಯೋಜನೆ ಮತ್ತು ಶಿಷ್ಟಾಚಾರ-ಮಟ್ಟದ ಸುಧಾರಣೆಗಳನ್ನು ವಿವರಿಸುತ್ತೇವೆ.
ಹಿಂದಿನ ಧ್ವನಿ ವಾಸ್ತುಶಿಲ್ಪಗಳು ಪಠ್ಯ LLMಗಳ ಸರದಿ-ಆಧಾರಿತ ಸ್ವರೂಪವನ್ನು ಪಡೆದಿದ್ದವು. ಆದರೆ ಪ್ರತಿ ಸರದಿಯನ್ನು ಪಠ್ಯದ ಬದಲು ಪ್ರತ್ಯೇಕ ಆಡಿಯೊ ತುಣುಕಾಗಿ ಪ್ರತಿನಿಧಿಸಲಾಗುತ್ತಿತ್ತು. ಅನುಕ್ರಮ ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ ಮಾತಿನಿಂದ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತನೆ, LLM ಮತ್ತು ಪಠ್ಯದಿಂದ ಮಾತಿಗೆ ಪರಿವರ್ತನೆ ಒಂದರ ನಂತರ ಮತ್ತೊಂದು ನಡೆಯುತ್ತಿದ್ದವು. ಈ ಅನುಕ್ರಮವು ವಿಳಂಬ ಹೆಚ್ಚಿಸಿದ್ದಲ್ಲದೆ, ಧ್ವನಿಯ ಏರಿಳಿತ ಮತ್ತು ಮಾತಿನ ಗತಿಯಂತಹ ಸೂಚನೆಗಳನ್ನು ಕಡೆಗಣಿಸಿತು.
ಸ್ಪೀಚ್-ಟು-ಸ್ಪೀಚ್ ಮಾಡೆಲ್ಗಳು ಆಡಿಯೊವನ್ನು ನೇರವಾಗಿ ಸಂಸ್ಕರಿಸುವ ಮೂಲಕ ಈ ವಿಧಾನವನ್ನು ಸುಧಾರಿಸಿದವು. ಮಾತನ್ನು ಸಹಜವಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಮತ್ತು ರಚಿಸಲು ಮಾಡೆಲ್ಗೆ ತರಬೇತಿ ನೀಡಿದ್ದರಿಂದ, ಲಿಪ್ಯಂತರದಲ್ಲಿ ಕಳೆದುಹೋಗುವ ವಿವರಗಳನ್ನು ಉಳಿಸಿಕೊಂಡು ಹೆಚ್ಚು ವೇಗವಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸಲು ಸಾಧ್ಯವಾಯಿತು. ಆದರೂ ಇನ್ಫರೆನ್ಸ್ ಯಾವಾಗ ಆರಂಭವಾಗಬೇಕೆಂದು ನಿರ್ಧರಿಸಲು ವ್ಯವಸ್ಥೆಯು ಸರದಿ ಪತ್ತೆಕಾರಕವನ್ನೇ ಅವಲಂಬಿಸಿತ್ತು. ಮಾಡೆಲ್ ಸಂವಹನದ ಹೆಚ್ಚಿನ ಭಾಗವನ್ನು ನಿರ್ವಹಿಸಿದರೂ, ಸಂವಹನವು ಸರದಿ-ಆಧಾರಿತವಾಗಿಯೇ ಉಳಿಯಿತು.
GPT‑Live ಧ್ವನಿ ಮಾಡೆಲ್ಗೆ ಸಂಭಾಷಣೆಯ ನಿಯಂತ್ರಣ ನೀಡುತ್ತದೆ: ಆಡಿಯೊ ಮಾಡೆಲ್ನ ಒಳಗೂ ಹೊರಗೂ ಹರಿಯುವಾಗ, ಆಳವಾದ ರೀಜನಿಂಗ್ ಮತ್ತು ಸಾಧನ ಬಳಕೆ ಅಸಮಕಾಲಿಕವಾಗಿ ನಡೆಯುತ್ತವೆ. ತಡೆರಹಿತ ಮಾಧ್ಯಮ ಆವರ್ತವನ್ನು ಮುಂದುವರಿಸುವುದೇ ವ್ಯವಸ್ಥೆಯ ಮುಖ್ಯ ಕೆಲಸ. ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸುವುದು ಮತ್ತು ಸಂಭಾಷಣೆಯನ್ನು ಶಾಶ್ವತವಾಗಿ ಉಳಿಸುವಂತಹ ಇತರ ಕೆಲಸಗಳು ನೇರ ಮಾರ್ಗದ ಹೊರಗೆ ನಡೆಯುತ್ತವೆ.
ಈ ಮಾಧ್ಯಮ ಆವರ್ತವನ್ನು ಅಡೆತಡೆಯಿಲ್ಲದೆ ಮುಂದುವರಿಸುವುದು ಯಾವಾಗಲೂ ಸುಲಭವಲ್ಲ. ಸಾಗಣೆ, ಸಂಸ್ಕರಣೆ ಅಥವಾ ಇನ್ಫರೆನ್ಸ್ನಲ್ಲಿನ ಯಾವುದೇ ವಿಳಂಬವು ಕೇಳಿಸುವ ವಿರಾಮ ಅಥವಾ ಅನಪೇಕ್ಷಿತ ಶಬ್ದವಾಗಬಹುದು. ಹಿಂದಿನ ಸರದಿ-ಆಧಾರಿತ ವ್ಯವಸ್ಥೆಯು ಆಡಿಯೊ ತುಣುಕು ಬರುವ ಸಮಯದಲ್ಲಿನ ಸ್ವಲ್ಪ ವ್ಯತ್ಯಾಸವನ್ನು ಸಹಿಸಿಕೊಳ್ಳುತ್ತಿತ್ತು. ಆದರೆ ನೇರ ಮಾಧ್ಯಮ ವ್ಯವಸ್ಥೆಯು ಪ್ರತಿ ಆಡಿಯೊ ಫ್ರೇಮ್ ಅನ್ನು ನಿಗದಿತ ಸಮಯಕ್ಕೆ ತಲುಪಿಸಬೇಕು.
ChatGPT ವಾಯ್ಸ್ ಮತ್ತು Realtime API ಕುರಿತ ಹಿಂದಿನ ಕೆಲಸವು ನಮಗೆ ಪ್ರಮುಖ ಅಡಿಪಾಯ ಒದಗಿಸಿತು. ಕಡಿಮೆ ಮತ್ತು ಹೆಚ್ಚು ಊಹಿಸಬಹುದಾದ ವಿಳಂಬದೊಂದಿಗೆ ಆಡಿಯೊ ಹಾಗೂ ವೀಡಿಯೊವನ್ನು ನಮ್ಮ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ನೇರವಾಗಿ ಒಳಗೆ ಮತ್ತು ಹೊರಗೆ ಸ್ಟ್ರೀಮ್ ಮಾಡಲು ನಾವು ಈಗಾಗಲೇ ನಮ್ಮ ಧ್ವನಿ ಮೂಲಸೌಕರ್ಯವನ್ನು ಮರುನಿರ್ಮಿಸಿದ್ದೆವು. ನಿರಂತರ ಸಂಭಾಷಣೆಗಾಗಿ ನಿರ್ಮಿಸಿದ ಹೊಸ ಸ್ಥಿತಿಯುಕ್ತ ಇನ್ಫರೆನ್ಸ್ ವ್ಯವಸ್ಥೆಯ ಮೂಲಕ ಮಾಧ್ಯಮವನ್ನು ಮಾಡೆಲ್ವರೆಗೆ ಸ್ಟ್ರೀಮ್ ಮಾಡುತ್ತಾ, GPT‑Live ಆ ವಿನ್ಯಾಸವನ್ನು ಮತ್ತಷ್ಟು ಮುಂದಕ್ಕೆ ಕೊಂಡೊಯ್ದಿತು.
ಆದರೆ ಸ್ಟ್ರೀಮಿಂಗ್ ಇನ್ಫರೆನ್ಸ್ ಪರಿಹಾರದ ಒಂದು ಭಾಗ ಮಾತ್ರವಾಗಿತ್ತು. ಉತ್ಪಾದನಾ ಪರಿಸರದಲ್ಲಿ ಅದು ಚೆನ್ನಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಲು, ಕ್ಲೈಂಟ್ನಿಂದ ಇನ್ಫರೆನ್ಸ್ ವ್ಯವಸ್ಥೆಯವರೆಗೆ ವಿಶ್ವಾಸಾರ್ಹ ಆಡಿಯೊ ವಿತರಣೆಯನ್ನು ಖಚಿತಪಡಿಸುವುದರ ಜೊತೆಗೆ ಸ್ಥಿತಿಯುಕ್ತ ವ್ಯವಸ್ಥೆಯ ಸವಾಲುಗಳನ್ನು ನಿಭಾಯಿಸಬೇಕಾಯಿತು.
ಮಾಧ್ಯಮ ಹರಿವನ್ನು ಆ್ಯಪ್ ಮತ್ತು ವ್ಯವಹಾರ ತರ್ಕದಿಂದ ಸ್ಪಷ್ಟವಾಗಿ ಬೇರ್ಪಡಿಸುವುದು ನಮ್ಮ ಆರಂಭಿಕ ನಿರ್ಧಾರಗಳಲ್ಲಿ ಒಂದಾಗಿತ್ತು. ಕ್ಲೈಂಟ್ ಮತ್ತು ಧ್ವನಿ ಮಾಡೆಲ್ ನಡುವೆ ಆಡಿಯೊ ಮೀಸಲಾದ ವೇಗದ ಮಾರ್ಗದಲ್ಲಿ ಸಾಗುತ್ತದೆ. ನಿಯೋಜನೆ, ಸಾಧನ ಬಳಕೆ ಮತ್ತು ಇತರ ಆ್ಯಪ್ ಕಾರ್ಯಗಳು ಅಸಮಕಾಲಿಕ RPC ಗಡಿಯ ಹಿಂದೆ ನಡೆಯುತ್ತವೆ. ನಿಧಾನವಾದ ಸಾಧನ ಕರೆ ಅಥವಾ ಹಿಂಭಾಗದ ಸೇವೆಯು ತನ್ನ ಫಲಿತಾಂಶವನ್ನು ವಿಳಂಬಗೊಳಿಸಬಹುದು, ಆದರೆ ಮಾಧ್ಯಮದ ಹರಿವನ್ನು ನಿಲ್ಲಿಸಲಾಗದು.
ಈ ಪ್ರತ್ಯೇಕತೆಯು ಗ್ರಾಹಕೀಕರಣಕ್ಕಾಗಿ ವ್ಯವಸ್ಥೆಗೆ ಸ್ಪಷ್ಟ ಗಡಿಯನ್ನೂ ಒದಗಿಸುತ್ತದೆ. ಆಡಿಯೊವನ್ನು ಚಲಿಸುವಂತೆ ನೋಡಿಕೊಳ್ಳುವ ಮಾಧ್ಯಮ ಮುಂಭಾಗದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರದೆ, ಆ್ಯಪ್ಗಳು ತಮ್ಮ ಸಾಧನಗಳು, ನೀತಿಗಳು ಮತ್ತು ಹಿಂಭಾಗದ ವರ್ತನೆಯನ್ನು ಬದಲಾಯಿಸಬಹುದು. ನೇರ ಮಾರ್ಗವು ಚಿಕ್ಕದಾಗಿ, ಊಹಿಸಬಹುದಾದಂತೆಯೂ ನೈಜ ಸಮಯದಲ್ಲಿ ನಡೆಯಲೇಬೇಕಾದ ಕೆಲಸದ ಮೇಲಷ್ಟೇ ಕೇಂದ್ರೀಕೃತವಾಗಿಯೂ ಉಳಿಯುತ್ತದೆ.
ಹಿಂದಿನ Python asyncio ಅನುಷ್ಠಾನವನ್ನು ಬದಲಿಸಿ, ಮಾಧ್ಯಮ ಮುಂಭಾಗ ಮತ್ತು ಇನ್ಫರೆನ್ಸ್ ತರ್ಕವನ್ನು ನಾವು Goನಲ್ಲಿ ಬರೆದೆವು. ಇದು ಫ್ರೇಮ್ ವಿತರಣೆಯ ಸುಗಮತೆಯನ್ನು ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸಿತು. ಹೊಸ ವ್ಯವಸ್ಥೆಯ p95 ಹಿಂದಿನ ವ್ಯವಸ್ಥೆಯ p50ಗೆ ಸಮನಾಯಿತು.
WebRTC ಸಾಗಣೆಗೆ ಅಡಿಪಾಯ ಒದಗಿಸುತ್ತದೆ. ಇದನ್ನು ಕಡಿಮೆ ವಿಳಂಬದ ಮಾಧ್ಯಮಕ್ಕಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ. ಪ್ಯಾಕೆಟ್ ನಷ್ಟ, ಗಡಿಯಾರದ ವ್ಯತ್ಯಾಸ ಮತ್ತು ಕ್ಲೈಂಟ್ ಸಂಪರ್ಕದ ಬದಲಾವಣೆಗಳ ನಡುವೆಯೂ ಇದು ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲದು. ಪ್ಯಾಕೆಟ್ಗಳು ತಡವಾಗಿ ಬಂದರೆ, ತೆರವುಗಳು ಉಂಟಾಗದಂತೆ WebRTC ಆಡಿಯೊವನ್ನು ಸೂಕ್ಷ್ಮವಾಗಿ ಹಿಗ್ಗಿಸಬಹುದು ಮತ್ತು ಬಳಿಕ ನೈಜ ಸಮಯವನ್ನು ತಲುಪಲು ಪ್ಲೇಬ್ಯಾಕ್ ಅನ್ನು ಸ್ವಲ್ಪ ಹೊತ್ತು ವೇಗಗೊಳಿಸಬಹುದು.
ವ್ಯವಸ್ಥೆಯಾದ್ಯಂತ ಬಫರಿಂಗ್ ಮತ್ತು ತಡೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ, ಸಂಭಾಷಣೆಯಿಂದ ಜನರು ನಿರೀಕ್ಷಿಸುವ ಒಂದು ಸೆಕೆಂಡ್ಗಿಂತ ಕಡಿಮೆ ಅವಧಿಯ ಸ್ಪಂದನೆಯನ್ನು ನೀಡಬಹುದು.
ಸ್ಥಿತಿಯುಕ್ತ ಇನ್ಫರೆನ್ಸ್ ತನ್ನದೇ ಆದ ಕಾರ್ಯಾಚರಣಾ ರಾಜಿಗಳನ್ನು ಹೊಂದಿದೆ. ಧ್ವನಿ ಸೆಷನ್ ಬಹಳ ಹೊತ್ತು ಸಕ್ರಿಯವಾಗಿರಬಹುದು, ಆದರೆ ಅದರ ಸಂದರ್ಭ ನಿರಂತರವಾಗಿ ಬೆಳೆಯುತ್ತದೆ ಮತ್ತು ಬೇಡಿಕೆಗೆ ಅನುಗುಣವಾಗಿ ಮಾಡೆಲ್ ನಿದರ್ಶನಗಳು ಆರಂಭಗೊಂಡು ಸ್ಥಗಿತಗೊಳ್ಳುತ್ತವೆ.
ಈ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಲು, ಮಾಡೆಲ್ ನಿದರ್ಶನಗಳ ನಡುವೆ ತಡೆರಹಿತ ಹಸ್ತಾಂತರ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸಿದೆವು. ಬದಲಾವಣೆ ಅಗತ್ಯವಾದಾಗ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ನಿದರ್ಶನದ ಜೊತೆಗೆ ಬದಲಿ ಮಾಡೆಲ್ ನಿದರ್ಶನವನ್ನು ಸಿದ್ಧಗೊಳಿಸಿ, ಪ್ರಸ್ತುತ ಸೆಷನ್ ಸಂದರ್ಭವನ್ನು ಅದರಲ್ಲಿ ಪೂರ್ವಭರ್ತಿ ಮಾಡಿ, ಎರಡರಲ್ಲೂ ಸಮಾನಾಂತರವಾಗಿ ಇನ್ಫರೆನ್ಸ್ ನಡೆಸಿ, ಹೊಸ ನಿದರ್ಶನ ಸಂಪೂರ್ಣ ಸಿದ್ಧವಾದಾಗ ಅದಕ್ಕೆ ಬದಲಾಯಿಸಬಹುದು.
ಇದೇ ಮೂಲ ವ್ಯವಸ್ಥೆಯು ಕ್ರಿಯಾತ್ಮಕ ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಗೂ ಬೆಂಬಲ ನೀಡುತ್ತದೆ. ಸಂಭಾಷಣೆ ಮುಂದುವರಿದಂತೆ, ಅದರ ಸಂಗ್ರಹಿತ ಸಂದರ್ಭವು ಕೊನೆಗೆ ಮಾಡೆಲ್ನ ಸಂದರ್ಭ ಮಿತಿಯನ್ನು ಮೀರಬಹುದು. ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯು ಸಂದರ್ಭದ ಗಾತ್ರವನ್ನು ಮಿತಿಯೊಳಗೆ ಹೊಂದುವಂತೆ ಕಡಿಮೆ ಮಾಡಬಹುದು, ಆದರೆ ಈ ಕಾರ್ಯಕ್ಕೆ ಸಮಯ ಬೇಕಾಗುತ್ತದೆ. ಇದು ಹಿಂದಿನ ಸಂದರ್ಭವನ್ನು ಬದಲಿಸುವುದರಿಂದ, ಹಿಂದೆ ಸಂಸ್ಕರಿಸಿದ ಟೋಕನ್ಗಳ ಗಮನ ಕೀಗಳು ಮತ್ತು ಮೌಲ್ಯಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಮಾಡೆಲ್ನ ಕೀ-ಮೌಲ್ಯ (KV) ಕ್ಯಾಶ್ ಕೂಡ ಅಮಾನ್ಯವಾಗುತ್ತದೆ. ಆ ಸ್ಥಿತಿಯನ್ನು ಮರುನಿರ್ಮಿಸಲು ಹೊಸ ಪೂರ್ವಭರ್ತಿ ಅಗತ್ಯವಾಗಿದ್ದು, ಹೆಚ್ಚುವರಿ ವಿಳಂಬ ಉಂಟಾಗುತ್ತದೆ.
ಅದರ ಬದಲು, ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆಯನ್ನು ಮತ್ತೊಂದು ನಿರ್ವಹಿತ ಬದಲಾವಣೆಯಾಗಿ ಪರಿಗಣಿಸುತ್ತೇವೆ. ಮೂಲ ಮಾಡೆಲ್ ನಿದರ್ಶನವು ಸಂಭಾಷಣೆಯನ್ನು ಮುಂದುವರಿಸುವಾಗ, ವ್ಯವಸ್ಥೆಯು ಸಂದರ್ಭವನ್ನು ಸಂಕುಚಿತಗೊಳಿಸಿ ಹೊಸ ಸಂದರ್ಭದೊಂದಿಗೆ ಬದಲಿ ಮಾಡೆಲ್ ನಿದರ್ಶನವನ್ನು ಸಿದ್ಧಪಡಿಸುತ್ತದೆ. ಆ ನಿದರ್ಶನ ಸಿದ್ಧವಾದ ಬಳಿಕ, ಮಾಧ್ಯಮಕ್ಕೆ ಯಾವುದೇ ಅಡಚಣೆಯಾಗದಂತೆ ಅದಕ್ಕೆ ಬದಲಾಯಿಸಬಹುದು. ಇದರಿಂದ ಅಗತ್ಯವಿದ್ದಾಗಲೆಲ್ಲ ಸಂದರ್ಭವನ್ನು ಸಂಕುಚಿತಗೊಳಿಸುತ್ತಾ, ದೀರ್ಘಕಾಲ ನಡೆಯುವ ಕರೆಗಳಿಗೆ ವ್ಯವಸ್ಥೆಯು ಬೆಂಬಲ ನೀಡಬಲ್ಲದು.
ಭಾರವಾದ ಕೆಲಸವು ನೇರ ಮಾರ್ಗದಿಂದ ಹೊರಗೇ ನಡೆಯುತ್ತದೆ. ಆದ್ದರಿಂದ ಹಸ್ತಾಂತರದ ವೇಳೆಯಲ್ಲೂ ಸಂಭಾಷಣೆಯ ಲಯ ತಪ್ಪುವುದಿಲ್ಲ.
ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸಿಕೊಳ್ಳುವ GPT‑Liveನ ಸಾಮರ್ಥ್ಯವು ಅದಕ್ಕೆ ಅಪಾರ ಶಕ್ತಿ ನೀಡುತ್ತದೆ. ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಇದು “ಮಾತನಾಡುವುದನ್ನು” ಆಳವಾದ “ಚಿಂತನೆಯಿಂದ” ಬೇರ್ಪಡಿಸುತ್ತದೆ. ಆದರೆ ಈ ಎರಡು-ಮಾಡೆಲ್ ವಾಸ್ತುಶಿಲ್ಪವು ಒಂದೇ ವ್ಯವಸ್ಥೆಯಂತೆ ಭಾಸವಾಗಲು, ಪರಸ್ಪರ ಸಂಬಂಧಿತ ಎರಡು ಎಂಜಿನಿಯರಿಂಗ್ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಬೇಕಾಯಿತು.
ಆಳವಾದ ಕೆಲಸಕ್ಕಾಗಿ ನಿಯೋಜನೆ
GPT-Live ವೇಗವಾಗಿ ಮತ್ತು ಸಹಜವಾಗಿ ಪ್ರತಿಕ್ರಿಯೆ ನೀಡುತ್ತದೆ, GPT-5.5 ಹಿನ್ನೆಲೆ ಹುಡುಕಾಟವನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ
ಮೊದಲನೆಯದಾಗಿ, ನಡೆಯುತ್ತಿರುವ ಸಂಭಾಷಣೆಯಲ್ಲಿ ಉಪಯುಕ್ತವಾಗಲು ಫಲಿತಾಂಶಗಳು ಸಾಕಷ್ಟು ಬೇಗ ಮರಳಬೇಕು. ಆದ್ದರಿಂದ ಮಾರ್ಗನಿರ್ದೇಶನ ಮತ್ತು ಪ್ರಾಂಪ್ಟ್ ಸಂಸ್ಕರಣೆಯಿಂದ ಇನ್ಫರೆನ್ಸ್ ಹಾಗೂ ಸಾಧನ ಕರೆಗಳವರೆಗೆ ಸಂಪೂರ್ಣ ನಿಯೋಜನಾ ಮಾರ್ಗದ ವಿಳಂಬವನ್ನು ಕಡಿಮೆ ಮಾಡಬೇಕಾಯಿತು. ಅದೇ ವೇಳೆ, ಉತ್ಪನ್ನದ ಇತರ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಇನ್ನೂ ಪ್ರತ್ಯೇಕ ಸಂದೇಶಗಳು ಬೇಕಾಗುತ್ತವೆ. ಹೀಗಾಗಿ ಅವು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ರೂಪದಲ್ಲಿ ನಡೆಯುತ್ತಿರುವ ಸಂಭಾಷಣೆಯನ್ನು ಪ್ರತಿನಿಧಿಸಬೇಕಾಯಿತು.
ನಿಯೋಜನೆಯನ್ನು ಕಳುಹಿಸಿದಾಗ, ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ ಸಂಭಾಷಣೆಗೆ ಉಪಯುಕ್ತವಾದದ್ದನ್ನು ನೀಡುವವರೆಗಿನ ಸಮಯವನ್ನು ಕಡಿಮೆ ಮಾಡಲು ನಾವು ಆದ್ಯತೆ ನೀಡುತ್ತೇವೆ. ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ ರೀಜನಿಂಗ್ ನಡೆಸುವಾಗ ಅಥವಾ ಸಾಧನಗಳನ್ನು ಬಳಸುವಾಗ, ಧ್ವನಿ ಮಾಡೆಲ್ ಸಂಭಾಷಣೆಯನ್ನು ಸ್ವಲ್ಪ ಹೊತ್ತು ಮುಂದುವರಿಸಬಹುದು. ಆದರೆ ಮಿತಿಮೀರಿದ ನಿಧಾನ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಮರೆಮಾಡಲಾಗದು. ಆದ್ದರಿಂದ ಮಾರ್ಗನಿರ್ದೇಶನ, ಪ್ರಾಂಪ್ಟ್ ಸಂಸ್ಕರಣೆ, ಇನ್ಫರೆನ್ಸ್ ಮತ್ತು ಸಾಧನ ಕರೆಗಳನ್ನು ಒಳಗೊಂಡ ಸಂಪೂರ್ಣ ನಿಯೋಜನಾ ಆವರ್ತವನ್ನು ಸ್ಪಂದನೆಯ ಸಮಯ ಮಿತಿಯ ಭಾಗವಾಗಿ ಪರಿಗಣಿಸಿದೆವು.
ನಿಯೋಜನೆಗೆ ವಿನಂತಿಸುವ ಮೊದಲೇ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ ಮತ್ತು ಅದಕ್ಕೆ ಬೇಕಾದ ಸಾಧನಗಳನ್ನು ಸಿದ್ಧಪಡಿಸುವುದು ಮೊದಲ ಸುಧಾರಣೆ. ಧ್ವನಿ ಸೆಷನ್ ಆರಂಭವಾದಾಗ, ಆ್ಯಪ್ ಸರ್ವರ್ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ಗಾಗಿ ಇನ್ಫರೆನ್ಸ್ ಸೆಷನ್ ರಚಿಸಿ, ಆರಂಭಿಕ ಸಂಭಾಷಣೆಯ ಸಂದರ್ಭವನ್ನು ಅದರಲ್ಲಿ ಪೂರ್ವಭರ್ತಿ ಮಾಡುತ್ತದೆ. ಇದರಿಂದ ಮೊದಲ ನಿಯೋಜಿತ ವಿನಂತಿಗೆ ಮೊದಲೇ ಪ್ರಾಂಪ್ಟ್ ಸಂಪೂರ್ಣವಾಗಿ ಸಂಸ್ಕರಿಸಲ್ಪಟ್ಟಿರುತ್ತದೆ.
ನಂತರ ಧ್ವನಿ ಸಂಭಾಷಣೆಯುದ್ದಕ್ಕೂ ಆ ಇನ್ಫರೆನ್ಸ್ ಸೆಷನ್ ಅನ್ನು ಲಭ್ಯವಿರಿಸಿ, ಮುಂದಿನ ವಿನಂತಿಗಳಿಗೆ ಸ್ಥಿರ ಸೆಷನ್ ಸಂಬಂಧವನ್ನು ಬಳಸುತ್ತೇವೆ. ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಜೊತೆಗೆ, ಈ ತಂತ್ರಗಳು ವಿಳಂಬವನ್ನು ಸುಧಾರಿಸುತ್ತವೆ ಮತ್ತು ಕಾರ್ಯನಿರ್ವಾಹಕದ ವೈಫಲ್ಯದಿಂದ ಸುಲಭವಾಗಿ ಚೇತರಿಸಿಕೊಳ್ಳಲು ಅವಕಾಶ ನೀಡುತ್ತವೆ.
ರೀಜನಿಂಗ್ ಪ್ರಯತ್ನ, ಔಟ್ಪುಟ್ ಮಿತಿಗಳು, ಸಾಧನ ಸ್ಕೀಮಾಗಳು ಮತ್ತು ಮಾಡೆಲ್-ಸಾಧನ ನಡುವಿನ ಸಂಚಾರವೂ ಸಂಭಾಷಣೆಗೆ ಉಪಯುಕ್ತ ಫಲಿತಾಂಶ ಸಿಗುವ ಸಮಯದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುತ್ತವೆ. ವೇಗವಾದ ಪ್ರತಿಕ್ರಿಯೆಗಾಗಿ ಇವುಗಳನ್ನು ಹೊಂದಿಸಿದೆವು. ನಿಯೋಜನಾ ಮಾರ್ಗದಲ್ಲಿ ಅಗತ್ಯವಿರುವ ಕೆಲಸವನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ, ನಮ್ಮ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್ಗಳ ಫಲಿತಾಂಶಗಳನ್ನು ಧ್ವನಿ ಮಾಡೆಲ್ ತ್ವರಿತವಾಗಿ ಅಳವಡಿಸಿಕೊಳ್ಳುವಂತೆ ಮಾಡಿದೆವು.
ಧ್ವನಿ ಮಾಡೆಲ್ ನಿರಂತರ ಮಾತಿನ ಸ್ಟ್ರೀಮ್ಗಳ ಮೇಲೆ ಕಾರ್ಯನಿರ್ವಹಿಸಿದರೂ, ChatGPTಯ ಸಂಭಾಷಣಾ ಬಳಕೆದಾರ ಅಂತರಸಂಪರ್ಕ ಮತ್ತು ನಮ್ಮ ವಿಶ್ಲೇಷಣಾ ಹಾಗೂ ಸುರಕ್ಷತಾ ಮೂಲಸೌಕರ್ಯದ ಕೆಲವು ಭಾಗಗಳು ಸೇರಿದಂತೆ ಅದರ ಸುತ್ತಲಿನ ಅನೇಕ ವ್ಯವಸ್ಥೆಗಳು ಇನ್ನೂ ಬಳಕೆದಾರ ಮತ್ತು ಸಹಾಯಕನ ಸರದಿಗಳ ಆಧಾರದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. ಹೀಗಾಗಿ, ಒಂದರ ಮೇಲೊಂದು ಬರುವ ಮತ್ತು ಕೆಲವೊಮ್ಮೆ ಅಸ್ಪಷ್ಟವಾಗಿರುವ ಸಂಭಾಷಣೆಯನ್ನು ಆ್ಯಪ್ ಸರ್ವರ್ ಪ್ರತ್ಯೇಕ ಸಂದೇಶಗಳಾಗಿ ವಿಭಜಿಸುತ್ತದೆ.
ಆಡಿಯೊ ಬಂದಂತೆ, ಯಾರು ಮಾತನಾಡುತ್ತಿದ್ದಾರೆಂದು ಊಹಿಸಲು ಮತ್ತು ಸಂದೇಶಗಳ ಸರತಿಯನ್ನು ನಿರ್ಮಿಸಲು ಸರ್ವರ್ ಭಾಗಶಃ ಲಿಪ್ಯಂತರಗಳು ಹಾಗೂ ಸಮಯ ಸಂಕೇತಗಳನ್ನು ಬಳಸುತ್ತದೆ. ಇತ್ತೀಚಿನ ಸಂದೇಶವು ತಾತ್ಕಾಲಿಕವಾಗಿರುತ್ತದೆ. ಹೆಚ್ಚಿನ ಮಾತು ಬಂದಂತೆ ಅದರ ಪಠ್ಯ, ಸಮಯ ಮತ್ತು ಮಾತುಗಾರನ ನಿಯೋಜನೆ ಎಲ್ಲವೂ ಬದಲಾಗಬಹುದು. ಮಾತುಗಾರನ ಗುರುತಿಸುವಿಕೆ ವಿಶ್ವಾಸಾರ್ಹವಾಗುವಷ್ಟು ಹೊತ್ತು ಅವರೇ ಮಾತನಾಡಿದ ಬಳಿಕ, ಸರ್ವರ್ ಸಂಬಂಧಿತ ಸಂದೇಶವನ್ನು ಅಂತಿಮಗೊಳಿಸುತ್ತದೆ.
ಮಾತುಗಾರರು ಏಕಕಾಲದಲ್ಲಿ ಮಾತನಾಡುವುದು ಇದನ್ನು ಮತ್ತಷ್ಟು ಸಂಕೀರ್ಣಗೊಳಿಸುತ್ತದೆ. ಬಳಕೆದಾರರು ಮಾತನಾಡುತ್ತಿರುವಾಗ ಸಹಾಯಕ ನೀಡುವ ಸಂಕ್ಷಿಪ್ತ ಪ್ರತಿಸ್ಪಂದನೆ, ಉದಾಹರಣೆಗೆ “ಹೂಂ” ಅಥವಾ “ಸರಿ”, ಪ್ರತ್ಯೇಕ ಸಂದೇಶವಾಗಲೇಬೇಕೆಂದಿಲ್ಲ. ಆದರೆ ಸಹಾಯಕನ ಅರ್ಥಪೂರ್ಣ ಮಧ್ಯಪ್ರವೇಶವು ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರತ್ಯೇಕ ಸಂದೇಶವಾಗಬೇಕು. ಅದೇ ರೀತಿ, ಬಳಕೆದಾರರು ಮಧ್ಯದಲ್ಲಿ ಮಾತನಾಡಿದರೂ ಪ್ರದರ್ಶಿಸಲಾದ ಸಹಾಯಕನ ಪ್ರತಿಕ್ರಿಯೆಗಳು ಸುಸಂಬದ್ಧವಾಗಿರಲು ಆದ್ಯತೆ ನೀಡುತ್ತೇವೆ.
ಪ್ರತಿಯೊಂದು ವಿಭಜನಾ ನೀತಿಯೂ ತಾಜಾತನ ಮತ್ತು ಖಚಿತತೆಯ ನಡುವೆ ರಾಜಿ ಮಾಡಿಕೊಳ್ಳುತ್ತದೆ. ತುಂಬ ಬೇಗ ಅಂತಿಮಗೊಳಿಸಿದರೆ ಇತಿಹಾಸ ತುಂಡಾಗುತ್ತದೆ ಮತ್ತು ಕ್ರಮ ಅಸ್ಥಿರವಾಗುತ್ತದೆ. ತುಂಬ ಹೊತ್ತು ಕಾದರೆ ಲಿಪ್ಯಂತರಗಳು ಹಾಗೂ ಅವುಗಳ ಮೇಲೆ ಅವಲಂಬಿತ ವೈಶಿಷ್ಟ್ಯಗಳು ವಿಳಂಬಗೊಳ್ಳುತ್ತವೆ. ಆದ್ದರಿಂದ ವ್ಯವಸ್ಥೆಯು ಸಂಭಾಷಣೆಯ ಎರಡು ಸಂಬಂಧಿತ ನೋಟಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ: ಪ್ರಸ್ತುತ ಸ್ಥಿತಿಯ ತಾತ್ಕಾಲಿಕ ನೋಟ ಮತ್ತು ಹೇಳಿದ ಮಾತಿನ ಅಧಿಕೃತ ದಾಖಲೆ. ಆ್ಯಪ್ನ ಬಳಕೆದಾರ ಅಂತರಸಂಪರ್ಕದಲ್ಲಿರುವ ಸಂಭಾಷಣಾ ನೋಟವು ನವೀಕರಣಗಳನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲುದರಿಂದ, ಅದು ತಾತ್ಕಾಲಿಕ ನೋಟವನ್ನು ಬಳಸುತ್ತದೆ. ಆದರೆ ವಿಶ್ಲೇಷಣಾ ಕಾರ್ಯವಾಹಿನಿಯಲ್ಲಿ ದಾಖಲಿಸಲು ಅಂತಿಮ ಲಿಪ್ಯಂತರ ಅಗತ್ಯ.
ಇದು ನೇರ ಧ್ವನಿ ಮಾರ್ಗದ ಮೇಲೆ ಸರದಿ ಪದ್ಧತಿಯನ್ನು ಹೇರದೆ, ಉಳಿದ ChatGPTಗೆ ಸಂಭಾಷಣೆಯ ಸ್ಥಿರ ನೋಟವನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಬಳಕೆದಾರರು ಗುಂಡಿ ಒತ್ತಿದ ಕ್ಷಣದಿಂದಲೇ ಸ್ಪಂದನಶೀಲತೆ ಆರಂಭವಾಗುತ್ತದೆ. GPT‑Liveನಲ್ಲಿ ಸಂಭಾಷಣೆ ಆರಂಭವಾಗುವ ಮೊದಲು, ವ್ಯವಸ್ಥೆಯು ಮಾಧ್ಯಮ ಮಾರ್ಗವನ್ನು ಸ್ಥಾಪಿಸಿ, ಮಾಡೆಲ್ ಮೂಲಕ ಆಡಿಯೊವನ್ನು ಕಳುಹಿಸಲು ಆರಂಭಿಸಬೇಕು. ಹೀಗಾಗಿ ಆರಂಭಿಕ ಅನುಕ್ರಮದ ಪ್ರತಿಯೊಂದು ಭಾಗವೂ ನಿರ್ಣಾಯಕ ಮಾರ್ಗದಲ್ಲಿರುತ್ತದೆ.
ಮೇಲೆ ಹೇಳಿದಂತೆ, WebRTC ನೈಜ-ಸಮಯಕ್ಕೆ ದೃಢವಾದ ಅಡಿಪಾಯ ಒದಗಿಸುತ್ತದೆ. ಆದರೆ ಸಾಮಾನ್ಯ WebRTC ಸೆಷನ್ ಆರಂಭಿಸಲು ಆಶ್ಚರ್ಯಕರ ಸಂಖ್ಯೆಯ ಶಿಷ್ಟಾಚಾರ ಹಸ್ತಲಾಘವಗಳು ಮತ್ತು ಜಾಲದ ಸುತ್ತಿನ ಸಂಚಾರಗಳು ಬೇಕಾಗುತ್ತವೆ. QUICನಂತಹ ನಂತರದ ಶಿಷ್ಟಾಚಾರಗಳನ್ನು ರೂಪಿಸಿದ ಸುತ್ತಿನ ಸಂಚಾರ ಕಡಿಮೆಗೊಳಿಸುವ ಒತ್ತಿಗಿಂತ WebRTC ಹಳೆಯದು. ಪರಿಣಾಮವಾಗಿ, ಅದರ ಆಧಾರಿತ ಶಿಷ್ಟಾಚಾರಗಳನ್ನು ಒಟ್ಟಿಗೆ ಬಳಸಿದಾಗ ಕೆಲವೊಮ್ಮೆ ಅವು ಒಂದೇ ಕೆಲಸವನ್ನು ಪುನರಾವರ್ತಿಸುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, ಸಂಪೂರ್ಣ WebRTC ವ್ಯವಸ್ಥೆಯ ಸಂದರ್ಭದಲ್ಲಿ ಅಗತ್ಯವಿಲ್ಲದಿದ್ದರೂ ಪ್ರತಿ ಶಿಷ್ಟಾಚಾರವು ತನ್ನದೇ ಆದ DoS-ನಿರೋಧಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಒಳಗೊಂಡಿತ್ತು.
ನಾವು ವ್ಯವಸ್ಥೆಯನ್ನು ವಿಶ್ಲೇಷಿಸಿ WebRTC ಸಂಕ್ಷಿಪ್ತ ಸುತ್ತಿನ ಸಂಚಾರ ಶಿಷ್ಟಾಚಾರವನ್ನು (WARP(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)) ಅಭಿವೃದ್ಧಿಪಡಿಸಿದೆವು. ಇದು ಮಾಧ್ಯಮ ಮತ್ತು ಡೇಟಾ ಆರಂಭಕ್ಕೆ ಬೇಕಾದ ಆರು ಜಾಲ ಸುತ್ತಿನ ಸಂಚಾರಗಳನ್ನು ಕೇವಲ ಒಂದಕ್ಕೆ ಇಳಿಸುತ್ತದೆ. ಹಿಂದಿನ ಆವೃತ್ತಿಗಳೊಂದಿಗೆ ಹೊಂದಿಕೊಳ್ಳುವ ಹಲವು ಶಿಷ್ಟಾಚಾರ ಸುಧಾರಣೆಗಳ ಮೂಲಕ WARP ಇದನ್ನು ಸಾಧಿಸುತ್ತದೆ: ICE ಮೇಲೆ DTLS ಹಸ್ತಲಾಘವವನ್ನು ಜೋಡಿಸುವುದು (SPED(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)), ವೇಗವಾದ DTLS 1.3(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಹಸ್ತಲಾಘವ ಬಳಸುವುದು, SCTP ಹಸ್ತಲಾಘವವನ್ನು ಮುಂಚಿತವಾಗಿ ಸಮಾಲೋಚಿಸುವುದು (SNAP(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)) ಮತ್ತು DCEP(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಬಳಸುವ ಬದಲು ಡೇಟಾ ವಾಹಿನಿಗಳನ್ನು ಮುಂಚಿತವಾಗಿ ಸಮಾಲೋಚಿಸುವುದು.
ವಿಸ್ತೃತ ಪರಿಸರವೂ ಈ ಕೆಲಸದ ಪ್ರಯೋಜನ ಪಡೆಯಲು, WebRTC ಸಮುದಾಯದ ಸಹಯೋಗಿಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡಿ WARP ಅನ್ನು ಮುಕ್ತ ನಿರ್ದಿಷ್ಟತೆಗಳ ಗುಚ್ಛವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಿದೆವು. IETFನ TSVWG ಕಾರ್ಯಗುಂಪಿನ ಮೂಲಕ ಪ್ರಸ್ತಾವನೆಗಳನ್ನು ಮುಂದುವರಿಸುತ್ತಿದ್ದೇವೆ. libwebrtc ಮತ್ತು Pion ಎರಡಕ್ಕೂ ಈಗಾಗಲೇ WARP ಬೆಂಬಲ ಸೇರಿಸಲಾಗಿದೆ ಹಾಗೂ ಇತರ WebRTC ಅನುಷ್ಠಾನಗಳಲ್ಲೂ ಕೆಲಸ ನಡೆಯುತ್ತಿದೆ.
ಮಾಧ್ಯಮ ಹಸ್ತಲಾಘವವನ್ನು ಸುಧಾರಿಸಿದ ಬಳಿಕವೂ ಒಂದು ವಿಳಂಬ ಎದ್ದು ಕಾಣುತ್ತಿತ್ತು: WebRTC ಸಂಪರ್ಕಗೊಳ್ಳುವ ಮೊದಲು SDP ನಿಯತಾಂಕಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳಲು ಬಳಸುವ ಸಂಕೇತ ವಿನಿಮಯ. ನಿರ್ಣಾಯಕ ಮಾರ್ಗದಿಂದ ಆ ವಿನಿಮಯವನ್ನು ತೆಗೆದುಹಾಕಲು, ನಾವು ಇನ್ಸ್ಟಂಟ್ ಕನೆಕ್ಟ್ ಎಂದು ಕರೆಯುವ ವ್ಯವಸ್ಥೆಯನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸಿದೆವು. ಇದು ಸರ್ವರ್ ಸಾಮರ್ಥ್ಯವನ್ನು ಕಾಯ್ದಿರಿಸದೆ ಮತ್ತು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ WebRTC ಅನುಷ್ಠಾನಗಳನ್ನು ಬದಲಿಸದೆ, ಈ ನಿಯತಾಂಕಗಳನ್ನು ಮುಂಚಿತವಾಗಿ ಸಮಾಲೋಚಿಸುತ್ತದೆ.
ಇನ್ಸ್ಟಂಟ್ ಕನೆಕ್ಟ್ ಪ್ರಮಾಣಿತ ಸಂಕೇತ ಹರಿವಿನ ಜೊತೆಯಲ್ಲೇ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಮುಂಚಿತವಾಗಿ ಸಮಾಲೋಚಿಸಿದ ನಿಯತಾಂಕಗಳು ಮಾನ್ಯವಾಗಿದ್ದರೆ, ಮೊದಲ ಮಾಧ್ಯಮ ಪ್ಯಾಕೆಟ್ ಬಂದಾಗ ಸರ್ವರ್ ಸೆಷನ್ ಅನ್ನು ರಚಿಸಬಹುದು. ಅವು ಹಳೆಯದಾಗಿದ್ದರೆ ಅಥವಾ ಅಮಾನ್ಯವಾಗಿದ್ದರೆ, ಸಂಕೇತ ಹರಿವು ಈಗಾಗಲೇ ನಡೆಯುತ್ತಿರುತ್ತದೆ. ಆದ್ದರಿಂದ ಕ್ಲೈಂಟ್ ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ವಿಳಂಬವಿಲ್ಲದೆ ಪರ್ಯಾಯ ಮಾರ್ಗಕ್ಕೆ ಮರಳಬಹುದು.
ಇನ್ಸ್ಟಂಟ್ ಕನೆಕ್ಟ್ ಮತ್ತು WARP ಒಟ್ಟಾಗಿ ಬಳಕೆದಾರರ ಉದ್ದೇಶದಿಂದ ನೇರ ಮಾಧ್ಯಮ ಹರಿವಿನವರೆಗಿನ ಸಮಯವನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತವೆ. SDP ವಿನಿಮಯವು ನಿರ್ಣಾಯಕ ಮಾರ್ಗದಿಂದ ಹೊರಗಿದ್ದು, WARP ಸಾಗಣೆ ಹಸ್ತಲಾಘವವನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸುವುದರಿಂದ, ಕ್ಲೈಂಟ್ ಈಗ ಒಂದೇ UDP ಪ್ಯಾಕೆಟ್ನೊಂದಿಗೆ ಸೆಷನ್ ಆರಂಭಿಸಬಹುದು. ಸರ್ವರ್ ತಕ್ಷಣ ಪ್ರತಿಕ್ರಿಯಿಸಬಹುದು. ಇದರಿಂದ ಉಳಿದ ವ್ಯವಸ್ಥೆಯು ಬಳಕೆದಾರರಿಗೆ ನಿಜವಾಗಿಯೂ ಮುಖ್ಯವಾದ ಕೇಳುವ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯಿಸುವ ಕೆಲಸವನ್ನು ಆರಂಭಿಸಬಹುದು.
ವ್ಯವಸ್ಥೆಯು ವಿನ್ಯಾಸದಲ್ಲಿ ವೇಗವಾಗಿ ಕಾಣಿಸಿದರೂ, ನೈಜ ಧ್ವನಿ ಸಂಚಾರದ ಒತ್ತಡದಲ್ಲಿ ಸ್ಥಗಿತಗೊಳ್ಳಬಹುದು. GPT‑Live ಬಳಕೆದಾರರೊಂದಿಗೆ ಸಂಭಾಷಿಸಲು ಅವಕಾಶ ನೀಡುವ ಮೊದಲು, ಉತ್ಪಾದನಾ ಪರಿಸರದ ChatGPT ವಾಯ್ಸ್ ಸೆಷನ್ಗಳಲ್ಲಿ ಸಣ್ಣ ಪ್ರಮಾಣವನ್ನು ಕ್ರಮೇಣ ಹೆಚ್ಚಿಸುತ್ತಾ, ಅವುಗಳನ್ನು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಸುಧಾರಿತ ಧ್ವನಿ ಮೋಡ್ ಅನುಭವಕ್ಕೂ ನಮ್ಮ ಹೊಸ ವ್ಯವಸ್ಥೆಗೂ ಕಳುಹಿಸುವ ಮೌನ ಪರೀಕ್ಷೆ ನಡೆಸಿದೆವು. ಸುಧಾರಿತ ಧ್ವನಿ ಮೋಡ್ ಎಂದಿನಂತೆ ಬಳಕೆದಾರರಿಗೆ ಸೇವೆ ನೀಡುವುದನ್ನು ಮುಂದುವರಿಸಿದರೆ, ನೆರಳು ಮಾರ್ಗವು ಓದಲು-ಮಾತ್ರ ಮೋಡ್ನಲ್ಲಿ ಇನ್ಫರೆನ್ಸ್ ನಡೆಸಿತು. ಇದರಿಂದ ಬಳಕೆದಾರರು ಕೇಳುವ ವಿಷಯ ಬದಲಾಗದೆಯೇ, ವ್ಯವಸ್ಥೆಯು ನೈಜ ಕ್ಲೈಂಟ್ಗಳು, ಜಾಲಗಳು, ವಿವಿಧ ಅವಧಿಯ ಸೆಷನ್ಗಳು ಮತ್ತು ಭೌಗೋಳಿಕ ಹಂಚಿಕೆಯನ್ನು ಎದುರಿಸಿತು.
ಸಾಮರ್ಥ್ಯವನ್ನು ಕೇವಲ GPU ಥ್ರೂಪುಟ್ಗೆ ಸೀಮಿತಗೊಳಿಸಲಾಗದು ಎಂಬುದು ನಮಗೆ ದೊರೆತ ಮೊದಲ ಪಾಠಗಳಲ್ಲಿ ಒಂದು. ಧ್ವನಿ ಸೆಷನ್ಗಳು ತೆರೆದಿದ್ದು ನಿರಂತರವಾಗಿ ಫ್ರೇಮ್ಗಳನ್ನು ಕಳುಹಿಸುವುದರಿಂದ, CPU ಭಾಗದ ಸ್ಟ್ರೀಮ್ ಹ್ಯಾಂಡ್ಲರ್ಗಳು, ಸರತಿಗಳು ಮತ್ತು ಜಾಲ ಮಾರ್ಗಗಳು ಇನ್ಫರೆನ್ಸ್ನೊಂದಿಗೆ ವಿಸ್ತರಿಸಬೇಕು. ನೈಜ ಹೊರೆ ಎದುರಾದಾಗ, ನಮ್ಮ ಹೊರೆ ಪರೀಕ್ಷೆಯ ಅಂದಾಜಿಗಿಂತ ಮೊದಲೇ ಒಂದು ಪೂರಕ ಘಟಕವು ಪೂರ್ಣ ಸಾಮರ್ಥ್ಯ ತಲುಪಿತು. ಇದರಿಂದ ಇನ್ಫರೆನ್ಸ್ ವಿನಂತಿಗಳು ಸಂಗ್ರಹವಾಗಿ ವಿಳಂಬ ಹೆಚ್ಚುತ್ತಾ ಹೋಯಿತು. ಸಾಮರ್ಥ್ಯದ ಪ್ರಶ್ನೆಯನ್ನು “ಒಂದು GPU ಎಷ್ಟು ವಿನಂತಿಗಳನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲದು?” ಎಂಬುದರಿಂದ “ಪ್ರತಿ ಫ್ರೇಮ್ ಸಮಯಕ್ಕೆ ಸರಿಯಾಗಿ ಸಾಗುವಂತೆ ವ್ಯವಸ್ಥೆಯು ಏಕಕಾಲದಲ್ಲಿ ಎಷ್ಟು ಸೆಷನ್ಗಳನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲದು?” ಎಂದು ಬದಲಾಯಿಸಿದೆವು.
ಈ ಪರೀಕ್ಷೆಯು ಭೌಗೋಳಿಕ ಸ್ಥಳವನ್ನೂ ಪ್ರಮುಖ ಪರಿಗಣನೆಯನ್ನಾಗಿಸಿತು. ದೂರದಲ್ಲಿರುವ ಸಾಮರ್ಥ್ಯಕ್ಕೆ ಸೆಷನ್ ಅನ್ನು ಕಳುಹಿಸುವುದರಿಂದ ಆರಂಭ ಮತ್ತು ಸ್ಟ್ರೀಮಿಂಗ್ನ ಹಲವು ಹಂತಗಳಲ್ಲಿ ವಿಳಂಬ ಉಂಟಾಗಬಹುದು. ಪ್ರಾದೇಶಿಕ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಸಂಚಾರ-ನಿರ್ದೇಶನ ಸಂರಚನೆಯೊಂದಿಗೆ ಮಾಡೆಲ್ ಬಿಡುಗಡೆಗಳನ್ನು ಪರಿಶೀಲಿಸಲು ಆರಂಭಿಸಿ, ಬಳಿಕ ಮೂಲದ ಭೌಗೋಳಿಕ ಸ್ಥಳದ ಆಧಾರದಲ್ಲಿ ವಿಳಂಬವನ್ನು ವಿಭಜಿಸಿ ವಿಶ್ಲೇಷಿಸಿದೆವು. ಇನ್ಫರೆನ್ಸ್ ಅನ್ನು ಬಳಕೆದಾರರಿಗೆ ಹತ್ತಿರಕ್ಕೆ ತರುವುದು ನೆರವಾಯಿತು. ಜೊತೆಗೆ, ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗಿನ ಸ್ಪಂದನಶೀಲತೆಯು ಮಾಡೆಲ್ ಸರ್ವರ್ ಒಂದರ ಮೇಲಲ್ಲ, ಮಾರ್ಗದಲ್ಲಿರುವ ಪ್ರತಿಯೊಂದು ಸೇವೆಯ ಮೇಲೂ ಅವಲಂಬಿತವಾಗಿದೆ ಎಂಬ ವಿಸ್ತೃತ ಪಾಠವನ್ನು ದೃಢಪಡಿಸಿತು.
ಇತರ ವೈಫಲ್ಯಗಳು ವಾಸ್ತವಿಕ ಸೆಷನ್ ಜೀವನಚಕ್ರಗಳಲ್ಲಿ ಮಾತ್ರ ಕಾಣಿಸಿಕೊಂಡವು. ದೀರ್ಘಕಾಲ ನಡೆಯುವ ಸೆಷನ್ಗಳು ಮೆಮೊರಿ ಮತ್ತು ಡೇಟಾ ಉಳಿಸುವಿಕೆಯ ಮೇಲಿನ ಒತ್ತಡವನ್ನು ಬಹಿರಂಗಪಡಿಸಿದವು. ಮರುಸಂಪರ್ಕಗಳು ಸಂದರ್ಭ ಸಂಕುಚಿತಗೊಳಿಸುವಿಕೆ ಮತ್ತು ಸ್ಥಿತಿ ಮರುಸ್ಥಾಪನೆಯನ್ನು ಪರೀಕ್ಷಿಸಿದವು. ಸಾಮಾನ್ಯ ಕ್ಲೈಂಟ್ ಸಂಪರ್ಕ ಕಡಿತಗಳು ಸ್ಥಗಿತಗೊಳಿಸುವಿಕೆಯ ಹಸ್ತಲಾಘವದಲ್ಲಿನ ರೇಸ್ ಸ್ಥಿತಿಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸಿದವು. ಈ ಸಮಸ್ಯೆಗಳು ಕಡಿಮೆ ಅವಧಿಯ ಹೊರೆ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ ಅಪರೂಪವಾಗಿ ಕಾಣಿಸಿದವು. ಏಕೆಂದರೆ ಅವು ಸಮಯ, ಸಂಗ್ರಹಿತ ಸ್ಥಿತಿ ಮತ್ತು ಸೇವೆಗಳ ಗಡಿಗಳನ್ನು ದಾಟುವ ವರ್ತನೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದ್ದವು.
ಅಂತಿಮವಾಗಿ, ಉತ್ಪಾದನಾ ಪರೀಕ್ಷೆಯು ವೀಕ್ಷಣಾ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಬಿಡುಗಡೆ ನಿಯಂತ್ರಣಗಳನ್ನು ಸುಧಾರಿಸುವಂತೆ ನಮ್ಮನ್ನು ಒತ್ತಾಯಿಸಿತು. ವಿಳಂಬದ ವಿಭಿನ್ನ ಮೂಲಗಳನ್ನು ಒಟ್ಟುಗೂಡಿಸಿದ್ದ ಮಾಪಕಗಳು, ಪ್ರತ್ಯೇಕವಾಗಿ ಅಸ್ವಸ್ಥವಾಗಿದ್ದ ಎಂಜಿನ್ಗಳನ್ನು ಒಟ್ಟು ಮೌಲ್ಯಗಳಲ್ಲಿ ಮರೆಮಾಡಿದ್ದ ಡ್ಯಾಶ್ಬೋರ್ಡ್ಗಳು ಮತ್ತು ಪರೀಕ್ಷಿತ ಹಾಗೂ ನಿಯೋಜಿತ ವ್ಯವಸ್ಥೆಗಳ ನಡುವಿನ ಸಂರಚನಾ ವ್ಯತ್ಯಾಸಗಳನ್ನು ಕಂಡುಕೊಂಡೆವು. ಇದಕ್ಕೆ ಪ್ರತಿಯಾಗಿ, ಹೆಚ್ಚು ಸೂಕ್ಷ್ಮವಾದ ದೂರಮಾಪನ, ಸರಿಯಾಗಿವೆ ಎಂದು ತಿಳಿದಿರುವ ಸಂರಚನೆಗಳ ವಿರುದ್ಧ ಪರಿಶೀಲನೆ, ಹಂತ ಹಂತವಾಗಿ ಸಂಚಾರ ಹೆಚ್ಚಿಸುವಿಕೆ ಮತ್ತು ಪ್ರತ್ಯೇಕ ಮಾರ್ಗಗಳನ್ನು ತ್ವರಿತವಾಗಿ ಪ್ರತ್ಯೇಕಿಸುವ ಅಥವಾ ನಿಷ್ಕ್ರಿಯಗೊಳಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಸೇರಿಸಿದೆವು. ಮೌನ ಪರೀಕ್ಷೆಯು ಆರಂಭಿಕ ಬಿಡುಗಡೆ ಪೂರ್ವಾಭ್ಯಾಸವಾಯಿತು. ವ್ಯವಸ್ಥೆಯು ಎಷ್ಟು ಸಂಚಾರವನ್ನು ಸ್ವೀಕರಿಸಬಲ್ಲದು ಎಂಬುದಕ್ಕೆ ಮಾತ್ರವಲ್ಲದೆ, ವೈಫಲ್ಯವನ್ನು ನಾವು ಎಷ್ಟು ಬೇಗ ಪತ್ತೆಹಚ್ಚಿ, ನಿಯಂತ್ರಿಸಿ, ಅದರಿಂದ ಚೇತರಿಸಿಕೊಳ್ಳಬಲ್ಲೆವು ಎಂಬುದಕ್ಕೂ ಅದು ಪರೀಕ್ಷೆಯಾಯಿತು.
GPT‑Live ಅನ್ನು ChatGPT ಮಟ್ಟಕ್ಕೆ ವಿಸ್ತರಿಸಲು ಒಂದು ಮೂಲಭೂತ ತತ್ವದ ಸುತ್ತ ನಿರ್ಮಿಸಿದ ಸಂಪೂರ್ಣ ಹೊಸ ವ್ಯವಸ್ಥೆ ಬೇಕಾಯಿತು: ಧ್ವನಿ ನಿರಂತರವಾಗಿ ಹರಿಯಬೇಕು. ಸ್ಟ್ರೀಮಿಂಗ್ ಇನ್ಫರೆನ್ಸ್ ಪೂರ್ಣ-ದ್ವಿಮುಖ ಮಾಡೆಲ್ಗೆ ನಿರಂತರವಾಗಿ ಆಡಿಯೊ ಒದಗಿಸುತ್ತದೆ. ಮೀಸಲಾದ ಮಾಧ್ಯಮ ಮಾರ್ಗವು ಫ್ರೇಮ್ಗಳ ವಿಶ್ವಾಸಾರ್ಹ ವಿತರಣೆಯನ್ನು ಖಚಿತಪಡಿಸುತ್ತದೆ. ಅಸಮಕಾಲಿಕ ನಿಯೋಜನೆಯಿಂದ ಆಳವಾದ ಚಿಂತನೆಯು ಸಮಾನಾಂತರವಾಗಿ ನಡೆಯುತ್ತದೆ. ಸುಧಾರಿತ ಸಾಗಣೆ ವ್ಯವಸ್ಥೆಯು ಬಳಕೆದಾರರವರೆಗೂ ಅನುಭವವನ್ನು ಸ್ಪಂದನಶೀಲವಾಗಿರಿಸುತ್ತದೆ.
GPT‑Live ಹಿಂದಿರುವ ವಾಸ್ತುಶಿಲ್ಪವು ಈಗಾಗಲೇ ನೈಜ-ಸಮಯದ ಸಂವಹನಕ್ಕಾಗಿ ವಿಸ್ತೃತ ಪ್ಲ್ಯಾಟ್ಫಾರ್ಮ್ ಆಗುತ್ತಿದೆ. ChatGPT ವಾಯ್ಸ್ ಸಂಭಾಷಣೆಯಿಂದ ಏಜೆಂಟ್ಗಳ ಸಮನ್ವಯದತ್ತ ವಿಸ್ತರಿಸುತ್ತಿರುವಾಗ ಇದುವೇ ಅದಕ್ಕೆ ಶಕ್ತಿ ನೀಡುತ್ತದೆ ಮತ್ತು ಮುಂಬರುವ GPT‑Live APIಗೂ ಅಡಿಪಾಯವಾಗಲಿದೆ. ಕಾಲಕ್ರಮೇಣ, ಧ್ವನಿ ಸಂಭಾಷಣೆಗೆ ನೇರ ಅನುಭವ ನೀಡುವ ತಕ್ಷಣದ ಸ್ಪಂದನೆಯನ್ನು ಕಳೆದುಕೊಳ್ಳದೆ, ಧ್ವನಿ ಅನುಭವಗಳು ಇನ್ನಷ್ಟು ಸಾಧನಗಳು, ಆ್ಯಪ್ಗಳು ಮತ್ತು ವಿಧಾನಗಳಿಗೆ ವಿಸ್ತರಿಸಲು ಇದು ನೆರವಾಗಲಿದೆ.
ನೀವು ಪರಿಹರಿಸಲು ಬಯಸುವ ಎಂಜಿನಿಯರಿಂಗ್ ಸಮಸ್ಯೆಗಳು ಇವೇ ಆಗಿದ್ದರೆ, ನಮ್ಮೊಂದಿಗೆ ಕೆಲಸ ಮಾಡಿ.

