
ಇಂದು ನಾವು ಡೆವಲಪರ್ಗಳು ಮತ್ತು ಉದ್ಯಮಗಳು ವಿಶ್ವಾಸಾರ್ಹ, ಉತ್ಪಾದನೆಗೆ ಸಿದ್ಧವಾಗಿರುವ ಧ್ವನಿ ಏಜೆಂಟ್ಗಳನ್ನು ನಿರ್ಮಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುವ ಹೊಸ ವೈಶಿಷ್ಟ್ಯಗಳೊಂದಿಗೆ ರಿಯಲ್ಟೈಮ್ API ಅನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಲಭ್ಯವಾಗುವಂತೆ ಮಾಡುತ್ತಿದ್ದೇವೆ. API ಈಗ ರಿಮೋಟ್ MCP ಸರ್ವರ್ಗಳು, ಚಿತ್ರ ಇನ್ಪುಟ್ಗಳು ಮತ್ತು ಸೆಷನ್ ಇನಿಶಿಯೇಶನ್ ಪ್ರೋಟೋಕಾಲ್ (SIP) ಮೂಲಕ ಫೋನ್ ಕರೆ ಮಾಡುವಿಕೆಯನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ, ಹೆಚ್ಚುವರಿ ಪರಿಕರಗಳು ಮತ್ತು ಸಂದರ್ಭಕ್ಕೆ ಪ್ರವೇಶದ ಮೂಲಕ ಧ್ವನಿ ಏಜೆಂಟ್ಗಳನ್ನು ಹೆಚ್ಚು ಸಮರ್ಥವಾಗಿಸುತ್ತದೆ.
ನಾವು ನಮ್ಮ ಅತ್ಯಂತ ಮುಂದುವರಿದ ಸ್ಪೀಚ್-ಟು-ಸ್ಪೀಚ್ ಮಾಡೆಲ್ ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ—gpt-realtime. ಹೊಸ ಮಾಡೆಲ್ ಸಂಕೀರ್ಣ ಸೂಚನೆಗಳನ್ನು ಅನುಸರಿಸುವುದು, ಉಪಕರಣಗಳನ್ನು ನಿಖರವಾಗಿ ಕರೆಯುವುದು ಮತ್ತು ಹೆಚ್ಚು ನೈಸರ್ಗಿಕ ಮತ್ತು ಅಭಿವ್ಯಕ್ತಿಶೀಲವಾಗಿ ಧ್ವನಿಸುವ ಭಾಷಣವನ್ನು ಉತ್ಪಾದಿಸುವಲ್ಲಿ ಸುಧಾರಣೆಗಳನ್ನು ತೋರಿಸುತ್ತದೆ. ಸಿಸ್ಟಮ್ ಸಂದೇಶಗಳು ಮತ್ತು ಡೆವಲಪರ್ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಅರ್ಥೈಸುವಲ್ಲಿ ಇದು ಉತ್ತಮವಾಗಿದೆ - ಅದು ಬೆಂಬಲ ಕರೆಯಲ್ಲಿ ಪದ-ಪದಕ್ಕೆ ಹಕ್ಕು ನಿರಾಕರಣೆ ಸ್ಕ್ರಿಪ್ಟ್ಗಳನ್ನು ಓದುವುದು, ಆಲ್ಫಾನ್ಯೂಮರಿಕ್ಸ್ ಅನ್ನು ಪುನರಾವರ್ತಿಸುವುದು ಅಥವಾ ವಾಕ್ಯದ ಮಧ್ಯದಲ್ಲಿ ಭಾಷೆಗಳ ನಡುವೆ ಸರಾಗವಾಗಿ ಬದಲಾಯಿಸುವುದು. ನಾವು ಸೀಡರ್ ಮತ್ತು ಮರಿನ್ ಎಂಬ ಎರಡು ಹೊಸ ಧ್ವನಿಗಳನ್ನು ಸಹ ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ, ಇವು ಇಂದಿನಿಂದ ರಿಯಲ್ಟೈಮ್ API ನಲ್ಲಿ ಪ್ರತ್ಯೇಕವಾಗಿ ಲಭ್ಯವಿದೆ.
ಕಳೆದ ಅಕ್ಟೋಬರ್ನಲ್ಲಿ ನಾವು ಮೊದಲು ಸಾರ್ವಜನಿಕ ಬೀಟಾದಲ್ಲಿ ರಿಯಲ್ಟೈಮ್ API ಅನ್ನು ಪರಿಚಯಿಸಿದಾಗಿನಿಂದ, ಸಾವಿರಾರು ಡೆವಲಪರ್ಗಳು API ನೊಂದಿಗೆ ನಿರ್ಮಿಸಿದ್ದಾರೆ ಮತ್ತು ನಾವು ಇಂದು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿರುವ ಸುಧಾರಣೆಗಳನ್ನು ರೂಪಿಸಲು ಸಹಾಯ ಮಾಡಿದ್ದಾರೆ—ಉತ್ಪಾದನೆಯಲ್ಲಿ ಧ್ವನಿ ಏಜೆಂಟ್ಗಳನ್ನು ಯಶಸ್ವಿಯಾಗಿ ನಿಯೋಜಿಸಲು ವಿಶ್ವಾಸಾರ್ಹತೆ, ಕಡಿಮೆ ಲೇಟೆನ್ಸಿ, ಮತ್ತು ಉತ್ತಮ ಗುಣಮಟ್ಟಕ್ಕಾಗಿ ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲಾಗಿದೆ. ಭಾಷಣದಿಂದ ಪಠ್ಯಕ್ಕೆ ಮತ್ತು ಪಠ್ಯದಿಂದ ಭಾಷಣಕ್ಕೆ ಬಹು ಮಾಡೆಲ್ಗಳನ್ನು ಒಟ್ಟಿಗೆ ಜೋಡಿಸುವ ಸಾಂಪ್ರದಾಯಿಕ ಪೈಪ್ಲೈನ್ಗಳಿಗಿಂತ ಭಿನ್ನವಾಗಿ, ರಿಯಲ್ಟೈಮ್ API ಒಂದೇ ಮಾಡೆಲ್ ಮತ್ತು API ಮೂಲಕ ನೇರವಾಗಿ ಆಡಿಯೊವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ರಚಿಸುತ್ತದೆ. ಇದು ಲೇಟೆನ್ಸಿಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಮಾತಿನಲ್ಲಿ ಸೂಕ್ಷ್ಮತೆಯನ್ನು ಕಾಪಾಡುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚು ನೈಸರ್ಗಿಕ, ಅಭಿವ್ಯಕ್ತಿಶೀಲ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.
“OpenAI ನ ರಿಯಲ್ಟೈಮ್ API ನಲ್ಲಿರುವ ಹೊಸ ಸ್ಪೀಚ್-ಟು-ಸ್ಪೀಚ್ ಮಾಡೆಲ್ ಬಲವಾದ ತಾರ್ಕಿಕತೆ ಮತ್ತು ಹೆಚ್ಚು ನೈಸರ್ಗಿಕ ಭಾಷಣವನ್ನು ತೋರಿಸುತ್ತದೆ—ಜೀವನಶೈಲಿಯ ಅಗತ್ಯಗಳಿಗೆ ಅನುಗುಣವಾಗಿ ಪಟ್ಟಿಗಳನ್ನು ಸಂಕುಚಿತಗೊಳಿಸುವುದು ಅಥವಾ ನಮ್ಮ BuyAbility ಸ್ಕೋರ್ನಂತಹ ಪರಿಕರಗಳೊಂದಿಗೆ ಕೈಗೆಟುಕುವ ಚರ್ಚೆಗಳನ್ನು ಮಾರ್ಗದರ್ಶನ ಮಾಡುವಂತಹ ಸಂಕೀರ್ಣ, ಬಹು-ಹಂತದ ವಿನಂತಿಗಳನ್ನು ನಿರ್ವಹಿಸಲು ಇದು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಇದು Zillow ನಲ್ಲಿ ಮನೆಯನ್ನು ಹುಡುಕುವುದು ಅಥವಾ ಹಣಕಾಸು ಆಯ್ಕೆಗಳನ್ನು ಅನ್ವೇಷಿಸುವುದು ಸ್ನೇಹಿತರೊಂದಿಗಿನ ಸಂಭಾಷಣೆಯಂತೆ ಸ್ವಾಭಾವಿಕವೆನಿಸುತ್ತದೆ, ಮನೆ ಖರೀದಿಸುವುದು, ಮಾರಾಟ ಮಾಡುವುದು ಮತ್ತು ಬಾಡಿಗೆಗೆ ಪಡೆಯುವಂತಹ ನಿರ್ಧಾರಗಳನ್ನು ಸರಳಗೊಳಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.”
– ಜೋಶ್ ವೈಸ್ಬರ್ಗ್, Zillow ನಲ್ಲಿ AI ಮುಖ್ಯಸ್ಥ
ಹೊಸ ಸ್ಪೀಚ್-ಟು-ಸ್ಪೀಚ್ ಮಾಡೆಲ್—gpt-realtime—ನಮ್ಮ ಅತ್ಯಂತ ಮುಂದುವರಿದ, ಉತ್ಪಾದನೆಗೆ ಸಿದ್ಧವಾಗಿರುವ ಧ್ವನಿ ಮಾದರಿಯಾಗಿದೆ. ಗ್ರಾಹಕರ ಬೆಂಬಲ, ವೈಯಕ್ತಿಕ ನೆರವು ಮತ್ತು ಶಿಕ್ಷಣದಂತಹ ನೈಜ-ಪ್ರಪಂಚದ ಕಾರ್ಯಗಳಲ್ಲಿ ಶ್ರೇಷ್ಠತೆಯನ್ನು ಸಾಧಿಸಲು ನಾವು ಗ್ರಾಹಕರೊಂದಿಗೆ ನಿಕಟ ಸಹಯೋಗದೊಂದಿಗೆ ಮಾಡೆಲ್ಗೆ ತರಬೇತಿ ನೀಡಿದ್ದೇವೆ—ಡೆವಲಪರ್ಗಳು ಧ್ವನಿ ಏಜೆಂಟ್ಗಳನ್ನು ಹೇಗೆ ನಿರ್ಮಿಸುತ್ತಾರೆ ಮತ್ತು ನಿಯೋಜಿಸುತ್ತಾರೆ ಎಂಬುದಕ್ಕೆ ಮಾಡೆಲ್ ಅನ್ನು ಜೋಡಿಸುವುದು. ಈ ಮಾಡೆಲ್ ಆಡಿಯೋ ಗುಣಮಟ್ಟ, ಬುದ್ಧಿವಂತಿಕೆ, ಸೂಚನೆಗಳನ್ನು ಅನುಸರಿಸುವುದು ಮತ್ತು ಕಾರ್ಯ ಕರೆಯಾದ್ಯಂತ ಸುಧಾರಣೆಗಳನ್ನು ತೋರಿಸುತ್ತದೆ.
ಜ ಜಗತ್ತಿನಲ್ಲಿ ಧ್ವನಿ ಏಜೆಂಟ್ಗಳನ್ನು ನಿಯೋಜಿಸಲು ನೈಸರ್ಗಿಕ ಧ್ವನಿಯ ಸಂಭಾಷಣೆ ನಿರ್ಣಾಯಕವಾಗಿದೆ. ಆನಂದದಾಯಕ ಅನುಭವವನ್ನು ರಚಿಸಲು ಮತ್ತು ಬಳಕೆದಾರರೊಂದಿಗೆ ನಿರಂತರ ಸಂಭಾಷಣೆಯನ್ನು ಪ್ರೋತ್ಸಾಹಿಸಲು ಮಾಡೆಲ್ಗಳು ಮಾನವನ ಸ್ವರ, ಭಾವನೆ ಮತ್ತು ವೇಗದೊಂದಿಗೆ ಮಾತನಾಡಬೇಕಾಗುತ್ತದೆ. "ತ್ವರಿತವಾಗಿ ಮತ್ತು ವೃತ್ತಿಪರವಾಗಿ ಮಾತನಾಡಿ" ಅಥವಾ "ಫ್ರೆಂಚ್ ಉಚ್ಚಾರಣೆಯಲ್ಲಿ ಸಹಾನುಭೂತಿಯಿಂದ ಮಾತನಾಡಿ" ನಂತಹ ಸೂಕ್ಷ್ಮ ಸೂಚನೆಗಳನ್ನು ಅನುಸರಿಸಬಹುದಾದ ಮತ್ತು ಹೆಚ್ಚು ನೈಸರ್ಗಿಕವಾಗಿ ಧ್ವನಿಸುವ ಉತ್ತಮ-ಗುಣಮಟ್ಟದ ಭಾಷಣವನ್ನು ಉತ್ಪಾದಿಸಲು ನಾವು gpt-realtime ಗೆ ತರಬೇತಿ ನೀಡಿದ್ದೇವೆ.
ನಾವು API ನಲ್ಲಿ ಎರಡು ಹೊಸ ಧ್ವನಿಗಳನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ, ಮರಿನ್ ಮತ್ತು ಸೀಡರ್, ನೈಸರ್ಗಿಕ-ಧ್ವನಿಯ ಭಾಷಣಕ್ಕೆ ಅತ್ಯಂತ ಗಮನಾರ್ಹ ಸುಧಾರಣೆಗಳೊಂದಿಗೆ. ಈ ಸುಧಾರಣೆಗಳಿಂದ ಪ್ರಯೋಜನ ಪಡೆಯಲು ನಾವು ನಮ್ಮ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಎಂಟು ಧ್ವನಿಗಳನ್ನು ನವೀಕರಿಸುತ್ತಿದ್ದೇವೆ.
gpt-realtime ಹೆಚ್ಚಿನ ಬುದ್ಧಿವಂತಿಕೆಯನ್ನು ತೋರಿಸುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚಿನ ನಿಖರತೆಯೊಂದಿಗೆ ಸ್ಥಳೀಯ ಆಡಿಯೋವನ್ನು ಗ್ರಹಿಸಬಲ್ಲದು. ಈ ಮಾಡೆಲ್ ಮೌಖಿಕವಲ್ಲದ ಸೂಚನೆಗಳನ್ನು (ನಗುವಿನಂತೆ) ಸೆರೆಹಿಡಿಯಬಹುದು, ವಾಕ್ಯದ ಮಧ್ಯದಲ್ಲಿ ಭಾಷೆಗಳನ್ನು ಬದಲಾಯಿಸಬಹುದು ಮತ್ತು ಸ್ವರವನ್ನು ಹೊಂದಿಕೊಳ್ಳಬಹುದು ("ಚುರುಕಾದ ಮತ್ತು ವೃತ್ತಿಪರ" ವರ್ಸಸ್ "ದಯೆ ಮತ್ತು ಸಹಾನುಭೂತಿ"). ಆಂತರಿಕ ಮೌಲ್ಯಮಾಪನಗಳ ಪ್ರಕಾರ, ಸ್ಪ್ಯಾನಿಷ್, ಚೈನೀಸ್, ಜಪಾನೀಸ್ ಮತ್ತು ಫ್ರೆಂಚ್ ಸೇರಿದಂತೆ ಇತರ ಭಾಷೆಗಳಲ್ಲಿ ಆಲ್ಫಾನ್ಯೂಮರಿಕ್ ಅನುಕ್ರಮಗಳನ್ನು (ಫೋನ್ ಸಂಖ್ಯೆಗಳು, VIN ಗಳು, ಇತ್ಯಾದಿ) ಪತ್ತೆಹಚ್ಚುವಲ್ಲಿ ಮಾಡೆಲ್ ಹೆಚ್ಚು ನಿಖರವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸುತ್ತದೆ. ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಅಳೆಯುವ ಬಿಗ್ ಬೆಂಚ್ ಆಡಿಯೋ ಮೌಲ್ಯ ಮಾಪನದಲ್ಲಿ, gpt-realtime 82.8% ನಿಖರತೆಯನ್ನು ಗಳಿಸುತ್ತದೆ—ಡಿಸೆಂಬರ್ 2024 ರ ನಮ್ಮ ಹಿಂದಿನ ಮಾಡೆಲ್ ಅನ್ನು ಹಿಂದಿಕ್ಕುತ್ತದೆ, ಅದು 65.6% ಅಂಕಗಳನ್ನು ಗಳಿಸುತ್ತದೆ.
ಬಿಗ್ ಬೆಂಚ್ ಆಡಿಯೋ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಬೆಂಚ್ಮಾರ್ಕ್ ಎಂಬುದು ಆಡಿಯೋ ಇನ್ಪುಟ್ ಅನ್ನು ಬೆಂಬಲಿಸುವ ಭಾಷಾ ಮಾಡೆಲ್ಗಳ ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ನಿರ್ಣಯಿಸಲು ಒಂದು ಮೌಲ್ಯಮಾಪನ ಡೇಟಾಸೆಟ್ ಆಗಿದೆ. ಈ ಡೇಟಾಸೆಟ್ ಬಿಗ್ ಬೆಂಚ್ ಹಾರ್ಡ್ನಿಂದ ಪ್ರಶ್ನೆಗಳನ್ನು—ಮುಂದುವರಿದ ತಾರ್ಕಿಕತೆಯ ಕಠಿಣ ಪರೀಕ್ಷೆಗಾಗಿ ಆಯ್ಕೆ ಮಾಡಲಾಗಿದೆ—ಆಡಿಯೋ ಡೊಮೇನ್ಗೆ ಅಳವಡಿಸುತ್ತದೆ.
ಸ್ಪೀಚ್-ಟು-ಸ್ಪೀಚ್ ಅರ್ಜಿಯನ್ನು ನಿರ್ಮಿಸುವಾಗ, ಡೆವಲಪರ್ಗಳು ಮಾಡೆಲ್ಗೆ ಹೇಗೆ ವರ್ತಿಸಬೇಕು ಎಂಬುದರ ಕುರಿತು ಸೂಚನೆಗಳನ್ನು ನೀಡುತ್ತಾರೆ, ಅದರಲ್ಲಿ ಹೇಗೆ ಮಾತನಾಡಬೇಕು, ನಿರ್ದಿಷ್ಟ ಸನ್ನಿವೇಶದಲ್ಲಿ ಏನು ಹೇಳಬೇಕು ಮತ್ತು ಏನು ಮಾಡಬೇಕು ಅಥವಾ ಮಾಡಬಾರದು ಎಂಬುದನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ. ಈ ಸೂಚನೆಗಳ ಅನುಸರಣೆಯ ಮೇಲೆ ನಾವು ನಮ್ಮ ಸುಧಾರಣೆಗಳನ್ನು ಕೇಂದ್ರೀಕರಿಸಿದ್ದೇವೆ, ಇದರಿಂದಾಗಿ ಸಣ್ಣ ನಿರ್ದೇಶನಗಳು ಸಹ ಮಾಡೆಲ್ಗೆ ಹೆಚ್ಚಿನ ಸಂಕೇತವನ್ನು ಸಾಗಿಸುತ್ತವೆ. ಮಲ್ಟಿಚಾಲೆಂಜ್ ಆಡಿಯೋ ಬೆಂಚ್ಮಾರ್ಕ್ ಅಳತೆ ಸೂಚನೆಯ ನಿಖರತೆಯನ್ನು ಅನುಸರಿಸಿ, gpt-realtime 30.5% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದೆ, ಇದು ಡಿಸೆಂಬರ್ 2024 ರಿಂದ ನಮ್ಮ ಹಿಂದಿನ ಮಾಡೆಲ್ಗಿಂತ ಗಮನಾರ್ಹ ಸುಧಾರಣೆಯಾಗಿದೆ, ಇದು 20.6% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದೆ.
ಮಲ್ಟಿಚಾಲೆಂಜ್(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ), LLM ಗಳು ಮನುಷ್ಯರೊಂದಿಗೆ ಬಹು-ತಿರುವು ಸಂಭಾಷಣೆಗಳನ್ನು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ನಿರ್ವಹಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತದೆ. ಪ್ರಸ್ತುತ ಗಡಿನಾಡು ಮಾಡೆಲ್ಗಳು ಎದುರಿಸುತ್ತಿರುವ ವಾಸ್ತವಿಕ ಸವಾಲುಗಳ ನಾಲ್ಕು ವರ್ಗಗಳ ಮೇಲೆ ಇದು ಕೇಂದ್ರೀಕರಿಸುತ್ತದೆ. ಈ ಸವಾಲುಗಳಿಗೆ ಮಾಡೆಲ್ಗಳು ಸೂಚನೆ-ಅನುಸರಣೆ, ಸಂದರ್ಭ ನಿರ್ವಹಣೆ ಮತ್ತು ಸಂದರ್ಭೋಚಿತ ತಾರ್ಕಿಕತೆಯನ್ನು ಏಕಕಾಲದಲ್ಲಿ ಸಂಯೋಜಿಸುವ ಅಗತ್ಯವಿದೆ. ಈ ಮೌಲ್ಯಮಾಪನದ ಆಡಿಯೊ ಆವೃತ್ತಿಯನ್ನು ರಚಿಸಲು ನಾವು ಪರೀಕ್ಷಾ ಪ್ರಶ್ನೆಗಳ ಆಡಿಯೊ-ಸ್ನೇಹಿ ಉಪವಿಭಾಗವನ್ನು ಪಠ್ಯದಿಂದ ಭಾಷಣಕ್ಕೆ ಪರಿವರ್ತಿಸಿದ್ದೇವೆ.
ಭಾಷಣದಿಂದ ಭಾಷಣಕ್ಕೆ ಮಾಡೆಲ್ನೊಂದಿಗೆ ಸಮರ್ಥ ಧ್ವನಿ ಏಜೆಂಟ್ ಅನ್ನು ನಿರ್ಮಿಸಲು, ಮಾಡೆಲ್ ಉತ್ಪಾದನೆಯಲ್ಲಿ ಉಪಯುಕ್ತವಾಗಲು ಸರಿಯಾದ ಸಮಯದಲ್ಲಿ ಸರಿಯಾದ ಪರಿಕರಗಳನ್ನು ಕರೆಯಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ. ನಾವು ಮೂರು ಅಕ್ಷಗಳಲ್ಲಿ ಕಾರ್ಯ ಕರೆ ಮಾಡುವಿಕೆಯನ್ನು ಸುಧಾರಿಸಿದ್ದೇವೆ: ಸಂಬಂಧಿತ ಕಾರ್ಯಗಳನ್ನು ಕರೆಯುವುದು, ಸೂಕ್ತ ಸಮಯದಲ್ಲಿ ಕಾರ್ಯಗಳನ್ನು ಕರೆಯುವುದು ಮತ್ತು ಸೂಕ್ತವಾದ ವಾದಗಳೊಂದಿಗೆ ಕಾರ್ಯಗಳನ್ನು ಕರೆಯುವುದು (ಇದರಿಂದಾಗಿ ಹೆಚ್ಚಿನ ನಿಖರತೆ ಕಂಡುಬರುತ್ತದೆ). ComplexFuncBench ಆಡಿಯೋ ಇವಾಲ್ ಮಾಪನ ಕಾರ್ಯದ ಕರೆ ಕಾರ್ಯಕ್ಷಮತೆಯಲ್ಲಿ, gpt-realtime 66.5% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದರೆ, ಡಿಸೆಂಬರ್ 2024 ರ ನಮ್ಮ ಹಿಂದಿನ ಮಾಡೆಲ್ 49.7% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದೆ.
ನಾವು ಅಸಮಕಾಲಿಕ ಕಾರ್ಯ ಕರೆ ಮಾಡುವಿಕೆಯಲ್ಲೂ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಸುಧಾರಣೆಗಳನ್ನು ಮಾಡಿದ್ದೇವೆ. ದೀರ್ಘಕಾಲೀನ ಕಾರ್ಯ ಕರೆಗಳು ಇನ್ನು ಮುಂದೆ ಸೆಷನ್ನ ಹರಿವಿಗೆ ಅಡ್ಡಿಪಡಿಸುವುದಿಲ್ಲ—ಫಲಿತಾಂಶಗಳಿಗಾಗಿ ಕಾಯುತ್ತಿರುವಾಗ ಮಾಡೆಲ್ ಅನಿಶ್ಚಿತ ಸಂಭಾಷಣೆಯನ್ನು ಮುಂದುವರಿಸಬಹುದು. ಈ ವೈಶಿಷ್ಟ್ಯವು ಸ್ಥಳೀಯವಾಗಿ gpt-realtime ನಲ್ಲಿ ಲಭ್ಯವಿದೆ, ಆದ್ದರಿಂದ ಡೆವಲಪರ್ಗಳು ತಮ್ಮ ಕೋಡ್ ಅನ್ನು ನವೀಕರಿಸುವ ಅಗತ್ಯವಿಲ್ಲ.
ComplexFuncBench(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಮಾಡೆಲ್ಗಳು ಸವಾಲಿನ ಕಾರ್ಯ ಕರೆ ಮಾಡುವ ಕಾರ್ಯಗಳನ್ನು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ನಿರ್ವಹಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಅಳೆಯುತ್ತದೆ. ಇದು ಬಹು-ಹಂತದ ಕರೆಗಳು, ನಿರ್ಬಂಧಗಳು ಅಥವಾ ಸೂಚ್ಯ ನಿಯತಾಂಕಗಳ ಬಗ್ಗೆ ತಾರ್ಕಿಕತೆ, ಬಹಳ ದೀರ್ಘವಾದ ಇನ್ಪುಟ್ಗಳನ್ನು ನಿರ್ವಹಿಸುವಂತಹ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತದೆ. ನಮ್ಮ ಮಾಡೆಲ್ಗಾಗಿ ಈ ಮೌಲ್ಯಮಾಪನವನ್ನು ನಿರ್ಮಿಸಲು ನಾವು ಮೂಲ ಪಠ್ಯ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಭಾಷಣಕ್ಕೆ ಪರಿವರ್ತಿಸಿದ್ದೇವೆ.
ರಿಮೋಟ್ MCP ಸರ್ವರ್ನ URL ಅನ್ನು ಸೆಷನ್ ಕಾನ್ಫಿಗರೇಶನ್ಗೆ ರವಾನಿಸುವ ಮೂಲಕ ನೀವು ರಿಯಲ್ಟೈಮ್ API ಸೆಷನ್ನಲ್ಲಿ MCP ಬೆಂಬಲವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬಹುದು. ಒಮ್ಮೆ ಸಂಪರ್ಕಗೊಂಡ ನಂತರ, API ಸ್ವಯಂಚಾಲಿತವಾಗಿ ನಿಮಗಾಗಿ ಪರಿಕರ ಕರೆಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ, ಆದ್ದರಿಂದ ಏಕೀಕರಣಗಳನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ವೈರ್ ಮಾಡುವ ಅಗತ್ಯವಿಲ್ಲ.
ಈ ಸೆಟಪ್ ನಿಮ್ಮ ಏಜೆಂಟ್ ಅನ್ನು ಹೊಸ ಸಾಮರ್ಥ್ಯಗಳೊಂದಿಗೆ ವಿಸ್ತರಿಸಲು ಸುಲಭಗೊಳಿಸುತ್ತದೆ—ಸೆಷನ್ ಅನ್ನು ಬೇರೆ MCP ಸರ್ವರ್ಗೆ ಪಾಯಿಂಟ್ ಮಾಡಿ, ಮತ್ತು ಆ ಪರಿಕರಗಳು ತಕ್ಷಣವೇ ಲಭ್ಯವಾಗುತ್ತವೆ. ರಿಯಲ್ಟೈಮ್ನೊಂದಿಗೆ MCP ಅನ್ನು ಕಾನ್ಫಿಗರ್ ಮಾಡುವ ಬಗ್ಗೆ ಇನ್ನಷ್ಟು ತಿಳಿದುಕೊಳ್ಳಲು, ಈ ಮಾರ್ಗದರ್ಶಿಯನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಪರಿಶೀಲಿಸಿ.
ಈಗ gpt-realtime ನಲ್ಲಿ ಬೆಂಬಲಿತವಾದ ಚಿತ್ರ ಇನ್ಪುಟ್ಗಳೊಂದಿಗೆ, ನೀವು ರಿಯಲ್ಟೈಮ್ API ಸೆಷನ್ಗೆ ಆಡಿಯೋ ಅಥವಾ ಪಠ್ಯದ ಜೊತೆಗೆ ಚಿತ್ರಗಳು, ಫೋಟೋಗಳು ಮತ್ತು ಸ್ಕ್ರೀನ್ಶಾಟ್ಗಳನ್ನು ಸೇರಿಸಬಹುದು. ಈಗ ಮಾಡೆಲ್ ಬಳಕೆದಾರರು ನಿಜವಾಗಿ ಏನನ್ನು ನೋಡುತ್ತಿದ್ದಾರೆ ಎಂಬುದರ ಮೇಲೆ ಸಂಭಾಷಣೆಯನ್ನು ನೆಲೆಗೊಳಿಸಬಹುದು, ಬಳಕೆದಾರರು "ನೀವು ಏನು ನೋಡುತ್ತೀರಿ?" ಅಥವಾ "ಈ ಸ್ಕ್ರೀನ್ಶಾಟ್ನಲ್ಲಿರುವ ಪಠ್ಯವನ್ನು ಓದಿ" ಎಂಬಂತಹ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.
ಚಿತ್ರವನ್ನು ಲೈವ್ ವೀಡಿಯೊ ಸ್ಟ್ರೀಮ್ನಂತೆ ಪರಿಗಣಿಸುವ ಬದಲು, ವ್ಯವಸ್ಥೆಯು ಅದನ್ನು ಸಂಭಾಷಣೆಗೆ ಚಿತ್ರವನ್ನು ಸೇರಿಸುವ ರೀತಿಯಲ್ಲಿ ಪರಿಗಣಿಸುತ್ತದೆ. ನಿಮ್ಮ ಆ್ಯಪ್ ಮಾಡೆಲ್ನೊಂದಿಗೆ ಯಾವ ಚಿತ್ರಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳಬೇಕು ಮತ್ತು ಅವುಗಳನ್ನು ಯಾವಾಗ ಹಂಚಿಕೊಳ್ಳಬೇಕು ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸಬಹುದು. ಈ ರೀತಿಯಾಗಿ, ಮಾಡೆಲ್ ಏನು ನೋಡುತ್ತದೆ ಮತ್ತು ಅದು ಯಾವಾಗ ಪ್ರತಿಕ್ರಿಯಿಸುತ್ತದೆ ಎಂಬುದರ ಮೇಲೆ ನೀವು ನಿಯಂತ್ರಣದಲ್ಲಿರುತ್ತೀರಿ.
ಚಿತ್ರ ಇನ್ಪುಟ್ನೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಲು ನಮ್ಮ ದಾಖಲೆಗಳನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಪರಿಶೀಲಿಸಿ.
ರಿಯಲ್ಟೈಮ್ API ಅನ್ನು ಸಂಯೋಜಿಸಲು ಸುಲಭಗೊಳಿಸಲು ಮತ್ತು ಉತ್ಪಾದನಾ ಬಳಕೆಗೆ ಹೆಚ್ಚು ಹೊಂದಿಕೊಳ್ಳುವಂತೆ ಮಾಡಲು ನಾವು ಹಲವಾರು ಇತರ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಸೇರಿಸಿದ್ದೇವೆ.
- ಸೆಷನ್ ಇನಿಶಿಯೇಶನ್ ಪ್ರೋಟೋಕಾಲ್ (SIP) ಬೆಂಬಲ: ನಿಮ್ಮ ಆ್ಯಪ್ಗಳನ್ನು ಸಾರ್ವಜನಿಕ ಫೋನ್ ನೆಟ್ವರ್ಕ್, PBX ಸಿಸ್ಟಮ್ಗಳು, ಡೆಸ್ಕ್ ಫೋನ್ಗಳು ಮತ್ತು ಇತರ SIP ಅಂತ್ಯಬಿಂದುಗಳಿಗೆ ನೈಜ ಸಮಯದ API ನಲ್ಲಿ ನೇರ ಬೆಂಬಲದೊಂದಿಗೆ ಸಂಪರ್ಕಪಡಿಸಿ. ಅದರ ಬಗ್ಗೆ ದಾಖಲೆಗಳಲ್ಲಿ ಓದಿ.(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)
- ಮರುಬಳಕೆ ಮಾಡಬಹುದಾದ ಪ್ರಾಂಪ್ಟ್ಗಳು: ನೀವು ಈಗ—ಡೆವಲಪರ್ ಸಂದೇಶಗಳು, ಪರಿಕರಗಳು, ವೇರಿಯೇಬಲ್ಗಳು ಮತ್ತು ಉದಾಹರಣೆ ಬಳಕೆದಾರ/ಸಹಾಯಕ ಸಂದೇಶಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು—ಪ್ರತಿಕ್ರಿಯೆಗಳ API ನಲ್ಲಿರುವಂತೆ ನೈಜ ಸಮಯದ API ಸೆಷನ್ಗಳಾದ್ಯಂತ ಉಳಿಸಬಹುದು ಮತ್ತು ಮರುಬಳಕೆ ಮಾಡಬಹುದು. ಡಾಕ್ಸ್ನಲ್ಲಿ ಇನ್ನಷ್ಟು ತಿಳಿಯಿರಿ.(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ)
ದುರುಪಯೋಗವನ್ನು ತಡೆಗಟ್ಟಲು ಸಹಾಯ ಮಾಡಲು ರಿಯಲ್ಟೈಮ್ API ಬಹು ಪದರಗಳ ಸುರಕ್ಷತೆ ಮತ್ತು ತಗ್ಗಿಸುವಿಕೆಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. ನಮ್ಮ ಸುರಕ್ಷತಾ ವಿಧಾನ ಮತ್ತು ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್ ವಿವರಗಳ ಕುರಿತು ನೀವು ಬೀಟಾ ಪ್ರಕಟಣೆ ಬ್ಲಾಗ್ನಲ್ಲಿ ಇನ್ನಷ್ಟು ತಿಳಿದುಕೊಳ್ಳಬಹುದು. ನಾವು ರಿಯಲ್ಟೈಮ್ API ಸೆಷನ್ಗಳಲ್ಲಿ ಸಕ್ರಿಯ ವರ್ಗೀಕರಣಕಾರಕಗಳನ್ನು ಬಳಸುತ್ತೇವೆ, ಅಂದರೆ ಕೆಲವು ಸಂಭಾಷಣೆಗಳು ನಮ್ಮ ಹಾನಿಕಾರಕ ವಿಷಯ ಮಾರ್ಗಸೂಚಿಗಳನ್ನು ಉಲ್ಲಂಘಿಸುತ್ತಿವೆ ಎಂದು ಪತ್ತೆಯಾದರೆ ಅವುಗಳನ್ನು ನಿಲ್ಲಿಸಬಹುದು. ಏಜೆಂಟ್ಸ್ SDK(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಬಳಸಿಕೊಂಡು ಡೆವಲಪರ್ಗಳು ತಮ್ಮದೇ ಆದ ಹೆಚ್ಚುವರಿ ಸುರಕ್ಷತಾ ಗಾರ್ಡ್ರೈಲ್ಗಳನ್ನು ಸುಲಭವಾಗಿ ಸೇರಿಸಬಹುದು.
ನಮ್ಮ ಬಳಕೆಯ ನೀತಿಗಳು ಸ್ಪ್ಯಾಮ್, ವಂಚನೆ ಅಥವಾ ಇತರ ಹಾನಿಕಾರಕ ಉದ್ದೇಶಗಳಿಗಾಗಿ ನಮ್ಮ ಸೇವೆಗಳಿಂದ ಔಟ್ಪುಟ್ಗಳನ್ನು ಮರುಬಳಕೆ ಮಾಡುವುದು ಅಥವಾ ವಿತರಿಸುವುದನ್ನು ನಿಷೇಧಿಸುತ್ತವೆ. ಡೆವಲಪರ್ಗಳು AI ಜೊತೆ ಸಂವಹನ ನಡೆಸುವಾಗ ಅಂತಿಮ ಬಳಕೆದಾರರಿಗೆ ಅದನ್ನು ಸ್ಪಷ್ಟಪಡಿಸಬೇಕು, ಅದು ಈಗಾಗಲೇ ಸಂದರ್ಭದಿಂದ ಸ್ಪಷ್ಟವಾಗಿದ್ದರೆ ಮಾತ್ರ. ದುರುದ್ದೇಶಪೂರಿತ ನಟರು ಇತರರಂತೆ ನಟಿಸುವುದನ್ನು ತಡೆಯಲು ರಿಯಲ್ಟೈಮ್ API ಮೊದಲೇ ಹೊಂದಿಸಲಾದ ಧ್ವನಿಗಳನ್ನು ಬಳಸುತ್ತದೆ.
ರಿಯಲ್ಟೈಮ್ API, EU-ಆಧಾರಿತ ಅರ್ಜಿಗಳಿಗಾಗಿ EU ಡೇಟಾ ರೆಸಿಡೆನ್ಸಿಯನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಸಂಪೂರ್ಣವಾಗಿ ಬೆಂಬಲಿಸುತ್ತದೆ ಮತ್ತು ನಮ್ಮ ಎಂಟರ್ಪ್ರೈಸ್ ಗೌಪ್ಯತೆ ಬದ್ಧತೆಗಳಿಂದ ಒಳಗೊಳ್ಳುತ್ತದೆ.
ಸಾಮಾನ್ಯವಾಗಿ ಲಭ್ಯವಿರುವ ರಿಯಲ್ಟೈಮ್ API ಮತ್ತು ಹೊಸ gpt-realtime ಮಾಡೆಲ್ ಇಂದಿನಿಂದ ಎಲ್ಲಾ ಡೆವಲಪರ್ಗಳಿಗೆ ಲಭ್ಯವಿದೆ. gpt-4o-realtime-preview ಗೆ ಹೋಲಿಸಿದರೆ ನಾವು gpt-realtime ಗಾಗಿ 20% ರಷ್ಟು ಬೆಲೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತಿದ್ದೇವೆ—$32 / 1M ಆಡಿಯೋ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳು (ಕ್ಯಾಶ್ ಮಾಡಿದ ಇನ್ಪುಟ್ token ಗಳಿಗೆ $0.40) ಮತ್ತು $64 / 1M ಆಡಿಯೋ ಔಟ್ಪುಟ್ token ಗಳು (ವಿವರವಾದ ಬೆಲೆ ನಿಗದಿಯನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನೋಡಿ). ಸಂಭಾಷಣೆಯ ಸಂದರ್ಭಕ್ಕಾಗಿ ನಾವು ಸೂಕ್ಷ್ಮ ನಿಯಂತ್ರಣವನ್ನು ಸೇರಿಸಿದ್ದೇವೆ, ಇದರಿಂದಾಗಿ ಡೆವಲಪರ್ಗಳು ಬುದ್ಧಿವಂತ token ಮಿತಿಗಳನ್ನು ಹೊಂದಿಸಬಹುದು ಮತ್ತು ಏಕಕಾಲದಲ್ಲಿ ಬಹು ತಿರುವುಗಳನ್ನು ಮೊಟಕುಗೊಳಿಸಬಹುದು, ದೀರ್ಘ ಸೆಷನ್ಗಳ ವೆಚ್ಚವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು.
ಪ್ರಾರಂಭಿಸಲು, ನಮ್ಮ ರಿಯಲ್ಟೈಮ್ API ದಸ್ತಾವೇಜನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಭೇಟಿ ಮಾಡಿ, Playground(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ಹೊಸ ಮಾಡೆಲ್ ಅನ್ನು ಪರೀಕ್ಷಿಸಿ ಮತ್ತು ನಮ್ಮ ರಿಯಲ್ಟೈಮ್ API ಪ್ರಾಂಪ್ಟಿಂಗ್ ಮಾರ್ಗದರ್ಶಿಯನ್ನು(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ವೀಕ್ಷಿಸಿ.


