ಮುಖ್ಯ ವಿಷಯಕ್ಕೆ ನೇರವಾಗಿ ಹೋಗಿ
OpenAI

API ನಲ್ಲಿ ಮುಂದಿನ ತಲೆಮಾರಿನ ಆಡಿಯೋ ಮಾಡೆಲ್ ಗಳನ್ನು ಪರಿಚಯಿಸಲಾಗುತ್ತಿದೆ

ವಾಯ್ಸ್ ಏಜೆಂಟ್‌ಗಳಿಗೆ ಶಕ್ತಿ ನೀಡಲು ಹೊಸ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳ ಸಮೂಹ, ಈಗ ವಿಶ್ವದಾದ್ಯಂತ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಲಭ್ಯವಿದೆ.

OpenAI ಮುಂದಿನ ತಲೆಮಾರಿನ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳ ಬ್ಲಾಗ್ ಹೀರೋ ಇಮೇಜ್
ಲೋಡ್ ಆಗುತ್ತಿದೆ…

28 ಆಗಸ್ಟ್, 2025 ನವೀಕರಣ: ನೈಜ ಸಮಯದ API ಯ ಸಾಮಾನ್ಯ ಲಭ್ಯತೆಯನ್ನು ನಾವು ಘೋಷಿಸಿದ್ದೇವೆ. ಇಲ್ಲಿ ಇನ್ನಷ್ಟು ತಿಳಿಯಿರಿ.


ಕಳೆದ ಕೆಲವು ತಿಂಗಳುಗಳಲ್ಲಿ, ಕಾರ್ಯನಿರ್ವಾಹಕ, ಡೀಪ್ ರಿಸರ್ಚ್, ಕಂಪ್ಯೂಟರ್-ಯೂಸಿಂಗ್ ಏಜೆಂಟ್‌ಗಳು ಮತ್ತು ಬಿಲ್ಟ್-ಇನ್ ಟೂಲ್‌ಗಳೊಂದಿಗೆ ಪ್ರತಿಕ್ರಿಯೆ API ಮುಂತಾದ ಬಿಡುಗಡೆಗಳ ಮೂಲಕ, ಬಳಕೆದಾರರ ಪರವಾಗಿ ಸ್ವತಂತ್ರವಾಗಿ ಕಾರ್ಯಗಳನ್ನು ಸಾಧಿಸುವ ಪಠ್ಯ-ಆಧಾರಿತ ಏಜೆಂಟ್‌ಗಳು—ಅಥವಾ ವ್ಯವಸ್ಥೆಗಳು—ಇವುಗಳ ಬುದ್ಧಿಮತ್ತೆ, ಸಾಮರ್ಥ್ಯಗಳು ಮತ್ತು ಉಪಯುಕ್ತತೆಯನ್ನು ಮುಂದುವರಿಸಲು ನಾವು ಹೂಡಿಕೆ ಮಾಡಿದ್ದೇವೆ. ಆದಾಗ್ಯೂ, ಏಜೆಂಟ್‌ಗಳು ನಿಜವಾಗಿಯೂ ಉಪಯುಕ್ತವಾಗಲು, ಜನರು ಕೇವಲ ಪಠ್ಯದಾಚೆಗೆ ಏಜೆಂಟ್‌ಗಳೊಂದಿಗೆ ಆಳವಾದ ಮತ್ತು ಹೆಚ್ಚು ಸಹಜ ಸಂವಹನಗಳನ್ನು ಹೊಂದಲು ಸಾಧ್ಯವಾಗಬೇಕು—ಸ್ವಾಭಾವಿಕವಾಗಿ ಮಾತನಾಡುವ ಭಾಷೆಯನ್ನು ಬಳಸಿ ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಸಂವಹನ ಮಾಡಬೇಕು.

ಇಂದು, ನಾವು APIಯಲ್ಲಿ ಹೊಸ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ ಮತ್ತು ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ ಆಡಿಯೊ ಮಾಡೆಲ್‌ಗಳನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಇದರಿಂದ ನಿಜವಾದ ಮೌಲ್ಯವನ್ನು ನೀಡುವ, ಹೆಚ್ಚು ಶಕ್ತಿಶಾಲಿ, ಕಸ್ಟಮೈಸ್ ಮಾಡಬಹುದಾದ ಮತ್ತು ಬುದ್ಧಿವಂತ ಧ್ವನಿ ಏಜೆಂಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ. ನಮ್ಮ ಇತ್ತೀಚಿನ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ ಮಾಡೆಲ್‌ಗಳು ಹೊಸ ಸ್ಟೇಟ್-ಆಫ್-ದಿ-ಆರ್ಟ್ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಅನ್ನು ಸ್ಥಾಪಿಸುತ್ತವೆ, ನಿಖರತೆ ಮತ್ತು ನಂಬಿಕಾಸ್ಪದತೆಯಲ್ಲಿ ಈಗಿರುವ ಪರಿಹಾರಗಳನ್ನು ಮೀರಿಸುತ್ತವೆ—ವಿಶೇಷವಾಗಿ ಉಚ್ಚಾರಣೆಗಳು, ಶಬ್ದಭರಿತ ಪರಿಸರಗಳು ಮತ್ತು ವಿಭಿನ್ನ ಮಾತಿನ ವೇಗಗಳನ್ನು ಒಳಗೊಂಡ ಸವಾಲಿನ ಸಂದರ್ಭಗಳಲ್ಲಿ. ಈ ಸುಧಾರಣೆಗಳು ಲಿಪ್ಯಂತರಣದ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ, ಇದರಿಂದ ಮಾಡೆಲ್‌ಗಳು ಗ್ರಾಹಕ ಕರೆ ಕೇಂದ್ರಗಳು, ಸಭೆಯ ಟಿಪ್ಪಣಿಗಳ ಲಿಪ್ಯಂತರಣ, ಮತ್ತು ಇನ್ನಷ್ಟುಂತಹ ಬಳಕೆ ಪ್ರಕರಣಗಳಿಗೆ ವಿಶೇಷವಾಗಿ ಸೂಕ್ತವಾಗುತ್ತವೆ.

ಮೊದಲ ಬಾರಿಗೆ, ಡೆವಲಪರ್‌ಗಳು ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ ಮಾಡೆಲ್ ಅನ್ನು ನಿರ್ದಿಷ್ಟ ರೀತಿಯಲ್ಲಿ ಮಾತನಾಡುವಂತೆ ಸೂಚಿಸಬಹುದು—ಉದಾಹರಣೆಗೆ, “ಸಹಾನುಭೂತಿಯ ಕಸ್ಟಮರ್ ಸರ್ವಿಸ್ ಏಜೆಂಟ್‌ನಂತೆ ಮಾತನಾಡಿ”—ಇದರಿಂದ ವಾಯ್ಸ್ ಏಜೆಂಟ್‌ಗಳಿಗೆ ಹೊಸ ಮಟ್ಟದ ಕಸ್ಟಮೈಸೇಶನ್ ಅನ್ನು ಅನ್ಲಾಕ್ ಮಾಡಬಹುದು. ಇದು ಹೆಚ್ಚು ಸಹಾನುಭೂತಿಪೂರ್ಣ ಮತ್ತು ಚೈತನ್ಯಮಯ ಗ್ರಾಹಕ ಸೇವಾ ಧ್ವನಿಗಳಿಂದ ಹಿಡಿದು ಸೃಜನಾತ್ಮಕ ಕಥೆ ಹೇಳುವಿಕೆ ಅನುಭವಗಳಿಗಾಗಿ ಅಭಿವ್ಯಕ್ತಿಪೂರ್ಣ ನಿರೂಪಣೆಯವರೆಗೆ, ಅಗತ್ಯಕ್ಕೆ ತಕ್ಕಂತೆ ರೂಪಿಸಿದ ಅನ್ವಯಿಕೆಗಳ ವಿಶಾಲ ಶ್ರೇಣಿಯನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ.

ನಾವು 2022 ರಲ್ಲಿ ನಮ್ಮ ಮೊದಲ ಆಡಿಯೋ ಮಾಡೆಲ್ ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದ್ದೇವೆ ಮತ್ತು ಆ ಸಮಯದಿಂದ, ಈ ಮಾಡೆಲ್‌ಗಳ ಬುದ್ಧಿವಂತಿಕೆ, ನಿಖರತೆ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಸುಧಾರಿಸಲು ನಾವು ಬದ್ಧರಾಗಿದ್ದೇವೆ. ಈ ಹೊಸ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳೊಂದಿಗೆ, ಡೆವಲಪರ್‌ಗಳು ಹೆಚ್ಚು ನಿಖರ ಮತ್ತು ದೃಢವಾದ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ (speech-to-text) ವ್ಯವಸ್ಥೆಗಳನ್ನು ಮತ್ತು ಅಭಿವ್ಯಕ್ತಿಪೂರ್ಣ, ಪಾತ್ರವಂತ ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ (text-to-speech) ಧ್ವನಿಗಳನ್ನು—API ಒಳಗೆಯೇ—ನಿರ್ಮಿಸಬಹುದು.

ಶಾಂತ
ಸರ್ಫರ್
ಪ್ರೊಫೆಷನಲ್
ಮಧ್ಯಯುಗದ ಕವಚಧಾರಿ ಯೋಧ
ಟ್ರೂ ಕ್ರೈಮ್ ಪ್ರಿಯ
ಮಲಗುವ ಸಮಯದ ಕಥೆ

ನಮ್ಮ ಇತ್ತೀಚಿನ ಆಡಿಯೊ ಮಾಡೆಲ್‌ಗಳ ಬಗ್ಗೆ ಹೆಚ್ಚಿನ ಮಾಹಿತಿ

ಹೊಸ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ ಮಾಡೆಲ್‌ಗಳು

ಮೂಲ Whisper ಮಾಡೆಲ್‌ಗಳೊಂದಿಗೆ ಹೋಲಿಸಿದರೆ, ಪದ ದೋಷ ದರದಲ್ಲಿ ಸುಧಾರಣೆಗಳು ಮತ್ತು ಉತ್ತಮ ಭಾಷಾ ಗುರುತಿಸುವಿಕೆ ಮತ್ತು ನಿಖರತೆಯೊಂದಿಗೆ ನಾವು ಹೊಸ gpt-4o-transcribe ಮತ್ತು gpt-4o-mini-transcribe ಮಾಡೆಲ್‌ಗಳನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ.

gpt-4o-transcribe ಅನೇಕ ಸ್ಥಾಪಿತ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳಲ್ಲಿ ಈಗಿರುವ Whisper ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಉತ್ತಮ ಪದ ದೋಷ ದರ (WER) ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸುತ್ತದೆ, ಇದು ನಮ್ಮ speech-to-text ತಂತ್ರಜ್ಞಾನದಲ್ಲಿ ಮಹತ್ವದ ಪ್ರಗತಿಯನ್ನು ತೋರಿಸುತ್ತದೆ. ಈ ಪ್ರಗತಿಗಳು ರೀಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್‌ನಲ್ಲಿನ ಗುರಿಯ ನವೀನತೆಗಳು ಮತ್ತು ವೈವಿಧ್ಯಮಯ, ಉನ್ನತ-ಗುಣಮಟ್ಟದ ಆಡಿಯೋ ಡೇಟಾಸೆಟ್‌ಗಳೊಂದಿಗೆ ವ್ಯಾಪಕ ಮಧ್ಯಮ ತರಬೇತಿಯಿಂದ ನೇರವಾಗಿ ಉಂಟಾಗಿವೆ.

ಫಲವಾಗಿ, ಈ ಹೊಸ ಭಾಷಣ-ಪಠ್ಯ ಮಾದರಿಗಳು ಮಾತಿನ ಸೂಕ್ಷ್ಮತೆಯನ್ನು ಉತ್ತಮವಾಗಿ ಹಿಡಿಯಲು, ತಪ್ಪು ಗುರುತಿಸುವಿಕೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಮತ್ತು ಲಿಪ್ಯಂತರದ ನಂಬಿಕಾಸ್ಪದತೆಯನ್ನು ಹೆಚ್ಚಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತವೆ, ವಿಶೇಷವಾಗಿ ಉಚ್ಚಾರಣೆಗಳು, ಶಬ್ದಭರಿತ ಪರಿಸರಗಳು ಮತ್ತು ವಿಭಿನ್ನ ಮಾತಿನ ವೇಗಗಳನ್ನು ಒಳಗೊಂಡ ಸವಾಲಿನ ಸಂದರ್ಭಗಳಲ್ಲಿ. ಈ ಮಾಡೆಲ್‌ಗಳು ಈಗ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ API(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ಲಭ್ಯವಿವೆ.

ಪದ ದೋಷ ಪ್ರಮಾಣ (WER) ಎನ್ನುವುದು ಉಲ್ಲೇಖ ಲಿಪ್ಯಂತರದೊಂದಿಗೆ ಹೋಲಿಸಿ ತಪ್ಪಾಗಿ ಲಿಪ್ಯಂತರಗೊಂಡ ಪದಗಳ ಶೇಕಡಾವಾರನ್ನು ಲೆಕ್ಕಹಾಕುವ ಮೂಲಕ ಮಾತು-ಗುರುತಿಸುವಿಕೆ ಮಾಡೆಲ್‌ಗಳ ನಿಖರತೆಯನ್ನು ಅಳೆಯುತ್ತದೆ—WER ಕಡಿಮೆ ಇದ್ದರೆ ಉತ್ತಮ ಮತ್ತು ಅದು ಕಡಿಮೆ ದೋಷಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ. ನಮ್ಮ ಇತ್ತೀಚಿನ ಭಾಷಣ-ದಿಂದ-ಪಠ್ಯ ಮಾಡೆಲ್‌ಗಳು FLEURS (ಫ್ಯೂ-ಶಾಟ್ ಭಾಷಣದ ಸಾರ್ವತ್ರಿಕ ಪ್ರಾತಿನಿಧ್ಯಗಳ ಕಲಿಕೆಯ ಮೌಲ್ಯಮಾಪನ)— ಅನ್ನು ಒಳಗೊಂಡಂತೆ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳಲ್ಲಿ ಕಡಿಮೆ WER ಅನ್ನು ಸಾಧಿಸುತ್ತವೆ, ಇದು ಕೈಯಾರೆ ಲಿಪ್ಯಂತರಿಸಿದ ಆಡಿಯೋ ಮಾದರಿಗಳನ್ನು ಬಳಸಿ 100ಕ್ಕೂ ಹೆಚ್ಚು ಭಾಷೆಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಬಹುಭಾಷಾ ಭಾಷಣ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಆಗಿದೆ. ಈ ಫಲಿತಾಂಶಗಳು ಹೆಚ್ಚು ನಿಖರವಾದ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಷನ್ ಮತ್ತು ಹೆಚ್ಚು ವ್ಯಾಪಕವಾದ ಭಾಷಾ ವ್ಯಾಪ್ತಿಯನ್ನು ತೋರಿಸುತ್ತವೆ. ಇಲ್ಲಿ ತೋರಿಸಿದಂತೆ, ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳು ಎಲ್ಲಾ ಭಾಷಾ ಮೌಲ್ಯಮಾಪನಗಳಲ್ಲಿ Whisper v2 ಮತ್ತು Whisper v3 ಗಿಂತ ನಿರಂತರವಾಗಿ ಉತ್ತಮ ಪ್ರದರ್ಶನ ನೀಡುತ್ತವೆ.

FLEURS ನಲ್ಲಿ, ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳು ಕಡಿಮೆ ವಾಕ್ಯ ದೋಷ ದರ (WER) ಮತ್ತು ಬಲವಾದ ಬಹುಭಾಷಾ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಒದಗಿಸುತ್ತವೆ. ಕಡಿಮೆ WER ಉತ್ತಮ ಮತ್ತು ಅದರರ್ಥ ಕಡಿಮೆ ದೋಷಗಳು. ಇಲ್ಲಿ ತೋರಿಸಿದಂತೆ, ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳು ಬಹುತೇಕ ಪ್ರಮುಖ ಭಾಷೆಗಳಾದ್ಯಂತ ಇತರ ಪ್ರಮುಖ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಸಮನಾಗಿ ಅಥವಾ ಅವುಗಳನ್ನು ಮೀರಿಸುತ್ತವೆ.

ಹೊಸ ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ ಮಾಡೆಲ್

ನಾವು ಉತ್ತಮ ಸ್ಟೀರಬಿಲಿಟಿಯೊಂದಿಗೆ ಹೊಸ gpt-4o-mini-tts ಮಾಡೆಲ್ ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಮೊದಲ ಬಾರಿಗೆ, ಡೆವಲಪರ್‌ಗಳು ಮಾಡೆಲ್‌ಗೆ ಏನು ಹೇಳಬೇಕು ಎಂಬುದಷ್ಟೇ ಅಲ್ಲ, ಅದನ್ನು ಹೇಗೆ ಹೇಳಬೇಕು ಎಂಬುದನ್ನೂ “ಸೂಚಿಸಬಹುದು”—ಇದು ಗ್ರಾಹಕ ಸೇವೆಯಿಂದ ಸೃಜನಾತ್ಮಕ ಕಥೆ ಹೇಳುವವರೆಗೆ ವ್ಯಾಪಿಸುವ ಬಳಕೆ-ಪ್ರಕರಣಗಳಿಗೆ ಹೆಚ್ಚು ಕಸ್ಟಮೈಸ್ ಮಾಡಿದ ಅನುಭವಗಳನ್ನು ಸೃಷ್ಟಿಸಲು ಅನುಮತಿಸುತ್ತದೆ. ಮಾಡೆಲ್ ಪಠ್ಯದಿಂದ ಮಾತಿಗೆ API(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ನಲ್ಲಿ ಲಭ್ಯವಿದೆ. ಈ ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ ಮಾಡೆಲ್‌ಗಳು ಕೃತಕ, ಪೂರ್ವನಿಗದಿತ ಧ್ವನಿಗಳಿಗೆ ಮಾತ್ರ ಸೀಮಿತವಾಗಿವೆ ಎಂಬುದನ್ನು ಗಮನಿಸಿ. ಅವು ಸಿಂಥೆಟಿಕ್ ಪೂರ್ವನಿಗದಿಗಳಿಗೆ ಸತತವಾಗಿ ಹೊಂದಿಕೆಯಾಗುತ್ತವೆ ಎಂಬುದನ್ನು ಖಚಿತಪಡಿಸಲು ನಾವು ಅವುಗಳನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುತ್ತೇವೆ.

ಮಾಡೆಲ್‌ಗಳ ಹಿಂದಿನ ತಾಂತ್ರಿಕ ನಾವೀನ್ಯತೆಗಳು

ಪ್ರಾಮಾಣಿಕ ಆಡಿಯೋ ಡೇಟಾಸೆಟ್‌ಗಳೊಂದಿಗೆ ಪೂರ್ವ ತರಬೇತಿ

ನಮ್ಮ ಹೊಸ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳು GPT‑4o ಮತ್ತು GPT‑4o‑mini ಆರ್ಕಿಟೆಕ್ಚರ್‌ಗಳ ಮೇಲೆ ನಿರ್ಮಿಸಲ್ಪಟ್ಟಿದ್ದು, ವಿಶೇಷ ಆಡಿಯೋ-ಕೇಂದ್ರಿತ ಡೇಟಾಸೆಟ್‌ಗಳಲ್ಲಿ ವ್ಯಾಪಕವಾಗಿ ಪೂರ್ವಪ್ರಶಿಕ್ಷಣ ಪಡೆದಿವೆ, ಇದು ಮಾಡೆಲ್ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲು ಅತ್ಯಂತ ಮುಖ್ಯವಾಗಿದೆ. ಈ ಗುರಿಮುಖಿ ವಿಧಾನವು ಮಾತಿನ ಸೂಕ್ಷ್ಮತೆಗಳ ಬಗ್ಗೆ ಆಳವಾದ ಒಳನೋಟಗಳನ್ನು ಒದಗಿಸುತ್ತದೆ ಮತ್ತು ಆಡಿಯೋ-ಸಂಬಂಧಿತ ಕಾರ್ಯಗಳಲ್ಲಿ ಅತ್ಯುತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.

ಸುಧಾರಿತ ಡಿಸ್ಟಿಲ್ಲೇಶನ್ ವಿಧಾನಗಳು

ನಾವು ನಮ್ಮ ಡಿಸ್ಟಿಲ್ಲೇಶನ್ ತಂತ್ರಗಳನ್ನು ಸುಧಾರಿಸಿದ್ದೇವೆ, ಇದರಿಂದ ನಮ್ಮ ಅತಿದೊಡ್ಡ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳಿಂದ ಚಿಕ್ಕ, ಹೆಚ್ಚು ಕಾರ್ಯಕ್ಷಮ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಜ್ಞಾನ ವರ್ಗಾವಣೆ ಸಾಧ್ಯವಾಗಿದೆ. ಸುಧಾರಿತ ಸ್ವಯಂ-ಪ್ಲೇ ವಿಧಾನಶಾಸ್ತ್ರಗಳನ್ನು ಬಳಸಿಕೊಂಡು, ನಮ್ಮ ಡಿಸ್ಟಿಲ್ಲೇಶನ್ ಡೇಟಾಸೆಟ್‌ಗಳು ವಾಸ್ತವಿಕ ಸಂಭಾಷಣಾತ್ಮಕ ಡೈನಾಮಿಕ್ಸ್ ಅನ್ನು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಸೆರೆಹಿಡಿಯುತ್ತವೆ ಮತ್ತು ನಿಜವಾದ ಬಳಕೆದಾರ-ಸಹಾಯಕ ಪರಸ್ಪರ ಕ್ರಿಯೆಗಳನ್ನು ಪುನರುತ್ಪಾದಿಸುತ್ತವೆ. ಇದು ನಮ್ಮ ಸಣ್ಣ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಉತ್ತಮ ಸಂಭಾಷಣಾ ಗುಣಮಟ್ಟ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯಾಶೀಲತೆಯನ್ನು ಒದಗಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.

ರೀಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಪರಿಕಲ್ಪನೆ

ನಮ್ಮ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ ಮಾಡೆಲ್‌ಗಳಿಗಾಗಿ, ನಾವು ರೀಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್ (RL)-heavy ಪರಿಕಲ್ಪನೆಯನ್ನು ಅಳವಡಿಸಿದ್ದೇವೆ, ಇದರಿಂದ ಪ್ರತಿಲೇಖನದ ನಿಖರತೆ ಅತ್ಯುನ್ನತ ಮಟ್ಟಗಳಿಗೆ ತಲುಪಿದೆ. ಈ ವಿಧಾನವು ನಿಖರತೆಯನ್ನು ಗಣನೀಯವಾಗಿ ಸುಧಾರಿಸುತ್ತದೆ ಮತ್ತು ಹ್ಯಾಲ್ಯೂಸಿನೇಷನ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಸಂಕೀರ್ಣ ಮಾತು ಗುರುತಿಸುವಿಕೆ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ ನಮ್ಮ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ ಪರಿಹಾರಗಳು ಅತ್ಯಂತ ಸ್ಪರ್ಧಾತ್ಮಕವಾಗುತ್ತವೆ.

ಈ ಅಭಿವೃದ್ಧಿಗಳು ಆಡಿಯೋ ಮಾದರೀಕರಣ ಕ್ಷೇತ್ರದಲ್ಲಿ ಪ್ರಗತಿಯನ್ನು ಸೂಚಿಸುತ್ತವೆ, ನವೀನ ವಿಧಾನಶಾಸ್ತ್ರಗಳನ್ನು ಪ್ರಾಯೋಗಿಕ ಸುಧಾರಣೆಗಳೊಂದಿಗೆ ಸಂಯೋಜಿಸಿ, ಭಾಷಣ ಅನ್ವಯಿಕೆಗಳಲ್ಲಿ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸಿವೆ.

API ಲಭ್ಯತೆ

ಈ ಹೊಸ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳು ಈಗ ಎಲ್ಲಾ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಲಭ್ಯವಿವೆ – ಆಡಿಯೋ ಬಳಸಿ ನಿರ್ಮಿಸುವ ಬಗ್ಗೆ ಇನ್ನಷ್ಟು ಇಲ್ಲಿ(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ). ಪಠ್ಯ ಆಧಾರಿತ ಮಾಡೆಲ್‌ಗಳೊಂದಿಗೆ ಸಂವಾದಾತ್ಮಕ ಅನುಭವಗಳನ್ನು ಈಗಾಗಲೇ ನಿರ್ಮಿಸುತ್ತಿರುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ, ನಮ್ಮ ಮಾತಿನಿಂದ-ಪಠ್ಯಕ್ಕೆ ಮತ್ತು ಪಠ್ಯದಿಂದ-ಮಾತಿಗೆ ಮಾಡೆಲ್‌ಗಳನ್ನು ಸೇರಿಸುವುದು ಧ್ವನಿ ಏಜೆಂಟ್ ಅನ್ನು ನಿರ್ಮಿಸಲು ಅತ್ಯಂತ ಸರಳ ಮಾರ್ಗವಾಗಿದೆ. ಈ ಅಭಿವೃದ್ಧಿ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಸರಳಗೊಳಿಸುವ Agents SDK(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಜೊತೆಗೆ ಒಂದು ಇಂಟಿಗ್ರೇಶನ್ ಅನ್ನು ನಾವು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಕಡಿಮೆ ಲೇಟೆನ್ಸಿಯ ಮಾತಿನಿಂದ-ಮಾತಿಗೆ ಅನುಭವಗಳನ್ನು ನಿರ್ಮಿಸಲು ಬಯಸುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ, ನಿಜ ಸಮಯದ API ನಲ್ಲಿ ನಮ್ಮ ಮಾತಿನಿಂದ-ಮಾತಿಗೆ ಮಾಡೆಲ್‌ಗಳನ್ನು ಬಳಸುವಂತೆ ನಾವು ಶಿಫಾರಸು ಮಾಡುತ್ತೇವೆ.

ಮುಂದೆ ಏನು

ಮುಂದೆ ನೋಡಿದರೆ, ನಾವು ನಮ್ಮ ಆಡಿಯೋ ಮಾಡೆಲ್‌ಗಳ ಬುದ್ಧಿವಂತಿಕೆ ಮತ್ತು ನಿಖರತೆಯನ್ನು ಸುಧಾರಿಸಲು ಹೂಡಿಕೆ ಮಾಡುತ್ತೇವೆ ಮತ್ತು ಡೆವಲಪರ್‌ಗಳು ತಮ್ಮದೇ ಆದ ಕಸ್ಟಮ್ ಧ್ವನಿಗಳನ್ನು ತರಲು ಮತ್ತು ಇನ್ನಷ್ಟು ವೈಯಕ್ತಿಕ ಅನುಭವಗಳನ್ನು ನಿರ್ಮಿಸಲು ಮಾರ್ಗಗಳನ್ನು ಅನ್ವೇಷಿಸುತ್ತೇವೆ, ಇದು ನಮ್ಮ ಸುರಕ್ಷತಾ ಮಾನದಂಡಗಳಿಗೆ ಹೊಂದಿಕೊಳ್ಳುತ್ತದೆ. ಇದಲ್ಲದೆ, ಕೃತಕ ಧ್ವನಿಗಳು ನೀಡಬಹುದಾದ ಸವಾಲುಗಳು ಮತ್ತು ಅವಕಾಶಗಳ ಬಗ್ಗೆ ನೀತಿನಿರ್ಧಾರಕರು, ಸಂಶೋಧಕರು, ಡೆವಲಪರ್‌ಗಳು ಮತ್ತು ಸೃಜನಶೀಲರೊಂದಿಗೆ ಸಂಭಾಷಣೆಗಳನ್ನು ನಾವು ಮುಂದುವರಿಸುತ್ತಿದ್ದೇವೆ. ಈ ಸುಧಾರಿತ ಆಡಿಯೋ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಡೆವಲಪರ್‌ಗಳು ನಿರ್ಮಿಸುವ ನಾವೀನ್ಯ ಮತ್ತು ಸೃಜನಶೀಲ ಅನ್ವಯಿಕೆಗಳನ್ನು ನೋಡಲು ನಾವು ಉತ್ಸುಕರಾಗಿದ್ದೇವೆ. ಡೆವಲಪರ್‌ಗಳು ಮಲ್ಟಿಮೋಡಲ್ ಏಜೆಂಟಿಕ್ ಅನುಭವಗಳನ್ನು ನಿರ್ಮಿಸಲು ಸಾಧ್ಯವಾಗುವಂತೆ, ವೀಡಿಯೊ ಸೇರಿದಂತೆ ಇತರ ಮೋಡಾಲಿಟಿಗಳಲ್ಲಿ ನಾವು ಹೂಡಿಕೆ ಮಾಡುತ್ತೇವೆ.

ಲೈವ್‌ಸ್ಟ್ರೀಮ್ ಮರುಪ್ರದರ್ಶನ

ಲೇಖಕರು

OpenAI

ಸಂಶೋಧನಾ ಮುಂಚೂಣಿಯವರು

ಕ್ರಿಸ್ಟಿನಾ ಕಿಮ್, ಜುನ್ಹುವಾ ಮಾವೋ, ಯಿ ಶೆನ್, ಯು ಝಾಂಗ್

ಕೊಡುಗೆದಾರರು

ಸಂಶೋಧನೆ

ಅಲೆಕ್ಸ್ ಪೈನೋ, ಬೋವನ್ ಚೆಂಗ್, ಚೆಂಗ್‌ಶು ಝುವಾಂಗ್, ಕ್ರಿಸ್ ಕೋಚ್, ಡೇಮಿಯನ್ ಮ್ರೋವ್ಕಾ, ಎರಿಕ್ ರಿಟ್ಟರ್, ಜೇಕಬ್ ಮೆನಿಕ್, ಜೇಮ್ಸ್ ಬೆಟ್ಕರ್, ಜಿ ಲಿನ್, ಜೇಮೀ ಕಿರೋಸ್, ಜಿಯಾಹುಯ್ ಯು, ಲಿಯಾಂಗ್ ಝೌ, ಲಿಯು ಚೆನ್, ಕೆವಿನ್ ಲು, ಮ್ಯಾಡೆಲಿನ್ ಬಾಯ್ಡ್, ಮೈಕಲ್ ಲ್ಯಾಂಪೆ, ಮೈಕ್ ಹೀಟನ್, ನಾನ್ಶಿನ್ ಚೆನ್, ನಿತೀಶ್ ಕೇಶ್ಕರ್, ಸಾಚಿ ಜೈನ್, ಸ್ಯಾಮ್ ಟೊಯ್ಜರ್, ಸೋಮಯ್ ಜೈನ್, ಟಾವೊ ಝು, ಟೋಮರ್ ಕಪ್ಲಾನ್, ವೇಯ್ ಹಾನ್, ಷಿಯಾಂಗ್ನಿಂಗ್ ಚೆನ್, ಯೆ ಜಿಯಾ

ಎಂಜಿನಿಯರಿಂಗ್

ಅಲಿನಾ ವು, ಆಂಡ್ರೆಸ್ ಗಾರ್ಸಿಯಾ ಗಾರ್ಸಿಯಾ, ಅರ್ಶಿ ಭಟ್ನಾಗರ್, ಅವಿಟಲ್ ಒಲಿವರ್, ಬ್ರೆಂಡನ್ ಕ್ವಿನ್, ಕ್ರಿಸ್ಟಿನಾ ಹುವಾಂಗ್, ಡೇವಿಡ್ ಫಾಂಗ್, ಡ್ರಾಗೋಸ್ ಓಪ್ರಿಕಾ, ಡೊಮಿನಿಕ್ ಕುಂಡೆಲ್, ಎಡೆಡೆ ಒಯಿವೋ, ಇಯಾರೋಸ್ಲಾವ್ ಟ್ವೆರ್ಡೊಖ್ಲಿಬ್, ಜಿಯಾಚೆಂಗ್ ಫೆಂಗ್, ಜೇ ಚೆನ್, ಜೆನಿಯಾ ವರವ್ವಾ, ಜೋರ್ಡನ್ ಸಿಟ್ಕಿನ್, ಜೋಸೆಫ್ ಫ್ಲೊರೆನ್ಸಿಯೋ, ಲಿಯೆನ್ ಮಮಿಟ್ಸುಕಾ, ಮಡಾ ಅಫ್ಲಾಕ್, ಮನೋಲಿ ಲಿಯೊಡಾಕಿಸ್, ಮಾರ್ಕ್ ಹಡ್ನಾಲ್, ನೋಹ್ ಮ್ಯಾಕ್ಕಲ್ಲಮ್, ಓಲಾ ಒಕೆಲೋಲಾ, ಪೀಟರ್ ಬಕ್ಕುಮ್, ರೋಹನ್ ಮೆಹ್ತಾ, ರೊಮೇನ್ ಹ್ಯುಯೆಟ್, ವಾನಿಂಗ್ ಜಿಯಾಂಗ್, ವೇನ್ ಚಾಂಗ್, ಯಿಲೈ ಕಿಯಾನ್

ಉತ್ಪನ್ನ

ಅನುಭಾ ಶ್ರೀವಾಸ್ತವ, ಜಾಕಿ ಶ್ಯಾನನ್, ಜೆಫ್ ಹ್ಯಾರಿಸ್, ರಿಯಾ ಮಿಯಾರಾ, ಝಿಯಾವೊಲಿನ್ ಹಾವೋ

ನಾಯಕತ್ವದ ಪ್ರಾಯೋಜಕರು

ಐಡನ್ ಕ್ಲಾರ್ಕ್, ಆಂಡ್ರ್ಯೂ ಗಿಬಿಯಾನ್ಸ್ಕಿ, ಡೇವಿಡ್ ಸಸಾಕಿ, ಕೆವಿನ್ ವೈಲ್, ಲಿಯಾಮ್ ಫೆಡಸ್, ಮಾರ್ಕ್ ಚೆನ್, ನಿಕ್ ರೈಡರ್, ನಿಕ್ ಟರ್ಲಿ, ಒಲಿವಿಯರ್ ಗೊಡೆಮೆಂಟ್, ಪ್ರಫುಲ್ಲ ಧರಿವಾಲ್, ಶೆಂಗ್ಜಿಯಾ ಝಾವೋ, ಶುಚಾವೊ ಬಿ, ಶೆರ್ವಿನ್ ವು, ಸುಲ್ಮಾನ್ ಚೌಧ್ರಿ