Prezantimi i modeleve audio të gjeneratës së ardhshme në API
Një suitë e re modelesh audio për të fuqizuar agjentët zanorë, tani e disponueshme për zhvilluesit në mbarë botën.

Përditësim më 28.8.2025: Njoftuam disponueshmërinë e përgjithshme të Realtime API. Mëso më shumë këtu.
Gjatë muajve të fundit, kemi investuar në avancimin e inteligjencës, aftësive dhe dobishmërisë së agjentëve të bazuar në tekst—ose sistemeve që kryejnë në mënyrë të pavarur detyra në emër të përdoruesve—me publikime si Operator, Kërkim i thelluar, agjentë kompjuterpërdorues dhe Responses API me mjete të integruara. Megjithatë, që agjentët të jenë vërtet të dobishëm, njerëzit duhet të kenë mundësinë të kenë ndërveprime më të thella dhe më intuitive me agjentët përtej vetëm tekstit—duke përdorur gjuhën e folur natyrale për të komunikuar në mënyrë efektive.
Sot, po qarkullojmë modele të reja audio për konvertimin e të folurit në tekst dhe tekstit në të folur në API — duke e bërë të mundur ndërtimin e agjentëve zanorë më të fuqishëm, të personalizueshëm dhe inteligjentë që ofrojnë vlerë reale. Modelet tona më të fundit për konvertimin e të folurit në tekst vendosin një standard të ri të avancuar, duke tejkaluar zgjidhjet ekzistuese në saktësi dhe besueshmëri — veçanërisht në skenarë sfidues që përfshijnë thekse, mjedise me zhurmë dhe shpejtësi të ndryshme të të folurit. Këto përmirësime rrisin besueshmërinë e transkriptimit, duke i bërë modelet veçanërisht të përshtatshme për raste përdorimi si qendrat e thirrjeve të klientëve, transkriptimi i shënimeve të takimeve dhe më shumë.
Për herë të parë, zhvilluesit mund të udhëzojnë modelin tekst-në-zë të flasë në një mënyrë të caktuar—për shembull, “fol si një agjent i dhembshur i shërbimit ndaj klientit”—duke hapur një nivel të ri personalizimi për agjentët zanorë. Kjo mundëson një gamë të gjerë aplikacionesh të përshtatura, nga zëra më empatikë dhe dinamikë të shërbimit ndaj klientit deri te narracioni shprehës për përvoja krijuese të tregimit.
Ne lançuam modelin tonë të parë audio në 2022 dhe që atëherë, jemi angazhuar të përmirësojmë inteligjencën, saktësinë dhe besueshmërinë e këtyre modeleve. Me këto modele të reja audio, zhvilluesit mund të ndërtojnë sisteme më të sakta dhe më të qëndrueshme për konvertimin e të folurit në tekst dhe zëra më ekspresivë e me karakter për konvertimin e tekstit në të folur—të gjitha brenda API.
Po prezantojmë modelet e reja gpt-4o-transcribe dhe gpt-4o-mini-transcribe me përmirësime në shkallën e gabimeve të fjalëve, njohje më të mirë të gjuhës dhe saktësi më të lartë, krahasuar me modelet origjinale Whisper.
gpt-4o-transcribe demonstron përmirësim të performancës së Word Error Rate (WER) krahasuar me modelet ekzistuese Whisper në disa pika referimi të njohura, duke reflektuar përparim të rëndësishëm në teknologjinë tonë të shndërrimit të të folurit në tekst. Këto përparime burojnë drejtpërdrejt nga inovacionet e synuara në trajnim përforcues dhe trajnimi i gjerë me grupe të dhënash audio të larmishme dhe me cilësi të lartë.
Si rezultat, këto modele të reja të konvertimit të të folurit në tekst mund të kapin më mirë nuancat e të folurit, të reduktojnë keqinterpretimet dhe të rrisin besueshmërinë e transkriptimit, veçanërisht në skenarë sfidues që përfshijnë thekse, mjedise me zhurmë dhe shpejtësi të ndryshme të të folurit. Këto modele janë tani të disponueshme në API-në për konvertimin e të folurit në tekst(hapet në një dritare të re).
Shkalla e gabimit të fjalëve (WER) mat saktësinë e modeleve të njohjes së të folurit duke llogaritur përqindjen e fjalëve të transkriptuara gabimisht krahasuar me një transkript referencë—sa më e ulët të jetë WER, aq më mirë, që do të thotë më pak gabime. Modelet tona më të fundit për konvertimin e të folurit në tekst arrijnë një WER më të ulët në të gjitha benchmark-et, duke përfshirë FLEURS (Vlerësimi i të mësuarit me pak shembuj i përfaqësimeve universale të të folurit)—një benchmark shumëgjuhësh që përfshin mbi 100 gjuhë duke përdorur mostra audio të transkriptuara manualisht. Këto rezultate tregojnë një saktësi më të madhe të transkriptimit dhe një mbulim më të qëndrueshëm të gjuhëve. Siç tregohet këtu, modelet tona tejkalojnë vazhdimisht Whisper v2 dhe Whisper v3 në të gjitha vlerësimet e gjuhëve.
Në FLEURS, modelet tona ofrojnë WER më të ulët dhe performancë të fortë shumëgjuhëshe. WER më e ulët është më mirë dhe nënkupton më pak gabime. Siç tregohet këtu, modelet tona përputhen ose tejkalojnë modelet e tjera kryesore në shumicën e gjuhëve të mëdha.
Po prezantojmë gjithashtu një model të ri gpt-4o-mini-tts me më shumë mundësi drejtimi. Për herë të parë, zhvilluesit mund të “udhëzojnë” modelin jo vetëm për çfarë të thotë, por edhe si ta thotë — duke mundësuar përvoja më të personalizuara për raste përdorimi që variojnë nga shërbimi ndaj klientit te rrëfimi krijues. Modeli është i disponueshëm në API-në text-to-speech(hapet në një dritare të re). Vini re se këto modele text-to-speech janë të kufizuara në zëra artificialë të paracaktuar, të cilët i monitorojmë për të siguruar që përputhen vazhdimisht me presetet sintetike.
Modelet tona të reja audio ndërtohen mbi arkitekturën GPT‑4o dhe GPT‑4o‑mini dhe janë të trajnuara gjerësisht në grupe të dhënash të specializuara të përqendruara në audio, të cilat kanë qenë thelbësore për optimizimin e performancës së modelit. Kjo qasje e synuar ofron njohuri më të thelluara mbi nuancat e të folurit dhe mundëson performancë të jashtëzakonshme në detyrat që lidhen me audion.
Ne kemi përmirësuar teknikat tona të distilimit, duke mundësuar transferimin e njohurive nga modelet tona më të mëdha audio te modelet më të vogla dhe më efikase. Duke përdorur metodologji të avancuara të vetë-lojës, grupet tona të të dhënave të distilimit kapin në mënyrë efektive dinamikat realiste të bisedave, duke riprodhuar ndërveprime të vërteta mes përdoruesit dhe asistentit. Kjo i ndihmon modelet tona më të vogla të ofrojnë cilësi të shkëlqyer bisedore dhe përgjigje të shpejta.
Për modelet tona të konvertimit të të folurit në tekst, kemi integruar një paradigmë të rëndë të trajnimit përforcues (RL), duke e çuar saktësinë e transkriptimit në nivele të avancuara të teknologjisë. Kjo metodologji përmirëson ndjeshëm saktësinë dhe redukton halucinacionin, duke i bërë zgjidhjet tona të konvertimit të të folurit në tekst jashtëzakonisht konkurruese në skenarë kompleksë të njohjes së të folurit.
Këto zhvillime përfaqësojnë përparim në fushën e modelimit të audios, duke kombinuar metodologji inovative me përmirësime praktike për performancë të përmirësuar në aplikacionet e të folurit.
Këto modele të reja audio janë të disponueshme tani për të gjithë zhvilluesit – më shumë rreth ndërtimit me audio këtu(hapet në një dritare të re). Për zhvilluesit që tashmë po krijojnë përvoja bisedore me modele të bazuara në tekst, shtimi i modeleve tona për konvertimin e të folurit në tekst dhe tekstit në të folur është mënyra më e thjeshtë për të krijuar një agjent zanor. Po lëshojmë një integrim me Agents SDK(hapet në një dritare të re) që e thjeshton këtë proces zhvillimi. Për zhvilluesit që kërkojnë të krijojnë përvoja të ligjëratë-ligjëratë me vonesë të ulët, ne rekomandojmë përdorimin e modeleve tona të ligjëratë-ligjëratë në Realtime API.
Duke parë përpara, planifikojmë të vazhdojmë të investojmë në përmirësimin e inteligjencës dhe saktësisë së modeleve tona audio dhe të eksplorojmë mënyra për t'u lejuar zhvilluesve të sjellin zërat e tyre të personalizuar për të krijuar përvoja edhe më të personalizuara në përputhje me standardet tona të sigurisë. Përveç kësaj, po vazhdojmë të angazhohemi në biseda me politikëbërës, studiues, zhvillues dhe krijues për sfidat dhe mundësitë që zërat sintetikë mund të paraqesin. Jemi të emocionuar të shohim aplikacionet inovative dhe krijuese që zhvilluesit do të ndërtojnë duke përdorur këto aftësi të përmirësuara audio. Ne gjithashtu do të investojmë në modalitete të tjera — duke përfshirë videon — për t'u mundësuar zhvilluesve të krijojnë përvoja agjentike multimodale.
Autorët
Udhëheqësit e kërkimit
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Kontribuesit
Kërkime
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Inxhinieria
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produkti
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Sponsorët e lidershipit
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry