Gå direkt till huvudinnehåll
OpenAI

20 mars 2025

LanseringProdukt

Vi presenterar nästa generations ljudmodeller i API:n

En ny uppsättning ljudmodeller för att driva röstagenter är nu tillgänglig för utvecklare världen över.

Bakgrundsbild på OpenAI:s blogg om nästa generations ljudmodeller
Laddar …

Uppdatering den 28 augusti 2025: Vi meddelade att Realtime API nu är allmänt tillgänglig. Läs mer här.


Under de senaste månaderna har vi investerat i att förbättra intelligensen, kapaciteten och användbarheten hos textbaserade agenter (eller system som självständigt utför uppgifter för användare) med lanseringar såsom Operator, Djup forskning, Datoranvändande agenter och Responses API med inbyggda verktyg. För att agenter verkligen ska vara användbara krävs det dock att man kan ha djupare och mer intuitiva interaktioner med agenter genom tal för effektiv kommunikation.

I dag lanserar vi nya tal-till-text- och text-till-tal-ljudmodeller i API:n som gör det möjligt att skapa mer kraftfulla, anpassningsbara och intelligenta röstagenter som erbjuder verkligt värde. Våra senaste tal-till-text-modeller sätter en ny branschledande standard och överträffar befintliga lösningar i noggrannhet och tillförlitlighet, särskilt i utmanande scenarier med accenter, bullriga miljöer och varierande talhastigheter. Dessa förbättringar ökar transkriptionens tillförlitlighet och gör modellerna särskilt lämpliga för användningsområden såsom kundtjänstcenter, transkribering av mötesanteckningar med mer.

Utvecklare kan även för första gången instruera text-till-tal-modellen att tala på ett specifikt sätt, t.ex. "prata som en sympatisk kundtjänstagent", vilket öppnar upp en ny nivå av anpassning för röstagenter. Detta möjliggör ett brett spektrum av skräddarsydda tillämpningar, från mer empatiska och dynamiska kundtjänströster till uttrycksfulla berättarröster för kreativa berättarupplevelser.

Vi lanserade vår första ljudmodell under 2022 och har sedan dess åtagit oss att förbättra intelligensen, noggrannheten och tillförlitligheten hos dessa modeller. Dessa nya ljudmodeller låter utvecklare skapa mer exakta och robusta tal-till-text-system och uttrycksfulla, karaktärsfulla text-till-tal-röster – allt med en API:n.

Calm
Surfare
Professionell
Medeltida riddare
True crime-entusiast
Godnattsaga

Mer om våra senaste ljudmodeller

Nya tal-till-textmodeller

Vi introducerar de nya modellerna gpt-4o-transcribe och gpt-4o-mini-transcribe med förbättrad ordfelsfrekvens och bättre språkigenkänning och noggrannhet jämfört med de ursprungliga Whisper-modellerna.

gpt-4o-transcribe demonstrerar förbättrad Word Error Rate (WER)-prestanda jämfört med befintliga Whisper-modeller i flera etablerade tester vilket återspeglar betydande framsteg i vår tal-till-text-teknik. Dessa framsteg härrör direkt från riktade innovationer inom förstärkningsinlärning och omfattande mellanträning med mångsidiga ljuddatamängder av hög kvalitet.

Dessa nya tal-till-text-modeller kan som ett resultat bättre fånga nyanser i tal, minska feligenkänningar och öka transkriptionens tillförlitlighet, särskilt i utmanande scenarier som involverar accenter, bullriga miljöer och varierande talhastigheter. Dessa modeller är nu tillgängliga i tal-till-text-API:n(öppnas i ett nytt fönster).

Word Error Rate (WER) mäter noggrannheten hos taligenkänningsmodeller genom att beräkna andelen felaktigt transkriberade ord i procent jämfört med ett referenstranskript—lägre WER är bättre och innebär färre fel. Våra senaste tal-till-text-modeller uppnår lägre WER i olika tester såsom FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), ett test för över 100 språk som använder manuellt transkriberade ljudprover. Dessa resultat demonstrerar bättre transkriptionsnoggrannhet och mer omfattande språktäckning. Som visas presterar våra modeller konsekvent bättre än Whisper v2 och Whisper v3 i alla språkutvärderingar.

På FLEURS levererar våra modeller lägre WER och stark flerspråkig prestanda. Lägre WER är bättre och betyder färre fel. Som visas matchar eller överträffar våra modeller andra ledande modeller på de flesta större språken.

Ny text-till-tal-modell

Vi lanserar även en ny gpt-4o-mini-tts-modell med bättre styrbarhet. För första gången kan utvecklare inte bara "instruera" modellen om vad den ska säga utan även hur den ska säga det vilket möjliggör mer anpassade upplevelser för användningsfall som sträcker sig från kundservice till kreativt berättande. Modellen finns tillgänglig i text-till-tal-API:n(öppnas i ett nytt fönster). Observera att dessa text-till-tal-modeller är begränsade till artificiella, förinställda röster som vi övervakar för att säkerställa att de konsekvent matchar de syntetiska förinställningarna.

Tekniska innovationer bakom modellerna

Förträning med autentiska ljuddatamängder

Våra nya ljudmodeller bygger på GPT‑4o‑ och GPT‑4o‑mini‑arkitekturerna och är förtränade på specialiserade ljudcentrerade datamängder vilket varit avgörande för att optimera modellernas prestanda. Detta riktade tillvägagångssätt ger djupare insikt i talnyanser och möjliggör exceptionell prestanda inom ljudrelaterade uppgifter.

Avancerade destillationsmetoder

Vi har förbättrat våra destillationstekniker vilket möjliggör kunskapsöverföring från våra största ljudmodeller till mindre och mer effektiva modeller. Genom att utnyttja avancerade självspelsmetoder fångar våra destilleringsdatamängder effektivt realistiska samtalsdynamiker och återskapar genuina interaktioner mellan användare och assistenter. Detta hjälper våra mindre modeller att leverera utmärkt samtalskvalitet och respons.

Paradigm för förstärkningsinlärning

För våra tal-till-text-modeller har vi integrerat en paradigm med stark betoning på förstärkningsinlärning (RL) vilket har drivit transkriptionsnoggrannheten till den senaste tekniska nivån. Denna metodik förbättrar precisionen och minskar hallucinationer vilket gör våra tal-till-text-lösningar mycket konkurrenskraftiga i komplexa taligenkänningsscenarier.

Detta representerar framsteg inom området ljudmodellering där innovativa metoder kombineras med praktiska förbättringar för att förbättra prestandan i talapplikationer.

API-tillgänglighet

Dessa nya ljudmodeller är nu tillgängliga för alla utvecklare, du kan läsa mer om att skapa med ljud här(öppnas i ett nytt fönster). För utvecklare som redan skapar samtalsupplevelser med textbaserade modeller är det enklaste sättet att skapa en röstagent att lägga till våra tal-till-text- och text-till-tal-modeller. Vi släpper en integration med Agents SDK(öppnas i ett nytt fönster) som förenklar utvecklingsprocessen. För utvecklare som vill skapa låglatenta tal-till-tal-upplevelser rekommenderar vi att använda våra tal-till-tal-modeller i Realtime API.

Vad händer härnäst?

Framöver planerar vi att fortsätta investera i att förbättra intelligensen och noggrannheten i våra ljudmodeller och utforska sätt som låter utvecklare använda sina egna anpassade röster till att skapa ännu mer personliga upplevelser som överensstämmer med våra säkerhetsstandarder. Dessutom fortsätter vi att delta i samtal med beslutsfattare, forskare, utvecklare och kreatörer om de utmaningar och möjligheter som syntetiska röster kan innebära. Vi ser fram emot att se de innovativa och kreativa applikationer som utvecklare kommer att skapa med dessa förbättrade ljudfunktioner. Vi kommer även att investera i andra modaliteter (inklusive video) för att göra det möjligt för utvecklare att skapa multimodala agentupplevelser.

Repris av livestream

Författare

OpenAI

Forskningschefer

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Deltagare

Forskning

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Teknik

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produkt

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Ledarskapssponsorer

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry