Прескокни до главната содржина
OpenAI

20 март 2025 г.

ИзданиеПроизвод

Претставување на аудио модели од следната генерација во API

Нов пакет аудио модели за напојување на гласовни агенти, сега достапен за програмери ширум светот.

Херојска слика за блогот на OpenAI за аудио модели од следната генерација
Се вчитува...

Ажурирање на 28.08.2025 г.: Ја објавивме општата достапност на Realtime API. Дознај повеќе тука.


Во изминатите неколку месеци, инвестиравме во унапредување на интелигенцијата, способностите и корисноста на агенти базирани на текст - или системи што самостојно извршуваат задачи во име на корисниците - со изданија како оператор, длабоко истражување, агенти кои користат компјутер и Responses API со вградени алатки. Сепак, за агентите да бидат навистина корисни, луѓето треба да можат да имаат подлабоки и поинтуитивни интеракции со нив, не само преку текст, туку и користејќи природен говорен јазик за ефективна комуникација.

Денес лансираме нови аудио модели за претворање на говор во текст и текст во говор во API, што овозможува создавање на помоќни, приспособливи и интелигентни гласовни агенти кои нудат вистинска вредност. Нашите најнови модели за претворање на говор во текст поставуваат нов најсовремен стандард, надминувајќи ги постојните решенија по точност и сигурност - особено во предизвикувачки сценарија што вклучуваат акценти, бучни средини и различни брзини на говор. Овие подобрувања ја зголемуваат доверливоста на транскрипцијата, правејќи ги моделите особено добро прилагодени за случаи на употреба како што се центри за кориснички повици, транскрипција на белешки од состаноци и други.

За првпат, програмерите можат да му дадат инструкции на моделот за претворање на текст во говор да зборува на одреден начин - на пример, „зборувај како сочувствителен агент за корисничка поддршка“ - отворајќи ново ниво на прилагодување за гласовни агенти. Ова овозможува широк спектар на приспособени апликации, од поемпатични и подинамични гласови за корисничка поддршка до експресивна нарација за креативни искуства во раскажување приказни.

Го лансиравме нашиот прв аудио модел во 2022 и оттогаш сме посветени на подобрување на интелигенцијата, точноста и сигурноста на овие модели. Со овие нови аудио модели, програмерите можат да создадат попрецизни и поробусни системи за претворање на говор во текст и експресивни, карактерни гласови за текст во говор - сето тоа во рамките на API.

Смирено
Сурфер
Професионално
Средновековен витез
Љубител на криминалистички серии
Приказна за добра ноќ

Повеќе за нашите најнови аудио модели

Нови модели за претворање говор во текст

Воведуваме нови модели gpt-4o-transcribe и gpt-4o-mini-transcribe со подобрувања во стапката на грешки во зборовите и подобро препознавање и точност на јазикот, во споредба со оригиналните Whisper модели.

gpt-4o-transcribe покажува подобрени перформанси на стапката на грешки во зборови (WER) во споредба со постојните модели Whisper на повеќе воспоставени одредници, што одразува значителен напредок во нашата технологија за претворање говор во текст. Овие напредоци произлегуваат директно од насочени иновации во зајакнувањето на учењето и обемно средно обучување со разновидни, висококвалитетни аудио збирки.

Како резултат на тоа, овие нови модели за претворање на говор во текст можат подобро да ги доловат нијансите на говорот, да ги намалат погрешните препознавања и да ја зголемат доверливоста на транскрипцијата, особено во предизвикувачки сценарија што вклучуваат акценти, бучни средини и различни брзини на говор. Овие модели сега се достапни во интерфејсот за претворање на говор во текст(се отвора во нов прозорец).

Стапката на грешки на зборови (WER) ја мери точноста на моделите за препознавање говор преку пресметување на процентот на погрешно транскрибирани зборови во споредба со референтен транскрипт - пониска WER е подобра и значи помалку грешки. Нашите најнови модели за претворање на говор во текст постигнуваат понизок WER низ репери, вклучувајќи го и FLEURS (Евалуација на промпт со мал број примери на универзални претстави на говор) - мултијазичен говорен репер што опфаќа над 100 јазици користејќи рачно транскрибирани аудио примероци. Овие резултати покажуваат поголема точност на транскрипцијата и поголема покриеност на јазиците. Како што е прикажано тука, нашите модели постојано ги надминуваат Whisper v2 и Whisper v3 во сите јазични евалуации.

На FLEURS, нашите модели обезбедуваат пониска стапка на грешка на зборови (WER) и силни повеќејазични перформанси. Нискиот WER е подобар и значи помалку грешки. Како што е прикажано тука, нашите модели се изедначуваат или ги надминуваат другите водечки модели на повеќето главни јазици.

Нов модел за претворање текст во говор

Исто така, го претставуваме новиот модел gpt-4o-mini-tts со подобра управливост. За првпат, програмерите можат да го „насочат“ моделот не само што да каже, туку и како да го каже - овозможувајќи поприлагодени искуства за случаи на употреба од корисничка поддршка до креативно раскажување приказни. Моделот е достапен во текст-во-говор API(се отвора во нов прозорец). Имајте предвид дека овие модели за претворање на текст во говор се ограничени на вештачки, однапред поставени гласови, кои ги следиме за да се осигураме дека постојано се совпаѓаат со синтетичките однапред поставени гласови.

Технички иновации зад моделите

Предобука со автентични аудио сетови на податоци

Нашите нови аудио модели се надоврзуваат на архитектурите GPT‑4o и GPT‑4o‑mini и се обемно претходно обучени на специјализирани збирки податоци насочени кон аудио, кои беа од суштинско значење за оптимизирање на перформансите на моделот. Овој насочен пристап овозможува подлабок увид во нијансите на говорот и обезбедува извонредни перформанси во задачи поврзани со аудио.

Напредни методи за дестилација

Ги подобривме нашите техники за дестилација, овозможувајќи пренос на знаење од нашите најголеми аудио модели на помали, поефикасни модели. Користејќи напредни методологии за самоигра, нашите збирки на податоци за дестилација ефикасно ги доловуваат реалистичните динамики на разговор, реплицирајќи автентични интеракции помеѓу корисник и асистент. Ова им помага на нашите помали модели да обезбедат одличен квалитет на разговор и одзивност.

Парадигма на зајакнување на учењето

За нашите модели за претворање на говор во текст, интегриравме парадигма со силен акцент на зајакнување на учењето (RL), со што ја подигнавме точноста на транскрипцијата на најсовремено ниво. Оваа методологија значително ја подобрува прецизноста и го намалува појавувањето на халуцинации, што ги прави нашите решенија за претворање на говор во текст исклучително конкурентни во сложени сценарија за препознавање на говор.

Овие развои претставуваат напредок во областа на аудио моделирањето, комбинирајќи иновативни методологии со практични подобрувања за подобри перформанси во апликациите за говор.

Достапност на API

Овие нови аудио модели сега се достапни за сите програмери – повеќе за градење со аудио овде(се отвора во нов прозорец). За програмерите кои веќе создаваат разговорни искуства со текстуални модели, додавањето на нашите модели за претворање говор во текст и текст во говор е најлесниот начин за создавање гласовен агент. Објавуваме интеграција со Agents SDK(се отвора во нов прозорец) која го поедноставува овој процес на развој. За програмери кои сакаат да создадат искуства за претворање на говор во говор со ниска латентност, препорачуваме да користите нашите модели за претворање на говор во говор во Realtime API.

Што е следно

Гледајќи напред, планираме да продолжиме да инвестираме во подобрување на интелигенцијата и точноста на нашите аудио модели и да истражуваме начини да им овозможиме на програмерите да донесат свои сопствени приспособени гласови за да создадат уште поперсонализирани искуства на начини што се усогласени со нашите безбедносни стандарди. Покрај тоа, продолжуваме да учествуваме во разговори со креаторите на политики, истражувачите, програмерите и креативците за предизвиците и можностите што синтетичките гласови можат да ги понудат. Возбудени сме да ги видиме иновативните и креативни апликации што програмерите ќе ги создадат користејќи ги овие подобрени аудио можности. Исто така, ќе инвестираме во други модалитети, вклучувајќи видео, за да им овозможиме на програмерите да создаваат мултимодални агентски искуства.

Снимка од пренос во живо

Автори

OpenAI

Истражувачки водичи

Кристина Ким, Џунхуа Мао, Ји Шен, Ју Жанг

Придонесувачи

Истражување

Алекс Паино, Боуен Ченг, Ченгксу Жуанг, Крис Кох, Демијан Мровца, Ерик Ритер, Џејкоб Меник, Џејмс Беткер, Џи Лин, Џејми Кирос, Џиахуи Ју, Лијанг Жоу, Лију Чен, Кевин Лу, Меделин Бојд, Мајкл Лампе, Мајк Хитон, Нансин Чен, Нитиш Кескар, Саачи Џаин, Сем Тојзер, Сомај Џаин, Тао Сју, Томер Каплан, Веи Хан, Ксијангнинг Чен, Је Џиа

Инженерство

Алина Ву, Андрес Гарсија Гарсија, Арши Батнагар, Авитал Оливер, Брендан Квин, Кристина Хуанг, Дејвид Фанг, Драгос Оприка, Доминик Кундел, Едеде Оивох, Јарослав Твердокхлиб, Џиаџенг Фенг, Џеј Чен, Џенија Варавва, Џордан Ситкин, Џозеф Флоренсио, Лиен Мамитсука, Мада Афлак, Маноли Лиодакис, Марк Хаднал, Ноа Макалум, Ола Окелола, Питер Бакум, Рохан Мехта, Ромен Уе, Ванинг Џијанг, Вејн Чанг, Јилеи Кјан

Производ

Анубха Шривастава, Џеки Шенон, Џеф Харис, Реа Мијара, Шјаолин Хао

Спонзори на раководството

Ејдан Кларк, Ендру Гибиански, Дејвид Сасаки, Кевин Вајл, Лиам Федус, Марк Чен, Ник Рајдер, Ник Турли, Оливие Годемент, Прафула Даривал, Шенѓија Жао, Шушао Би, Шервин Ву, Сулман Чоудри