Ana içeriğe atla
OpenAI

20 Mart 2025

SürümÜrün

API’de yeni nesil ses modellerinin tanıtımı

Sesli asistanlara güç verecek yeni bir ses modeli paketi şimdi dünya genelindeki geliştiricilere sunuldu.

OpenAI yeni nesil ses modelleri blog başlık görseli
Yükleniyor...

28 Ağustos 2025 güncellemesi: Realtime API'nin genel kullanıma açıldığını duyurduk. Buradan daha fazla bilgi edinin.


Son birkaç ay içinde Operatör, Derin Araştırma, Otonom Bilgisayar Kullanma Ajanları ve yerleşik araçlara sahip Responses API gibi sürümlerle, metin tabanlı otonom ajanların (veya kullanıcılar adına görevleri bağımsız olarak yerine getiren sistemlerin) zekasını, yeteneklerini ve kullanışlılığını artırmaya yatırım yaptık. Ancak, otonom ajanların gerçekten faydalı olabilmesi için, insanların yalnızca metinle sınırlı kalmayıp, doğal konuşma dilini kullanarak daha derin ve sezgisel etkileşimler de kurabilmesi gerekir.

Bugün, API'de yeni konuşmayı metne ve metni konuşmaya dönüştürme ses modellerini kullanıma sunuyoruz ve bu sayede, gerçek değer sunan daha güçlü, özelleştirilebilir ve akıllı sesli otonom ajanlar geliştirmeyi mümkün kılıyoruz. En yeni konuşmayı metne dönüştürme modellerimiz, doğruluk ve güvenilirlikte mevcut çözümleri geride bırakarak, özellikle aksanlar, gürültülü ortamlar ve değişen konuşma hızları gibi zorlu senaryolarda yeni bir ileri teknoloji standardı belirliyor. Bu iyileştirmeler, transkripsiyon güvenilirliğini artırarak modelleri özellikle müşteri çağrı merkezleri, toplantı notlarının transkripsiyonu gibi kullanım senaryoları için uygun hale getirir.

İlk kez, geliştiriciler metni konuşmaya dönüştürme modeline belirli bir şekilde konuşması için (örneğin, "Sempatik bir müşteri hizmetleri temsilcisi gibi konuş" şeklinde) talimat verebiliyor. Bu, otonom ajanlar için yeni bir özelleştirme düzeyinin kapılarını açan bir gelişmedir. Bu, daha empatik ve dinamik müşteri hizmetleri seslerinden yaratıcı hikaye anlatımı deneyimleri için etkileyici anlatımlara kadar geniş bir yelpazede kişiselleştirilmiş uygulamaların önünü açar.

İlk ses modelimizi 2022 yılında kullanıma sunduk ve o zamandan beri bu modellerin zekasını, doğruluğunu ve güvenilirliğini artırma kararlılığımızı sürdürüyoruz. Bu yeni ses modelleri sayesinde geliştiriciler, doğrudan API içerisinde konuşmayı metne dönüştürme odaklı daha doğru ve sağlam sistemler ve metni konuşmaya dönüştürme alanında daha etkileyici ve karakterli sesler oluşturabilirler.

Sakin
Sörfçü
Profesyonel
Orta Çağ şövalyesi
True crime tutkunu
Gece masalı

En yeni ses modellerimiz hakkında daha fazla bilgi

Yeni konuşarak yazma modelleri

Orijinal Whisper modellerine kıyasla kelime hata oranında iyileştirmelerin yanı sıra daha iyi dil tanıma ve doğruluk sunan yeni gpt-4o-transcribe ve gpt-4o-mini-transcribe modellerini tanıtıyoruz.

gpt-4o-transcribe, birden fazla yerleşik kıyaslamada mevcut Whisper modellerine göre daha iyi bir Kelime Hata Oranı (WER) performansı sergileyerek, konuşmayı metne dönüştürme teknolojimizde önemli bir ilerlemeyi yansıtmaktadır. Bu ilerlemeler doğrudan, pekiştirmeli öğrenmedeki hedefe yönelik yeniliklerden ve çeşitli, yüksek kaliteli ses veri setleriyle yapılan kapsamlı ara eğitimden kaynaklanmaktadır.

Sonuç olarak, bu yeni konuşmayı metne dönüştürme modelleri, konuşmadaki nüansları daha iyi yakalar, yanlış tanımaları azaltır ve özellikle aksanlar, gürültülü ortamlar ve değişen konuşma hızları gibi zorlu senaryolarda yazıya dökme güvenilirliğini artırır. Bu modeller şu anda speech-to-text API(yeni bir pencerede açılır)'de kullanılabilir.

Kelime Hata Oranı (WER), bir referans metin dökümüyle karşılaştırıldığında yanlış şekilde yazıya dökülmüş olan kelimelerin yüzdesini hesaplayarak konuşma tanıma modellerinin doğruluğunu ölçer. Daha düşük WER değeri daha iyidir ve daha az hata anlamına gelir. En yeni konuşmayı metne dönüştürme modellerimiz, 100’den fazla dili kapsayan ve manuel olarak yazıya dökülmüş ses örneklerini kullanan çok dilli bir konuşma kıyaslaması olan FLEURS (Konuşmanın Evrensel Temsillerinin Az Örnekli Öğrenme Değerlendirmesi) dâhil olmak üzere kıyaslamalar genelinde daha düşük WER değeri elde ediyor. Bu sonuçlar, daha yüksek metin dökümü doğruluğu ve daha geniş dil kapsamına işaret ediyor. Burada gösterildiği gibi, modellerimiz tüm dil değerlendirmelerinde Whisper v2 ve Whisper v3'e kıyasla tutarlı bir şekilde daha iyi performans sergiliyor.

FLEURS'de, modellerimiz daha düşük Kelime Hata Oranı (WER) ve güçlü çok dilli performans sunuyor. Daha düşük Kelime Hata Oranı (WER) daha iyidir ve daha az hata anlamına gelir. Burada gösterildiği gibi, modellerimiz çoğu büyük dilde diğer önde gelen modellerle eşleşir veya onları geride bırakır.

Yeni metinden konuşmaya dönüştürme modeli

Ayrıca daha iyi yönlendirilebilirlik sunan yeni bir gpt-4o-mini-tts modelini de piyasaya sürüyoruz. İlk kez, geliştiriciler modele yalnızca ne söyleyeceğini değil, nasıl söyleyeceğini de "öğretebiliyor". Bu da müşteri hizmetlerinden yaratıcı hikaye anlatımına kadar uzanan kullanım durumları için daha özelleştirilmiş deneyimler sağlıyor. Model, text-to-speech API(yeni bir pencerede açılır)'de mevcuttur. Bu metni konuşmaya dönüştürme modellerinin, sentetik ön ayarlarla tutarlı biçimde eşleştiklerinden emin olmak için izlediğimiz yapay, önceden ayarlanmış seslerle sınırlı olduğunu unutmayın.

Modellerin ardındaki teknik yenilikler

Otantik ses veri kümeleriyle önceden eğitim

Yeni ses modellerimiz, GPT‑4o ve GPT‑4o mini mimarileri üzerine inşa edilmiştir ve model performansını optimize etmede kritik rol oynayan ses odaklı özel veri kümeleri üzerinde kapsamlı bir şekilde önceden eğitilmiştir. Bu hedefli yaklaşım, konuşma nüanslarına dair daha derin içgörüler sunarak sesle ilgili görevlerde olağanüstü performans sağlar.

Gelişmiş damıtma metodolojileri

Damıtma tekniklerimizi geliştirdik, böylece en büyük ses modellerimizden daha küçük ve daha verimli modellere bilgi aktarabiliyoruz. Gelişmiş kendi kendine oynama metodolojilerinden yararlanarak, damıtma veri kümelerimiz gerçekçi konuşma dinamiklerini etkili bir şekilde yakalar ve gerçek kullanıcı-asistan etkileşimlerini yeniden oluşturur. Bu, daha küçük modellerimizin mükemmel sohbet kalitesi sunmasına ve hızlı yanıt verebilmesine yardımcı olur.

Pekiştirmeli öğrenme paradigması

Konuşmayı metne dönüştürme modellerimiz için, pekiştirmeli öğrenme (RL) ağırlıklı bir paradigmayı entegre ederek transkripsiyon doğruluğunu en üst seviyelere çıkardık. Bu yöntem, doğruluğu büyük ölçüde artırır ve halüsinasyonu azaltır; böylece konuşmayı metne dönüştürme çözümlerimizi karmaşık konuşma tanıma senaryolarında son derece rekabetçi hale getirir.

Bu gelişmeler, yenilikçi metodolojileri pratik iyileştirmelerle birleştirerek konuşma uygulamalarında daha yüksek performans için ses modelleme alanında ilerleme kaydedildiğini göstermektedir.

API kullanılabilirliği

Bu yeni ses modelleri artık tüm geliştiriciler tarafından kullanılabilir. Sesle geliştirme hakkında daha fazla bilgiyi burada(yeni bir pencerede açılır) bulabilirsiniz. Zaten metin tabanlı modellerle konuşma deneyimleri geliştiren geliştiriciler için konuşmayı metne ve metni konuşmaya dönüştürme modellerimizi eklemek, bir sesli otonom ajan oluşturmanın en basit yoludur. Bu geliştirme sürecini basitleştiren Agents SDK(yeni bir pencerede açılır) ile bir entegrasyon yayınlıyoruz. Düşük gecikmeli sesli sohbet deneyimleri oluşturmak isteyen geliştiricilere, Realtime API'deki sesli sohbet modellerimizle geliştirme yapmalarını öneririz.

Sırada ne var?

İleriye baktığımızda, ses modellerimizin zekasını ve doğruluğunu artırmaya yatırım yapmaya devam etmeyi ve geliştiricilerin güvenlik standartlarımızla uyumlu şekilde daha kişiselleştirilmiş deneyimler oluşturmak için kendi özel seslerini kullanmalarına olanak tanımanın yollarını keşfetmeyi planlıyoruz. Ayrıca, sentetik seslerin sunabileceği zorluklar ve fırsatlar üzerine yasa belirleyici kurumlar, araştırmacılar, geliştiriciler ve yaratıcılarla görüşmelerimize devam ediyoruz. Geliştiricilerin bu geliştirilmiş ses yeteneklerini kullanarak inşa edeceği yenilikçi ve yaratıcı uygulamaları görmek için sabırsızlanıyoruz. Ayrıca geliştiricilerin çok modlu otonom ajan deneyimleri oluşturmasını sağlamak için video da dahil olmak üzere diğer modalitelere de yatırım yapacağız.

Canlı yayın tekrarı

Yazarlar

OpenAI

Araştırma liderleri

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Katkıda Bulunanlar

Araştırma

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Mühendislik

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Ürün

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Liderlik sponsorları

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry