Mengharungi Cabaran dan Peluang Suara Sintetik
Kami berkongsi pelajaran daripada pratonton berskala kecil Voice Engine, sebuah model untuk mencipta suara tersuai.
OpenAI komited untuk membangunkan AI yang selamat dan bermanfaat secara meluas. Hari ini kami berkongsi pandangan dan hasil awal daripada pratonton berskala kecil bagi sebuah model yang dipanggil Voice Engine, yang menggunakan input teks dan satu sampel audio 15-saat untuk menjana pertuturan yang kedengaran semula jadi dan sangat menyerupai penutur asal. Ia adalah sesuatu yang luar biasa bahawa model kecil dengan satu sampel 15 saat boleh mencipta suara yang emotif dan realistik.
Kami mula-mula membangunkan Voice Engine pada akhir 2022, dan telah menggunakannya untuk menggerakkan suara pratetap yang tersedia dalam API teks-ke-tutur(dibuka dalam tetingkap baru) serta ChatGPT Voice dan Read Aloud. Pada masa yang sama, kami mengambil pendekatan yang berhati-hati dan berasaskan maklumat untuk pelancaran yang lebih meluas disebabkan potensi penyalahgunaan suara sintetik. Kami berharap untuk memulakan dialog mengenai penggunaan suara sintetik secara bertanggungjawab, dan bagaimana masyarakat boleh menyesuaikan diri dengan keupayaan baharu ini. Berdasarkan perbualan-perbualan ini dan hasil ujian-ujian berskala kecil ini, kami akan membuat keputusan yang lebih termaklum tentang sama ada dan bagaimana untuk menerapkan teknologi ini pada skala besar.
Untuk lebih memahami potensi penggunaan teknologi ini, pada lewat tahun lalu kami mula mengujinya secara persendirian dengan sekumpulan kecil rakan kongsi yang dipercayai. Kami benar-benar kagum dengan aplikasi yang telah dibangunkan oleh kumpulan ini. Pelaksanaan berskala kecil ini membantu memaklumkan pendekatan, perlindungan, dan pemikiran kami tentang bagaimana Voice Engine boleh digunakan untuk kebaikan merentasi pelbagai industri. Beberapa contoh awal termasuk:
- Menyediakan bantuan membaca kepada mereka yang tidak boleh membaca dan kanak-kanak melalui suara yang kedengaran semula jadi dan penuh emosi yang mewakili julat pembicara yang lebih luas daripada apa yang mungkin dengan suara pratetap. Age of Learning(dibuka dalam tetingkap baru), sebuah syarikat teknologi pendidikan yang berdedikasi terhadap kejayaan akademik kanak-kanak, telah menggunakan ini untuk menjana kandungan alih suara praskrip. Mereka juga menggunakan Voice Engine dan GPT‑4 untuk mencipta respons masa nyata yang diperibadikan untuk berinteraksi dengan pelajar. Dengan teknologi ini, Age of Learning telah berjaya mencipta lebih banyak kandungan untuk khalayak yang lebih luas.
- Menterjemah kandungan, seperti video dan audio siar, supaya pencipta dan perniagaan dapat mencapai lebih ramai orang di seluruh dunia, dengan lancar dan dalam suara mereka sendiri. Salah satu pengguna awal bagi ini ialah HeyGen(dibuka dalam tetingkap baru), sebuah platform penceritaan visual AI yang bekerjasama dengan pelanggan perusahaan mereka untuk mencipta avatar tersuai yang menyerupai manusia bagi pelbagai kandungan, daripada pemasaran produk hingga demo jualan. Mereka menggunakan Voice Engine untuk terjemahan video, jadi mereka boleh menterjemah suara penutur ke dalam pelbagai bahasa dan mencapai audiens global. Apabila digunakan untuk terjemahan, Voice Engine mengekalkan loghat asli penutur asal: sebagai contoh, menghasilkan bahasa Inggeris dengan sampel audio daripada penutur Perancis akan menghasilkan pertuturan dengan loghat Perancis.
- Mencapai komuniti global, dengan menambah baik penyampaian perkhidmatan penting dalam persekitaran terpencil. Dimagi(dibuka dalam tetingkap baru) sedang membina alat untuk pekerja kesihatan komuniti menyediakan pelbagai perkhidmatan penting, seperti kaunseling untuk ibu yang menyusukan bayi. Untuk membantu pekerja ini membangunkan kemahiran mereka, Dimagi menggunakan Voice Engine dan GPT‑4 untuk memberikan maklum balas interaktif dalam bahasa utama setiap pekerja termasuk Swahili atau bahasa yang lebih tidak formal seperti Sheng, iaitu bahasa campuran kod yang popular di Kenya.
- Menyokong individu yang tidak boleh bertutur, seperti aplikasi terapeutik untuk individu dengan keadaan yang menjejaskan pertuturan dan penambahbaikan pendidikan untuk mereka yang mempunyai keperluan pembelajaran. Livox(dibuka dalam tetingkap baru), sebuah aplikasi komunikasi alternatif AI, menggerakkan peranti Augmentative & Alternative Communication (AAC) yang membolehkan orang kurang upaya berkomunikasi. Dengan menggunakan Voice Engine, mereka dapat menawarkan kepada orang yang tiada suara satu suara yang unik dan tidak kedengaran seperti robot merentasi banyak bahasa. Pengguna mereka boleh memilih pertuturan yang paling mirip dengan diri mereka, dan bagi pengguna berbilang bahasa, mengekalkan suara yang konsisten merentasi setiap bahasa yang dituturkan.
- Membantu pesakit mendapatkan semula suara mereka, bagi mereka yang mengalami masalah pertuturan secara tiba-tiba atau degeneratif. The Norman Prince Neurosciences Institute di Lifespan(dibuka dalam tetingkap baru), sebuah sistem kesihatan bukan berasaskan keuntungan yang berfungsi sebagai afiliasi pengajaran utama bagi sekolah perubatan Universiti Brown, sedang meneroka penggunaan AI dalam konteks klinikal. Mereka telah menjalankan program perintis yang menawarkan Voice Engine kepada individu dengan etiologi onkologi atau neurologi bagi gangguan pertuturan. Memandangkan Voice Engine memerlukan sampel audio yang sangat pendek, doktor Fatima Mirza, Rohaid Ali dan Konstantina Svokos dapat memulihkan suara seorang pesakit muda yang kehilangan pertuturan lancarnya akibat tumor otak vaskular, menggunakan audio daripada video yang dirakam untuk projek sekolah.
Kami sedar bahawa penjanaan pertuturan yang menyerupai suara individu mempunyai risiko yang tinggi, yang menjadi fokus utama terutamanya pada tahun pilihan raya. Kami sedang bekerjasama dengan rakan kongsi U.S. dan antarabangsa merentasi kerajaan, media, hiburan, pendidikan, masyarakat sivil dan seterusnya untuk memastikan kami menyatukan maklum balas mereka semasa kami membina teknologi ini. Rakan kongsi yang menguji Voice Engine hari ini telah bersetuju dengan dasar penggunaan kami, yang melarang penyamaran sebagai individu atau organisasi lain tanpa kebenaran atau hak undang-undang. Selain itu, terma kami dengan rakan kongsi ini memerlukan persetujuan yang jelas dan termaklum daripada penutur asal dan kami tidak membenarkan pembangun membina cara untuk pengguna individu menghasilkan suara mereka sendiri. Rakan kongsi juga mesti mendedahkan dengan jelas kepada audiens mereka bahawa suara yang mereka dengar adalah suara yang dijana oleh AI. Akhir sekali, kami telah melaksanakan satu set langkah keselamatan, termasuk penandaan tera air untuk menjejak asal usul sebarang audio yang dijana oleh Voice Engine, serta pemantauan proaktif tentang bagaimana ia digunakan. Kami percaya bahawa sebarang penggunaan teknologi suara sintetik yang meluas harus disertai dengan pengalaman pengesahan suara yang mengesahkan bahawa penutur asal menambah suara mereka ke dalam perkhidmatan secara sedar serta senarai suara no-go yang mengesan dan mencegah penghasilan suara yang terlalu serupa dengan tokoh terkenal.
Voice Engine ialah kesinambungan komitmen kami untuk memahami perbatasan teknikal dan berkongsi secara terbuka apa yang AI kini mampu lakukan. Selaras dengan pendekatan keselamatan AI kami dan komitmen sukarela kami, kami memilih untuk membuat pratonton tetapi tidak mengeluarkan teknologi ini secara meluas pada masa ini. Kami berharap pratonton Voice Engine ini bukan sahaja menekankan potensinya tetapi juga mendorong keperluan untuk memperkukuh daya tahan masyarakat terhadap cabaran yang dibawa oleh model generatif yang semakin meyakinkan. Secara khusus, kami menggalakkan langkah-langkah seperti:
- Menghentikan pengesahan berasaskan suara secara berperingkat sebagai langkah keselamatan untuk mengakses akaun bank dan maklumat sensitif lain
- Meneroka dasar untuk melindungi penggunaan suara individu dalam AI
- Mendidik orang awam untuk memahami keupayaan dan batasan teknologi AI, termasuk kemungkinan kandungan AI yang mengelirukan
- Mempercepat pembangunan dan penerimaan teknik untuk menjejak asal-usul kandungan audiovisual, supaya sentiasa jelas apabila anda berinteraksi dengan individu sebenar atau dengan AI
Adalah penting agar orang ramai di seluruh dunia memahami ke mana hala tuju teknologi ini, sama ada kami akhirnya melaksanakannya secara meluas sendiri atau tidak. Kami berharap dapat terus melibatkan diri dalam perbualan mengenai cabaran dan peluang suara sintetik bersama penggubal dasar, penyelidik, pembangun dan golongan kreatif.


