Frissítés – 2026. július 31.: A ChatGPT Hangon és az OpenAI API-n keresztül, GPT‑Live‑val létrehozott támogatott hanganyagok mostantól SynthID-vízjelezést tartalmaznak. Nyilvános ellenőrző eszközünk mostantól képes észlelni az OpenAI-eredetre utaló jeleket a támogatott hangfájlokban, és API-hozzáférést is bevezettünk az ellenőrzéshez, hogy a fejlesztők és a szervezetek beépíthessék az eredet-ellenőrzéseket a saját munkafolyamataikba. Ezek a frissítések az alább ismertetett biztonsági megközelítésre és arra a szélesebb körű munkánkra épülnek, amelynek célja, hogy az OpenAI által generált tartalmak könnyebben azonosíthatók legyenek.
Bemutatjuk a GPT‑Live‑ot, a hangmodellek új generációját, amelynek köszönhetően az AI-val való beszélgetés sokkal inkább valódi beszélgetésnek érződik.
A GPT‑Live full-duplex architektúrára épül, vagyis egyszerre tud figyelni és beszélni. Beszélgetés közben a GPT‑Live az olyan visszajelzésekkel, mint az „ühüm” vagy az „aha”, jelezheti, hogy figyel, gyorsan reagálhat, vagy egyszerűen csendben maradhat, ha szükséged van egy pillanatra a gondolkodáshoz. Az eredmény egy olyan hangélmény, amellyel üdítően könnyű beszélgetni.
A GPT‑Live egyben az eddigi legokosabb hangmodellünk is. Azoknál a kérdéseknél, amelyek webes keresést, mélyebb érvelést vagy összetettebb munkát igényelnek, a háttérben átadja a feladatot a legújabb élvonalbeli modellünknek, majd amikor elkészült, visszahozza az eredményt a beszélgetésbe. Miközben dolgozik, a GPT‑Live tovább tud beszélgetni veled, és fenn tudja tartani a beszélgetés folyamatosságát. Induláskor a GPT‑Live a háttérben a GPT‑5.5‑öt fogja használni. Ahogy új élvonalbeli modelleket adunk ki, folyamatosan frissítjük a GPT‑Live által használt modellt.
Ezek a fejlesztések egy új, intelligensebb és természetesebben használható ChatGPT Hang-élményt tesznek lehetővé. Úgy gondoljuk, hogy idővel ez a kutatás azt is lehetővé teszi majd, hogy a hangot egyre összetettebb, hosszabb ideig futó és ügynöki jellegű munkafolyamatokhoz használjuk.
Ma megkezdjük a GPT‑Live két verziójának – a GPT‑Live‑1 és a GPT‑Live‑1 mini – globális bevezetését a ChatGPT‑felhasználók számára. Terveink szerint hamarosan az API-ban is elérhetővé tesszük őket; a fejlesztők és a vállalatok ezen az űrlapon iratkozhatnak fel az értesítésre.
Belépés az ember–AI interakció új korszakába
A célunk az igazán természetes ember–AI interakció megteremtése: egy olyan világé, ahol az AI-val való együttműködés ugyanolyan gördülékenynek és gyorsan reagálónak érződik, mint amikor egy másik emberrel dolgozunk, miközben az érvelés és az összetett feladatok végrehajtása zökkenőmentesen a háttérben zajlik.
Korábbi megközelítések
A hangalapú AI-rendszerek korábbi generációi közelebb vittek minket ehhez a vízióhoz, de fontos kompromisszumokkal jártak.
Kaszkádos hangrendszerek
A kaszkádos hangrendszerek több, egymás után működő modellre támaszkodnak az egyes megszólalási körök feldolgozásához. Az eredeti ChatGPT Hang három modellt kapcsolt össze: egy beszédfelismerő modellt, amely átírta a beszédet szöveggé, egy nagy nyelvi modellt, amely választ készített, és egy szövegfelolvasó modellt, amely ezt visszaalakította beszéddé. Ez a megközelítés tette először lehetővé, hogy élvonalbeli AI-modellekkel beszélgessünk, de az összetettségnek ára volt: az információ elveszhetett a modellek között, a válaszok pedig lassúak és döcögősek voltak.
Kaszkádolt hangrendszer
Lassú, akadozó válaszok, hosszú szünetek
Körökre osztott hangmodellek
Az olyan körökre osztott hangmodellek, mint a ChatGPT speciális hang mód, egyetlen modellen belül dolgozták fel és generálták a hangot, csökkentve a késleltetést és gördülékenyebbé téve a beszélgetéseket — de továbbra is különálló körökben működtek. A modellnek meg kellett várnia, amíg a felhasználó abbahagyja a beszédet, mielőtt válaszolhatott volna, ami merev oda-vissza párbeszédet eredményezett. Emellett, mivel a megszólalási kör észlelése a csend alapján történik, akár egy rövid szünetet vagy háttérzajt is a kör végének lehetett értelmezni — emiatt a modell természetellenes pillanatokban szakíthatta félbe a felhasználót.
Fordulóalapú hangmodell
Valamivel gyorsabb és gördülékenyebb válaszok, de a modellel való oda-vissza kommunikáció még mindig merevnek érződik
Az új megközelítésünk
A GPT‑Live két architekturális változtatással kezeli ezeket a korlátokat.
Folyamatos interakció
Először is a GPT‑Live‑ot folyamatos interakcióra terveztük, full-duplex architektúrával. A különálló üzenetek sorozatának feldolgozása helyett a GPT‑Live folyamatosan dolgozza fel a bemenetet, miközben kimenetet generál. A modell így másodpercenként sokszor tud dönteni az interakcióról: beszéljen-e, tovább figyeljen-e, szünetet tartson-e, közbevágjon-e, vagy meghívjon-e egy eszközt.
Ez lehetővé teszi, hogy a modell természetesebb párbeszédet folytasson, jobban érzékelje az időzítést, sőt akár élő fordítást is végezzen.
Folyamatos interakció
Gyors, természetes, kifejező válaszok és aktívabb odafigyelés
Delegálás mélyebb munkához
Másodszor, szétválasztottuk a folyamatos interakciót kezelő GPT‑Live‑ot a mélyebb munkától. Ha egy kérdés keresést, érvelést vagy erősebb ügynöki képességeket igényel, a GPT‑Live átadhatja a feladatot egy másik modellnek, például a GPT‑5.5‑nek. Így akkor is fenn tudja tartani a beszélgetést, amikor közben több feladatot kezel a háttérben.
Ez az architekturális változtatás azt is lehetővé teszi, hogy a GPT‑Live folyamatosan a legújabb modelleket és ügynököket használja, ötvözve az élvonalbeli intelligenciát a természetes interakcióval.
Delegálás mélyebb munkához
A GPT-Live gyors, természetes válaszokat ad, miközben a GPT-5.5 a háttérben végzi a keresést
Értékelések
Új emberi értékeléseket hoztunk létre annak mérésére, mennyire kellemes és gördülékeny a beszélgetés. Ezekben a közvetlen összehasonlításokban a GPT‑Live‑1‑et és a GPT‑Live‑1 minit egyértelműen előnyben részesítik a speciális hang móddal szemben az egymáshoz illesztett, 5–10 perces beszélgetésekben, amelyek az általános preferenciát, a megszólalási körök kezelését, a közbevágásokat, a beszélgetés folyamatát és az egyes interakciók természetességét mérik.
- GPQA: a GPT‑Live‑1 jelentősen felülmúlja a speciális hang módot a GPQA-n, amely szakértői szintű tudományos érvelést tesztel biológiában, kémiában és fizikában.
- BrowseComp: a GPT‑Live‑1 jelentős javulást mutat a speciális hang módhoz képest a BrowseComp teszten, amely az ügynöki jellegű webes keresést és a nehezen megtalálható információk felkutatásának képességét méri.
- τ³-Voice Telecom (belső változat)**: A GPT‑Live‑1 felülmúlja a speciális hang módot a τ³-Voice Telecom feladaton, amely a hangügynököket valósághű, többfordulós telekommunikációs támogatási feladatokon teszteli.
* A GPT‑Live‑1 (gyors) és a GPT‑Live‑1 mini a háttérben a GPT‑5.5 Gyors modellt használja, míg a GPT‑Live‑1 Közepes és a GPT‑Live‑1 Erős a GPT‑5.5 Thinking modellt használja közepes, illetve erős érvelési erőfeszítéssel.
** Ehhez az értékeléshez egy testreszabott felhasználói modellt használtunk, amelyet legújabb érvelési modelljeink működtetnek.
Új ChatGPT Hang-élmény
Hetente több mint 150 millióan beszélnek a ChatGPT‑vel olyan funkciókkal, mint a Hang és a Diktálás. Használják kéz nélküli mindennapi segítségre, nyelvgyakorlásra, esti mesékhez, vagy egyszerűen csak beszélgetésre ingázás közben.
Mától, amikor a Hang gombra koppintva beszélgetsz a ChatGPT‑vel, a GPT‑Live által működtetett, továbbfejlesztett élményt kapsz: természetesebb beszélgetéseket, okosabb válaszokat, jobb figyelmet és vizuális válaszokat.
Természetesebb beszélgetések
A ChatGPT‑vel való beszélgetésnek mostantól sokkal inkább valódi beszélgetés érzését kell keltenie. Közbevághatsz egy kérdéssel, tarthatsz szünetet, hogy összeszedd a gondolataidat, vagy megkérheted a ChatGPT‑t, hogy lassítson. Természetesen jelzi, hogy figyel arra, amit mondasz, például olyan kifejezésekkel, mint a „mhmm” vagy az „értem”, így tudod, hogy követi a beszélgetést. A ChatGPT kilenc különböző hangját is újramasztereltük a GPT‑Live‑hoz.
Okosabb válaszok
A ChatGPT Hang mostantól a legújabb élvonalbeli modelljeinkre is támaszkodhat, így okosabb válaszokat adhat, amikor szükséged van rájuk. Kiválaszthatod az igényeidhez illő érvelési szintet is: az Instant gyors válaszokhoz, a Medium és a High pedig akkor, ha szeretnéd, hogy a ChatGPT több időt töltsön gondolkodással.
Jobb figyelem
Ha időre van szükséged a gondolkodáshoz, a ChatGPT Hang most már vár, ahelyett hogy közbevágna és megszakítana. Ha megkéred, hogy maradjon csendben és figyeljen, így is tesz. Ha pedig háttérzaj van, például elhaladó forgalom vagy közeli beszélgetések, a ChatGPT jobban tud a hangodra összpontosítani, és kevésbé zavarodik meg.
Vizuális válaszok egy pillantásra
Egyes válaszok hasznosabbak, ha látni is lehet őket. Beszélgetés közben a ChatGPT mostantól gazdag vizuális kártyákat jeleníthet meg olyan témákban, mint az időjárás, a részvények, a sport és még sok más. A Hang továbbra is támogatja a keresést, a memóriát, a képeket és a fájlfeltöltéseket.



Az eredmény egy olyan ChatGPT Hang-élmény, amely természetesebbnek, képességesebbnek és hasznosabbnak érződik a mindennapokban.
Hangra tervezett biztonság
A GPT‑Live‑ot alapértelmezetten biztonságosra terveztük. A legújabb modelljeink biztonsági fejlesztéseire épít, miközben célzott biztonsági képzést ad hozzá a fő kockázati területeken, valamint kifejezetten hanghoz tervezett új védelmi megoldásokat.
Kibővített biztonsági tesztelés
Hogy jobban tükrözzük, hogyan használják az emberek a hangot valós helyzetekben, a biztonsági tesztelést új, natívan hangalapú értékelésekkel bővítettük. Szintetikus értékeléseket is létrehoztunk, amelyek generált hangot használnak a fő biztonsági területek intenzívebb vizsgálatára, a speciális hang módból szerzett tapasztalatainkra támaszkodva. Ezek közé tartozik az önkárosítás, a pszichózis és a mánia, az MI-re való érzelmi támaszkodás, az erőszak és a szexuális tartalom. Belső szakértők a hangra jellemző kockázatok szempontjából is red teamingnek vetették alá a modellt.
Tesztjeinkben a GPT‑Live az általunk értékelt területek szinte mindegyikén a speciális hang módhoz hasonlóan vagy annál jobban teljesített. Tesztelésünkről és védelmi megoldásainkról bővebben a GPT‑Live rendszerkártyájában(új ablakban nyílik meg) olvashatsz.
Beépített védelmi megoldások
Mivel a hangalapú beszélgetések valós időben zajlanak, olyan védelmi megoldásokat is építettünk, amelyek a modell beszéde közben is működésbe léphetnek. Amikor a rendszer potenciálisan nem biztonságos kimenetet észlel, biztonságosabb válasz felé terelheti a modellt, további biztonsági üzeneteket vagy erőforrásokat jeleníthet meg, illetve magasabb kockázatú esetekben lezárhatja a hangalapú beszélgetést. Az önkárosítással kapcsolatos beszélgetésekhez a ChatGPT támogatási folyamatait hangra alakítottuk át, beleértve a szakértők által ellenőrzött krízis-segélyvonalak felajánlását.
További védelmeket terveztünk a tizenéves felhasználók támogatására, és közvetlenül a modellbe tanítottunk életkornak megfelelő viselkedést, hogy csökkentsük a nem megfelelő válaszok kockázatát. A szülők a szülői felügyeleten keresztül dönthetnek arról, hogy tizenéves gyermekük használhatja-e a ChatGPT Hangot, a kapcsolt szülők pedig értesítést kaphatnak magasabb kockázatú helyzetekben, amikor lehetséges önkárosítás vagy öngyilkossági szándék jelei merülnek fel.
Tanulás a valós használatból
Hosszabb távú mérést és bevezetés utáni monitorozást is indítunk, amely az érzelmi támaszkodásra összpontosít, hogy tovább mélyítsük megértésünket és finomítsuk a védelmi megoldásokat. Az affektív használatról és érzelmi jóllétről szóló korábbi kutatásunkra építve ez segít azonosítani az újonnan megjelenő mintázatokat, és javítani, hogyan reagál a rendszer érzelmileg érzékeny interakciókban.
Végül: a GPT‑Live‑ot beszélgetésre terveztük, nem hangutánzásra. A ChatGPT‑ben előre meghatározott hangokat használ, és védelmi megoldások akadályozzák meg, hogy valós személy hangját utánozza.
Elkötelezettek vagyunk a biztonság és a jóllét támogatása mellett, és a valós használatból tanulva tovább erősítjük ezeket a védelmeket.
Elérhetőség és korlátozások
A GPT‑Live bevezetése most zajlik világszerte a ChatGPT‑felhasználók számára iOS-en, Androidon és a ChatGPT.com(új ablakban nyílik meg) oldalon. A GPT‑Live‑1 lesz az alapértelmezett modell, amely a ChatGPT Hangot működteti a Go-, Plus- és Pro-felhasználóknál, a GPT‑Live‑1 mini pedig az ingyenes felhasználóknál válik alapértelmezetté. További elérhetőségi részletek a Súgóközpontban(új ablakban nyílik meg) találhatók.
A GPT‑Live‑ot a ChatGPT néhány legnépszerűbb nyelvére optimalizáltuk. Bizonyos nyelveken a modellnek nem anyanyelvi akcentusa lehet, vagy hiányosságai lehetnek a folyékonyságban. Aktívan dolgozunk azon, hogy minden nyelven javítsuk az élményt.
Induláskor a GPT‑Live nem támogatja a hangot videóval vagy képernyőmegosztással a ChatGPT‑ben, de dolgozunk rajta, hogy hamarosan bevezessük ezeket a képességeket. Továbbra is hozzáférhetsz a ChatGPT Hang korábbi verzióihoz, köztük a Standard és a speciális hang módhoz, ahol ezek a funkciók elérhetők.


