Ажурирање од 31. 7. 2026: Подржани аудио-садржај генерисан помоћу GPT‑Live путем Govorni ChatGPT и OpenAI API сада садржи SynthID означавање воденим жигом. Наш јавни алат за верификацију сада може да открије OpenAI сигнале порекла у подржаним аудио-датотекама, а увели смо и API приступ за верификацију како би програмери и организације могли да укључе провере порекла у сопствене токове рада. Ова ажурирања надовезују се на безбедносни приступ описан у наставку и наш шири рад на томе да садржај генерисан помоћу OpenAI буде лакше препознатљив.
Представљамо GPT‑Live, нову генерацију гласовних модела због којих разговор са AI-јем много више личи на прави разговор.
GPT‑Live је изграђен на архитектури пуног дуплекса, што значи да може истовремено да слуша и говори. Током разговора, GPT‑Live може да покаже да прати саговорника фразама попут „мхм” или „да”, да учествује у брзој размени, или да једноставно ћути када вам треба тренутак да размислите. Резултат је гласовно искуство са којим је изненађујуће лако разговарати.
GPT‑Live је уједно наш најпаметнији гласовни модел до сада. За питања која захтевају претрагу веба, дубље резоновање или сложенији рад, он у позадини делегира задатак нашем најновијем граничном моделу и даје резултат у разговор када буде спреман. Док ради, GPT‑Live може да настави разговор са вама и одржи његов ток. При лансирању, GPT‑Live ће у позадини користити GPT‑5.5. Како будемо објављивали нове граничне моделе, континуирано ћемо ажурирати модел који GPT‑Live користи.
Ова унапређења покрећу ново искуство са функцијом Говорни ChatGPT које је интелигентније и природније за коришћење. Верујемо да ће с временом ово истраживање омогућити и коришћење гласа за све сложенији, дуготрајнији и више агентски рад.
Данас почињемо глобално увођење две верзије модела GPT‑Live – GPT‑Live‑1 и GPT‑Live‑1 mini – за кориснике услуге ChatGPT. Планирамо и да их ускоро уведемо у API, а програмери и предузећа могу да се пријаве за обавештење преко овог обрасца.
Улазак у нову еру интеракције између људи и AI-ја
Наша визија је да омогућимо истински природну интеракцију између људи и AI-ја: свет у ком сарадња са AI-јем делује једнако течно и одзивно као рад са другом особом, док се резоновање и извршавање сложених задатака неприметно одвијају у позадини.
Претходни приступи
Старије генерације гласовних AI система приближиле су нас тој визији, али уз значајне компромисе.
Каскадни гласовни системи
Каскадни гласовни системи ослањају се на низ модела који делују један за другим како би обрадили сваки потез у разговору. Оригинални Говорни ChatGPT повезивао је три модела: модел за претварање говора у текст који транскрибује говор, велики језички модел који генерише одговор и модел за претварање текста у говор који га поново претвара у говор. Овај приступ нам је први пут омогућио да разговарамо са граничним AI моделима, али сложеност је имала цену: информације су могле да се изгубе при преласку са једног модела на други, а одговори су били спори и укочени.
Каскадни гласовни систем
Спори и извештачени одговори, дуге паузе
Гласовни модели засновани на смењивању
Гласовни модели засновани на смењивању, попут ChatGPT режима напредног гласа, обрађивали су и генерисали звук у оквиру једног модела, што је смањило кашњење и учинило разговоре течнијим – али су и даље радили кроз засебна смењивања. Модел је морао да сачека да корисник престане да говори пре него што одговори, што је доводило до круте размене. Поред тога, пошто се препознавање краја смењивања заснива на тишини, чак и кратка пауза или позадинска бука могли су бити погрешно протумачени као крај смењивања – због чега би модел прекидао у неприродним тренуцима.
Гласовни модел заснован на смењивању
Нешто бржи и течнији одговори, али размена са моделом и даље делује круто
Наш нови приступ
GPT‑Live решава ова ограничења кроз две архитектонске промене.
Континуирана интеракција
Прво, GPT‑Live смо изградили за континуирану интеракцију помоћу архитектуре пуног дуплекса. Уместо да обрађује низ одвојених порука, GPT‑Live непрекидно обрађује улаз док генерише излаз. Зато модел може више пута у секунди да доноси одлуке о интеракцији: да ли да говори, настави да слуша, направи паузу, прекине или позове алатку.
То омогућава моделу да води природнију размену, боље одржава осећај за време, па чак и да преводи уживо.
Континуирана интеракција
Брзи, природни, изражајни одговори и активније слушање
Делегирање за дубљи рад
Друго, одвојили смо GPT‑Live – који управља континуираном интеракцијом – од дубљег рада. Када питање захтева претрагу, резоновање или више агентске могућности, GPT‑Live може да делегира задатак другом моделу, као што је GPT‑5.5. То му омогућава да одржи разговор, чак и док у позадини обавља више задатака.
Ова архитектонска промена омогућава моделу GPT‑Live и да континуирано користи најновије моделе и агенте, спајајући граничну интелигенцију са природном интеракцијом.
Делегирање за дубљи рад
GPT-Live пружа брзе, природне одговоре, док GPT-5.5 обавља претрагу у позадини
Евалуације
Израдили смо нове људске евалуације за мерење пријатности и тока разговора. У овим директним поређењима, GPT‑Live‑1 и GPT‑Live‑1 mini имају јасну предност у односу на режим напредног гласа у упоредивим разговорима од 5 до 10 минута, у којима се мере укупна преференција, смењивање у разговору, прекидања, ток разговора и природност сваке интеракције.
- GPQA: GPT‑Live‑1 знатно надмашује режим напредног гласа на GPQA тесту, који проверава научно резоновање на стручном нивоу у биологији, хемији и физици.
- BrowseComp: GPT‑Live‑1 показује значајан напредак у односу на режим напредног гласа на тесту BrowseComp, који проверава агентску претрагу веба и способност проналажења тешко доступних информација.
- τ³-Voice Telecom (интерна варијанта)**: GPT‑Live‑1 надмашује режим напредног гласа на тесту у оквиру τ³-Voice Telecom, који тестира гласовне агенте на реалистичним телекомуникационим задацима подршке у више корака.
* GPT‑Live‑1 (тренутно) и GPT‑Live‑1 mini у позадини користе модел GPT‑5.5 Instant, док GPT‑Live‑1 Medium и GPT‑Live‑1 High користе модел GPT‑5.5 Thinking са средњим и високим напором резоновања.
** За ову евалуацију користили смо прилагођени кориснички модел, који покрећу наши најновији модели резоновања.
Ново искуство за Говорни ChatGPT
Сваке недеље више од 150 милиона људи разговара са услугом ChatGPT користећи функције као што су Voice и диктирање. Користе га за свакодневну помоћ без руку, вежбање језика, приче за лаку ноћ или просто за ћаскање током путовања на посао.
Од данас, када додирнете дугме Voice да разговарате са услугом ChatGPT, добићете унапређено искуство које покреће GPT‑Live – са природнијим разговорима, паметнијим одговорима, бољим слушањем и визуелним одговорима.
Природнији разговори
Разговор са услугом ChatGPT сада би требало много више да личи на прави разговор. Можете да га прекинете питањем, застанете да саберете мисли или замолите ChatGPT да успори. Он природно показује да прати шта говорите изразима као што су „мхм” или „разумем”, тако да знате да вас слуша. Такође смо ремастеровали девет препознатљивих гласова у услузи ChatGPT за GPT‑Live.
Паметнији одговори
Говорни ChatGPT сада може да користи наше најновије граничне моделе и да вам пружи паметније одговоре када су вам потребни. Можете и да изаберете ниво резоновања који одговара вашим потребама: Instant за брзе одговоре или Medium и High када желите да ChatGPT проведе више времена размишљајући.
Боље слушање
Ако вам треба тренутак да размислите, Говорни ChatGPT сада чека уместо да ускаче и прекида вас. Ако му кажете да ћути и слуша, тако ће и урадити. А када има позадинске буке, попут саобраћаја у пролазу или разговора у близини, ChatGPT се боље усредсређује на ваш глас уместо да му нешто одвлачи пажњу.
Визуелни одговори на први поглед
Неки одговори су кориснији када можете да их видите. Док разговарате, ChatGPT сада може да приказује богате визуелне картице за теме као што су време, акције, спорт и још много тога. Voice и даље подржава претрагу, меморију, слике и отпремање датотека.



Резултат је искуство са интерфејсом Говорни ChatGPT које делује природније, способније и корисније у свакодневном животу.
Безбедност осмишљена за глас
GPT‑Live је осмишљен тако да подразумевано буде безбедан. Надовезује се на безбедносна унапређења из наших најновијих модела, уз наменску безбедносну обуку у кључним областима ризика и нове мере заштите посебно осмишљене за глас.
Проширено безбедносно тестирање
Да бисмо боље одразили начин на који људи користе глас у стварним условима, почели смо проширивањем безбедносног тестирања новим евалуацијама заснованим на звуку. Направили смо и синтетичке евалуације које користе генерисани звук како би се интензивније усредсредиле на кључне области безбедности, ослањајући се на оно што смо научили из режима напредног гласа. Те области обухватају самоповређивање, психозу и манију, емоционално ослањање на вештачку интелигенцију, насиље и сексуални садржај. Интерни стручњаци су такође спровели тестирање модела црвене команде за ризике јединствене за глас.
У нашем тестирању, GPT‑Live је у скоро свим областима које смо процењивали био упоредив са режимом напредног гласа или бољи од њега. Више о нашем тестирању и мерама заштите можете прочитати у системској картици(отвара се у новом прозору) за GPT‑Live.
Уграђене мере заштите
Пошто се гласовни разговори одвијају у реалном времену, уградили смо и мере заштите које могу да делују док модел говори. Када систем открије потенцијално небезбедан излаз, може да усмери модел ка безбеднијем одговору, прикаже додатне безбедносне поруке или ресурсе, или да прекине гласовни разговор у случајевима већег ризика. За разговоре који укључују самоповређивање, прилагодили смо токове подршке за глас услуге ChatGPT, укључујући нуђење подршке кризних линија коју су проверили стручњаци.
Осмислили смо додатне заштите за подршку тинејџерима и директно обучили модел за понашање примерено узрасту како бисмо смањили ризик од непримерених одговора. Родитељи могу преко родитељских контрола да изаберу да ли њихов тинејџер може да користи Говорни ChatGPT, а повезани родитељи могу бити обавештени у ситуацијама већег ризика које укључују знаке могућег самоповређивања или суицидалне намере.
Учење из употребе у стварном свету
Такође уводимо дугорочнија мерења и праћење после лансирања усмерене на емоционално ослањање, како бисмо наставили да унапређујемо разумевање и усавршавамо мере заштите. Надовезујући се на наше претходно истраживање о афективној употреби и емоционалном благостању, то ће нам помоћи да препознамо нове обрасце и побољшамо начин на који систем реагује у емоционално осетљивим интеракцијама.
На крају, GPT‑Live је осмишљен за разговор, а не за имитирање гласа. Користи скуп унапред дефинисаних гласова у услузи ChatGPT, уз мере заштите које спречавају имитирање гласа стварне особе.
Посвећени смо подршци безбедности и благостању и наставићемо да јачамо ове заштите док учимо из употребе у стварном свету.
Доступност и ограничења
GPT‑Live се сада уводи за кориснике услуге ChatGPT широм света на оперативним системима iOS, Android и сајту ChatGPT.com(отвара се у новом прозору). GPT‑Live‑1 ће постати подразумевани модел који покреће Говорни ChatGPT за кориснике пакета Go, Plus и Pro, а GPT‑Live‑1 mini ће постати подразумеван за кориснике пакета Free. Више детаља о доступности можете пронаћи у нашем Центру за помоћ(отвара се у новом прозору).
Оптимизовали смо GPT‑Live за неке од најпопуларнијих језика у услузи ChatGPT. За одређене језике, модел може имати страни акценат или мањкавости у погледу течности говора. Активно радимо на побољшању искуства на различитим језицима.
При лансирању, GPT‑Live неће подржавати глас са видеом или дељењем екрана у услузи ChatGPT, али радимо на томе да ускоро уведемо те могућности. И даље можете приступити старијим верзијама интерфејса Говорни ChatGPT, укључујући Standard и режим напредног гласа, ако су те функције доступне.


