Po prezantojmë GPT‑Live, një brez të ri modelesh zanore që e bëjnë bisedën me IA-në të duket shumë më tepër se një bisedë e vërtetë.
GPT‑Live është ndërtuar mbi një arkitekturë full-duplex, që do të thotë se mund të dëgjojë dhe të flasë njëkohësisht. Gjatë bisedave, GPT‑Live mund të tregojë se po të ndjek me shprehje si “mhmm” ose “po”, të përfshihet në shkëmbime të shpejta fjalësh ose thjesht të qëndrojë në heshtje kur të duhet një moment për të menduar. Si rezultat, ofron një përvojë zanore me të cilën është natyrshëm e lehtë të bisedosh.
GPT‑Live është gjithashtu modeli ynë zanor më inteligjent deri më sot. Për pyetje që kërkojnë kërkim në internet, arsyetim më të thellë ose detyra më komplekse, ai ia delegon punën në sfond modelit tonë më të avancuar dhe e rikthen rezultatin në bisedë sapo të jetë gati. Gjatë kësaj kohe, GPT‑Live mund të vazhdojë të bisedojë me ty dhe të ruajë rrjedhën natyrale të bisedës. Në momentin e prezantimit, GPT‑Live do të përdorë GPT‑5.5 në sfond. Me publikimin e modeleve të reja të avancuara, do të përditësojmë vazhdimisht modelin që përdor GPT‑Live.
Këto përparime mundësojnë një përvojë të re zëri në ChatGPT, më inteligjente dhe më natyrale për t’u përdorur. Me kalimin e kohës, besojmë se ky kërkim do të hapë edhe mundësinë për ta përdorur zërin në punë gjithnjë e më komplekse, më afatgjata dhe më agjentike.
Sot po fillojmë t’u vëmë në dispozicion përdoruesve të ChatGPT në mbarë botën dy versione të GPT‑Live – GPT‑Live‑1 dhe GPT‑Live‑1 mini. Gjithashtu, planifikojmë t’i sjellim së shpejti në API, dhe zhvilluesit e ndërmarrjet mund të regjistrohen për t’u njoftuar duke përdorur këtë formular.
Hyrja në një epokë të re të ndërveprimit mes njerëzve dhe IA-së
Vizioni ynë është të mundësojmë ndërveprim vërtet natyral mes njeriut dhe IA-së: një botë ku bashkëpunimi me IA-në ndihet po aq i rrjedhshëm dhe reagues sa puna me një person tjetër, ndërsa arsyetimi dhe kryerja e detyrave komplekse ndodhin pa ndërprerje në sfond.
Qasjet e mëparshme
Gjeneratat më të vjetra të sistemeve të IA-së me zë na afruan me atë vizion, por me kompromise të rëndësishme.
Sisteme zëri kaskadë
Sistemet e zërit kaskadë mbështeten në një varg modelesh që veprojnë njëri pas tjetrit për të përpunuar çdo radhë bisede. Zëri origjinal i ChatGPT lidhi bashkë tri modele: një model nga të folurit në tekst për të transkriptuar të folurit, një model të madh gjuhësor për të prodhuar një përgjigje dhe një model nga teksti në të folur për ta kthyer sërish në të folur. Kjo qasje na mundësoi të flisnim për herë të parë me modele IA avangardë, por kompleksiteti kishte një kosto: informacioni mund të humbiste mes modeleve dhe përgjigjet ishin të ngadalta e të ngurta.
Sistemi i zërit me faza
Përgjigje të ngadalta dhe jo të natyrshme, me pauza të gjata
Modele zëri me radhë
Modelet e zërit me radhë, si modaliteti i zërit të avancuar i ChatGPT, përpunonin dhe gjeneronin audio brenda një modeli të vetëm, duke ulur vonesën dhe duke i bërë bisedat më të rrjedhshme — por ende funksiononin përmes radhëve të ndara. Modeli duhej të priste që përdoruesi të ndalonte së foluri para se të përgjigjej, duke krijuar një bisedë të ngurtë. Përveç kësaj, duke qenë se zbulimi i radhës bazohet te heshtja, edhe një pauzë e shkurtër ose zhurma në sfond mund të merrej gabimisht si fundi i radhës së të folurit — duke bërë që modeli të ndërpriste bisedën në momente jonatyrale.
Modeli i zërit me radhë
Përgjigje pak më të shpejta dhe më të rrjedhshme, por shkëmbimi i komunikimit me modelin duket akoma i ngurtë
Qasja jonë e re
GPT‑Live i zgjidh këto kufizime përmes dy ndryshimeve arkitekturore.
Ndërveprim i vazhdueshëm
Së pari, e ndërtuam GPT‑Live për ndërveprim të vazhdueshëm duke përdorur një arkitekturë full-duplex. Në vend që të përpunojë një sekuencë mesazhesh të veçanta, GPT‑Live përpunon vazhdimisht hyrjen ndërsa gjeneron daljen. Prandaj, modeli mund të marrë vendime ndërveprimi shumë herë në sekondë: nëse të flasë, të vazhdojë të dëgjojë, të bëjë pauzë, të ndërpresë ose të përdorë një mjet.
Kjo i lejon modelit të hyjë në biseda më natyrale, të ruajë një ndjesi më të mirë të kohës dhe madje të kryejë përkthim në kohë reale.
Ndërveprim i vazhdueshëm
Përgjigje të shpejta, të natyrshme dhe shprehëse, si dhe dëgjim më aktiv
Delegim për punë më të thelluar
Së dyti, e ndamë GPT‑Live — që merret me ndërveprimin e vazhdueshëm — nga puna më e thelluar. Kur një pyetje kërkon kërkim, arsyetim ose aftësi më agjentike, GPT‑Live mund t’ia delegojë detyrën një modeli tjetër si GPT‑5.5. Kjo i mundëson të vazhdojë bisedën pa ndërprerje, edhe ndërsa përpunon disa detyra njëkohësisht në sfond.
Ky ndryshim arkitekturor i lejon gjithashtu GPT‑Live të përdorë vazhdimisht modelet dhe agjentët më të fundit, duke bashkuar inteligjencën avangardë me ndërveprimin natyral.
Delegimi për punë më të thelluar
GPT-Live jep përgjigje të shpejta dhe të natyrshme, ndërsa GPT-5.5 menaxhon kërkimin në sfond
Vlerësimet
Krijuam vlerësime të reja njerëzore për të matur sa e këndshme është përvoja dhe sa natyrshëm rrjedh biseda. Në këto krahasime kokë më kokë, GPT‑Live‑1 dhe GPT‑Live‑1 mini u preferuan dukshëm ndaj Advanced Voice Mode në biseda të krahasueshme me kohëzgjatje 5–10 minuta, ku u vlerësuan preferenca e përgjithshme, alternimi i radhës së të folurit, ndërprerjet, rrjedhshmëria e bisedës dhe sa natyrale ndihej secili ndërveprim.
- GPQA: GPT‑Live‑1 e tejkalon ndjeshëm modalitetin e zërit të avancuar në GPQA, i cili teston arsyetimin shkencor të nivelit të ekspertit në biologji, kimi dhe fizikë.
- BrowseComp: GPT‑Live‑1 tregon përmirësime të mëdha ndaj modalitetit të zërit të avancuar në BrowseComp, i cili teston kërkimin agjentik në ueb dhe aftësinë për të gjetur informacion të vështirë për t’u lokalizuar.
- τ³-Voice Telecom (variant i brendshëm)**: GPT‑Live‑1 e tejkalon modalitetin e zërit të avancuar në τ³-Voice Telecom, i cili teston agjentët zanorë në detyra realiste me mbështetjen e telekomunikimit me shumë radhë.
* GPT‑Live‑1 (Instant) dhe GPT‑Live‑1 mini përdorin në sfond modelin GPT‑5.5 Instant, ndërsa GPT‑Live‑1 Medium dhe GPT‑Live‑1 High përdorin modelin GPT‑5.5 Thinking me nivel mesatar dhe të lartë të përpjekjes së arsyetimit.
** Për këtë vlerësim, ne përdorëm një model të personalizuar për përdoruesit, të mundësuar nga modelet tona më të fundit të arsyetimit.
Një përvojë e re ChatGPT Voice
Çdo javë, më shumë se 150 milionë njerëz flasin me ChatGPT duke përdorur veçori si Voice dhe Dictation. Ata e përdorin për ndihmë të përditshme pa përdorur duart, për të praktikuar gjuhë, për të treguar përralla para gjumit ose thjesht për të biseduar gjatë rrugës.
Duke nisur nga sot, kur prek butonin Voice për të folur me ChatGPT, do të kesh një përvojë të përmirësuar të mundësuar nga GPT‑Live—me biseda më të natyrshme, përgjigje më të zgjuara, dëgjim më të mirë dhe përgjigje vizuale.
Biseda më të natyrshme
Të flasësh me ChatGPT tani duhet të ndihet shumë më tepër si një bisedë e vërtetë. Mund ta ndërpresësh me një pyetje, të ndalesh për të mbledhur mendimet ose t’i kërkosh ChatGPT të flasë më ngadalë. Ai e pranon natyrshëm atë që po thua me shprehje si “mhmm” ose “e kuptova”, që ta dish se po të ndjek. Kemi rimasterizuar edhe nëntë zërat e veçantë në ChatGPT për GPT‑Live.
Përgjigje më inteligjente
ChatGPT Voice tani mund të mbështetet te modelet tona më të fundit avangardë, duke të dhënë përgjigje më të zgjuara kur të duhen. Mund të zgjedhësh edhe nivelin e arsyetimit që i përshtatet nevojave të tua: Instant për përgjigje të shpejta, ose Medium dhe High kur do që ChatGPT të kalojë më shumë kohë duke menduar.
Dëgjim më i mirë
Nëse merr një çast për të menduar, ChatGPT Voice tani pret në vend që të hyjë në bisedë dhe të të ndërpresë. Nëse i kërkon të rrijë në heshtje dhe të dëgjojë, ai do ta bëjë. Dhe kur ka zhurmë në sfond, si trafik që kalon ose biseda aty pranë, ChatGPT fokusohet më mirë te zëri yt pa u shpërqendruar.
Përgjigje vizuale me një shikim
Disa përgjigje janë më të dobishme kur mund t’i shohësh. Ndërsa flet, ChatGPT tani mund të shfaqë karta të pasura vizuale për tema si moti, aksionet, sportet e të tjera. Voice vazhdon gjithashtu të mbështesë kërkimin, memorien, imazhet dhe ngarkimet e skedarëve.



Rezultati është një përvojë ChatGPT Voice që ndihet më e natyrshme, më e aftë dhe më e dobishme në jetën e përditshme.
Siguri e projektuar për zërin
GPT‑Live është projektuar të jetë i sigurt si parazgjedhje. Ai ndërtohet mbi përparimet e sigurisë nga modelet tona më të fundit, duke shtuar trajnim të posaçëm sigurie në fushat kryesore të rrezikut dhe mbrojtje të reja të hartuara posaçërisht për zërin.
Testim i zgjeruar i sigurisë
Për të pasqyruar më mirë mënyrën se si njerëzit e përdorin zërin në situata të jetës reale, fillimisht zgjeruam testimet tona të sigurisë duke përfshirë vlerësime të reja të krijuara posaçërisht për audio. Krijuam gjithashtu vlerësime sintetike që përdorin audio të gjeneruar për t’u përqendruar më intensivisht në fushat kryesore të sigurisë, duke u mbështetur në përvojën që fituam nga modaliteti i zërit të avancuar. Këto fusha përfshijnë vetëlëndimin, psikozën dhe maninë, varësinë emocionale nga IA-ja, dhunën dhe përmbajtjen seksuale. Ekspertët tanë të brendshëm gjithashtu testuan modelin përmes testimit të sigurisë për të identifikuar rreziqe specifike që lidhen me ndërveprimin zanor.
Në testimin tonë, GPT‑Live performoi në mënyrë të krahasueshme ose më mirë se modaliteti i zërit të avancuar në pothuajse të gjitha fushat që vlerësuam. Mund të lexosh më shumë për testimin dhe masat tona mbrojtëse në kartën e sistemit(hapet në një dritare të re) të GPT‑Live.
Mbrojtje të integruara
Meqenëse bisedat me zë zhvillohen në kohë reale, ndërtuam edhe masa mbrojtëse që mund të veprojnë ndërsa modeli po flet. Kur sistemi zbulon dalje potencialisht të pasigurt, ai mund ta drejtojë modelin drejt një përgjigjeje më të sigurt, të shfaqë mesazhe ose burime shtesë sigurie, ose ta përfundojë bisedën me zë në raste me rrezik më të lartë. Për bisedat që përfshijnë vetëlëndim, përshtatëm rrjedhat mbështetëse të ChatGPT për zërin, duke përfshirë ofrimin e mbështetjes nga linja ndihme për kriza të verifikuara nga ekspertë.
Projektuam mbrojtje shtesë për të mbështetur përdoruesit adoleshentë dhe trajnuam sjellje të përshtatshme për moshën drejtpërdrejt në model për të ulur rrezikun e përgjigjeve të papërshtatshme. Prindërit mund të zgjedhin nëse adoleshenti i tyre mund të përdorë ChatGPT Voice përmes kontrolleve prindërore, dhe prindërit e lidhur mund të njoftohen në situata me rrezik më të lartë që përfshijnë shenja të vetëlëndimit të mundshëm ose qëllimit vetëvrasës.
Të mësojmë nga përdorimi në botën reale
Po prezantojmë gjithashtu matje afatgjata dhe monitorim pas prezantimit të fokusuara te mbështetja emocionale, për të vazhduar të përmirësojmë kuptimin tonë dhe të përsosim mbrojtjet. Duke u mbështetur në kërkimet tona të mëparshme mbi përdorimin afektiv dhe mirëqenien emocionale, kjo do të na ndihmojë të identifikojmë modele të reja dhe të përmirësojmë mënyrën si sistemi përgjigjet në ndërveprime emocionalisht të ndjeshme.
Së fundi, GPT‑Live është projektuar për bisedë, jo për imitimin e zërit. Ai përdor një grup zërash të paracaktuar në ChatGPT, me masa mbrojtëse për ta penguar të imitojë zërin e një personi real.
Jemi të përkushtuar të mbështesim sigurinë dhe mirëqenien dhe do të vazhdojmë t’i forcojmë këto mbrojtje ndërsa mësojmë nga përdorimi në botën reale.
Disponueshmëria dhe kufizimet
GPT‑Live po shpërndahet tani për përdoruesit e ChatGPT në mbarë botën në iOS, Android dhe ChatGPT.com(hapet në një dritare të re). GPT‑Live‑1 do të bëhet modeli i parazgjedhur që fuqizon ChatGPT Voice për përdoruesit Go, Plus dhe Pro, ndërsa GPT‑Live‑1 mini do të bëhet parazgjedhja për përdoruesit Free. Më shumë detaje mbi disponueshmërinë mund të gjenden në qendrën tonë të ndihmës(hapet në një dritare të re).
E kemi optimizuar GPT‑Live për disa nga gjuhët më të përdorura në ChatGPT. Për disa gjuhë, modeli mund të ketë theks jo-vendas ose mangësi në rrjedhshmëri. Po punojmë aktivisht për të përmirësuar përvojën në të gjitha gjuhët.
Në prezantim, GPT‑Live nuk do të mbështesë zërin me video ose ndarjen e ekranit në ChatGPT, por po punojmë t’i prezantojmë së shpejti këto aftësi. Mund të përdorësh ende versionet e mëparshme të ChatGPT Voice, përfshirë Standard dhe modalitetin e zërit të avancuar, aty ku këto veçori janë të disponueshme.


