Entdecke GPT‑Live
Eine neue Generation von Sprachmodellen für natürliche Mensch-KI-Interaktion – jetzt in ChatGPT Sprachchat.
Update vom 31. Juli 2026: Unterstützte Audiodateien, die mit GPT‑Live über ChatGPT Sprachchat und die OpenAI API generiert werden, enthalten jetzt SynthID-Wasserzeichen. Unser öffentliches Verifizierungstool kann jetzt OpenAI-Provenienzsignale in unterstützten Audiodateien erkennen, und wir haben API-Zugriff für die Verifizierung eingeführt, damit Entwickler:innen und Organisationen Provenienzprüfungen in ihre eigenen Arbeitsabläufe integrieren können. Diese Aktualisierungen bauen auf dem unten beschriebenen Sicherheitsansatz sowie auf unseren umfassenderen Bemühungen auf, von OpenAI generierte Inhalte leichter erkennbar zu machen.
Wir führen GPT‑Live ein: eine neue Generation von Sprachmodellen, mit denen sich Gespräche mit KI deutlich mehr wie echte Unterhaltungen anfühlen.
GPT‑Live basiert auf einer Full-Duplex-Architektur. Das bedeutet: Es kann gleichzeitig zuhören und sprechen. In Gesprächen kann GPT‑Live mit Ausdrücken wie „hm-hm“ oder „ja“ zeigen, dass es aufmerksam ist, schnell hin und her wechseln oder einfach still bleiben, wenn du einen Moment zum Nachdenken brauchst. Das Ergebnis ist ein Sprachchat, mit dem man erfrischend leicht sprechen kann.
GPT‑Live ist außerdem unser bisher intelligentestes Sprachmodell. Bei Fragen, die eine Websuche, tieferes Reasoning oder komplexere Arbeit erfordern, delegiert es im Hintergrund an unser neuestes Frontier-Modell und bringt das Ergebnis in die Unterhaltung zurück, sobald es bereit ist. Währenddessen kann GPT‑Live weiter mit dir sprechen und den Gesprächsfluss aufrechterhalten. Zum Start verwendet GPT‑Live im Hintergrund GPT‑5.5. Wenn wir neue Frontier-Modelle veröffentlichen, aktualisieren wir das von GPT‑Live verwendete Modell fortlaufend.
Diese Fortschritte ermöglichen einen neuen ChatGPT Sprachchat, der intelligenter und natürlicher zu nutzen ist. Langfristig kann diese Forschung unserer Ansicht nach auch ermöglichen, Sprache für immer komplexere, länger laufende und stärker agentenbasierte Arbeit einzusetzen.
Ab heute führen wir weltweit schrittweise zwei Versionen von GPT‑Live für Menschen ein, die ChatGPT nutzen: GPT‑Live‑1 und GPT‑Live‑1 mini. Wir planen außerdem, sie bald in die API zu bringen. Entwickelnde und Unternehmen können sich über dieses Formular für Benachrichtigungen anmelden.
Der Beginn einer neuen Ära der Mensch-KI-Interaktion
Unsere Vision ist eine wirklich natürliche Mensch-KI-Interaktion: eine Welt, in der sich die Zusammenarbeit mit KI so flüssig und reaktionsschnell anfühlt wie die Arbeit mit einem anderen Menschen, während Reasoning und die Ausführung komplexer Aufgaben nahtlos im Hintergrund stattfinden.
Bisherige Ansätze
Frühere Generationen von Sprach-KI-Systemen haben uns dieser Vision nähergebracht, allerdings mit deutlichen Kompromissen.
Kaskadierte Sprachsysteme
Kaskadierte Sprachsysteme stützen sich auf eine Reihe von Modellen, die nacheinander arbeiten, um jeden Gesprächsbeitrag zu verarbeiten. Der ursprüngliche ChatGPT Sprachchat verband drei Modelle miteinander: ein Speech-to-Text-Modell zur Transkription deiner Sprache, ein großes Sprachmodell zur Erstellung einer Antwort und ein Text-to-Speech-Modell, das diese Antwort wieder in Sprache umwandelte. Mit diesem Ansatz konnten wir erstmals mit Frontier-KI-Modellen sprechen. Die Komplexität hatte jedoch ihren Preis: Zwischen den Modellen konnten Informationen verloren gehen, und die Antworten waren langsam und steif.
Kaskadiertes Sprachsystem
Langsame und hölzerne Antworten, lange Pausen
Rundenbasierte Sprachmodelle
Rundenbasierte Sprachmodelle wie der erweiterte Sprachmodus von ChatGPT verarbeiteten und erzeugten Audio in einem einzigen Modell. Das senkte die Latenz und machte Gespräche flüssiger, aber sie funktionierten weiterhin in einzelnen Gesprächsrunden. Das Modell musste warten, bis die nutzende Person aufgehört hatte zu sprechen, bevor es antworten konnte. Dadurch entstand ein starrer Hin-und-her-Austausch. Da die Erkennung des Gesprächswechsels außerdem auf Stille basiert, konnte schon eine kurze Pause oder ein Hintergrundgeräusch fälschlich als Ende des Beitrags erkannt werden. Das führte dazu, dass das Modell zu unnatürlichen Zeitpunkten unterbrach.
Rundenbasiertes Sprachmodell
Geringfügig schnellere und flüssigere Antworten, aber das Hin und Her mit dem Modell fühlt sich weiterhin starr an
Unser neuer Ansatz
GPT‑Live behebt diese Einschränkungen durch zwei Änderungen an der Architektur.
Kontinuierliche Interaktion
Erstens haben wir GPT‑Live für kontinuierliche Interaktion auf Basis einer Full-Duplex-Architektur entwickelt. Statt eine Abfolge einzelner Nachrichten zu verarbeiten, verarbeitet GPT‑Live fortlaufend Eingaben, während es Ausgaben erzeugt. Das Modell kann dadurch viele Male pro Sekunde Interaktionsentscheidungen treffen: ob es sprechen, weiter zuhören, pausieren, unterbrechen oder ein Tool aufrufen soll.
So kann das Modell natürlicher hin und her kommunizieren, ein besseres Zeitgefühl behalten und sogar live übersetzen.
Kontinuierliche Interaktion
Schnelle, natürliche, ausdrucksstarke Antworten und aktiveres Zuhören
Delegation für anspruchsvollere Aufgaben
Zweitens haben wir GPT‑Live, das die kontinuierliche Interaktion übernimmt, von anspruchsvolleren Aufgaben entkoppelt. Wenn eine Frage Suche, Reasoning oder stärker agentenbasierte Fähigkeiten erfordert, kann GPT‑Live die Aufgabe an ein anderes Modell wie GPT‑5.5 delegieren. So kann es die Unterhaltung fortsetzen, auch während es mehrere Aufgaben im Hintergrund bearbeitet.
Diese Architekturänderung ermöglicht GPT‑Live außerdem, fortlaufend die neuesten Modelle und Agenten zu nutzen und Frontier-Intelligenz mit natürlicher Interaktion zu verbinden.
Delegation für tiefere Arbeit
GPT-Live bietet schnelle, natürliche Antworten, während GPT-5.5 die Suche im Hintergrund übernimmt
Evaluierungen
Wir haben neue Evaluierungen mit Menschen entwickelt, um angenehme Nutzung und Gesprächsfluss zu messen. In diesen direkten Vergleichen werden GPT‑Live‑1 und GPT‑Live‑1 mini in vergleichbaren Gesprächen von 5–10 Minuten klar gegenüber dem erweiterten Sprachmodus bevorzugt. Gemessen werden Gesamtpräferenz, Gesprächswechsel, Unterbrechungen, Gesprächsfluss und wie natürlich sich die jeweilige Interaktion anfühlt.
- GPQA: GPT‑Live‑1 schneidet bei GPQA deutlich besser ab als der erweiterte Sprachmodus. Der Test prüft wissenschaftliches Reasoning auf Expertenniveau in Biologie, Chemie und Physik.
- BrowseComp: GPT‑Live‑1 zeigt bei BrowseComp deutliche Verbesserungen gegenüber dem erweiterten Sprachmodus. Der Test prüft agentenbasierte Websuche und die Fähigkeit, schwer auffindbare Informationen zu finden.
- τ³-Voice Telecom (interne Variante)**: GPT‑Live‑1 schneidet bei τ³-Voice Telecom besser ab als der erweiterte Sprachmodus. Der Benchmark testet Sprachagenten in realistischen mehrstufigen Supportaufgaben im Telekommunikationsbereich.
* GPT‑Live‑1 (Instant) und GPT‑Live‑1 mini nutzen im Hintergrund das GPT‑5.5 Instant-Modell, während GPT‑Live‑1 Mittel und GPT‑Live‑1 Hoch das GPT‑5.5 Thinking-Modell mit mittlerem bzw. hohem Reasoning-Aufwand verwenden.
** Für diese Evaluation haben wir ein angepasstes Nutzermodell verwendet, das auf unseren neuesten Reasoning-Modellen basiert.
Ein neues ChatGPT Sprachchat-Erlebnis
Jede Woche sprechen mehr als 150 Millionen Menschen über Funktionen wie Sprachchat und Diktieren mit ChatGPT. Sie nutzen es für freihändige Alltagshilfe, zum Sprachenlernen, für Gute-Nacht-Geschichten oder einfach zum Plaudern auf dem Arbeitsweg.
Ab heute bekommst du ein verbessertes Erlebnis auf Basis von GPT‑Live, wenn du auf die Sprachchat-Schaltfläche tippst, um mit ChatGPT zu sprechen: mit natürlicheren Gesprächen, intelligenteren Antworten, besserem Zuhören und visuellen Antworten.
Natürlichere Gespräche
Mit ChatGPT zu sprechen, sollte sich jetzt viel mehr wie ein echtes Gespräch anfühlen. Du kannst mit einer Frage unterbrechen, eine Pause machen, um deine Gedanken zu sortieren, oder ChatGPT bitten, langsamer zu sprechen. ChatGPT bestätigt ganz natürlich mit Wendungen wie „mhm“ oder „verstanden“, was du sagst. So weißt du, dass es mitkommt. Außerdem haben wir die neun unterschiedlichen Stimmen in ChatGPT für GPT‑Live neu abgemischt.
Intelligentere Antworten
ChatGPT Sprachchat kann jetzt auf unsere neuesten Frontier-Modelle zugreifen und dir intelligentere Antworten geben, wenn du sie brauchst. Du kannst außerdem die passende Reasoning-Stufe wählen: Instant für schnelle Antworten oder Mittel und Hoch, wenn ChatGPT mehr Zeit zum Nachdenken verwenden soll.
Besseres Zuhören
Wenn du einen Moment nachdenkst, wartet ChatGPT Sprachchat jetzt, statt dazwischenzugehen und dich zu unterbrechen. Wenn du darum bittest, ruhig zu bleiben und zuzuhören, tut es das. Und bei Hintergrundgeräuschen wie vorbeifahrendem Verkehr oder Gesprächen in der Nähe kann sich ChatGPT besser auf deine Stimme konzentrieren, statt sich ablenken zu lassen.
Visuelle Antworten auf einen Blick
Manche Antworten sind hilfreicher, wenn du sie sehen kannst. Während du sprichst, kann ChatGPT jetzt visuell reichhaltige Karten zu Themen wie Wetter, Aktien, Sport und mehr anzeigen. Der Sprachchat unterstützt außerdem weiterhin Suche, Erinnerung, Bilder und Datei-Uploads.



Das Ergebnis ist ein ChatGPT Sprachchat-Erlebnis, das sich natürlicher, leistungsfähiger und im Alltag nützlicher anfühlt.
Sicherheit, speziell für Sprachchat entwickelt
GPT‑Live wurde so entwickelt, dass Sicherheit standardmäßig mitgedacht ist. Es nutzt die Sicherheitsfortschritte unserer neuesten Modelle und ergänzt sie um gezieltes Sicherheitstraining in wichtigen Risikobereichen sowie neue Schutzmechanismen speziell für Sprache.
Erweiterte Sicherheitstests
Damit unsere Tests besser abbilden, wie Menschen Sprache in realen Situationen nutzen, haben wir unsere Sicherheitstests zunächst um neue Audio-native Evaluierungen erweitert. Außerdem haben wir synthetische Evaluierungen erstellt, die mit generiertem Audio wichtige Sicherheitsbereiche intensiver prüfen und auf unseren Erkenntnissen aus dem erweiterten Sprachmodus aufbauen. Dazu gehören Selbstverletzung, Psychosen und Manie, emotionale Abhängigkeit von KI, Gewalt und sexuelle Inhalte. Interne Fachleute haben das Modell außerdem per Red-Teaming auf Risiken getestet, die speziell bei Sprache auftreten.
In unseren Tests schnitt GPT‑Live in nahezu allen bewerteten Bereichen vergleichbar mit oder besser als der erweiterte Sprachmodus ab. Mehr zu unseren Tests und Schutzmaßnahmen findest du in der GPT‑Live‑Systemkarte(wird in einem neuen Fenster geöffnet).
Integrierte Schutzmaßnahmen
Da Sprachunterhaltungen in Echtzeit ablaufen, haben wir außerdem Schutzmaßnahmen entwickelt, die greifen können, während das Modell spricht. Wenn das System potenziell unsichere Ausgaben erkennt, kann es das Modell zu einer sichereren Antwort führen, zusätzliche Sicherheitshinweise oder Ressourcen anzeigen oder die Sprachunterhaltung in Fällen mit höherem Risiko beenden. Für Gespräche zu Selbstverletzung haben wir die Support-Abläufe von ChatGPT für Sprache angepasst, einschließlich des Anbietens von Hilfe durch fachlich geprüfte Krisenhotlines.
Wir haben zusätzliche Schutzmaßnahmen für jugendliche Nutzende entwickelt und altersgerechtes Verhalten direkt in das Modell trainiert, um das Risiko unangemessener Antworten zu verringern. Eltern können über die Kindersicherung festlegen, ob ihr:e Teenager:in ChatGPT Sprachchat nutzen darf. Verknüpfte Eltern können in Situationen mit höherem Risiko benachrichtigt werden, wenn es Hinweise auf mögliche Selbstverletzung oder Suizidabsicht gibt.
Aus der Nutzung in der Praxis lernen
Außerdem führen wir langfristigere Messungen und Monitoring nach dem Launch mit Fokus auf emotionale Abhängigkeit ein, damit wir unser Verständnis weiter verbessern und Schutzmaßnahmen verfeinern können. Aufbauend auf unserer bisherigen Forschung zu affektiver Nutzung und emotionalem Wohlbefinden hilft uns das, neue Muster zu erkennen und die Reaktionen des Systems in emotional sensiblen Interaktionen zu verbessern.
GPT‑Live ist für Gespräche konzipiert, nicht für Stimmimitation. Es nutzt eine Reihe vordefinierter Stimmen in ChatGPT und enthält Schutzmaßnahmen, die verhindern, dass es die Stimme einer realen Person imitiert.
Wir setzen uns für Sicherheit und Wohlbefinden ein und werden diese Schutzmaßnahmen weiter stärken, während wir aus der realen Nutzung lernen.
Verfügbarkeit und Einschränkungen
GPT‑Live wird jetzt weltweit für ChatGPT‑Nutzende auf iOS, Android und ChatGPT.com(wird in einem neuen Fenster geöffnet) eingeführt. GPT‑Live‑1 wird das Standardmodell für ChatGPT Sprachchat bei Go-, Plus- und Pro-Nutzenden. GPT‑Live‑1 mini wird der Standard für Free-Nutzende. Weitere Details zur Verfügbarkeit findest du in unserem Hilfecenter(wird in einem neuen Fenster geöffnet).
Wir haben GPT‑Live für einige der beliebtesten Sprachen in ChatGPT optimiert. Bei bestimmten Sprachen kann das Modell einen nicht muttersprachlichen Akzent haben oder nicht durchgehend flüssig sprechen. Wir arbeiten aktiv daran, das Erlebnis sprachübergreifend zu verbessern.
Zum Start unterstützt GPT‑Live in ChatGPT keinen Sprachchat mit Video oder Bildschirmfreigabe. Wir arbeiten aber daran, diese Funktionen bald einzuführen. Du kannst weiterhin auf ältere Versionen von ChatGPT Sprachchat zugreifen, darunter „Standard“ und „Erweiterter Sprachmodus“, sofern diese Funktionen dort verfügbar sind.


