Zum Hauptinhalt springen
OpenAI

10. September 2026

ProduktVeröffentlichung

Entwickle natürlichere Spracherlebnisse mit GPT‑Live‑1 in der API

GPT‑Live‑1 bringt die natürlichen Vollduplex-Gespräche von ChatGPT in die API mit mehr Kontrolle darüber, wie Sprachagenten sprechen und handeln.

Laden …

Wir führen GPT‑Live‑1 in der API ein und geben Entwickelnden ein leistungsfähiges, natürlich klingendes Sprachmodell an die Hand, mit dem sie sprachgestützte Apps und Geschäftsabläufe entwickeln können. Zuerst in ChatGPT eingeführt, kann GPT‑Live‑1 gleichzeitig zuhören und sprechen und, wie bei Codex und ChatGPT Work gezeigt⁠(wird in einem neuen Fenster geöffnet), tiefergehendes Reasoning und Aktionen an die Modelle und Tools delegieren, mit denen es kombiniert wird.

Für die API-Veröffentlichung von GPT‑Live‑1 haben wir uns auf neue Funktionen konzentriert, mit denen Entwickelnde Spracherlebnisse auf ihre Nutzenden, Workflows und Ziele abstimmen und anpassen können. Eine zentrale Stärke von GPT‑Live‑1, die reibungslose Verarbeitung von Unterbrechungen, sorgt bereits für geschäftliche Wirkung: In ersten Tests stellte Speak fest, dass GPT‑Live‑1 Lernenden mehr Zeit zum Nachdenken gab, bevor der Sprachtutor antwortete, und Unterbrechungen gegenüber bisherigen Systemen mit festen Sprecherwechseln um fast 80 % reduzierte.

Die wichtigsten Stärken von GPT‑Live‑1 in der API:

  • Umgang mit Unterbrechungen: Verbessert den Umgang mit Unterbrechungen durch ein einziges Modell, das eingehende und ausgehende Audiodaten gemeinsam verarbeitet. Dadurch werden die Latenzen und fehleranfälligen Übergaben verketteter STT–LLM–TTS-Architekturen vermieden.

  • Delegierung von Reasoning und Tool-Aufrufen: GPT‑Live‑1 kann Reasoning und Tool-Aufrufe an ein Backend-Textmodell wie GPT‑6 Astra oder ein Drittanbieter-Modell delegieren.

  • Tonfall, Tempo und Stil: Entwickler:innen können Tonfall, Tempo und Gesprächsstil eines Agenten über den System-Prompt gestalten.

  • Stille Kontextverwaltung und Hintergrundgeräusche: Verarbeitet Hintergrundgeräusche und Stille besser, ohne das Gespräch zu unterbrechen oder jeden Schritt laut zu kommentieren.

  • Zuverlässigkeit bei langen Sitzungen: Verbessert die Beibehaltung des Kontexts und die Gesprächsqualität bei längeren Interaktionen.

  • Telefonie-Unterstützung: Ermöglicht den Einsatz von Vollduplex-Sprach-Agenten für Telefongespräche, von Restaurantreservierungen bis zum Kundensupport.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Diese Demo ist zeitlich begrenzt. Durch die Nutzung stimmst du den Nutzungsbedingungen von OpenAI zu und bestätigst, dass du unsere Datenschutzrichtlinie zur Kenntnis genommen hast.

Vereinfache deine Sprachagenten-Architektur und reduziere die Sprachlatenz

Herkömmliche Sprach-Agenten verknüpfen Spracherkennung, ein Reasoning-Modell und Sprachsynthese. Jede Übergabe erhöht die Latenz und birgt zusätzliche Risiken, das Timing, den Kontext oder den natürlichen Gesprächsrhythmus zu verlieren. Die Koordination dieser Phasen bleibt häufig den Entwickelnden überlassen. Das gilt auch für Unterbrechungen, Pausen oder Richtungswechsel im Gespräch.

GPT‑Live‑1 übernimmt Zuhören und Sprechen in einem einzigen Modell und vereinfacht damit die Sprachschicht. Es kann unmittelbar auf Unterbrechungen und Bestätigungen reagieren und komplexeres Reasoning zugleich an das Backend delegieren. So kann das Gespräch weiterlaufen, während im Hintergrund gearbeitet wird.

“Gegenüber unserer kaskadierten Lösung hat GPT‑Live‑1 unsere Codebasis um 80 % vereinfacht und 23.000 Codezeilen überflüssig gemacht. Dadurch wurden natürliche Echtzeitgespräche mit Patientinnen und Patienten möglich. Unser Team kann sich nun darauf konzentrieren, das Erlebnis von der Terminbuchung bis zur Orientierung in der Versorgung zu verbessern.”
– Tony Stoyanov, Mitbegründer und CTO

Entwickelnde wählen die Modelle, Tools und das Agenten-Harness hinter dem Gespräch. Sie können GPT‑Live‑1 beispielsweise für Aufgaben mit hohem Volumen wie Terminplanung oder Bestellaktualisierungen mit einem Modell wie Luna kombinieren. Für komplexe Anliegen im Kundensupport, die Reasoning erfordern, können sie ein Modell wie Astra einsetzen. Dank dieser Flexibilität können Entwickelnde Reasoning-Tiefe, Geschwindigkeit und Kosten auf die jeweilige Aufgabe abstimmen.

GPT‑Live‑1 stellt nativ ASR-Transkripte und Antworttexte bereit. Es bietet zudem ein gutes Verständnis alphanumerischer Inhalte und unterstützt die Gewichtung von Schlüsselwörtern. Auch wenn GPT‑Live‑1 kein Modell mit festen Sprecherwechseln ist, erkennt es diese nativ. Entwickelnde können ihre Systeme daher weiterhin um explizite Sprecherwechsel herum aufbauen.

Den Vollduplex-Vorteil messen

In unseren Evaluationen verbessert GPT‑Live‑1 die Leistung beim Full Duplex Bench gegenüber GPT‑Realtime‑2.1 um 30 Prozentpunkte, mit großen Verbesserungen bei der Latenz beim Sprecherwechsel und beim interaktiven Verhalten. In Kombination mit GPT‑6 Astra bei mittlerem Reasoning-Aufwand belegt es außerdem Platz 1 bei Tau3, das die Frontier-Intelligenz von Sprachagenten bei durchgängigen Aufgaben misst.

Bewertet gesprochene Kundendienstaufgaben in den Bereichen Fluggesellschaften, Einzelhandel und Telekommunikation. Pass@1 misst den Aufgabenerfolg; die Überschrift gewichtet jeden Bereich gleich.


* GPT‑Live‑Backend: Astra (Mittel).

Bewertet sprachbasierten Bankensupport mit Wissensabruf und Kontotools. Pass@1 ist der Anteil der 97 erfolgreich abgeschlossenen banking_knowledge-Aufgaben.


* GPT‑Live‑Backend: Astra (Mittel).

Bewertet den Umgang mit Pausen, Sprecherwechsel, Unterbrechungen und Rückmeldesignalen.

Testet Reaktionen auf Hintergrundsprache, an eine andere Person gerichtete Sprache, Rückmeldungen des Zuhörenden und Unterbrechungen.

Misst, wie schnell der Agent mit seiner Antwort beginnt, nachdem ein Nutzer seinen Gesprächsbeitrag beendet hat.

Testet die Tool-Nutzung anhand gesprochener Anfragen mit natürlichen Pausen, Zögern und Selbstkorrekturen. Pass@1 bewertet die Tool-Aufrufsequenz.


* GPT‑Live‑Backend: Terra (niedrig).

Bewertet die gesprochene Antwort auf Anfragen, für die Tools genutzt werden und die Pausen, Zögern sowie Selbstkorrekturen enthalten. Bewertet, wie gut die Antwort der Referenzintention entspricht.


* GPT‑Live‑Backend: Terra (niedrig).

Das sagen Unternehmen

1 von 4
“Durch die Einbindung von GPT‑Live‑1 in Yelp Host und Hatch konnten wir Sprecherwechsel und Genauigkeit gegenüber unserer bisherigen Spracharchitektur verbessern. Wenn Yelp Host mit GPT‑Live‑1 Anrufe zu Reservierungen oder Essensbestellungen entgegennimmt, verzeichnen wir deutlich höhere Erfolgsquoten bei der Anrufbearbeitung. Anrufende sprechen außerdem in vollständigeren, natürlicheren Sätzen. Das zeigt uns, dass das Erlebnis am anderen Ende der Leitung wirklich anders ist.”
– Alex Levy, Chief Technology Officer

Neue Sprachoptionen

Entwickelnde brauchen Stimmen, die zu ihrem Produkt passen und für die Menschen, die es nutzen, natürlich klingen. Mit GPT‑Live‑1 erweitern wir die bisher kleine Auswahl an Echtzeitstimmen um weitere Akzente, Dialekte und Sprachen. So können Entwickelnde besser bestimmen, wie ihre Assistenten klingen.

Hör dir die neuen Stimmen an

In den kommenden Monaten werden wir die Sprachoptionen und verfügbaren Sprachen weiter ausbauen.

Preise und Verfügbarkeit

GPT‑Live‑1 ist ab heute in der API⁠(wird in einem neuen Fenster geöffnet) verfügbar und kostet für die Sprachschicht im Frontend 0,05 USD pro Minute. Kombiniere es mit dem Backend-Modell und Agenten-Harness, die zu deinem Produkt passen. Entwickle dann ein Spracherlebnis, das mit den anstehenden Aufgaben skaliert.

GPT-Live-1 mit Codex verbinden

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

GPT-Live-1 mit Codex verbinden. Dieser Auszug zeigt, wie eine Anwendung Gesprächskontext an Codex übergibt und dessen Antwort an GPT-Live-1 zurückgibt. Der Verbindungsaufbau und die Verarbeitung der Delegierung sind nicht enthalten.

Wenn du eine eigene Stimme nutzen möchtest, kontaktiere unser Vertriebsteam. Dort erfährst du mehr über die Voraussetzungen und den Anfrageprozess.

Eine weitere Möglichkeit, auf Basis von GPT‑Live‑1 Sprach-Workflows zu entwickeln, ist OpenAI Presence, das das Modell für Sprachinteraktionen in Echtzeit nutzt. Presence hilft Unternehmen, vertrauenswürdige KI-Agenten bereitzustellen, die Fragen beantworten, Probleme lösen, Unternehmenssysteme nutzen, genehmigte Aktionen ausführen und bei Bedarf an Menschen übergeben können. Wende dich an deine:n OpenAI Account Director, um mehr zu erfahren.

Autor:in

OpenAI