Schnellmodus für API-Kund:innen
Der Schnellmodus bietet zuverlässige Hochgeschwindigkeitsleistung mit der Flexibilität von „Pay as you go“. Für unser neuestes Frontier-Modell, gpt-5.6-sol, kannst du mit dem Schnellmodus bis zu 2,5-mal höhere Geschwindigkeiten erzielen.
Durch Auswahl des Schnellmodus erhältst du Zugriff auf Folgendes:
- Vorhersehbar niedrige Latenz: Der Schnellmodus generiert Tokens schneller und mit konstanterer Geschwindigkeit als der Standardverarbeitungsdienst, selbst bei hoher Nachfrage.
- Benutzerfreundliche Flexibilität: Wie bei der Standardverarbeitung kannst du auch im Schnellmodus flexibel und nutzungsabhängig bezahlen, ohne dass eine Bereitstellung im Voraus erforderlich ist.
Hinweis: „Vorrangige Verarbeitung“ wurde am 30. Juli 2026 in „Schnellmodus“ umbenannt. Du kannst in deinen API-Anfragen entweder service_tier: priority oder service_tier: fast verwenden.
| Short context | Long context | Uptime SLA3 | Latenz-SLA (Service Level Agreement)3 | |||||
|---|---|---|---|---|---|---|---|---|
| Preis pro 1 Million Eingabe-Tokens | Preis pro 1 Million Eingabe-Tokens (zwischengespeichert) | Preis pro 1 Million Output-Tokens | Preis pro 1 Million Eingabe-Tokens | Preis pro 1 Million Eingabe-Tokens (zwischengespeichert) | Preis pro 1 Million Output-Tokens | |||
GPT-5.6 Sol | 10,00 $ | 1,00 $ | 60,00 $ | 20,00 $ | 2,00 $ | 90,00 $ | 99,9 % | 99 % > 80 Tokens pro Sekunde2 |
GPT-5.6 Terra | 4,00 $ | 0,40 $ | 24,00 $ | 8,00 $ | 0,80 $ | 36,00 $ | 99,9 % | 99 % > 70 Tokens pro Sekunde2 |
GPT-5.6 Luna | 0,40 $ | 0,04 $ | 2,40 $ | 0,80 $ | 0,08 $ | 3,60 $ | 99,9 % | 99 % > 100 Tokens pro Sekunde2 |
GPT-5.5 schließt Langzeit-Kontext aus1 | 12,50 $ | 1,250 $ | 75,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-5.4 mini schließt Langzeit-Kontext aus1 | 1,50 $ | 0,150 $ | 9,00 $ | — | — | — | 99,9 % | 99 % > 100 Tokens pro Sekunde2 |
GPT-5.4 schließt Langzeit-Kontext aus1 | 5,00 $ | 0,500 $ | 30,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-5.2 | 3,50 $ | 0,350 $ | 28,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-5.1 | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-5 | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-5 mini | 0,45 $ | 0,045 $ | 3,60 $ | — | — | — | 99,9 % | 99 % > 80 Tokens pro Sekunde2 |
GPT-5.1 codex | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-5 codex | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 Tokens pro Sekunde2 |
GPT-4.1 | 3,50 $ | 0,875 $ | 14,00 $ | — | — | — | 99,9 % | 99 % > 80 Tokens pro Sekunde2 |
GPT-4.1 mini | 0,70 $ | 0,175 $ | 2,80 $ | — | — | — | 99,9 % | 99 % > 90 Tokens pro Sekunde2 |
GPT-4.1 nano | 0,20 $ | 0,050 $ | 0,80 $ | — | — | — | 99,9 % | 99 % > 100 Tokens pro Sekunde2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 $ | 2,125 $ | 17,00 $ | — | — | — | 99,9 % | 99 % > 80 Tokens pro Sekunde2 |
gpt-4o-2024-05-13 | 8,75 $ | — | 26,25 $ | — | — | — | 99,9 % | 99 % > 80 Tokens pro Sekunde2 |
GPT-4o mini | 0,25 $ | 0,125 $ | 1,00 $ | — | — | — | 99,9 % | 99 % > 90 Tokens pro Sekunde2 |
o3 | 3,50 $ | 0,875 $ | 14,00 $ | — | — | — | 99,9 % | 99 % > 80 Tokens pro Sekunde2 |
o4-mini | 2,00 $ | 0,500 $ | 8,00 $ | — | — | — | 99,9 % | 99 % > 90 Tokens pro Sekunde2 |
Funktionsweise
Kund:innen können den Traffic auf Anfragebasis mithilfe des bestehenden service_tier-Parameters mit der Option service_tier = "fast" an den Schnellmodus weiterleiten.
Tokens, die vom Schnellmodus bereitgestellt werden, werden pro Token abgerechnet und kosten im Vergleich zu den Standardverarbeitungsgebühren einen Aufpreis.
Zusätzlich zur Konfiguration auf Anfrageebene kannst du für ein Projekt auch in den Projekteinstellungen → Standard-Servicestufe: Schnell als Standard festlegen. Du kannst weiterhin die Einstellung pro Anfrage überschreiben. Die Auswahl von „Schnell“ in den Projekteinstellungen entspricht der Auswahl von „Vorrangig“.
Einschränkungen
- Die Ratenlimits für den Schnellmodus werden mit anderen Servicestufen geteilt.
- In seltenen Fällen kann eine schnelle Erhöhung deiner Schnellmodus-Tokens pro Minute dazu führen, dass du die Ramp-Ratenlimits erreichst. Wenn du das Ramp-Ratenlimit überschreitest, kann zusätzlicher Traffic stattdessen an die Standardverarbeitung gesendet werden.