Overslaan naar hoofdinhoud
OpenAI

Fast-modus voor API-klanten

De Fast-modus biedt betrouwbare, snelle prestaties en de flexibiliteit van betaling op basis van gebruik. Voor ons nieuwste grensverleggende model, gpt-5.6-sol, biedt de Fast-modus snelheden die tot 2,5 keer hoger liggen.

Met de Fast-modus profiteer je van:

  • Voorspelbaar lage latentie: de Fast-modus genereert tokens sneller en met een consistentere snelheid dan standaardverwerking, zelfs tijdens piekbelasting.
  • Gebruiksvriendelijke flexibiliteit: net als standaardverwerking is de Fast-modus flexibel beschikbaar met betaling op basis van gebruik, zonder dat capaciteit vooraf hoeft te worden gereserveerd.

Opmerking: Priority processing is op 30 juli 2026 hernoemd naar Fast-modus. Je kunt service_tier: priority of service_tier: fast gebruiken in je API-verzoeken.

Short contextLong contextBeschikbaarheid SLA3Latentie SLA3
Prijs per miljoen invoertokensPrijs per miljoen invoertokens (uit de cache)Prijs per miljoen uitvoertokensPrijs per miljoen invoertokensPrijs per miljoen invoertokens (uit de cache)Prijs per miljoen uitvoertokens
GPT-5.6 Sol
US$ 10,00US$ 1,00US$ 60,00US$ 20,00US$ 2,00US$ 90,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-5.6 Terra
US$ 4,00US$ 0,40US$ 24,00US$ 8,00US$ 0,80US$ 36,0099,9%In 99% van de gevallen meer dan 70 tokens per seconde2
GPT-5.6 Luna
US$ 0,40US$ 0,04US$ 2,40US$ 0,80US$ 0,08US$ 3,6099,9%In 99% van de gevallen meer dan 100 tokens per seconde2
GPT-5.5
sluit lange context uit1
US$ 12,50US$ 1,250US$ 75,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5.4 mini
sluit lange context uit1
US$ 1,50US$ 0,150US$ 9,0099,9%In 99% van de gevallen meer dan 100 tokens per seconde2
GPT-5.4
sluit lange context uit1
US$ 5,00US$ 0,500US$ 30,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5.2
US$ 3,50US$ 0,350US$ 28,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5.1
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5 mini
US$ 0,45US$ 0,045US$ 3,6099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-5.1 codex
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5 codex
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-4.1
US$ 3,50US$ 0,875US$ 14,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-4.1 mini
US$ 0,70US$ 0,175US$ 2,8099,9%In 99% van de gevallen meer dan 90 tokens per seconde2
GPT-4.1 nano
US$ 0,20US$ 0,050US$ 0,8099,9%In 99% van de gevallen meer dan 100 tokens per seconde2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
US$ 4,25US$ 2,125US$ 17,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
gpt-4o-2024-05-13
US$ 8,75US$ 26,2599,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-4o mini
US$ 0,25US$ 0,125US$ 1,0099,9%In 99% van de gevallen meer dan 90 tokens per seconde2
o3
US$ 3,50US$ 0,875US$ 14,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
o4-mini
US$ 2,00US$ 0,500US$ 8,0099,9%In 99% van de gevallen meer dan 90 tokens per seconde2
1Verzoeken geschat op >272K prompt-tokens
2Wordt berekend als p50-latentie (responstijd) in blokken van vijf minuten. Ben je al klant met een bestaand Enterprise-contract waarin de SLA voor de p50-latentie per minuut wordt berekend? Dan blijft die SLA ook gewoon gelden.
3Dit is alleen van toepassing op Enterprise-klanten

Hoe het werkt

Klanten kunnen per verzoek verkeer naar Fast-modus leiden met behulp van de bestaande parameter service_tier, met de optie service_tier = "fast".

Tokens die door de Fast-modus worden afgehandeld, worden per token gefactureerd en zijn hoger geprijsd dan de standaardverwerkingstarieven.

Naast configuratie op verzoekniveau kun je de Fast-modus ook als standaard voor een project instellen via Projectinstellingen > Standaardserviceniveau: Fast. Je kunt nog steeds per verzoek overschrijven. Fast selecteren in je projectinstellingen staat gelijk aan Prioriteit selecteren.

Beperkingen

  • De volumelimieten voor de Fast-modus worden gedeeld met andere serviceniveaus.
  • In zeldzame gevallen kan een snelle stijging van het aantal tokens per minuut voor de Fast-modus ertoe leiden dat je de limieten voor de opbouwsnelheid bereikt. Als je de limiet voor de opbouwsnelheid overschrijdt, kan extra verkeer in plaats daarvan naar standaardverwerking worden gestuurd.

Veelgestelde vragen

Prijzen

Modellen

Volumelimieten

Betrouwbaarheid

Beleidsregels