Fast-modus voor API-klanten
De Fast-modus biedt betrouwbare, snelle prestaties en de flexibiliteit van betaling op basis van gebruik. Voor ons nieuwste grensverleggende model, gpt-5.6-sol, biedt de Fast-modus snelheden die tot 2,5 keer hoger liggen.
Met de Fast-modus profiteer je van:
- Voorspelbaar lage latentie: de Fast-modus genereert tokens sneller en met een consistentere snelheid dan standaardverwerking, zelfs tijdens piekbelasting.
- Gebruiksvriendelijke flexibiliteit: net als standaardverwerking is de Fast-modus flexibel beschikbaar met betaling op basis van gebruik, zonder dat capaciteit vooraf hoeft te worden gereserveerd.
Opmerking: Priority processing is op 30 juli 2026 hernoemd naar Fast-modus. Je kunt service_tier: priority of service_tier: fast gebruiken in je API-verzoeken.
| Short context | Long context | Beschikbaarheid SLA3 | Latentie SLA3 | |||||
|---|---|---|---|---|---|---|---|---|
| Prijs per miljoen invoertokens | Prijs per miljoen invoertokens (uit de cache) | Prijs per miljoen uitvoertokens | Prijs per miljoen invoertokens | Prijs per miljoen invoertokens (uit de cache) | Prijs per miljoen uitvoertokens | |||
GPT-5.6 Sol | US$ 10,00 | US$ 1,00 | US$ 60,00 | US$ 20,00 | US$ 2,00 | US$ 90,00 | 99,9% | In 99% van de gevallen meer dan 80 tokens per seconde2 |
GPT-5.6 Terra | US$ 4,00 | US$ 0,40 | US$ 24,00 | US$ 8,00 | US$ 0,80 | US$ 36,00 | 99,9% | In 99% van de gevallen meer dan 70 tokens per seconde2 |
GPT-5.6 Luna | US$ 0,40 | US$ 0,04 | US$ 2,40 | US$ 0,80 | US$ 0,08 | US$ 3,60 | 99,9% | In 99% van de gevallen meer dan 100 tokens per seconde2 |
GPT-5.5 sluit lange context uit1 | US$ 12,50 | US$ 1,250 | US$ 75,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-5.4 mini sluit lange context uit1 | US$ 1,50 | US$ 0,150 | US$ 9,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 100 tokens per seconde2 |
GPT-5.4 sluit lange context uit1 | US$ 5,00 | US$ 0,500 | US$ 30,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-5.2 | US$ 3,50 | US$ 0,350 | US$ 28,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-5.1 | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-5 | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-5 mini | US$ 0,45 | US$ 0,045 | US$ 3,60 | — | — | — | 99,9% | In 99% van de gevallen meer dan 80 tokens per seconde2 |
GPT-5.1 codex | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-5 codex | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 50 tokens per seconde2 |
GPT-4.1 | US$ 3,50 | US$ 0,875 | US$ 14,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 80 tokens per seconde2 |
GPT-4.1 mini | US$ 0,70 | US$ 0,175 | US$ 2,80 | — | — | — | 99,9% | In 99% van de gevallen meer dan 90 tokens per seconde2 |
GPT-4.1 nano | US$ 0,20 | US$ 0,050 | US$ 0,80 | — | — | — | 99,9% | In 99% van de gevallen meer dan 100 tokens per seconde2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$ 4,25 | US$ 2,125 | US$ 17,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 80 tokens per seconde2 |
gpt-4o-2024-05-13 | US$ 8,75 | — | US$ 26,25 | — | — | — | 99,9% | In 99% van de gevallen meer dan 80 tokens per seconde2 |
GPT-4o mini | US$ 0,25 | US$ 0,125 | US$ 1,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 90 tokens per seconde2 |
o3 | US$ 3,50 | US$ 0,875 | US$ 14,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 80 tokens per seconde2 |
o4-mini | US$ 2,00 | US$ 0,500 | US$ 8,00 | — | — | — | 99,9% | In 99% van de gevallen meer dan 90 tokens per seconde2 |
Hoe het werkt
Klanten kunnen per verzoek verkeer naar Fast-modus leiden met behulp van de bestaande parameter service_tier, met de optie service_tier = "fast".
Tokens die door de Fast-modus worden afgehandeld, worden per token gefactureerd en zijn hoger geprijsd dan de standaardverwerkingstarieven.
Naast configuratie op verzoekniveau kun je de Fast-modus ook als standaard voor een project instellen via Projectinstellingen > Standaardserviceniveau: Fast. Je kunt nog steeds per verzoek overschrijven. Fast selecteren in je projectinstellingen staat gelijk aan Prioriteit selecteren.
Beperkingen
- De volumelimieten voor de Fast-modus worden gedeeld met andere serviceniveaus.
- In zeldzame gevallen kan een snelle stijging van het aantal tokens per minuut voor de Fast-modus ertoe leiden dat je de limieten voor de opbouwsnelheid bereikt. Als je de limiet voor de opbouwsnelheid overschrijdt, kan extra verkeer in plaats daarvan naar standaardverwerking worden gestuurd.