Hopp til hovedinnhold
OpenAI

Hurtigmodus for API-kunder

Hurtigmodus gir pålitelig ytelse med høy hastighet og fleksibilitet til å betale etter Go. For vår nyeste banebrytende modell, gpt-5.6-sol, du kan få opptil 2,5 ganger høyere hastighet med hurtigmodus.

Ved å velge Hurtigmodus kan du låse opp:

  • Forutsigbart lav forsinkelse: Hurtigmodus genererer tokens raskere og med en mer konsekvent hastighet enn standardbehandlingstjenesten, selv under høy etterspørsel.
  • Brukervennlig fleksibilitet: I likhet med standardbehandling kan hurtigmodus benyttes på en fleksibel, betal-etter-hvert-basis i stedet for å kreve forhåndsklargjøring.

Merk: Prioritetsbehandling ble omdøpt til Hurtigmodus 30. juli 2026. Du kan bruke enten service_tier: priority eller service_tier: fast i API-forespørslene dine.

Pris per 1 mill. inndatatokenerPris per 1 mill. inndatatokener (bufret)Pris per 1 mill. utdatatokenerTjenesteavtale – oppetid3Tjenesteavtale – forsinkelse3
GPT-5.6 Sol
uten long-context1
10,00 USD1,00 USD60,00 USD99,9 %99 % > 80 tokener per sekund2
GPT-5.6 Terra
uten long-context1
4,00 USD0,40 USD24,00 USD99,9 %99 % > 70 tokener per sekund2
GPT-5.6 Luna
uten long-context1
0,40 USD0,04 USD2,40 USD99,9 %99 % > 100 tokener per sekund2
GPT-5.5
uten long-context1
12,50 USD1,250 USD75,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-5.4 mini
uten long-context1
1,50 USD0,150 USD9,00 USD99,9 %99 % > 100 tokener per sekund2
GPT-5.4
uten long-context1
5,00 USD0,500 USD30,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-5.2
3,50 USD0,350 USD28,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-5.1
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-5
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-5 mini
0,45 USD0,045 USD3,60 USD99,9 %99 % > 80 tokener per sekund2
GPT-5.1 codex
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-5 codex
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokener per sekund2
GPT-4.1
3,50 USD0,875 USD14,00 USD99,9 %99 % > 80 tokener per sekund2
GPT-4.1 mini
0,70 USD0,175 USD2,80 USD99,9 %99 % > 90 tokener per sekund2
GPT-4.1 nano
0,20 USD0,050 USD0,80 USD99,9 %99 % > 100 tokener per sekund2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 USD2,125 USD17,00 USD99,9 %99 % > 80 tokener per sekund2
gpt-4o-2024-05-13
8,75 USD26,25 USD99,9 %99 % > 80 tokener per sekund2
GPT-4o mini
0,25 USD0,125 USD1,00 USD99,9 %99 % > 90 tokener per sekund2
o3
3,50 USD0,875 USD14,00 USD99,9 %99 % > 80 tokener per sekund2
o4-mini
2,00 USD0,500 USD8,00 USD99,9 %99 % > 90 tokener per sekund2
1Forespørsler med et estimert prompt-omfang på over 272 000 tokens.
2Beregnet som p50-meldingsforsinkelse på en per 5 minutter-basis. For kunder med eksisterende bedriftsavtaler som har tjenesteavtaler om forsinkelse beregnet som p50-meldingsforsinkelse på en per minutt-basis, gjelder også de tidligere tjenesteavtalene.
3Dette gjelder kun Enterprise-kunder

Slik fungerer det

Kunder kan dirigere trafikk til hurtigmodus på forespørsel ved å bruke den eksisterende parameteren service_tier, med alternativet service_tier = "fast".

Token som behandles med hurtigmodus, faktureres per token til en pris som er høyere enn standard behandlingssatser.

I tillegg til å bli konfigurert på forespørselsnivå, kan du også angi hurtigmodus som standard for et prosjekt i prosjektinnstillinger > standard tjenestenivå: hurtig. Du kan fortsatt overstyre per forespørsel. Å velge rask i prosjektinnstillingene tilsvarer å velge prioritet.

Begrensninger

  • Bruksgrensene for hurtigmodus deles med andre tjenestenivåer.
  • I sjeldne tilfeller kan raske økninger i antall tokens per minutt for hurtigmodus føre til at økningsbruksgrenser nås. Hvis du overskrider ramp rate-grensen, kan ekstra trafikk bli sendt til standardbehandling i stedet.

Vanlige spørsmål

Priser

Modeller

Hastighetsgrenser

Pålitelighet

Retningslinjer