Vai al contenuto principale
OpenAI

Modalità rapida per i clienti API

La modalità rapida offre prestazioni affidabili e ad alta velocità, con la flessibilità del pagamento a consumo. Per il nostro modello avanzato più recente, gpt-5.6-sol, con la modalità rapida puoi ottenere una velocità fino a 2,5 volte superiore.

Scegliendo la modalità rapida, ottieni:

  • Latenza bassa e prevedibile: la modalità rapida genera token più velocemente e a un ritmo più costante rispetto al servizio di elaborazione standard, anche durante i picchi di domanda.
  • Flessibilità e semplicità: come l’elaborazione standard, la modalità rapida è disponibile con pagamento flessibile a consumo e non richiede il provisioning anticipato.

Nota: il 30/07/2026 l’elaborazione prioritaria è stata rinominata modalità rapida. Nelle richieste API puoi usare service_tier: priority o service_tier: fast.

Short contextLong contextSLA di uptime3SLA di latenza3
Prezzo per 1M token di inputPrezzo per 1M token di input (memorizzati nella cache)Prezzo per 1M token di outputPrezzo per 1M token di inputPrezzo per 1M token di input (memorizzati nella cache)Prezzo per 1M token di output
GPT-5.6 Sol
10,00 USD1,00 USD60,00 USD20,00 USD2,00 USD90,00 USD99,9%99% > 80 token al secondo2
GPT-5.6 Terra
4,00 USD0,40 USD24,00 USD8,00 USD0,80 USD36,00 USD99,9%99% > 70 token al secondo2
GPT-5.6 Luna
0,40 USD0,04 USD2,40 USD0,80 USD0,08 USD3,60 USD99,9%99% > 100 token al secondo2
GPT-5.5
esclude il contesto lungo1
12,50 USD1,250 USD75,00 USD99,9%99% > 50 token al secondo2
GPT-5.4 mini
esclude il contesto lungo1
1,50 USD0,150 USD9,00 USD99,9%99% > 100 token al secondo2
GPT-5.4
esclude il contesto lungo1
5,00 USD0,500 USD30,00 USD99,9%99% > 50 token al secondo2
GPT-5.2
3,50 USD0,350 USD28,00 USD99,9%99% > 50 token al secondo2
GPT-5.1
2,50 USD0,250 USD20,00 USD99,9%99% > 50 token al secondo2
GPT-5
2,50 USD0,250 USD20,00 USD99,9%99% > 50 token al secondo2
GPT-5 mini
0,45 USD0,045 USD3,60 USD99,9%99% > 80 token al secondo2
GPT-5.1 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 token al secondo2
GPT-5 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 token al secondo2
GPT-4.1
3,50 USD0,875 USD14,00 USD99,9%99% > 80 token al secondo2
GPT-4.1 mini
0,70 USD0,175 USD2,80 USD99,9%99% > 90 token al secondo2
GPT-4.1 nano
0,20 USD0,050 USD0,80 USD99,9%99% > 100 token al secondo2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 USD2,125 USD17,00 USD99,9%99% > 80 token al secondo2
gpt-4o-2024-05-13
8,75 USD26,25 USD99,9%99% > 80 token al secondo2
GPT-4o mini
0,25 USD0,125 USD1,00 USD99,9%99% > 90 token al secondo2
o3
3,50 USD0,875 USD14,00 USD99,9%99% > 80 token al secondo2
o4-mini
2,00 USD0,500 USD8,00 USD99,9%99% > 90 token al secondo2
1Richieste stimate a >272.000 token di prompt
2Calcolata come latenza della richiesta p50 su base 5 minuti. Per i clienti con contratti aziendali che prevedono SLA di latenza calcolati come latenza della richiesta p50 su base al minuto, anche gli SLA precedenti sono ancora applicabili.
3Questa opzione è disponibile solo per i clienti Enterprise

Come funziona

I clienti possono indirizzare ogni richiesta alla modalità rapida usando il parametro service_tier esistente e impostando l’opzione service_tier = "fast".

I token elaborati in modalità rapida vengono fatturati singolarmente, a una tariffa superiore rispetto a quella dell’elaborazione standard.

Oltre che a livello di singola richiesta, puoi impostare la modalità rapida come opzione predefinita per un progetto in Impostazioni progetto > Livello di servizio predefinito: Modalità rapida. Puoi comunque modificare l’impostazione per le singole richieste. Selezionare Modalità rapida nelle impostazioni del progetto equivale a selezionare Priorità.

Limiti

  • I limiti di richieste della modalità rapida sono condivisi con gli altri livelli di servizio.
  • In rari casi, un rapido aumento dei token al minuto in modalità rapida può comportare il raggiungimento dei limiti alla crescita del traffico. Se superi questo limite, il traffico aggiuntivo potrebbe essere indirizzato all’elaborazione standard.

Domande frequenti

Tariffe

Modelli

Limiti di utilizzo

Affidabilità

Politiche