Modalità rapida per i clienti API
La modalità rapida offre prestazioni affidabili e ad alta velocità, con la flessibilità del pagamento a consumo. Per il nostro modello avanzato più recente, gpt-5.6-sol, con la modalità rapida puoi ottenere una velocità fino a 2,5 volte superiore.
Scegliendo la modalità rapida, ottieni:
- Latenza bassa e prevedibile: la modalità rapida genera token più velocemente e a un ritmo più costante rispetto al servizio di elaborazione standard, anche durante i picchi di domanda.
- Flessibilità e semplicità: come l’elaborazione standard, la modalità rapida è disponibile con pagamento flessibile a consumo e non richiede il provisioning anticipato.
Nota: il 30/07/2026 l’elaborazione prioritaria è stata rinominata modalità rapida. Nelle richieste API puoi usare service_tier: priority o service_tier: fast.
| Short context | Long context | SLA di uptime3 | SLA di latenza3 | |||||
|---|---|---|---|---|---|---|---|---|
| Prezzo per 1M token di input | Prezzo per 1M token di input (memorizzati nella cache) | Prezzo per 1M token di output | Prezzo per 1M token di input | Prezzo per 1M token di input (memorizzati nella cache) | Prezzo per 1M token di output | |||
GPT-5.6 Sol | 10,00 USD | 1,00 USD | 60,00 USD | 20,00 USD | 2,00 USD | 90,00 USD | 99,9% | 99% > 80 token al secondo2 |
GPT-5.6 Terra | 4,00 USD | 0,40 USD | 24,00 USD | 8,00 USD | 0,80 USD | 36,00 USD | 99,9% | 99% > 70 token al secondo2 |
GPT-5.6 Luna | 0,40 USD | 0,04 USD | 2,40 USD | 0,80 USD | 0,08 USD | 3,60 USD | 99,9% | 99% > 100 token al secondo2 |
GPT-5.5 esclude il contesto lungo1 | 12,50 USD | 1,250 USD | 75,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-5.4 mini esclude il contesto lungo1 | 1,50 USD | 0,150 USD | 9,00 USD | — | — | — | 99,9% | 99% > 100 token al secondo2 |
GPT-5.4 esclude il contesto lungo1 | 5,00 USD | 0,500 USD | 30,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-5.2 | 3,50 USD | 0,350 USD | 28,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-5.1 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-5 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-5 mini | 0,45 USD | 0,045 USD | 3,60 USD | — | — | — | 99,9% | 99% > 80 token al secondo2 |
GPT-5.1 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-5 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 token al secondo2 |
GPT-4.1 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9% | 99% > 80 token al secondo2 |
GPT-4.1 mini | 0,70 USD | 0,175 USD | 2,80 USD | — | — | — | 99,9% | 99% > 90 token al secondo2 |
GPT-4.1 nano | 0,20 USD | 0,050 USD | 0,80 USD | — | — | — | 99,9% | 99% > 100 token al secondo2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 USD | 2,125 USD | 17,00 USD | — | — | — | 99,9% | 99% > 80 token al secondo2 |
gpt-4o-2024-05-13 | 8,75 USD | — | 26,25 USD | — | — | — | 99,9% | 99% > 80 token al secondo2 |
GPT-4o mini | 0,25 USD | 0,125 USD | 1,00 USD | — | — | — | 99,9% | 99% > 90 token al secondo2 |
o3 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9% | 99% > 80 token al secondo2 |
o4-mini | 2,00 USD | 0,500 USD | 8,00 USD | — | — | — | 99,9% | 99% > 90 token al secondo2 |
Come funziona
I clienti possono indirizzare ogni richiesta alla modalità rapida usando il parametro service_tier esistente e impostando l’opzione service_tier = "fast".
I token elaborati in modalità rapida vengono fatturati singolarmente, a una tariffa superiore rispetto a quella dell’elaborazione standard.
Oltre che a livello di singola richiesta, puoi impostare la modalità rapida come opzione predefinita per un progetto in Impostazioni progetto > Livello di servizio predefinito: Modalità rapida. Puoi comunque modificare l’impostazione per le singole richieste. Selezionare Modalità rapida nelle impostazioni del progetto equivale a selezionare Priorità.
Limiti
- I limiti di richieste della modalità rapida sono condivisi con gli altri livelli di servizio.
- In rari casi, un rapido aumento dei token al minuto in modalità rapida può comportare il raggiungimento dei limiti alla crescita del traffico. Se superi questo limite, il traffico aggiuntivo potrebbe essere indirizzato all’elaborazione standard.