Livell ta’ Eskalaġġ għall-klijenti tal-API
Scale Tier is available on models released before GPT‑5.6. For GPT‑5.6 and future model releases, see Reserved Tier
This offering is available to Enterprise customers. Please contact our sales team to learn more. To access the same premium latency and reliability benefits on a flexible, pay-as-you-go basis, see Fast mode.
Scale Tier lets you purchase a set number of API input and output tokens per minute (known as “token units”) upfront for access to one specific model snapshot. Each token unit is purchased for a minimum of 30 days. Additional models may be added based on customer interest.
By choosing Scale Tier, you can unlock:
- Predictable latency: Scale Tier is designed to generate tokens faster and at a more consistent speed than the pay-as-you-go (PAYG) service, even during peak demand.
- Uncapped scale: Any quota purchases with Scale Tier is automatically added to your rate limits, so you can confidently scale further.
- Higher reliability: Scale Tier traffic offers a 99.9% uptime SLA and prioritized compute.
| Bundle tal-input | Pakkett tal-output | SLA tal-ħin ta' tħaddim | SLA tal-latenza | |
|---|---|---|---|---|
| GPT-5.5 | 50,000 TPM US$750.00 għal kull unità/jum | N/A3 | 99.9% | 99% > 100 tokens kull sekonda2 |
| GPT-5.4 mini | 50,000 TPM US$100.00 għal kull unità/jum | N/A3 | 99.9% | 99% > 100 tokens kull sekonda2 |
GPT-5.4 jeskludi l-kuntest twil4 | 50,000 TPM US$300.00 għal kull unità/jum | N/A3 | 99.9% | 99% > 50 tokens kull sekonda2 |
| GPT-5.2 | 25,000 TPM US$105.00 għal kull unità/jum | 2,500 TPM US$84.00 għal kull unità/jum | 99.9% | 99% > 50 tokens kull sekonda2 |
| GPT-5.1 | 25,000 TPM US$75.00 għal kull unità/jum | 2,500 TPM US$60.00 għal kull unità/jum | 99.9% | 99% > 50 tokens kull sekonda2 |
| GPT-5 | 25,000 TPM US$75.00 għal kull unità/jum | 2,500 TPM US$60.00 għal kull unità/jum | 99.9% | 99% > 50 tokens kull sekonda2 |
| GPT-5 mini | 500,000 TPM US$275.00 għal kull unità/jum | 50,000 TPM US$220.00 għal kull unità/jum | 99.9% | 99% > 80 tokens kull sekonda2 |
GPT-4.1 jeskludi long-context1 | 30,000 TPM US$110.00 għal kull unità/kuljum | 2,500 TPM US$36.00 għal kull unità/jum | 99.9% | 99% > 80 tokens kull sekonda2 |
GPT-4.1 mini jeskludi long-context1 | 500,000 TPM US$450.00 għal kull unità/jum | 50,000 TPM US$175.00 għal kull unità/jum | 99.9% | 99% > 90 tokens kull sekonda2 |
GPT-4.1 nano jeskludi long-context1 | 500,000 TPM US$110.00 għal kull unità/jum | 50,000 TPM US$40.00 għal kull unità/jum | 99.9% | 99% > 100 tokens kull sekonda2 |
| GPT-4.1 fine tuning | 30,000 TPM US$165.00 għal kull unità/kuljum | 2,500 TPM US$36.00 għal kull unità/jum | 99.9% | 99% > 80 tokens kull sekonda2 |
| GPT-4.1 mini fine tuning | 500,000 TPM US$900.00 għal kull unità/jum | 50,000 TPM US$175.00 għal kull unità/jum | 99.9% | 99% > 90 tokens kull sekonda2 |
| o3 | 25,000 TPM US$75.00 għal kull unità/jum | 5,000 TPM US$60.00 għal kull unità/jum | 99.9% | 99% > 80 tokens kull sekonda2 |
| o4-mini | 30,000 TPM US$50.00 għal kull unità/jum | 5,000 TPM US$32.50 għal kull unità/jum | 99.9% | 99% > 90 tokens kull sekonda2 |
| GPT-4o | 30,000 TPM US$124.59 għal kull unità/kuljum | 2,500 TPM US$39.34 għal kull unità/jum | 99.9% | 99% > 80 tokens kull sekonda2 |
| GPT-4o mini | 500,000 TPM US$114.75 għal kull unità/jum | 50,000 TPM US$49.18 għal kull unità/jum | 99.9% | 99% > 90 tokens kull sekonda2 |
| GPT-4o mini fine tuning | 500,000 TPM US$229.50 għal kull unità/jum | 50,000 TPM US$98.36 għal kull unità/jum | 99.9% | 99% > 90 tokens kull sekonda2 |
| o1 | 5,000 TPM US$163.93 għal kull unità/jum | 1,000 TPM US$131.15 għal kull unità/jum | 99.9% | 99% > 80 tokens kull sekonda2 |
| o3-mini | 30,000 TPM US$78.69 għal kull unità/jum | 5,000 TPM US$52.46 għal kull unità/jum | 99.9% | 99% > 90 tokens kull sekonda2 |
Kif jaħdem
Bil-Livell ta’ Eskalaġġ, tista’ tixtri unitajiet ta’ tokens għall-input u l-output. Pereżempju, b’GPT‑4.1 kull unità tal-input tiswa $110/jum u tagħtik id-dritt għal 30k token tal-input/min. Kull unità tal-output tiswa $36/jum u tagħtik id-dritt għal 2.5k tokens tal-output/min. Kull unità ta’ token tinxtara għal perjodu minimu ta’ 30 ġurnata.
Aktar informazzjoni dwar kif il-Livell ta’ Eskalaġġ jinteraġixxi mal-Kaching tal-Prompt tista’ tinstab fit-taqsima tal-FAQ (Mistoqsijiet Frekwenti) hawn taħt.
B’GPT‑5.4 u GPT‑5.5, tixtri tokeni tal-input u tal-output ikkombinati kull minuta Dan jagħtik aktar flessibbiltà u jneħħi l-ħtieġa li tbassar il-proporzjon tat-token tal-input u tal-output tiegħek. Hekk kif tuża l-livell ta’ eskalaġġ, aħna ngħoddu t-tokeni kontra t-tokeni ikkombinati tiegħek kif ġej:
- Token tal-input jikkontaw bħala 1
- It-token tal-input moħżin jissegwixxu l-metodu ta’ caching għal kull mudell kif spjegat hawn taħt fit-taqsima tal-FAQ
- Għadd ta’ tokens tal-output ibbażat fuq il-proporzjon tal-prezz PayG bejn tokens tal-output u tal-input għall-mudell Pereżempju, b'GPT‑5.4 token wieħed tal-output jgħodd bħala 6.
