Mod Pantas untuk Pelanggan API
Mod Pantas menawarkan prestasi yang boleh dipercayai dan berkelajuan tinggi dengan fleksibiliti untuk membayar mengikut penggunaan. Untuk model perbatasan terbaharu kami, gpt-5.6-sol, anda boleh mengakses kelajuan sehingga 2.5x lebih pantas dengan mod Pantas.
Dengan memilih mod Pantas, anda boleh membuka kunci:
- Kependaman rendah yang boleh dijangka: Mod Pantas menjana token dengan lebih cepat dan pada kelajuan yang lebih konsisten berbanding perkhidmatan pemprosesan Standard, walaupun semasa permintaan memuncak.
- Fleksibiliti yang mudah digunakan: Seperti pemprosesan standard, mod Pantas boleh diakses secara fleksibel, bayar-sambil-anda guna tanpa memerlukan peruntukan awal.
Nota: pemprosesan Keutamaan telah dinamakan semula kepada mod Pantas pada 30 Julai 2026. Anda boleh menggunakan sama ada `service_tier: priority` atau `service_tier: fast` dalam permintaan API.
| Harga bagi setiap 1J token input | Harga bagi setiap 1J token input (yang di-cache) | Harga setiap 1J token output | SLA Beroperasi3 | SLA Kependaman3 | |
|---|---|---|---|---|---|
GPT-5.6 Sol tidak termasuk konteks panjang1 | USD 10.00 | USD 1.00 | USD 60.00 | 99.9% | 99% > 80 token setiap saat2 |
GPT-5.6 Terra tidak termasuk konteks panjang1 | USD 4.00 | USD 0.40 | USD 24.00 | 99.9% | 99% > 70 token setiap saat2 |
GPT-5.6 Luna tidak termasuk konteks panjang1 | USD 0.40 | USD 0.04 | USD 2.40 | 99.9% | 99% > 100 token setiap saat2 |
GPT-5.5 tidak termasuk konteks panjang1 | USD 12.50 | USD 1.250 | USD 75.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-5.4 mini tidak termasuk konteks panjang1 | USD 1.50 | USD 0.150 | USD 9.00 | 99.9% | 99% > 100 token setiap saat2 |
GPT-5.4 tidak termasuk konteks panjang1 | USD 5.00 | USD 0.500 | USD 30.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-5.2 | USD 3.50 | USD 0.350 | USD 28.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-5.1 | USD 2.50 | USD 0.250 | USD 20.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-5 | USD 2.50 | USD 0.250 | USD 20.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-5 mini | USD 0.45 | USD 0.045 | USD 3.60 | 99.9% | 99% > 80 token setiap saat2 |
GPT-5.1 codex | USD 2.50 | USD 0.250 | USD 20.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-5 codex | USD 2.50 | USD 0.250 | USD 20.00 | 99.9% | 99% > 50 token setiap saat2 |
GPT-4.1 | USD 3.50 | USD 0.875 | USD 14.00 | 99.9% | 99% > 80 token setiap saat2 |
GPT-4.1 mini | USD 0.70 | USD 0.175 | USD 2.80 | 99.9% | 99% > 90 token setiap saat2 |
GPT-4.1 nano | USD 0.20 | USD 0.050 | USD 0.80 | 99.9% | 99% > 100 token setiap saat2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | USD 4.25 | USD 2.125 | USD 17.00 | 99.9% | 99% > 80 token setiap saat2 |
gpt-4o-2024-05-13 | USD 8.75 | — | USD 26.25 | 99.9% | 99% > 80 token setiap saat2 |
GPT-4o mini | USD 0.25 | USD 0.125 | USD 1.00 | 99.9% | 99% > 90 token setiap saat2 |
o3 | USD 3.50 | USD 0.875 | USD 14.00 | 99.9% | 99% > 80 token setiap saat2 |
o4-mini | USD 2.00 | USD 0.500 | USD 8.00 | 99.9% | 99% > 90 token setiap saat2 |
Bagaimana ia berfungsi
Pelanggan boleh mengarahkan trafik kepada mod Pantas berdasarkan setiap permintaan menggunakan parameter service_tier yang sedia ada, dengan pilihan service_tier = "fast".
Token yang diproses melalui Mod Pantas akan dicaj berdasarkan setiap token, dengan harga premium berbanding kadar pemprosesan Standard.
Selain dikonfigurasikan pada peringkat permintaan, projek juga boleh ditetapkan secara lalai kepada mod Pantas dalam Tetapan Projek > Peringkat Perkhidmatan Lalai: Pantas. Anda masih boleh mengatasi tetapan bagi setiap permintaan. Memilih Pantas dalam tetapan projek anda adalah bersamaan dengan memilih Keutamaan.
Had
- Had kadar mod Pantas dikongsi dengan tahap perkhidmatan lain.
- Dalam kes yang jarang berlaku, peningkatan ketara kepada token mod Pantas setiap Minit boleh menyebabkan had kadar kenaikan dicapai. Jika anda melebihi had kadar kenaikan, trafik tambahan mungkin akan dihantar kepada pemprosesan Standard.