Langsung ke konten utama
OpenAI

Mode Cepat untuk Pelanggan API

Mode Cepat menawarkan kinerja yang andal dan berkecepatan tinggi dengan fleksibilitas bayar sesuai pemakaian. Untuk model terdepan terbaru kami, gpt-5.6-sol, Anda dapat mengakses kecepatan hingga 2,5x lebih cepat dengan Mode Cepat.

Dengan memilih Mode Cepat, Anda dapat mendapatkan:

  • Latensi rendah yang dapat diprediksi: Mode Cepat menghasilkan token lebih cepat dan dengan kecepatan yang lebih konsisten dibandingkan dengan layanan Pemrosesan Standar, bahkan selama permintaan puncak.
  • Fleksibilitas yang mudah digunakan: Seperti Pemrosesan Standar, Mode Cepat dapat diakses secara fleksibel dengan model bayar sesuai penggunaan, tanpa memerlukan penyediaan sebelumnya.

Catatan: Pemrosesan Prioritas diubah namanya menjadi Mode Cepat pada 30 Juli 2026. Anda dapat menggunakan service_tier: priority atau service_tier: fast dalam permintaan API Anda.

Short contextLong contextSLA Waktu aktif3SLA Latensi3
Harga per 1JT token masukanHarga per 1JT token masukan (dengan cache)Harga per 1JT token keluaranHarga per 1JT token masukanHarga per 1JT token masukan (dengan cache)Harga per 1JT token keluaran
GPT-5.6 Sol
US$10,00US$1,00US$60,00US$20,00US$2,00US$90,0099,9%99% > 80 token per detik2
GPT-5.6 Terra
US$4,00US$0,40US$24,00US$8,00US$0,80US$36,0099,9%99% > 70 token per detik2
GPT-5.6 Luna
US$0,40US$0,04US$2,40US$0,80US$0,08US$3,6099,9%99% > 100 token per detik2
GPT-5.5
mengecualikan konteks panjang1
US$12,50US$1,250US$75,0099,9%99% > 50 token per detik2
GPT-5.4 mini
mengecualikan konteks panjang1
US$1,50US$0,150US$9,0099,9%99% > 100 token per detik2
GPT-5.4
mengecualikan konteks panjang1
US$5,00US$0,500US$30,0099,9%99% > 50 token per detik2
GPT-5.2
US$3,50US$0,350US$28,0099,9%99% > 50 token per detik2
GPT-5.1
US$2,50US$0,250US$20,0099,9%99% > 50 token per detik2
GPT-5
US$2,50US$0,250US$20,0099,9%99% > 50 token per detik2
GPT-5 mini
US$0,45US$0,045US$3,6099,9%99% > 80 token per detik2
GPT-5.1 codex
US$2,50US$0,250US$20,0099,9%99% > 50 token per detik2
GPT-5 codex
US$2,50US$0,250US$20,0099,9%99% > 50 token per detik2
GPT-4.1
US$3,50US$0,875US$14,0099,9%99% > 80 token per detik2
GPT-4.1 mini
US$0,70US$0,175US$2,8099,9%99% > 90 token per detik2
GPT-4.1 nano
US$0,20US$0,050US$0,8099,9%99% > 100 token per detik2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
US$4,25US$2,125US$17,0099,9%99% > 80 token per detik2
gpt-4o-2024-05-13
US$8,75US$26,2599,9%99% > 80 token per detik2
GPT-4o mini
US$0,25US$0,125US$1,0099,9%99% > 90 token per detik2
o3
US$3,50US$0,875US$14,0099,9%99% > 80 token per detik2
o4-mini
US$2,00US$0,500US$8,0099,9%99% > 90 token per detik2
1Permintaan diestimasikan pada token prompt >272K
2Dihitung sebagai latensi permintaan p50 per 5 menit. Untuk pelanggan dengan perjanjian enterprise yang ada, dengan SLA latensi yang dihitung sebagai latensi permintaan p50 per menit, SLA sebelumnya juga masih berlaku.
3Ini hanya berlaku bagi pelanggan Enterprise

Cara kerjanya

Pelanggan dapat mengarahkan trafik ke Mode Cepat berdasarkan setiap permintaan menggunakan parameter service_tier yang sudah ada, dengan opsi service_tier = "fast".

Token yang dilayani oleh Mode Cepat akan dikenakan biaya per token, dengan harga premium dibandingkan tarif Pemrosesan Standar.

Selain dikonfigurasi pada tingkat permintaan, Anda juga dapat mengatur proyek ke Mode Cepat secara default di Pengaturan proyek > Tingkat Layanan Default: Cepat. Anda masih dapat menimpa (override) per permintaan. Memilih Cepat di pengaturan proyek Anda setara dengan memilih Prioritas.

Keterbatasan

  • Batas laju Mode Cepat dibagikan dengan tingkat layanan lainnya.
  • Dalam kasus yang jarang terjadi, peningkatan cepat pada Token per Menit Mode Cepat Anda dapat menyebabkan tercapainya batas laju kenaikan. Jika Anda melebihi batas laju kenaikan, maka trafik tambahan mungkin akan dialihkan ke Pemrosesan Standar.

Pertanyaan umum

Harga

Model

Batas laju

Keandalan

Kebijakan