Langsung ke konten utama
OpenAI

22 September 2026

Produk

Penyimpanan prompt yang lebih baik untuk GPT‑6

Tingkat hit cache lebih tinggi dan alat baru agar agen persisten bekerja lebih cepat dengan biaya lebih rendah.

Memuat…

GPT‑6 memungkinkan agen persisten mengerjakan tugas kompleks selama berjam-jam, mulai dari memfaktorkan ulang basis kode hingga membuat dokumen dan presentasi berbasis riset mendalam. Aplikasi di balik agen ini membuat serangkaian permintaan API yang saling berkesinambungan, sering kali dengan meneruskan instruksi, definisi alat, dan konteks yang sama dari giliran sebelumnya. OpenAI menyimpan konteks bersama tersebut dalam cache agar komputasi dapat digunakan kembali di berbagai permintaan, sehingga waktu respons berkurang dan pengembang mendapat diskon hingga 90% untuk token input yang di-cache.

Bersama keluarga GPT‑6, kami meluncurkan sistem penyimpanan prompt yang ditingkatkan dan secara default menghasilkan tingkat hit cache lebih tinggi. Kini kami memberikan diskon cache untuk prefiks bersama yang memenuhi syarat dan digunakan kembali dalam jangka waktu 30 menit. Kami juga memperkenalkan alat baru untuk membantu pengembang memantau kinerja cache, mendiagnosis cache miss, dan menentukan seberapa banyak bagian prompt yang akan di-cache.

Penyimpanan prompt OpenAI berperan penting dalam membantu GitHub Copilot menghadirkan pengalaman yang cepat dan efisien dalam skala besar. Selama beberapa bulan terakhir, dibandingkan dengan tolok ukur kami sebelumnya, kami telah mengurangi lebih dari 50% porsi token prompt yang memerlukan pemrosesan baru di miliaran permintaan ke model OpenAI. Hasilnya adalah tumpukan inferensi yang lebih efisien dan waktu menuju respons pertama yang lebih cepat bagi pengembang.
—Mario Rodriguez, Direktur Produk

Pantau penyimpanan cache dan diagnosis cache miss

Dasbor Penyimpanan Prompt(terbuka di jendela baru) baru menunjukkan seberapa banyak input aplikasi Anda yang disajikan dari cache. Pantau tingkat hit dari waktu ke waktu dan gunakan bagan komposisi input untuk membandingkan token yang di-cache dan yang tidak di-cache. Tampilan ini membantu Anda menemukan penurunan hit cache dan mengevaluasi dampak perubahan pada aplikasi terhadap kinerja penyimpanan cache.

Dasbor penyimpanan prompt yang menampilkan tingkat hit cache, kinerja cache dari waktu ke waktu, dan komposisi token input.

Saat menemukan cache miss yang tidak terduga, gunakan alat diagnostik penyimpanan prompt(terbuka di jendela baru) untuk memahami penyebabnya. Bandingkan permintaan dengan respons terbaru untuk mengidentifikasi perubahan pada model, alat, pengaturan, atau input yang menghalangi penggunaan kembali. Perkiraan jumlah token yang terdampak membantu Anda menilai besarnya dampak dan menentukan cara mengoptimalkan integrasi agar tingkat hit cache maksimal.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimalkan penyimpanan cache untuk aplikasi Anda

Pilih apa yang akan di-cache. Titik henti cache eksplisit memungkinkan Anda memilih prefiks prompt yang akan digunakan kembali. Panduan penyimpanan prompt(terbuka di jendela baru) yang diperbarui menjelaskan cara menggunakannya, berapa lama prefiks yang di-cache tetap memenuhi syarat, dan bagaimana perubahan pada alat serta input memengaruhi penggunaan kembali.

Sesuaikan upaya penalaran tanpa mengganggu cache. Pada model GPT‑6, kini Anda dapat mengubah upaya penalaran(terbuka di jendela baru) di antara respons tanpa mengganggu cache. Tingkatkan upaya untuk tugas yang lebih sulit atau kurangi untuk tindak lanjut rutin dengan menambahkan configuration_update, sementara upaya penalaran tingkat permintaan tetap tidak berubah. Dengan begitu, Anda dapat menyesuaikan kadar penalaran yang dibutuhkan tugas sembari mempertahankan konteks yang dapat digunakan kembali.

Pertahankan cache saat alat dan instruksi berubah. Saat kebutuhan penggunaan alat oleh agen Anda berubah, pertahankan definisi, skema, dan urutan alat agar tetap stabil sehingga konteks sebelumnya dapat terus digunakan kembali. Gunakan allowed_tools agar hanya alat yang relevan yang dapat dipanggil, atau atur tool_choice ke none saat tidak ada alat yang diperlukan, alih-alih menghapus definisinya. Gunakan pesan pengembang baru untuk menambahkan instruksi baru di bagian akhir konteks agar menggantikan instruksi lama. Lihat panduan kami tentang pengelolaan perubahan alat(terbuka di jendela baru).

Panaskan cache lebih awal untuk mengurangi latensi. Pemanasan awal(terbuka di jendela baru) menyiapkan konteks yang sudah diketahui sebelumnya agar model dapat mulai merespons lebih cepat saat permintaan tiba. Misalnya, saat mulai dijalankan, aplikasi dapat memanaskan lebih awal instruksi bersama, definisi alat, atau materi referensi sebelum pengguna mengajukan pertanyaan pertama. Dengan demikian, pemrosesan dilakukan di luar waktu tunggu pengguna.

Kontrol opsional ini melengkapi kinerja default mesin, sehingga Anda dapat menyesuaikan penyimpanan cache dengan beban kerja.

1 dari 3
Diagnostik dan dasbor penyimpanan prompt OpenAI membantu kami meningkatkan tingkat hit cache beberapa poin persentase, sehingga biaya turun 20%. Kini kami menerima peringatan saat penyimpanan cache tiba-tiba terganggu dan menggunakan agen Codex untuk mendiagnosis akar masalahnya. Titik henti eksplisit juga memungkinkan kami menyimpan konteks stabil dalam cache, sementara konten yang sering berubah tetap berada di akhir prompt. Dengan begitu, fork percakapan untuk tugas latar belakang menjadi layak secara ekonomis, sembari menggunakan kembali hampir seluruh konteks bersama.
—Arian Hanifi, Direktur Teknologi

Mulai sekarang

Penulis

OpenAI