Cache prom yang lebih baik untuk GPT‑6
Kadar padanan cache yang lebih tinggi dan alat baharu untuk membantu ejen berterusan berjalan lebih pantas dengan kos lebih rendah.
GPT‑6 membolehkan ejen berterusan melaksanakan tugas rumit selama berjam-jam, daripada memfaktorkan semula pangkalan kod hingga menghasilkan dokumen dan pembentangan berdasarkan penyelidikan menyeluruh. Aplikasi di sebalik ejen ini membuat siri permintaan API yang saling bersambung, lazimnya dengan meneruskan arahan, takrif alat dan konteks yang sama daripada giliran terdahulu. OpenAI menyimpan konteks yang dikongsi itu dalam cache untuk menggunakan semula pengiraan merentas permintaan, mengurangkan masa respons dan memberikan diskaun sehingga 90% kepada pembangun bagi token input yang disimpan dalam cache.
Bersama keluarga GPT‑6, kami melancarkan sistem cache prom yang dipertingkatkan untuk memberikan kadar padanan cache lalai yang lebih tinggi. Kini, kami memberikan diskaun cache bagi awalan dikongsi yang layak dan digunakan semula dalam tempoh 30 minit. Kami turut memperkenalkan alat baharu untuk membantu pembangun memantau prestasi cache, mendiagnosis kegagalan padanan dan memilih bahagian prom yang hendak disimpan dalam cache.
Papan Pemuka Cache Prom(dibuka dalam tetingkap baru) baharu menunjukkan bahagian input aplikasi anda yang disediakan daripada cache. Jejaki kadar padanan dari semasa ke semasa dan gunakan carta komposisi input untuk membandingkan token yang disimpan dalam cache dengan token yang tidak disimpan dalam cache. Paparan ini membantu anda mengesan penurunan padanan cache dan menilai kesan perubahan aplikasi anda terhadap prestasi cache.

Apabila berlaku kegagalan padanan cache yang tidak dijangka, gunakan alat diagnostik cache prom(dibuka dalam tetingkap baru) untuk memahami puncanya. Bandingkan sesuatu permintaan dengan respons terkini untuk mengenal pasti perubahan pada model, alat, tetapan atau input yang menghalang penggunaan semula. Anggaran bilangan token yang terjejas membantu anda menilai skala kesannya dan menentukan cara mengoptimumkan integrasi untuk memaksimumkan kadar padanan cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Pilih kandungan untuk disimpan dalam cache. Titik henti cache eksplisit membolehkan anda memilih awalan prom yang hendak digunakan semula. Panduan cache prom(dibuka dalam tetingkap baru) yang dikemas kini menerangkan cara menggunakannya, tempoh awalan yang disimpan dalam cache kekal layak serta kesan perubahan alat dan input terhadap penggunaan semula.
Laraskan usaha penaakulan tanpa mengganggu cache. Pada model GPT‑6, kini anda boleh mengubah usaha penaakulan(dibuka dalam tetingkap baru) antara respons tanpa mengganggu cache. Tingkatkan usaha untuk tugas yang lebih sukar atau kurangkannya bagi susulan rutin dengan menambahkan configuration_update sambil mengekalkan usaha penaakulan peringkat permintaan tanpa perubahan. Ini membolehkan anda melaraskan tahap penaakulan yang diperlukan oleh sesuatu tugas sambil mengekalkan konteks yang boleh digunakan semula.
Kekalkan cache apabila alat dan arahan berubah. Apabila keperluan penggunaan alat ejen anda berubah, kekalkan kestabilan takrif, skema dan susunan alat supaya konteks terdahulu boleh terus digunakan semula. Gunakan allowed_tools supaya hanya alat yang berkaitan boleh dipanggil, atau tetapkan tool_choice kepada none apabila tiada alat diperlukan, dan bukannya mengalih keluar takrif. Gunakan mesej pembangun baharu untuk menambahkan arahan baharu pada penghujung konteks bagi mengatasi arahan terdahulu. Lihat panduan kami tentang pengurusan perubahan alat(dibuka dalam tetingkap baru).
Pramuat cache untuk mengurangkan kependaman. Pramuat(dibuka dalam tetingkap baru) menyediakan konteks yang diketahui lebih awal agar model boleh mula memberikan respons dengan lebih pantas apabila permintaan diterima. Contohnya, aplikasi boleh pramuat arahan dikongsi, takrif alat atau bahan rujukan semasa permulaan, sebelum pengguna mengemukakan soalan pertama. Ini mengalihkan pemprosesan keluar daripada tempoh menunggu pengguna.
Kawalan pilihan ini melengkapi prestasi lalai enjin dan membantu anda menyesuaikan cache dengan beban kerja anda.
Pantau kadar padanan cache dalam Papan Pemuka Cache Prom(dibuka dalam tetingkap baru).
Siasat kegagalan padanan yang tidak dijangka dengan alat diagnostik(dibuka dalam tetingkap baru).
Ikuti panduan cache prom(dibuka dalam tetingkap baru) untuk menambah baik persediaan anda, atau gunakan Codex(dibuka dalam tetingkap baru) untuk menyemak kod anda, melaksanakan penambahbaikan dan mengukur hasilnya.


