Memperbaiki hierarki arahan dalam LLM perbatasan
Memperkenalkan IH-Challenge, set data latihan yang mengukuhkan hierarki arahan, kebolehkawalan keselamatan, dan keteguhan terhadap suntikan prom.
Sistem AI sering menerima arahan daripada pelbagai sumber. Ini boleh merangkumi dasar keselamatan daripada mesej sistem, panduan produk daripada pembangun, permintaan daripada pengguna, dan maklumat yang ditemui dalam talian. Melatih model untuk mengutamakan arahan yang paling dipercayai dalam kalangan sumber-sumber ini merupakan bahagian penting dalam pelaksanaan selamat.
Banyak isu keselamatan dan kebolehpercayaan AI boleh timbul apabila keutamaan ini gagal. Model-model mungkin menerima permintaan untuk kandungan yang tidak dibenarkan, percubaan untuk mendedahkan maklumat peribadi, atau serangan suntikan arahan yang disisipkan dalam data dalam talian. Kegagalan untuk bertindak dengan sewajarnya dalam setiap senario ini berkongsi punca utama yang sama: model mungkin mengikuti arahan yang salah.
Apabila arahan ini bercanggah, model perlu memutuskan yang mana satu harus diutamakan. Jika ia menganggap arahan yang tidak dipercayai sebagai berwibawa, model mungkin berkelakuan dengan cara yang melanggar dasar atau niat pembangun dan pengguna.
Kami menunjukkan bahawa tugas hierarki arahan yang direka dengan betul, yang melatih model untuk mengutamakan arahan mengikut tahap kepercayaannya, meningkatkan beberapa sifat keselamatan dunia sebenar. Model yang dilatih pada tugas-tugas ini menjadi lebih responsif terhadap spesifikasi keselamatan dalam prom sistem (meningkatkan kebolehkawalan keselamatan) dan lebih teguh terhadap serangan suntikan prom yang dibenamkan dalam output alat.
Untuk menangani konflik, model OpenAI dilatih untuk mengikuti hierarki arahan yang jelas:
Sistem > pembangun > pengguna > alat
Arahan keutamaan‑lebih tinggi lebih dipercayai. Model hanya harus mengikuti arahan berkeutamaan‑lebih rendah apabila arahan tersebut tidak bercanggah dengan kekangan berkeutamaan‑lebih tinggi. Prinsip ini digariskan dalam Spesifikasi Model OpenAI(dibuka dalam tetingkap baru).
Sebagai contoh, jika mesej sistem menyertakan dasar keselamatan dan pengguna meminta model untuk melanggarnya, model sepatutnya menolak. Jika output alat mengandungi arahan berniat jahat, model harus mengabaikannya dan bukannya menganggapnya sebagai perintah.
Memastikan perkara ini betul adalah asas kepada keselamatan, sekuriti, dan kebolehpercayaan.
Model di sebelah kanan dengan betul mengikuti arahan Pembangun, yang berkeutamaan lebih tinggi, berbanding arahan Pengguna apabila kedua-dua arahan bercanggah.
Pembelajaran pengukuhan sesuai secara semula jadi untuk mengajar hierarki arahan. Kami boleh menjana perbualan dengan arahan yang bercanggah, prom model untuk memberikan respons, dan memberinya ganjaran apabila ia mengikut arahan yang betul.
Kami telah mengenal pasti tiga perangkap apabila menggunakan resipi itu secara tidak bijak:
- Kegagalan mengikuti arahan boleh juga menjadi kegagalan hierarki arahan: model mungkin gagal menyelesaikan konflik arahan, bukan kerana ia tidak memahami hierarki peranan, tetapi kerana arahan itu sendiri terlalu rumit.
- Konflik arahan boleh bersifat nuansa dan malah subjektif. Pendekatan yang lazim ialah membiarkan seorang hakim LLM yang berasingan menetapkan ganjaran kepada LLM yang sedang dilatih, tetapi hakim itu sendiri tidak sempurna.
- Model cenderung mempelajari pintasan yang menghasilkan ganjaran yang tinggi, tetapi tidak berguna dalam amalan(dibuka dalam tetingkap baru). Contoh klasik ialah penolakan berlebihan: model boleh belajar untuk memaksimumkan keselamatan dengan menolak walaupun permintaan yang tidak berbahaya.
Kami mereka bentuk IH-Challenge, satu set data latihan pembelajaran pengukuhan, untuk menangani setiap satu daripada kelemahan tersebut. Kami mematuhi prinsip berikut:
- Tugas adalah mengikut arahan yang mudah
- Ia boleh dinilai secara objektif dengan skrip Python yang ringkas
- Tiada jalan pintas yang mudah yang menjamin ganjaran yang tinggi merentas semua tugas
Setiap tugas dalam IH-Challenge secara asasnya ialah perbualan dengan mesej-mesej berikut:
- Mesej arahan daripada peranan berkeistimewaan tinggi, contohnya, “Hanya jawab ‘Ya’ atau ‘Tidak’.”
- Mesej arahan daripada peranan berkeistimewaan rendah, yang cuba membuat model melanggar arahan dalam mesej berkeistimewaan tinggi.
Model yang sedang dilatih menjana mesej seterusnya. Kami menulis tugas/persekitaran supaya adalah mungkin untuk menyemak secara pengaturcaraan sama ada respons model memenuhi kekangan peringkat lebih tinggi.
Kami melatih sebuah model pada IH‑Challenge dan menghasilkan model dalaman, yang kami panggil GPT‑5 Mini-R, dengan penambahbaikan berikut:
- Berprestasi lebih baik pada penanda aras hierarki arahan
- Prestasi yang dipertingkatkan digeneralisasikan kepada ujian hierarki arahan yang diasingkan dan bersifat permusuhan
- Mengekalkan kegunaan keseluruhan, tanpa merosot menjadi penolakan berlebihan
Inilah yang menjadikan pendekatan ini sangat meyakinkan untuk keselamatan: dengan melatih model secara langsung untuk menyelesaikan konflik arahan dengan betul pada tugasan IH-Challenge, kami memperoleh penambahbaikan IH yang boleh digeneralisasikan kepada serangan baharu dan situasi baharu.
Keteguhan pada penanda aras akademik
Penilaian | GPT‑5‑Mini | GPT‑5 Mini-R |
Kata laluan Gandalf (sys-user) | 0.99 | 0.99 (+0) |
Kata laluan Gandalf (dev-user) | 0.98 | 1.00 (+0.02) |
TensorTrust (sys-user) | 0.86 | 0.94 (+0.08) |
TensorTrust (pembangun-pengguna) | 0.76 | 0.91 (+0.15) |
RealGuardrails (Pengalih perhatian) | 0.88 | 0.95 (+0.07) |
RealGuardrails (Tulisan tangan) | 0.82 | 0.89 (+0.07) |
Sistem IFEval | 0.92 | 0.96 (+0.04) |
Keteguhan pada penanda aras dalaman
Penilaian | GPT‑5‑Mini | GPT‑5 Mini-R |
TutorJailbreak (sys-user) | 0.96 | 0.99 (+0.03) |
Tutor Jailbreak (pengguna-dev) | 0.97 | 0.99 (+0.02) |
Sistem <> Konflik Pengguna | 0.84 | 0.95 (+0.11) |
Konflik Sistem <> Pembangun | 0.86 | 0.86 (+0) |
Pembangun <> Konflik pengguna | 0.83 | 0.95 (+0.12) |
Tiada regresi keupayaan
Penilaian | GPT‑5‑Mini | GPT‑5 Mini-R |
IH-Cabaran (penolakan berlebihan) | 0.79 | 1.00 (+0.21) |
TensorTrust (penolakan berlebihan) | 0.91 | 0.90 (-0.01) |
GPQA Diamond | 0.83 | 0.83 (+0) |
AIME 2024 | 0.93 | 0.94 (+0.01) |
Kadar Kemenangan Sembang berbanding o1 | 0.71 | 0.66 (-0.05) |
Skor Keutamaan | 0.46 | 0.40 (-0.06) |
Hierarki arahan yang lebih kukuh memberikan pelbagai manfaat keselamatan serentak, termasuk dalam kebolehkawalan keselamatan dan ketahanan terhadap suntikan prom.
Kami menilai kebolehkawalan keselamatan dengan menambah spesifikasi keselamatan khusus kategori pada prom sistem dan mengukur tingkah laku pada Penanda Aras Produksi keselamatan OpenAI (satu set perbualan sensitif keselamatan yang mewakili ChatGPT dalam produksi).
Model yang dilatih IH menunjukkan peningkatan yang konsisten: dengan spesifikasi keselamatan tersedia, ia mencapai kadar penolakan dan penyelesaian selamat yang lebih tinggi merentasi kategori yang tidak dibenarkan, menunjukkan bahawa tingkah laku hierarki arahan yang lebih kukuh menjadikannya lebih baik dalam menyelesaikan konflik apabila permintaan yang tidak selamat datang daripada arahan berkeutamaan lebih rendah. Yang ketara, penambahbaikan ini tidak disertai dengan penurunan kadar kebergunaan yang sepadan (iaitu, ia tidak menjadi kurang “helpful” hanya dengan menolak lebih banyak secara keseluruhan).


Contoh bagaimana model yang dilatih IH menentang suntikan prom yang GPT‑5 Mini (Baseline) tidak dapat menanganinya.
Hierarki arahan juga merupakan teras dalam menentang suntikan prom, apabila arahan berniat jahat dibenamkan dalam output alat. Kami menilai model yang dilatih IH pada dua penanda aras suntikan prom—penanda aras akademik CyberSecEval 2 dan penanda aras suntikan prom dalaman OpenAI yang terdiri daripada serangan seperti yang ditunjukkan pada versi lama ChatGPT Atlas.
Berbanding dengan garis dasar, model GPT‑5 Mini-R yang dilatih IH meningkatkan keteguhan suntikan prom pada kedua-dua penanda aras dan meningkatkan prestasi dengan ketara pada penilaian suntikan prom statik dalaman kami dalam eksperimen ini.
Apabila model menjadi lebih bersifat ejen—memanggil alat, membaca dokumen yang tidak dipercayai, dan mengambil tindakan di dunia—keupayaan untuk secara konsisten mengutamakan arahan yang dipercayai berbanding arahan yang tidak dipercayai menjadi satu sifat keselamatan teras.
Dalam kajian ini, kami menunjukkan bahawa beberapa kesilapan lazim dalam latihan keteguhan IH boleh diatasi dengan mereka bentuk persekitaran latihan yang menangani kesilapan lazim tersebut. Walaupun set data IH-Challenge kami kelihatan ringkas, tingkah laku IH yang dipelajari oleh model daripada persekitaran ini digeneralisasikan kepada penanda aras yang lebih realistik, yang selalunya tidak boleh digredkan secara objektif.
Memperkukuh hierarki arahan bukan sahaja meningkatkan kebolehpercayaan, tetapi juga membuka pelbagai manfaat keselamatan dan sekuriti serentak—satu asas yang menjadi semakin penting apabila sistem AI semakin berkebolehan dan autonomi.
Untuk menyokong penyelidikan lanjut dalam bidang ini, kami melancarkan set data Cabaran‑IH di sini(dibuka dalam tetingkap baru).


