Prioritas dan prinsip asesmen pihak ketiga yang efektif
Laboratorium AI terdepan memikul tanggung jawab besar untuk melatih, mengevaluasi, dan menerapkan model secara aman. Asesmen pihak ketiga sangat penting untuk mengimbangi tanggung jawab tersebut, memperluas kesempatan memberikan masukan tentang keselamatan AI, terus menginformasikan perkembangan kepada dunia, dan memastikan laboratorium bertanggung jawab atas klaim keselamatan yang jelas serta didukung secara independen.
Sebagai bagian dari upaya kami untuk mengimbangi kemajuan AI terdepan, OpenAI berkomitmen mendukung asesmen independen dengan akses mendalam ke seluruh tahap pelatihan, evaluasi, dan penerapan. Akses tersebut harus memungkinkan penilai menguji asumsi kami, mengidentifikasi risiko yang mungkin kami lewatkan, dan mencapai kesimpulan sendiri mengenai efektivitas langkah pengamanan kami.
Kami telah lama bekerja sama dengan penilai pihak ketiga pada berbagai tahap pengembangan dan penerapan model. Kami juga telah memasukkan asesmen pihak ketiga ke dalam praktik Kerangka Kerja Kesiapan dan mendukung organisasi serta peraturan perundang-undangan yang mendorong proses yang lebih ketat dan akuntabel. Dalam seluruh kerja sama ini, kami telah memberikan akses mendalam, termasuk informasi tentang langkah pengamanan teknis, akses ke rantai pemikiran yang terlihat, serta akses ke data rahasia dan penerapan internal pada tingkat yang belum pernah diberikan sebelumnya untuk penanganan insiden dan red teaming terhadap sistem pemantauan. Prioritas dan prinsip yang disampaikan di sini berfokus pada kerja sama kami dengan organisasi asesmen independen di sektor swasta dan nirlaba untuk asesmen keselamatan teknis. Prinsip-prinsip ini melengkapi kerja sama kami dengan pemerintah dalam pengujian dan evaluasi, yang mungkin memerlukan pendekatan berbeda karena peran dan tanggung jawabnya juga berbeda.
Agar efektif, asesmen ini memerlukan mekanisme independensi yang kuat, ketelitian ilmiah, praktik keamanan yang kukuh, dan tanggung jawab yang jelas. Laboratorium bertanggung jawab memungkinkan pemeriksaan yang bermakna sekaligus melindungi informasi sensitif. Laboratorium dan penilai independen sama-sama bertanggung jawab memastikan proses ini berjalan semestinya, dan harus menerapkan standar internasional bersama untuk praktik keselamatan dan keamanan. Berikut ini kami mengusulkan empat bidang prioritas untuk asesmen yang lebih mendalam, beserta prinsip untuk pekerjaan yang ketat, aman, dan independen.
Asesmen pihak ketiga paling berguna ketika menjawab pertanyaan spesifik yang berdampak besar: Apakah bukti mendukung kasus keselamatan dan klaim keselamatan suatu laboratorium? Apakah evaluasi menguji secara memadai risiko yang hendak diukurnya? Apakah langkah pengamanan berfungsi dalam kondisi realistis?
Asesmen yang dijelaskan di sini dimaksudkan untuk dilakukan dalam berbagai bentuk, bergantung pada persoalan keselamatan yang diperiksa. Kami berencana mendukung beberapa asesmen secara paralel dalam rentang waktu berbeda; sebagian berlangsung beberapa minggu dan lainnya beberapa bulan. Meskipun asesmen pihak ketiga juga dapat menjadi bagian dari pekerjaan prapenerapan dan memberikan masukan bagi keputusan penerapan, pekerjaan yang dijelaskan di sini umumnya berjangka lebih panjang dan tidak terkait peluncuran tertentu—dengan fokus memeriksa klaim keselamatan tertentu secara mendalam dari waktu ke waktu.
Dalam seluruh bidang prioritas dan prinsip ini, kami menggunakan istilah klaim keselamatan dan kasus keselamatan. Berikut arti istilah-istilah tersebut:
Klaim keselamatan: Pernyataan spesifik tentang kemampuan, perilaku, atau langkah pengamanan suatu model atau sistem yang berkaitan dengan keselamatannya dan dapat dinilai berdasarkan bukti. Klaim harus mengidentifikasi risiko dan kondisi yang ditanganinya, beserta asumsi dan keterbatasan yang relevan.
Kasus keselamatan: Argumen terstruktur yang didukung bukti dan menjelaskan mengapa risiko suatu model atau sistem telah dikelola secara memadai untuk aktivitas tertentu, seperti pelatihan, evaluasi, atau penerapan. Kasus keselamatan menghubungkan setiap klaim keselamatan dengan bukti pendukungnya serta menyatakan secara jelas asumsi, ketidakpastian, dan risiko tersisa yang dapat memengaruhi kesimpulannya.
Kami mengusulkan empat bidang prioritas untuk asesmen yang lebih mendalam, beserta prinsip untuk pekerjaan yang ketat, aman, dan independen.
Asesmen independen atas kasus keselamatan, yang mencakup pelatihan, evaluasi, penerapan internal, dan penerapan eksternal.
Asesmen kasus keselamatan memerlukan keahlian dalam penyelarasan, metode pengendalian seperti pemantauan, keamanan siber, penyalahgunaan biologis dan kimia, serta red teaming. Kasus keselamatan terdiri atas klaim yang mencakup pelatihan, evaluasi kemampuan, dan langkah pengamanan, yang dapat dinilai secara keseluruhan atau sebagian (lihat prioritas 2 dan 3 di bawah). Beberapa penilai kemungkinan perlu memeriksa bagian kasus yang berbeda sesuai dengan keahlian masing-masing. Secara keseluruhan, asesmen mereka harus menjawab pertanyaan seperti:
Apakah bukti untuk kasus keselamatan dalam pelatihan, evaluasi, dan penerapan telah terbukti kuat? Apakah ketentuan dalam kasus keselamatan dipatuhi selama pelatihan, evaluasi, dan penerapan?
Apakah kasus keselamatan kami mencakup risiko paling mendesak yang teridentifikasi selama asesmen? Apakah klaim keselamatan mendukung kasus keselamatan secara keseluruhan? Adakah kesenjangan atau aspek yang perlu diperbaiki?
Apakah metode yang efektif digunakan untuk mengidentifikasi dan mengurangi insentif dalam pelatihan yang dapat memberi imbalan atas penipuan, manipulasi reward, tindakan merusak, atau pengelakan pembatasan?
Asesmen langkah pengamanan penting dalam penerapan internal dan eksternal
Rangkaian langkah pengamanan kami terus berkembang mengikuti perubahan kemampuan dan lanskap. Langkah pengamanan kami mencakup pelatihan, penerapan internal, dan penerapan eksternal. Saat ini, langkah tersebut mencakup pengamanan pada tingkat model, pengamanan penegakan aturan, pengamanan keamanan, serta pemantau ketidakselarasan—yang meliputi beragam risiko, seperti hilangnya kendali dan penyalahgunaan yang menimbulkan risiko siber, biologis, dan kimia. Kemitraan teknis dapat mengidentifikasi kelemahan langkah pengamanan saat ini sekaligus meningkatkan metode asesmen dan mempercepat pengembangan standar, sehingga memberikan landasan teknis yang lebih kuat bagi kebijakan publik mendatang untuk mengimbangi kemajuan AI terdepan—terutama pada penerapan internal, yang standar keselamatan dan keamanannya masih dalam tahap awal.
Asesmen independen harus memeriksa seberapa baik langkah pengamanan ini bekerja dan di mana kekurangannya, misalnya:
Dengan akses “kotak abu-abu”, apakah langkah pengamanan tahan terhadap pengujian adversarial (jailbreak) dan cukup melindungi dari peningkatan kemampuan di bidang berisiko tinggi, misalnya siber dan biologi? Apakah pengujian adversarial dan red teaming kami mencakup risiko yang paling penting?
Dalam pengujian resmi pada kondisi operasional yang realistis, bagaimana agen berinteraksi dengan pertahanan siber seperti kontrol akses, sandboxing, serta sistem deteksi dan respons? Pertahanan mana yang mencegah, mendeteksi, atau membatasi tindakan berbahaya, dan di mana pertahanan tersebut gagal?
Apakah pemantau ketidakselarasan kami memiliki kesenjangan penting yang dapat menyebabkan hilangnya kendali atau ketidakselarasan berat, baik pada penerapan internal maupun eksternal? Seberapa andal pemantauan rantai pemikiran sebagai sumber bukti keselamatan atau penyelarasan ketika kemampuan model meningkat?
Apakah pemantauan yang sesuai diterapkan pada semua pelatihan, evaluasi, dan penerapan yang relevan dengan cara yang tidak mudah dinonaktifkan?
Apakah langkah pengamanan diterapkan secara sepadan dengan kemampuan yang ada?
Asesmen evaluasi kemampuan yang mencakup kategori risiko Kesiapan (Risiko Kimia dan Biologis, Keamanan Siber, Peningkatan Mandiri AI) serta evaluasi penyelarasan untuk risiko ketidakselarasan
Kerangka Kerja Kesiapan kami mewajibkan evaluasi terhadap bidang utama risiko frontier. Ketika ambang batas terlampaui dan evaluasi mencapai titik jenuh, evaluasi kemampuan di bidang risiko Kesiapan perlu diperbarui secara konsisten serta dipastikan cakupan dan kualitasnya. Hal yang sama berlaku bagi evaluasi penyelarasan untuk menilai risiko ketidakselarasan berat.
Pertanyaan yang relevan antara lain:
Apakah evaluasi risiko Kesiapan mencakup definisi ambang batas risiko Kesiapan secara memadai? Apakah ambang batas untuk evaluasi ini ditetapkan dengan tepat?
Apakah evaluasi diperbarui ketika model secara konsisten meraih skor tertinggi, dan apakah pengujian baru benar-benar mengukur kemampuan yang lebih canggih?
Apakah evaluasi penyelarasan kami mencakup risiko ketidakselarasan berat secara memadai, dan perilaku atau kondisi penting apa yang mungkin terlewat?
Penyelidikan independen atas insiden ketidakselarasan kritis
Penyelidikan independen dapat bermanfaat untuk berbagai insiden kritis terkait keselamatan AI. Di sini, kami berfokus pada ketidakselarasan model, termasuk model yang bertindak tanpa izin atau menghindari pengawasan. Hal ini dapat mengungkap kelemahan metode penyelarasan dan langkah pengamanan, bahkan tanpa penyalahgunaan yang disengaja.
Dalam keadaan tertentu, seperti pada insiden OpenAI Hugging Face, melibatkan pihak ketiga yang independen untuk melakukan penyelidikan independen atas insiden ketidakselarasan dapat memberikan manfaat. Pihak ketiga yang terlibat dalam penyelidikan insiden wajib memiliki keahlian yang diperlukan, termasuk bila relevan: keahlian forensik siber, keahlian penyelarasan, analisis rantai pemikiran berskala besar, serta staf dan sumber daya yang tersedia untuk melakukan penyelidikan tepat waktu. Penanganan insiden mungkin melibatkan akses ke data internal sensitif dan data pihak ketiga. Karena itu, publikasi atau akses terhadap detail tertentu mungkin perlu dibatasi. Temuan penyelidikan independen juga dapat memberikan masukan bagi kasus keselamatan suatu model dengan menyediakan bukti untuk menilai klaim tentang penyelarasannya dan efektivitas tindakan perbaikan atas ketidakselarasan yang sebelumnya teramati.
Dalam konteks insiden ketidakselarasan, kami memprioritaskan asesmen independen atas:
Perilaku model atau masalah ketidakselarasan apa yang terjadi selama insiden, dan apa saja faktor utama yang menyebabkannya?
Apakah langkah pengamanan dan perbaikan akan secara efektif mengurangi risiko insiden serupa pada masa mendatang?
Ruang lingkup yang jelas dan klaim asesmen yang disepakati bersama: Asesmen harus diawali dengan penetapan ruang lingkup yang disepakati bersama, lalu klaim keselamatan yang didefinisikan dengan jelas dan didaftarkan sebelum kegiatan asesmen dimulai. Pihak ketiga dan laboratorium harus memperjelas apakah klaim tersebut diajukan oleh perusahaan yang dievaluasi untuk dinilai, atau hendak dinilai secara independen oleh penilai pihak ketiga dan disetujui laboratorium sebagai dasar asesmen. Ada banyak alasan suatu klaim mungkin berada di luar ruang lingkup, termasuk ketidakmungkinan pihak ketiga mengakses data, kurangnya keahlian penilai, atau keterbatasan waktu yang wajar ketika asesmen bersifat mendesak. Laboratorium dan penilai harus menetapkan proses untuk mempertimbangkan risiko signifikan yang ditemukan di luar ruang lingkup awal, termasuk menentukan apakah penyelidikan lebih lanjut diperlukan. Kesimpulan harus memperjelas hal-hal yang dinilai dan tidak dinilai dalam kaitannya dengan ruang lingkup yang disepakati bersama.
Akses yang proporsional: Jika memungkinkan dan dalam batasan hukum, keamanan, serta kekayaan intelektual, penilai harus memperoleh akses yang proporsional untuk menilai klaim yang telah disepakati. Jika akses langsung tidak praktis atau tidak memungkinkan, penilai dapat bekerja sama dengan perwakilan khusus di perusahaan atau menjajaki mekanisme akses tidak langsung maupun yang menjaga privasi untuk melindungi informasi yang mendasarinya.
Metodologi dan standar yang transparan: Penilai harus menjelaskan metode, kriteria asesmen, dan ketidakpastian mereka dengan merujuk pada standar yang telah ditetapkan jika tersedia. Jika standar belum tersedia, mereka harus memberikan alasan yang jelas atas kriteria yang digunakan. Laporan harus membedakan temuan langsung dari interpretasi, menjelaskan ketidakpastian, dan memperjelas kesimpulan mana yang didukung oleh bukti.
Keahlian dan independensi: Penilai harus menunjukkan keahlian teknis yang relevan serta mengidentifikasi, mengungkapkan, dan menangani konflik kepentingan organisasi maupun individu, termasuk insentif finansial, hubungan dengan pengembang, dan keterlibatan sebelumnya dalam pekerjaan yang dinilai. Langkah pengamanan harus dirancang untuk memastikan tekanan komersial dan pengaturan kompensasi tidak memengaruhi temuan, dan dapat mencakup pengunduran diri dari proses atau masa pengecualian yang sesuai.
Keamanan dan kerahasiaan: Penilai harus menunjukkan praktik keamanan informasi dan perlindungan kerahasiaan yang dapat ditegakkan bagi personel mereka, sebanding dengan sensitivitas sistem dan informasi yang diakses. Perlindungan ini harus mencakup kekayaan intelektual, informasi sensitif, dan catatan asesmen. Jika penilai tidak dapat memenuhi persyaratan keamanan di lingkungan mereka sendiri, atau data yang diakses sangat sensitif, akses melalui perangkat atau lokasi yang dikelola perusahaan mungkin lebih tepat.
Temuan yang dapat ditindaklanjuti dan waktu untuk perbaikan: Asesmen harus mengidentifikasi kesenjangan tertentu dan memberikan detail yang cukup agar laboratorium dapat menanganinya. Jika sesuai, laboratorium harus diberi waktu yang wajar untuk memperbaiki masalah sebelum publikasi. Jika relevan, laporan juga harus menjelaskan pelajaran bagi pengembang, pihak yang menerapkan, dan pihak yang melindungi agen, disertai rekomendasi praktis untuk penerapannya.
Praktik publikasi yang bertanggung jawab: Laporan asesmen harus berlandaskan bukti dan dibagikan seterbuka mungkin sembari melindungi informasi sensitif dan rahasia. Jika pengungkapan penuh kepada publik tidak memungkinkan, pelaporan rahasia kepada badan pengawas yang tepat, seperti badan tata kelola atau dewan perusahaan, dapat mendukung akuntabilitas. Perlindungan dan kebijakan penyuntingan yang berprinsip, serta ekspektasi yang jelas mengenai umpan balik dan koreksi ketidakakuratan, harus diterapkan guna menjaga keseimbangan antara independensi dan kerahasiaan. Penilai harus mempertahankan independensi editorial sekaligus memastikan perlindungan kerahasiaan dan kekayaan intelektual tetap terjaga. Penilai harus menerapkan kebijakan penyuntingan yang jelas agar laboratorium dapat meminta penghapusan informasi sensitif, sementara penilai dapat mencatat penyuntingan substansial yang dilakukan beserta dampaknya terhadap laporan asesmen.
Kami berkomitmen mendukung penilai independen dan menetapkan standar internasional bersama yang lebih jelas—baik melalui undang-undang mendatang maupun lembaga tata kelola swasta—untuk asesmen pihak ketiga yang efektif. Selagi ekosistem evaluasi independen terus berkembang, kami akan turut mengembangkannya dengan mendukung dan bekerja sama dengan komunitas penilai independen yang beragam dan memiliki keahlian mendalam dalam berbagai persoalan keselamatan AI terdepan. Tidak ada satu pihak ketiga pun yang mampu atau seharusnya menangani secara menyeluruh semua persoalan mendesak terkait keselamatan AI terdepan. Kami akan bertindak secara cermat dan terarah untuk meningkatkan kapasitas serta membantu ekosistem pihak ketiga yang berkembang agar menyelaraskan praktik dan prinsip terbaik. Kami sedang berdiskusi dengan sejumlah pihak ketiga mengenai usulan yang selaras dengan bidang prioritas di atas.


