Panduan bersama untuk evaluasi pihak ketiga yang boleh dipercayai
Perkara yang penting untuk evaluasi bebas yang berkesan bagi perlindungan dan keupayaan untuk model frontier.
Evaluasi pihak ketiga yang bebas dan dipercayai memainkan peranan kritikal dalam mengukuhkan ekosistem keselamatan. Evaluasi ini dijalankan pada model frontier untuk memberikan bukti tambahan bagi dakwaan tentang keupayaan kritikal dan mitigasi keselamatan. Dalam siaran ini, kami berkongsi pengajaran yang telah kami pelajari setakat ini, dan mengesyorkan pendekatan untuk mereka bentuk evaluasi yang boleh menilai model frontier secara sahih yang kami harap dapat membantu memaklumkan piawaian yang sedang muncul dalam bidang ini.
Sebelum ini, banyak evaluasi menganggap model seperti chatbot: evaluasi itu memberikan prompt kepada model seolah-olah ia pengguna yang bertanya soalan, model menjawab, dan penilai menilai output tersebut. Model frontier hari ini boleh melakukan jauh lebih banyak: mereka boleh menggunakan alat, menjejak maklumat merentas banyak langkah, dan bertindak dalam aliran kerja yang lebih besar. Ini bermakna prestasi bergantung bukan sahaja pada model, tetapi juga pada persekitaran tempat tugasan itu berlaku, dan pada persediaan yang memudahkan tindakannya. Persediaan sekeliling ini, yang kami panggil “harness,” boleh mengubah aspek utama prestasi sistem, termasuk cara ia menggunakan alat, menjejak maklumat, atau pulih daripada kesilapan.
Ini mengubah cara evaluasi perlu dijalankan, dan perkara yang patut dicari oleh pembaca dalam laporan evaluasi. Pada pandangan kami, laporan yang paling berguna menerangkan secara jelas dua perkara selain keputusan itu sendiri: Pertama, ia menyatakan dakwaan yang persediaan evaluasi itu direka untuk diuji, dan kedua, ia berkongsi bukti yang tersedia bahawa keputusan evaluasi itu sah.
Dakwaan yang diuji dalam evaluasi biasanya terbahagi kepada satu daripada tiga kategori1:
- Elisitasi keupayaan: Bolehkah model secara munasabah menghasilkan keupayaan yang sedang dievaluasi?
- Prestasi perlindungan: Sejauh mana keteguhan perlindungan yang diuji terhadap tingkah laku atau serangan yang sedang dievaluasi?
- Perbandingan: Bagaimanakah model yang berbeza berprestasi di bawah keadaan yang setara?
Laporan evaluasi juga perlu menerangkan bagaimana penilai memeriksa kesan yang boleh menjejaskan kesahihan sesuatu keputusan. Ini termasuk:
- Manipulasi ganjaran: Mengeksploitasi jalan pintas dalam tugasan atau pemarkah, supaya sistem mendapat kredit tanpa menunjukkan tingkah laku yang ingin diukur oleh evaluasi.
- Keengganan: Enggan dengan cara yang mengaburkan tingkah laku yang sedang diuji.
- Pencemaran: Prestasi berlebihan kerana tugasan evaluasi, jawapan, atau varian yang hampir sama muncul dalam data latihan atau boleh ditemui semasa evaluasi, seperti melalui pelayaran web.
- Masalah rosak: Prestasi rendah kerana tugasan tidak sah. Sebabnya boleh termasuk pemarkahan yang tidak adil (contohnya, jawapan betul memerlukan butiran pelaksanaan yang tidak dinyatakan) dan persekitaran yang tidak boleh diselesaikan (contohnya, fail kritikal tiada atau alat yang tidak boleh dipercayai).
- Sandbagging: Sengaja berprestasi rendah apabila mereka menunjukkan kesedaran bahawa mereka sedang dievaluasi.
Kami telah memerhatikan bahawa peranan harness amat penting khususnya bagi sistem yang bertindak merentas trajektori yang lebih panjang. Apabila model boleh menggunakan alat, mengekalkan keadaan, dan pulih daripada kesilapan merentas banyak langkah, harness boleh mengubah tahap prestasi yang diperhatikan, malah menentukan sama ada keupayaan yang sedang dinilai itu muncul dalam evaluasi sama sekali. Sebagai contoh, harness yang mengekalkan keadaan dan mencuba semula tindakan yang gagal mungkin membolehkan model menamatkan tugasan berbilang langkah yang tidak pernah diselesaikan oleh model yang sama dalam harness yang lebih ringkas.
Dalam jadual di bawah, kami memisahkan tiga jenis dakwaan yang mungkin ingin dibuat oleh penilai dan harness yang kami percaya diperlukan oleh setiap jenis dakwaan.
Dakwaan yang cuba disokong oleh evaluasi | Pilihan harness yang sesuai | Bukti untuk dilaporkan |
Keupayaan di bawah elisitasi kuat: Sistem A boleh menyelesaikan tugasan jenis X apabila persediaan direka untuk menonjolkan prestasi paling kuat dan boleh dipercayainya. | Gunakan persediaan elisitasi paling kuat dan boleh dipercayai untuk sistem, termasuk harness, alat, scaffolding, dan bajet yang munasabah akan digunakan oleh pengguna berkeupayaan. | Persediaan harness dan alat, panduan elisitasi, bajet/usaha yang dibenarkan, token/kos/masa, dan sebab persediaan itu ialah proksi yang boleh dipercayai untuk keupayaan yang didakwa. Jika membandingkan sistem di bawah persediaan teroptimum yang berbeza, labelkannya sebagai perbandingan sistem-ke-sistem atau elisitasi kuat. |
Perbandingan terkawal: Sistem A mengatasi Sistem B di bawah persediaan evaluasi yang dikongsi. | Kekalkan tugasan, pemarkahan, dan bajet secara tetap. Gunakan sama ada persediaan harness/alat yang dikongsi atau set tetap harness piawai yang dipilih lebih awal untuk menyediakan elisitasi maksimum yang munasabah bagi sistem yang dibandingkan. | Set tugasan yang dikongsi, alat, kaedah pemarkahan, harness, bajet, kecekapan token/kos, dan batasan yang diketahui. Untuk evaluasi ejen pengekodan, harness sumber terbuka seperti Codex CLI boleh menyediakan gelung ejen tetap dan antara muka alat merentas sistem. Pendekatan ideal untuk elisitasi maksimum ialah mengoptimumkan harness tersuai bagi setiap tugasan dan sistem, tetapi pada masa ini hal itu tidak praktikal dalam amalan. |
Keteguhan perlindungan di bawah serangan yang dielisitasi: Perlindungan Sistem A mencukupi untuk tingkah laku model yang relevan atau serangan yang dielisitasi. | Gunakan persediaan ujian perlindungan yang direka untuk menonjolkan serangan paling kuat dan boleh dipercayai di bawah model musuh yang relevan. | Bagaimana penilai mencirikan tingkah laku model yang relevan, konfigurasi perlindungan yang diuji, strategi elisitasi, harness yang digunakan untuk melaksanakannya, dan bajet atau usaha yang dibenarkan. |
Dakwaan keupayaan hanya sekuat elisitasi di sebaliknya: penilai perlu memilih harness yang paling sesuai dengan tugasan dan keupayaan yang cuba diukur oleh evaluasi. Harness piawai mungkin sesuai untuk membandingkan sistem di bawah keadaan yang sama, tetapi ia boleh meremehkan keupayaan apabila ia meninggalkan ciri harness khusus yang membantu model melaksanakan tugasan. Sebagai contoh, prestasi GPT‑5.5 pada julat siber OpenAI menunjukkan bagaimana pilihan harness boleh mengubah secara material keupayaan yang diukur pada tugasan yang memerlukan penggunaan alat yang panjang dan berbilang langkah: model berprestasi lebih baik apabila harness menggunakan pemadatan untuk mengekalkan konteks yang relevan dengan tugasan apabila interaksi menjadi lebih panjang. Ini menunjukkan bahawa bagi model tertentu, harness yang tidak memasukkan pemadatan akan kurang menonjolkan prestasi.
Kadar kejayaan yang lebih tinggi adalah lebih baik
Evaluasi lain yang diterbitkan2 juga menunjukkan pilihan harness dan bajet mengubah keputusan evaluasi. Meningkatkan pengiraan masa ujian boleh mengubah dengan ketara keupayaan yang ditonjolkan oleh sesuatu evaluasi, terutamanya dalam domain yang kejayaannya mudah disahkan, seperti banyak tugasan siber. Dalam evaluasi julat siber UK AISI(dibuka dalam tetingkap baru), meningkatkan bajet daripada 10M kepada 100M token meningkatkan prestasi sehingga 59%, dan prestasi masih meningkat pada bajet tertinggi yang diuji. Memperincikan perkara ini menjadikan evaluasi lebih mudah ditafsir: ia menunjukkan kepada pembaca bagaimana keputusan itu bergantung pada persediaan elisitasi yang diuji. Apabila prestasi masih bertambah baik dengan bajet tambahan, skor itu patut diterangkan sebagai prestasi di bawah harness dan bajet tersebut, bukan sebagai siling keupayaan yang diukur. Keupayaan selalunya bergantung pada sumber dan bukannya kuantiti tetap yang boleh diukur dengan bersih sekali untuk selama-lamanya. Apabila kejayaan boleh diukur merentas percubaan berulang, laporan juga patut mempertimbangkan kos jangkaan bagi setiap penyelesaian yang berjaya, bukan hanya kadar kejayaan pada bajet token tetap. Ini boleh menjadikan tahap keterukan lebih mudah ditafsir: kadar kejayaan yang rendah mungkin masih bermakna secara praktikal jika kos percubaan berulang berada dalam model ancaman yang relevan. Bagi dakwaan keupayaan, kurang elisitasi yang boleh dielakkan ialah kegagalan pengukuran: jika harness atau bajet menghalang sistem daripada menunjukkan tingkah laku yang sebaliknya boleh dihasilkannya, skor itu tidak mengukur keupayaan yang didakwa. Apabila penilai telah menolak elisitasi sejauh yang boleh dilaksanakan dan prestasi masih bertambah baik, laporan patut menyatakannya dengan jelas dan menjelaskan bahawa keputusan itu hanyalah anggaran had bawah.
Ujian perlindungan boleh meremehkan sama ada sesuatu serangan boleh berjaya, dan betapa teruk kesannya, apabila tidak mengambil kira sumber yang tersedia kepada penyerang, termasuk harness tersuai. Dalam evaluasi siber GPT‑5.5 UK AISI(dibuka dalam tetingkap baru), red teaming pakar mereka menemui jailbreak universal yang menonjolkan kandungan siber yang melanggar dasar merentas pertanyaan berniat jahat yang disediakan oleh OpenAI, termasuk dalam tetapan agentik berbilang giliran. Mereka menggunakan Codex untuk mencipta harness tersuai bagi mengukuhkan prestasi serangan model: ia membenamkan corak pintasan perlindungan yang boleh diguna semula ke dalam interaksi, mengekalkan corak itu merentas giliran dan blok, dan menerapkannya merentas pertanyaan siber berniat jahat yang disediakan oleh OpenAI. Ujian perlindungan patut sepadan dengan musuh. Jika dakwaan itu tentang keteguhan terhadap penyalahgunaan pakar, ujian itu patut menilai strategi serangan hujung-ke-hujung paling kuat dan boleh dipercayai di bawah bajet yang ditetapkan, termasuk sebarang harness yang diperlukan untuk mengekalkan dan menggunakan semula strategi itu. Jika tidak, keputusan berisiko tersalah kalibrasi: ia mungkin hanya menyokong dakwaan yang lebih sempit tentang ketahanan terhadap prompting yang lebih mudah, boleh terlepas kedua-dua betapa teruknya serangan itu dan kebarangkalian kejayaannya sebaik sahaja kaedah elisitasi dioperasikan, dan juga boleh melebihkan kemungkinan atau keterukan masalah jika diberi bajet yang terlalu besar.
Terdapat masa dan tempat untuk perbandingan harness piawai, tetapi penilai patut jelas tentang sebab penggunaan set harness yang konsisten adalah sesuai dan dakwaan apa yang boleh disokongnya. Evaluasi horizon masa METR(dibuka dalam tetingkap baru) ialah contoh persediaan evaluasi yang lebih luas dan ditetapkan dengan sesuai: ia direka untuk menghasilkan keputusan yang boleh dibandingkan merentas sistem yang dinilainya. METR mentakrifkan hasil bersama, iaitu tempoh tipikal tugasan manusia yang pada tahap itu ejen AI diramalkan berjaya pada tahap kebolehpercayaan tertentu. Ia menggunakan suite tugasan bersama, kaedah pemarkahan, kaedah pemadanan, dan set kecil scaffolding boleh guna semula seperti Triframe dan ReAct(dibuka dalam tetingkap baru) dalam setiap kelompok anggaran yang dilaporkan bersama. Apabila METR memperluas suite tugasan dan memindahkan infrastruktur evaluasi daripada rangka kerja bernama Vivaria kepada yang bernama Inspect, ia melaporkan perubahan itu (kemas kini Time Horizon 1.1(dibuka dalam tetingkap baru)) dan menilai semula model di bawah persediaan evaluasi baharu. Itulah nilai persediaan evaluasi piawai, termasuk set harness yang konsisten: ia boleh membuat pembaca yakin bahawa perbezaan skor benar-benar mencerminkan perbezaan antara sistem yang dibandingkan, bukannya perubahan dalam persediaan pengukuran.
Kami mengesyorkan agar laporan evaluasi pihak ketiga menyatakan jenis dakwaan yang ingin disokong oleh persediaan evaluasi mereka; menerangkan sejauh mana apa yang diuji mencerminkan dakwaan yang lebih luas itu; menerangkan pilihan harness yang membentuk keputusan; memperincikan bila pilihan tersebut berubah antara evaluasi; dan menyertakan bukti sokongan untuk menunjukkan bagaimana keputusan itu dihasilkan dan sejauh mana ia digeneralisasikan kepada dakwaan tersebut.
Apabila model menjadi lebih berkeupayaan, skor evaluasi menjadi lebih mudah disalah tafsir. Berbanding keupayaan sebenar, skor evaluasi boleh dikurangkan secara buatan jika model menyedari bahawa ia sedang dievaluasi dan secara strategik berprestasi rendah. Skor juga boleh meningkat secara berlebihan jika model mengeksploitasi jalan pintas dalam tugasan, prompt, pemarkah, atau harness. Skor juga boleh diputarbelitkan oleh pencemaran (apabila model sudah mengetahui atau boleh mencari jawapan tanpa menyelesaikan tugasan) atau oleh masalah “rosak” yang kabur, diparkahkan secara salah, tidak boleh diselesaikan, atau terdedah kepada jalan pintas yang tidak disengajakan. Oleh itu, laporan evaluasi patut menggandingkan skor utama dengan perbincangan tentang bahaya ini, supaya pembaca boleh menilai sama ada skor tersebut mencerminkan tingkah laku yang dimaksudkan.
Harness, bajet, alat, peraturan pemarkahan, pemantau, dan prosedur semakan semuanya mempengaruhi sama ada ejen sedang menyelesaikan tugasan yang dimaksudkan, mengelakkannya, menghafalnya, atau mencari jalan mengelilinginya. Laporan yang boleh dipercayai menjadikan semakan itu kelihatan: penilai patut menyemak sampel untuk tingkah laku ini setiap kali penilaian dijalankan.
Manipulasi ganjaran
Manipulasi ganjaran bermaksud mencapai skor evaluasi tinggi dengan cara yang tidak mencerminkan keupayaan yang dimaksudkan. Di sini, kebimbangannya ialah sistem mendapat kredit dengan mengeksploitasi tugasan, pemarkah, prompt, atau harness dan bukannya dengan melakukan kerja yang ingin diukur oleh evaluasi. Evaluasi GPT 5.4 oleh METR(dibuka dalam tetingkap baru) menunjukkan mengapa ini penting: walaupun model berjaya pada tugasan pada kadar yang pada pandangan pertama akan direkodkan sebagai horizon masa kira-kira 13 jam, semakan manusia menunjukkan bahawa sebahagian kejayaan itu datang daripada manipulasi ganjaran, dan menyemak semula keputusan untuk mengambil kira hanya kejadian tanpa manipulasi ganjaran menurunkan anggaran itu kepada kira-kira 6 jam. Penilai patut menilai keperluan untuk pelarasan sedemikian dan, apabila ia diperlukan, melaporkannya dengan jelas: anggaran keupayaan jauh lebih berguna apabila pembaca boleh melihat kejayaan yang kelihatan mana telah dibatalkan, mengapa ia dibatalkan, dan sejauh mana keputusan itu bergantung pada pertimbangan tersebut.

Keengganan
Model juga boleh berprestasi rendah dalam evaluasi keupayaan disebabkan perlindungan. Sesuatu model mungkin mempunyai prestasi evaluasi yang lebih rendah daripada keupayaan sebenarnya kerana ia enggan melaksanakan tugasan evaluasi dan bukannya menyiapkannya. Oleh itu, laporan patut menerangkan sama ada keengganan merupakan sebahagian daripada keputusan evaluasi dan jika ya, berapa banyak sampel yang terjejas kerananya.
Pencemaran
Pencemaran paling penting bagi penanda aras awam atau yang digunakan semula. Jika tugasan, jawapan, atau varian yang hampir sama muncul dalam data latihan atau boleh ditemui oleh ejen dengan pelayaran web, prestasi mungkin mencerminkan hafalan atau perolehan semula dan bukannya prestasi model. Penilai patut mengutamakan tugasan peribadi atau yang baru dibina jika boleh dan menguji sama ada model menghasilkan semula butiran khusus tugasan sebelum menyelesaikannya.
Masalah rosak
Masalah rosak termasuk situasi seperti masalah yang secara tidak sengaja tidak boleh diselesaikan. Masalah rosak cukup lazim(dibuka dalam tetingkap baru) sehingga ia patut dianggap sebagai risiko kesahihan standard. Ia termasuk kebenaran asas yang salah, prompt yang kabur, fail yang hilang, perkhidmatan yang tidak stabil, kriteria pemarkahan yang tidak adil, dan persekitaran yang mendedahkan jalan pintas seperti fail jawapan tersembunyi atau sejarah repositori yang mengandungi tampalan kebenaran asas.
Sandbagging
Sandbagging oleh model atau sistem bermaksud berprestasi rendah secara strategik apabila prestasi tinggi akan bercanggah dengan sesuatu objektif. Evaluasi GPT‑5.5 oleh Apollo(dibuka dalam tetingkap baru) menguji perkara ini dengan mewujudkan konteks di mana model memahami bahawa skor evaluasi yang tinggi mungkin mencetuskan unlearning atau menghalang penggunaan. GPT‑5.5 masih menjawab dengan betul, menunjukkan sedikit bukti tingkah laku tentang prestasi rendah secara strategik3. Tetapi semakan mereka terhadap jejak penaakulan menambah konteks penting: Apollo menemui tanda sederhana atau lebih tinggi tentang kesedaran evaluasi penjajaran dalam 52% sampel keadaan sandbagging, berbanding 0% dalam kontrafaktual. Bukti itu merumitkan tafsiran keputusan, tetapi akhirnya memberi lebih banyak isyarat kepada pembaca: pembaca boleh melihat kedua-dua keputusan tingkah laku yang meyakinkan dan sebab untuk berhati-hati agar tidak mentafsirnya secara berlebihan.
Dakwaan yang kukuh memerlukan kedua-duanya: harness yang betul untuk menonjolkan tingkah laku dan semakan kesahihan untuk menunjukkan bahawa keputusan itu kukuh. Pandangan kami bahawa harness dan semakan kesahihan ialah sebahagian daripada keputusan evaluasi membentuk cara kami menyokong evaluasi pihak ketiga dalam amalan:
- Kami berkongsi panduan elisitasi maksimum yang khusus dengan penilai.
- Kami meminta penilai keupayaan menggunakan Codex sebagai aras minimum bersama untuk model OpenAI: ujian sekurang-kurangnya patut menjalankan garis dasar melalui antara muka agentik yang sama yang mungkin diandalkan pengguna, dan bukannya hanya melalui antara muka model yang dipermudahkan.
- Kami juga menyediakan jejak penaakulan dan artifak perantaraan lain apabila ia diperlukan untuk menilai penipuan, sandbagging, atau kesedaran evaluasi. METR dan Apollo telah menggunakan akses ini dalam evaluasi OpenAI sejak GPT‑5.
- Akhir sekali, kami mengutamakan penyelidikan untuk memahami dengan lebih mendalam bila dan bagaimana pilihan harness mengubah keputusan secara material, daripada pengurusan konteks dan akses alat kepada tingkah laku percubaan semula, pemarkahan, dan bajet sumber.
Cadangan ini bertujuan bukan sahaja untuk menambah baik laporan evaluasi individu, tetapi juga untuk memaklumkan piawaian kebangsaan (dibuka dalam tetingkap baru)dan antarabangsa (dibuka dalam tetingkap baru)yang sedang muncul bagi evaluasi dan pelaporan AI frontier. Pada masa hadapan, piawaian evaluasi pihak ketiga patut memerlukan butiran yang mencukupi untuk pembuat keputusan memahami dakwaan yang disokong oleh evaluasi tertentu, sistem yang diuji, bagaimana keputusan itu ditonjolkan, dan bagaimana penilai memeriksa kesahihannya. Bagi sistem frontier yang diuji pada tugasan yang keupayaan agentik penting, butiran patut merangkumi (tertakluk pada sebarang kebimbangan keselamatan atau kerahsiaan):
- Dakwaan: sama ada evaluasi membandingkan sistem, menganggarkan siling keupayaan, atau menguji perlindungan.
- Kandungan evaluasi: butiran yang mencukupi tentang tugasan atau taburan tugasan supaya pembaca memahami kemahiran, tingkah laku, atau mod kegagalan yang sebenarnya diuji oleh evaluasi.
- Sistem yang diuji: model, tetapan penaakulan, akses alat, harness, dan perlindungan.
- Bajet: giliran, token, percubaan/percubaan semula, masa sebenar, kos inferens, dan jika berkenaan kos jangkaan bagi setiap penyelesaian yang berjaya.
- Kaedah elisitasi: pilihan harness yang digunakan untuk menonjolkan keputusan, dan sejauh mana apa yang diuji mencerminkan dakwaan lebih luas yang dibuat.
- Semakan kesahihan: bagaimana penilai mencari manipulasi ganjaran, kesedaran evaluasi, pencemaran, keengganan, sandbagging dan tingkah laku lain yang boleh menjejaskan keputusan, termasuk bagaimana kes yang disahkan mempengaruhi pemarkahan atau tafsiran.
Piawaian yang meninggalkan pilihan harness atau semakan kesahihan boleh meremehkan apa yang boleh dilakukan oleh sistem atau melebihkan keyakinan terhadap dakwaan keselamatan. Membina harness dan kaedah elisitasi yang kukuh kekal sebagai bidang penyelidikan terbuka dan patut menjadi fokus bagi penyiasatan dan pelaburan lanjut.
Penulis
Glosari
Oleh sebab kami menggunakan beberapa istilah teknikal dalam siaran ini, kami telah menyertakan glosari di bawah yang memberikan penjelasan dalam bahasa mudah tentang perkara yang kami maksudkan:
Sistem agentik: Sistem yang boleh melaksanakan tugasan melalui berbilang langkah, menggunakan alat, mengekalkan keadaan tugasan, dan bertindak dalam persekitaran, bukannya hanya memberikan satu respons kepada prompt.
Penilaian: Pertimbangan yang lebih luas tentang sama ada bukti menyokong sesuatu dakwaan, kesimpulan risiko, atau kedudukan jaminan yang mungkin berdasarkan data evaluasi, semakan dokumen, temu bual, semakan proses, dan artifak relevan lain.
Pemadatan: Kaedah untuk mengekalkan konteks yang relevan dengan tugasan semasa pelaksanaan yang panjang.
Konfigurasi: Sistem tepat yang diuji dan syarat evaluasi, melangkaui nama model.
Pencemaran: Apabila tugasan evaluasi, jawapan, atau varian yang hampir sama muncul dalam data latihan model atau boleh ditemui semasa evaluasi (contohnya, melalui alat seperti pelayaran web), menyebabkan prestasi melebihkan generalisasi sebenar model.
Elisitasi: Proses cuba menonjolkan keupayaan atau tingkah laku daripada sistem semasa penilaian.
Persekitaran: Tetapan tugasan tempat sesuatu sistem diuji. Ini termasuk perkara seperti keadaan luaran yang berinteraksi dengan ejen dan diubah suai semasa evaluasi, seperti persekitaran terminal atau permainan video.
Evaluasi: Ujian atau pengukuran tertentu dalam sesuatu penilaian.
Kesedaran evaluasi: Kesedaran evaluasi merujuk kepada model yang mengenali, atau kelihatan mengenali, bahawa ia sedang dinilai dan berpotensi melaraskan tingkah lakunya sebagai respons kepada konteks itu. Ini boleh kelihatan seperti model secara jelas menaakul tentang sedang diuji, membuat inferens tentang tujuan evaluasi, atau mengubah tingkah lakunya kerana ia menjangka hasilnya akan mempengaruhi cara ia dinilai atau digunakan.
Rangka kerja model: Struktur yang menghadap model yang membolehkan model melaksanakan tugasan: gesaan, alat, antara muka, logik kawalan, memori, percubaan semula, pengesah, dan struktur sokongan lain di sekeliling model.
Elisitasi maksimum: Ujian yang bertujuan mencari prestasi atau mod kegagalan paling kuat dan boleh dipercayai yang boleh dihasilkan sistem di bawah bajet yang ditetapkan, bukannya sekadar menjalankan sistem sekali melalui harness piawai.
Jejak penaakulan: Rekod penaakulan perantaraan model semasa ujian.
Manipulasi ganjaran: Mencapai skor tinggi melalui jalan pintas atau tingkah laku di luar niat penilai.
Perlindungan: Penapis, pemantau, sistem sekatan, dan perlindungan lain yang digunakan di sekeliling model atau produk.
Sandbagging: Prestasi rendah secara strategik dalam evaluasi dengan cara yang menjejaskan hasilnya.
Pemarkahan: Kaedah yang digunakan untuk menentukan bagaimana prestasi diukur atau sama ada tugasan berjaya.
Harness piawai: Harness yang dikekalkan sama merentas sistem dan bukannya disesuaikan untuk model atau tugasan tertentu, supaya perbezaan keputusan lebih mudah dikaitkan dengan model yang diuji.
Horizon masa: Tempoh tugasan yang boleh diselesaikan sistem dengan kebolehpercayaan tertentu, sering dinyatakan sebagai berapa lama tugasan yang sama akan mengambil masa bagi manusia.
Akses alat: Alat luaran yang tersedia kepada model semasa penilaian.
Trajektori: Laluan langkah demi langkah yang diikuti sistem semasa melaksanakan tugasan.
Jailbreak universal: Corak serangan tunggal yang menyebabkan sistem memintas perlindungan merentas banyak prompt atau tugasan.
Nota kaki
- 1
Siaran ini tidak cuba menyelesaikan bagaimana pihak ketiga patut menilai dakwaan berkaitan ketidakselarasan atau kecenderungan. Lebih banyak kerja diperlukan untuk memahami bagaimana pilihan harness mempengaruhi evaluasi tersebut, terutamanya kerana harness yang menyokong tingkah laku horizon lebih panjang juga boleh mengubah jenis tingkah laku tidak diingini yang perlu dipantau oleh penilai.
- 2
HAL(dibuka dalam tetingkap baru) memberikan satu lagi contoh daripada evaluasi ejen: pada CORE-Bench(dibuka dalam tetingkap baru), menukar harness kepada Claude Code mengubah kedua-dua prestasi yang diukur dan profil kos pada penanda aras yang sama. Contoh awam lain termasuk SWE-agent(dibuka dalam tetingkap baru), SeeAct(dibuka dalam tetingkap baru), ScienceAgentBench(dibuka dalam tetingkap baru), CORE-Bench(dibuka dalam tetingkap baru), dan Inspect Cyber(dibuka dalam tetingkap baru); setiap satu memberitahu pembaca antara muka atau harness yang menghasilkan skor tersebut.
- 3
Mencapai skor 100% pada kedua-dua varian Soal Jawab Sandbagging dan 99.6% pada tugasan sandbagging penipuan strategik.


