Langkau ke kandungan utama
OpenAI

18 Februari 2026

PenyelidikanPenerbitan

Memperkenalkan EVMbench

Menjadikan kontrak pintar lebih selamat dengan menilai keupayaan ejen AI untuk mengesan, menampal, dan mengeksploitasi kelemahan dalam persekitaran rantaian blok.

Memuat…

Kontrak pintar secara rutin memperoleh lebih daripada $100B dalam aset kripto sumber terbuka. Apabila ejen AI semakin mahir dalam membaca, menulis, dan melaksanakan kod, adalah semakin penting untuk menilai keupayaannya dalam persekitaran yang bermakna dari segi ekonomi, serta menggalakkan penggunaan sistem AI secara defensif untuk mengaudit dan memperkukuh kontrak yang telah dilaksanakan.

Bersama Paradigm(dibuka dalam tetingkap baru), kami memperkenalkan EVMbench, satu penanda aras yang menilai keupayaan ejen AI untuk mengesan, membaiki dan mengeksploitasi kelemahan kontrak pintar yang berisiko tinggi. EVMbench menggunakan 117 kelemahan yang dipilih dengan teliti daripada 40 audit, dengan kebanyakannya diperoleh daripada pertandingan audit kod terbuka.  EVMbench turut merangkumi beberapa senario kerentanan yang diambil daripada proses pengauditan keselamatan untuk rantaian blok Tempo(dibuka dalam tetingkap baru), sebuah L1 yang direka khusus untuk membolehkan pembayaran berdaya pemprosesan tinggi dan berkos rendah melalui stablecoin. Senario ini meluaskan penanda aras ke dalam kod kontrak pintar berorientasikan pembayaran, di mana kami menjangkakan pembayaran stablecoin berasaskan ejen akan berkembang dan membantu mengasaskannya dalam domain yang semakin penting dari segi praktikal.

Untuk mencipta persekitaran tugas kami, kami menyesuaikan ujian eksploit bukti konsep dan skrip penggunaan yang sedia ada, apabila ia wujud, dan jika tidak, kami akan menulisnya secara manual. Untuk mod tampalan, kami memastikan bahawa kelemahan tersebut boleh dieksploitasi dan boleh dikurangkan tanpa memperkenalkan perubahan yang memecahkan kompilasi, yang akan menjejaskan persediaan kami. Untuk mod eksploitasi, kami menulis penggred tersuai dan menjalankan pasukan simulasi serangan terhadap persekitaran dalam usaha untuk mencari dan menampal kaedah yang membolehkan ejen menipu penggred. Selain kawalan kualiti tugas melalui kepakaran domain yang disediakan oleh Paradigm, kami menggunakan ejen pengauditan tugas automatik untuk membantu meningkatkan keteguhan persekitaran kami.

EVMbench menilai tiga mod keupayaan:

  • Kesan: Ejen mengaudit repositori kontrak pintar dan diberi skor berdasarkan ingatan semula kelemahan sebenar serta ganjaran audit yang berkaitan.
  • Tampalan: Ejen mengubah suai kontrak yang terdedah dan mesti mengekalkan fungsi yang dimaksudkan sambil menghapuskan keboleheksploitasian, yang disahkan melalui ujian automatik dan semakan eksploit.
  • Eksploitasi: Ejen melaksanakan serangan pengeringan dana dari hujung ke hujung terhadap kontrak yang digunakan dalam persekitaran rantaian blok persekitaran terasing, dengan penggredan dilakukan secara programatik melalui main semula transaksi dan pengesahan di atas rantaian.

Untuk menyokong penilaian yang objektif dan boleh diulang, kami membangunkan alat berasaskan Rust yang melaksanakan kontrak, memainkan semula transaksi ejen secara deterministik, dan mengehadkan kaedah RPC yang tidak selamat. Tugas eksploitasi dijalankan dalam persekitaran Anvil tempatan yang terasing dan bukannya pada rangkaian langsung, dan kerentanan adalah bersifat sejarah serta didokumenkan secara umum.

Kami menilai ejen perbatasan merentasi ketiga-tiga mod. Dalam mod ‘eksploitasi’, GPT‑5.3‑Codex dijalankan melalui Codex CLI dan mencapai skor 71.0%. Ini mewakili peningkatan yang ketara berbanding model-model sebelumnya, seperti GPT‑5, yang mendapat markah 33.3% dan dilancarkan lebih daripada enam bulan yang lalu. Kadar kejayaan pengesanan, panggil balik, dan tampalan kekal di bawah liputan penuh, kerana sebahagian besar kelemahan masih sukar untuk dicari dan dibaiki oleh ejen.

EVMbench juga mendedahkan perbezaan menarik dalam tingkah laku model merentasi pelbagai tugas. Ejen berprestasi paling baik dalam tetapan eksploitasi, di mana objektifnya jelas: teruskan lelaran sehingga dana habis. Sebaliknya, prestasi lebih lemah dalam tugas mengesan dan menampal. Dalam ‘kesan’, ejen kadangkala berhenti selepas mengenal pasti satu isu sahaja dan bukannya mengaudit pangkalan kod secara menyeluruh. Dalam ‘tampalan’, mengekalkan kefungsian penuh sambil menghapuskan kelemahan halus tetap mencabar.

Had

EVMbench tidak sepenuhnya mewakili kesukaran keselamatan kontrak pintar dunia sebenar. Kerentanan yang disertakan diambil daripada pertandingan audit Code4rena. Walaupun ini realistik dan berketerukan tinggi, banyak kontrak kripto yang digunakan secara meluas menjalani penelitian yang jauh lebih mendalam dan mungkin lebih sukar untuk dieksploitasi.

Sistem penggredan kami kukuh tetapi tidak sempurna. Dalam mod ‘kesan’, kami menyemak sama ada ejen dapat mengesan kerentanan yang sama seperti yang dikenal pasti oleh juruaudit manusia. Jika ejen mengenal pasti isu tambahan, kami pada masa ini tidak mempunyai cara yang boleh dipercayai untuk menentukan sama ada ia mewakili kelemahan sebenar yang terlepas pandang oleh manusia atau positif palsu.

Terdapat juga batasan struktur dalam tetapan ‘eksploitasi’. Transaksi diulang secara berurutan dalam bekas penggredan, jadi tingkah laku yang bergantung pada mekanik masa yang tepat adalah di luar skop. Keadaan rantaian adalah instans Anvil tempatan yang bersih dan bukannya fork mainnet, dan pada masa ini kami hanya menyokong persekitaran rantaian tunggal. Dalam beberapa kes, ini memerlukan kontrak olok-olok dan bukannya penyebaran mainnet.

Mengapa ini penting

Kontrak pintar melindungi aset bernilai berbilion dolar, dan ejen AI berkemungkinan akan menjadi transformasi besar bagi kedua-dua penyerang dan pembela. Mengukur keupayaan model dalam domain ini membantu menjejaki risiko siber yang sedang muncul dan menekankan kepentingan menggunakan sistem AI secara defensif untuk mengaudit dan memperkukuh kontrak yang telah dikerahkan.

EVMbench bertujuan sebagai alat pengukuran dan juga sebagai panggilan untuk bertindak. Apabila ejen bertambah baik, menjadi semakin penting bagi pembangun dan penyelidik keselamatan untuk menggabungkan audit berbantukan AI ke dalam aliran kerja mereka.

Sejak beberapa bulan kebelakangan ini, kami telah melihat peningkatan prestasi model yang ketara dalam tugas keselamatan siber, memberi manfaat kepada kedua-dua pembangun dan profesional keselamatan. Secara selari, kami telah menyediakan langkah-langkah keselamatan siber yang diperkukuh untuk menyokong penggunaan pertahanan dan ketahanan ekosistem yang lebih luas.

Oleh kerana keselamatan siber secara semula jadi bersifat penggunaan dwi, kami mengambil pendekatan berasaskan bukti dan berulang yang mempercepatkan keupayaan pertahanan untuk mencari dan membaiki kelemahan sambil memperlahankan penyalahgunaan. Langkah-langkah mitigasi kami termasuk latihan keselamatan, pemantauan automatik, akses yang dipercayai untuk keupayaan lanjutan, dan saluran penguatkuasaan yang merangkumi perisikan ancaman.

Kami melabur dalam perlindungan ekosistem seperti memperluas beta peribadi Aardvark, ejen penyelidikan keselamatan kami, dan bekerjasama dengan penyelenggara sumber terbuka untuk menyediakan pengimbasan pangkalan kod percuma bagi projek yang digunakan secara meluas.

Berdasarkan Program Geran Keselamatan Siber kami yang dilancarkan pada 2023, kami juga komited untuk menyediakan $10 juta dalam kredit API bagi mempercepatkan pertahanan siber dengan model kami yang paling berkemampuan, terutamanya untuk perisian sumber terbuka dan sistem infrastruktur kritikal. Organisasi yang terlibat dalam penyelidikan keselamatan dengan niat baik boleh memohon kredit API dan sokongan melalui Program Geran Keselamatan Siber kami.

Kami melancarkan tugas, alat, dan kerangka penilaian EVMbench untuk menyokong penyelidikan berterusan dalam mengukur dan mengurus keupayaan siber AI yang sedang berkembang.