Langkau ke kandungan utama
OpenAI

5 September 2025

PenyelidikanPenerbitan

Mengapa model bahasa berhalusinasi

Imej abstrak dengan kecerunan warna biru kehijauan, biru, dan lavender yang menyapu, bercantum secara menyerong merentasi bingkai dalam coretan lembut dan mengalir.
Memuat…

Di OpenAI, kami berusaha keras untuk menjadikan sistem AI lebih berguna dan boleh dipercayai. Walaupun model bahasa menjadi semakin berkebolehan, satu cabaran tetap sukar untuk diselesaikan sepenuhnya: halusinasi. Dengan ini kami maksudkan situasi di mana model dengan yakin menjana jawapan yang tidak benar. Kertas penyelidikan baharu(dibuka dalam tetingkap baru) kami menunjukkan bahawa model bahasa berhalusinasi kerana prosedur latihan dan penilaian standard memberi ganjaran kepada meneka berbanding mengakui ketidakpastian.

ChatGPT juga berhalusinasi. GPT‑5 mempunyai halusinasi yang jauh lebih sedikit terutamanya apabila membuat penaakulan, tetapi ia masih berlaku. Halusinasi kekal sebagai cabaran asas untuk semua model bahasa besar, tetapi kami berusaha keras untuk mengurangkannya lagi.

Apakah itu halusinasi?

Halusinasi adalah kenyataan yang munasabah tetapi palsu yang dijana oleh model bahasa. Ia boleh muncul dengan cara yang mengejutkan, walaupun untuk soalan yang nampaknya mudah. Sebagai contoh, apabila kami bertanya kepada chatbot yang digunakan secara meluas untuk tajuk disertasi PhD oleh Adam Tauman Kalai (salah seorang pengarang kertas ini), ia dengan yakin memberikan tiga jawapan berbeza—tiada satu pun yang betul. Bila kami tanya hari lahirnya, ia memberikan tiga tarikh berbeza, semuanya juga salah. 

Mengajar untuk peperiksaan

Halusinasi berterusan sebahagiannya kerana kaedah penilaian semasa menetapkan insentif yang salah. Walaupun penilaian itu sendiri tidak secara langsung menyebabkan halusinasi, kebanyakan penilaian mengukur prestasi model dengan cara yang menggalakkan meneka daripada kejujuran tentang ketidakpastian.

Fikirkan ia seperti ujian aneka pilihan. Kalau anda tidak tahu jawapannya tetapi cuba meneka secara rambang, anda mungkin bernasib baik dan betul. Membiarkannya kosong menjami mendapat sifar. Dengan cara yang sama, apabila model dinilai hanya berdasarkan ketepatan, peratusan soalan yang dijawab dengan tepat, ia digalakkan untuk meneka daripada mengatakan "Saya tidak tahu".

Sebagai contoh lain, bayangkan model bahasa diminta memberikan hari lahir seseorang tetapi tidak mengetahuinya. Jika ia meneka "10 September," ia mempunyai peluang 1-dalam-365 untuk betul. Mengatakan “Saya tidak tahu” menjamin mata sifar. Sepanjang ribuan soalan ujian, model meneka akhirnya kelihatan lebih baik pada papan skor berbanding model berhati-hati yang mengakui ketidakpastian.

Untuk soalan di mana terdapat satu “jawapan yang betul”, seseorang boleh mempertimbangkan tiga kategori jawapan: jawapan tepat, ralat, dan berkecuali di mana model tidak membuat tekaan. Berkecuali adalah sebahagian daripada kerendahan hati, salah satu nilai teras OpenAI. Kebanyakan papan skor mengutamakan dan menyusun model berdasarkan ketepatan, tetapi ralat lebih buruk daripada tidak membuat pilihan. Spesifikasi Model(dibuka dalam tetingkap baru) kami menyatakan bahawa lebih baik untuk menunjukkan ketidakpastian atau meminta penjelasan daripada memberikan maklumat yang yakin tetapi mungkin tidak betul. 

Sebagai contoh konkrit, pertimbangkan penilaian SimpleQA sebagai contoh daripada Kad Sistem GPT5(dibuka dalam tetingkap baru).

Metrik

gpt-5-thinking-mini

OpenAI o4-mini

Kadar berkecuali
(tiada jawapan khusus diberikan) 

52%

1%

Kadar ketepatan
(jawapan betul, lebih tinggi lebih baik)

22%

24%

Kadar ralat
(jawapan salah, lebih rendah lebih baik)

26%

75%

Jumlah

100%

100%

Dari segi ketepatan, model OpenAI o4-mini yang lebih lama berprestasi sedikit lebih baik. Namun, kadar ralatnya (iaitu, kadar halusinasi) adalah jauh lebih tinggi. Meneka secara strategik apabila tidak pasti meningkatkan ketepatan tetapi meningkatkan ralat dan halusinasi. 

Apabila memuratakan hasil merentas berdozen penilaian, kebanyakan penanda aras memilih metrik ketepatan, tetapi ini melibatkan dikotomi palsu antara betul dan salah. Dalam penilaian yang mudah seperti SimpleQA, sesetengah model mencapai ketepatan hampir 100% dan dengan itu menghapuskan halusinasi. Walau bagaimanapun, dalam penilaian yang lebih mencabar dan penggunaan sebenar, ketepatan dihadkan di bawah 100% kerana terdapat sesetengah soalan yang jawapannya tidak dapat ditentukan atas pelbagai sebab seperti maklumat yang tidak tersedia, keupayaan berfikir terhad model kecil, atau kekaburan yang perlu dijelaskan.

Walau bagaimanapun, papan skor yang hanya menekankan ketepatan sahaja menguasai papan pendahulu dan kad model, mendorong pembangun untuk membina model yang meneka daripada menahan diri. Itu merupakan satu sebab mengapa, walaupun model semakin maju, ia masih boleh berhalusinasi, dengan yakin memberikan jawapan yang salah dan bukannya mengakui ketidakpastian.

Cara yang lebih baik untuk menggred penilaian

Ada penyelesaian yang mudah. Hukum ralat yang yakin lebih daripada anda menghukum ketidakpastian, dan beri kredit separa untuk ungkapan ketidakpastian yang sesuai. Idea ini bukan baharu. Sesetengah ujian piawai telah lama menggunakan versi penandaan negatif untuk jawapan yang salah atau kredit separa bagi membiarkan soalan kosong untuk mengelakkan tekaan rambang. Beberapa kumpulan penyelidikan juga telah meneroka penilaian yang mengambil kira ketidakpastian dan penentukuran.

Pandangan kita berbeza. Tidak mencukupi untuk menambah beberapa ujian sedar ketidakpastian di sisi. Penilaian berasaskan ketepatan yang digunakan secara meluas perlu dikemas kini supaya pemarkahannya tidak menggalakkan meneka. Jika papan skor utama terus memberi ganjaran kepada tekaan bertuah, model akan terus belajar meneka. Memperbaiki papan skor boleh meluaskan penggunaan teknik pengurangan halusinasi, sama ada yang baru dibangunkan atau yang berasal dari penyelidikan terdahulu.

Bagaimana halusinasi terhasil daripada ramalan perkataan seterusnya

Kita telah bercakap tentang mengapa halusinasi sangat sukar untuk disingkirkan, tetapi dari mana datangnya ketidaktepatan fakta yang sangat khusus ini? Lagipun, model pralatihan besar jarang menunjukkan jenis ralat lain seperti kesalahan ejaan dan kurungan yang tidak sepadan. Perbezaannya berkaitan dengan jenis corak yang terdapat dalam data.

Model bahasa mula-mula belajar melalui pralatihan, iaitu proses meramal perkataan seterusnya dalam sejumlah besar teks. Tidak seperti masalah pembelajaran mesin tradisional, tiada label “benar/salah” dilampirkan pada setiap kenyataan. Model ini hanya melihat contoh positif bahasa fasih dan perlu menghampiri taburan keseluruhan. 

Memang dua kali ganda sukar untuk membezakan pernyataan yang sah daripada yang tidak sah apabila anda tidak mempunyai sebarang contoh yang dilabelkan sebagai tidak sah. Tetapi walaupun dengan label, sesetengah ralat tidak dapat dielakkan. Untuk melihat kenapa, pertimbangkan analogi yang lebih mudah. Dalam pengecaman imej, jika berjuta-juta foto kucing dan anjing dilabelkan sebagai “kucing” atau “anjing”, algoritma boleh belajar untuk mengelaskannya dengan tepat. Tetapi bayangkan melabelkan setiap foto haiwan peliharaan mengikut hari lahirnya. Oleh kerana hari lahir pada dasarnya rawak, tugas ini akan sentiasa menghasilkan ralat, tidak kira betapa majunya algoritma tersebut.

Prinsip yang sama terpakai dalam pralatihan. Ejaan dan tanda kurungan mengikuti pola yang konsisten, jadi kesalahan di sana hilang dengan skala. Tetapi fakta frekuensi rendah yang sewenang-wenangnya, seperti hari lahir haiwan peliharaan, tidak boleh diramalkan daripada corak sahaja dan oleh itu membawa kepada halusinasi. Analisis kami menerangkan jenis halusinasi yang mungkin timbul daripada ramalan perkataan seterusnya. Sebaik-baiknya, peringkat seterusnya selepas pra-latihan perlu mengeluarkannya, tetapi ini tidak berjaya sepenuhnya atas sebab yang diterangkan dalam bahagian sebelumnya. 

Kesimpulan

Kami berharap lensa statistik dalam kertas kerja kami dapat menjelaskan sifat halusinasi dan menolak salah tanggapan biasa kembali:

  • Dakwaan: Halusinasi akan dihapuskan dengan meningkatkan ketepatan kerana model yang 100% tepat tidak pernah berhalusinasi.
    Dapatan:
    Ketepatan tidak akan mencapai 100% kerana, tanpa mengira saiz model, keupayaan carian dan penaakulan, sesetengah soalan dunia sebenar sememangnya tidak dapat dijawab. 
  • Dakwaan: Halusinasi tidak dapat dielakkan.
    Dapatan:
    Bukan, kerana model bahasa boleh menahan diri apabila tidak pasti.
  • Dakwaan: Mengelakkan halusinasi memerlukan tahap kecerdasan yang hanya boleh dicapai dengan model yang lebih besar.
    Dapatan:
    Adalah lebih mudah bagi model kecil untuk mengetahui hadnya. Sebagai contoh, apabila diminta untuk menjawab soalan Māori, model kecil yang tidak tahu Māori hanya boleh berkata "Saya tidak tahu" manakala model yang tahu sedikit Māori perlu menentukan keyakinannya. Seperti yang dibincangkan dalam makalah, “dikalibrasi” memerlukan pengiraan yang jauh lebih sedikit berbanding dengan menjadi tepat.
  • Dakwaan: Halusinasi adalah gangguan misteri dalam model bahasa moden.
    Dapatan:
    Kami memahami mekanisme statistik yang menyebabkan halusinasi timbul dan diberi ganjaran dalam penilaian.
  • Dakwaan: Untuk mengukur halusinasi, kita hanya memerlukan penilaian halusinasi yang baik.
    Dapatan:
    Penilaian halusinasi telah diterbitkan. Walau bagaimanapun, penilaian halusinasi yang baik mempunyai sedikit kesan terhadap ratusan penilaian berasaskan ketepatan tradisional yang menghukum kerendahan hati dan memberi ganjaran kepada tekaan. Sebaliknya, semua metrik penilaian utama perlu diolah semula untuk memberi ganjaran kepada ungkapan ketidakpastian.

Model terbaharu kami mempunyai kadar halusinasi yang lebih rendah, dan kami terus bekerja keras untuk mengurangkan lagi kadar output ralat yakin oleh model bahasa kami.

Penyumbang pengumuman

Adam Kalai, Santosh Vempala (Georgia Tech), Ofir Nachum, Eddie Zhang, David Robinson, Saachi Jain, Eric Mitchell, Alex Beutel, Johannes Heidecke