Langkau ke kandungan utama
OpenAI

Dua tetapan yang menggandakan tiga kali skor kami pada penanda aras ARC-AGI-3

Memuat…

Video dipercepat yang menunjukkan GPT‑5.6 Sol cuba menyelesaikan teka-teki dalam penanda aras ARC-AGI-3 menggunakan harnes rasmi (kiri) dan harnes Responses API kami (kanan), yang mengekalkan penaakulan dan mendayakan pemadatan. Pada papan kedudukan untuk permainan ini(dibuka dalam tetingkap baru), tiada model termaju yang menyelesaikan mana-mana tahap selepas tahap pertama. Dengan harnes kami, GPT‑5.6 Sol menyelesaikan kesemua enam tahap.

Apabila mula-mula melihat skor rendah GPT‑5.6 Sol dalam penanda aras ARC-AGI-3(dibuka dalam tetingkap baru), kami berasa hairan.

GPT‑5.6 Sol telah menyelesaikan masalah terbuka matematik yang sekian lama tidak terungkai, seperti konjektur litupan kitaran berganda(dibuka dalam tetingkap baru), serta menamatkan permainan seperti Pokémon FireRed. Namun, dalam ARC-AGI-3, penanda aras permainan teka-teki 2D, GPT‑5.6 Sol hanya mencatat skor 7.8%, manakala GPT‑5.5 hampir langsung tidak dapat bermain, dengan skor sekadar 0.4%.

Adakah permainan teka-teki 2D luar biasa sukar bagi model kami? Atau ada perkara lain yang berlaku?

Penanda aras jarang mengukur model AI secara berasingan. Penanda aras turut mengukur pilihan yang kurang ketara tentang tetapan API, reka bentuk harnes dan pemberian gesaan. Bagi ARC-AGI-3, kami mendapati bahawa menghidupkan dua tetapan API yang digunakan dalam ChatGPT dan Codex—pengekalan penaakulan dan pemadatan—menggandakan skor sebanyak tiga kali dan mengurangkan token output sebanyak enam kali pada set tugasan awam.

Dengan harnes rasmi, GPT‑5.6 Sol mencatat skor 13.3% pada set awam ARC-AGI-3. Dengan penaakulan yang dikekalkan dan pemadatan, skornya ialah 38.3%. Skor mengukur Kecekapan Tindakan Manusia Relatif (RHAE(dibuka dalam tetingkap baru))metrik yang membandingkan prestasi model dengan garis dasar manusia. Berdasarkan log permainan rasmi(dibuka dalam tetingkap baru), kami menganggarkan purata skor penguji manusia ialah 48%. Model tidak diberitahu cara pemarkahan akan dibuat dan tidak dapat melihat skornya sepanjang prosestindakan hanya mengembalikan gambaran teks bagi setiap bingkai dan tahapnya.

ARC-AGI-3

ARC-AGI-3 ialah penanda aras yang direka untuk mengukur sejauh mana ejen AI belajar dan menaakul. Ejen meneroka permainan 2D yang tidak dikenali dan menyimpulkan cara permainan itu berfungsi tanpa arahan yang jelas. Anda boleh bermain 25 permainan demo di arcprize.org/tasks(dibuka dalam tetingkap baru).

ARC-AGI-3 menggunakan harnes generik secara sengaja, tanpa alat atau ciri khas. Rasional ARC ialah harnes yang ringkas menjadikan kelemahan model lebih ketara dan perbandingan antara model lebih adil. Sebaliknya, pembangun komersial mengoptimumkan harnes mengikut ciri dan keunikan setiap model.

Dalam permainan, GPT‑5.6 Sol telah menamatkan Pokémon FireRed dengan harnes penglihatan sahaja (seperti yang distrim oleh GPT_Plays_Pokemon(dibuka dalam tetingkap baru)), menamatkan Slay the Spire menggunakan komputer melalui Codex (seperti yang distrim oleh EpochAI(dibuka dalam tetingkap baru)), dan melepasi peringkat awal Baba Is You (seperti yang dikongsikan oleh Piotr Migdał & Piotr Grabowski(dibuka dalam tetingkap baru)). Apakah yang begitu berbeza tentang ARC-AGI-3?

GPT-5.6 Sol dalam Codex menyelesaikan cabaran harian rawak dalam Slay the Spire 2.

Ethan Mollick menunjukkan(dibuka dalam tetingkap baru) GPT‑5.6 Sol dalam Codex menewaskan cabaran harian rawak dalam Slay the Spire 2, permainan yang dikeluarkan selepas tarikh tamat pengetahuan GPT‑5.6 Sol.

Dengan mengambil inspirasi daripada analisis ARC tentang kelemahan GPT‑5.5(dibuka dalam tetingkap baru), kami meneliti beberapa percubaan GPT‑5.6 Sol. Seperti ARC, kami mendapati bahawa model itu kelihatan kurang pintar. Model itu mengambil masa yang lama bagi setiap tindakan dan sukar mencapai kemajuan.

Namun, selepas meneliti dengan lebih mendalam, kami mendapati sebahagian besar kekeliruan model bukanlah kelemahan dalaman model itu sendiri, sebaliknya berpunca daripada tetapan harnes.

Pertama, kami menyedari bahawa selepas setiap tindakan permainan, semua penaakulan peribadi dibuang. Ini bermakna bagi setiap tindakan, GPT‑5.6 Sol perlu memahami semula permainan dari awal tanpa dapat mengingati pemikirannya yang terdahulu. Model masih dapat melihat rekod langkah terdahulu dan nota ringkas yang disertakan, tetapi tidak dapat melihat rancangan, pemahaman atau pemikiran yang membawa kepada langkah tersebut.

Kedua, kami mendapati bahawa harnes menggunakan tetingkap pemangkasan bergulir, menyebabkan tindakan lama tidak lagi kelihatan apabila sejarah semakin panjang. Jadi, GPT‑5.6 Sol bukan sahaja tidak dapat mengingati pemikirannya yang terdahulu, malah turut kehilangan ingatan tentang tindakan sebelumnya.

Gabungan dua ciri harnes ini—membuang penaakulan dan pemangkasan bergulir—membantu menjelaskan sebab GPT‑5.6 Sol sukar belajar dari semasa ke semasa.

Ejen menunjukkan prestasi terbaik apabila ia mengingati tindakannya

Model kami dilatih untuk berfikir melalui mesej penaakulan peribadi sebelum menghasilkan balasan atau panggilan alat. Mesej pemikiran peribadi ini dikekalkan sebagai sebahagian daripada sejarah perbualan. Jika perbualan menjadi terlalu panjang, kami meringkaskannya lalu meneruskan perbualan.

Rajah yang menunjukkan cara penaakulan model, panggilan alat, sejarah perbualan dan pemadatan konteks berfungsi bersama sepanjang tugasan yang berjalan lama.

Beginilah model kami dilatih dan turut digunakan dalam ChatGPT dan Codex. Untuk menyesuaikannya dengan lebih baik kepada persediaan pengeluaran kami, kami melaksanakan harnes ARC-AGI-3 menggunakan Responses API(dibuka dalam tetingkap baru) kami. API kami memudahkan pengurusan konteks: bagi GPT‑5.6, penghantaran ID respons sebelumnya mengekalkan penaakulan secara automatik merentas panggilan alat dan giliran perbualan.

Apabila penaakulan dikekalkan, kami melihat dua perubahan besar. Pertama, GPT‑5.6 Sol kurang meluangkan masa berfikir sebelum setiap tindakan kerana tidak lagi perlu mentafsir permainan dari awal pada setiap giliran. Kedua, apabila dapat mengingati pemikiran terdahulu, GPT‑5.6 Sol jauh lebih berupaya belajar dari semasa ke semasa dan menggunakan strategi yang koheren.

Peningkatan seterusnya dicapai dengan menggantikan pemangkasan bergulir dengan pemadatan(dibuka dalam tetingkap baru), satu lagi tetapan dalam Responses API.

Harnes ARC-AGI-3 menangani had konteks melalui pemangkasan bergulir. Apabila konteks perbualan melebihi 175,000 aksara, mesej paling lama akan dibuang.

Pemangkasan bergulir mempunyai dua kelemahan. Pertama, model kehilangan pemerhatian dan tindakan terdahulu. Kedua, model melaksanakan sebahagian besar tugasan dengan tetingkap konteks yang lebih penuh, yang boleh menjejaskan sedikit prestasi.

Apabila kami mendayakan pemadatan pada ARC-AGI-3, GPT‑5.6 Sol lebih berupaya mengekalkan perkara yang telah dipelajarinya tentang setiap permainan sepanjang sesi yang lebih panjang, lalu mencapai skor lebih tinggi dengan token output yang lagi sedikit.

Untuk menggambarkan kesan pengekalan penaakulan dan pemadatan, berikut ialah animasi yang menunjukkan tetingkap konteks 175K GPT‑5.6 Sol apabila ia menyelesaikan beberapa teka-teki ARC-AGI-3 dengan setiap harnes.

Dua lajur tengah menggambarkan cara setiap harnes menggunakan tetingkap konteks model secara berbeza. Dengan ingatan yang lebih baik tentang tindakannya yang terdahulu, GPT‑5.6 Sol kurang berfikir bagi setiap tindakan dan bergerak jauh lebih pantas. Nota: pelaksanaan kami menggunakan had 175,000 token dan bukannya aksara, tetapi hasilnya agak serupa kerana sebahagian besar teks terdiri daripada grid tindakan yang ditokenkan oleh penoken kami pada nisbah 1:1.

Secara bersama, pengekalan penaakulan dan pemadatan membolehkan GPT‑5.6 Sol (Max) mencapai kira-kira tiga kali ganda skor dengan token output enam kali lagi sedikit.

Kesimpulan dan saranan

Kami berharap eksperimen ini menjadi peringatan bahawa penilaian jarang mengukur model secara berasingan—penilaian turut mengukur gabungan pilihan yang kurang ketara tentang tetapan API, reka bentuk harnes dan pemberian gesaan. Ini bukan kali pertama kami terkejut dengan skor rendah pada penanda aras awam, sebelum mendapati bahawa sistem pelaksana penilaian menggunakan harnes generik yang menggugurkan mesej penaakulan.

Jika anda pembangun API yang mahu memaksimumkan prestasi, kami syorkan anda menggunakan tetapan yang sama seperti dalam produk kami sendiri:

  • Gunakan Responses API kami, bukan API Pelengkapan Sembang legasi kami
  • Kekalkan penaakulan
  • Gunakan pemadatan

Jika anda membandingkan model, kami syorkan anda menggunakan penilaian dengan tetapan di atas, yang paling sepadan dengan penggunaan sebenar dalam ChatGPT dan Codex.

Kami berterima kasih kepada ARC atas usaha kreatif mereka selama bertahun-tahun dalam penilaian AGI, serta analisis mereka yang mendorong kami untuk menelitinya dengan lebih mendalam.

Jika anda mahu menguji keupayaan sendiri berbanding model termaju, cuba permainan awam tersebut di arcprize.org/tasks(dibuka dalam tetingkap baru).

Penulis

Ilan Bigio, Ted Sanders