Langkau ke kandungan utama
OpenAI

12 Mei 2026

Penyelidikan

Apa yang Parameter Golf ajarkan kepada kami

Pengajaran daripada 1,000+ peserta, 2,000+ penyerahan, dan cabaran pembelajaran mesin terbuka yang dibentuk oleh ejen pengekodan.

Memuat…

Kami melancarkan Parameter Golf untuk melibatkan dan menyokong komuniti penyelidikan pembelajaran mesin dalam meneroka masalah pembelajaran mesin baharu yang sangat terhad. Kami mahu cabaran ini cukup menarik untuk memberi ganjaran kepada kreativiti teknikal sebenar, sambil kekal ringkas dari segi konsep dan mudah disahkan.

Peserta perlu meminimumkan kerugian yang dipegang pada set data FineWeb tetap sambil kekal dalam had artifak 16 MB, termasuk kedua-dua pemberat model dan kod latihan, serta bajet latihan 10 minit pada 8×H100. Kami menyediakan garis dasar, set data dan skrip penilaian supaya peserta boleh mencapah repositori, menambah baik model, dan menghantar hasilnya melalui GitHub.

Sepanjang lapan minggu, kami menerima lebih daripada 2,000 penyerahan daripada lebih 1,000 peserta. Kami kagum dengan keluasan teknikal, kreativiti dan kecenderungan melentur peraturan dalam penyerahan, daripada pelarasan pengoptimuman dan kerja pengkuantuman yang teliti hingga idea pemodelan baharu dan latihan masa ujian.

Salah satu bahagian paling menarik dalam cabaran ini ialah melihat betapa meluasnya peserta menggunakan ejen pengekodan AI. Ejen membantu mengurangkan kos eksperimen, memudahkan lebih ramai orang untuk mengambil bahagian, dan mengubah rentak pertandingan. Ia juga mewujudkan cabaran baharu untuk semakan penyerahan, atribusi dan pemarkahan.

Cabaran ini juga menjadi saluran penemuan bakat yang bermakna bagi kami. Itu ialah salah satu matlamat kami untuk Parameter Golf, dan ia merupakan isyarat berguna bahawa cabaran teknikal terbuka boleh mendedahkan cita rasa pembelajaran mesin yang luar biasa dan ketekunan.

Dalam siaran ini, kami menonjolkan beberapa penyerahan yang kami anggap mengejutkan dan menarik, serta berkongsi apa yang kami pelajari daripada menjalankan pertandingan pengekodan pada era ejen AI yang berkuasa.

Tanggapan teknikal

Jejak rekod

Kami menilai dan menghasilkan semula secara bebas setiap penyerahan pada papan pendahulu jejak rekod, dan mengesahkan bahawa setiap penyerahan memecahkan rekod pada masa ia dihantar. Beberapa tema menonjol.

Pengoptimuman latihan

Beberapa hasil terkuat datang daripada pelarasan teliti komponen sedia ada.

Penyerahan Penyumbang Teknik Mengapa ia penting
#60@notapplicaDigabungkan kemenangan terdahulu daripada #50, #42, dan kemungkinan besar #39, kemudian membolehkan model yang lebih mendalam berfungsi dengan pereputan pemberat Muon, pemulaan pembenaman spektrum, penjadualan baki campuran dan penilaian susunan.Satu contoh kukuh tentang kerja papan pendahulu yang berdisiplin: mengenal pasti penambahbaikan sedia ada yang benar-benar penting dan menggabungkannya dengan kemas.

Pengkuantuman

Beberapa penyerahan benar-benar menumpukan pada pemampatan dan eksport.

Penyerahan Penyumbang Teknik Mengapa ia penting
#414@signalrushMenggunakan GPTQ-lite untuk mengkuantisasikan pemberat selepas latihan. penyerahan papan pendahulu pertama yang berjaya menggunakan GPTQ-lite, menghasilkan penilaian yang lebih baik.
#1060@dexhunterDibina berasaskan #634 oleh @raahilshah untuk berjaya menggunakan Hessian GPTQ penuh.Memperluas kerja pengkuantuman terdahulu kepada laluan pemampatan yang lebih kukuh.

Strategi masa ujian dan penilaian

Sesetengah penyerahan menolak sempadan antara penambahbaikan model dan strategi penilaian. Pendekatan ini sah di bawah peraturan, tetapi memerlukan semakan teliti daripada kami sebagai penganjur.

Penyerahan Penyumbang Teknik Mengapa ia penting
#77@samacquaDigunakan latihan pada masa ujian LoRA per dokumen yang mengutamakan skor: beri skor dahulu, sesuaikan hanya pada bahagian yang sudah diberi skor, dan tetapkan semula pada sempadan dokumen.Mencabar batas antara penambahbaikan model dan strategi penilaian sambil tetap boleh disemak mengikut peraturan.
#1019@abaybektursunDigunakan penentukuran GPTQ janaan sendiri: jana teks penentukuran daripada model yang dilatih, kemudian bina Hessian GPTQ daripada pengaktifan tersebut.Satu strategi penentukuran kreatif yang memerlukan semakan teliti daripada penganjur.

Idea pemodelan dan data baharu

Beberapa penyerahan memperkenalkan idea pemodelan atau data yang sangat kreatif.

Penyerahan Penyumbang Teknik Mengapa ia penting
#1729@romeerpMemperkenalkan tokenizer CaseOps: token operator penggunaan huruf besar tanpa kehilangan dengan perakaunan sidecar BPB bait asal.A idea tokenizer dan perwakilan data yang kreatif.
#265@unnirMemperkenalkan XSA, pendekatan Perhatian Kendiri Eksklusif separa yang cekap dengan paparan berkumpulan sedar GQA.Membawakan varian perhatian yang cekap ke dalam cabaran.
#65@aquariouseworkmanMemperkenalkan SmearGate dan BigramHash: gabungan pembenaman token sebelumnya yang dipelajari serta ciri cincang pasangan token bersebelahan.Ditambahkan mekanisme ciri baharu dari awal.
#1204@msisovicMemperkenalkan pengulangan kedalaman mini: lapisan 4 dan 5 diulang, pengulangan dilengahkan sehingga pertengahan latihan, dan memisahkan sebahagian MLP berulang tersebut.Baris papan pendahulu pertama yang diterima untuk membolehkan lapisan berulang berfungsi dengan berkesan.

Kami memilih untuk menonjolkan sembilan penyerahan ini kerana ia mewakili julat hasil yang kami harap cabaran ini akan tampilkan. Sesetengah peserta menemui kejayaan melalui pelarasan teliti. Yang lain menolak teknik pengkuantuman dan kedudukan rendah. Ada yang meneroka pinggir peraturan penilaian. Dan beberapa lagi memperkenalkan idea pemodelan atau data, daripada kesusasteraan atau dari awal, yang menghasilkan peningkatan yang tidak dijangka.

Jejak bukan rekod

Jejak bukan rekod menempatkan banyak penyerahan kreatif. Kami menonjolkan 15 kegemaran, termasuk pendekatan daripada pemodelan teks bukan autoregresif hingga pentokenan dinamik.

Disebabkan jejak ini lebih bersifat eksperimen, kami kurang menumpukan pada prestasi mentah dan lebih pada sama ada pendekatan itu menarik dari segi teknikal. Tiga penyerahan amat menonjol:

Ini ialah tiga penyerahan bukan rekod kegemaran kami, walaupun ia tidak semestinya tiga teratas dari segi prestasi.

Walau begitu, jejak bukan rekod masih kompetitif. Separuh daripada entri papan pendahulu bukan rekod mengatasi garis dasar naif 1.22 BPB, dan entri kedudukan teratas mencapai 1.12 BPB.

Kami mendapati ini menggalakkan. Walaupun berdepan garis dasar pengubah yang kuat, pendekatan alternatif kadangkala mampu menandingi seni bina dominan itu.

Kami juga berpendapat bahawa jejak ini mendapat manfaat khusus daripada ketersediaan ejen pengekodan yang kukuh. Ejen menjadikan prototaip idea spekulatif jauh lebih murah, termasuk pendekatan yang sebelum ini mungkin terasa terlalu memakan masa atau terlalu tidak pasti untuk dicuba dalam pertandingan singkat.

Pengajaran

Perbezaan besar antara Parameter Golf dan pertandingan terdahulu sepertinya ialah penggunaan meluas ejen pengekodan. Sebahagian besar penghantar penyerahan menyebut penggunaan ejen sebagai sebahagian daripada kerja mereka.

Itu mengurangkan halangan untuk masuk. Peserta dapat menyediakan eksperimen dengan lebih cepat, meneliti kod yang tidak dikenali, dan menguji idea dengan kurang halangan. Tajaan Runpod bernilai $1,000,000 dalam pengiraan juga memainkan peranan besar dalam menjadikan cabaran ini lebih mudah diakses oleh lebih ramai orang.

Pada masa yang sama, penggunaan ejen mewujudkan isu baharu untuk penyerahan dan pemarkahan. Banyak penyerahan hanyalah perubahan kecil pada pencapai skor tertinggi sedia ada, bukannya pendekatan yang benar-benar baharu. Ini selalunya berguna: idea kuat tersebar dengan cepat dan diperhalusi oleh orang lain. Tetapi ia juga mewujudkan hingar. Apabila penyerahan yang berada di luar garis panduan pertandingan menghasilkan skor yang luar biasa tinggi, ejen lain kadangkala menyalin idea tersebut dan meneruskan laluan tidak sah yang sama.

Jumlah penyerahan juga mengubah cara kami perlu menjalankan pertandingan. Kami tidak dapat memeriksa setiap penyerahan secara manual sambil memastikan papan pendahulu terus bergerak. Semasa cabaran, kami membangunkan bot triaj dalaman berasaskan Codex untuk memantau penyerahan baharu dan menandainya untuk semakan manusia. Ini menjadi sangat penting terutamanya ketika kami menerima ratusan penyerahan sehari.

Ejen AI juga menjadi sebahagian daripada komuniti sekitar cabaran ini. Untuk sebahagian besar pertandingan, @notapplica dan ejen pengekodan mereka menjalankan buletin “Kemas Kini Langsung”, menjejak peristiwa utama, menerangkan pendekatan papan pendahulu, dan membantu peserta lain mengikuti pertandingan. Alat semakan komuniti juga muncul untuk membantu peserta yang kurang berpengalaman menyemak sama ada penyerahan mereka mematuhi peraturan dan mengelakkan pendekatan tidak sah yang lazim.

Apa seterusnya?

Matlamat utama kami adalah untuk melancarkan cabaran yang boleh disertai oleh peserta yang layak(dibuka dalam tetingkap baru), sekali gus membolehkan mereka mengalami sendiri penyelidikan pembelajaran mesin. Parameter Golf menghimpunkan pelbagai penyerahan yang kuat dari segi teknikal dan kreatif, dan ia memberi kami gambaran yang lebih jelas tentang bagaimana pertandingan penyelidikan terbuka mungkin berubah apabila ejen AI menjadi lebih berkeupayaan dan digunakan secara meluas.

Kami sedang mempertimbangkan untuk melancarkan lebih banyak cabaran seperti ini pada masa hadapan. Jika anda berminat, sila isi borang peserta cabaran(dibuka dalam tetingkap baru).