Langkau ke kandungan utama
OpenAI

Alat baharu untuk memahami AI dan hasil pembelajaran

Memajukan cara impak AI diukur merentas persekitaran pembelajaran

Pendidikan adalah salah satu bidang AI yang paling berpotensi. Dengan alat seperti ChatGPT, sokongan pembelajaran yang diperibadikan boleh tersedia kepada mana-mana pelajar, di mana-mana sahaja, pada bila-bila masa. 

Namun sektor pendidikan masih di peringkat awal dalam memahami impak AI terhadap hasil pembelajaran. Tahun lalu, pasukan kami memulakan kajian tentang penggunaan alat seperti mod belajar dan mendapati peningkatan yang memberangsangkan dalam prestasi pelajar. Tetapi penyelidikan kami juga telah menimbulkan persoalan penting: bagaimanakah kami boleh menilai cara AI mempengaruhi kemajuan seseorang pelajar dari semasa ke semasa, bukan hanya pada peperiksaan akhir?

Ini adalah cabaran ekosistem yang lebih luas. Sehingga kini, kebanyakan kaedah penyelidikan menumpukan pada isyarat prestasi yang sempit—seperti skor ujian—dan tidak mempunyai keupayaan untuk menilai bagaimana pelajar sebenarnya belajar dengan AI dalam persekitaran dunia sebenar, dan bagaimana penggunaan itu membentuk hasil dari semasa ke semasa. 

Untuk menangani jurang ini, kami membangunkan Learning Outcomes Measurement Suite, iaitu rangka kerja yang dicipta bersama University of Tartu di Estonia dan Inisiatif SCALE di Accelerator for Learning di Stanford University untuk menyokong pengukuran longitudinal hasil pembelajaran merentas konteks pendidikan yang berbeza. 

Pengesahan menyeluruh sedang dijalankan melalui percubaan terkawal rawak, dan penyelidikan lanjut dirancang bersama organisasi pengasas di Learning Lab, ekosistem penyelidikan pembelajaran OpenAI, termasuk penyelidik dari Arizona State University, UCL Knowledge Lab, dan MIT Media Lab (berdasarkan kajian kolaboratif terdahulu).

Hari ini, kami berkongsi gambaran keseluruhan tentang bagaimana suite pengukuran berfungsi dan kenapa ia penting. Dari semasa ke semasa, kami berhasrat untuk menerbitkan lebih banyak penyelidikan dan mengeluarkan set pengukuran sebagai sumber awam untuk sekolah, universiti, dan sistem pendidikan di seluruh dunia.

“Penyelidikan ini membolehkan kami belajar dengan cepat sambil meletakkan asas untuk pemahaman yang lebih mendalam tentang bagaimana AI boleh diintegrasikan secara berhemah ke dalam sekolah dengan cara yang benar-benar penting.” Kami ingin memahami bagaimana alat-alat ini dapat menyokong pembelajaran akademik yang ketat sambil juga memupuk pemikiran aras tinggi, kreativiti, rasa ingin tahu, dan keyakinan pelajar terhadap diri mereka sendiri sebagai pelajar.”
–Susanna Loeb, Profesor Pendidikan dan Pengarah Fakulti, Inisiatif SCALE di Stanford University

Ringkasan perkara penting

  • Kaedah penyelidikan hari ini mengenai kesan AI terhadap pembelajaran menunjukkan isyarat yang memberangsangkan tentang prestasi, tetapi tidak menangkap gambaran penuh tentang bagaimana AI mempengaruhi hasil pembelajaran dari semasa ke semasa.
  • The Learning Outcomes Measurement Suite akan, buat pertama kalinya, menyediakan rangka kerja standard untuk kajian longitudinal yang membantu pendidik, penyelidik, dan institusi memahami bagaimana AI membentuk pembelajaran dan hasil pembelajaran merentasi konteks yang berbeza.
  • Makmal Pembelajaran OpenAI ialah ekosistem penyelidikan baharu yang memberi tumpuan kepada memajukan kerja ini. OpenAI akan menerbitkan penemuan bersama pelbagai rakan kongsi apabila bidang ini terus berkembang.

Asal usul dan penyelidikan awal

Apabila pelajar menggunakan alat AI untuk belajar dan menimba ilmu, ia boleh membawa maksud yang berbeza-beza—daripada mendapatkan jawapan pantas daripada AI hinggalah menggunakannya untuk menyelesaikan masalah langkah demi langkah dengan panduan seperti tutor. Untuk menggalakkan pengguna berinteraksi dengan ChatGPT dengan cara yang menyokong pemahaman yang lebih mendalam dan pembangunan kemahiran, OpenAI memperkenalkan mod belajar tahun lalu.  Di bawah hud, mod belajar dikuasakan oleh arahan sistem tersuai yang kami tulis dengan kerjasama guru, saintis, dan pakar pedagogi untuk mencerminkan satu set tingkah laku teras yang menyokong pembelajaran sebenar, bukan sekadar jawapan—dengan menggunakan perancah, semakan kefahaman, dan latihan berpandu.

Untuk menguji sama ada gaya interaksi AI yang sejajar dengan pedagogi seperti ini diterjemahkan kepada hasil pembelajaran yang lebih baik, kami menjalankan kajian rawak dengan lebih 300 pelajar kolej yang sedang membuat persediaan untuk peperiksaan neurosains dan mikroekonomi. Walaupun analisis masih sedang dijalankan, keputusan awal memberi kami keyakinan bahawa gaya interaksi AI yang sejajar dengan pedagogi, yang digalakkan melalui ciri-ciri seperti mod belajar, boleh meningkatkan hasil pembelajaran. Namun, penyelidikan ini juga menonjolkan satu realiti penting: apa yang benar-benar penting ialah sama ada peningkatan dan tingkah laku produktif yang berkaitan kekal dari semasa ke semasa.

Reka bentuk kajian

Peserta ditugaskan kepada salah satu daripada tiga kumpulan: satu kumpulan kawalan belajar menggunakan sumber dalam talian tradisional seperti Google Search dan YouTube, dengan ciri gambaran keseluruhan yang dijana AI dinyahdayakan, manakala dua kumpulan tambahan diberikan akses kepada salah satu daripada dua varian Mod Belajar yang direka untuk membimbing pelajar melalui proses pembelajaran dengan cara yang sedikit berbeza. Kuiz asas dan tinjauan suai tugas dikumpulkan lebih awal untuk melaraskan perbezaan dalam pendedahan kerja kursus terdahulu, tabiat belajar, keyakinan akademik, dan kebiasaan dengan alat AI. Pelajar melengkapkan sesi Mod Belajar bermasa sebelum setiap peperiksaan, dengan dua varian Mod Belajar diimbangi merentas subjek.

Persediaan ini direka untuk mencerminkan keadaan kajian dunia sebenar dan bukannya persekitaran makmal yang dikawal ketat. Penyertaan tidak dikaitkan dengan prestasi peperiksaan, dan tidak semua pelajar menggunakan Mod Belajar pada tahap yang sama semasa sesi nominal 40 minit. Ini membolehkan kami mengukur dan melaporkan kesan intention-to-treat (ITT), iaitu impak apabila diberikan akses kepada alat tersebut di bawah keadaan pelaksanaan yang realistik—dengan kata lain, impak sebab-akibat apabila ditawarkan Mod Belajar, dengan mengakui bahawa penglibatan boleh berbeza dalam amalan.

Penemuan

Kami mengukur prestasi pada setiap peperiksaan secara berasingan. Dalam kajian rawak kami, penambahbaikan tidak seragam merentas subjek, dan tahap penglibatan dengan Mod Belajar berbeza-beza merentas peserta. 

  • Neurosains (ITT utama): Kami memerhatikan perbezaan positif dari segi arah bagi mod belajar berbanding kawalan, tetapi keputusan tidak dapat dibezakan daripada pelajar yang belajar menggunakan sumber dalam talian tradisional. Beberapa isu pengenalan dan teknikal menjejaskan masa yang dihabiskan untuk belajar dalam kalangan pelajar yang menggunakan mod belajar. 
  • Mikroekonomi (primary ITT): Kami memerhatikan peningkatan yang ketara dalam prestasi peperiksaan dalam kalangan pelajar yang diberikan akses kepada Mod Belajar berbanding kumpulan kawalan tanpa AI—kira-kira 15% skor lebih tinggi secara relatif.

Mod belajar (varian A & B) vs kawalan (tiada kumpulan AI): Skor peperiksaan min terlaras

Kesan tersebut kekal konsisten apabila kami membandingkan setiap varian Mod Belajar secara berasingan dengan kawalan.

Walaupun ini mencerminkan variasi dunia sebenar, ia menonjolkan batasan yang lebih mendalam dalam cara hasil pembelajaran biasanya diukur.

Kebanyakan pendekatan penilaian sedia ada bergantung pada intervensi tetap yang dinilai dalam jangka masa yang singkat, menggunakan hasil seperti skor ujian atau esei akhir sebagai isyarat utama. Kaedah-kaedah ini tidak direka untuk menangkap mekanisme teras yang melaluinya AI mempengaruhi pembelajaran dalam amalan: interaksi berterusan yang diperibadikan yang berkembang seiring dengan strategi, keutamaan, dan tabiat belajar pelajar sendiri. Mereka juga tidak mendedahkan sama ada penambahbaikan dalam satu keupayaan, seperti ingatan jangka pendek, mungkin datang bersama pertukaran dalam yang lain, seperti ketekunan, motivasi autonomi, atau penyelesaian masalah kreatif. Akibatnya, mereka terlepas kesan kognitif longitudinal yang akhirnya menentukan sama ada AI benar-benar meningkatkan pembelajaran. 

Oleh sebab persekitaran pembelajaran berbeza-beza dengan ketara merentasi negara, kurikulum, dan matlamat institusi, hasil daripada kajian sekali sahaja jarang dapat digeneralisasikan merentasi sistem. Oleh itu, pendekatan pengukuran mestilah cukup fleksibel untuk sistem pendidikan yang berbeza menentukan bagaimana kejayaan kelihatan dalam konteks mereka, menilai AI mengikut piawaian mereka sendiri, dan mengulangi proses tersebut dengan sewajarnya.

Membina sistem pengukuran yang lebih baik 

Berdasarkan pembelajaran daripada penyelidikan mod belajar OpenAI, kami telah membina sistem pengukuran berstruktur untuk mengukur impak AI terhadap pelajar pada skala besar, dan mewujudkan mekanisme untuk menambah baik model berdasarkan hasil tersebut. Ia berasaskan tiga isyarat—bagaimana model berkelakuan, bagaimana pelajar memberi respons, dan hasil kognitif yang boleh diukur yang terhasil dari masa ke masa. Ia termasuk: 

  • Arahan sistem untuk memperhalusi tingkah laku model: penggunaan bahasa semula jadi untuk mengubah tingkah laku lalai model agar lebih selaras dengan pendekatan pedagogi tertentu.
  • Pengelas interaksi pembelajaran: ini secara automatik mengesan “detik pembelajaran” dalam interaksi pelajar–model yang sebenar, telah dinyahkenal pasti, dan melabelkan ciri-ciri penting seperti penglibatan dan pembetulan ralat.
  • Penggred kualiti pembelajaran: ini menilai dan memberi markah setiap detik pembelajaran tersebut berdasarkan sama ada pelajar mencapai objektif mereka dan tahap sejauh mana interaksi itu mengikuti prinsip pedagogi yang kukuh, termasuk pengenalpastian mod kegagalan.
  • Penilai pembelajaran longitudinal: ini menjejaki perubahan dalam interaksi pelajar yang sama dengan model dari semasa ke semasa—termasuk penglibatan, ketekunan, dan strategi metakognitif—pada peringkat individu dan kohort.
  • Ukuran kognitif dan metakognitif yang diseragamkan: ini ialah instrumen pihak ketiga yang disahkan yang disampaikan melalui akses ChatGPT pra/semasa/selepas untuk menetapkan garis asas dan mengukur perubahan dalam keupayaan asas seperti pemikiran kritikal, kreativiti, dan ingatan.

Apabila digabungkan, kami merujuk kepada sistem pengukuran ini sebagai Learning Outcomes Measurement Suite. 

Ia menghasilkan isyarat penting yang boleh digunakan oleh ekosistem pendidikan: paparan berstruktur bagi detik pembelajaran, papan pemuka yang menunjukkan bagaimana hasil berubah dari semasa ke semasa merentas kohort, penunjuk prestasi model berbanding rubrik pengajaran dan tunjuk ajar, serta ukuran hasil yang sejajar dengan penilaian standard dan soal selidik pelajar ringkas. Jika tersedia, ia boleh menggabungkan kebenaran asas yang disediakan oleh rakan kongsi seperti markah peperiksaan, pemerhatian bilik darjah, atau kehadiran.

 Rajah yang menggambarkan aliran kerja pengukuran hasil pembelajaran di mana AI memproses data melalui langkah analisis, penilaian, dan pengesahan sebelum menyampaikan dapatan untuk menyokong pelajar.

Semua data dinyahidentifikasi

Ini juga membolehkan rakan kongsi kami memahami impak kognitif yang lebih mendalam daripada penggunaan AI untuk pembelajaran dari semasa ke semasa, kerana melalui sistem ini kami juga dapat menjejaki impak terhadap keupayaan seperti:

  • Motivasi Autonomi: tahap sejauh mana pelajar membentuk pembelajaran mereka sendiri berbanding diarahkan oleh model 
  • Penglibatan Produktif: kekerapan, kepelbagaian dan kualiti interaksi pedagogi
  • Ketekunan Tugasan: tahap sejauh mana seorang pelajar kekal dan terus berusaha menempuh cabaran kognitif
  • Metakognisi: kekerapan dan kualiti usaha pelajar untuk merancang, membuat refleksi, dan memantau pendekatan mereka terhadap pembelajaran
  • Ingat semula: ketepatan yang menunjukkan sejauh mana seorang pelajar boleh mengingati kandungan daripada interaksi sebelumnya

Ini mencerminkan usaha keseluruhan kami untuk tidak sekadar menumpukan pada takrifan sempit hasil pembelajaran (markah ujian meningkat), tetapi keupayaan holistik yang mendasari pembelajaran. Ia juga mencerminkan kepercayaan kami bahawa tidak akan ada penyelesaian ajaib dari segi apa yang perlu dioptimumkan untuk: sistem dan para pendidik perlu diperkasakan untuk membimbing pertukaran selaras dengan amalan terbaik pedagogi dan pendekatan.

Ke mana kita akan pergi dari sini

Kami sedang mengesahkan Learning Outcomes Measurement Suite melalui kajian berskala besar sebelum menjadikannya tersedia dengan lebih meluas. Kerja ini sedang dijalankan bersama University of Tartu dan Inisiatif SCALE Stanford merentas rakan kongsi berskala negara seperti Estonia, di mana set pengukuran sedang dikaji dengan hampir 20,000 pelajar berumur 16-18 tahun selama beberapa bulan. Penggunaan oleh pelajar akan berlaku dengan kerjasama rapat bersama pemimpin tempatan, untuk memastikan keselamatan dan keselarasan dengan kurikulum tempatan.

“Estonia sentiasa mendekati pendidikan bukan sebagai sesuatu yang statik tetapi sebagai satu sistem yang kami terus menambah baik. Dengan AI menjadi sebahagian daripada gambaran itu, persoalan besar ialah bagaimana kita mengukur impak jangka panjang AI terhadap pembelajaran. Itulah yang kami sedang cuba fahami dengan kerjasama OpenAI. Pelajar berminat untuk terlibat dalam proses pembangunan, dan ramai yang ingin belajar bagaimana untuk memberikan sokongan kepada pembelajaran dengan AI. Ia terasa seperti satu titik perubahan yang sebenar, dan kami teruja untuk menyumbangkan kaedah yang boleh digunakan semula dan dibangunkan oleh sistem pendidikan lain.”
–Jaan Aru, Profesor Madya di Institut Sains Komputer, Universiti Tartu

Kerja ini berasaskan badan penyelidikan kolaboratif yang lebih luas yang sedang dijalankan. Selain daripada penyelidikan hasil pembelajaran yang dijalankan melalui rakan kongsi pengasas di Learning Lab, OpenAI menyokong kajian di persimpangan pembelajaran dan tenaga kerja—meneliti bagaimana AI membentuk laluan akademik pelajar, keputusan kerjaya, dan cara institusi boleh menyokong penerimaan yang bertanggungjawab. Penyelidikan ini sedang dijalankan di seluruh Bocconi University, Innova Schools dan Tuck School of Business at Dartmouth, San Diego State University, Stony Brook University, dan lain-lain.

Semasa kami menjalankan kajian jangka panjang tentang cara pelajar belajar dengan terbaik menggunakan AI, kami berhasrat untuk berkongsi penemuan dan bekerjasama dengan ekosistem pendidikan yang lebih luas untuk memastikan AI memberi manfaat kepada pelajar di mana-mana sahaja.

Bagi yang berminat untuk menerima kemas kini mengenai kerja ini, boleh mendaftar di sini.