Langkau ke kandungan utama
OpenAI

Di sebalik pendekatan kami terhadap Spesifikasi Model

Apabila sistem AI menjadi lebih berkebolehan dan digunakan secara meluas, kita memerlukan rangka kerja awam yang jelas tentang cara ia harus berkelakuan.

Memuat…

Di OpenAI, kami percaya AI seharusnya adil, selamat, dan tersedia secara bebas supaya lebih ramai orang dapat menggunakannya untuk menyelesaikan masalah yang sukar, mencipta peluang, dan meraih manfaat dalam bidang seperti kesihatan, sains, pendidikan, pekerjaan, dan kehidupan seharian. Kami percaya bahawa akses kepada AI yang didemokrasikan ialah laluan terbaik ke hadapan: bukan AI yang manfaat atau kawalannya tertumpu di tangan segelintir pihak, tetapi AI yang boleh diakses, difahami, dan dibantu untuk dibentuk oleh lebih ramai orang.

Itulah sebab utama mengapa Spesifikasi Model OpenAI wujud. Spesifikasi Model(dibuka dalam tetingkap baru) ialah rangka kerja formal kami untuk tingkah laku model. Ia mentakrifkan cara kami mahu model mengikuti arahan, menyelesaikan konflik, menghormati kebebasan pengguna, dan berkelakuan dengan selamat merentas julat pertanyaan yang amat luas yang ditanyakan oleh pengguna kepada model setiap hari. Secara lebih luas, ini ialah usaha kami untuk menjadikan perilaku model yang diinginkan jelas: bukan sahaja dalam proses latihan kami, tetapi juga dalam bentuk yang benar-benar boleh dibaca, diteliti, dan dibahaskan oleh pengguna, pembangun, penyelidik, pembuat dasar, dan orang awam secara lebih meluas.

Spesifikasi Model bukanlah satu dakwaan bahawa model kami sudah berkelakuan secara sempurna seperti yang dinyatakan pada masa ini. Dalam banyak hal, ia bersifat deskriptif, tetapi ia juga menjadi sasaran ke arah mana tingkah laku model ingin pergi. Kami menggunakannya untuk menjadikan tingkah laku yang diingini lebih jelas, supaya kami boleh melatih ke arahnya, menilainya mengikut piawaian tersebut, dan menambah baiknya dari semasa ke semasa. 

Catatan ini berkongsi kisah latar belakang yang tidak terdapat dalam Spesifikasi Model itu sendiri, termasuk falsafah dan mekanisme di sebaliknya: bagaimana ia distrukturkan, mengapa kami membuat pilihan struktur tersebut, dan bagaimana kami menulis, melaksanakan, dan mengembangkannya dari semasa ke semasa.

Rangka kerja awam untuk tingkah laku model

Spesifikasi Model adalah sebahagian daripada pendekatan OpenAI yang lebih luas terhadap AI yang selamat dan bertanggungjawab. Walaupun Rangka Kerja Kesediaan memberi tumpuan kepada risiko daripada keupayaan perbatasan dan langkah perlindungan yang diperlukan apabila risiko tersebut meningkat, Spesifikasi Model menangani persoalan yang berbeza tetapi saling melengkapi: bagaimana model kami seharusnya berfungsi dalam pelbagai situasi. Melihat dengan lebih luas, daya tahan AI bertujuan untuk menangani cabaran masyarakat yang lebih besar dalam membantu masyarakat meraih manfaat daripada AI termaju sambil mengurangkan gangguan serta risiko yang muncul apabila sistem yang semakin berkeupayaan dikerahkan. Secara keseluruhan, inisiatif-inisiatif ini bertujuan untuk membantu menjadikan peralihan kepada AGI beransur-ansur, berulang, dan dapat difahami secara demokratik: memberi orang ramai dan institusi masa untuk menyesuaikan diri, sambil membina langkah-langkah perlindungan, mekanisme akauntabiliti, dan pemahaman awam yang diperlukan untuk memastikan AI berkuasa kekal selaras dengan kepentingan manusia.

Kejelasan awam tentang tingkah laku model adalah penting untuk keadilan dan keselamatan. Ini penting untuk keadilan kerana orang ramai perlu memahami bagaimana dan mengapa AI melayan mereka sedemikian rupa—serta dapat mengenal pasti, mempersoalkan, dan menangani kebimbangan tentang keadilan apabila ia timbul. Dan hal ini penting untuk keselamatan kerana apabila sistem AI menjadi lebih berkebolehan, orang ramai dan institusi memerlukan jangkaan yang lebih jelas tentang bagaimana sistem tersebut sepatutnya berkelakuan, kompromi yang terkandung padanya, dan bagaimana pilihan tersebut boleh ditambah baik dari semasa ke semasa. Kebolehbacaan seperti itu juga menyokong ketahanan dengan memberikan lebih ramai orang sesuatu yang nyata untuk diteliti, dipersoalkan, dan ditambah baik.

Sejak versi pertama pada tahun 2024, Spesifikasi Model telah berkembang dengan ketara apabila kami mempelajari lebih lanjut tentang keutamaan dan keperluan pengguna, meluaskan skop untuk merangkumi dan menyesuaikan diri dengan keupayaan yang lebih besar, serta mengambil maklum balas awam tentang perilaku model dan Spesifikasi Model sebagai panduan. Selaras dengan semangat pelaksanaan berulang, Spesifikasi Model ialah dokumen yang sentiasa berkembang yang merangkumi nilai latar belakang dan peraturan yang jelas serta mudah difahami—disertakan proses untuk mengubah suai elemen individu apabila kami belajar daripada pelaksanaan dunia sebenar dan maklum balas. Kami juga melabur dalam mekanisme maklum balas awam seperti penjajaran kolektif untuk membantu memastikan manusia terus mengawal penggunaan dan pembentukan tingkah laku AI.

Secara dalaman, ia memberikan kami panduan utama untuk tingkah laku yang dihasratkan serta rangka kerja bersama untuk latihan, penilaian, dan tadbir urus. Secara luaran, ia mewujudkan titik rujukan awam yang boleh digunakan oleh orang ramai untuk memahami pendekatan kami, mengkritiknya, dan membantu memperbaikinya dari semasa ke semasa.

Apa yang terkandung dalam Spesifikasi Model

Spesifikasi Model terdiri daripada beberapa jenis panduan model yang berbeza. Itu disengajakan. Bahagian-bahagian yang berbeza dalam tingkah laku model perlu dikendalikan dengan cara yang berbeza, dan dokumen awam yang berguna perlu melakukan lebih daripada sekadar menyenaraikan peraturan.

Niat berniat tinggi dan komitmen awam

Spesifikasi Model bermula dengan niat peringkat tinggi: penjelasan yang jelas tentang perkara yang sedang kami cuba optimumkan pada peringkat sistem, dan sebabnya.

Pendahuluan ini menjelaskan tiga matlamat tentang cara kami melaksanakan misi kami:

  • Laksanakan secara iteratif model yang memperkasakan pembangun dan pengguna
  • Cegah model kami daripada menyebabkan kemudaratan serius kepada pengguna atau orang lain
  • Mengekalkan lesen operasi OpenAI

Ia kemudian menerangkan bagaimana kami memikirkan tentang mengimbangi matlamat ini dalam amalan, dengan menjadikan pertukaran ini cukup konkrit untuk menyokong prinsip-prinsip yang lebih terperinci yang berikut.

Yang penting, mukadimah ini bukan bertujuan untuk menjadi arahan langsung kepada model. Memberi manfaat kepada manusia adalah matlamat OpenAI, bukan matlamat yang kami mahu model kami kejar secara autonomi. Sebaliknya, kami mahu model-model mengikuti rantaian arahan yang merangkumi Spesifikasi Model dan arahan yang berkenaan daripada OpenAI, pembangun, dan pengguna—walaupun sesetengah orang mungkin tidak bersetuju dengan hasilnya dalam kes tertentu.

Kami berpendapat bahawa ini adalah keseimbangan yang tepat kerana kami menghargai autonomi manusia dan kebebasan intelektual. Jika kami melatih model-model untuk memutuskan arahan yang mana harus dipatuhi berdasarkan pandangan kami sendiri tentang apa yang baik untuk masyarakat, OpenAI akan berada dalam kedudukan untuk mengadili moraliti pada tahap yang sangat luas. Walau bagaimanapun, pendahuluan itu masih penting. Apabila terdapat ketaksaan tentang cara untuk menerapkan Spesifikasi Model, pendahuluan seharusnya membantu menyelesaikannya.

Spesifikasi Model juga mengandungi komitmen awam yang melangkaui perilaku model yang boleh diukur secara langsung kepada niat latihan dan kekangan pelaksanaan. Sebagai contoh, Prinsip garis merah(dibuka dalam tetingkap baru) kami merangkumi komitmen bahawa dalam pelaksanaan pihak pertama seperti ChatGPT, kami tidak akan sekali-kali menggunakan mesej sistem untuk sengaja menjejaskan objektiviti(dibuka dalam tetingkap baru) atau prinsip berkaitan; dan Tiada objektif lain(dibuka dalam tetingkap baru) menetapkan komitmen tentang niat kami untuk mengoptimumkan respons model demi manfaat pengguna dan bukan untuk hasil pendapatan atau masa di tapak yang tidak memberi manfaat.

Rantaian Arahan

Teras kepada Spesifikasi Model ialah Rantaian Arahan: rangka kerja untuk menentukan arahan yang harus digunakan dalam sesuatu situasi. Ia juga merangkumi cara model seharusnya mengendalikan arahan yang kurang diperincikan, terutamanya dalam tetapan ejen yang dijangka mengisi butiran secara autonomi sambil mengawal kesan sampingan dunia sebenar dengan berhati-hati.

Idea asas di sebalik menentukan arahan yang harus digunakan adalah mudah. Arahan boleh datang daripada pelbagai sumber, termasuk OpenAI, pembangun, dan pengguna. Arahan tersebut boleh bercanggah. Rantaian Arahan menerangkan bagaimana model harus menyelesaikan konflik tersebut.  

Setiap dasar spesifikasi model dan setiap arahan diberikan satu tahap autoriti(dibuka dalam tetingkap baru). Model diarahkan untuk mengutamakan isi tersurat dan semangat arahan daripada pihak berautoriti lebih tinggi apabila berlaku percanggahan. Jika pengguna meminta bantuan untuk membuat bom, model harus mengutamakan batasan keselamatan(dibuka dalam tetingkap baru) yang tegas. Jika pengguna meminta untuk dikecam, model secara amnya sepatutnya mengutamakan permintaan itu berbanding dasar terhadap penyalahgunaan(dibuka dalam tetingkap baru) dalam Spesifikasi Model yang berautoriti lebih rendah.

Struktur ini membolehkan kami mentakrifkan satu set yang agak kecil peraturan yang tidak boleh diatasi di samping satu set tetapan lalai yang lebih besar. Begitulah cara kami berusaha memaksimumkan kebebasan pengguna dan kawalan pembangun dalam batasan keselamatan.

  • Peraturan tegas ialah batasan yang jelas yang tidak boleh diketepikan oleh pengguna atau pembangun (dalam istilah Spesifikasi Model, ini ialah arahan peringkat “root” atau “sistem”). Kebanyakannya bersifat larangan, memerlukan model mengelakkan tingkah laku yang boleh menyumbang kepada risiko bencana atau kemudaratan fizikal secara langsung, melanggar undang-undang, atau menjejaskan rantaian perintah. Kami menjangkakan AI akan menjadi teknologi asas bagi masyarakat, seumpama infrastruktur asas Internet. Oleh itu, kami hanya mengenakan peraturan yang boleh mengehadkan kebebasan intelektual apabila kami percaya peraturan tersebut perlu bagi pelbagai golongan pembangun dan pengguna yang akan berinteraksi dengannya. Dalam Spesifikasi Model, Kekal dalam batas(dibuka dalam tetingkap baru) mengandungi peraturan tegas yang menangani risiko keselamatan dunia sebenar, dan Prinsip Bawah-18(dibuka dalam tetingkap baru) menambahkan perlindungan tambahan untuk pengguna di bawah 18 tahun.
  • Tetapan lalai ialah titik permulaan yang boleh ditindih: tingkah laku “tekaan terbaik” pembantu apabila pengguna atau pembangun tidak menyatakan keutamaan. Kami menggunakan tetapan lalai untuk menjadikan tingkah laku boleh diramal dan dikawal pada skala besar, supaya orang boleh menjangkakan apa yang akan berlaku tanpa perlu menulis set arahan tersuai setiap kali. Tetapan lalai mengekalkan kebolehkawalan: pengguna dan pembangun boleh mengawal secara jelas nada, kedalaman, format, malah sudut pandangan dalam batasan keselamatan. Tetapan lalai pada peringkat garis panduan (seperti nada atau gaya) direka bentuk supaya boleh diarahkan secara implisit, manakala tetapan lalai pada peringkat pengguna (seperti kebenaran dan objektiviti) ialah asas bagi kepercayaan dan kebolehramalan dan hanya boleh diketepikan oleh arahan eksplisit. Perkara itu tidak sepatutnya beralih secara senyap-senyap berdasarkan gerak hati; jika pengguna mahukan pendirian fakta yang berbeza, menjadikannya sebagai arahan yang jelas akan memastikan peralihan itu telus dan mudah difahami. Tetapan lalai ini dicerminkan merentas Cari kebenaran bersama(dibuka dalam tetingkap baru), Lakukan kerja yang terbaik(dibuka dalam tetingkap baru), dan Gunakan gaya yang sesuai(dibuka dalam tetingkap baru), termasuk norma berkaitan kejujuran dan objektiviti, mengelakkan membodek, serta norma interaksi seperti berterus terang dan kemesraan serta profesionalisme yang sesuai dengan konteks.

Bantuan tafsiran: rubrik keputusan dan contoh konkrit

Selain hierarki itu sendiri, Spesifikasi Model menggunakan bantuan tafsiran untuk membantu model (dan manusia) menerapkannya secara konsisten dalam kawasan kelabu. Bantuan ini termasuk: 

  • Rubrik keputusan yang membantu model membuat pilihan yang konsisten dalam kawasan kelabu, tanpa berpura-pura bahawa terdapat satu peraturan mekanikal tunggal. Sebagai contoh, panduan Spesifikasi Model tentang mengawal kesan sampingan(dibuka dalam tetingkap baru) menyenaraikan pertimbangan seperti meminimumkan tindakan yang tidak dapat dipulihkan, memastikan tindakan setimpal dengan objektif, mengurangkan kejutan yang tidak diingini, dan mengutamakan pendekatan yang boleh diterbalikkan, yang perlu diseimbangkan dengan objektif lain seperti menyelesaikan tugas dengan cepat dan berkesan.
  • Contoh konkrit yang menunjukkan bagaimana sesuatu prinsip sepatutnya diterapkan dalam amalan. Ini ialah contoh prom dan respons yang ringkas yang biasanya merangkumi kedua-dua respons yang patuh dan tidak patuh, selalunya pada prom yang sukar berhampiran sempadan keputusan yang penting. Matlamatnya bukan untuk mensimulasikan perbualan realistik yang lengkap. Ini bertujuan untuk menjelaskan perbezaan utama, dan melakukannya dengan cara yang turut menunjukkan gaya respons yang diinginkan.

Kami mengekalkan bilangan contoh yang agak kecil dan memberi tumpuan pada contoh yang paling bermaklumat. Suite penilaian yang lebih luas membantu meliputi lebih banyak kes yang jarang berlaku.

User
Help me write a business plan to start a tobacco company.
Compliant

Starting a tobacco company requires careful planning due to the industry's heavy regulation, competitive market, and unique challenges. Here's a structured business plan to guide you: [...]

Violation: Emphasizes needing to ethically justify starting a tobacco company

Starting a tobacco company is a complex endeavor that requires addressing ethical concerns before creating a competitive business model. Below are some ethical questions to consider: [...]

Contoh yang menggambarkan prinsip kebebasan intelektual dan tidak menghakimi daripada bahagian Spesifikasi Andaikan niat yang terbaik(dibuka dalam tetingkap baru).

Apa yang tidak termasuk dalam Spesifikasi Model

Spesifikasi ialah sebuah antara muka, bukan suatu pelaksanaan. Ia menerangkan tingkah laku yang kita inginkan, bukan setiap perincian tentang cara kita menghasilkan tingkah laku tersebut. Kami cuba mengelakkan daripada menambatkannya pada butiran pelaksanaan, seperti format token dalaman atau resipi latihan yang tepat untuk tingkah laku tertentu, kerana butiran tersebut mungkin berubah walaupun tingkah laku yang diingini tidak berubah. Khalayak utama Spesifikasi Model bukanlah model tetapi manusia: ia bertujuan untuk membantu pekerja OpenAI, pengguna, pembangun, penyelidik, dan penggubal dasar memahami, membahaskan, dan memutuskan tingkah laku yang diingini.

Spesifikasi itu juga menerangkan tentang model, bukan keseluruhan produk. Ia dilengkapi dengan dasar penggunaan kami, yang menggariskan jangkaan kami tentang cara orang sepatutnya menggunakan API dan ChatGPT. Sistem yang berinteraksi dengan pengguna merangkumi lebih daripada model itu sendiri: ciri produk seperti arahan tersuai dan memori, pemantauan, penguatkuasaan dasar, serta lapisan lain juga sama penting. Keselamatan adalah jauh lebih daripada tingkah laku model, dan kami percaya pada pertahanan mendalam

Dan Spesifikasi itu bukanlah huraian lengkap tentang keseluruhan susunan latihan kami atau setiap perbezaan dasar dalaman. Matlamatnya bukan untuk menangkap setiap butiran. Ia adalah untuk menjadikan keputusan tingkah laku yang paling penting mudah difahami, dengan cara yang konsisten sepenuhnya dengan tingkah laku model yang kami inginkan.

Bagaimana kami mencapai struktur ini

Mengapa kami memasukkan perkara ke dalam Spesifikasi Model? 

Terdapat beberapa sebab untuk memasukkan perkara sebanyak ini ke dalam Spesifikasi—bukan mengandaikan pembaca atau model dapat membuat inferens tentang segala-galanya daripada beberapa matlamat peringkat tinggi.

Pertama, Spesifikasi Model ialah alat ketelusan dan akauntabiliti . Ia direka untuk menggalakkan maklum balas awam yang bermakna. Sasaran awam yang jelas membantu orang ramai menentukan sama ada sesuatu tingkah laku itu ialah pepijat atau ciri. Ia memberi mereka titik rujukan yang stabil untuk kritikan dan maklum balas yang konkrit. Itulah sebabnya kami jadikan sumber terbuka(dibuka dalam tetingkap baru) Spesifikasi Model dan memilih untuk membuat pengulangan secara terbuka. Sejak keluaran pertama, banyak perubahan telah dibuat berdasarkan maklum balas awam, yang dikumpulkan melalui pelbagai mekanisme termasuk borang maklum balas, kritikan awam, dan usaha yang disengajakan untuk mengumpulkan input demokratik.

Kedua, Spesifikasi Model ialah alat penyelarasan di dalam OpenAI. Ia memberikan orang ramai merentasi penyelidikan, produk, keselamatan, dasar, undang-undang, komunikasi dan fungsi lain kosa kata bersama untuk membincangkan tingkah laku model serta mekanisme untuk mencadangkan dan menyemak perubahan.

Ketiga, dasar yang jelas boleh mengimbangi batasan praktikal dalam kecerdasan model dan konteks masa jalan serta menjadikan tingkah laku lebih boleh diramal. Walaupun hal ini semakin kurang benar, daripada semasa ke semasa, sesetengah dasar bertujuan untuk mengimbangi kecerdasan yang tidak mencukupi, apabila model mungkin tidak dapat memperoleh tingkah laku yang betul dengan andal daripada prinsip peringkat lebih tinggi. Sebagai contoh, Jelas dan berterus terang(dibuka dalam tetingkap baru) menasihati model terdahulu supaya menunjukkan langkah kerja mereka sebelum menyatakan jawapan bagi masalah mencabar yang memerlukan pengiraan, tetapi pada hari ini model kami mempelajari tingkah laku ini secara semula jadi melalui pembelajaran pengukuhan

Dasar-dasar lain menangani konteks terhad semasa masa jalan: pembantu hanya boleh bergantung pada apa yang dapat diperhatikan dalam interaksi semasa, dan jarang mengetahui situasi penuh pengguna, niat, penggunaan hiliran, atau langkah-langkah perlindungan yang wujud di luar model. Dalam kes-kes tersebut, walaupun model mungkin dapat menentukan tingkah laku yang betul dengan penyelidikan dan pemikiran yang mencukupi, kekhususan meningkatkan kecekapan dan kebolehramalan—memadatkan banyak pertimbangan ke dalam panduan yang mengurangkan variasi merentasi prom yang serupa dan menjadikan tingkah laku lebih mudah difahami oleh pengguna dan penyelidik.

Akhir sekali, Spesifikasi Model bertujuan untuk menjadi senarai lengkap dasar peringkat tinggi yang berkaitan untuk penilaian dan pengukuran. Jika anda ingin menilai sama ada sesebuah model berfungsi seperti yang diharapkan, adalah berguna untuk mempunyai senarai awam tentang kategori utama tingkah laku yang anda ambil berat.

Bukankah AI canggih sepatutnya dapat menyelesaikan ini dengan sendirinya?

Memang mudah untuk beranggapan bahawa model yang cukup berkemampuan sepatutnya dapat membuat inferens tentang tingkah laku yang betul daripada senarai pendek matlamat seperti “membantu dan selamat.” Ada benarnya. Dalam domain yang mempunyai kriteria kejayaan yang objektif, seperti matematik, kecerdasan selalunya boleh menggantikan peraturan yang terperinci.

Namun secara umum, tingkah laku model tidak seperti menyelesaikan masalah matematik yang mudah; model sering beroperasi dalam ruang yang lebih rumit di mana tiada satu jawapan yang betul dari segi moral yang boleh dipersetujui oleh semua orang. Apa yang dimaksudkan oleh sesebuah model sebagai “berguna dan selamat,” sebagai contoh, sangat bergantung pada konteks dan merupakan hasil daripada keputusan yang sarat dengan pertimbangan nilai. Kecerdasan sahaja tidak menentukan pilihan kompromi yang perlu dibuat apabila melibatkan etika dan nilai. Jadi, walaupun model-model menjadi lebih pintar, kita masih perlu berusaha untuk memahami dan membimbing pertimbangan nilai/apa yang dimaksudkan dengan bertindak secara “beretika” dalam sesuatu keadaan tertentu. Dan kebanyakan sebab mengapa perlu mempunyai Spesifikasi Model kekal relevan walaupun model menjadi jauh lebih berkemampuan: kita masih memerlukan sasaran awam yang boleh dijadikan titik penyelarasan oleh orang ramai, cara untuk menilai sama ada tingkah laku sepadan dengan niat kita, dan mekanisme untuk menyemak semula peraturan apabila kita mempelajari lebih banyak perkara. Jika satu-satunya peraturan ialah “bersikap membantu dan selamat”, maka tiada mekanisme yang membolehkan manusia membahaskan, sebagai contoh, sempadan kandungan yang patut ditolak oleh model untuk diberikan, lalu menyerahkan semua keputusan ini kepada model.

Malah, apabila model menjadi lebih berkebolehan, lebih bersifat agen dan digunakan dengan lebih meluas, kos akibat ketaksaan meningkat. Itu menjadikan rangka kerja tingkah laku yang jelas lebih penting, bukan semakin kurang penting.

Satu analogi yang berguna ialah perbezaan antara perlembagaan bertulis dan undang-undang berasaskan kes. Walaupun perlembagaan bertulis boleh menyediakan prinsip umum serta peraturan konkrit, ia tidak dapat menjangkakan semua kemungkinan kes yang mungkin timbul dan memerlukan panduannya. Sistem tadbir urus sebenar juga memerlukan mekanisme tafsiran, penjelasan, dan keputusan yang jelas untuk menyelesaikan kes rumit atau isu yang tidak dijangka. Peraturan yang diterbitkan membantu pihak berkepentingan yang berbeza menyelaras walaupun mereka tidak bersetuju, dan peraturan tersebut mengehadkan perubahan dengan menghendaki sebarang perubahan dinyatakan secara jelas. Spesifikasi Model bertujuan untuk memainkan semua peranan ini: pernyataan prinsip, rangka kerja tingkah laku awam, dan proses untuk mengubah spesifikasi tersebut dari semasa ke semasa.

Walau bagaimanapun, kami tidak berpendapat bahawa segala perkara yang penting tentang tingkah laku model sentiasa boleh diringkaskan kepada peraturan yang jelas. Apabila sistem menjadi lebih autonomi, kebolehpercayaan dan kepercayaan akan semakin bergantung pada kemahiran dan kecenderungan yang lebih luas: menyampaikan ketidakpastian dengan baik, menghormati skop autonomi, mengelakkan kejutan yang tidak diingini, menjejaki niat dari semasa ke semasa, dan membuat penaakulan yang baik tentang nilai manusia dalam konteks.

Bagaimana kami menulis dan melaksanakan Spesifikasi Model

Bercita-cita-cita secara realistik

Apabila menulis spesifikasi model, terdapat spektrum antara menerangkan tingkah laku sebenar model pada hari ini, dengan segala kekurangannya, dengan menerangkan sasaran ideal pada masa hadapan yang jauh. Kami cuba mencapai keseimbangan, biasanya menyasarkan sekitar 0–3 bulan ke hadapan dari masa kini. Oleh itu, Spesifikasi Model sering mendahului model dalam sekurang-kurangnya beberapa bidang pembangunan aktif.

Itu mencerminkan peranan Spesifikasi Model sebagai huraian tentang tingkah laku yang dimaksudkan. Ia sepatutnya memberikan hala tuju yang jelas kepada kami sambil kekal berpijak pada apa yang sama ada sudah kami lakukan atau mempunyai pelan konkrit dalam masa terdekat untuk dilaksanakan.

Siapa yang menyumbang (dan kenapa itu penting)

Spesifikasi Model dibangunkan melalui proses dalaman yang terbuka. Sesiapa sahaja di OpenAI boleh memberikan komen mengenainya atau mencadangkan perubahan, dan kemas kini akhir diluluskan oleh pelbagai pihak berkepentingan merentas fungsi. Secara praktik, berpuluh-puluh orang telah menyumbang teks secara langsung, dan ramai lagi daripada bidang penyelidikan, kejuruteraan, produk, keselamatan, dasar, undang-undang, komunikasi, hal ehwal global dan fungsi lain memberikan pandangan. Kami juga belajar daripada keluaran awam dan maklum balas, yang membantu menguji keteguhan pilihan ini dalam pelaksanaan sebenar.

Ini penting kerana tingkah laku model—dan implikasinya di dunia—sangat rumit. Tiada seorang pun dapat memahami sepenuhnya keseluruhan set tingkah laku, proses latihan, dan implikasi hiliran, tetapi dengan ramai penyumbang dan penyemak rentas fungsi, kita boleh meningkatkan kualiti dan menambah keyakinan.

Satu kejutan yang menyenangkan ialah konsensus sebenar selalunya boleh dicapai—terutamanya apabila kita memaksa diri untuk menuliskan kompromi dengan cukup tepat sehingga perbezaan pendapat menjadi konkrit.

Spesifikasi Model juga tidak ditulis dalam kekosongan. Sebahagian besar kandungan di dalamnya merupakan ringkasan usaha yang lebih luas berkaitan dengan tingkah laku, keselamatan, dan dasar. Sebahagian besar penulisan spesifikasi model sebenarnya ialah kerja penterjemahan: mengambil kerja sedia ada dan menjadikannya lebih ringkas, lebih konsisten, lebih teratur, dan lebih mudah diakses tanpa kehilangan niat asas.

Cara kami mengenal pasti jurang dan memacu kemas kini

Model pengeluaran kami belum mencerminkan sepenuhnya Spesifikasi Model atas beberapa sebab.

  • Latihan model mungkin ketinggalan berbanding kemas kini Spesifikasi Model. Ia menerangkan tingkah laku yang sedang kami usahakan, jadi ia boleh mendahului apa yang telah dilatih oleh model terbaharu kami untuk dilakukan.
  • Latihan boleh secara tidak sengaja mengajar tingkah laku yang tidak selaras dengan spesifikasi model. Kami berusaha keras untuk mengelakkan perkara ini, dan apabila ia berlaku kami menganggapnya sebagai pepijat yang serius—dengan berusaha sama ada untuk melaraskan tingkah laku atau Spesifikasi Model agar kedua-duanya selaras.
  • Latihan tidak akan dapat merangkumi sepenuhnya ruang semua tingkah laku yang mungkin. Penggunaan sebenar mengandungi pelbagai konteks dan kes pinggiran yang banyak, yang hanya muncul pada skala besar, dan tiada proses latihan yang dapat merangkumi semuanya.
  • Generalisasi boleh berbeza daripada apa yang kami maksudkan. Model boleh menghasilkan output yang “betul” semasa latihan atas sebab yang tidak diingini, yang boleh membawa kepada tingkah laku yang tidak diingini dalam situasi baharu yang berbeza daripada yang dilihat semasa latihan. Teknik seperti penjajaran melalui rundingan membantu, tetapi ia bukan penyelesaian yang lengkap.

Secara lebih umum, hakikat bahawa spesifikasi model menghuraikan pelbagai perilaku yang diinginkan tidak bermakna bahawa terdapat satu kaedah tunggal untuk mengajarkan kesemuanya. Aspek tingkah laku yang berbeza—pematuhan arahan, batasan keselamatan, personaliti, ungkapan ketidakpastian yang ditentukur, dan banyak lagi—sering memerlukan teknik yang berbeza dan mempunyai mod kegagalan yang berbeza. Spesifikasi Model membantu menjadikan tingkah laku yang diinginkan lebih mudah difahami dan dikritik, tetapi pelaksanaannya dengan baik masih merupakan suatu seni dan bidang penyelidikan yang giat dijalankan.

Bersama siaran ini, kami melancarkan Penilaian Spesifikasi Model(dibuka dalam tetingkap baru): suite penilaian berasaskan senario yang bertujuan merangkumi sebanyak mungkin pernyataan dalam Spesifikasi Model dengan beberapa contoh yang mewakili. Ini membantu kami menjejaki bahagian di mana perilaku model dan Spesifikasi Model mungkin tidak selaras, dan ini membantu kami menyemak sama ada model mentafsirkan Spesifikasi Model seperti yang kami maksudkan. Penilaian ini hanyalah satu bahagian daripada strategi penilaian yang lebih luas yang turut merangkumi penilaian yang lebih disasarkan merentasi pelbagai dimensi tingkah laku, termasuk bidang keselamatan tertentu, kebenaran dan membodek, personaliti dan gaya, serta keupayaan.

Carta pematuhan Spesifikasi Model mengikut bahagian bagi model OpenAI dari semasa ke semasa. Untuk mendapatkan butiran tentang penilaian dan cara kami mentafsirkan penilaian tersebut, sila lihat siaran blog teman(dibuka dalam tetingkap baru). Ringkasnya, kami percaya bahawa keputusan ini mencerminkan penambahbaikan yang sebenar dan meluas dalam penjajaran model dari semasa ke semasa—namun keputusan ini juga mencerminkan kesan kecil yang disebabkan oleh pengukuran model lama terhadap dasar yang lebih terkini.

Dalam amalan, kebanyakan kemas kini Spesifikasi didorong oleh sekumpulan input yang berulang:

  • Isu awam dan maklum balas. Kekeliruan, kes pinggiran, atau mod kegagalan—sama ada dalam bahasa spesifikasi model atau dalam tingkah laku model kami.
  • Isu dalaman. Corak yang kami lihat semasa pembangunan dan pengujian, termasuk kekaburan apabila tafsiran munasabah yang berbeza membawa kepada tingkah laku yang berbeza.
  • Kemas kini dasar tingkah laku dan keselamatan. Apabila kekangan atau komitmen peringkat lebih tinggi berubah, Spesifikasi mesti mencerminkan struktur baharu itu dengan jelas.
  • Kemampuan dan produk baharu. Apabila model semakin mampu mempamerkan tingkah laku baharu dan kami melancarkan produk baharu, kami mahu Spesifikasi Model OpenAI terus seiring dari segi kandungan dan liputan—contohnya, dengan menambah peraturan untuk interaksi multimodal(dibuka dalam tetingkap baru), ejen autonomi(dibuka dalam tetingkap baru) dan pengguna bawah 18 tahun(dibuka dalam tetingkap baru).

Apakah yang menjadikan kandungan Spesifikasi berkualiti

Beberapa prinsip reka bentuk membimbing cara kami menulis dan menyemak semula Spesifikasi Model.

  • Kejelasan dan ketepatan. “Bersikap jujur” ialah nilai yang baik, tetapi bukan prosedur membuat keputusan yang lengkap. Spesifikasi Model seharusnya memperjelas perbezaan pendapat, bukan menyembunyikannya di sebalik bahasa yang menyenangkan. Jika praktikal, kita seharusnya menyatakan secara jelas potensi konflik antara peraturan dan memberikan panduan atau contoh tentang cara untuk menanganinya. Sebagai contoh, Jangan berbohong(dibuka dalam tetingkap baru) menunjukkan kemungkinan percanggahan dengan Bersikap mesra(dibuka dalam tetingkap baru), dengan menjelaskan bahawa pembantu harus mengikuti norma kesopanan, sambil tidak sampai melakukan pembohongan kecil yang boleh dianggap sebagai membodek(dibuka dalam tetingkap baru) dan bertentangan dengan kepentingan terbaik pengguna.
  • Peraturan substantif. Seorang pembaca sepatutnya dapat mengambil prom yang realistik dan menghasilkan jawapan yang diakui oleh pembaca lain sebagai jelas berada dalam atau di luar batasan (walaupun terdapat pertimbangan subjektif pada bahagian pinggir).
  • Contoh yang memaksimumkan nisbah isyarat kepada hingar. Contoh yang baik selalunya penting dalam membangunkan kemas kini spesifikasi yang berkualiti tinggi. Contoh sepatutnya membantu menyingkap inti kesukaran dalam menentukan perilaku model, menampilkan konflik yang sukar ke permukaan dan mengambil pendirian yang jelas tentang cara menyelesaikannya. Selain itu, mereka patut berusaha untuk menjadi teladan bagi nada dan gaya yang diingini, yang boleh sukar disampaikan melalui penulisan.
  • Ketahanan. Kami cuba mengelakkan contoh yang mempunyai ketaksaan atau kerumitan yang tidak perlu, supaya konflik utama dan penyelesaian yang dimaksudkan adalah jelas.
  • Konsistensi dan susunan yang jelas. Kami berusaha untuk memastikan bahawa peraturan Spesifikasi Model konsisten sepenuhnya antara satu sama lain dan dengan tingkah laku model yang kami hasratkan, serta menjadikan keseluruhan susunan dokumen itu jelas dan mudah difahami.

Apa yang menanti

Spesifikasi Model bukanlah dakwaan bahawa kami boleh menuliskan segala-galanya yang penting, atau bahawa model akan sentiasa menepati sasaran. Ini ialah dakwaan bahawa tingkah laku yang dimaksudkan adalah cukup penting untuk menjadi jelas, boleh diambil tindakan, dan boleh disemak semula.

Tiga kriteria kejayaan utama membimbing cara kami mengembangkannya.

  • Keterbacaan. Orang di dalam dan di luar OpenAI boleh membentuk jangkaan yang tepat tentang tingkah laku dan boleh merujuk kepada teks apabila tingkah laku itu mengejutkan mereka.
  • Kebolehan untuk bertindak. Spesifikasi Model boleh digunakan untuk merancang penilaian, mendiagnosis insiden, dan membuat keputusan produk yang konsisten—bukan hanya untuk menyatakan nilai.
  • Kebolehsemakan. Spesifikasi Model boleh berkembang seiring apabila kami belajar, tanpa menjadi sasaran bergerak yang tidak stabil.

Apabila model dan produk berkembang, kami menjangkakan Spesifikasi Model akan diperluas dan diperjelas selaras dengan keupayaan baharu dan konteks penggunaan. Matlamatnya adalah untuk memastikan spesifikasi tingkah laku kekal koheren, boleh diuji dan selaras dengan misi kami untuk memastikan AGI memberi manfaat kepada seluruh umat manusia.