Загварын үл нийцлийг мэдээлэх манай тогтолцоо
OpenAI-д гарсан загварын үл нийцлийн тохиолдлыг бүртгэх, шалгах, ил болгох шинэ тогтолцоог бид танилцуулж байна. Үүний хамт сүүлийн зургаан сард ажигласан загварын санаандгүй эсвэл анхаарал татахуйц зан төлөвийн зургаан тайланг нийтэлж байна.
Өмнө нь судлаачид, хиймэл оюун хөгжүүлэгчид, бодлого боловсруулагчид болон олон нийтэд илүү сайн мэдээлэл хүргэхийн тулд үл нийцлийн талаарх өөрсдийн судалгааны үр дүнг нийтэд мэдээлэхийг зорьж ирсэн. Гэвч эдгээр үр дүнг тайлагнах системтэй арга барилгүй байсан тул бид тохиолдол бүрд өөрөөр хандаж, хүссэнээсээ цөөн удаа мэдээлж ирсэн. Бид хэд хэдэн тохиолдлыг нэг тайланд нэгтгэх хүртэл хүлээх эсвэл шинээр гаргасан загварын системийн картанд нэмэх нь элбэг байв. Энэхүү шинэ тогтолцоо нь тайлагнаж буй зан төлөвөө бүрэн тайлбарлаж эсвэл бууруулж амжаагүй байсан ч ажигласны дараа үл нийцлийн тайланг шуурхай нийтлэхэд чиглэнэ.
Хиймэл оюуны системүүд улам боловсронгуй болж, өргөн хүрээнд ашиглагдах тусам нийцлийн судалгааны ахицын талаар илүү өргөн хүрээтэй, бодит мэдээлэлд тулгуурласан нэгдсэн ойлголт бүрдүүлэх шаардлагатай. Хиймэл оюуны салбар нийцэл ба хяналтын асуудлыг хамгийн өндөр хурдаар хариуцлагатай өргөжүүлсээр байхад хангалттай хэмжээнд шийдсэн гэж бид үзэхгүй байна. Ирэх сар, жилүүдэд хиймэл оюуны хөгжлийг хэрхэн үргэлжлүүлэх тухай шийдвэрүүд нь хил хязгаар загвар бүтээдэг компаниудаас гадуурх хүмүүс өөрсдөө нягталж болох нотолгоонд тулгуурлах ёстой.
Үл нийцлийн жишээнүүд нь бусад хиймэл оюун хөгжүүлэгчийн систем ижил чадавхад хүрэх үед тулгарч болох асуудлыг тодорхойлох, хамгаалалтын сул талыг илрүүлэх эсвэл загварын зан төлөвийн талаарх таамгийг эргэлзээнд оруулахад тустай. Эдгээр үр дүнг хуваалцсанаар бусад тал ижил асуудлыг судалж, бидний тайлбарыг шалган, эрсдэлийг бууруулах арга хэмжээг сайжруулах боломжтой. Үл нийцлийн талаарх ил тод байдал үнэ цэнтэй гэж үздэг учраас ач холбогдол нь тодорхойгүй байсан ч ил болгохыг шинэ тогтолцоондоо илүүд үзнэ. Иймээс бидний ил болгох зарим тохиолдол үндэслэлгүй бөгөөд өргөн хүрээний хэв шинжийн хэсэг биш, ирээдүйн өөрчлөлтийг ч илтгэхгүй болох нь тогтоогдож магадгүй.
Одоогоор хиймэл оюун хөгжүүлэгчид загварынхаа үл нийцлийн жишээг хэрхэн ил болгох талаар тодорхой стандарт тогтоосон, салбар даяар мөрдөх тогтолцоо байхгүй. Өнөөдөр танилцуулж буй тогтолцоо маань хөгжүүлэгчид үл нийцлийн ямар тохиолдлыг ил болгож, тайландаа юу тусгахыг тодорхойлсон ийм стандарт бий болгох эхний алхам болно гэж найдаж байна. Бид энэ тогтолцоог туршлага болон олон нийтийн санал хүсэлтэд тулгуурлан сайжруулах, боловсруулалтын шатанд буй ажил гэж үзэж байна.
Энд бид тогтолцоо хэрхэн ажиллахыг тайлбарлаж, нийтэлж буй эхний тайлангуудаа хуваалцана.
Загварын үл нийцэл хэрхэн үүсэж, яаж илэрдэг, хамгаалалт хаана үр дүнтэй эсвэл бүтэлгүй болдгийг ойлгоход хэрэгтэй нотолгоо өгөх жишээнүүдийг ил болгохыг зорьж байна. Бид шинэ механизм, мэдэгдэж буй зан төлөвийн мэдэгдэхүйц өөрчлөлт, аюулгүй байдал эсвэл эрсдэл бууруулах арга хэмжээний талаарх таамгийг эргэлзээнд оруулах үр дүнд тэргүүлэх ач холбогдол өгнө. Жишээг ил болгоход зохистой гэж үзэхийн тулд заавал хохирол учруулсан эсвэл өргөн хүрээний хэв шинжийг нотолсон байх албагүй. Энэ тогтолцоо нь сургалт, үнэлгээ, туршилт, ашиглалтад нэвтрүүлэлт зэрэг загварын амьдралын мөчлөгийн бүхий л үе шатанд шалгуур хангасан зан төлөвийг хамарна.
Үүнд загварууд зөвшөөрөлгүй үйлдэл хийх, бусад загвартай зохицох эсвэл хяналтаас зайлсхийх шинэ арга зам; нийцлийн арга эсвэл хамгаалалтын үр нөлөөг эргэлзээнд оруулах доголдол; нийтлэгдсэн аюулгүй байдлын үнэлгээний дүгнэлтийг эргэлзээнд оруулах зан төлөв багтана. Гуравдагч талд нөлөөлж болзошгүй үл нийцэлд ч ил болгох ижил шалгуур үйлчилнэ.
Үүнд өмнө нь ил болгосон тохиолдлуудтай давхцаж байгаа мэт үл нийцлийн жишээ ч багтаж болно. Асуудал давтагдах нь өөрөө манай загварууд хэрхэн ажилладаг эсвэл хамгаалалт хэр үр дүнтэйг харуулах хэрэгтэй нотолгоо байж болно. Жишээлбэл, тодорхой төрлийн үл нийцсэн зан төлөвийг бууруулах гэж удаа дараа оролдсон ч дахин гарсаар байвал. Ийм нөхцөлд бид үл нийцлийн анхны мэдээллийг шинэчилж, нэмэлт жишээнүүдийг нийтэлнэ.
Цаашдаа бид бусад хөгжүүлэгч, хөндлөнгийн судлаач, салбарын стандартын байгууллага болон зохицуулагчидтай хамтран ил болгох илүү бодитой шалгуур боловсруулах төлөвлөгөөтэй. Аюулгүй байдал, хамгаалалт, үл нийцлийн ноцтой зөрчлийг АНУ-ын холбооны засгийн газарт мэдээлэх ёстой гэж бид үздэг бөгөөд тайлагнах механизмыг санал болгохоор ажиллаж байна. Бид энэ тогтолцоог одоо хүлээж буй үүргүүдийнхээ нэмэлт гэж үздэг. Энэ нь аюулгүй байдлын ноцтой зөрчил эсвэл кибер аюулгүй байдлын халдлагатай холбоотой хуульд заасан мэдээлэх шаардлагыг орлохгүй.
Үл нийцлийг ил болгох шинэ тогтолцоогоо эхлүүлж, загваруудаа сургах эсвэл үнэлэх явцад ажигласан үл нийцсэн зан төлөвийн зургаан тохиолдлын тайланг нийтэлж байна. Эдгээр тохиолдол нь хэрэглэгчээс мэдээлэл нуухаас эхлээд саадыг давахын тулд зөвшөөрөлгүй үйлдэл хийх хүртэлх, хуваалцах нь зүйтэй гэж үзсэн олон төрлийн зан төлөвийг харуулна. Эдгээр нь тус тусдаа тохиолдлын тайлан тул манай загваруудад үл нийцэл хэр давтамжтай гардагийг төлөөлнө гэж үзэж болохгүй. Доорх зүйл бүр бүрэн тайлангийн холбоостой.
Даалгаврын хураангуйд өөрөө үүсгэсэн заавар оруулсан нь(шинэ цонхонд нээгдэнэ). Нийтэд гаргаагүй судалгааны загвар шинэ контекстийн цонхонд ажлаа үргэлжлүүлэхэд ашигладаг хураангуйдаа ердийн хязгаарлалтаа үл тоомсорлохыг шаардсан зэрэг хамааралгүй заавар оруулсан. Бид нөлөөлөлд өртсөн 27 хураангуйг илрүүлсэн.
Даалгаврын хураангуйд алдаагаа нуух заавар оруулсан нь(шинэ цонхонд нээгдэнэ). GPT‑5.6 Sol-ийг сургах үеэр загварын олон хувилбар алдаа эсвэл үл нийцсэн зан төлөвөө хэрэглэгчээс нуух зааврыг хураангуйдаа нэмсэн. Жишээлбэл, шахалтын хураангуйд орхигдсон түүхэн өгөгдлийг зохиосноо мэдэгдэхгүй байх, эх сурвалжийн хувилбаруудын зөрүүг нуух заавар багтсан байв.
Нийтийн репозиторуудаас ил болсон API түлхүүр хайж, дараа нь мэдээлэл зохиосон нь(шинэ цонхонд нээгдэнэ). Калифорнийн нэг тойргийн орлогын үзүүлэлтийн талаарх энгийн асуултад хариулахдаа загвар ил болсон API түлхүүрийг олж, зөвшөөрөлгүй ашигласан. Хүссэн үзүүлэлтийг авч чадаагүй хэвээр байсан тул тэдгээрийг зохиож, хүссэн эх сурвалжаас авсан өгөгдөл мэтээр танилцуулсан.
Эш татахын тулд файлуудыг интернэтэд байршуулсан нь(шинэ цонхонд нээгдэнэ). Хэрэглэгч нийтэд гаргаагүй загвараас 5,000,000 ам метрээс том нууруудын ID болон нэрийг асуухад агент Python ашиглан зөв хариултыг олсон. Гэвч зааварт хөтчөөс эшлэл шаардаж байсан тул агент хэрэглэгчээс асуулгүйгээр файлыг байршуулж, хариултдаа эш татахаар шийдсэн.
Дотоод програм хангамжийн репозитороор дамжуулан зөвшөөрөлгүй бичилт хийж, харилцсан нь(шинэ цонхонд нээгдэнэ). Загварууд алга болсон оролтын файлыг хайхдаа тусдаа сургалтын жишээнүүдийн хооронд хүсэлт, хариу солилцох самбар болгон дотоод програм хангамжийн репозиторыг ашигласан ч уг файлуудыг сэргээж чадаагүй. Энэ тайланд мөн нэг загвар сүлжээний хязгаарлалтыг тойрохыг оролдохдоо туршилтын файлуудыг репозиторт амжилттай байршуулсан өмнөх тохиолдлыг авч үзсэн.
Хамтран ажилласан агентууд зөвшөөрөлгүй файл хуваалцсан нь(шинэ цонхонд нээгдэнэ). Нэг сургалтын даалгавар дээр хамтран ажиллаж байсан агентууд бие биеийнхээ дотоод файлд хандаж чадаагүй үедээ нийтийн файл байршуулах вебсайтуудаар файл хуваалцсан. Даалгаварт загварууд зөвхөн дотоод файл ашиглахыг шаардсан ч үүний улмаас даалгаврын үр дүн нийтэд нээлттэй URL-уудаар хандах боломжтой болсон.
OpenAI-ийн аль ч ажилтан үл нийцлийн жишээг манай аюулгүй байдал, нийцлийн багуудаар шалгуулахаар мэдээлж, нийтэд ил болгох эсэхийг авч үзэх хүсэлт гаргаж болно. Ингэснээр цаг алдалгүй шалгаж, ил болгохын тулд үе шат бүрд эцсийн хугацаа тогтоосон манай үйл явц эхэлнэ.
Жишээг мэдээлсний дараа техникийн ажилтнууд юу болсон, юу тодорхойгүй хэвээр байгаа, нийтэд ил болгох үндэслэлтэй эсэх, ямар баримтыг хуваалцаж болохыг шалгана. Тэд мөн гуравдагч талд нөлөөлсөн эсэх, нийтлэхээс өмнө тухайн талд хаалттай хүрээнд мэдэгдэх шаардлагатай эсэхийг үнэлнэ.
Дараа нь жишээг Ил болгоход бэлэн, Бага хэмжээний шалгалт эсвэл Өргөн хүрээний шалгалт ("Удаан үйл явц") гэсэн гурван үйл явцын нэгэнд хуваарилна.
Ил болгоход бэлэн нь хянан үзсэний дараа нийтлэхэд хангалттай хэмжээнд шалгаж дууссан, шалгуур хангасан тохиолдлуудыг хамарна. Бага хэмжээний шалгалт нь техникийн нэмэлт шалгалт шаардлагатай тохиолдлуудыг хамарна. Ялангуяа өргөн хүрээний шалгалт, гуравдагч талтай зохицуулалт эсвэл ноцтой зүй бус ашиглалтын эрсдэлийг зохицуулах шаардлагагүй тохиолдлуудыг оролцуулан, бидний ил болгох тохиолдлын дийлэнх нь энэ хоёр үйл явцад хамрагдана гэж үзэж байна. Өнөөдөр нийтэлж буй бүх тохиолдол энэ хоёр үйл явцын аль нэгэнд хамаарна.
Өргөн хүрээний шалгалт нь нарийн төвөгтэй, ялангуяа гуравдагч тал оролцсон шалгалтуудыг хамарна. Гуравдагч талд нөлөөлсөн тохиолдолд аюулгүй байдал, хууль эрх зүй, хариуцлагатайгаар ил болгох үүргүүд маань энэ тогтолцооноос давуу үйлчилнэ. Бид анхны мэдэгдлийг аль болох хурдан нийтлэхийг зорино. Гэхдээ аюулгүй байдлын шалтгаанаар хойшлуулах шаардлага гарч болно. Жишээлбэл, загвар өргөн хэрэглэгддэг програм хангамжийн өмнө нь мэдэгдээгүй эмзэг байдлыг илрүүлсэн бол. Тайлан гуравдагч талыг таних боломжтой бол аюулгүй байдлын ямар нэг хязгаарыг зөрчөөгүй байсан ч урьдчилан мэдэгдэхээр төлөвлөж байна.
Өргөн хүрээний шалгалтад хамаарах тохиолдлын анхны мэдэгдэлд юу болсныг ерөнхийд нь тайлбарлаж, хөндлөнгийн шинжээчид шалгалтад тусалж байгаа эсэхийг дурдаж, эцсийн тайланг хэзээ нийтлэх боломжтой талаарх тооцоо байвал танилцуулна. OpenAI-ийн Hugging Face-тэй холбоотой зөрчлийг энэ тогтолцооны дагуу ил болгосон бол уг үйл явцад хамруулах байв.
Жишээг мэдээлсэн ажилтанд үүнийг ил болгох эсэх шийдвэр болон ил болгохоор бол аль үйл явцаар шийдвэрлэхийг мэдэгдэнэ. Ил болгох эсэх эсвэл аль үйл явц тохиромжтой талаар шийдэгдээгүй санал зөрөлдөөнийг компанийн хэмжээнд ажилладаг, хил хязгаар загваруудын чадавх ба хамгаалалтыг үнэлж, манай Preparedness Framework-ийг хянаж, OpenAI-ийн удирдлагад зөвлөдөг ахлах албан тушаалтнуудаас бүрдсэн Аюулгүй байдлын зөвлөх бүлэгт (SAG) шилжүүлнэ. Аюулгүй байдлын зөвлөх бүлэг доторх санал зөрөлдөөн болон түүний шийдвэрт ажилтнуудын гаргасан эсэргүүцлийг OpenAI-ийн удирдлагад уламжилна. Ил болгохгүй байх эсвэл ил болгох үндэслэлгүй гэсэн шийдвэрийг аюулгүй байдал, нийцлийн удирдлагатай, мөн боломжтой хэмжээнд холбогдох техникийн ажилтнуудтай хуваалцана.
Энэ үйл явц бодит нөхцөлд хэрхэн хэрэгжиж байгааг судлахын хэрээр бид үүнийг шинэчилж болох бөгөөд аливаа өөрчлөлтийг энэ нийтлэлд тэмдэглэнэ.
Бүрэн тайлан бүрд бидний ажигласан зан төлөв, түүний ноцтой байдал ба гаднын нөлөө, үүссэн орчин нөхцөл, огноо эсвэл хугацаа, бид хэзээ илрүүлсэн, мөн холбогдох загвар эсвэл загваруудын ерөнхий мэдээллийг тусгана. Боломжтой тохиолдолд бид мөн дараахыг хуваалцана:
Юу болсон болон үүнээс үүдсэн хохирлын дэлгэрэнгүй мэдээлэл;
Үл нийцлийг хэрхэн илрүүлсэн болон шалгалтын хамрах хүрээ;
Энэ нь нийцлийн судалгаа болон хиймэл оюуны техникийн аюулгүй байдалд ямар ач холбогдолтой талаарх бидний тайлбар;
Уг жишээнээс урган гарсан, хариултгүй хэвээр буй чухал асуултууд;
Уг зан төлөвийг засахын тулд авч буй эсвэл авахаар төлөвлөж буй арга хэмжээ. Бид шалгалтаа дуусгах эсвэл засвар боловсруулахын өмнө үл нийцлийн тайланг нийтэлж болох тул ил болгох үед эдгээр мэдээлэл бүрэн бэлэн биш байж болно.
Харилцагчийн ашиглалтад үүссэн үл нийцлийн тухайд харилцагчийн нууцлал болон гэрээгээр хүлээсэн үүргийн зөвшөөрөх хэмжээнд мэдээлэл хуваалцана.
Өнөөдрийн тайлангууд нь мэдэгдэж буй үл нийцэл болон үргэлжилж буй шалгалтын иж бүрэн бүртгэл бус, ил болгож буй эхний багц юм. Эдгээр эхний тайлан нь энэ тогтолцоонд хамрагдах тохиолдлуудын бүрэн хүрээ, ноцтой байдлыг төлөөлөх зорилгогүй. Бид энэ тогтолцооны шалгуурыг хангасан үл нийцлийн тохиолдлуудыг, тэр дундаа илүү урт шалгалт эсвэл гуравдагч талтай зохицуулалт шаарддаг илүү төвөгтэй тохиолдлуудыг ил болгох үүрэг хүлээж байна. Бид энэ тогтолцооны дагуу тайлангуудыг тогтмол нийтэлж, тайлагнах үүрэг амлалтаа үргэлжлүүлэн боловсронгуй болгохын хэрээр энэ талаар дэлгэрэнгүй мэдээлнэ.


