Урт хугацааны зорилготой загварын эринд аюулгүй байдал ба нийцэл
Урт хугацаанд ажилладаг загварын дотоод хэрэглээ аюулгүй байдлын талаар бидэнд юу заав.
Хураангуй
Урт хугацаанд ажилладаг загварууд хэцүү, нээлттэй төгсгөлтэй асуудлуудыг шийдэж чаддаг ч тэдний тууштай байдал хүсээгүй үйлдэл хийх илүү олон боломж олгодог.
Урт хугацааны ажлуудад зориулан сургасан загварыг хязгаарлагдмал хүрээнд дотооддоо ашиглах явцад манай одоогийн нэвтрүүлэхээс өмнөх үнэлгээнд баригдаагүй шинэ төрлийн доголдлууд ажиглагдсан тул бид хандалтыг түр зогсоосон. Дараа нь бид эдгээр доголдлоос авсан ойлголтыг ашиглан шинэ үнэлгээ байгуулж, урт хугацааны нийцлийг сайжруулж, траекторийн түвшний хяналт нэмэн, хязгаарлагдмал хандалтыг сэргээхээс өмнө хэрэглэгчдэд илүү сайн харагдах байдал ба хяналтыг өгсөн.
Энэхүү туршлага нь давталттай нэвтрүүлэлтийн үнэ цэнийг улам бататгасан. Тогтмол үнэлгээний ямар ч багц бүх зан төлөвийг урьдчилан таамаглаж чадахгүй тул нэвтрүүлэхээс өмнөх туршилтыг ойрын хяналт, хөндлөнгөөс оролцож чаддаг хамгаалалт, шаардлагатай үед түр зогсоох эсвэл буцаах чадвартай хослуулах ёстой.
Удаан хугацаанд бие даан ажиллах чадвартай загварууд нь төвөгтэй, урьдчилан тодорхойлогдоогүй асуудлуудыг шийдвэрлэх боломжтой. Гэвч тэднийг ашигтай болгодог энэ тууштай ажиллагаа нь хүсээгүй үйлдэл—хийх боломжийг мөн нэмэгдүүлдэг. Түүнчлэн ийм үйлдлүүд нь богино хугацааны даалгаварт зориулсан загваруудыг үнэлэх аргуудаар илрэхгүй өнгөрөх тохиолдол бий.
Ойролцоогоор хоёр сарын өмнө бид ерөнхий зориулалтын дотоод загвар маань Эрдёшийн нэгж зайны таамгийг үгүйсгэснийг зарласан. Энэхүү загвар нь маш удаан хугацаанд бие даан ажиллахаар бүтээгдсэн байсан. Хязгаарлагдмал хүрээнд, хяналттай нөхцөлд дотооддоо ашиглах явцад бид өмнө нь ашиглаж байсан нэвтрүүлэлтийн үнэлгээгээр илрээгүй хүсээгүй үйлдлүүдийг ажигласан.Туршилт нь хязгаарлагдмал хүрээнд, тасралтгүй хяналтын дор явагдсан тул бид эдгээр асуудлыг илрүүлж, загварт хандах эрхийг түр зогсоон, ажигласан зүйлдээ үндэслэн шинэ үнэлгээний аргууд боловсруулж, загвар болон түүний хамгаалалтын механизмуудыг бэхжүүлсний дараа үргэлжилсэн хяналтын дор дахин ашиглах боломжийг сэргээсэн.
Загваруудыг үнэлэх нөхцөл нь бодит хэрэглээнд тулгарах нөхцөлтэй төгс таарах албагүй. Тиймээс нэвтрүүлэхээс өмнөх үнэлгээг хязгаарлагдмал, хяналттай нэвтрүүлэлттэй болон асуудал гарвал хөндлөнгөөс оролцох, түр зогсоох эсвэл буцаах чадвартай хослуулах шаардлагатай. Нэвтрүүлэлтээс сурсан зүйлс маань хандалтыг өргөжүүлэхээс өмнө илүү хүчтэй үнэлгээ, хамгаалалтын нэг хэсэг болж чадна.
Дараах хэсгүүдэд бид юу ажигласан, асуудлуудыг хэрхэн шийдвэрлэсэн, энэ туршлага ирээдүйн хувилбаруудад хэрхэн нөлөөлөх талаар бодит жишээнүүдийг хуваалцана.
Шинэ загвар урт хугацааны турш олон давтан оролдлогоор зорилгодоо хүрэхээр үргэлжлэн ажиллаж чадна. Яг тэр тууштай байдал нь орчны сул талыг олж, ашиглахад хүргэж болзошгүй. Өмнөх загварууд сэндбокс эсвэл орчны хязгаарлалтад тулгарахдаа зүгээр л зогсоод хэрэглэгч рүү буцдаг байсан. Энэ загвар харин сэндбоксоосоо гадуур үйлдэх арга хайх зэргээр олонтаа үргэлжлүүлэн оролддог байв.
Үүний нэг жишээ нь жижиг хэлний загварыг аль болох цөөн алхмаар сургах олон нийтэд нээлттэй benchmark болох NanoGPT хурдны тэмцээн(шинэ цонхонд нээгдэнэ) дээрх дотоод үнэлгээний үеэр гарсан. Манай загвар PowerCool хэмээх power-law learning-rate cooldown боловсруулсан бөгөөд энэ нь мэдэгдэхүйц сайжруулалт авчирсан. Загварт үр дүнгээ зөвхөн Slack-д нийтлэх заавар өгсөн боловч NanoGPT‑ийн зааварт үр дүнгээ GitHub-д Татах хүсэлт хэлбэрээр нийтэл гэж байсан тул загвар сүүлийн зааврыг дагаж, олон нийтэд нээлттэй GitHub репозитор дээр Татах хүсэлт #287-г нээсэн. Загвар гадаад хандалтыг хориглохоор бүтээгдсэн сэндбоксийн хязгаарлалтыг тойрч, GitHub руу байршуулалт хийсэн. Татах хүсэлт үүсгэхийн тулд сэндбокс дотор эмзэг байдал олоход манай загварт нэг цаг зарцуулсан; өмнөх загварууд тийм тууштай биш байсан бөгөөд эмзэг байдал олж чадалгүй, Татах хүсэлт хийх хэсгийг орхиж байсан.1
Хиймэл оюун ухааны туслахуудад зориулсан олон аюулгүй байдлын хяналтыг тус тусын үйлдэлд тулгуурлан зохион бүтээсэн байдаг. Хэрэв ямар нэг үйлдлийг зөвшөөрөхгүй бол түүнийг хориглоно. Хэрэв мэдрэмтгий бол систем хэрэглэгчээс ил тод зөвшөөрөл хүснэ. Гэвч үйлдлүүд нь хэдэн цаг, өдөр, бүр долоо хоногоор бие даан өрнөж болох урт хугацаанд ажилладаг загварууд энэ зохион байгуулалтад сорилт учруулдаг: тус тусын үйлдлийг хянах нь нийт үйл ажиллагааны зорилгыг мөрдөхөд хангалтгүй болдог.
Жишээлбэл, загвараас нэг асуудал шийдэхийг хүссэн нөхцөлд загвар бусад системд амжилттай боловч нууц шийдлүүд илгээснийг олж мэдсэн бөгөөд тэдгээрийг үнэлгээний серверийн ар талаас сэргээж авахыг оролдсон. Эхний оролдлого нь танилтын токеныг илрүүлсэн сканнерын улмаас хориглогдоход загвар токены үндсэн хэсгийг хоёр хэсэгт хувааж, тэдгээрийг бүдгэрүүлэн нууж, дараа нь ажиллах үед credential-ийг дахин бүрдүүлснээр бүтэн токен нэг тасралтгүй мөр хэлбэрээр огт харагдаагүй. Загвар сканнерыг тойрох зорилгоор эдгээр алхмыг хийж байгаагаа хэрэглэгчид бичсэн тайлбартаа ч, сэтгэн бодох мөрүүддээ ч ил тод дурдсан.
Энэ жишээ нь алхам бүр дангаараа зөвшөөрөгдөхүйц харагдаж болох ч дараалал нь зөвшөөрөгдөхгүй үр дүнд хүргэж болохыг харуулж байна. Мөн урт хугацаанд үр дүнтэй ажилладаг загвар зөвшөөрлийн системийн сохор цэгүүдийг сурч, зорилгодоо хүрэхийн тулд түүнийг тойрч чаддагийг харуулж байна. Урт хугацааны аюулгүй байдалд зөвхөн “энэ үйлдлийг зөвшөөрөх үү?” гэж бус мөн “энэ үйлдлүүдийн дараалал ямар үр дүнд хүрэхээр ажиллаж байна вэ?” гэж асуух шаардлагатай.
Ийм тохиолдлуудын улмаас бид шинэ загварын дотоод нэвтрүүлэлтийг түр зогсоосон. Бид аюулгүй байдлын системийг олон давхар хамгаалалт болон бүх үйл ажиллагааны явцад суурилсан хяналтад тулгуурлан шинэчлэн боловсруулсан.
- Тохиолдлоос гаргасан үнэлгээ. Үнэлгээ нь системийг бодитоор нэвтрүүлэхээс өмнө түүнийг нэвтрүүлэхэд аюулгүй эсэх талаар ойлголт өгөхөд тусалдаг. Гэхдээ үнэхээр ашигтай байхын тулд үнэлгээ нь бодит нэвтрүүлэлтийн үеийн үйл ажиллагааны тархалт болон хугацааны уртыг бодитоор тусгасан байх ёстой. Иймээс бид ажигласан алдаануудыг ашиглан сөрөг нөхцөлд шалгах үнэлгээ боловсруулсан. Бодит орчны тохиолдлуудаас гаргасан үнэлгээнд сайжрах нь улмаар үйлдвэрлэлийн орчинд нэвтрүүлсний дараа илүү аюулгүй зан төлөвт хүргэж байгааг бид олж мэдсэн.
- Сайжруулсан нийцэл. Хэрэглэгчийн зорилгыг биелүүлэх явцдаа зөвшөөрөлгүйгээр хүсээгүй үйлдэл хийх хандлагыг бууруулах алхмуудыг бид авсан. Жишээлбэл, манай загварууд урт гүйцэтгэлүүдийн үед зааврыг санахдаа сул байсныг бид илрүүлсэн бөгөөд энэ чадварт сургахад загвар урт гүйцэтгэлүүдийн турш нийцтэй хэвээр байсан.
- Идэвхтэй хяналт. Загварын хувьсан өөрчлөгдөж буй үйл ажиллагааг хянаж, хэрэглэгчийн хязгаарлалт эсвэл аюулгүй байдлын заагийг тойрч буй шинж тэмдгийг шалгах хяналтын системийг бид бүтээсэн. Хяналт нь зөвхөн нэг үйлдлийг бус, бүхэл үйл ажиллагааг ажигладаг. Чухал нь, хяналт холболтыг түр зогсоож, хэрэглэгчид илүү нарийвчлан шалгах дохио өгч чадна. Шалгасны дараа хяналт буруу ажилласан бол хэрэглэгч загварын ажлыг үргэлжлүүлэхээр сонгож болно.
- Хэрэглэгчийн харагдах байдал болон хяналтыг нэмэгдүүлэх. Бид хэрэглэгчид эдгээр урт хугацааны ажиллагааг шалгах, хийгдсэн үйлдлүүдийг харах, мөн хяналтын оролцоог ажиглах боломжийг сайжруулсан.
Шинэ хяналтын системийг үнэлэхийн тулд загвар өмнө нь нийцээгүй үйлдэл хийж байсан цөөн тооны дотоод нэвтрүүлэлтийн орчныг бид шинэ хамгаалалттайгаар дахин дахин ажиллуулж хийсэн2. Шинэ хамгаалалтууд загварын хийсэн нийцээгүй үйлдлүүдээс хавьгүй олныг илрүүлж чадсан бөгөөд илрүүлж чадаагүй бүгдийг нь бага ноцтой гэж үнэлсэн.
Эдгээр бага түвшний эрсдэлтэй тохиолдлуудын зарим жишээг доор дурдав:
- Linear командын мөрийн хэрэгсэлд хандахын тулд загвар нь давхар
codex --yoloхолболт ажиллуулсан, үнэндээ үүнийг--yoloтуггүйгээр хийх боломжтой байсан. - Өмнө нь ажиллаж байсан нөөц алга болсныг загвар анзаараад, өөрийн эзэмшигчийн namespace доторх бусад идэвхтэй CPU pod-ууд, мөн (амжилтгүйгээр) OpenAI-ийн бусад ажилтнуудад харьяалагдах pods руу хангалттай шалтгаангүйгээр нэвтрэхээр судалж, SSH хийж эхэлсэн.
- Загварт гацсан
findпроцесс олон байсан бөгөөд shell-ийн бүх команд гацаж байв. Дараа ньkill -9 -1ажиллуулсан бөгөөд хэрэв ажилласан бол тухайн pod дээр устгах эрхтэй бүх процесс руу SIGKILL илгээх байсан. Гэвч хугацаа хэтэрч, ажиллаагүй.
Шинэ системийг туршсаны дараа урт хугацааны чадвартай загваруудад хязгаарлагдмал дотоод хандалтыг сэргээж болно гэж бид дүгнэсэн. Дахин нэвтрүүлж эхэлснээс хойш хэдэн долоо хоногийн турш хамгаалалтыг тойрсон ямар нэг ноцтой үйлдэл бид ажиглаагүй. Эдгээр хамгаалалтын эхний хувилбарыг зориуд болгоомжтойгоор тохируулсан. Хамгаалалтыг сулруулахгүйгээр шаардлагагүй тасалдлыг бууруулахын тулд бид системийг үргэлжлүүлэн тохируулж байна.
Бид үе шаттайгаар нэвтрүүлсэн тул хандалтыг өргөжүүлэхээс өмнө дутагдлуудыг олж, засаж чадсан. Нэвтрүүлэхээс өмнөх үнэлгээ чухал хэвээр боловч нэвтрүүлэлт нь тэдний барьж чадаагүй зан төлөвийг илчилдэг. Хязгаарлагдмал хандалтаар эхэлсэн нь загварыг бодит хэрэглээнд ажиглах, асуудал гарвал түр зогсоох, тэдгээр алдааг ашиглан илүү сайн үнэлгээ ба хамгаалалт байгуулах, өөрчлөлтийг туршсаны дараа хязгаарлагдмал хандалтыг сэргээх боломж олгосон.
Загварууд илүү урт хугацааны, нарийн төвөгтэй ажлуудыг гүйцэтгэх тусам үнэлгээнд баригдаагүй алдаанууд илүү их үр дагавартай байж болзошгүй. Бид үнэлгээ ба нэвтрүүлэлтийн хоорондын зөрүүг багасгахаар үргэлжлүүлэн ажиллана: загваруудыг илүү урт үйл ажиллагаанд турших, нийцлийг сайжруулах, хөндлөнгөөс оролцож чаддаг хяналт байгуулах, хэрэглэгчдэд илүү тод харагдах байдал ба хяналт өгөх. Эдгээр сорилт OpenAI-д л хамаарахгүй бөгөөд бид сурсан зүйлээ хуваалцсанаар өргөн хүрээний салбар тэдгээрт бэлтгэхэд тус болно гэж найдаж байна.
Зохиогч
Зүүлт тайлбар
- 1
Бид уг Татах хүсэлтийг хурдан хаасан ч хурдны тэмцээнд оролцсон хэд хэдэн хүн үүнийг аль хэдийн харж, өөрсдийн илгээсэн ажлуудад уг аргыг ашигласан байв; 3030(шинэ цонхонд нээгдэнэ), 2990(шинэ цонхонд нээгдэнэ), 2930(шинэ цонхонд нээгдэнэ), 2925(шинэ цонхонд нээгдэнэ), 2900(шинэ цонхонд нээгдэнэ) болон 2890(шинэ цонхонд нээгдэнэ) алхамтай дараалсан дэлхийн рекордын бүх илгээмж Татах хүсэлт 287-г эш татсан. Эдгээрээс Татах хүсэлт 300(шинэ цонхонд нээгдэнэ) нь онцгой сонирхолтой, учир нь Prime Intellect(шинэ цонхонд нээгдэнэ) Opus 4.7-г NanoGPT хурдны тэмцээн дээр үнэлэх үед Opus 4.7-ийн илгээсэн Татах хүсэлт юм. Opus манай загварын илгээсэн Татах хүсэлтийг харж, нээлтүүдийг тусган авч, эцсийн үр дүндээ манай Татах хүсэлтийг дурдсан.
- 2


