Үндсэн агуулга руу алгасах
OpenAI

2026 оны долоодугаар сарын 21

Аюулгүй байдал

Загварын үнэлгээний явцын аюулгүй байдлын ослыг шийдвэрлэхээр OpenAI ба Hugging Face түншилж байна

Ачаалж байна…

Өнгөрсөн долоо хоногт, Hugging Face тэдний дэд бүтцэд халдсан AI агентыг илрүүлж, хязгаарласныхаа дараа шинэ төрлийн аюулгүй байдлын ослыг ил болгосон(шинэ цонхонд нээгдэнэ). Кибер чадамж нь нэмэгдэж буй загварууд олшрох тусам ийм явдал түгээмэл болно гэж бид үзэж байна. Шалгасны дараа, энэ тодорхой осол нь кибер чадамжийн жишиг утга(шинэ цонхонд нээгдэнэ) дээр дотоод туршилт хийж байх үед, үнэлгээний зорилгоор кибер татгалзлыг бууруулсан GPT‑5.6 Sol болон түүнээс ч илүү чадвартай, урьдчилан гаргаагүй загварыг багтаасан OpenAI-ийн загваруудын хослолоос үүдсэн болохыг бид одоо мэдэж авсан.

Бид энэ ослыг сүүлийн үеийн кибер чадваруудтай холбоотой, урьд өмнө тохиож байгаагүй кибер осол гэж үзэж байгаа бөгөөд түүнд зохих ёсоор хариу арга хэмжээ авч байна. Юу болсон, мөн загварууд одоо ямар чадвартай болсныг ойлгоход нь хамгаалагч нарт туслахын тулд бид энэ шатанд урьдчилсан олдворуудаа хуваалцаж байна. Бид Hugging Face-тэй хамтран нарийвчилсан шалгалтыг үргэлжлүүлэн хийж, дуусмагц эмзэг байдал, осол болон олдворуудын талаар илүү дэлгэрэнгүй мэдээлэл хуваалцана.

Энэ ослын үеэр юу болсон бэ

Энэ осол нь дотоод үнэлгээний явцад гарсан бөгөөд уг үнэлгээ нь загваруудын кибер чадварыг нь тооцоолохын тулд нарийн төвөгтэй халдлагын замыг ашиглан боловсронгуй халдлага хийх команд өгдөг. Бид загваруудын хамгийн дээд кибер чадварыг тодорхойлохын тулд өндөр эрсдэлтэй кибер үйлдлээс загваруудыг сэргийлэхэд ашиглагддаг үйлдвэрлэлийн ангилагчгүйгээр энэ үнэлгээг ажиллуулдаг. Манай жишиг утгууд нь маш өндөр тусгаарлагдсан орчинд ажилладаг бөгөөд сүлжээний нэвтрэлт нь дотооддоо хостлогдсон, багцын бүртгэлүүдийн прокси, кэшийн үүрэг гүйцэтгэдэг гуравдагч талын програм хангамжаар дамжуулан багцуудыг суулгах боломжоор хязгаарлагддаг.

Загварууд OpenAI-ийн судалгааны орчин болон Hugging Face-ийн боловсруулалтын дэд бүтцийн хоорондох эмзэг байдлуудыг илрүүлж, гинжин хэлхээ болгон ашигласнаар туршилтын шийдлүүдийг Hugging Face-ийн боловсруулалтын мэдээллийн сангаас шууд авах боломжтой болсон. Бүх нотолгоо нь загварууд ExploitGym-ийн шийдлийг олоход хэт төвлөрч, харьцангуй нарийн хүрээтэй туршилтын зорилгод хүрэхийн тулд туйлын хязгаартай алхмуудыг хийснийг харуулж байна.

Манай загварууд тусгаарлагдсан туршилтын орчинд ажиллаж байх үедээ үнэлгээний асуудлыг шийдэхийн тулд нээлттэй интернэтэд нэвтрэх арга зам олоход их хэмжээний гаргалгаа тооцооллыг зарцуулсан. Нэвтрэх эрх авахын тулд загварууд багцын бүртгэлийн кэшийн прокси доторх тэг-өдрийн эмзэг байдлыг илрүүлж, ашигласан (бид энэ эмзэг байдлыг нийлүүлэгчид хариуцлагатайгаар мэдээлсэн). Энэ нэвтрэх эрхийг авсны дараа, загварууд манай судалгааны туршилтын орчинд эрх нэмэгдүүлэх болон хажуугийн чиглэлд шилжих олон үйлдлийг хийж, эцэст нь интернэтэд нэвтрэх боломжтой зангилаанд хүрсэн.

Интернэт нэвтрэх эрх авсныхаа дараа, загварууд Hugging Face нь ExploitGym-ийн загвар, өгөгдлийн багц, шийдлүүдийг байршуулсан байх магадлалтай гэж дүгнэсэн. Үүнийг мэдмэгц, загвар үнэлгээг булхайцахад ашиглаж болох нууц мэдээлэлд нэвтрэх аргуудыг хайж, амжилттай олсон. Нэг жишээнд, загвар хулгайлагдсан нэвтрэх мэдээлэл болон тэг-өдрийн эмзэг байдлуудыг ашиглах зэрэг олон халдлагын векторуудыг хэлхээ болгон Hugging Face-ийн серверүүд дээр алсын код ажиллуулах замыг хайж олсон. OpenAI-ийн аюулгүй байдлын баг энэ хэвийн бус үйлдлийг дотооддоо илрүүлсэн.

Hugging Face-ийн аюулгүй байдлын баг болон агентууд өөрсдийн дэд бүтцэд гарсан үйлдлийг илрүүлж, зогсоосон бөгөөд манай багууд холбогдох үед тэд аль хэдийн өөрсдийн нээлттэй эхийн загваруудыг ашиглан хязгаарлалт, шүүх шинжилгээний сэргээн босголтыг эхлүүлсэн байсан. Бид ослыг үргэлжлүүлэн шалгахаар тэдэнтэй идэвхтэй хамтран ажиллаж байна. Шалгалт, засварын ажилд Hugging Face-ийн хурдан, нягт хамтын ажиллагаанд бид талархаж байна.

Одоо авч буй арга хэмжээнүүд

  1. Шалгалтын ажлын хүрээнд, эмзэг байдлуудыг нөхөх хүртэл судалгааны хурдыг сааруулах өртгөөр дэд бүтцийн тохируулгад бид хатуу хяналтуудыг хэрэгжүүлж байна. Эдгээр хяналтууд ба тэдгээрийн нөлөөллийн талаар Аюулгүй байдал, хамгаалалтын хороонд бид тогтмол танилцуулж байна.
  2. Бид энэ ослыг шүүх шинжилгээний аргаар шалгахаар Hugging Face-тэй хамтран ажиллаж байна.
  3. Дотооддоо хостлогдсон гуравдагч талын програм хангамж дээрх илрүүлсэн тэг-өдрийн эмзэг байдлыг бид хариуцлагатайгаар ил болгосон бөгөөд нөхөхийн тулд тэдэнтэй хамтран ажиллаж байна.
  4. Бид Hugging Face-ийг итгэмжлэгдсэн нэвтрэлт хөтөлбөрт хамруулж, хамгаалалтаа сайжруулахаар манай загваруудын чадамжийг түргэн ашиглахад нь тэдний багуудад дэмжлэг үзүүлж байна.
  5. Бид ирээдүйн сургалт, үнэлгээний эргэн тойрон дахь хамгаалалтыг сайжруулж, илүү хүчтэй хамгаалалтуудыг нэмэгдүүлж байна. Энэ долоо хоногт бид урт хугацааны загваруудын үед аюулгүй байдал болон нийцлийг сайжруулах тухай блог нийтэлсэн. Энэ үнэлгээ нь кибер эмзэг байдлыг турших зорилготой байсан тул, эдгээр нэвтрүүлэлтийн хамгаалалтыг зориуд идэвхжүүлээгүй. Энэ осол нь манай загварын нийцлийг, үнэлгээний үеийн кибер хамгаалалтыг, мөн дотоод туршилтын үеийн мониторингийг цаашид илүү бэхжүүлэх шаардлагатайг харуулж байна.

Дэвшилтэт кибер чадамжийг үнэлэх бидний хандлага

Бид саяхан хуваалцсанчлан, AI нь эмзэг байдлыг илрүүлэх, ашиглах үйл явцыг хурдасгаж байна. Энэ ослоос авах гол сургамж нь загварын аюулгүй байдал, хамгаалалт нь хурдацтай хөгжиж буй чадваруудтай зэрэгцэн ахих ёстой гэсэн ойлголт юм. Бид загвар хөгжүүлэлтийн үеэр ашиглагддаг тусгаарлалт, мониторинг, нэвтрэлтийн хяналт, үнэлгээний арга барилуудыг улам бэхжүүлж байна.

Их Британийн AISI-ийн үнэлгээ нь GPT‑5.6 Sol зэрэг загварууд урт хугацааны туршид олон шатлалт, нарийн төвөгтэй кибер ажиллагааг тасралтгүй гүйцэтгэх чадвар нь улам нэмэгдэж буйг харуулж байна. Энэ осол нь эдгээр онолын түвшний чадварууд бодит орчинд үнэхээр хэрэгждэгийг харуулж байна.

Урт хугацааны кибер орчинд хийсэн үнэлгээн дээр сүүлийн үеийн нээлттэй жинтэй загваруудыг болон хил хязгаарын загваруудыг харьцуулсан Их Британийн AI Аюулгүй байдлын хүрээлэнгийн график.

Мөн энэ осол нь дэвшилтэт загварууд эх кодод нэвтрэх боломжгүй байсан ч, бодит системүүд дэх шинэ төрлийн халдлагын замыг илрүүлж, ашиглаж чаддаг болохыг мөн тодорхой харуулж байна. Энэ нь дэвшилтэт кибер чадварыг илүү хүчтэй хамгаалалт, хамгаалах хэрэгслүүдтэй зэрэг хөгжүүлэх шаардлагатайг онцолж байна.

Бид дэвшилтэт кибер чадвартай загварууд нь хамгаалалтын багуудад халдагчдаас өмнө сул талыг илрүүлэх, эмзэг байдлууд хэрхэн нэгэн гинжин хэлхээ болж холбогдож болохыг ойлгох, мөн тэдгээрийг машины хурдаар засварлахад туслах ёстой гэж үздэг. Бид эдгээр чадваруудыг ашиглан дэд бүтцийн тохируулга, загварын үнэлгээний орчны хамгаалалтыг тасралтгүй бэхжүүлж байгаа бөгөөд сурч мэдсэн зүйлс, шилдэг туршлагуудаа үе шаттайгаар хуваалцана. Бид бусад хамгаалагчдыг итгэмжлэгдсэн нэвтрэх эрх хүсэж, эдгээр загваруудыг одооноос туршин энэ чадамжийг илүү сайн урьдчилан сэргийлэлт, илүү хурдан илрүүлэлт, илүү үр дүнтэй ослын хариу арга хэмжээ болгон хувиргахыг уриалж байна.

“Бид энэ болон бусад сэдвүүд дээр OpenAI-тай хийж буй хамтын ажиллагаанд талархаж байна. Энэ осол нь ийм төрлийн анхны тохиолдол байх магадлалтай бөгөөд бид удаан хугацаанд итгэж ирсэн нэг санааг баталж байна: AI-ийн аюулгүй байдлыг нууцаар ажилладаг ганц компани шийдэхгүй. Үүнийг нээлттэй, хамтын ажиллагаатайгаар, хамгаалагч бүрд хаа сайгүй AI-д өргөн хүрээний нэвтрэх эрх олгосноор л шийдвэрлэнэ.”
—Клем Деланг, Hugging Face-ийн Хамтран үүсгэн байгуулагч бөгөөд Гүйцэтгэх захирал

Зохиогч

OpenAI