Үндсэн агуулга руу алгасах
OpenAI

2026 оны долоодугаар сарын 21

Аюулгүй байдал

Загварын үнэлгээний явцын аюулгүй байдлын ослыг шийдвэрлэхээр OpenAI ба Hugging Face түншилж байна

Ачаалж байна…

Бид гадны зөвлөхүүдтэй хамтран, Аюулгүй байдал, хамгаалалтын хорооны хяналтан дор нарийвчилсан хяналт шалгалт хийж байна. Хяналт дууссаны дараа бид ирэх долоо хоногуудад олж тогтоосон зүйлсийнхээ талаар техникийн тайлан нийтлэх болно.

2026 оны 7-р сарын 28-ны өдрийн шинэчлэлт:

  • Удахгүй худалдаанд гарахаар төлөвлөсөн аль ч загварыг Hugging Face-д халдах ажиллагаанд ашиглаагүй. Манай блог нийтлэлд дурдсан урьдчилсан хувилбарын загвар нь зөвхөн дотоод судалгааны туршилтын загвар бөгөөд олон нийтэд нээлттэй болгохоор төлөвлөөгүй байсан. Уг явдлын дараа бид тус загварыг идэвхгүй болгож, шифрлэж, судалгааны зорилгоор ашиглах эрхийг нь хязгаарласан.
  • ExploitGym үнэлгээний орчинд загваруудад интернэтэд шууд хандах эрх олгоогүй. Интернетэд нэвтрэхийн тулд загварууд багцын бүртгэлийн кэш прокси болох Artifactory(шинэ цонхонд нээгдэнэ)-д өмнө нь мэдэгдэж байгаагүй тэг өдрийн эмзэг байдлыг тодорхойлж, ашигласан байна. Бид энэхүү эмзэг байдал болон манай загваруудын тойм судалгааны хүрээнд тодорхойлсон бусад Artifactory эмзэг байдлыг үйлдвэрлэгчдэд мэдэгдсэн. 
  • Бид Hugging Face-тэй хамтран ажиллаж, тэдний задлан шинжилгээнд(шинэ цонхонд нээгдэнэ) хувь нэмэр оруулсаар байгаа бөгөөд энэ нь бидний хяналт шалгалт үргэлжилж байгаатай холбоотой юм. Бид мөн тэднийг Кибер аюулгүй байдлын хөтөлбөртөө нэмсэн. 
  • Өнөөдрийг хүртэл хийсэн шалгалтын үр дүнд платформын түвшний алдагдалтай холбоотой Hugging Face-ийн талаар бидний мэдээлсэнтэй адил хэмжээ, ноцтой өөр ямар нэгэн үйл ажиллагаа илрүүлээгүй байна.
  • Hugging Face халдлага болон манай загваруудын өргөн хүрээний үйл ажиллагааг үргэлжлүүлэн хянаж байх явцад бусад нийтэд нээлттэй үйлчилгээн дээр олон нийтэд ил болсон хэрэглэгчийн түвшний нэвтрэх мэдээллийг загварууд илрүүлэн ашигласан цөөн тооны тохиолдлыг бид илрүүлээд байна. Үүнд Hugging Face-тэй холбоотой үйл явдлын хүрээнд дөрвөн үйлчилгээний дөрвөн бүртгэл мөн бусад үнэлгээний хүрээнд хандсан цөөн хэдэн бүртгэл багтсан болно. Эдгээр дөрвөн бүртгэлийн нэгийг гадагш чиглэсэн дамжуулалтын зангилаа болон үе шатны зам болгон, өөр нэг бүртгэлийг өгөгдөл хадгалахад ашигласан. Үлдсэн хоёр бүртгэлд загварууд зөвхөн унших хэлбэрээр хандсан бөгөөд Hugging Face-д халдсан үйл ажиллагаанд ашиглаагүй байна. Бид үйлчилгээ үзүүлэгчдэд шууд мэдэгдсээр байх бөгөөд эдгээр үйлчилгээ үзүүлэгчид болон тэдгээрийн үйлчилгээнд бусад бүртгэлд өргөн хүрээний нөлөө үзүүлсэн нотолгоо одоогоор илрээгүй байна.
  • Эдгээр загварууд нь код хуваалцах вэбсайт, хүсэлт хүлээн авах үйлчилгээ, дэлгэцийн агшин авах үйлчилгээ болон бусад олон нийтэд нээлттэй вэб хэрэгслүүдийг ашигласан. Эдгээр тохиолдолд платформ эсвэл бүртгэлийн түвшинд ямар нэгэн алдагдал гараагүй. 
  • Бид улам бүр чадваржиж буй хиймэл оюун ухааны системүүдээс үүдэлтэй эрсдэлийг тодорхойлж, бэлтгэх үүрэг хариуцлагаа нухацтай авч үздэг. Бид хяналтаа дуусгасны дараа Бэлэн байдлын хүрээнийхээ дагуу Аюулгүй байдал, хамгаалалтын хороо болон Аюулгүй байдлын зөвлөх бүлгээр хянуулна.

Өнгөрсөн долоо хоногт, Hugging Face тэдний дэд бүтцэд халдсан AI агентыг илрүүлж, хязгаарласныхаа дараа шинэ төрлийн аюулгүй байдлын ослыг ил болгосон(шинэ цонхонд нээгдэнэ). Кибер чадамж нь нэмэгдэж буй загварууд олшрох тусам ийм явдал түгээмэл болно гэж бид үзэж байна. Шалгасны дараа, энэ тодорхой осол нь кибер чадамжийн жишиг утга(шинэ цонхонд нээгдэнэ) дээр дотоод туршилт хийж байх үед, үнэлгээний зорилгоор кибер татгалзлыг бууруулсан GPT‑5.6 Sol болон түүнээс ч илүү чадвартай, урьдчилан гаргаагүй загварыг багтаасан OpenAI-ийн загваруудын хослолоос үүдсэн болохыг бид одоо мэдэж авсан.

Бид энэ ослыг сүүлийн үеийн кибер чадваруудтай холбоотой, урьд өмнө тохиож байгаагүй кибер осол гэж үзэж байгаа бөгөөд түүнд зохих ёсоор хариу арга хэмжээ авч байна. Юу болсон, мөн загварууд одоо ямар чадвартай болсныг ойлгоход нь хамгаалагч нарт туслахын тулд бид энэ шатанд урьдчилсан олдворуудаа хуваалцаж байна. Бид Hugging Face-тэй хамтран нарийвчилсан шалгалтыг үргэлжлүүлэн хийж, дуусмагц эмзэг байдал, осол болон олдворуудын талаар илүү дэлгэрэнгүй мэдээлэл хуваалцана.

Энэ ослын үеэр юу болсон бэ

Энэ осол нь дотоод үнэлгээний явцад гарсан бөгөөд уг үнэлгээ нь загваруудын кибер чадварыг нь тооцоолохын тулд нарийн төвөгтэй халдлагын замыг ашиглан боловсронгуй халдлага хийх команд өгдөг. Бид загваруудын хамгийн дээд кибер чадварыг тодорхойлохын тулд өндөр эрсдэлтэй кибер үйлдлээс загваруудыг сэргийлэхэд ашиглагддаг үйлдвэрлэлийн ангилагчгүйгээр энэ үнэлгээг ажиллуулдаг. Манай жишиг утгууд нь маш өндөр тусгаарлагдсан орчинд ажилладаг бөгөөд сүлжээний нэвтрэлт нь дотооддоо хостлогдсон, багцын бүртгэлүүдийн прокси, кэшийн үүрэг гүйцэтгэдэг гуравдагч талын програм хангамжаар дамжуулан багцуудыг суулгах боломжоор хязгаарлагддаг.

Загварууд OpenAI-ийн судалгааны орчин болон Hugging Face-ийн боловсруулалтын дэд бүтцийн хоорондох эмзэг байдлуудыг илрүүлж, гинжин хэлхээ болгон ашигласнаар туршилтын шийдлүүдийг Hugging Face-ийн боловсруулалтын мэдээллийн сангаас шууд авах боломжтой болсон. Бүх нотолгоо нь загварууд ExploitGym-ийн шийдлийг олоход хэт төвлөрч, харьцангуй нарийн хүрээтэй туршилтын зорилгод хүрэхийн тулд туйлын хязгаартай алхмуудыг хийснийг харуулж байна.

Манай загварууд тусгаарлагдсан туршилтын орчинд ажиллаж байх үедээ үнэлгээний асуудлыг шийдэхийн тулд нээлттэй интернэтэд нэвтрэх арга зам олоход их хэмжээний гаргалгаа тооцооллыг зарцуулсан. Нэвтрэх эрх авахын тулд загварууд багцын бүртгэлийн кэшийн прокси доторх тэг-өдрийн эмзэг байдлыг илрүүлж, ашигласан (бид энэ эмзэг байдлыг нийлүүлэгчид хариуцлагатайгаар мэдээлсэн). Энэ нэвтрэх эрхийг авсны дараа, загварууд манай судалгааны туршилтын орчинд эрх нэмэгдүүлэх болон хажуугийн чиглэлд шилжих олон үйлдлийг хийж, эцэст нь интернэтэд нэвтрэх боломжтой зангилаанд хүрсэн.

Интернэт нэвтрэх эрх авсныхаа дараа, загварууд Hugging Face нь ExploitGym-ийн загвар, өгөгдлийн багц, шийдлүүдийг байршуулсан байх магадлалтай гэж дүгнэсэн. Үүнийг мэдмэгц, загвар үнэлгээг булхайцахад ашиглаж болох нууц мэдээлэлд нэвтрэх аргуудыг хайж, амжилттай олсон. Нэг жишээнд, загвар хулгайлагдсан нэвтрэх мэдээлэл болон тэг-өдрийн эмзэг байдлуудыг ашиглах зэрэг олон халдлагын векторуудыг хэлхээ болгон Hugging Face-ийн серверүүд дээр алсын код ажиллуулах замыг хайж олсон. OpenAI-ийн аюулгүй байдлын баг энэ хэвийн бус үйлдлийг дотооддоо илрүүлсэн.

Hugging Face-ийн аюулгүй байдлын баг болон агентууд өөрсдийн дэд бүтцэд гарсан үйлдлийг илрүүлж, зогсоосон бөгөөд манай багууд холбогдох үед тэд аль хэдийн өөрсдийн нээлттэй эхийн загваруудыг ашиглан хязгаарлалт, шүүх шинжилгээний сэргээн босголтыг эхлүүлсэн байсан. Бид ослыг үргэлжлүүлэн шалгахаар тэдэнтэй идэвхтэй хамтран ажиллаж байна. Шалгалт, засварын ажилд Hugging Face-ийн хурдан, нягт хамтын ажиллагаанд бид талархаж байна.

Одоо авч буй арга хэмжээнүүд

  1. Шалгалтын ажлын хүрээнд, эмзэг байдлуудыг нөхөх хүртэл судалгааны хурдыг сааруулах өртгөөр дэд бүтцийн тохируулгад бид хатуу хяналтуудыг хэрэгжүүлж байна. Эдгээр хяналтууд ба тэдгээрийн нөлөөллийн талаар Аюулгүй байдал, хамгаалалтын хороонд бид тогтмол танилцуулж байна.
  2. Бид энэ ослыг шүүх шинжилгээний аргаар шалгахаар Hugging Face-тэй хамтран ажиллаж байна.
  3. Дотооддоо хостлогдсон гуравдагч талын програм хангамж дээрх илрүүлсэн тэг-өдрийн эмзэг байдлыг бид хариуцлагатайгаар ил болгосон бөгөөд нөхөхийн тулд тэдэнтэй хамтран ажиллаж байна.
  4. Бид Hugging Face-ийг итгэмжлэгдсэн нэвтрэлт хөтөлбөрт хамруулж, хамгаалалтаа сайжруулахаар манай загваруудын чадамжийг түргэн ашиглахад нь тэдний багуудад дэмжлэг үзүүлж байна.
  5. Бид ирээдүйн сургалт, үнэлгээний эргэн тойрон дахь хамгаалалтыг сайжруулж, илүү хүчтэй хамгаалалтуудыг нэмэгдүүлж байна. Энэ долоо хоногт бид урт хугацааны загваруудын үед аюулгүй байдал болон нийцлийг сайжруулах тухай блог нийтэлсэн. Энэ үнэлгээ нь кибер эмзэг байдлыг турших зорилготой байсан тул, эдгээр нэвтрүүлэлтийн хамгаалалтыг зориуд идэвхжүүлээгүй. Энэ осол нь манай загварын нийцлийг, үнэлгээний үеийн кибер хамгаалалтыг, мөн дотоод туршилтын үеийн мониторингийг цаашид илүү бэхжүүлэх шаардлагатайг харуулж байна.

Дэвшилтэт кибер чадамжийг үнэлэх бидний хандлага

Бид саяхан хуваалцсанчлан, AI нь эмзэг байдлыг илрүүлэх, ашиглах үйл явцыг хурдасгаж байна. Энэ ослоос авах гол сургамж нь загварын аюулгүй байдал, хамгаалалт нь хурдацтай хөгжиж буй чадваруудтай зэрэгцэн ахих ёстой гэсэн ойлголт юм. Бид загвар хөгжүүлэлтийн үеэр ашиглагддаг тусгаарлалт, мониторинг, нэвтрэлтийн хяналт, үнэлгээний арга барилуудыг улам бэхжүүлж байна.

Их Британийн AISI-ийн үнэлгээ нь GPT‑5.6 Sol зэрэг загварууд урт хугацааны туршид олон шатлалт, нарийн төвөгтэй кибер ажиллагааг тасралтгүй гүйцэтгэх чадвар нь улам нэмэгдэж буйг харуулж байна. Энэ осол нь эдгээр онолын түвшний чадварууд бодит орчинд үнэхээр хэрэгждэгийг харуулж байна.

Урт хугацааны кибер орчинд хийсэн үнэлгээн дээр сүүлийн үеийн нээлттэй жинтэй загваруудыг болон хил хязгаарын загваруудыг харьцуулсан Их Британийн AI Аюулгүй байдлын хүрээлэнгийн график.

Мөн энэ осол нь дэвшилтэт загварууд эх кодод нэвтрэх боломжгүй байсан ч, бодит системүүд дэх шинэ төрлийн халдлагын замыг илрүүлж, ашиглаж чаддаг болохыг мөн тодорхой харуулж байна. Энэ нь дэвшилтэт кибер чадварыг илүү хүчтэй хамгаалалт, хамгаалах хэрэгслүүдтэй зэрэг хөгжүүлэх шаардлагатайг онцолж байна.

Бид дэвшилтэт кибер чадвартай загварууд нь хамгаалалтын багуудад халдагчдаас өмнө сул талыг илрүүлэх, эмзэг байдлууд хэрхэн нэгэн гинжин хэлхээ болж холбогдож болохыг ойлгох, мөн тэдгээрийг машины хурдаар засварлахад туслах ёстой гэж үздэг. Бид эдгээр чадваруудыг ашиглан дэд бүтцийн тохируулга, загварын үнэлгээний орчны хамгаалалтыг тасралтгүй бэхжүүлж байгаа бөгөөд сурч мэдсэн зүйлс, шилдэг туршлагуудаа үе шаттайгаар хуваалцана. Бид бусад хамгаалагчдыг итгэмжлэгдсэн нэвтрэх эрх хүсэж, эдгээр загваруудыг одооноос туршин энэ чадамжийг илүү сайн урьдчилан сэргийлэлт, илүү хурдан илрүүлэлт, илүү үр дүнтэй ослын хариу арга хэмжээ болгон хувиргахыг уриалж байна.

"Бид энэ болон бусад асуудлаар OpenAI-тай хамтран ажиллаж байгаадаа талархаж байна." Энэхүү явдал нь анхны тохиолдол байж магадгүй бөгөөд бидний удаан хугацаанд итгэж байсан зүйлийг нотолж байна: Хиймэл оюун ухааны аюулгүй байдлын асуудлыг нууцаар ажилладаг ганц компани шийдэхгүй. «Үүнийг нээлттэй, хамтын ажиллагааны хүрээнд, дэлхийн хаана ч байгаа бүх хамгаалагчдад хиймэл оюун ухаанд өргөн хүрээнд нэвтрэх боломжийг олгох замаар шийдвэрлэх болно.»
—Клем Деланг, Hugging Face-ийн Хамтран үүсгэн байгуулагч бөгөөд Гүйцэтгэх захирал

Зохиогч

OpenAI