Үндсэн агуулга руу алгасах
OpenAI

2026 оны наймдугаар сарын 18

КомпаниНийтлэл

Кибер чухал чадавхын эринд загвар хөгжүүлэх хурдаа тохируулах

Ачаалж байна…

Сүүлийн хэдэн долоо хоногт гарсан хоёр үйл явдал улам чадваржиж буй хиймэл оюуны системүүдтэй холбоотой эрсдэл нэмэгдэж байгааг тодотголоо. Эдгээр нь OpenAI-Hugging Face-ийн хэрэг явдал болон тусдаа тохиолдол болох манай удахгүй гарах Astra загвар кибер аюулгүй байдлын чухал чадавхын босгыг манай Preparedness Framework-ийн дагуу хангаж болзошгүйг харуулсан урьдчилсан нотолгоо юм. Эдгээр үйл явдал болон манай дотоод судалгааны хурдацтай ахиц нь сургалтын бүх үе шатанд хяналт, нийцүүлэлт, хязгаарлалтын хамгаалалтаа бэхжүүлэх ажлыг нэн яаралтай болголоо.

Загварууд чадваржихын хэрээр тэдгээрийг дотооддоо хөгжүүлж, туршихтай холбоотой эрсдэл мөн нэмэгддэг. Хяналт, нийцүүлэлт, аюулгүй байдлын манай стандарт эдгээр эрсдэлээс ямагт түрүүлж байх ёстой. Бид эдгээр стандартыг хангахад шаардлагатай хугацааг зориулахын тулд цар хүрээг тэлэх хурдаа түр сааруулсан. Үүний хүрээнд судалгааны орчноо улам бэхжүүлж, халдлагын багийн туршилт хийж, хяналтын системийн хамрах хүрээг өргөжүүлэх зуур нэвтрүүлэхээр төлөвлөсөн хамгийн сүүлийн загваруудын бататгах сургалтыг (RL) хоёр долоо хоног түр зогсоосон. Загварын зан төлөвийг үнэлэх, хамгаалалтаа баталгаажуулах, цааш үргэлжлүүлэхээс өмнө нийцлийн нэмэлт нотолгоо бүрдүүлэх зорилгоор бага цар хүрээтэй сургалт, үнэлгээ хийж байгаа тул төлөвлөсөн хамгийн том хил хязгаарын RL сургалт түр зогссон хэвээр байна.

Хиймэл оюуны системийг зориулалтын дагуу ажиллаж, хүний хяналтад хариу үйлдэл үзүүлдэг болгох ажил буюу нийцүүлэлт нь манай судалгааны хөтөлбөрийн цөм байсаар ирсэн. Бид хийгдэж буй судалгаа, үнэлгээндээ тулгуурлан сургалтын бүх явцад нийцсэн зан төлөвийн илүү баттай нотолгоо шаарддаг боллоо. Улам чадваржиж буй системүүдийг нийцтэй хэвээр байлгах нь салбар даяараа шийдэх ёстой сорилт юм. Удахгүй гарах загваруудын ахицаас ажиглагдаж буй дохио нь одоогийн Preparedness Framework-д тулгуурлахын зэрэгцээ түүнээс давсан, илүү өргөн хүрээтэй арга барил хэрэгтэйг тодорхой харуулж байна.

Арга барил маань хэрхэн өөрчлөгдөж буйг ил тод мэдээлэх нь чухал гэж бид үзэж байна. Доор бид судалгааны үйл явц, дэд бүтцэд аль хэдийн хийсэн өөрчлөлтүүд болон үргэлжилж буй ажлаа тайлбарлана.

Илүү чадварлаг загваруудын хамгаалалтыг бэхжүүлэх нь

Илүү чадварлаг загвар хөгжүүлэх манай арга барил харилцан бэхжүүлэх гурван хамгаалалтад тулгуурладаг:

  1. Хяналт нь анхаарал татсан зан төлөвийг илрүүлж, хариу арга хэмжээ авах боломж олгодог.
  2. Нийцүүлэлт нь хортой эсвэл зөвшөөрөлгүй үйлдэл гарах магадлалыг бууруулдаг.
  3. Аюулгүй байдлын арга хэмжээ нь хиймэл оюуны систем юунд хандаж, юунд нөлөөлж болохыг хязгаарладаг.

Удахгүй загварууд бусад загвараас хамгаалах зэрэг аюулгүй байдлын ихэнх ажлыг гүйцэтгэнэ гэж бид үзэж байна. Ингэснээр энэ гурван хамгаалалт загварын чадавхтай хамт өргөжих бөгөөд бид үүнийг нэн чухал гэж үздэг.

Бид эдгээр хамгаалалтыг судалгаа болон нэвтрүүлэлтийн бүх хүрээнд хэрэглэж, загвар бүрийн чадавх, ажиллах орчин, эрсдэлийн түвшинд тохируулдаг.

Судалгааны орчноо аюулгүй болгох нь

Хил хязгаарын загваруудын кибер аюулгүй байдлын чадавх нэмэгдэхийн хэрээр тэдгээрийг сургаж, үнэлдэг орчны аюулгүй байдлын стандартыг бид өндөрсгөж байна. Эдгээр стандартыг хангахын тулд инженерчлэлийн ихээхэн ажил шаардагдаж, хил хязгаарын судалгаанд өндөр зардал, саатал учирсан. OpenAI-Hugging Face-ийн хэрэг явдлын* дараа бид код ажиллуулах эсвэл интернэтэд хандах хэрэгсэл ашиглах боломжтой туршилтуудын хил хязгаарын загварын дүгнэлт боловсруулалтыг судалгааны кластеруудад нэн даруй түр зогсоосон. Удалгүй бид код ажиллуулах илүү хязгаарлагдмал, аюулгүй замыг сэргээж, дараа нь ажлын ачаалал бүрийг аюулгүй үргэлжлүүлэх боломжтой эсэхийг тус тусад нь шалгасан. Зарим судалгааны ажлын ачааллыг шинэ хяналтын дор үргэлжлүүлсэн бол бусдад нь нэмэлт өөрчлөлт шаардлагатай байв.

Дараагийн долоо хоногуудад бид хил хязгаарын судалгааны ажлын ачаалалд тавих илүү хатуу аюулгүй байдлын шаардлагыг тодорхойлж, хэрэгжүүлж эхэлсэн. Жишээлбэл:

  • Ажлын ачааллыг тусгаарлах: Загварын үүсгэсэн эсвэл өөр байдлаар итгэмжлэгдээгүй код ажиллуулдаг ажлын ачаалалд илүү хүчтэй тусгаарлалт («сэндбокс») шаардах болсон. Энэ нь загварын гаралтыг боловсруулахдаа халдлагад өртөж болзошгүй програм хангамжид мөн хамаарна.
  • Сүлжээний тусгаарлалт: Өндөр эрсдэлтэй болон итгэмжлэгдээгүй ажлын ачааллыг интернэтээс тусгаарлах нэмэлт хяналтуудыг хэрэгжүүлсэн. Бид эдгээр хяналтыг нэг ажлын ачаалал эсвэл туслах үйлчилгээ дангаараа халдлагад өртсөн ч интернэт болон бусад дотоод сүлжээнд зөвшөөрөлгүй нэвтрэх боломж олгохгүй байхаар зохион бүтээсэн.
  • Аюулгүй байдлын тасралтгүй туршилт: Болзошгүй эмзэг хамтын үйлчилгээг арилгах, байнгын эрхийг багасгах, аюулгүй байдал болон итгэлцлийн хил хязгаарыг сайжруулахын тулд орчноо дахин тохируулсан. Мөн аюулгүй байдлын бүртгэлийг цуглуулах, хянах чадвараа сайжруулж байна. Эцэст нь, эдгээр хил хязгаарыг дуураймал халдлагаар тасралтгүй шалгахын тулд загваруудаа ашигласан автоматжуулалтад хөрөнгө оруулж байна.

Эдгээр хяналт нийлээд олон давхар хамгаалалт бүрдүүлж, судалгааны орчныг халдлагаас хамгаалахад тусалдаг. Astra загварууд кибер чадавхын чухал түвшинд хүрч болзошгүй гэж тогтоосон тул одоо Astra эсвэл кибер загвартай холбоотой ажлын ачаалалд аюулгүй байдлын хамгийн хатуу хамгаалалт шаарддаг. Эдгээр хамгаалалт кибертэй холбоотой бусад бүх ажлын ачаалалд мөн хамаарна.

Astra-гийн зарим сургалт, үнэлгээ эдгээр шаардлагыг хангаж байгаа ч олон ажлын ачааллыг бүрэн шилжүүлж, шинэ аюулгүй байдлын босгод нийцүүлэн сайжруулах хүртэл түр зогсоосон хэвээр байна. Бид аюулгүй байдал, нийцүүлэлтийн ажлын ачааллыг эдгээр шинэ орчинд хамгийн түрүүнд шилжүүлж байна.

Бодлын хэлхээний хяналтыг өргөжүүлэх нь

Хяналт нь дотоод кодчиллын агентуудын хяналт болон удаан үргэлжлэх сешнүүд зэрэг манай загвар хөгжүүлэлтийн үйл явцын чухал хэсэг байсаар ирсэн. Манай хяналт хил хязгаарын загваруудын дотоод нэвтрүүлэлт болон хил хязгаарын RL сургалтад онцгой төвлөрч байв. Учир нь эдгээр нь загварын дэвшилтэт чадавхыг хэрэгсэл, эмзэг систем, дотоод эсвэл гадаад сүлжээнд хандах эрхтэй хослуулж чаддаг тул хамгийн өндөр эрсдэлтэй ажлын ачаалал гэж үзсэн. Эдгээр хяналтыг хэрэгсэл ашигладаг бүх дүгнэлт боловсруулалт, сургалтад хэрэглэдэггүй байв. Бид шинэ хяналтын тогтолцоогоороо арга барилаа шинэчилж, өргөжүүлсэн.

Энэхүү шинэ хяналт нь олон үе шаттай. Эхлээд түүвэрлэсэн токен бүрд ажиллах идэвхжилийн ангилагчид (загварын дотоод үйл ажиллагааг шалгадаг илрүүлэгчид) болзошгүй асуудлыг илрүүлж, улмаар улам боловсронгуй, өндөр тооцооллын нөөцтэй автомат мөрдөн шалгагчдад шилжүүлдэг. Эдгээр систем нь зөвшөөрөлгүй хандалт, өгөгдөл хулгайлах, сүйтгэх зан төлөв, хамгаалалтыг давах оролдлогыг илрүүлэхийн тулд хэрэгслийн үйлдэл, харагдах сэтгэн бодох явц, үйл ажиллагааны бүрэн дарааллыг шалгадаг. Хяналтын системээр анхаарал татсан үйл ажиллагаа илэрснээс хойш 30 минутын дотор сэрэмжлүүлэг өгөхийг зорьдог. Хяналтын систем аюулгүй байдлын чухал хил зөрчигдсөн байх магадлалтайг тогтоовол хамгийн өндөр ач холбогдолтой сэрэмжлүүлэг үүсгэнэ. Одоогийн хэрэгжүүлэлтээр аюулгүй ажиллагаа, аюулгүй байдал, судалгааны багуудад яаралтай мэдэгдэл хүрдэг. Хэрэв тэд 30 минутын дотор уг дохио худал эерэг гэдгийг баттай тогтоож чадахгүй бол үйл ажиллагааг түр зогсоох ёстой.

Sol болон түүнээс дээш чадавхтай загварын хэрэгсэл ашигласан бүх RL сургалт, үнэлгээнд энэ хяналтыг заавал хэрэглэнэ. Наймдугаар сарын 7-нд Astra кибер чухал чадавхтай байж болзошгүйг тогтоосны дараа Astra-г хэрэгсэлтэй ашигласан бүх дүгнэлт боловсруулалтад зөвхөн RL сургалт, үнэлгээнээс гадна нэмэлт хяналтын шаардлага тавьсан.

Эдгээр хамгаалалтад үлэмж тооцооллын нөөц шаардлагатай. Одоогийн тооцоогоор хяналтын нэмэлт зардал нь хянаж буй дүгнэлт боловсруулалтын тооцооллын нөөцийн ойролцоогоор 20%-тай тэнцэж байгаа ч сургалт, үнэлгээний ажлын ачаалал бүрд зардал ихээхэн ялгаатай. Удахгүй нийтлэх блогийн нийтлэлээр энэ системийн талаар дэлгэрэнгүй мэдээлнэ.

Нийцүүлэлтийн судалгааг ахиулах нь

Нийцүүлэлтийн судалгаа бол манай эрхэм зорилгын гол цөм юм. Бидний эрхэм зорилго бол Ерөнхий хиймэл оюун ухааныг бүх хүн төрөлхтөнд өгөөжтэй байлгах явдал юм. Загварууд кибер халдлага хийх зэрэг дэвшилтэт чадавхтай болж, илүү нарийн төвөгтэй орчинд ажиллахын хэрээр шагналыг хакердах (зорьсон үр дүнд бодитоор хүрэлгүйгээр сургалтын өндөр шагнал авах арга олох), хууран мэхлэх, зөвшөөрөлгүй хандах зэрэг нийцээгүй зан төлөв улам ноцтой эрсдэл үүсгэнэ.

Хамгийн чадварлаг загваруудын RL сургалтад нийцүүлэлтийн үндсэн арга техникээ сургалтын илүү олон үе шатанд хэрэглэж байна. Үүнд даалгавар, орчин бүрд аюултай зан төлөвийг илүү сайн илрүүлж, хязгаарлахын тулд шагналын загваруудыг сайжруулах; загваруудыг өөрсдийн үйлдэл, чадавх, хязгаарлалтын талаар илүү үнэнч байхаар сургах; шагнал, үнэлэгч, хэрэгсэл эсвэл хяналтын сул талыг ашиглах зан төлөвийг бууруулах зэрэг багтана. Мөн загварууд гадаад систем эсвэл нөөцтэй харилцах үед хор хөнөөл учруулж болзошгүй зан төлөвийн сургалтын хамрах хүрээг нэмэгдүүлж байна.

Бид нийцүүлэлтийн судалгаанд эрчимтэй хөрөнгө оруулж, үнэлгээний хамрах хүрээг өргөжүүлэн, сурсан зүйлээ сургалт болон хамгаалалтад тусгасаар байна. Ойрын хугацаанд загварын зан төлөвийн талаар сурч мэдсэн зүйлс, илрүүлсэн шинэ сорилтууд зэрэг нийцүүлэлтийн судалгааныхаа талаар илүү дэлгэрэнгүй хуваалцахаар төлөвлөж байна.

Цаашид хийх зүйлс

Бид эдгээр хамгаалалтыг сургалт болон нэвтрүүлэлтийн хүрээнд нэгтгэж, ирээдүйн загваруудын чадавх болон ажиллах орчныг илүү сайн тусгахын тулд Preparedness Framework-ээ хөгжүүлнэ. Эдгээр чадавхтай хамт өргөжих арга боловсруулахад загварын тусламжтай аюулгүй байдал, илүү үр дүнтэй хяналт, нийцүүлэлтийн судалгааны тасралтгүй ахицад урт хугацаанд хөрөнгө оруулах шаардлагатай. Арга барилаа хөгжүүлэх явцдаа гаднын байгууллагуудыг оролцуулж, сурсан зүйлсээсээ илүү ихийг хуваалцах зорилготой.

Хил хязгаарын загваруудын чадавх хурдацтай нэмэгдэж байна. Тэдгээрийг ойлгох, нийцүүлэх, аюулгүй болгох чадвар маань энэ ахицаас ямагт түрүүлж байх ёстой.


*Бид сурч мэдсэн зүйлсийнхээ техникийн тайланг ирэх долоо хоногуудад нийтэлнэ.

Зохиогч

OpenAI