OpenAI และ Hugging Face ร่วมมือกันเพื่อแก้ไขเหตุการณ์ด้านความปลอดภัยระหว่างการประเมินโมเดล
สัปดาห์ที่ผ่านมา Hugging Face เปิดเผยเหตุการณ์ด้านความปลอดภัยรูปแบบใหม่(เปิดในหน้าต่างใหม่) หลังตรวจพบและควบคุม AI เอเจนต์ที่บุกรุกโครงสร้างพื้นฐานของตนได้สำเร็จ ซึ่งเราเชื่อว่าเหตุการณ์ลักษณะนี้จะเกิดขึ้นบ่อยขึ้นเมื่อโมเดลที่มีความสามารถด้านไซเบอร์พัฒนาก้าวหน้ายิ่งขึ้น หลังการสืบสวน เราทราบแล้วว่าเหตุการณ์ครั้งนี้เกิดจากการใช้โมเดลของ OpenAI หลายตัวร่วมกัน ซึ่งรวมถึง GPT‑5.6 Sol และโมเดลรุ่นก่อนเปิดตัวที่มีความสามารถสูงกว่า ทั้งหมดได้รับการลดข้อจำกัดในการปฏิเสธคำขอด้านไซเบอร์เพื่อการประเมิน และกำลังอยู่ระหว่างการทดสอบภายในบนเกณฑ์มาตรฐาน(เปิดในหน้าต่างใหม่)ด้านความสามารถทางไซเบอร์
เราถือว่าเหตุการณ์ครั้งนี้เป็นเหตุการณ์ทางไซเบอร์ที่ไม่เคยเกิดขึ้นมาก่อน ซึ่งเกี่ยวข้องกับความสามารถด้านไซเบอร์ที่ล้ำสมัยที่สุด และเรากำลังตอบสนองต่อเหตุการณ์นี้ด้วยมาตรการที่เหมาะสม เราเผยแพร่ผลการตรวจสอบเบื้องต้นในระยะนี้ เพื่อช่วยให้ผู้ป้องกันเข้าใจเหตุการณ์ที่เกิดขึ้น และใช้เป็นข้อมูลอ้างอิงในการประเมินขีดความสามารถของโมเดลในปัจจุบัน เราจะยังคงดำเนินการตรวจสอบอย่างละเอียดร่วมกับ Hugging Face ต่อไป และจะแชร์รายละเอียดเพิ่มเติมเกี่ยวกับช่องโหว่ เหตุการณ์ และผลการตรวจสอบเมื่อการตรวจสอบของเราเสร็จสิ้น
เหตุการณ์นี้เกิดขึ้นระหว่างการประเมินภายใน ซึ่งกระตุ้นให้โมเดลดำเนินการใช้ประโยชน์จากช่องโหว่ขั้นสูงผ่านเส้นทางการโจมตีที่ซับซ้อน เพื่อวัดขีดความสามารถด้านไซเบอร์ของโมเดลในเชิงปริมาณ เราประเมินขีดความสามารถด้านไซเบอร์สูงสุดของโมเดล โดยไม่ใช้ตัวจำแนกที่ใช้ในระบบจริงซึ่งมีหน้าที่ป้องกันไม่ให้โมเดลดำเนินกิจกรรมด้านไซเบอร์ที่มีความเสี่ยงสูง การประเมินตามเกณฑ์มาตรฐานของเราดำเนินการในสภาพแวดล้อมที่มีการแยกออกจากระบบอื่นอย่างเข้มงวด โดยอนุญาตให้เข้าถึงเครือข่ายได้เฉพาะการติดตั้งแพ็กเกจผ่านซอฟต์แวร์ของบุคคลที่สามที่โฮสต์ภายในระบบ ซึ่งทำหน้าที่เป็นพร็อกซีและแคชสำหรับรีจิสทรีของแพ็กเกจ
โมเดลสามารถค้นพบและเชื่อมโยงช่องโหว่ที่ครอบคลุมทั้งสภาพแวดล้อมการวิจัยของ OpenAI และโครงสร้างพื้นฐานระบบจริงของ Hugging Face จนสามารถเข้าถึงคำตอบของชุดทดสอบได้โดยตรงจากฐานข้อมูลระบบจริงของ Hugging Face หลักฐานทั้งหมดชี้ให้เห็นว่าโมเดลจดจ่อกับการหาคำตอบของ ExploitGym เป็นพิเศษ และยอมทำทุกวิถีทางเพื่อให้บรรลุเป้าหมายการทดสอบที่ค่อนข้างเฉพาะเจาะจง
ขณะทำงานภายในสภาพแวดล้อมทดสอบแบบแซนด์บ็อกซ์ของเรา โมเดลใช้กำลังประมวลผลสำหรับการอนุมานไปเป็นจำนวนมากในการค้นหาวิธีเข้าถึงอินเทอร์เน็ตสาธารณะ โดยมีเป้าหมายเพื่อแก้โจทย์การประเมิน เพื่อให้เข้าถึงระบบได้ โมเดลได้ค้นพบและใช้ประโยชน์จากช่องโหว่แบบ Zero-day ในพร็อกซีแคชของรีจิสทรีแพ็กเกจ โดยขณะนี้เราได้แจ้งช่องโหว่ดังกล่าวแก่ผู้พัฒนาซอฟต์แวร์ตามแนวทางการเปิดเผยช่องโหว่อย่างมีความรับผิดชอบแล้ว เมื่อได้สิทธิ์เข้าถึงดังกล่าวแล้ว โมเดลได้ดำเนินการยกระดับสิทธิ์และเคลื่อนที่ข้ามระบบหลายครั้งในสภาพแวดล้อมการทดสอบวิจัย จนกระทั่งสามารถเข้าไปถึงโหนดที่เชื่อมต่ออินเทอร์เน็ตได้
หลังจากเข้าถึงอินเทอร์เน็ตได้แล้ว โมเดลจึงคาดการณ์ว่า Hugging Face อาจเป็นแหล่งจัดเก็บโมเดล ชุดข้อมูล และคำตอบของ ExploitGym เมื่อทราบเช่นนั้น โมเดลจึงค้นหาวิธีเข้าถึงข้อมูลลับและสามารถทำได้สำเร็จ เพื่อนำข้อมูลดังกล่าวไปใช้ในการโกงการประเมิน ตัวอย่างหนึ่งแสดงให้เห็นว่าโมเดลเชื่อมโยงวิธีการโจมตีหลายรูปแบบเข้าด้วยกัน รวมถึงการใช้ข้อมูลรับรองที่ขโมยมาและช่องโหว่แบบ Zero-day เพื่อหาช่องทางรันโค้ดจากระยะไกลบนเซิร์ฟเวอร์ของ Hugging Face ทีมรักษาความปลอดภัยของ OpenAI ตรวจพบกิจกรรมที่ผิดปกตินี้ภายในองค์กร
ทีมรักษาความปลอดภัยและเอเจนต์ของ Hugging Face ตรวจพบและหยุดยั้งกิจกรรมดังกล่าวบนโครงสร้างพื้นฐานของตนได้ พร้อมทั้งเริ่มดำเนินการควบคุมสถานการณ์และวิเคราะห์เหตุการณ์ย้อนหลังด้วยโมเดลโอเพนซอร์สของตนเอง ก่อนที่ทีมของเราจะเริ่มประสานงานร่วมกัน เรากำลังทำงานร่วมกับพวกเขาอย่างแข็งขันเพื่อดำเนินการตรวจสอบเหตุการณ์นี้ต่อไป เราขอขอบคุณ Hugging Face สำหรับการประสานงานอย่างรวดเร็วและความร่วมมืออย่างใกล้ชิดในการตรวจสอบและแก้ไขเหตุการณ์ครั้งนี้
- ในฐานะส่วนหนึ่งของการตรวจสอบ เรากำลังใช้มาตรการควบคุมที่เข้มงวดในการกำหนดค่าโครงสร้างพื้นฐาน แม้จะต้องแลกกับความเร็วในการวิจัยที่ลดลงในช่วงที่กำลังแก้ไขช่องโหว่เหล่านี้ก็ตาม เรารายงานข้อมูลเกี่ยวกับมาตรการควบคุมเหล่านี้และผลกระทบที่เกิดขึ้นต่อคณะกรรมการด้านความปลอดภัยและการรักษาความปลอดภัยอย่างสม่ำเสมอ
- เรากำลังร่วมมือกับ Hugging Face เพื่อสืบสวนและตรวจสอบหลักฐานทางนิติวิทยาศาสตร์ของเหตุการณ์ที่เกิดขึ้น
- เราได้เปิดเผยช่องโหว่แบบ Zero-day ที่ตรวจพบในซอฟต์แวร์ของบุคคลที่สามซึ่งโฮสต์ภายในระบบของเราตามแนวทางการเปิดเผยข้อมูลอย่างมีความรับผิดชอบ และกำลังทำงานร่วมกับผู้พัฒนาซอฟต์แวร์เพื่อออกแพตช์แก้ไข
- เราได้ให้ Hugging Face เข้าร่วมโครงการการเข้าถึงที่เชื่อถือได้ พร้อมสนับสนุนทีมของ Hugging Face ในการนำความสามารถของโมเดลของเราไปใช้เพื่อเสริมความแข็งแกร่งให้ระบบป้องกันได้อย่างรวดเร็ว
- เรากำลังปรับปรุงและเพิ่มมาตรการปกป้องที่ดียิ่งขึ้นสำหรับการฝึกและการประเมินโมเดลในอนาคต สัปดาห์นี้ เราเผยแพร่บทความเรื่อง การพัฒนาความปลอดภัยและการจัดแนวพฤติกรรมในยุคของโมเดลที่รองรับงานระยะยาว มาตรการป้องกันสำหรับการนำโมเดลไปใช้งานจริงเหล่านี้ถูกปิดไว้โดยเจตนาระหว่างการประเมินครั้งนี้ เพราะการประเมินมีวัตถุประสงค์เพื่อทดสอบช่องโหว่ด้านความมั่นคงปลอดภัยทางไซเบอร์ เหตุการณ์ครั้งนี้ชี้ให้เห็นว่าเราจำเป็นต้องเสริมความแข็งแกร่งให้กับการปรับพฤติกรรมโมเดลให้สอดคล้องกับเป้าหมายของมนุษย์ การป้องกันด้านความมั่นคงปลอดภัยไซเบอร์ระหว่างการประเมิน และการติดตามตรวจสอบระหว่างการทดสอบภายในให้มากยิ่งขึ้น
ตามที่เราได้แชร์ไปเมื่อเร็วๆ นี้ AI กำลังทำให้ทั้งการค้นพบช่องโหว่และการใช้ประโยชน์จากช่องโหว่เพื่อการโจมตีเกิดขึ้นได้รวดเร็วยิ่งขึ้น บทเรียนหลักจากเหตุการณ์นี้คือ ความมั่นคงและความปลอดภัยของโมเดลต้องก้าวให้ทันขีดความสามารถที่พัฒนาไปอย่างรวดเร็ว เรากำลังเสริมความเข้มแข็งให้กับแนวทางปฏิบัติด้านการควบคุม การเฝ้าติดตาม การควบคุมการเข้าถึง และการประเมินผลที่ใช้ระหว่างการพัฒนาโมเดล
การประเมินของ UK AISI แสดงให้เห็นว่าโมเดลต่างๆ เช่น GPT‑5.6 Sol สามารถดำเนินปฏิบัติการด้านความมั่นคงปลอดภัยไซเบอร์ที่ซับซ้อนและมีหลายขั้นตอนได้ต่อเนื่องเป็นเวลานานมากขึ้น เหตุการณ์ครั้งนี้ชี้ให้เห็นว่าความสามารถที่เคยเป็นเพียงทฤษฎีเหล่านี้สามารถเกิดขึ้นได้จริงในสถานการณ์จริง

เหตุการณ์นี้ยังทำให้เห็นได้ชัดว่าโมเดลขั้นสูงสามารถค้นพบและใช้ประโยชน์จากเส้นทางการโจมตีรูปแบบใหม่ในระบบจริงได้โดยไม่ต้องเข้าถึงซอร์สโค้ด เหตุการณ์นี้ชี้ให้เห็นว่าความสามารถด้านความมั่นคงปลอดภัยทางไซเบอร์ขั้นสูงควรได้รับการพัฒนาไปพร้อมกับมาตรการปกป้องและเครื่องมือด้านการป้องกันที่มีประสิทธิภาพยิ่งขึ้น
เราเชื่อว่าโมเดลที่มีความสามารถด้านความมั่นคงปลอดภัยทางไซเบอร์ขั้นสูงควรช่วยให้ทีมรักษาความปลอดภัยค้นพบจุดอ่อนก่อนที่ผู้โจมตีจะพบ พร้อมเข้าใจว่าช่องโหว่สามารถเชื่อมโยงกันเพื่อใช้โจมตีได้อย่างไร และแก้ไขได้ด้วยความเร็วระดับเครื่อง เรากำลังใช้ความสามารถเหล่านี้เพื่อเสริมความแข็งแกร่งให้กับการป้องกันเกี่ยวกับการกำหนดค่าโครงสร้างพื้นฐานและสภาพแวดล้อมการประเมินโมเดลอย่างต่อเนื่อง เราจะแชร์ผลการค้นพบและแนวทางปฏิบัติที่ดีที่สุดเมื่อเราได้เรียนรู้เพิ่มเติม เราขอเชิญชวนให้ผู้ป้องกันภัยรายอื่นๆ สมัครขอรับสิทธิ์การเข้าถึงที่เชื่อถือได้ และทดลองใช้โมเดลเหล่านี้ตั้งแต่ตอนนี้ เพื่อนำความสามารถเหล่านี้ไปต่อยอดเป็นการป้องกันที่ดียิ่งขึ้น การตรวจจับที่รวดเร็วยิ่งขึ้น และการตอบสนองต่อเหตุการณ์ที่มีประสิทธิภาพยิ่งขึ้น
“เราขอขอบคุณ OpenAI สำหรับความร่วมมือในเรื่องนี้ รวมถึงความร่วมมือในด้านอื่นๆ เหตุการณ์ครั้งนี้ซึ่งอาจเป็นเหตุการณ์แรกในลักษณะนี้ ตอกย้ำสิ่งที่เราเชื่อมาโดยตลอดว่า ความปลอดภัยของ AI ไม่อาจเกิดขึ้นได้จากการที่บริษัทใดบริษัทหนึ่งทำงานเพียงลำพังอย่างลับๆ แต่จะเกิดขึ้นได้จากการทำงานร่วมกันอย่างเปิดกว้าง พร้อมเปิดโอกาสให้ผู้ป้องกันทุกคนทั่วโลกเข้าถึง AI ได้อย่างทั่วถึง”


