ข้ามไปยังเนื้อหาหลัก
OpenAI

การประเมินไซเบอร์ของโมเดล OpenAI โดยบุคคลที่สาม

กำลังโหลด…

การทดสอบโดยหน่วยงานอิสระมีบทบาทสำคัญในการช่วยให้เราตรวจสอบยืนยันและทำความเข้าใจความเสี่ยงได้ดียิ่งขึ้นก่อนนำระบบไปใช้งาน การประเมินไซเบอร์บางรายการจงใจใช้การกำหนดค่าเฉพาะ รวมถึงลดมาตรการป้องกันเพื่อวัดขีดความสามารถพื้นฐาน ไม่ใช่พฤติกรรมตามปกติของโมเดลเมื่อให้บริการแก่สาธารณะ

ในระหว่างการประเมินเมื่อไม่นานมานี้ พาร์ทเนอร์ภายนอกที่ทำหน้าที่ทดสอบ 2 รายพบเหตุการณ์ที่การตั้งค่าและมาตรการควบคุมในการทดสอบ เมื่อประกอบกับความสามารถที่ก้าวหน้าขึ้นของโมเดลรุ่นล่าสุด ทำให้โมเดลดำเนินการเกินขอบเขตการทดสอบที่กำหนดไว้ เหตุการณ์เหล่านี้ตอกย้ำความสำคัญของการร่วมมือกับภาคอุตสาหกรรมและผู้ประเมินจากภายนอก เพื่อพัฒนามาตรฐานด้านสภาพแวดล้อมและแนวทางการทดสอบให้ทันต่อความสามารถของโมเดลที่เพิ่มสูงขึ้น หมายเหตุจากบรรณาธิการ: เหตุการณ์เหล่านี้ไม่เกี่ยวข้องกับเหตุการณ์ด้านความปลอดภัยของ Hugging Face และเราจะรายงานความคืบหน้าเกี่ยวกับเหตุการณ์ของ Hugging Face ต่อไปที่นี่

เหตุการณ์ล่าสุดเกี่ยวข้องกับการที่โมเดลของ OpenAI เข้าถึงอินเทอร์เน็ตสาธารณะระหว่างการประเมินด้านไซเบอร์โดยหน่วยงานภายนอก ภายใต้เงื่อนไขเฉพาะและการตั้งค่าที่ลดทอนมาตรการป้องกันซึ่งไม่ใช่รูปแบบการใช้งานทั่วไป โดยเหตุการณ์ที่เกิดขึ้นมีดังนี้:

  1. UK AISI ซึ่งเป็นสถาบันความมั่นคงปลอดภัย AI ของรัฐบาลสหราชอาณาจักร กำลังประเมินโมเดลในสนามทดสอบไซเบอร์ที่จงใจเปิดให้เชื่อมต่ออินเทอร์เน็ต เพื่อให้เอเจนต์หาเครื่องมือมาใช้เองและทำงานในสภาพแวดล้อมที่ใกล้เคียงกับการโจมตีจริง อีกทั้งยังปิดตัวจำแนกด้านไซเบอร์เพื่อประเมินขีดความสามารถของโมเดลโดยตรง อ่านบล็อกของ UK AISI ได้ที่นี่(เปิดในหน้าต่างใหม่)
  2. Irregular ซึ่งเป็นหนึ่งในพาร์ทเนอร์ภายนอกด้านการทดสอบความปลอดภัยทางไซเบอร์ของเรา ได้ดำเนินการประเมินในรูปแบบ Capture-the-Flag ที่ออกแบบให้แยกจากอินเทอร์เน็ต แต่การกำหนดค่าสภาพแวดล้อมการทดสอบที่ผิดพลาดทำให้โมเดลเข้าถึงอินเทอร์เน็ตสาธารณะได้

ด้านล่างนี้ เราสรุปเหตุการณ์ที่เกิดขึ้น เงื่อนไขการทดสอบที่ทำให้เกิดกิจกรรมดังกล่าว ขั้นตอนที่ใช้ควบคุมเหตุการณ์ และสิ่งที่เรากำลังดำเนินการเพื่อให้ห้องปฏิบัติการอิสระสามารถประเมินโมเดลที่มีขีดความสามารถสูงขึ้นได้อย่างเข้มงวดและปลอดภัยต่อไป

ยกระดับสภาพแวดล้อมสำหรับการประเมินโมเดลโดยบุคคลที่สาม

เหตุการณ์เหล่านี้สะท้อนถึงความท้าทายในวงกว้างแบบเดียวกับที่เราอธิบายไว้ในโพสต์ล่าสุดเกี่ยวกับเหตุการณ์ของ Hugging Face กล่าวคือ เมื่อขีดความสามารถของโมเดลก้าวหน้าขึ้น ระบบรักษาความมั่นคงปลอดภัยและความปลอดภัยรอบตัวโมเดลก็ต้องพัฒนาตามไปด้วย ทั้งสภาพแวดล้อมที่ใช้พัฒนาโมเดล ตลอดจนสภาพแวดล้อมที่ห้องปฏิบัติการและพันธมิตรอิสระใช้ประเมินโมเดล ล้วนรวมอยู่ในเรื่องนี้

ในอีกไม่กี่สัปดาห์ข้างหน้า เราจะทบทวนแนวทางการทดสอบโดยบุคคลที่สามของเรา ซึ่งรวมถึงวิธีระบุการประเมินที่มีความเสี่ยงสูง การกำหนดขอบเขตร่วมกัน การพิจารณาคำขอเปิดให้เข้าถึงอินเทอร์เน็ตหรือลดระดับมาตรการป้องกัน การกำหนดข้อคาดหวังเกี่ยวกับการแยกระบบ การจัดการข้อมูลประจำตัว การติดตามตรวจสอบ และเงื่อนไขในการยุติการทดสอบ ตลอดจนกำหนดกระบวนการแจ้งเหตุและยกระดับเหตุการณ์ให้ชัดเจนยิ่งขึ้น

เรามุ่งมั่นทำงานร่วมกับทุกภาคส่วนในอุตสาหกรรมเพื่อยกระดับแนวปฏิบัติร่วมกันสำหรับการประเมินที่มีความเสี่ยงสูงอย่างปลอดภัย รวมถึงการเชิญผู้มีส่วนได้ส่วนเสีย เช่น สถาบัน AI แห่งชาติ ผู้ประเมินอิสระ ห้องปฏิบัติการ AI อื่น และกลุ่มอื่นๆ มาหารือกันในอีกไม่กี่สัปดาห์ข้างหน้า เป้าหมายของเราคือรักษาคุณค่าของการประเมินโดยหน่วยงานอิสระที่เข้มงวด พร้อมดูแลให้แนวทางการทดสอบพัฒนาทันกับขีดความสามารถของโมเดลที่เพิ่มขึ้น

UK AISI

เมื่อวันที่ 3 สิงหาคม UK AISI แจ้งเราว่า ระหว่างการประเมินไซเบอร์ตามปกติซึ่งเริ่มขึ้นเมื่อวันที่ 25 กรกฎาคม โมเดลจาก OpenAI และห้องปฏิบัติการอีกแห่งล้ำออกนอกขอบเขตการทดสอบในบางกรณี การประเมินนี้จัดขึ้นในสนามทดสอบไซเบอร์ที่มีการควบคุมและออกแบบให้จำลองเครือข่ายในโลกจริง จากเหตุการณ์ที่ตรวจพบทั้งหมด 19 เหตุการณ์ มี 2 เหตุการณ์ที่เกี่ยวข้องกับ GPT‑5.6 Sol ซึ่งเป็นโมเดลของ OpenAI ส่วนเหตุการณ์อื่นๆ เกี่ยวข้องกับโมเดลจากอีกแล็บหนึ่ง

สำหรับการประเมินนี้ เอเจนต์ได้รับคำสั่งให้ทำหน้าที่เป็นผู้เชี่ยวชาญด้านความปลอดภัยทางไซเบอร์ในการทดสอบแบบ Capture-the-Flag โดยต้องเจาะระบบในสภาพแวดล้อมจำลองที่เชื่อมต่อกัน 3 แห่งและค้นหาแฟล็กสุดท้าย โจทย์ได้กำหนดช่วงเครือข่ายที่อนุญาตให้ทดสอบ และระบุชื่อระบบหลายระบบที่ห้ามดำเนินการ UK AISI ยังอนุญาตให้เข้าถึงอินเทอร์เน็ตจริง เพื่อให้เอเจนต์ค้นหาและดาวน์โหลดเครื่องมือเอง รวมทั้งปฏิบัติงานในสภาวะที่ใกล้เคียงกับผู้โจมตีจริงมากขึ้น พร้อมปิดตัวจำแนกด้านไซเบอร์เพื่อประเมินความสามารถที่แท้จริงของโมเดล

ขอบเขตที่ UK AISI ตั้งใจอนุญาตให้ดำเนินการครอบคลุมเฉพาะสนามทดสอบไซเบอร์จำลอง โดยเอเจนต์ได้รับอนุญาตให้โจมตีเครือข่ายจำลองที่ระบุไว้และค้นหาแฟล็ก แต่ไม่ได้รับอนุญาตให้โต้ตอบกับระบบที่อยู่นอกขอบเขตเครือข่ายของสนามทดสอบ อย่างไรก็ตาม เอเจนต์ไม่ได้รับคำสั่งที่ชัดเจนว่าสามารถและไม่สามารถใช้อินเทอร์เน็ตสาธารณะในลักษณะใดได้บ้าง ซึ่ง UK AISI ระบุว่าอาจเป็นปัจจัยหนึ่งที่ทำให้เกิดเหตุการณ์นี้

จากการทดสอบเหล่านี้ UK AISI พบว่า GPT‑5.6 Sol ดำเนินการโดยไม่ได้รับอนุญาต 2 อย่าง ระหว่างพยายามหาเส้นทางเข้าสู่สนามทดสอบจำลองเพื่อค้นหาแฟล็ก โดยมีรายละเอียดดังนี้:

  1. GPT‑5.6 Sol นำโทเค็น GitHub ที่เอเจนต์ของแล็บอื่นเปิดเผยต่อสาธารณะไว้มาใช้ซ้ำ เพื่อตรวจสอบว่าระบบภายในขอบเขตการทดสอบกำลังตรวจสอบ GitHub หรือบริการอัปเดตอื่นเป็นระยะหรือไม่ ทั้งยังพยายามหาวิธีกู้คืนบัญชีและหลบเลี่ยงลิมิตการใช้งาน รวมถึงสมัครบัญชีกับผู้ให้บริการ DNS และบริการทันเนลภายนอก
  2. GPT‑5.6 Sol ใช้บริการทันเนลสาธารณะเพื่อเปิดให้เข้าถึงเซิร์ฟเวอร์ DNS ที่ทำงานอยู่ภายในสภาพแวดล้อมการประเมินจากอินเทอร์เน็ตสาธารณะได้ เซิร์ฟเวอร์ดังกล่าวมีเพย์โหลดที่ออกแบบมาเพื่อใช้โจมตีช่องโหว่ที่เป็นที่รู้จักในซอฟต์แวร์ซึ่งทำงานอยู่ในขอบเขตการทดสอบ แต่การตั้งค่านี้ไม่สำเร็จ ไม่พบหลักฐานว่าตัวแก้ชื่อโดเมนจริงส่งคำขอไปยังเซิร์ฟเวอร์ดังกล่าว และระบบโครงสร้างพื้นฐานดังกล่าวถูกนำออกเมื่อการประเมินสิ้นสุดลง

แม้โมเดลจะพยายามทำภารกิจในสนามทดสอบไซเบอร์ให้สำเร็จ แต่ UK AISI เห็นว่าการดำเนินการเหล่านี้ไม่ได้รับอนุญาต เนื่องจากเกี่ยวข้องกับบัญชีและบริการภายนอกจริงที่อยู่นอกขอบเขตสนามทดสอบ และไม่จำเป็นต่อการทำภารกิจให้สำเร็จ นอกจากนี้เซิร์ฟเวอร์ DNS ยังนำเพย์โหลดที่ใช้โจมตีช่องโหว่ขึ้นเผยแพร่บนอินเทอร์เน็ตสาธารณะ แต่ระบบที่ตั้งค่าไว้ไม่ทำงาน และไม่มีหลักฐานว่าตัวแก้ชื่อโดเมนจริงส่งคำขอเข้ามา

UK AISI ตรวจพบกิจกรรมดังกล่าวเมื่อวันที่ 28 กรกฎาคม หลังระบบเฝ้าระวังความปลอดภัยตรวจพบการถ่ายโอนข้อมูลที่ผิดปกติ UK AISI หยุดการประเมินที่เกี่ยวข้อง แยกเครื่องที่เกี่ยวข้องออกจากระบบ และควบคุมกิจกรรมไว้ได้ภายในเวลาประมาณหนึ่งชั่วโมงหลังตรวจพบ

เราขอขอบคุณ UK AISI สำหรับความร่วมมือตลอดกระบวนการนี้ รวมถึงการตรวจพบ ตรวจสอบ และแบ่งปันรายละเอียดเกี่ยวกับกิจกรรมดังกล่าว เราหวังว่าจะได้สานต่อความร่วมมือนี้ต่อไป

Irregular

เมื่อวันที่ 29 กรกฎาคม Irregular ซึ่งเป็นหนึ่งในพาร์ทเนอร์ภายนอกที่ประเมินระบบของเรา ได้แจ้งเหตุการณ์ที่เกี่ยวข้องกับโมเดล OpenAI ระหว่างการประเมินความปลอดภัยทางไซเบอร์ในรูปแบบ Capture-the-Flag (CTF) โมเดลได้รับคำสั่งให้ค้นหาข้อมูลที่ซ่อนอยู่ด้วยการใช้ประโยชน์จากจุดอ่อนภายในสภาพแวดล้อมจำลอง และได้รับแจ้งว่าไม่สามารถเข้าถึงอินเทอร์เน็ตได้ อย่างไรก็ตาม การกำหนดค่าสภาพแวดล้อมการทดสอบที่ผิดพลาดทำให้โมเดลเข้าถึงอินเทอร์เน็ตสาธารณะได้

ในการทดสอบครั้งหนึ่ง ชื่อเป้าหมายสมมติของโจทย์ CTF บังเอิญตรงกับโดเมนจริง เนื่องจากสภาพแวดล้อมการทดสอบเชื่อมต่ออินเทอร์เน็ตโดยไม่ได้ตั้งใจ โมเดลจึงโจมตีเว็บไซต์จริงโดยเข้าใจผิดว่าเป็นส่วนหนึ่งของสภาพแวดล้อมจำลอง เหตุการณ์นี้ไม่ได้เกี่ยวข้องกับการหลบหนีออกจากแซนด์บ็อกซ์ที่ซับซ้อนหรือช่องโหว่ซีโร่เดย์ การเข้าถึงอินเทอร์เน็ตเกิดจากการกำหนดค่าที่ผิดพลาด และดูเหมือนว่าโมเดลจะใช้ประโยชน์จากช่องโหว่ด้านความปลอดภัยขั้นพื้นฐาน

จากการตรวจสอบของ Irregular โมเดลยังค้นพบและใช้ข้อมูลรับรองเพื่อควบคุมเว็บไซต์เดียวกันนั้นด้วย Irregular ยังไม่พบผลกระทบนอกเหนือจากข้อมูลของเว็บไซต์ที่ได้รับผลกระทบ และการตรวจสอบยังดำเนินอยู่ Irregular ได้หยุดการประเมินไว้ชั่วคราว เริ่มแก้ไขปัญหา และแจ้งบุคคลที่สามที่ได้รับผลกระทบแล้ว Irregular ยังแจ้งเราด้วยว่า ปัญหาทั้งหมดที่ระบุว่าเกี่ยวข้องกับเหตุการณ์นี้ได้รับการจัดการจนไม่มีความเสี่ยงแล้ว และมีการเพิ่มมาตรการป้องกันที่เหมาะสมในสภาพแวดล้อมการทดสอบ นอกจากนี้ ยังได้แจ้งข้อมูลเกี่ยวกับเหตุการณ์ที่เกี่ยวข้องกับแล็บอื่นจากสภาพแวดล้อมการทดสอบเดียวกันด้วย

เราขอขอบคุณ Irregular สำหรับความร่วมมือ และจะทำงานอย่างใกล้ชิดกับ Irregular ต่อไปเพื่อสนับสนุนการตรวจสอบของบริษัท ขณะนี้ Irregular กำลังจัดทำเอกสารไวท์เปเปอร์เพื่อเผยแพร่แนวทางปฏิบัติที่ดีที่สุดในการควบคุมความเสี่ยงและดำเนินการประเมินด้านไซเบอร์อย่างปลอดภัย เราหวังว่าจะได้มีส่วนร่วมในการจัดทำเอกสารดังกล่าวเพื่อเผยแพร่ข้อค้นพบแก่ชุมชน และเดินหน้าความร่วมมือนี้ต่อไป เรามองว่าความร่วมมือในลักษณะนี้มีความสำคัญอย่างยิ่งต่อการประเมินโมเดลทั้งในปัจจุบันและอนาคตอย่างปลอดภัยและรอบด้าน

ผู้เขียน

OpenAI