ข้ามไปยังเนื้อหาหลัก
OpenAI

สกัดปฏิบัติการร่วมกันกลั่นความรู้จากโมเดล

กำลังโหลด…

เมื่อไม่นานมานี้ เราตรวจพบและสกัดปฏิบัติการที่มีผู้ร่วมมือกันลอบดึงข้อมูลการให้เหตุผลภายในที่โมเดลของเราปกป้องไว้ โดยพบความเคลื่อนไหวครั้งแรกในสัปดาห์แรกของเดือนกรกฎาคม พฤติกรรมนี้เข้าข่ายการกลั่นความรู้จากโมเดลโดยมุ่งร้าย ซึ่งหมายถึงการนำคำตอบหรือข้อมูลการให้เหตุผลของโมเดลหนึ่งไปใช้อย่างเป็นระบบโดยไม่ได้รับอนุญาต เพื่อฝึก สร้างเลียนแบบ หรือปรับปรุงอีกโมเดลหนึ่ง ข้อมูลการให้เหตุผลที่โมเดลปกป้องไว้คือบันทึกขั้นตอนการคิดภายในระหว่างทำงาน หากดึงข้อมูลนี้ออกมาได้ ก็อาจเห็นข้อมูลที่โมเดลไม่ได้เปิดเผยในคำตอบสุดท้าย และนำไปใช้เลียนแบบความสามารถของโมเดลได้

ผู้ดำเนินการไม่ได้เจาะระบบเข้ารหัส บุกรุกฐานข้อมูล หรือเข้าถึงบทสนทนาของผู้ใช้ที่จัดเก็บไว้โดยตรง แต่พวกเขาใช้กลวิธีในการโต้ตอบกับโมเดล เพื่อให้โมเดลแสดงข้อมูลการให้เหตุผลภายในที่ปกป้องไว้ออกมาให้ผู้ส่งคำขอเห็น โดยประสานงานกันทำในวงกว้าง ซึ่งละเมิดข้อกำหนดการให้บริการของเรา โมเดลของ OpenAI ไม่ใช่โมเดลเดียวที่มีช่องโหว่ลักษณะนี้ เราได้แบ่งปันข้อมูลผ่าน Frontier Model Forum กับพันธมิตรในอุตสาหกรรม เพื่อเพิ่มความแข็งแกร่งให้การป้องกันร่วมกันจากการกลั่นความรู้จากโมเดลโดยมีเจตนามุ่งร้าย

ก่อนเปิดเผยข้อมูล เราได้ตรวจสอบว่าเหตุการณ์เกิดขึ้นในวงกว้างเพียงใดและอาจมีผลกระทบอะไรบ้าง พร้อมใช้มาตรการลดความเสี่ยงของเราเอง และแลกเปลี่ยนข้อมูลพร้อมรับฟังความคิดเห็นจากนักวิจัยและพันธมิตรในอุตสาหกรรม เพื่อให้แน่ใจว่ามีการป้องกันการโจมตีประเภทนี้แล้ว เรายังคงตรวจสอบและดำเนินมาตรการลดความเสี่ยงเพิ่มเติมต่อไป เราเชื่อว่าการแบ่งปันสิ่งที่ได้เรียนรู้ในตอนนี้จะช่วยให้ผู้เกี่ยวข้องในวงการเสริมการป้องกันของตนได้

สิ่งที่เราพบ

เราพบว่าผู้ดำเนินการพยายามใช้วิธีใหม่ๆ ดึงข้อมูลการให้เหตุผลภายในที่โมเดลปกป้องไว้ เช่น คัดลอกข้อมูลการให้เหตุผลที่เข้ารหัสไว้จากบทสนทนาหนึ่ง แล้วนำไปให้โมเดลในอีกบทสนทนาถอดรหัสและเขียนเนื้อหาที่ซ่อนอยู่ออกมาเป็นข้อความ

นักวิจัยด้านความปลอดภัยอิสระ⁠(เปิดในหน้าต่างใหม่)ยังรายงานช่องโหว่ที่เกี่ยวข้องกับการใช้งานข้ามโมเดลและการย่อบริบทของบทสนทนา ผ่านกระบวนการเปิดเผยช่องโหว่อย่างมีความรับผิดชอบ หลังตรวจสอบเราพบว่าวิธีโจมตีที่พวกเขาระบุไว้ใช้ได้จริง ผลงานของพวกเขาช่วยให้เราเข้าใจภาพรวมของการโจมตีประเภทนี้มากขึ้น และดำเนินมาตรการลดความเสี่ยงได้เร็วขึ้น

กิจกรรมนี้เริ่มขึ้นเมื่อวันที่ 1 กรกฎาคม โดยช่วงแรกมีคำขอไม่มากนัก ก่อนที่เราจะพบว่าปริมาณพุ่งสูงขึ้นในวันที่ 24 และ 25 กรกฎาคม มีคำขอที่ใช้รูปแบบการดึงข้อมูลดังกล่าวรวม 16,000 ครั้ง1 จากผู้ใช้กว่า 4,000 ราย เมื่อตรวจสอบเพิ่มเติม เราพบการใช้พรอมต์รูปแบบที่เกี่ยวข้องกันในกลุ่มผู้ใช้กว่า 15,000 ราย และสกัดกิจกรรมทั้งหมดนี้ได้ภายในวันที่ 28 กรกฎาคม

วิธีการที่ใช้ในปฏิบัติการนี้เปลี่ยนไปเรื่อยๆ ตอกย้ำว่าการกลั่นความรู้จากโมเดลโดยมุ่งร้ายเป็นปัญหาด้านความปลอดภัยในวงกว้าง ซึ่งต้องใช้มาตรการป้องกันหลายชั้นและปรับให้ทันกับวิธีโจมตีที่เปลี่ยนไป

การประเมินว่าใครอยู่เบื้องหลังการโจมตีนี้

เรายังไม่ทราบแน่ชัดว่าผู้ดำเนินการทั้งหมดที่พบในช่วงเวลาดังกล่าวมีผู้บงการรายเดียวกันหรือไม่ อย่างไรก็ตาม เราประเมินว่าบุคคลที่เกี่ยวข้องกับ Moonshot AI ซึ่งเป็นผู้พัฒนา Kimi อยู่เบื้องหลังกิจกรรมกลุ่มหลักที่เราตรวจพบ

เหตุใดเรื่องนี้จึงสำคัญ

การกลั่นความรู้จากโมเดลโดยมุ่งร้ายก่อให้เกิดความเสี่ยงต่อความปลอดภัยและความมั่นคงของชาติ ผู้อื่นอาจนำข้อมูลการให้เหตุผลที่ดึงออกมาไปฝึกโมเดลอื่น โดยไม่นำมาตรการป้องกันที่กำกับคำตอบของโมเดลต้นฉบับมาใช้ด้วย เมื่อทำเช่นนี้ในวงกว้าง ความสามารถขั้นสูงก็อาจถ่ายทอดไปได้รวดเร็วขึ้น โดยไม่ต้องลงทุนด้านความปลอดภัยในระดับเดียวกัน ความเสี่ยงนี้ยิ่งน่ากังวลเมื่อโมเดลมีความสามารถมากขึ้นในด้านที่ใช้ได้ทั้งในทางที่เป็นประโยชน์และในทางที่ก่ออันตราย

ความเสี่ยงนี้ไม่ได้เกิดขึ้นกับ OpenAI เพียงแห่งเดียว ดังที่กล่าวไว้ข้างต้น เทคนิคที่คล้ายกันอาจส่งผลต่อระบบ AI ขั้นสูงอื่นๆ ด้วย จึงเป็นความท้าทายด้านความปลอดภัยร่วมกันที่ต้องอาศัยการประสานงานทั่วทั้งอุตสาหกรรม

วิธีที่เรารับมือ

เรารับมือกับผลกระทบจากปฏิบัติการกลั่นความรู้จากโมเดลครั้งล่าสุดโดยจัดการบัญชีที่ละเมิดข้อกำหนด ใช้มาตรการควบคุมทางเทคนิค และประสานงานกับพันธมิตร ควบคู่กับการระงับหรือจำกัดบัญชีที่ใช้ทุจริต เสริมมาตรการควบคุมการสมัครใช้งานและโครงสร้างพื้นฐาน และขยายขอบเขตการเฝ้าระวังเครือข่ายที่เกี่ยวข้อง

เราเพิ่มมาตรการปกป้องข้อมูลการให้เหตุผลที่ซ่อนอยู่ ไม่ว่าจะเป็นการใช้งานข้ามผู้ใช้ เวิร์กสเปซ องค์กร หรือตระกูลโมเดล เราปิดช่องทางที่ทำให้ผู้ที่ครอบครองข้อมูลการให้เหตุผลที่เข้ารหัสไว้ของผู้ใช้อื่นนำข้อมูลนั้นมาส่งให้โมเดลอีกครั้งเพื่อให้แสดงเนื้อหาภายในได้ พร้อมเพิ่มการตรวจสอบเพื่อตรวจจับและพักการส่งผลลัพธ์แบบสตรีมที่อาจเปิดเผยข้อมูลการให้เหตุผล เมื่อพบกิจกรรมที่เกี่ยวข้องผ่านบริการของบุคคลที่สาม เราก็ร่วมมือกับผู้ให้บริการเหล่านั้นเพื่อระบุบัญชีที่เกี่ยวข้องและหยุดการใช้งานบัญชีดังกล่าว

ท้ายที่สุด เราได้แบ่งปันข้อค้นพบที่เกี่ยวข้องผ่าน Frontier Model Forum และช่องทางแบ่งปันข้อมูลของภาครัฐที่เหมาะสม เพื่อให้ผู้พัฒนาโมเดลระดับแนวหน้ารายอื่นและพันธมิตรภาครัฐสามารถตรวจหากิจกรรมที่คล้ายกันและเสริมการป้องกันของตนเองได้ ระบบที่รองรับการย้ายข้อมูลบันทึกการให้เหตุผลหรือนำข้อมูลนั้นมาประมวลผลซ้ำ อาจเผชิญความเสี่ยงในลักษณะเดียวกัน

ก้าวต่อไป

เราคาดว่าความพยายามกลั่นความรู้โดยมุ่งร้ายจะซับซ้อนยิ่งขึ้น เมื่อโมเดลระดับแนวหน้าพัฒนาขึ้น และผู้ก่อเหตุมองหาวิธีเลียนแบบความสามารถของโมเดลเหล่านี้ด้วยต้นทุนที่ต่ำกว่า การป้องกันกิจกรรมนี้ต้องอาศัยมาตรการควบคุมหลายชั้นและการปรับตัวอย่างต่อเนื่อง

งานนี้ยังไม่จบเพียงแค่นี้ บริการที่พันธมิตรเป็นผู้โฮสต์ต้องมีมาตรการป้องกันเช่นเดียวกับบริการที่เราให้บริการเอง ส่วนการโจมตีผ่านผลลัพธ์ของเครื่องมือต้องอาศัยการป้องกันที่ตรวจสอบมากกว่าแค่ข้อความทั่วไปที่มองเห็นได้ เรากำลังพัฒนาการป้องกันการโจมตีผ่านเครื่องมือให้ดีขึ้น ให้ระบบจำแนกตรวจสอบได้ครอบคลุมยิ่งขึ้น และปรับปรุงการปฏิเสธคำขอของโมเดล รวมทั้งขยายมาตรการควบคุมที่เกี่ยวข้องไปยังพันธมิตรคลาวด์

การรับมือของเราจะยังคงมุ่งเน้นสามด้าน ได้แก่ การป้องกันทางเทคนิคที่แข็งแกร่งขึ้นเพื่อสกัดการดึงข้อมูล การตรวจจับและบังคับใช้มาตรการกับปฏิบัติการที่ประสานงานกันให้มีประสิทธิภาพยิ่งขึ้น และการแบ่งปันข้อมูลภัยคุกคามระหว่างภาคอุตสาหกรรมกับภาครัฐอย่างลึกซึ้งยิ่งขึ้น

ผู้เขียน

OpenAI

เชิงอรรถ

  1. 1

    ตัวเลขเหล่านี้แสดงจำนวนครั้งที่พยายามดึงข้อมูล ไม่ได้หมายความว่าดึงข้อมูลได้สำเร็จเสมอไป