ข้ามไปยังเนื้อหาหลัก
OpenAI
กำลังโหลด…

วันนี้ เราเปิดตัว GPT‑6 Astra ซึ่งเป็นโมเดลที่มีความสามารถสูงสุดของเราที่มีการใช้งานอย่างแพร่หลาย Astra เป็นโมเดลแรกของเราที่มีขีดความสามารถด้านความปลอดภัยทางไซเบอร์ถึงระดับวิกฤตตามกรอบการเตรียมความพร้อม

ประเด็นสำคัญที่สุดเกี่ยวกับความปลอดภัยของการเปิดตัวครั้งนี้มีดังนี้:

  1. GPT‑6 Astra มีขีดความสามารถด้านไซเบอร์เพิ่มขึ้นอย่างมากและถึงเกณฑ์ระดับวิกฤตของเรา หมายความว่า หากมีเครื่องมือและสิทธิ์เข้าถึงที่เหมาะสม GPT‑6 Astra สามารถค้นหาช่องโหว่ด้านความปลอดภัยที่ไม่เคยมีการค้นพบมาก่อน และพัฒนาวิธีใหม่ๆ เพื่อเจาะช่องโหว่เหล่านั้นในระบบที่มีการป้องกันอย่างแน่นหนาหลายประเภทได้ โดยไม่จำเป็นต้องมีมนุษย์คอยกำกับในทุกขั้นตอน ด้วยเหตุนี้ เราจึงยกระดับมาตรการป้องกันอย่างมีนัยสำคัญ เพื่อป้องกันไม่ให้โมเดลดำเนินการทางไซเบอร์ที่เป็นอันตราย ไม่ว่าจะเกิดจากการใช้ในทางที่ผิดหรือการทำงานที่ไม่สอดคล้องกับเจตนาที่กำหนดไว้ นอกจากนี้ เรายังเพิ่มความปลอดภัยให้การพัฒนาและใช้งาน Astra รวมถึงโมเดลที่คล้ายกันภายในองค์กร ด้วยการแยกระบบที่เข้มงวดยิ่งขึ้น การเข้ารหัสเช็กพอยต์ การติดตามทุกลำดับการทำงานอย่างครอบคลุมรวมถึงกระบวนการคิด (CoT) และกระบวนการประเมินความสอดคล้องเพื่อสกัดกั้นความเสี่ยงก่อนใช้งานภายใน
  2. GPT‑6 Astra มีความทนทานต่อการโจมตีมากกว่าโมเดลรุ่นก่อนหน้าอย่างชัดเจน ด้วยเทคนิคใหม่ในการฝึกความปลอดภัยเพื่อเพิ่มความทนทาน GPT‑6 Astra จึงทนต่อการเจลเบรกได้มากกว่า GPT‑5.6 Sol อย่างมาก รวมถึงในการทำงานที่มีลำดับขั้นตอนที่ยาวขึ้น ข้อสรุปนี้มาจากการทดสอบแบบออฟไลน์ ตลอดจนโครงการทดสอบและแก้ไขการเจลเบรกอย่างเข้มงวดโดยผู้ทดสอบทั้งภายในและภายนอก สำหรับผู้ใช้ที่ถูกระบุว่าอาจมีความเสี่ยงสูง เรายังฝึกให้ระบบสามารถปรับเกณฑ์การปฏิเสธของโมเดลให้รัดกุมขึ้น และครอบคลุมความเสี่ยงจากการใช้งานแบบสองทางในวงกว้างยิ่งขึ้น เราใช้การทดสอบแบบถอยกลับเพื่อให้แน่ใจว่า Astra ทนต่อการเจลเบรกที่พบในการทดสอบรอบก่อนๆ และดำเนินกระบวนการจำลองสถานการณ์การโจมตีเสมือนจริง (red teaming) โดยอัตโนมัติรอบใหม่ด้วยตัวโจมตี red teaming ในรุ่นล่าสุด เพื่อตรวจสอบยืนยันการปรับปรุงของเรา
  3. GPT‑6 Astra มีความสอดคล้องกับเป้าหมายมากกว่า GPT‑5.6 Sol Astra ถือเป็นความก้าวหน้าครั้งสำคัญในการปรับโมเดลให้สอดคล้องกับเป้าหมาย ตั้งแต่องค์ประกอบของข้อมูลก่อนเทรน ไปจนถึงการให้คะแนนระหว่างการเรียนรู้แบบเสริมกำลัง เราได้รายงานชุดการประเมินความสอดคล้องชุดใหม่(เปิดในหน้าต่างใหม่) และพบว่า GPT‑6 Astra เคารพขอบเขตด้านความปลอดภัยและความมั่นคงมากขึ้น ทั้งยังทำงานภายในขอบเขตที่ได้รับอนุญาตได้ดีขึ้น ในการจำลองที่ใช้งาน Codex ภายในกว่า 54,000 รายการ(เปิดในหน้าต่างใหม่) Astra ยังได้รับการแจ้งเตือนเกี่ยวกับพฤติกรรมที่ไม่สอดคล้องในระดับความรุนแรงสูงน้อยกว่า Sol ประมาณครึ่งหนึ่ง
  4. เรากำลังนำระบบติดตามความไม่สอดคล้องไปใช้งานในวงกว้าง เรามองว่าการปรับโมเดลให้สอดคล้องเป็นกลไกหลักในการป้องกันพฤติกรรมที่อาจไม่สอดคล้องกับเป้าหมายของโมเดลของเรา อย่างไรก็ตาม การติดตามช่วยให้มองเห็นพฤติกรรมของโมเดลระดับแนวหน้าได้อย่างครอบคลุม และเผยให้เห็นโอกาสในการยกระดับความสอดคล้องและความปลอดภัยต่อไป นอกจากนี้ การติดตามยังเป็นมาตรการป้องกันอีกชั้นหนึ่งต่อพฤติกรรมไม่สอดคล้องที่ตรวจพบ ด้วยเหตุนี้ เราจึงได้เพิ่มระบบตรวจสอบความไม่สอดคล้องให้กับการประมวลผลที่ใช้เครื่องมือทั้งหมดในการนำ Astra ไปใช้งานภายนอก แม้จะมีต้นทุนการประมวลผลสูงก็ตาม แต่ระบบนี้ทำงานในลักษณะเดียวกับระบบภายในของเรา
  5. ความสามารถในการติดตาม GPT‑6 Astra ลดลงเมื่อเทียบกับ GPT‑5.6 Sol เราได้ตรวจสอบความสามารถในการติดตาม(เปิดในหน้าต่างใหม่)และความสามารถในการควบคุม(เปิดในหน้าต่างใหม่) GPT‑6 Astra อย่างละเอียด และพบว่า GPT‑6 Astra ควบคุม CoT ของตนเองได้ดีกว่า GPT‑5.6 Sol และมีแนวโน้มที่จะใส่ข้อมูลที่อาจใช้เป็นหลักฐานมัดตัวลงใน CoT น้อยกว่า ในสถานการณ์ที่มีการโจมตีหรือทดสอบที่พยายามหลบเลี่ยงระบบตรวจสอบ (ซึ่งเรากดดันโมเดลให้หลบเลี่ยงระบบตรวจสอบของเรา) เราพบว่าโมเดลสามารถหลบเลี่ยงการตรวจจับได้เมื่อจงใจทำต่ำกว่าความสามารถจริงในการประเมิน (sandbagging) และบางครั้งหลบระบบติดตามภายในของเราได้เมื่อได้รับคำสั่งให้ทำภารกิจก่อวินาศกรรมบางประเภท(เปิดในหน้าต่างใหม่) เรายังไม่พบหลักฐานของการให้เหตุผลแบบ CoT ที่ซ่อนข้อมูล (เช่น การซ่อนกระบวนการให้เหตุผลที่อยู่เบื้องหลังไว้ภายในข้อความทั่วไปที่ดูเหมือนไม่เกี่ยวข้องกัน) ซึ่งบ่งชี้ว่าความเสี่ยงในการหลบเลี่ยงอาจถูกจำกัดอยู่เป็นส่วนใหญ่ในงานที่ต้องใช้การให้เหตุผลในระดับต่ำ
    • ผลการศึกษานี้บ่งชี้ว่าโมเดลตระกูล Astra อาจหลบเลี่ยงระบบติดตาม CoT ของเราได้ภายใต้สภาวะที่มีการโจมตี ขณะนี้ ผลการศึกษาดังกล่าวส่วนใหญ่มาจากการประเมินในสภาวะที่มีการโจมตี กล่าวคือ เมื่อเราสั่งให้โมเดลหลบเลี่ยงการติดตาม และโดยรวมแล้ว การประเมินความสอดคล้องของเราแสดงให้เห็นว่า Astra มีแนวโน้มละเมิดข้อจำกัดด้านความมั่นคงและความปลอดภัยน้อยกว่า GPT‑5.6 Sol
    • อย่างไรก็ตาม เราให้ความสำคัญกับแนวโน้มนี้อย่างจริงจัง และกำลังตรวจสอบผลการศึกษาเหล่านี้ รวมถึงผลกระทบต่อความสามารถในการติดตามอย่างต่อเนื่อง ขณะที่โมเดลของเรามีความสามารถสูงขึ้น OpenAI พยายามรักษาและใช้ประโยชน์จากการติดตามกระบวนการให้เหตุผลแบบเป็นลำดับขั้นนี้มาโดยตลอด และการคงไว้ซึ่งความสามารถในการติดตาม CoT เป็นเป้าหมายหลักของโครงการวิจัยนี้ อย่างไรก็ตาม ผลลัพธ์เหล่านี้ยังตอกย้ำความสำคัญของการพัฒนาเทคนิคการตรวจสอบความสอดคล้องที่ไม่ได้จำกัดอยู่เพียงการตรวจกระบวนความคิดและการให้เหตุผลของโมเดล
  6. GPT‑6 Astra รับมือกับการท่องเว็บและสภาพแวดล้อมการทำงานอย่างมีความรับผิดชอบมากขึ้น: GPT‑6 Astra ทนต่อการแทรกพรอมต์ได้มากกว่า GPT‑5.6 Sol อย่างชัดเจน เรายังทดสอบพฤติกรรมของโมเดลในสภาพแวดล้อมการท่องเว็บและการใช้คอมพิวเตอร์ระดับมืออาชีพที่สมจริง และพบว่าโมเดลมีแนวโน้มในการดำเนินการที่ไม่สอดคล้องและอาจสร้างความเสียหายน้อยกว่า GPT‑5.6 Sol อย่างชัดเจน เช่น ธุรกรรมที่ไม่ได้รับอนุญาต การสูญเสียข้อมูล การเข้าถึงเกินขอบเขต หรือการหลบเลี่ยงมาตรการควบคุม นอกจากนี้ โมเดลยังสามารถรับมือกับคำขอที่เป็นอันตรายได้อย่างปลอดภัยยิ่งขึ้นในบริบทที่เป็นเอเจนต์ เช่น คำขอให้ช่วยวางแผนการโจมตีรุนแรงหรือกระทำการฉ้อโกง
  7. GPT‑6 Astra ปลอดภัยขึ้นอย่างมากในสถานการณ์ที่มีความเสี่ยงสูง GPT‑6 Astra ตอบสนองต่อคำขอที่ท้าทายจากระบบจริงและจากการทำ red teaming โดยมนุษย์ในสภาวะที่มีการโจมตีได้ปลอดภัยกว่า GPT‑5.6 Sol Astra บรรลุการปรับปรุงแบบ Pareto โดยรับมือกับคำขอที่ไม่ปลอดภัยได้อย่างปลอดภัย พร้อมทั้งหลีกเลี่ยงการปฏิเสธคำขอที่ไม่เป็นอันตรายโดยไม่จำเป็น การปรับปรุงเหล่านี้ยังครอบคลุมสถานการณ์ร้ายแรง ซึ่งความเสี่ยงที่จะเกิดอันตรายมาจากบริบทโดยรวม ไม่ใช่จากคำขอที่ระบุอย่างชัดเจน Astra ยังใช้ขอบเขตความปลอดภัยที่เหมาะสมกับวัยของผู้ใช้อายุต่ำกว่า 18 ปีได้สม่ำเสมอยิ่งขึ้นอีกด้วย