ก้าวสู่แนวทางยืนยันความปลอดภัยสำหรับการฝึก AI ระดับแนวหน้า
เราเชื่อว่าเรากำลังเข้าสู่ยุคใหม่ที่การฝึก AI ระดับแนวหน้าแบบการเรียนรู้ด้วยการเสริมกำลังในแต่ละรอบควรดำเนินต่อได้ก็ต่อเมื่อมีเอกสารด้านความปลอดภัยที่จัดทำอย่างเป็นระบบแล้วเท่านั้น ในอุดมคติ เอกสารนี้ควรพัฒนาไปเป็น “เอกสารยืนยันความปลอดภัย” ซึ่งเป็นการประเมินและให้เหตุผลเกี่ยวกับความเสี่ยงอย่างครอบคลุม มีโครงสร้าง และมีหลักฐานรองรับ เช่นเดียวกับแนวทางในอุตสาหกรรมที่ความปลอดภัยมีความสำคัญสูง เรามองเอกสารยืนยันความปลอดภัยเป็นมาตรฐานเป้าหมายที่เรากำลังพัฒนาไปสู่ ขณะเดียวกันก็ยอมรับว่าการจัดทำเอกสารสำหรับโมเดล AI ให้มีความเข้มงวดเทียบเท่ามาตรฐานที่ใช้ในอุตสาหกรรมการบินหรือพลังงานนิวเคลียร์นั้นยังทำได้ยาก เพราะทุกครั้งที่ AI มีความสามารถเพิ่มขึ้น ก็มักเกิดความซับซ้อนรูปแบบใหม่ตามมา เรากำลังพัฒนากรอบการทำงานเพื่อกำหนดแนวปฏิบัติเหล่านี้ให้ชัดเจน
ด้านล่างนี้คือแนวทางเบื้องต้นบางส่วนที่เราเห็นว่าควรรวมอยู่ในเอกสารยืนยันความปลอดภัยสำหรับการฝึก AI ระดับแนวหน้า แนวปฏิบัติเหล่านี้สะท้อนสิ่งที่เราได้เรียนรู้ในปัจจุบัน และคาดว่าจะพัฒนาต่อไปเมื่อเราปรับปรุงกระบวนการภายในเพื่อให้การพัฒนาเป็นไปอย่างรอบคอบ เรายกแนวทางเหล่านี้มาเผยแพร่ในตอนนี้เพื่อให้แนวคิดปัจจุบันของเราโปร่งใส และเปิดรับข้อเสนอแนะจากชุมชน ทั้งนี้ เอกสารฉบับนี้มุ่งเน้นการฝึก AI ระดับแนวหน้าแบบการเรียนรู้ด้วยการเสริมกำลังโดยเฉพาะ ส่วนการนำไปใช้งานทั้งภายในและภายนอกองค์กรจำเป็นต้องพิจารณาคุณสมบัติด้านความสอดคล้องในวงกว้างกว่านี้มาก
เอกสารยืนยันความปลอดภัยควรครอบคลุมองค์ประกอบทางเทคนิค 3 ด้าน ได้แก่ การฝึกเพื่อให้ AI ทำงานสอดคล้องกับเป้าหมาย การควบคุมให้อยู่ในขอบเขตที่กำหนด และการเฝ้าติดตาม มาตรการเหล่านี้ช่วยลดโอกาสที่โมเดลจะพยายามดำเนินการที่ไม่สอดคล้องกับเป้าหมาย และแม้โมเดลจะพยายามทำเช่นนั้น โมเดลก็ควรฝ่าการควบคุมออกไปได้ยาก พร้อมมีระบบตรวจจับก่อนที่จะก่อให้เกิดความเสียหาย
ความสอดคล้องของโมเดล: แนวป้องกันด่านแรกควรเริ่มจากการฝึกโมเดลให้มีความสอดคล้องกับเป้าหมาย หรือก็คือให้โมเดลทำงานในแบบที่เราต้องการได้อย่างสม่ำเสมอและเชื่อถือได้ โดยอาจครอบคลุมถึง:
สภาพแวดล้อมการฝึกและการให้คะแนน: ลดความเสี่ยงที่โมเดลจะพัฒนาพฤติกรรมที่ไม่สอดคล้อง โดยป้องกันไม่ให้การใช้ช่องโหว่เพื่อรับรางวัลได้รับการเสริมแรงทางบวกระหว่างฝึก ซึ่งอาจรวมถึง:
การตรวจชุดข้อมูลอัตโนมัติ: ใช้เอเจนต์ค้นหาและแก้ไขสภาพแวดล้อมการเรียนรู้แบบเสริมกำลัง (RL) ที่มีข้อบกพร่อง ซึ่งอาจให้รางวัลสูงแก่ลำดับการกระทำที่ไม่สอดคล้องเพราะใช้ช่องโหว่ แทนที่จะทำตามพฤติกรรมที่ตั้งใจไว้ เพื่อลดโอกาสที่ความไม่สอดคล้องจะได้รับการเสริมแรงระหว่างฝึก
การตรวจชุดข้อมูลโดยมนุษย์: นอกจากการทำ red team แบบอัตโนมัติแล้ว ควรมีการตรวจทานโดยมนุษย์และตรวจสอบคุณภาพของชุดข้อมูล เพื่อค้นหางานที่มีข้อบกพร่องซึ่งอาจส่งเสริมพฤติกรรมที่ไม่สอดคล้องกับเป้าหมายโดยไม่ตั้งใจ
การปรับกลไกการให้คะแนน: ปรับกลไกการให้คะแนนเพื่อไม่ให้รางวัล และให้ลงโทษพฤติกรรมที่โมเดลพยายามหาทางเอาเปรียบหรือเจาะสภาพแวดล้อม RL ในระหว่างการฝึก
การวิเคราะห์การทดลองที่ผ่านมา: ใช้ตัวจำแนกประเภทตรวจสอบบันทึกการทำงานจากการทดลองก่อนหน้า เพื่อยืนยันว่าตัวให้คะแนนทำงานตามที่ตั้งใจไว้
การวัดความสอดคล้อง: ทำการประเมินเพื่อติดตามแนวโน้มที่โมเดลจะแสดงพฤติกรรมไม่สอดคล้องกับเป้าหมาย เพื่อวัดว่าการฝึกด้านความสอดคล้องมีประสิทธิภาพเพียงใด โดยอาจรวมถึง:
การประเมินความสอดคล้องแบบออฟไลน์: ประเมินความสอดคล้องระหว่างการฝึกโมเดลระดับแนวหน้า เพื่อตรวจว่าการฝึกได้ผลตามที่ตั้งใจไว้หรือไม่ และสืบสวนเมื่อผลแย่ลงอย่างมีนัยสำคัญ
การทดสอบย้อนหลัง: นำการประเมินด้านความสอดคล้องไปทดสอบย้อนหลังกับเหตุการณ์ที่ผ่านมา เพื่อยืนยันว่าแบบประเมินสามารถตรวจพบโมเดลที่เคยแสดงพฤติกรรมไม่สอดคล้องกับเป้าหมายได้จริง และไม่ได้ถูกปรับให้เหมาะกับเหตุการณ์ใดเหตุการณ์หนึ่งมากเกินไป
ติดตามพฤติกรรมที่พยายามเอาชนะการประเมิน: ตรวจสอบว่าโมเดลรู้ตัวหรือคาดเดาได้หรือไม่ว่ากำลังถูกทดสอบ เพราะอาจทำให้โมเดลเปลี่ยนพฤติกรรมระหว่างการประเมิน (เช่น เปิดใช้ตัวตรวจจับพฤติกรรมดังกล่าวในการประเมินด้านความสอดคล้อง) และกำหนดเกณฑ์ที่หากเกินระดับนั้นจะต้องหยุดการทดสอบหรือการดำเนินการ
การทดสอบภายใต้สถานการณ์เลวร้ายที่สุด: กระตุ้นให้โมเดลแสดงพฤติกรรมที่ไม่พึงประสงค์ในกรณีร้ายแรงที่สุด แล้วตรวจสอบว่ามีแบบประเมินอย่างน้อยหนึ่งรายการที่สามารถตรวจจับพฤติกรรมนั้นได้
ป้องกันการใช้การให้เหตุผลแบบเป็นลำดับขั้นในการฝึก: ควรปิดไม่ให้ระบบให้คะแนนอัตโนมัติเข้าถึงการให้เหตุผลแบบเป็นลำดับขั้นในกระบวนการเรียนรู้แบบเสริมกำลัง เพื่อไม่ให้โมเดลค่อยๆ เรียนรู้วิธีหลบหลีกตัวตรวจจับการให้เหตุผลดังกล่าว
การควบคุมให้อยู่ในขอบเขต: หากโมเดลเริ่มแสดงพฤติกรรมที่ไม่สอดคล้องกับเป้าหมาย ควรออกแบบแซนด์บ็อกซ์และมาตรการรักษาความปลอดภัยให้รัดกุมเพียงพอที่จะป้องกันไม่ให้โมเดลดำเนินการที่เป็นอันตรายได้ ซึ่งอาจรวมถึง:
ความมั่นคงปลอดภัยของโครงสร้างพื้นฐานหลายชั้น: ลงทุนอย่างจริงจังเพื่อเสริมความแข็งแกร่งทั้งแซนด์บ็อกซ์ที่โมเดลทำงานอยู่และโครงสร้างพื้นฐานการวิจัยที่รองรับแซนด์บ็อกซ์ เพื่อให้มีการป้องกันอีกชั้นหากโมเดลหลุดจากแซนด์บ็อกซ์
การทำ red team เพื่อทดสอบการควบคุม: ควรยกระดับความปลอดภัยของแซนด์บ็อกซ์ โครงสร้างพื้นฐานการวิจัย และระบบรักษาความปลอดภัยบริเวณขอบเขตระบบ ด้วยการทดสอบ red team ซ้ำเป็นระยะโดยใช้เช็กพอยต์จากการฝึกโมเดลแนวหน้า ทั้งนี้ต้องผ่านการวิเคราะห์ด้านความปลอดภัยก่อน เพื่อค้นหาและแก้ไขจุดอ่อนต่าง ๆ พร้อมทั้งทดสอบบริการทุกประเภทที่โมเดลอาจใช้งานระหว่างการฝึก เช่น แคชอินเทอร์เน็ต
การจำกัดการสื่อสารข้ามตัวอย่าง: ควรจำกัดช่องทางที่ตัวอย่างต่างๆ ใช้สื่อสารกันด้วยปริมาณข้อมูลสูง ให้เหลือเฉพาะช่องทางที่ได้รับอนุมัติ เช่น ระบบเครื่องมือสำหรับหลายเอเจนต์ และปิดช่องทางแฝงของโครงสร้างพื้นฐานที่เอเจนต์สามารถค้นพบและใช้สื่อสารได้ง่าย
บันทึกบทสนทนาที่แก้ไขไม่ได้: เก็บบันทึกบทสนทนาของเอเจนต์ในรูปแบบที่ไม่สามารถแก้ไขย้อนหลังได้เป็นระยะเวลาที่เหมาะสม เช่น จัดเก็บไว้ในระบบที่เขียนข้อมูลได้เพียงครั้งเดียว สำหรับการฝึกแบบ RL การประเมินผล และการนำไปใช้งานภายในทั้งหมด เพื่อให้สามารถตรวจสอบเหตุการณ์ได้อย่างน่าเชื่อถือและป้องกันการแก้ไขข้อมูลโดยไม่ตั้งใจ
การเฝ้าติดตาม: หากโมเดลเริ่มดำเนินการที่ไม่สอดคล้องกับเป้าหมาย ควรมีระบบเฝ้าติดตามแบบเรียลไทม์เพื่อตรวจจับสัญญาณของความไม่สอดคล้องที่อาจเกิดขึ้น และเร่งจัดการประเด็นสำคัญก่อนที่จะพัฒนาไปเป็นเหตุการณ์ร้ายแรง ซึ่งอาจรวมถึง:
ทำให้สามารถเฝ้าติดตามได้อย่างต่อเนื่อง: ตรวจสอบให้แน่ใจว่ายังสามารถติดตามพฤติกรรมของโมเดลได้ โดยวัดจากการประเมินความสามารถในการเฝ้าติดตามและการหลบเลี่ยงระบบเฝ้าติดตาม พร้อมกำหนดเกณฑ์ที่ชัดเจน เพื่อให้ตรวจพบพฤติกรรมที่น่ากังวลได้ตั้งแต่เนิ่นๆ
ตรวจจับปัญหาที่เคยเกิดขึ้นให้ได้มากที่สุด: ตรวจสอบให้แน่ใจว่าระบบเฝ้าติดตามสามารถตรวจพบเหตุการณ์ที่เคยเกิดขึ้นในอดีตได้ในสัดส่วนสูง เมื่อทดสอบกับชุดประเมินที่แยกไว้ต่างหาก
การปรับชุดประเมินของระบบเฝ้าติดตามให้ทันสมัย: ควรสร้างข้อมูลทดสอบที่เป็นตัวแทนของความเสี่ยงใหม่ที่เกิดขึ้นในการฝึกแต่ละรอบ เพื่อให้ค่าที่ใช้วัดความสามารถในการตรวจจับและความแม่นยำของระบบเฝ้าติดตามยังคงสะท้อนสถานการณ์ปัจจุบัน
การตอบสนองอย่างรวดเร็ว: ใช้ระบบแจ้งเตือนตามลำดับความสำคัญที่ต้องมีการดำเนินการภายในกรอบเวลาตาม SLA ที่กำหนด ไม่ว่าจะเป็นการเรียกผู้เข้าเวรมารับผิดชอบหรือหยุดการฝึกที่เกี่ยวข้องโดยอัตโนมัติ ก่อนที่โมเดลจะสร้างความเสียหาย (เช่น ในตอนกลางวัน ให้แจ้งทีมรักษาความปลอดภัยที่เข้าเวรและเจ้าของการฝึก ส่วนกลางคืนให้ระบบหยุดการฝึกอัตโนมัติหากไม่มีใครรับทราบการแจ้งเตือน)
นอกจากคำแนะนำด้านมาตรการป้องกันทางเทคนิคแล้ว เรายังพัฒนาแนวปฏิบัติที่เหมาะสมสำหรับการจัดทำเอกสารยืนยันความปลอดภัยในการฝึก AI ระดับแนวหน้า ซึ่งอาจครอบคลุมเรื่องต่อไปนี้:
ความเห็นแย้ง (วิเคราะห์ความล้มเหลวล่วงหน้า): เมื่อจัดทำเอกสารยืนยันความปลอดภัยฉบับร่างแล้ว ควรให้สมาชิกจากทีมอื่นเข้ามาตรวจสอบโดยตั้งใจมองหาช่องโหว่หรือข้อบกพร่องที่อาจถูกมองข้าม พร้อมประเมินความเสี่ยงอย่างรอบคอบ ทีมฝึกควรตอบข้อสังเกตเหล่านี้และปรับปรุงเอกสาร เพื่อให้เหตุผลด้านความปลอดภัยมีความแข็งแรงมากขึ้น
การอนุมัติ: ผู้บริหารระดับสูงควรทบทวนเอกสารยืนยันความปลอดภัย โดยแต่ละคนควรมีสิทธิ์ระงับการฝึกได้ เพื่อให้การฝึกผ่านการตรวจสอบภายในจากหลายฝ่าย (เช่น หัวหน้าฝ่ายวิจัยหรือรองประธาน หัวหน้าฝ่ายความปลอดภัย และหัวหน้านักวิทยาศาสตร์)
ความรับผิดชอบ: ผู้บริหารระดับสูงที่รับผิดชอบการฝึกโมเดลแต่ละครั้ง เช่น หัวหน้าฝ่ายวิจัยหรือรองประธานฝ่ายวิจัย ควรเป็นผู้รับผิดชอบต่อเอกสารยืนยันความปลอดภัยและการรับมือกับเหตุการณ์ที่เกิดขึ้น รวมถึงนำเรื่องเหล่านี้มาพิจารณาในการประเมินผลงาน เพื่อสร้างแรงจูงใจให้ทีมฝึกโมเดลให้ความสำคัญกับความปลอดภัยและการทำให้ AI สอดคล้องกับเป้าหมายที่กำหนด
การหยุดชั่วคราว: หากพบปัญหาที่ทำให้เอกสารยืนยันความปลอดภัยใช้เป็นหลักอ้างอิงไม่ได้อีกต่อไป เช่น พบปัญหาด้านความปลอดภัยใหม่ ควรมีคู่มือรับมือ ขั้นตอนควบคุมทางเทคนิค และ SLA ที่ชัดเจนสำหรับการหยุดการฝึกโมเดลทั้งหมดที่อยู่ภายใต้ขอบเขตดังกล่าว
ความโปร่งใสภายใน: ควรเปิดให้หน่วยงานภายในที่ทำหน้าที่กำกับดูแล เช่น คณะกรรมการด้านความปลอดภัยและการรักษาความปลอดภัย เข้าถึงเอกสารยืนยันความปลอดภัยได้
การตรวจสอบ: ผู้ตรวจสอบควรได้รับสิทธิ์เข้าถึงข้อมูลในระดับที่เพียงพอสำหรับตรวจสอบว่าเนื้อหาและข้อกล่าวอ้างในเอกสารยืนยันความปลอดภัยนั้นถูกต้องและมีเหตุผลรองรับ พร้อมทั้งสามารถแจ้งประเด็นที่ยังมีช่องว่างได้หากตรวจพบ
การแจ้งปัญหาไปยังผู้มีอำนาจตัดสินใจ: ควรกำหนดขั้นตอนที่ชัดเจนสำหรับการแจ้งและยกระดับเหตุการณ์ที่ AI ไม่สอดคล้องกับเป้าหมาย โดยกำหนดระดับความรุนแรงไว้อย่างเป็นระบบ และมีทีมเวรรับผิดชอบด้านความไม่สอดคล้องที่สามารถแจ้งผู้บริหาร เช่น CEO ได้ทันที หากการฝึกโมเดลมีความรุนแรงถึงระดับที่กำหนด
มาตรการควบคุมทางเทคนิค: ควรออกแบบระบบให้มนุษย์หรือเอเจนต์ไม่สามารถเริ่มการฝึกที่ไม่เป็นไปตามข้อกำหนดได้ง่าย ระบบด้านความปลอดภัย เช่น การเฝ้าติดตามและการหยุดอัตโนมัติ ควรออกแบบให้หยุดการทำงานไว้ก่อนเมื่อเกิดความผิดปกติ เช่น ต้องไม่สามารถเริ่มการฝึกได้หากยังไม่ได้เปิดระบบเฝ้าติดตามที่เหมาะสม หรือปิดระบบเฝ้าติดตามจากภายในกระบวนการฝึกแบบ RL การประเมินผล หรือการนำระบบไปใช้งานภายใน
การแก้ไขผลกระทบย้อนหลัง: ควรตรวจสอบได้โดยง่ายว่าโมเดลที่มีพฤติกรรมไม่สอดคล้องกับเป้าหมายถูกนำไปใช้ในขั้นตอนต่อเนื่องใดบ้างของการฝึก เช่น ใช้สร้างข้อมูลหรือใช้ให้คะแนน เพื่อให้สามารถยกเลิกผลกระทบจากเอาต์พุตเหล่านั้นได้เมื่อจำเป็น
การระบุความเสี่ยงที่ยังเหลืออยู่อย่างครบถ้วน: เอกสารยืนยันความปลอดภัยควรแจกแจงความเสี่ยงที่มาตรการป้องกันในปัจจุบันยังไม่ครอบคลุมให้ครบถ้วนที่สุดเท่าที่ทำได้ เพื่อประกอบการตัดสินใจว่าจะยอมรับความเสี่ยงเหล่านั้นหรือไม่
ทั้งหมดนี้เป็นคำแนะนำปัจจุบันของเรา ซึ่งอยู่ระหว่างการนำไปใช้ที่ OpenAI เราคาดว่าแนวปฏิบัติของเราจะพัฒนาต่อไปในช่วงหลายสัปดาห์ข้างหน้า
เรายังได้พัฒนาแนวปฏิบัติที่เหมาะสมสำหรับการตรวจสอบเหตุการณ์ร้ายแรงที่ AI มีพฤติกรรมไม่สอดคล้องกับเป้าหมายอีกด้วย ห้องปฏิบัติการควรเรียนรู้จากแต่ละเหตุการณ์ให้ได้มากที่สุด (เช่นเดียวกับแนวทางการสอบสวนเหตุการณ์(เปิดในหน้าต่างใหม่)ในอุตสาหกรรมอื่นที่มีความเสี่ยงสูง) เพื่อป้องกันไม่ให้เหตุการณ์ลักษณะเดียวกันเกิดขึ้นอีกในอนาคต ตัวอย่างการดำเนินการอาจรวมถึง:
ความโปร่งใสภายในองค์กร: เนื่องจากการสอบสวนอาจใช้เวลานานกว่าจะเสร็จสิ้น จึงควรรายงานความคืบหน้าของการสอบสวนเหตุการณ์ให้บุคลากรภายในทราบเป็นระยะ เช่น รายงานทุกวันในกรณีที่ยังอยู่ระหว่างการสอบสวน นอกจากนี้ ควรกำหนดช่องทางที่ชัดเจนให้พนักงานสามารถขอเข้าถึงข้อมูลเพิ่มเติมได้ รวมถึงบทสนทนาต้นฉบับและตัวอย่างเอาต์พุตจากโมเดลที่ไม่สอดคล้องกับเป้าหมาย หากการเข้าถึงดังกล่าวปลอดภัยและเกี่ยวข้องกับงานของพนักงาน
ต้นตอของความไม่สอดคล้อง: นักวิจัยควรสืบหาต้นตอของสิ่งที่เกิดขึ้นระหว่างการฝึกโมเดล (เช่น ทดลองตัดองค์ประกอบเฉพาะออกหรือสุ่มตัวอย่างใหม่) เพื่อทำความเข้าใจว่าพฤติกรรมที่ไม่สอดคล้องกับเป้าหมายเกิดขึ้นได้อย่างไร ซึ่งจะช่วยให้เข้าใจกลไกของความไม่สอดคล้องได้ดีขึ้นและป้องกันไม่ให้เกิดขึ้นอีกในอนาคต
การทบทวนหลังเกิดเหตุ: ควรทบทวนเหตุการณ์ย้อนหลังทั้งในด้านการดำเนินงานและวัฒนธรรมองค์กร เพื่อทำความเข้าใจปัจจัยทั้งหมดที่มีส่วนทำให้เกิดเหตุการณ์ เช่น เหตุใดปัญหาจึงเกิดขึ้น เหตุใดจึงไม่ถูกตรวจพบ และเหตุใดจึงไม่ได้รับการยกระดับก่อนเกิดเหตุ
การตรวจจับ: เราควรสร้างวิธีทดสอบด้านความสอดคล้องที่สามารถตรวจจับได้ว่าโมเดลมีแนวโน้มจะก่อให้เกิดเหตุการณ์เช่นนี้หรือไม่ โดยไม่ปรับการทดสอบให้มุ่งตรงไปยังข้อมูลที่ได้จากเหตุการณ์นั้น เช่น บันทึกบทสนทนาหรือสรุปเหตุการณ์ นอกจากนี้ ควรนำข้อมูลจากเหตุการณ์มาสร้างการประเมินแบบ “การทดสอบเพื่อป้องกันปัญหาเดิมเกิดซ้ำ” เพื่อยืนยันว่าโมเดลรุ่นต่อไปจะไม่แสดงพฤติกรรมไม่สอดคล้องในเหตุการณ์ที่ใกล้เคียงกันมาก
การเปิดเผยต่อสาธารณะ: ผลการสอบสวน รายงานทบทวนหลังเกิดเหตุ และการเปลี่ยนแปลงด้านการปฏิบัติงานควรเปิดเผยให้สาธารณชนทราบหลังจากการสอบสวนสิ้นสุดลง และควรแจ้งผู้ที่ได้รับผลกระทบจากภายนอกองค์กรโดยเร็วที่สุด


