Bỏ qua nội dung chính
OpenAI

28 tháng 9, 2026

An toàn

Hướng tới hồ sơ lập luận an toàn cho huấn luyện AI tiên phong

Đang tải…

Chúng tôi tin rằng chúng ta đang bước vào một kỷ nguyên mới, trong đó cần bắt buộc có tài liệu an toàn được xây dựng có hệ thống trước khi tiếp tục bất kỳ đợt huấn luyện học tăng cường nào cho mô hình tiên phong. Lý tưởng nhất, các tài liệu này cần đạt chuẩn “hồ sơ lập luận an toàn” — những lập luận toàn diện, có cấu trúc và dựa trên bằng chứng về rủi ro, vốn được sử dụng trong các ngành khác có yêu cầu an toàn đặc biệt nghiêm ngặt. Chúng tôi coi hồ sơ lập luận an toàn là mục tiêu định hướng mà mình đang nỗ lực hướng tới. Đồng thời, chúng tôi thừa nhận những thách thức trong việc xây dựng hồ sơ cho mô hình AI chặt chẽ ngang với ngành hàng không hay điện hạt nhân, do sự phức tạp mới nảy sinh ở mỗi cấp độ năng lực AI. Chúng tôi đang xây dựng một khuôn khổ để hệ thống hóa các thực hành này.

Dưới đây là một số hướng dẫn ban đầu mà chúng tôi cho rằng cần có trong các hồ sơ lập luận an toàn cho hoạt động huấn luyện AI tiên phong. Những thực hành tốt nhất này phản ánh các bài học chúng tôi đã rút ra đến nay và dự kiến sẽ tiếp tục thay đổi khi chúng tôi cải tiến quy trình nội bộ để phát triển AI một cách thận trọng. Chúng tôi chia sẻ ngay lúc này để minh bạch quan điểm hiện tại và đón nhận ý kiến đóng góp từ cộng đồng. Lưu ý rằng tài liệu này tập trung vào huấn luyện học tăng cường cho mô hình tiên phong; việc triển khai nội bộ và bên ngoài đòi hỏi xem xét nhiều đặc tính liên quan đến sự phù hợp mục tiêu hơn nữa.

1. Biện pháp bảo vệ kỹ thuật

Hồ sơ lập luận an toàn cần bao quát ba khía cạnh của hệ thống kỹ thuật: huấn luyện sự phù hợp mục tiêu, cách ly và giám sát. Các biện pháp này giúp bảo đảm mô hình không tìm cách hành động lệch mục tiêu; ngay cả khi có, mô hình cũng khó vượt khỏi phạm vi cách ly và hệ thống giám sát sẽ phát hiện trước khi tác hại xảy ra.

  • Sự phù hợp mục tiêu của mô hình: Tuyến phòng thủ đầu tiên cần là huấn luyện mô hình phù hợp mục tiêu, tức là hành động một cách đáng tin cậy theo ý định của chúng ta. Các biện pháp có thể bao gồm:

    • Môi trường huấn luyện và chấm điểm: Giảm nguy cơ mô hình hình thành hành vi lệch mục tiêu bằng cách ngăn việc củng cố tích cực cho hành vi lách cơ chế phần thưởng trong quá trình huấn luyện. Các biện pháp có thể bao gồm:

      • Rà soát tập dữ liệu tự động: Dùng tác nhân để tìm và sửa các môi trường học tăng cường bị lỗi, nơi chuỗi hành động lệch mục tiêu có thể nhận phần thưởng cao nhờ khai thác lỗ hổng thay vì hành xử như mong muốn, qua đó giảm khả năng củng cố hành vi lệch mục tiêu trong huấn luyện.

      • Rà soát tập dữ liệu thủ công: Bổ sung rà soát thủ công và kiểm tra chất lượng tập dữ liệu bên cạnh kiểm thử đội đỏ (red team) tự động, nhằm tìm các tác vụ có lỗi có thể vô tình củng cố hành vi lệch mục tiêu.

      • Tinh chỉnh bộ chấm điểm: Điều chỉnh bộ chấm điểm để phạt các nỗ lực khai thác lỗ hổng hoặc lách cơ chế của môi trường học tăng cường trong quá trình huấn luyện mô hình.

      • Phân tích các đợt huấn luyện trước: Chạy bộ phân loại trên dấu vết thực thi từ các thí nghiệm trước để bảo đảm bộ chấm điểm hoạt động như dự kiến.

    • Đo lường sự phù hợp mục tiêu: Thực hiện các bài đánh giá theo dõi khuynh hướng lệch mục tiêu của mô hình để đo hiệu quả huấn luyện sự phù hợp mục tiêu. Các biện pháp có thể bao gồm:

      • Đánh giá ngoại tuyến về sự phù hợp mục tiêu: Thực hiện đánh giá sự phù hợp mục tiêu trong các đợt huấn luyện mô hình tiên phong để xác định việc huấn luyện có đạt hiệu quả như dự kiến hay không, đồng thời điều tra mọi suy giảm đáng kể.

      • Kiểm thử trên dữ liệu quá khứ: Kiểm thử các bài đánh giá sự phù hợp mục tiêu trên những sự cố trước đây để xác nhận chúng phát hiện được các mô hình từng lệch mục tiêu và không bị quá khớp với sự cố cụ thể.

      • Theo dõi hành vi lách bài đánh giá: Theo dõi hiện tượng Nhận biết bị đánh giá hoặc tận dụng bối cảnh kiểm tra để lách bài đánh giá (mô hình nhận ra mình đang được kiểm tra), có thể dẫn đến thay đổi hành vi. Ví dụ: bật bộ giám sát các hiện tượng này trong bài đánh giá sự phù hợp mục tiêu, với các ngưỡng chặn cụ thể.

      • Kiểm thử sức chịu đựng trong tình huống xấu nhất: Khơi gợi hành vi sai trái trong tình huống xấu nhất và kiểm tra xem có ít nhất một bài đánh giá phát hiện được hành vi đó hay không.

    • Ngăn huấn luyện dựa trên chuỗi tư duy: Không cho bộ chấm điểm tự động thấy chuỗi tư duy trong quá trình học tăng cường, để ngăn mô hình phát triển khả năng né tránh bộ giám sát chuỗi tư duy.

  • Cách ly: Nếu mô hình trở nên lệch mục tiêu, cần có cơ chế cách ly trong môi trường sandbox và bảo mật đủ mạnh để ngăn hành động gây hại. Các biện pháp có thể bao gồm:

    • Bảo mật hạ tầng nhiều lớp: Đầu tư mạnh vào việc gia cố cả môi trường sandbox chạy mô hình lẫn hạ tầng nghiên cứu chứa sandbox, để có thêm một lớp bảo vệ nếu mô hình thoát khỏi sandbox.

    • Kiểm thử đội đỏ (red team) cho cơ chế cách ly: Cải thiện bảo mật của sandbox, hạ tầng nghiên cứu và vùng biên bằng cách lặp lại việc kiểm thử đội đỏ (red team) trên các hệ thống này, dùng những bản lưu trạng thái từ các đợt huấn luyện mô hình tiên phong, theo phân tích an toàn, để tìm và khắc phục mọi lỗ hổng. Đồng thời kiểm thử đối kháng mọi dịch vụ mà mô hình có thể tiếp cận trong quá trình huấn luyện (ví dụ: bộ nhớ đệm internet).

    • Giao tiếp giữa các mẫu: Chỉ cho phép giao tiếp băng thông cao giữa các mẫu qua những kênh đã được phê duyệt, chẳng hạn bộ công cụ đa tác nhân, và đóng các kênh phụ trên hạ tầng có băng thông cao, dễ bị tác nhân phát hiện.

    • Bản ghi tương tác bất biến: Lưu bản ghi tương tác của tác nhân ở dạng không thể sửa đổi trong thời gian hợp lý (ví dụ: trong tài khoản lưu trữ chỉ ghi một lần) cho mọi hoạt động huấn luyện học tăng cường, đánh giá và triển khai nội bộ, để hỗ trợ điều tra sự cố đáng tin cậy và ngăn chỉnh sửa ngoài ý muốn.

  • Giám sát: Nếu mô hình bắt đầu hành động lệch mục tiêu, cần có hệ thống giám sát trực tiếp để phát hiện mọi dấu hiệu lệch mục tiêu tiềm ẩn và nhanh chóng xử lý các vấn đề ưu tiên trước khi xảy ra sự cố nghiêm trọng. Các biện pháp có thể bao gồm:

    • Bảo đảm khả năng giám sát: Bảo đảm mô hình luôn có thể được giám sát, dựa trên các bài đánh giá khả năng giám sát và né tránh giám sát với ngưỡng rõ ràng, để sớm phát hiện hành vi đáng lo ngại.

    • Tỷ lệ phát hiện cao đối với vấn đề đã biết: Bảo đảm hệ thống giám sát phát hiện được tỷ lệ cao các sự cố trước đây trong bài đánh giá dùng dữ liệu được giữ riêng.

    • Cập nhật bài đánh giá cho bộ giám sát: Tạo các mẫu dữ liệu đánh giá đại diện cho rủi ro hoàn toàn mới trong các đợt huấn luyện mới, để các phép đo độ bao phủ và độ chính xác của bộ giám sát không bị lỗi thời.

    • Ứng phó nhanh: Triển khai cảnh báo ưu tiên để có hành động trong thời hạn SLA đã định, bằng cách báo khẩn cho người trực hoặc tự động tạm dừng đợt huấn luyện bị ảnh hưởng, trước khi mô hình gây hại (ví dụ: ban ngày báo khẩn cho người trực bảo mật và người phụ trách đợt huấn luyện khi có sự cố; ban đêm tự động tạm dừng nếu cảnh báo chưa được xác nhận).

2. Hướng dẫn vận hành

Bên cạnh các khuyến nghị về biện pháp bảo vệ kỹ thuật, chúng tôi đang xây dựng những thực hành vận hành tốt nhất cho hồ sơ lập luận an toàn của một đợt huấn luyện AI tiên phong. Các thực hành này có thể bao gồm:

  • Phản biện (phân tích trước sự cố): Sau khi hồ sơ lập luận an toàn được soạn thảo, một thành viên thuộc nhóm khác nên viết bản phản biện để tìm những lỗ hổng tiềm ẩn và đưa ra nhận định rủi ro sát với bằng chứng. Nhóm huấn luyện sau đó cần xử lý các vấn đề được nêu để củng cố hồ sơ.

  • Phê duyệt: Hồ sơ lập luận an toàn cần được các lãnh đạo cấp cao xem xét; mỗi người đều phải có quyền phủ quyết đợt huấn luyện để bảo đảm có nhiều lớp kiểm tra nội bộ (ví dụ: trưởng bộ phận nghiên cứu / phó chủ tịch phụ trách nghiên cứu, người đứng đầu bộ phận an toàn và nhà khoa học trưởng).

  • Trách nhiệm giải trình: Lãnh đạo cấp cao phụ trách đợt huấn luyện (ví dụ: trưởng bộ phận nghiên cứu / phó chủ tịch phụ trách nghiên cứu) cần chịu trách nhiệm về hồ sơ lập luận an toàn và việc ứng phó mọi sự cố, kể cả trong đánh giá hiệu quả công việc, để các nhóm huấn luyện cũng có động lực thúc đẩy tính an toàn và sự phù hợp mục tiêu.

  • Tạm dừng: Nếu phát hiện vấn đề khiến hồ sơ lập luận an toàn không còn giá trị (ví dụ: vấn đề bảo mật mới), cần bảo đảm có quy trình thao tác, biện pháp kiểm soát kỹ thuật và cam kết mức dịch vụ (SLA) để tạm dừng mọi đợt huấn luyện thuộc phạm vi áp dụng.

  • Minh bạch nội bộ: Các nhóm giám sát nội bộ (ví dụ: Uỷ ban An toàn và An ninh) cần được tiếp cận hồ sơ lập luận an toàn.

  • Kiểm toán: Kiểm toán viên cần được cấp đủ quyền truy cập để xác minh tính xác đáng và vững chắc của các khẳng định trong hồ sơ lập luận an toàn, đồng thời nêu ra những thiếu sót nếu phát hiện.

  • Báo cáo lên cấp cao hơn: Cần có quy trình rõ ràng để báo cáo vấn đề lệch mục tiêu lên cấp cao hơn, kèm bảng phân loại mức độ nghiêm trọng và người trực chuyên trách có thể gửi cảnh báo khẩn cho ban điều hành (ví dụ: CEO) khi đợt huấn luyện chạm một ngưỡng nghiêm trọng nhất định.

  • Biện pháp kiểm soát kỹ thuật: Cần gây khó khăn cho cả con người và tác nhân khi khởi chạy các đợt huấn luyện không tuân thủ quy định. Các tính năng an toàn như giám sát và tự động tạm dừng cần chặn hoạt động khi xảy ra lỗi (ví dụ: không cho phép khởi chạy đợt huấn luyện nếu chưa bật giám sát phù hợp, hoặc tắt bộ giám sát từ bên trong quá trình huấn luyện học tăng cường, đánh giá hay triển khai nội bộ).

  • Khả năng hoàn tác: Cần dễ dàng xác định mọi cách sử dụng mô hình lệch mục tiêu ở các bước tiếp theo trong quá trình huấn luyện (ví dụ: tạo dữ liệu hoặc chấm điểm), để có thể loại bỏ tác động của các đầu ra lệch mục tiêu khi cần.

  • Liệt kê đầy đủ rủi ro còn lại: Hồ sơ lập luận an toàn cần liệt kê đầy đủ nhất có thể những rủi ro chưa được các biện pháp giảm thiểu hiện hành xử lý, làm cơ sở cho quyết định chấp nhận rủi ro.

Đây là các khuyến nghị hiện tại của chúng tôi và đang được triển khai tại OpenAI. Chúng tôi dự kiến sẽ tiếp tục điều chỉnh các thực hành này trong những tuần tới.

3. Điều tra sự cố lệch mục tiêu

Chúng tôi cũng đang xây dựng một số thực hành tốt nhất để điều tra các sự cố AI lệch mục tiêu nghiêm trọng. Các phòng nghiên cứu nên cố gắng rút ra nhiều bài học nhất có thể từ từng sự cố (tương tự thực hành điều tra⁠(mở trong cửa sổ mới) trong các ngành mà sai sót có thể gây hậu quả lớn) để ngăn những sự cố như vậy tái diễn. Một số hành động có thể bao gồm:

  • Minh bạch nội bộ: Vì việc điều tra có thể mất nhiều thời gian, cần cập nhật định kỳ trong nội bộ về tiến trình điều tra sự cố (ví dụ: cập nhật hằng ngày đối với các cuộc điều tra đang diễn ra). Cần có quy trình rõ ràng để nhân viên được mở rộng quyền truy cập, bao gồm xem bản ghi tương tác gốc và lấy mẫu từ mô hình lệch mục tiêu, nếu điều đó an toàn và phù hợp với công việc của họ.

  • Nguyên nhân gốc rễ của lệch mục tiêu: Các nhà nghiên cứu cần truy tìm nguyên nhân gốc rễ trong diễn biến huấn luyện (ví dụ: qua thí nghiệm loại bỏ thành phần có chủ đích hoặc lấy mẫu lại) để hiểu hành vi lệch mục tiêu đã xuất hiện như thế nào, từ đó hiểu rõ hơn cơ sở khoa học của hiện tượng này và phòng ngừa tốt hơn trong tương lai.

  • Rà soát sau sự cố: Cần rà soát cả khía cạnh vận hành lẫn văn hóa tổ chức để hiểu mọi nguyên nhân góp phần gây ra sự cố, chẳng hạn vì sao vấn đề phát sinh nhưng không được phát hiện hoặc báo cáo lên cấp cao hơn trước khi sự cố xảy ra.

  • Phát hiện: Chúng ta cần phát triển phương pháp kiểm tra sự phù hợp mục tiêu có thể phát hiện khuynh hướng gây ra sự cố, mà không trực tiếp tối ưu lặp đi lặp lại dựa trên thông tin rút ra từ sự cố đó (ví dụ: bản ghi tương tác hoặc bản tóm tắt sự cố). Cần xây dựng các bài đánh giá dựa trên sự cố dưới dạng “kiểm thử hồi quy”, để bảo đảm các mô hình tương lai không có khuynh hướng lệch mục tiêu trong những sự cố rất tương đồng.

  • Công bố công khai: Kết quả điều tra, báo cáo rà soát sau sự cố và những thay đổi về vận hành cần được chia sẻ với công chúng sau khi cuộc điều tra kết thúc. Các bên thứ ba bị ảnh hưởng cần được thông báo sớm nhất có thể.

Tác giả

OpenAI