Bỏ qua nội dung chính
OpenAI

22 tháng 9, 2026

An toàn

Ưu tiên và nguyên tắc đánh giá hiệu quả của bên thứ ba

Đang tải…

Các phòng thí nghiệm AI tiên phong mang trách nhiệm to lớn trong việc huấn luyện, đánh giá và triển khai mô hình một cách an toàn. Đánh giá của bên thứ ba đóng vai trò thiết yếu trong việc cân bằng trách nhiệm đó, mở rộng cơ hội đóng góp ý kiến về an toàn AI, cập nhật thông tin cho thế giới và yêu cầu các phòng thí nghiệm chịu trách nhiệm trước những tuyên bố an toàn rõ ràng, được hỗ trợ độc lập.

Trong nỗ lực định hướng tốc độ phát triển AI tiên phong, OpenAI cam kết hỗ trợ hoạt động đánh giá độc lập với quyền tiếp cận chuyên sâu trong suốt quá trình huấn luyện, đánh giá và triển khai. Quyền tiếp cận đó cần cho phép đơn vị đánh giá chất vấn các giả định của chúng tôi, xác định những rủi ro chúng tôi có thể đã bỏ sót và tự đưa ra kết luận về hiệu quả của các biện pháp bảo vệ.

Từ lâu, chúng tôi đã hợp tác với các đơn vị đánh giá bên thứ ba ở nhiều giai đoạn trong quá trình phát triển và triển khai mô hình. Chúng tôi cũng đã tích hợp hoạt động đánh giá của bên thứ ba vào các thông lệ thuộc Khung chuẩn bị và hỗ trợ các tổ chức cùng hoạt động lập pháp thúc đẩy một quy trình nghiêm ngặt và có trách nhiệm giải trình hơn. Trong suốt các hoạt động hợp tác này, chúng tôi đã cung cấp quyền tiếp cận chuyên sâu, bao gồm thông tin về các biện pháp bảo vệ kỹ thuật, quyền xem chuỗi tư duy, cũng như mức độ tiếp cận chưa từng có đối với dữ liệu mật và hệ thống triển khai nội bộ để ứng phó sự cố và kiểm thử đội đỏ (red team) đối với hệ thống giám sát. Các ưu tiên và nguyên tắc được trình bày ở đây tập trung vào việc chúng tôi hợp tác với các tổ chức đánh giá độc lập thuộc khu vực tư nhân và phi lợi nhuận để thực hiện đánh giá an toàn kỹ thuật. Những nội dung này bổ trợ cho hoạt động kiểm thử và đánh giá mà chúng tôi thực hiện cùng các chính phủ, trong đó vai trò và trách nhiệm riêng biệt có thể đòi hỏi cách tiếp cận khác.

Để những đánh giá này đạt hiệu quả, cần có cơ chế độc lập vững chắc, tính nghiêm ngặt khoa học, biện pháp an ninh chặt chẽ và trách nhiệm rõ ràng. Các phòng thí nghiệm có trách nhiệm tạo điều kiện cho việc thẩm định thực chất, đồng thời bảo vệ thông tin nhạy cảm. Các phòng thí nghiệm và đơn vị đánh giá độc lập cùng có trách nhiệm thực hiện đúng công việc này và cần hoạt động theo các tiêu chuẩn quốc tế chung về thông lệ an toàn và an ninh. Dưới đây, chúng tôi đề xuất bốn lĩnh vực ưu tiên cần đánh giá chuyên sâu hơn, cùng các nguyên tắc để công việc được thực hiện nghiêm ngặt, an toàn và độc lập.

Các lĩnh vực ưu tiên đánh giá

Đánh giá của bên thứ ba hữu ích nhất khi giải quyết những câu hỏi cụ thể và có hệ quả đáng kể: Bằng chứng có hỗ trợ luận chứng an toàn và các tuyên bố an toàn của phòng thí nghiệm không? Các bài đánh giá có kiểm thử đầy đủ những rủi ro mà chúng được thiết kế để đo lường không? Các biện pháp bảo vệ có hiệu quả trong điều kiện thực tế không?

Các hoạt động đánh giá được mô tả ở đây sẽ có hình thức khác nhau tùy theo vấn đề an toàn được xem xét. Chúng tôi dự kiến hỗ trợ đồng thời nhiều hoạt động đánh giá trong các khoảng thời gian khác nhau: một số kéo dài vài tuần, số khác kéo dài vài tháng. Mặc dù đánh giá của bên thứ ba cũng có thể thuộc công việc trước triển khai và cung cấp thông tin cho quyết định triển khai, công việc mô tả ở đây nhìn chung mang tính dài hạn hơn và không phụ thuộc vào thời điểm ra mắt—tập trung xem xét chuyên sâu các tuyên bố an toàn cụ thể theo thời gian.

Trong các lĩnh vực ưu tiên và nguyên tắc, chúng tôi đề cập đến tuyên bố an toàn và luận chứng an toàn. Chúng tôi sử dụng các thuật ngữ này với ý nghĩa như sau:

Tuyên bố an toàn: Một khẳng định cụ thể về năng lực, hành vi hoặc biện pháp bảo vệ của mô hình hay hệ thống, có liên quan đến mức độ an toàn và có thể được đánh giá dựa trên bằng chứng. Tuyên bố cần xác định các rủi ro và điều kiện mà tuyên bố đề cập, cùng những giả định và hạn chế có liên quan.

Luận chứng an toàn: Một lập luận có cấu trúc và được bằng chứng hỗ trợ, giải thích vì sao các rủi ro của mô hình hoặc hệ thống được kiểm soát đầy đủ đối với một hoạt động cụ thể, chẳng hạn như huấn luyện, đánh giá hoặc triển khai. Luận chứng an toàn liên kết từng tuyên bố an toàn với bằng chứng hỗ trợ, đồng thời nêu rõ các giả định, yếu tố bất định và rủi ro còn lại có thể ảnh hưởng đến kết luận.

Chúng tôi đề xuất bốn lĩnh vực ưu tiên cần đánh giá chuyên sâu hơn, cùng các nguyên tắc để công việc được thực hiện nghiêm ngặt, an toàn và độc lập.

  1. Đánh giá độc lập các luận chứng an toàn trong quá trình huấn luyện, đánh giá, triển khai nội bộ và triển khai bên ngoài.

    Đánh giá luận chứng an toàn đòi hỏi chuyên môn về căn chỉnh, các phương pháp kiểm soát như giám sát, an ninh mạng, hành vi lạm dụng trong lĩnh vực sinh học và hóa học, cũng như kiểm thử đội đỏ (red team). Luận chứng an toàn gồm các tuyên bố liên quan đến huấn luyện, đánh giá năng lực và biện pháp bảo vệ; có thể đánh giá toàn bộ hoặc từng phần (xem ưu tiên 2 và 3 bên dưới). Nhiều đơn vị đánh giá có thể sẽ cần xem xét các phần khác nhau của luận chứng dựa trên chuyên môn tương ứng. Kết hợp lại, các đánh giá của họ cần trả lời những câu hỏi như:

    1. Bằng chứng cho các luận chứng an toàn về huấn luyện, đánh giá và triển khai có được chứng minh đầy đủ không? Các điều kiện trong luận chứng an toàn có được tuân thủ trong quá trình huấn luyện, đánh giá và triển khai không?

    2. Các luận chứng an toàn của chúng tôi có bao quát những rủi ro cấp bách nhất được xác định trong quá trình đánh giá không? Các tuyên bố an toàn có hỗ trợ luận chứng an toàn tổng thể không? Có thiếu sót hoặc khía cạnh nào cần cải thiện không?

    3. Các phương pháp hiệu quả có được sử dụng để xác định và giảm động cơ trong quá trình huấn luyện có thể tưởng thưởng hành vi lừa dối, gian lận phần thưởng, hành động phá hoại hoặc né tránh hạn chế không?

  2. Đánh giá các biện pháp bảo vệ thiết yếu trong hoạt động triển khai nội bộ và bên ngoài

    Hệ thống biện pháp bảo vệ của chúng tôi liên tục phát triển để thích ứng với năng lực và bối cảnh thay đổi. Các biện pháp bảo vệ của chúng tôi bao trùm quá trình huấn luyện, triển khai nội bộ và triển khai bên ngoài. Hiện tại, các biện pháp này gồm biện pháp bảo vệ ở cấp mô hình, biện pháp thực thi và biện pháp an ninh, cùng các hệ thống giám sát sai lệch mục tiêu—bao quát nhiều loại rủi ro (như mất kiểm soát và hành vi lạm dụng gây rủi ro về an ninh mạng, sinh học và hóa học). Quan hệ đối tác kỹ thuật có thể vừa xác định những điểm yếu hiện tại của biện pháp bảo vệ, vừa cải thiện phương pháp đánh giá và đẩy nhanh quá trình xây dựng tiêu chuẩn, qua đó tạo nền tảng kỹ thuật vững chắc hơn cho chính sách công trong tương lai nhằm định hướng tốc độ phát triển AI tiên phong—đặc biệt đối với triển khai nội bộ, nơi các tiêu chuẩn an toàn và an ninh vẫn còn sơ khai.

    Hoạt động đánh giá độc lập cần xem xét mức độ hiệu quả và những điểm có thể còn hạn chế của các biện pháp bảo vệ này, chẳng hạn như:

    1. Khi sử dụng quyền tiếp cận “hộp xám”, các biện pháp bảo vệ có đủ vững trước kiểm thử đối kháng (các cuộc Bẻ khóa) và có ngăn chặn đầy đủ việc gia tăng năng lực trong các lĩnh vực rủi ro cao (ví dụ: mạng, sinh học) không? Hoạt động kiểm thử đối kháng và kiểm thử đội đỏ (red team) của chúng tôi có bao quát những rủi ro quan trọng nhất không?

    2. Trong các thử nghiệm được cấp phép ở điều kiện vận hành thực tế, tác nhân tương tác như thế nào với những biện pháp phòng vệ mạng như kiểm soát truy cập, môi trường cách ly và hệ thống phát hiện, ứng phó? Những biện pháp phòng vệ nào có thể ngăn chặn, phát hiện hoặc kiềm chế hành động gây hại, và chúng thất bại ở đâu?

    3. Các hệ thống giám sát sai lệch mục tiêu của chúng tôi có thiếu sót nghiêm trọng nào có thể dẫn đến mất kiểm soát hoặc sai lệch mục tiêu nghiêm trọng trong cả triển khai nội bộ và bên ngoài không? Khi năng lực của mô hình được cải thiện, việc giám sát chuỗi tư duy đáng tin cậy đến mức nào với tư cách là nguồn bằng chứng về tính an toàn hoặc khả năng phù hợp mục tiêu?

    4. Hoạt động giám sát phù hợp có được triển khai trong mọi quá trình huấn luyện, đánh giá và triển khai có liên quan theo cách không dễ bị vô hiệu hóa không?

    5. Các biện pháp bảo vệ có được triển khai tương xứng với năng lực không?

  3. Đánh giá năng lực bao quát các nhóm rủi ro trong Khung chuẩn bị (Rủi ro hóa học và sinh học, An ninh mạng, Khả năng tự cải thiện của AI) và đánh giá khả năng phù hợp mục tiêu đối với rủi ro sai lệch mục tiêu

    Khung chuẩn bị của chúng tôi yêu cầu tiến hành đánh giá những lĩnh vực rủi ro biên trọng yếu. Khi các ngưỡng bị vượt qua và bài đánh giá đạt mức bão hòa, cần thường xuyên làm mới, đồng thời bảo đảm độ bao phủ và chất lượng của các bài đánh giá năng lực trong những lĩnh vực rủi ro thuộc Khung chuẩn bị cũng như các bài đánh giá khả năng phù hợp mục tiêu nhằm xem xét rủi ro sai lệch mục tiêu nghiêm trọng.

    Các câu hỏi có liên quan gồm:

    1. Các bài đánh giá rủi ro thuộc Khung chuẩn bị có bao quát đầy đủ định nghĩa về ngưỡng rủi ro của Khung chuẩn bị không? Các ngưỡng cho những bài đánh giá này có được thiết lập chính xác không?

    2. Các bài đánh giá có được cập nhật khi mô hình liên tục đạt điểm cao nhất không, và những bài kiểm thử mới có đo lường một cách thực chất các năng lực tiên tiến hơn không?

    3. Các bài đánh giá khả năng phù hợp mục tiêu của chúng tôi có bao quát đầy đủ rủi ro sai lệch mục tiêu nghiêm trọng không, và có thể bỏ sót những hành vi hoặc điều kiện quan trọng nào?

  4. Điều tra độc lập các sự cố sai lệch mục tiêu nghiêm trọng

    Điều tra độc lập có thể mang lại giá trị đối với nhiều sự cố nghiêm trọng về an toàn AI. Ở đây, chúng tôi tập trung vào tình trạng sai lệch mục tiêu của mô hình, bao gồm trường hợp mô hình hành động khi chưa được phép hoặc né tránh giám sát; những hành vi này có thể làm lộ điểm yếu trong phương pháp về phù hợp mục tiêu và biện pháp bảo vệ ngay cả khi không có hành vi cố ý lạm dụng.

    Trong một số trường hợp nhất định, như sự cố OpenAI Hugging Face, việc mời một bên thứ ba độc lập thực hiện điều tra độc lập sự cố sai lệch mục tiêu có thể mang lại lợi ích. Điều thiết yếu là các bên thứ ba tham gia điều tra sự cố phải có chuyên môn cần thiết, bao gồm, khi phù hợp: chuyên môn pháp chứng mạng, chuyên môn về khả năng phù hợp mục tiêu, khả năng phân tích chuỗi tư duy quy mô lớn, cùng nhân sự và nguồn lực để tiến hành điều tra kịp thời. Hoạt động ứng phó sự cố có thể đòi hỏi quyền tiếp cận dữ liệu nội bộ và dữ liệu của bên thứ ba mang tính nhạy cảm; vì vậy, một số chi tiết có thể không phù hợp để công bố hoặc cho phép tiếp cận. Các phát hiện từ điều tra độc lập cũng có thể cung cấp thông tin cho luận chứng an toàn của mô hình bằng cách đưa ra bằng chứng để đánh giá những tuyên bố về khả năng phù hợp mục tiêu và hiệu quả của các biện pháp khắc phục sai lệch mục tiêu từng được ghi nhận.

    Trong bối cảnh xảy ra sự cố sai lệch mục tiêu, chúng tôi ưu tiên đánh giá độc lập về:

    1. Hành vi nào của mô hình hoặc vấn đề sai lệch mục tiêu nào đã xảy ra trong sự cố, và những yếu tố chính góp phần gây ra sự cố là gì?

    2. Các biện pháp bảo vệ và khắc phục có giảm thiểu hiệu quả những sự cố tương tự trong tương lai không?

Các nguyên tắc đánh giá hiệu quả

  • Phạm vi rõ ràng và các tuyên bố đánh giá được đôi bên thống nhất: Hoạt động đánh giá nên bắt đầu bằng việc thống nhất phạm vi, sau đó xác định rõ và đăng ký trước các tuyên bố an toàn trước khi tiến hành đánh giá. Bên thứ ba và phòng thí nghiệm cần làm rõ đó là những tuyên bố mà công ty được đánh giá muốn đưa ra để thẩm định, hay là những tuyên bố mà đơn vị đánh giá bên thứ ba muốn thẩm định độc lập và phòng thí nghiệm đồng ý lấy làm căn cứ đánh giá. Một số tuyên bố có thể nằm ngoài phạm vi vì nhiều lý do, như bên thứ ba không thể tiếp cận dữ liệu, đơn vị đánh giá không có đủ chuyên môn hoặc hạn chế hợp lý về thời gian khi cần đánh giá khẩn cấp. Phòng thí nghiệm và đơn vị đánh giá cần thiết lập quy trình xem xét những rủi ro đáng kể được phát hiện ngoài phạm vi ban đầu, bao gồm việc xác định có cần điều tra thêm hay không. Kết luận cần nêu rõ những nội dung đã và chưa được đánh giá theo phạm vi mà đôi bên thống nhất.

  • Quyền tiếp cận tương xứng: Trong phạm vi cho phép của các ràng buộc pháp lý, bảo mật và quyền sở hữu trí tuệ, đơn vị đánh giá cần được cấp quyền tiếp cận tương xứng để thẩm định các tuyên bố đã thống nhất khi có thể. Khi việc tiếp cận trực tiếp không khả thi hoặc không thể thực hiện, đơn vị đánh giá có thể làm việc với đại diện được chỉ định của công ty hoặc tìm hiểu các cơ chế tiếp cận gián tiếp hay bảo vệ quyền riêng tư để bảo vệ thông tin nền tảng.

  • Phương pháp và tiêu chuẩn minh bạch: Đơn vị đánh giá cần giải thích phương pháp, tiêu chí đánh giá và các yếu tố bất định, đồng thời dựa trên những tiêu chuẩn đã được thiết lập nếu có. Khi chưa có tiêu chuẩn, họ cần giải thích rõ căn cứ của các tiêu chí được sử dụng. Báo cáo cần phân biệt phát hiện trực tiếp với diễn giải, giải thích yếu tố bất định và nêu rõ bằng chứng hỗ trợ những kết luận nào.

  • Chuyên môn và tính độc lập: Đơn vị đánh giá cần chứng minh chuyên môn kỹ thuật phù hợp, đồng thời xác định, công khai và xử lý các xung đột lợi ích của tổ chức và cá nhân, bao gồm động cơ tài chính, quan hệ với nhà phát triển và việc từng tham gia công việc đang được đánh giá. Các biện pháp bảo vệ cần được thiết kế để áp lực thương mại và thỏa thuận thù lao không ảnh hưởng đến kết quả; những biện pháp này có thể gồm việc xin rút khỏi quy trình hoặc áp dụng thời gian không tham gia phù hợp.

  • An ninh và bảo mật: Đơn vị đánh giá cần chứng minh các biện pháp bảo mật thông tin và áp dụng cơ chế bảo vệ tính bảo mật có hiệu lực đối với nhân sự, tương xứng với độ nhạy cảm của hệ thống và thông tin được tiếp cận. Các biện pháp này cần bảo vệ quyền sở hữu trí tuệ, thông tin nhạy cảm và hồ sơ đánh giá. Khi đơn vị đánh giá không thể đáp ứng yêu cầu an ninh trong môi trường của mình hoặc dữ liệu được tiếp cận đặc biệt nhạy cảm, việc truy cập bằng thiết bị hay tại cơ sở do công ty quản lý có thể phù hợp.

  • Phát hiện có thể hành động và thời gian khắc phục: Hoạt động đánh giá cần xác định những thiếu sót cụ thể và cung cấp đủ chi tiết để phòng thí nghiệm xử lý. Khi phù hợp, phòng thí nghiệm cần có một khoảng thời gian hợp lý để khắc phục vấn đề trước khi công bố. Khi có liên quan, báo cáo cũng cần trình bày bài học dành cho nhà phát triển, đơn vị triển khai và bên bảo vệ tác nhân, kèm theo các khuyến nghị thiết thực để áp dụng.

  • Thông lệ công bố có trách nhiệm: Báo cáo đánh giá cần dựa trên bằng chứng và được chia sẻ công khai ở mức tối đa có thể, đồng thời bảo vệ thông tin nhạy cảm và bí mật. Khi không thể công khai toàn bộ, việc báo cáo bảo mật cho các cơ quan giám sát thích hợp (như cơ quan quản trị hoặc hội đồng quản trị công ty) có thể góp phần bảo đảm trách nhiệm giải trình. Cần có nguyên tắc và chính sách bảo vệ việc biên tập che thông tin, cũng như quy định rõ về phản hồi và sửa chữa nội dung thiếu chính xác, nhằm duy trì sự cân bằng giữa tính độc lập và tính bảo mật. Đơn vị đánh giá cần duy trì tính độc lập biên tập, đồng thời bảo đảm các biện pháp bảo vệ tính bảo mật và quyền sở hữu trí tuệ. Đơn vị đánh giá cần áp dụng chính sách biên tập che thông tin rõ ràng, cho phép phòng thí nghiệm yêu cầu che thông tin nhạy cảm; đồng thời, đơn vị đánh giá có thể ghi rõ những nội dung quan trọng đã bị che và tác động của việc đó đối với báo cáo đánh giá.

Chặng đường phía trước

Chúng tôi cam kết hỗ trợ các đơn vị đánh giá độc lập và xây dựng những tiêu chuẩn quốc tế chung, rõ ràng hơn—thông qua cả luật pháp trong tương lai lẫn các tổ chức quản trị tư nhân—để hoạt động đánh giá của bên thứ ba đạt hiệu quả. Trong khi hệ sinh thái đánh giá độc lập vẫn đang phát triển, chúng tôi sẽ thúc đẩy hệ sinh thái này bằng cách hỗ trợ và hợp tác với một cộng đồng đa dạng gồm các đơn vị đánh giá độc lập có chuyên môn sâu về những vấn đề an toàn tiên phong. Không một bên thứ ba nào có thể hoặc nên bao quát toàn diện các vấn đề cấp bách về an toàn tiên phong. Chúng tôi sẽ hành động thận trọng và có chủ đích để nâng cao năng lực, đồng thời giúp hệ sinh thái bên thứ ba đang phát triển thống nhất về các nguyên tắc và thông lệ tốt nhất. Chúng tôi đang trao đổi với nhiều bên thứ ba về các đề xuất phù hợp với những lĩnh vực ưu tiên nêu trên.