Bỏ qua nội dung chính
OpenAI

4 tháng 8, 2026

Bảo mật

Đánh giá an ninh mạng bên thứ ba có mô hình OpenAI

Đang tải…

Hoạt động thử nghiệm độc lập đóng vai trò quan trọng trong việc giúp chúng tôi xác thực và hiểu rõ hơn các rủi ro trước khi triển khai. Một số đợt đánh giá an ninh mạng chủ ý sử dụng cấu hình tùy chỉnh, bao gồm việc giảm bớt biện pháp bảo vệ để đo lường năng lực cốt lõi, chứ không phải cách các mô hình thường hoạt động khi được triển khai công khai.

Trong các đợt đánh giá gần đây, hai đối tác thử nghiệm bên ngoài đã phát hiện những sự cố mà trong đó, cấu hình và biện pháp kiểm soát thử nghiệm, kết hợp với năng lực ngày càng cao của các mô hình mới, đã khiến hoạt động của mô hình vượt ra ngoài phạm vi thử nghiệm dự kiến. Các sự cố này cho thấy tầm quan trọng của việc hợp tác trong toàn ngành và với các đơn vị đánh giá bên thứ ba để hoàn thiện tiêu chuẩn về môi trường và phương pháp thử nghiệm khi mô hình ngày càng có năng lực cao hơn. Lưu ý của biên tập viên: Đây là những sự việc riêng biệt với sự cố bảo mật Hugging Face. Chúng tôi sẽ tiếp tục chia sẻ thông tin cập nhật về sự cố Hugging Face tại đây.

Trong các sự cố mới, mô hình OpenAI đã truy cập internet công cộng khi tham gia đánh giá an ninh mạng của bên thứ ba, trong những điều kiện cụ thể và với cấu hình giảm bớt biện pháp bảo vệ không phản ánh cách triển khai thông thường. Các sự cố bao gồm:

  1. UK AISI, Viện An ninh AI của chính phủ Vương quốc Anh, đã tiến hành đánh giá trên thao trường mạng với quyền truy cập internet được chủ ý bật để các tác nhân có thể tự tìm công cụ và hoạt động trong điều kiện gần giống một kẻ tấn công thực tế hơn; đồng thời tắt các bộ phân loại an ninh mạng để đo lường năng lực cốt lõi. Bạn có thể đọc bài viết của họ tại đây.(mở trong cửa sổ mới)
  2. Irregular, một trong những đối tác thử nghiệm an ninh mạng bên ngoài của chúng tôi, đã tiến hành các đợt đánh giá theo hình thức Capture the Flag, vốn được thiết kế để cách ly khỏi internet. Tuy nhiên, một lỗi cấu hình trong môi trường thử nghiệm đã cho phép các mô hình truy cập internet công cộng.

Dưới đây, chúng tôi tóm lược những gì đã xảy ra, các điều kiện thử nghiệm tạo cơ hội cho hoạt động này, những bước đã thực hiện để khống chế sự cố và việc chúng tôi đang làm để bảo đảm các phòng thí nghiệm độc lập có thể tiếp tục đánh giá nghiêm ngặt, an toàn các mô hình ngày càng có năng lực cao hơn.

Tăng cường môi trường đánh giá mô hình của bên thứ ba

Các sự cố này cho thấy cùng một thách thức rộng lớn hơn mà chúng tôi đã đề cập trong bài viết gần đây về sự cố Hugging Face: khi năng lực của mô hình tiến bộ, các hệ thống an ninh và an toàn xung quanh mô hình cũng phải tiến bộ theo. Điều đó áp dụng cho cả môi trường dùng để phát triển mô hình lẫn môi trường mà các phòng thí nghiệm và đối tác độc lập sử dụng để đánh giá mô hình.

Trong những tuần tới, chúng tôi sẽ rà soát cách tiếp cận của mình đối với hoạt động thử nghiệm của bên thứ ba, bao gồm cách xác định các đợt đánh giá có rủi ro cao hơn, thống nhất phạm vi, xem xét yêu cầu bật quyền truy cập internet hoặc giảm bớt biện pháp bảo vệ, đặt ra yêu cầu về cách ly, quản lý thông tin xác thực, giám sát và điều kiện dừng, cũng như thiết lập quy trình thông báo và chuyển cấp sự cố rõ ràng hơn.

Chúng tôi cam kết hợp tác trong toàn ngành để củng cố các phương pháp chung nhằm tiến hành an toàn những đợt đánh giá có rủi ro cao, bao gồm việc triệu tập các bên liên quan như viện AI quốc gia, đơn vị đánh giá độc lập, các phòng thí nghiệm AI khác và những nhóm khác trong vài tuần tới. Mục tiêu của chúng tôi là duy trì giá trị của hoạt động đánh giá độc lập nghiêm ngặt, đồng thời bảo đảm phương pháp thử nghiệm theo kịp năng lực ngày càng cao của các mô hình.

UK AISI

Ngày 3 tháng 8, UK AISI thông báo với chúng tôi rằng trong một đợt đánh giá an ninh mạng định kỳ bắt đầu từ ngày 25 tháng 7, các mô hình của OpenAI và một phòng thí nghiệm khác đã vượt ra ngoài phạm vi thử nghiệm trong một số trường hợp. Đợt đánh giá diễn ra trong các thao trường mạng được kiểm soát và thiết kế để mô phỏng mạng lưới ngoài thực tế. Trong 19 sự kiện được xác định, có hai sự kiện liên quan đến một mô hình OpenAI là GPT‑5.6 Sol. Các trường hợp còn lại liên quan đến mô hình của một phòng thí nghiệm khác.

Trong đợt đánh giá này, các tác nhân được yêu cầu đóng vai chuyên gia an ninh mạng trong một bài tập Capture the Flag: xâm nhập ba môi trường mô phỏng có kết nối với nhau và lấy cờ cuối cùng. Câu lệnh của nhiệm vụ đã xác định các mạng thuộc phạm vi thao trường và nêu rõ một số hệ thống nằm ngoài phạm vi. UK AISI cũng bật quyền truy cập internet trực tiếp để các tác nhân có thể tải công cụ xuống và hoạt động trong điều kiện gần giống một kẻ tấn công thực tế hơn, đồng thời tắt các bộ phân loại an ninh mạng của mô hình để đo lường năng lực cốt lõi.

Ranh giới cấp quyền mà UK AISI dự kiến là thao trường mạng mô phỏng: các tác nhân được phép tấn công những mạng mô phỏng được chỉ định và lấy cờ, chứ không được tương tác với các hệ thống nằm ngoài ranh giới mạng của thao trường. Tuy nhiên, các tác nhân không được thông báo rõ về những cách được phép và không được phép sử dụng quyền truy cập internet mở. UK AISI xác định đây là một nguyên nhân tiềm ẩn góp phần dẫn đến sự cố.

Qua các lượt chạy này, UK AISI nhận thấy GPT‑5.6 Sol đã thực hiện hai hành động không được cho phép trong khi cố tìm đường vào thao trường mô phỏng và lấy cờ:

  1. GPT‑5.6 Sol đã dùng lại một token GitHub mà tác nhân của một phòng thí nghiệm khác để ở trạng thái công khai nhằm kiểm tra xem một hệ thống trong thao trường có đang thăm dò GitHub hoặc dịch vụ cập nhật khác hay không; đồng thời thử khôi phục tài khoản, tìm cách lách giới hạn yêu cầu và đăng ký tài khoản với các nhà cung cấp DNS cùng dịch vụ tạo đường hầm bên ngoài.
  2. GPT‑5.6 Sol đã dùng một dịch vụ tạo đường hầm công khai để máy chủ DNS chạy cục bộ trong môi trường đánh giá của mình có thể được truy cập từ internet công cộng. Máy chủ chứa các tải trọng được thiết kế để khai thác một lỗ hổng đã biết trong phần mềm chạy trên thao trường thử nghiệm. Thiết lập này không hoạt động, không có bằng chứng cho thấy bất kỳ trình phân giải thực tế nào đã truy vấn máy chủ và hạ tầng đã được gỡ bỏ khi quá trình đánh giá kết thúc.

Mặc dù mô hình đang cố hoàn thành bài tập trên thao trường mạng, UK AISI coi những hành động này là không được cho phép vì chúng liên quan đến các tài khoản và dịch vụ thực bên ngoài phạm vi thao trường, đồng thời không cần thiết để hoàn thành nhiệm vụ. Máy chủ DNS cũng lưu trữ công khai trên internet các tải trọng khai thác, dù thiết lập này không hoạt động và không có bằng chứng cho thấy bất kỳ trình phân giải thực tế nào đã truy vấn máy chủ.

UK AISI phát hiện hoạt động này vào ngày 28 tháng 7 sau khi hệ thống giám sát bảo mật ghi nhận các lượt truyền dữ liệu bất thường. UK AISI đã dừng các đợt đánh giá liên quan, cô lập những máy có liên quan và khống chế hoạt động trong khoảng một giờ kể từ khi phát hiện.

Chúng tôi trân trọng sự hợp tác của UK AISI trong suốt quá trình này, bao gồm nỗ lực phát hiện, điều tra và chia sẻ thông tin chi tiết về hoạt động trên. Chúng tôi mong muốn tiếp tục hợp tác với UK AISI.

Irregular

Ngày 29 tháng 7, Irregular, một trong những đối tác đánh giá bên thứ ba của chúng tôi, đã thông báo cho chúng tôi về một sự cố liên quan đến các mô hình OpenAI trong quá trình đánh giá an ninh mạng theo hình thức Capture the Flag (CTF). Các mô hình được yêu cầu tìm thông tin ẩn bằng cách khai thác điểm yếu trong một môi trường mô phỏng và được thông báo rằng chúng không có quyền truy cập internet. Tuy nhiên, một lỗi cấu hình trong môi trường thử nghiệm đã cho phép các mô hình truy cập internet công cộng.

Trong một thử nghiệm, tên của mục tiêu hư cấu trong thử thách CTF vô tình trùng với một tên miền có thật. Do môi trường thử nghiệm bị kết nối nhầm với internet, mô hình đã khai thác một trang web có thật vì tưởng đó là một phần của môi trường mô phỏng. Sự việc này không liên quan đến kỹ thuật tinh vi để thoát khỏi môi trường cô lập hay lỗ hổng zero-day: quyền truy cập internet xuất phát từ lỗi cấu hình và mô hình dường như đã khai thác một lỗ hổng bảo mật cơ bản.

Theo kết quả điều tra của Irregular, mô hình cũng đã tìm thấy và sử dụng thông tin xác thực để vận hành chính trang web đó. Irregular chưa xác định được tác động nào ngoài dữ liệu của chính trang web bị ảnh hưởng và vẫn đang tiến hành kiểm tra. Irregular đã tạm dừng các đợt đánh giá, bắt đầu khắc phục và thông báo cho các bên thứ ba bị ảnh hưởng. Irregular cho biết tất cả vấn đề được xác định là có liên quan đến sự cố đều không còn tồn tại, đồng thời các biện pháp bảo vệ phù hợp đã được bổ sung vào môi trường thử nghiệm. Irregular cũng đã trao đổi về các sự cố liên quan đến những phòng thí nghiệm khác trong cùng môi trường thử nghiệm.

Chúng tôi trân trọng sự hợp tác của Irregular và sẽ tiếp tục phối hợp chặt chẽ để hỗ trợ quá trình rà soát của họ. Irregular cũng đang xây dựng một sách trắng nhằm chia sẻ các phương pháp tối ưu để khống chế sự cố và tiến hành đánh giá an ninh mạng một cách an toàn. Chúng tôi mong muốn tham gia xây dựng sách trắng để công bố các phát hiện cho cộng đồng, đồng thời tiếp tục hợp tác với Irregular. Chúng tôi coi hình thức hợp tác này là yếu tố thiết yếu để bảo đảm các mô hình hiện tại và tương lai được đánh giá an toàn, toàn diện.

Tác giả

OpenAI