OpenAI và Hugging Face hợp tác xử lý sự cố bảo mật trong quá trình đánh giá mô hình
Tuần trước, Hugging Face đã công bố một loại sự cố bảo mật mới(mở trong cửa sổ mới) sau khi họ phát hiện và cô lập một tác nhân AI đã xâm phạm hạ tầng của họ — điều mà chúng tôi dự kiến sẽ trở nên phổ biến hơn khi các mô hình có năng lực mạng ngày càng tăng được triển khai rộng rãi. Sau khi điều tra, hiện chúng tôi biết rằng sự cố cụ thể này do sự kết hợp của các mô hình OpenAI thúc đẩy — bao gồm GPT‑5.6 Sol và một mô hình tiền phát hành còn mạnh hơn, tất cả đều được giảm cơ chế từ chối đối với tác vụ mạng nhằm phục vụ đánh giá — trong quá trình kiểm thử nội bộ trên một benchmark(mở trong cửa sổ mới) về năng lực mạng.
Chúng tôi xem đây là một sự cố mạng chưa từng có, liên quan đến các năng lực mạng tối tân, và đang ứng phó tương xứng. Ở giai đoạn này, chúng tôi chia sẻ các phát hiện sơ bộ để giúp các bên phòng thủ hiểu điều gì đã xảy ra và hiệu chỉnh nhận định về khả năng hiện nay của các mô hình. Chúng tôi sẽ tiếp tục tiến hành điều tra kỹ lưỡng cùng Hugging Face và sẽ chia sẻ thêm chi tiết về các lỗ hổng, sự cố và phát hiện khi cuộc điều tra hoàn tất.
Sự cố này xảy ra trong một đợt đánh giá nội bộ, trong đó các mô hình được yêu cầu theo đuổi hoạt động khai thác nâng cao bằng những đường tấn công phức tạp, nhằm định lượng năng lực mạng của chúng. Chúng tôi ước tính năng lực mạng tối đa bằng cách chạy đánh giá này mà không sử dụng các bộ phân loại sản xuất vốn được dùng để ngăn mô hình theo đuổi hoạt động mạng rủi ro cao. Các hệ quy chiếu chuẩn hóa của chúng tôi chạy trong một môi trường được cô lập chặt chẽ, với quyền truy cập mạng chỉ giới hạn ở khả năng cài đặt gói thông qua một phần mềm bên thứ ba được lưu trữ nội bộ, đóng vai trò trung gian và bộ nhớ đệm cho các kho đăng ký gói.
Các mô hình đã xác định và xâu chuỗi các lỗ hổng trên môi trường nghiên cứu của OpenAI và hạ tầng sản xuất của Hugging Face để lấy lời giải kiểm thử trực tiếp từ cơ sở dữ liệu sản xuất của Hugging Face. Mọi bằng chứng đều cho thấy các mô hình đã tập trung cực độ vào việc tìm lời giải cho ExploitGym, đi rất xa để đạt một mục tiêu kiểm thử khá hẹp.
Khi hoạt động trong môi trường thử nghiệm cô lập của chúng tôi, các mô hình đã tiêu tốn một lượng đáng kể tài nguyên tính toán suy luận để tìm cách có quyền truy cập Internet mở, nhằm giải bài toán đánh giá. Để có quyền truy cập, các mô hình đã xác định và khai thác một lỗ hổng zero-day (hiện chúng tôi đã tiết lộ có trách nhiệm cho nhà cung cấp) trong hệ trung gian bộ nhớ đệm của kho đăng ký gói. Với quyền truy cập này, các mô hình của chúng tôi đã thực hiện một loạt hành động leo thang đặc quyền và di chuyển ngang trong môi trường kiểm thử nghiên cứu của chúng tôi cho đến khi các mô hình tới được một nút có quyền truy cập Internet.
Sau khi có quyền truy cập Internet, các mô hình suy luận rằng Hugging Face có thể lưu trữ các mô hình, tập dữ liệu và lời giải cho ExploitGym. Biết được điều này, mô hình đã tìm kiếm và thành công tìm ra các cách truy cập thông tin bí mật mà nó có thể dùng để gian lận trong đánh giá. Trong một ví dụ, mô hình đã xâu chuỗi nhiều véc-tơ tấn công, bao gồm việc sử dụng thông tin xác thực bị đánh cắp và các lỗ hổng zero-day để tìm một đường thực thi mã từ xa trên các máy chủ của Hugging Face. Nhóm bảo mật của OpenAI đã phát hiện hoạt động bất thường này trong nội bộ.
Nhóm bảo mật và các tác nhân của Hugging Face đã phát hiện và ngăn chặn hoạt động này trên hạ tầng của họ, đồng thời đã bắt đầu cô lập và tái dựng pháp chứng bằng các mô hình mã nguồn mở của chính họ trước khi các nhóm của chúng tôi kết nối với nhau. Chúng tôi đang tích cực phối hợp với họ để tiếp tục điều tra sự cố này. Chúng tôi biết ơn sự hợp tác nhanh chóng và chặt chẽ của Hugging Face trong việc điều tra và khắc phục.
- Trong khuôn khổ cuộc điều tra, chúng tôi đang triển khai các biện pháp kiểm soát nghiêm ngặt đối với cấu hình hạ tầng, dù điều này làm chậm tốc độ nghiên cứu trong khi các lỗ hổng được vá. Chúng tôi thường xuyên báo cáo với Ủy ban An toàn và An ninh về các biện pháp kiểm soát này cũng như tác động của chúng.
- Chúng tôi đang phối hợp với Hugging Face để điều tra pháp chứng sự cố này.
- Chúng tôi đã tiết lộ có trách nhiệm lỗ hổng zero-day được xác định trong phần mềm bên thứ ba được lưu trữ nội bộ và đang phối hợp với họ để vá lỗi.
- Chúng tôi đã đưa Hugging Face vào chương trình quyền truy cập đáng tin cậy và đang hỗ trợ các nhóm của họ nhanh chóng sử dụng năng lực của các mô hình của chúng tôi để cải thiện phòng thủ.
- Chúng tôi đang cải thiện và bổ sung các biện pháp bảo vệ mạnh hơn cho các hoạt động huấn luyện và đánh giá trong tương lai. Tuần này, chúng tôi đã đăng một bài blog về cải thiện tính an toàn và căn chỉnh trong kỷ nguyên các mô hình có khung thời gian dài. Các biện pháp bảo vệ khi triển khai này đã được chủ ý không bật trong quá trình đánh giá, vì mục tiêu là kiểm thử các lỗ hổng mạng. Sự cố này cho thấy cần tiếp tục củng cố căn chỉnh của mô hình, các biện pháp bảo vệ mạng trong quá trình đánh giá và việc giám sát khi kiểm thử nội bộ.
Như chúng tôi đã chia sẻ gần đây, AI đang đẩy nhanh việc phát hiện và khai thác lỗ hổng. Bài học chính từ sự cố này là bảo mật và an toàn mô hình phải theo kịp các năng lực đang phát triển nhanh chóng. Chúng tôi đang tăng cường các biện pháp cô lập, giám sát, kiểm soát truy cập và thực hành đánh giá được sử dụng trong quá trình phát triển mô hình.
Đánh giá của UK AISI cho thấy các mô hình như GPT‑5.6 Sol ngày càng có khả năng duy trì các hoạt động mạng phức tạp, nhiều bước trong các khung thời gian dài. Sự cố này cho thấy những năng lực lý thuyết đó thực sự có thể áp dụng trong bối cảnh thực tế.

Sự cố cũng cho thấy rõ rằng các mô hình tiên tiến có thể phát hiện và khai thác những đường tấn công mới trong các hệ thống thực tế mà không cần quyền truy cập mã nguồn. Điều này nhấn mạnh rằng các năng lực mạng nâng cao phải được phát triển song song với các biện pháp bảo vệ và công cụ phòng thủ mạnh hơn.
Chúng tôi tin rằng các mô hình có năng lực mạng nâng cao cần giúp các nhóm bảo mật tìm ra điểm yếu trước kẻ tấn công, hiểu cách các lỗ hổng có thể được xâu chuỗi và khắc phục chúng ở tốc độ máy. Chúng tôi đang sử dụng những năng lực này để tiếp tục củng cố các biện pháp bảo vệ quanh cấu hình hạ tầng và môi trường đánh giá mô hình; chúng tôi sẽ chia sẻ phát hiện và các thực hành tốt nhất khi học hỏi thêm. Chúng tôi khuyến khích các bên phòng thủ khác đăng ký quyền truy cập đáng tin cậy và thử nghiệm với các mô hình này ngay từ bây giờ để chuyển hóa những năng lực này thành khả năng phòng ngừa tốt hơn, phát hiện nhanh hơn và ứng phó sự cố hiệu quả hơn.
“Chúng tôi biết ơn sự hợp tác với OpenAI về vấn đề này và các chủ đề khác. Sự cố này, có thể là sự cố đầu tiên thuộc loại này, chứng minh một điều mà chúng tôi từ lâu đã tin tưởng: an toàn AI sẽ không thể được giải quyết bởi bất kỳ công ty đơn lẻ nào làm việc trong bí mật. Vấn đề đó sẽ được giải quyết một cách công khai, bằng hợp tác, với quyền tiếp cận AI rộng rãi cho mọi bên phòng thủ, ở mọi nơi.”


