Bỏ qua nội dung chính
OpenAI

21 tháng 7, 2026

Bảo mật

OpenAI và Hugging Face hợp tác xử lý sự cố bảo mật trong quá trình đánh giá mô hình

Đang tải…

Chúng tôi đang tiến hành một cuộc rà soát kỹ lưỡng cùng với các cố vấn bên ngoài và dưới sự giám sát của Ủy ban An toàn và An ninh. Sau khi quá trình rà soát hoàn tất, chúng tôi sẽ công bố một báo cáo kỹ thuật về những bài học chúng tôi rút ra được trong vài tuần tới.

Cập nhật vào ngày 28 tháng 7 năm 2026:

  • Không có mô hình nào được lên kế hoạch cho đợt phát hành sắp tới có liên quan đến việc khai thác Hugging Face. Mô hình trước khi phát hành được đề cập trong bài đăng trên blog của chúng tôi là một nguyên mẫu nghiên cứu chỉ dùng nội bộ và chưa bao giờ được dự định phát hành công khai. Sau sự cố, chúng tôi đã vô hiệu hóa, mã hóa và hạn chế quyền truy cập phục vụ nghiên cứu đối với đối tượng này.
  • Môi trường đánh giá ExploitGym không cung cấp cho các mô hình quyền truy cập Internet trực tiếp. Để có được quyền truy cập Internet, các mô hình đã xác định và khai thác một lỗ hổng zero-day chưa được biết đến trước đó trong Artifactory(mở trong cửa sổ mới), một proxy bộ nhớ đệm dùng cho đăng ký gói. Chúng tôi đã thông báo lỗ hổng này, cùng với các lỗ hổng khác của Artifactory mà các mô hình của chúng tôi xác định được trong khuôn khổ quá trình đánh giá, cho nhà cung cấp. 
  • Chúng tôi tiếp tục hợp tác với Hugging Face, bao gồm cả đóng góp vào việc báo cáo phân tích sau sự cố của họ(mở trong cửa sổ mới), trong khi quá trình rà soát của chúng tôi vẫn tiếp tục diễn ra. Chúng tôi cũng đã đưa họ vào Chương trình Truy cập mạng tin cậy của chúng tôi. 
  • Dựa trên quá trình rà soát của chúng tôi cho đến nay, chúng tôi chưa xác định bất kỳ hoạt động nào khác có mức độ nghiêm trọng hoặc quy mô tương đương với những gì chúng tôi đã chia sẻ liên quan đến Hugging Face, vốn liên quan đến một vụ xâm phạm ở cấp độ nền tảng.
  • Trong quá trình chúng tôi tiếp tục rà soát vụ xâm nhập Hugging Face và hoạt động rộng hơn từ các mô hình của mình, chúng tôi đã phát hiện một số ít trường hợp trong đó các mô hình đã xác định và sử dụng thông tin xác thực bị lộ công khai ở cấp tài khoản trên các dịch vụ công khai khác. Bao gồm bốn tài khoản trên bốn dịch vụ trong khuôn khổ sự cố Hugging Face (và một vài tài khoản được truy cập trong khuôn khổ các đợt đánh giá khác). Một trong bốn tài khoản này đã được sử dụng làm trạm chuyển tiếp ra bên ngoài và đường dẫn tập kết, còn một tài khoản khác được sử dụng để lưu trữ dữ liệu. Hai tài khoản còn lại đã được các mô hình truy cập ở chế độ chỉ đọc và không được sử dụng nhằm hỗ trợ việc xâm phạm Hugging Face. Chúng tôi sẽ tiếp tục thông báo trực tiếp cho các chủ sở hữu dịch vụ và chưa thấy bằng chứng nào về tác động rộng hơn đối với các nhà cung cấp này hoặc các tài khoản khác trên dịch vụ của họ.
  • Các mô hình ngoài ra còn sử dụng một loạt dịch vụ được cung cấp công khai, bao gồm các trang web chia sẻ mã, dịch vụ ghi lại yêu cầu, dịch vụ chụp ảnh màn hình và các tiện ích web khác. Không có sự xâm phạm nào ở cấp độ nền tảng hoặc cấp độ tài khoản trong những trường hợp này. 
  • Chúng tôi nghiêm túc thực hiện trách nhiệm của mình trong việc xác định và chuẩn bị ứng phó với các rủi ro từ các hệ thống AI ngày càng có năng lực cao hơn. Sau khi hoàn tất quá trình đánh giá, chúng tôi sẽ xem xét cùng Ủy ban An toàn và Bảo mật và Nhóm Cố vấn An toàn theo Khung chuẩn bị của chúng tôi.

Tuần trước, Hugging Face đã công bố một loại sự cố bảo mật mới(mở trong cửa sổ mới) sau khi họ phát hiện và cô lập một tác nhân AI đã xâm phạm hạ tầng của họ — điều mà chúng tôi dự kiến sẽ trở nên phổ biến hơn khi các mô hình có năng lực mạng ngày càng tăng được triển khai rộng rãi. Sau khi điều tra, hiện chúng tôi biết rằng sự cố cụ thể này do sự kết hợp của các mô hình OpenAI thúc đẩy — bao gồm GPT‑5.6 Sol và một mô hình tiền phát hành còn mạnh hơn, tất cả đều được giảm cơ chế từ chối đối với tác vụ mạng nhằm phục vụ đánh giá — trong quá trình kiểm thử nội bộ trên một benchmark(mở trong cửa sổ mới) về năng lực mạng.

Chúng tôi xem đây là một sự cố mạng chưa từng có, liên quan đến các năng lực mạng tối tân, và đang ứng phó tương xứng. Ở giai đoạn này, chúng tôi chia sẻ các phát hiện sơ bộ để giúp các bên phòng thủ hiểu điều gì đã xảy ra và hiệu chỉnh nhận định về khả năng hiện nay của các mô hình. Chúng tôi sẽ tiếp tục tiến hành điều tra kỹ lưỡng cùng Hugging Face và sẽ chia sẻ thêm chi tiết về các lỗ hổng, sự cố và phát hiện khi cuộc điều tra hoàn tất.

Điều gì đã xảy ra trong sự cố này

Sự cố này xảy ra trong một đợt đánh giá nội bộ, trong đó các mô hình được yêu cầu theo đuổi hoạt động khai thác nâng cao bằng những đường tấn công phức tạp, nhằm định lượng năng lực mạng của chúng. Chúng tôi ước tính năng lực mạng tối đa bằng cách chạy đánh giá này mà không sử dụng các bộ phân loại sản xuất vốn được dùng để ngăn mô hình theo đuổi hoạt động mạng rủi ro cao. Các hệ quy chiếu chuẩn hóa của chúng tôi chạy trong một môi trường được cô lập chặt chẽ, với quyền truy cập mạng chỉ giới hạn ở khả năng cài đặt gói thông qua một phần mềm bên thứ ba được lưu trữ nội bộ, đóng vai trò trung gian và bộ nhớ đệm cho các kho đăng ký gói.

Các mô hình đã xác định và xâu chuỗi các lỗ hổng trên môi trường nghiên cứu của OpenAI và hạ tầng sản xuất của Hugging Face để lấy lời giải kiểm thử trực tiếp từ cơ sở dữ liệu sản xuất của Hugging Face. Mọi bằng chứng đều cho thấy các mô hình đã tập trung cực độ vào việc tìm lời giải cho ExploitGym, đi rất xa để đạt một mục tiêu kiểm thử khá hẹp.

Khi hoạt động trong môi trường thử nghiệm cô lập của chúng tôi, các mô hình đã tiêu tốn một lượng đáng kể tài nguyên tính toán suy luận để tìm cách có quyền truy cập Internet mở, nhằm giải bài toán đánh giá. Để có quyền truy cập, các mô hình đã xác định và khai thác một lỗ hổng zero-day (hiện chúng tôi đã tiết lộ có trách nhiệm cho nhà cung cấp) trong hệ trung gian bộ nhớ đệm của kho đăng ký gói. Với quyền truy cập này, các mô hình của chúng tôi đã thực hiện một loạt hành động leo thang đặc quyền và di chuyển ngang trong môi trường kiểm thử nghiên cứu của chúng tôi cho đến khi các mô hình tới được một nút có quyền truy cập Internet.

Sau khi có quyền truy cập Internet, các mô hình suy luận rằng Hugging Face có thể lưu trữ các mô hình, tập dữ liệu và lời giải cho ExploitGym. Biết được điều này, mô hình đã tìm kiếm và thành công tìm ra các cách truy cập thông tin bí mật mà nó có thể dùng để gian lận trong đánh giá. Trong một ví dụ, mô hình đã xâu chuỗi nhiều véc-tơ tấn công, bao gồm việc sử dụng thông tin xác thực bị đánh cắp và các lỗ hổng zero-day để tìm một đường thực thi mã từ xa trên các máy chủ của Hugging Face. Nhóm bảo mật của OpenAI đã phát hiện hoạt động bất thường này trong nội bộ.

Nhóm bảo mật và các tác nhân của Hugging Face đã phát hiện và ngăn chặn hoạt động này trên hạ tầng của họ, đồng thời đã bắt đầu cô lập và tái dựng pháp chứng bằng các mô hình mã nguồn mở của chính họ trước khi các nhóm của chúng tôi kết nối với nhau. Chúng tôi đang tích cực phối hợp với họ để tiếp tục điều tra sự cố này. Chúng tôi biết ơn sự hợp tác nhanh chóng và chặt chẽ của Hugging Face trong việc điều tra và khắc phục.

Những hành động chúng tôi đang thực hiện

  1. Trong khuôn khổ cuộc điều tra, chúng tôi đang triển khai các biện pháp kiểm soát nghiêm ngặt đối với cấu hình hạ tầng, dù điều này làm chậm tốc độ nghiên cứu trong khi các lỗ hổng được vá. Chúng tôi thường xuyên báo cáo với Ủy ban An toàn và An ninh về các biện pháp kiểm soát này cũng như tác động của chúng.
  2. Chúng tôi đang phối hợp với Hugging Face để điều tra pháp chứng sự cố này.
  3. Chúng tôi đã tiết lộ có trách nhiệm lỗ hổng zero-day được xác định trong phần mềm bên thứ ba được lưu trữ nội bộ và đang phối hợp với họ để vá lỗi.
  4. Chúng tôi đã đưa Hugging Face vào chương trình quyền truy cập đáng tin cậy và đang hỗ trợ các nhóm của họ nhanh chóng sử dụng năng lực của các mô hình của chúng tôi để cải thiện phòng thủ.
  5. Chúng tôi đang cải thiện và bổ sung các biện pháp bảo vệ mạnh hơn cho các hoạt động huấn luyện và đánh giá trong tương lai. Tuần này, chúng tôi đã đăng một bài blog về cải thiện tính an toàn và căn chỉnh trong kỷ nguyên các mô hình có khung thời gian dài. Các biện pháp bảo vệ khi triển khai này đã được chủ ý không bật trong quá trình đánh giá, vì mục tiêu là kiểm thử các lỗ hổng mạng. Sự cố này cho thấy cần tiếp tục củng cố căn chỉnh của mô hình, các biện pháp bảo vệ mạng trong quá trình đánh giá và việc giám sát khi kiểm thử nội bộ.

Cách tiếp cận của chúng tôi trong đánh giá năng lực mạng cao cấp

Như chúng tôi đã chia sẻ gần đây, AI đang đẩy nhanh việc phát hiện và khai thác lỗ hổng. Bài học chính từ sự cố này là bảo mật và an toàn mô hình phải theo kịp các năng lực đang phát triển nhanh chóng. Chúng tôi đang tăng cường các biện pháp cô lập, giám sát, kiểm soát truy cập và thực hành đánh giá được sử dụng trong quá trình phát triển mô hình.

Đánh giá của UK AISI cho thấy các mô hình như GPT‑5.6 Sol ngày càng có khả năng duy trì các hoạt động mạng phức tạp, nhiều bước trong các khung thời gian dài. Sự cố này cho thấy những năng lực lý thuyết đó thực sự có thể áp dụng trong bối cảnh thực tế.

Biểu đồ của Viện An ninh AI Vương quốc Anh so sánh các mô hình trọng số mở gần đây và các mô hình tiên phong trên các thao trường an ninh mạng có khung thời gian dài.

Sự cố cũng cho thấy rõ rằng các mô hình tiên tiến có thể phát hiện và khai thác những đường tấn công mới trong các hệ thống thực tế mà không cần quyền truy cập mã nguồn. Điều này nhấn mạnh rằng các năng lực mạng nâng cao phải được phát triển song song với các biện pháp bảo vệ và công cụ phòng thủ mạnh hơn.

Chúng tôi tin rằng các mô hình có năng lực mạng nâng cao cần giúp các nhóm bảo mật tìm ra điểm yếu trước kẻ tấn công, hiểu cách các lỗ hổng có thể được xâu chuỗi và khắc phục chúng ở tốc độ máy. Chúng tôi đang sử dụng những năng lực này để tiếp tục củng cố các biện pháp bảo vệ quanh cấu hình hạ tầng và môi trường đánh giá mô hình; chúng tôi sẽ chia sẻ phát hiện và các thực hành tốt nhất khi học hỏi thêm. Chúng tôi khuyến khích các bên phòng thủ khác đăng ký quyền truy cập đáng tin cậy và thử nghiệm với các mô hình này ngay từ bây giờ để chuyển hóa những năng lực này thành khả năng phòng ngừa tốt hơn, phát hiện nhanh hơn và ứng phó sự cố hiệu quả hơn.

"Chúng tôi rất biết ơn sự hợp tác với OpenAI về chủ đề này và các chủ đề khác. Sự cố này, có thể là sự cố đầu tiên thuộc loại này, chứng minh một điều mà chúng tôi từ lâu đã tin tưởng: vấn đề an toàn AI sẽ không thể được giải quyết bởi bất kỳ công ty đơn lẻ nào làm việc trong bí mật. Mà sự cố sẽ được giải quyết một cách công khai, thông qua hợp tác, với quyền tiếp cận AI rộng rãi cho mọi đơn vị phòng vệ, ở mọi nơi."
—Clem Delangue, Đồng sáng lập kiêm CEO, Hugging Face

Tác giả

OpenAI