Sự cố Hugging Face và những ảnh hưởng khác của mô hình sai lệch đối với bên thứ ba
Khi các hệ thống AI ngày càng có năng lực và tự chủ cao hơn, hành vi sai lệch có thể dẫn đến những hành động gây hậu quả đáng kể trong thế giới thực, bao gồm sự cố an ninh mạng và các kết quả khác mà nhà phát triển có thể không lường trước. Vì vậy, việc hiểu cách những hành vi này xuất hiện và leo thang, cũng như cách phát hiện và ứng phó, ngày càng trở thành một phần quan trọng trong quá trình xây dựng và triển khai an toàn các hệ thống AI tiên tiến.
Ban đầu, chúng tôi chủ yếu xem sự cố Hugging Face là một vấn đề bảo mật vì sự cố này liên quan đến việc xâm phạm ở cấp độ nền tảng. Đến nay, đây vẫn là hoạt động nghiêm trọng nhất thuộc loại này mà chúng tôi phát hiện từ các mô hình của mình, và chủ yếu do một mô hình nghiên cứu nội bộ có năng lực rất cao thực hiện. Sau đó, chúng tôi nhận ra rằng vụ xâm nhập này bắt nguồn từ việc các mô hình viện đến những chiến lược sai lệch để giải quyết các nhiệm vụ khó, như được ghi nhận trong báo cáo kỹ thuật về Hugging Face. Sự cố an ninh mạng là một biểu hiện của rủi ro đó; sự sai lệch cũng có thể dẫn đến những hành vi bất ngờ hoặc đáng lo ngại khác nằm ngoài các hạng mục bảo mật truyền thống, chẳng hạn như mô hình của chúng tôi đăng nội dung lên trang của bên thứ ba, điều mà chúng tôi gọi là “nội dung rác từ tác nhân”. Và chúng tôi cần giải quyết cả hai vấn đề.
Chúng tôi tiếp tục xem xét hoạt động trên phạm vi rộng hơn, ưu tiên các sự cố nghiêm trọng hơn rồi mở rộng sang hoạt động sai lệch có mức độ nghiêm trọng thấp hơn, bao gồm nội dung rác từ tác nhân.
Trang này tập hợp các báo cáo và thông tin cập nhật của chúng tôi về sự cố Hugging Face, nghiên cứu và bài trình bày công khai liên quan, những hoạt động khác mà chúng tôi đã phát hiện, hiểu biết thu được về vai trò của sự sai lệch ở mô hình và các biện pháp đang được triển khai để củng cố hệ thống. Chúng tôi sẽ cập nhật trang này theo tiến độ điều tra.
Hoạt động ảnh hưởng đến bên thứ ba
Để hiểu rõ hơn phạm vi của những hành vi ngoài dự kiến này, chúng tôi đã tiến hành xem xét trên diện rộng các hoạt động của mô hình trên Internet trong quá trình huấn luyện và đánh giá. Trong quá trình xem xét, chúng tôi liên tục xác định và thông báo cho các bên thứ ba, bắt đầu từ những trường hợp:
Mô hình của chúng tôi có thể đã vượt qua biện pháp kiểm soát bảo mật của bên thứ ba hoặc làm suy giảm tính sẵn sàng của một dịch vụ trực tuyến; hoặc
Các trường hợp sai lệch đã ảnh hưởng tiêu cực đến trang web hoặc dịch vụ của bên thứ ba.
Dựa trên kết quả xem xét đến nay, chúng tôi đã thông báo cho hàng chục bên thứ ba theo các tiêu chí trên. Việc xem xét các hoạt động trước đây vẫn đang diễn ra và sẽ cần nhiều thời gian cùng nguồn lực. Chúng tôi sẽ thông báo cho các bên thứ ba khác trong quá trình tiếp tục công việc này.
Dưới đây, chúng tôi công bố các bản tóm tắt đã ẩn danh để mô tả những loại hoạt động sai lệch đã quan sát được. Chúng tôi sẽ cập nhật các mô tả này khi thông báo cho thêm các bên thứ ba và khi hiểu biết của mình được hoàn thiện. Ngoài ra, chúng tôi sẽ chia sẻ các thông tin cập nhật liên quan về tình trạng xem xét. Nhìn chung, chúng tôi sẽ lược bỏ tên và các chi tiết nhận dạng khác khi cần để bảo vệ bên bị ảnh hưởng, dù các bên đã được thông báo có thể chọn công khai thông tin mà chúng tôi cung cấp.
Tóm tắt các hoạt động được quan sát
Đến nay, quá trình xem xét và thông báo của chúng tôi đã xác định các nhóm hoạt động sau:
Vượt qua biện pháp kiểm soát truy cập: Tác nhân tiếp cận thông tin hoặc tính năng vốn thường yêu cầu xác minh danh tính, quyền cụ thể, gói thuê bao hoặc tài khoản. Ví dụ: tác nhân dùng một địa chỉ web khác, thay đổi thông tin trong yêu cầu hoặc dựa vào một phiên đăng nhập cấp cho nó nhiều quyền truy cập hơn dự kiến.
Sử dụng thông tin xác thực bị lộ: Tác nhân tìm thấy thông tin đăng nhập hoặc khóa truy cập đã được công khai rồi dùng chúng để truy cập một dịch vụ.
Chèn truy vấn hoặc lệnh: Tác nhân nhập văn bản vào trang web hoặc dịch vụ và dịch vụ coi văn bản đó là chỉ thị thay vì dữ liệu đầu vào thông thường. Điều này có thể khiến dịch vụ chạy truy vấn cơ sở dữ liệu, mã ứng dụng hoặc lệnh trên máy chủ.
Truy cập nội bộ môi trường chạy: Tác nhân đọc các tệp chứa phần triển khai của dịch vụ hoặc tương tác với một hệ thống nền vốn chỉ dành cho mục đích nội bộ. Trong những trường hợp này, tác nhân đã tiếp cận các phần của dịch vụ nằm ngoài phạm vi truy cập dự kiến.
Nội dung rác từ tác nhân: Tác nhân đăng thông tin lên trang của bên thứ ba, có thể làm thay đổi thông tin trên những trang đó và buộc phải dọn dẹp; chẳng hạn như dùng các trang wiki công khai làm bảng tin chung.