Ngăn chặn chiến dịch chưng cất mô hình có phối hợp
Gần đây, chúng tôi đã phát hiện và ngăn chặn một chiến dịch có phối hợp nhằm trích xuất nội dung suy luận được bảo vệ từ các mô hình của mình. Hoạt động sớm nhất được ghi nhận vào tuần đầu tiên của tháng 7. Hoạt động này có những đặc điểm của chưng cất đối kháng: sử dụng có hệ thống và trái phép đầu ra hoặc nội dung suy luận của một mô hình để hỗ trợ huấn luyện, tái tạo hoặc cải thiện một mô hình khác. Nội dung suy luận được bảo vệ là bản ghi nội bộ về quá trình mô hình giải quyết một tác vụ; việc trích xuất nội dung này có thể làm lộ thông tin không được đưa vào câu trả lời cuối cùng và giúp các bên khác tái tạo năng lực của mô hình.
Những người thực hiện không phá được cơ chế mã hóa của chúng tôi, không xâm nhập cơ sở dữ liệu hay truy cập trực tiếp vào các cuộc trò chuyện đã lưu của người dùng. Thay vào đó, họ thao túng các tương tác với mô hình để tái hiện nội dung suy luận được bảo vệ dưới những dạng mà người gửi yêu cầu có thể nhìn thấy. Hoạt động này được thực hiện có phối hợp, trên quy mô lớn và vi phạm điều khoản dịch vụ của chúng tôi. Cách thao túng này khai thác một lỗ hổng không chỉ có ở các mô hình của OpenAI. Chúng tôi đã chia sẻ thông tin về lỗ hổng này với các đối tác trong ngành thông qua Diễn đàn Mô hình Tiên phong nhằm tăng cường khả năng phòng vệ chung trước hoạt động chưng cất đối kháng.
Trước khi công bố, chúng tôi đã điều tra phạm vi và tác động tiềm tàng, triển khai các biện pháp giảm thiểu của riêng mình, đồng thời chia sẻ thông tin và tiếp nhận phản hồi từ các nhà nghiên cứu cùng đối tác trong ngành để đảm bảo đã có biện pháp bảo vệ trước kiểu tấn công này. Công tác điều tra và triển khai thêm các biện pháp giảm thiểu vẫn đang tiếp tục. Chúng tôi tin rằng việc chia sẻ những gì đã tìm hiểu được ngay lúc này sẽ giúp toàn bộ hệ sinh thái tăng cường khả năng phòng vệ.
Chúng tôi ghi nhận những nỗ lực trích xuất nội dung suy luận được bảo vệ bằng các cách thức mới, trong đó có việc sao chép nội dung suy luận đã mã hóa từ một cuộc trò chuyện rồi yêu cầu mô hình trong một cuộc trò chuyện khác giải mã và chép lại nội dung suy luận ẩn đó.
Các nhà nghiên cứu bảo mật độc lập(mở trong cửa sổ mới) cũng đã thông báo cho chúng tôi về những lỗ hổng liên quan đến tương tác giữa các mô hình và việc nén ngữ cảnh cuộc trò chuyện, thông qua quy trình công bố có trách nhiệm. Chúng tôi đã điều tra các phát hiện của họ và xác nhận rằng những cách thức tấn công mà họ chỉ ra thực sự khả thi. Nghiên cứu của họ giúp chúng tôi hiểu rõ hơn về nhóm tấn công này nói chung và đẩy nhanh việc triển khai các biện pháp giảm thiểu.
Hoạt động bắt đầu vào ngày 1 tháng 7, ban đầu với số lượng nhỏ, cho đến khi chúng tôi ghi nhận mức tăng đột biến vào ngày 24 và 25 tháng 7: 16.000 yêu cầu1 sử dụng một mẫu trích xuất liên quan từ hơn 4.000 người dùng. Điều tra sâu hơn đã phát hiện hoạt động sử dụng các mẫu câu lệnh liên quan trong một cụm gồm hơn 15.000 người dùng. Đến ngày 28 tháng 7, chúng tôi đã ngăn chặn hoàn toàn hoạt động này.
Hoạt động này biến đổi theo thời gian, càng cho thấy chưng cất đối kháng là một thách thức bảo mật rộng hơn, đòi hỏi các biện pháp phòng vệ nhiều lớp và có khả năng thích ứng.
Hiện chưa rõ liệu tất cả những người thực hiện mà chúng tôi ghi nhận trong khoảng thời gian liên quan có cùng thuộc một bên hay không. Tuy nhiên, chúng tôi xác định một cụm hoạt động cốt lõi do các cá nhân có liên hệ với Moonshot AI, nhà phát triển Kimi, thực hiện.
Chưng cất đối kháng gây ra rủi ro về an toàn và an ninh quốc gia. Nội dung suy luận bị trích xuất có thể được dùng để huấn luyện một mô hình khác mà không giữ lại các biện pháp bảo vệ được áp dụng cho đầu ra hướng đến người dùng của mô hình gốc. Ở quy mô lớn, việc chưng cất cũng có thể đẩy nhanh quá trình chuyển giao các năng lực tiên tiến mà không đòi hỏi mức đầu tư tương đương cho an toàn. Những lo ngại này càng gia tăng khi các mô hình có thêm năng lực trong các lĩnh vực lưỡng dụng.
Rủi ro này không chỉ có ở OpenAI. Như đã nêu ở trên, các kỹ thuật tương tự có thể ảnh hưởng đến những hệ thống AI tiên tiến khác. Vì vậy, đây là thách thức bảo mật chung, đòi hỏi sự phối hợp trong toàn ngành.
Chúng tôi đã hạn chế tác động của chiến dịch chưng cất gần đây bằng cách kết hợp xử lý tài khoản vi phạm, áp dụng các biện pháp kiểm soát kỹ thuật và phối hợp với đối tác. Chúng tôi đã cấm hoặc hạn chế các tài khoản gian lận, tăng cường kiểm soát việc đăng ký và cơ sở hạ tầng, đồng thời mở rộng giám sát các mạng lưới liên quan.
Chúng tôi cũng tăng cường bảo vệ nội dung suy luận ẩn giữa các người dùng, không gian làm việc, tổ chức và dòng mô hình. Chúng tôi đã chặn một cách thức tấn công cho phép người vốn đã có nội dung suy luận mã hóa của người dùng khác gửi lại nội dung đó để khôi phục phần bên trong, đồng thời bổ sung các bước kiểm tra nhằm phát hiện và giữ lại đầu ra truyền trực tiếp có nguy cơ làm lộ nội dung suy luận. Khi hoạt động liên quan chuyển sang các dịch vụ bên thứ ba, chúng tôi đã làm việc với những nhà cung cấp đó để xác định và vô hiệu hóa các tài khoản tham gia.
Cuối cùng, chúng tôi đã chia sẻ các phát hiện liên quan thông qua Diễn đàn Mô hình Tiên phong và những kênh chia sẻ thông tin phù hợp của chính phủ, để các nhà phát triển mô hình tiên phong khác cùng đối tác khu vực công có thể tìm kiếm hoạt động tương tự và củng cố biện pháp phòng vệ của mình. Các hệ thống hỗ trợ dữ liệu suy luận có thể chuyển sang nơi khác hoặc gửi lại để xử lý có thể đối mặt với những rủi ro liên quan.
Chúng tôi dự đoán các nỗ lực chưng cất đối kháng sẽ ngày càng tinh vi khi các mô hình tiên phong được cải thiện và các bên tìm cách mô phỏng năng lực của chúng với chi phí thấp hơn. Việc phòng vệ trước hoạt động này đòi hỏi các biện pháp kiểm soát nhiều lớp và khả năng thích ứng liên tục.
Công việc này vẫn chưa kết thúc. Các hệ thống triển khai trên hạ tầng đối tác cần được bảo vệ như các dịch vụ do chúng tôi trực tiếp cung cấp. Các cuộc tấn công qua đầu ra công cụ cũng đòi hỏi biện pháp bảo vệ có thể kiểm tra nhiều hơn là chỉ phần văn bản hiển thị thông thường. Chúng tôi đang tiếp tục cải thiện các biện pháp phòng vệ cho công cụ, mở rộng phạm vi phát hiện của bộ phân loại, nâng cao khả năng từ chối của mô hình và triển khai các biện pháp kiểm soát liên quan trên toàn bộ mạng lưới đối tác đám mây.
Hoạt động ứng phó của chúng tôi sẽ tiếp tục tập trung vào ba lĩnh vực: tăng cường các biện pháp bảo vệ kỹ thuật chống trích xuất, cải thiện khả năng phát hiện và xử lý các chiến dịch có phối hợp, đồng thời đẩy mạnh chia sẻ thông tin về mối đe dọa trong toàn ngành và với chính phủ.

