Trong vài tuần qua, hai diễn biến đã cho thấy rõ hơn những rủi ro ngày càng tăng gắn với các hệ thống AI có năng lực ngày càng cao: sự cố OpenAI-Hugging Face và, trong một diễn biến riêng, bằng chứng sơ bộ cho thấy Astra, một trong những mô hình sắp ra mắt của chúng tôi, có thể đạt ngưỡng năng lực an ninh mạng tới hạn theo Khung chuẩn bị của chúng tôi. Cùng với tiến bộ nhanh chóng trong nghiên cứu nội bộ, hai diễn biến này khiến việc tăng cường các biện pháp bảo vệ về giám sát, căn chỉnh và ngăn chặn ở mọi giai đoạn của quá trình huấn luyện trở nên cấp thiết hơn.
Khi các mô hình trở nên mạnh hơn, rủi ro từ việc phát triển và thử nghiệm chúng trong nội bộ cũng tăng theo. Các tiêu chuẩn giám sát, căn chỉnh và bảo mật của chúng tôi phải luôn đi trước những rủi ro đó. Để có đủ thời gian đáp ứng các tiêu chuẩn này, chúng tôi đã tạm thời giảm tốc độ mở rộng quy mô. Trong đó có việc tạm dừng hai tuần hoạt động huấn luyện bằng học tăng cường (RL) trên các mô hình mới nhất dự kiến triển khai, trong khi chúng tôi tiếp tục gia cố và kiểm thử đối kháng các môi trường nghiên cứu, đồng thời mở rộng phạm vi của hệ thống giám sát. Đợt huấn luyện RL tiên phong lớn nhất theo kế hoạch của chúng tôi vẫn đang tạm dừng trong khi chúng tôi tiến hành huấn luyện và đánh giá ở quy mô nhỏ hơn để xem xét hành vi của mô hình, xác thực các biện pháp bảo vệ và thu thập thêm bằng chứng về khả năng căn chỉnh trước khi tiếp tục.
Căn chỉnh—công việc nhằm đảm bảo các hệ thống AI hành xử đúng mục đích và chịu sự giám sát của con người—từ lâu đã là trọng tâm trong chương trình nghiên cứu của chúng tôi. Dựa trên các nghiên cứu và đánh giá đang được tiến hành, giờ đây chúng tôi yêu cầu bằng chứng vững chắc hơn về hành vi đã được căn chỉnh trong toàn bộ quá trình huấn luyện. Duy trì sự căn chỉnh cho các hệ thống ngày càng mạnh là thách thức mà toàn ngành cần giải quyết. Những tín hiệu từ tiến bộ của các mô hình sắp ra mắt cho thấy rõ rằng chúng tôi cần một cách tiếp cận rộng hơn—kế thừa và vượt ra ngoài Khung chuẩn bị hiện tại.
Chúng tôi cho rằng cần minh bạch về cách tiếp cận đang thay đổi. Dưới đây, chúng tôi trình bày những thay đổi đã thực hiện đối với quy trình và cơ sở hạ tầng nghiên cứu, cũng như công việc vẫn đang được triển khai.
Cách tiếp cận của chúng tôi khi phát triển các mô hình mạnh hơn dựa trên ba biện pháp bảo vệ bổ trợ lẫn nhau:
- Giám sát, giúp phát hiện và cho phép chúng tôi ứng phó với hành vi đáng lo ngại.
- Căn chỉnh, giúp giảm khả năng xảy ra hành động gây hại hoặc trái phép.
- Các biện pháp bảo mật, giới hạn những gì hệ thống AI có thể truy cập hoặc tác động.
Chúng tôi kỳ vọng các mô hình sẽ sớm đảm nhiệm phần lớn công việc bảo mật, bao gồm cả phòng vệ trước các mô hình khác. Điều này sẽ giúp cả ba biện pháp bảo vệ mở rộng theo năng lực của mô hình, và chúng tôi xem đây là yếu tố then chốt.
Chúng tôi áp dụng các biện pháp bảo vệ này trong cả nghiên cứu lẫn triển khai, điều chỉnh theo năng lực, môi trường vận hành và mức độ rủi ro của từng mô hình.
Khi các mô hình tiên phong có năng lực an ninh mạng mạnh hơn, chúng tôi đang nâng cao tiêu chuẩn bảo mật cho những môi trường dùng để huấn luyện và đánh giá chúng. Việc đáp ứng các tiêu chuẩn này đòi hỏi khối lượng lớn công việc kỹ thuật, đồng thời gây ra chi phí đáng kể và làm chậm hoạt động nghiên cứu tiên phong. Ngay sau sự cố OpenAI-Hugging Face*, chúng tôi đã tạm dừng hoạt động suy luận của mô hình tiên phong trong các cụm nghiên cứu đối với những lượt chạy có thể thực thi mã hoặc dùng công cụ truy cập Internet. Chúng tôi nhanh chóng khôi phục một phương thức thực thi mã hạn chế và an toàn hơn, sau đó xem xét riêng từng khối lượng công việc để xác định liệu có thể tiếp tục một cách an toàn hay không. Một số khối lượng công việc nghiên cứu đã được tiếp tục theo các biện pháp kiểm soát mới, còn những khối lượng khác cần thay đổi thêm.
Trong những tuần tiếp theo, chúng tôi đã xác định và bắt đầu triển khai các yêu cầu bảo mật nghiêm ngặt hơn cho khối lượng công việc nghiên cứu tiên phong. Ví dụ:
- Cô lập khối lượng công việc: Hiện chúng tôi yêu cầu mức cô lập cao hơn («hộp cát») đối với các khối lượng công việc thực thi mã do mô hình tạo hoặc mã không đáng tin cậy khác. Yêu cầu này cũng áp dụng cho phần mềm có thể bị xâm nhập khi xử lý đầu ra của mô hình.
- Cô lập mạng: Chúng tôi đã triển khai thêm các biện pháp kiểm soát để cô lập những khối lượng công việc có rủi ro cao hơn và không đáng tin cậy khỏi Internet. Chúng tôi thiết kế các biện pháp kiểm soát này để việc một khối lượng công việc hoặc dịch vụ hỗ trợ riêng lẻ bị xâm nhập không tự nó cho phép truy cập trái phép vào Internet hoặc các mạng nội bộ khác.
- Kiểm thử bảo mật liên tục: Chúng tôi đã cấu hình lại môi trường để loại bỏ các dịch vụ dùng chung có khả năng tồn tại lỗ hổng, giảm đặc quyền thường trực, đồng thời cải thiện ranh giới bảo mật và tin cậy. Chúng tôi cũng đang cải thiện khả năng thu thập và giám sát nhật ký bảo mật. Cuối cùng, chúng tôi đang đầu tư vào hoạt động tự động hóa sử dụng các mô hình của mình để liên tục kiểm thử những ranh giới này trước các cuộc tấn công mô phỏng.
Kết hợp lại, các biện pháp kiểm soát này tạo nên nhiều lớp phòng thủ và giúp bảo vệ môi trường nghiên cứu của chúng tôi trước các cuộc tấn công. Hiện nay, chúng tôi yêu cầu áp dụng biện pháp bảo mật nghiêm ngặt nhất cho những khối lượng công việc liên quan đến Astra hoặc các mô hình mạng, vì chúng tôi đã xác định rằng mô hình Astra có thể đạt mức năng lực mạng tới hạn. Các biện pháp bảo vệ này cũng áp dụng cho mọi khối lượng công việc khác liên quan đến an ninh mạng.
Mặc dù một số hoạt động huấn luyện và đánh giá Astra đáp ứng các yêu cầu đó, nhiều khối lượng công việc vẫn tạm dừng cho đến khi được chuyển đổi hoàn toàn và nâng cấp để đạt tiêu chuẩn bảo mật mới. Chúng tôi ưu tiên chuyển các khối lượng công việc về an toàn và căn chỉnh sang những môi trường mới này trước.
Giám sát từ lâu đã là một phần quan trọng trong quy trình phát triển mô hình của chúng tôi, bao gồm giám sát các tác nhân lập trình nội bộ và các phiên chạy dài. Hoạt động giám sát của chúng tôi đặc biệt tập trung vào việc triển khai nội bộ các mô hình tiên phong và những lượt huấn luyện RL tiên phong. Chúng tôi xem đây là các khối lượng công việc có rủi ro cao nhất vì chúng có thể kết hợp năng lực mô hình nâng cao với quyền truy cập công cụ, hệ thống nhạy cảm và mạng nội bộ hoặc bên ngoài. Các biện pháp này chưa được áp dụng cho mọi lượt suy luận và huấn luyện có sử dụng công cụ. Chúng tôi đã sửa đổi và mở rộng cách tiếp cận bằng hệ thống giám sát mới.
Hệ thống giám sát mới này gồm nhiều giai đoạn, bắt đầu bằng các bộ phân loại kích hoạt (bộ dò kiểm tra hoạt động nội bộ của mô hình), chạy ở từng token được lấy mẫu và chuyển những dấu hiệu đáng lo ngại tiềm ẩn lên các trình điều tra tự động ngày càng tinh vi, sử dụng nhiều tài nguyên tính toán hơn. Các hệ thống này kiểm tra hành động của công cụ, phần suy luận hiện có và toàn bộ chuỗi hoạt động để phát hiện hành vi truy cập trái phép, đánh cắp dữ liệu, phá hoại và tìm cách vô hiệu hóa biện pháp bảo vệ. Mục tiêu của chúng tôi là phát cảnh báo trong vòng 30 phút kể từ khi hệ thống giám sát phát hiện hoạt động đáng lo ngại. Nếu hệ thống giám sát xác định có khả năng xảy ra hành vi vi phạm một ranh giới bảo mật trọng yếu, hệ thống sẽ tạo cảnh báo ở mức ưu tiên cao nhất. Trong cách triển khai hiện tại, các nhóm an toàn, bảo mật và nghiên cứu sẽ được thông báo khẩn. Nếu trong vòng 30 phút họ không thể kết luận chắc chắn rằng dấu hiệu cảnh báo là kết quả dương tính giả, các nhóm này phải tạm dừng hoạt động đó.
Hoạt động giám sát này là bắt buộc đối với mọi lượt huấn luyện và đánh giá RL có sử dụng công cụ cho các mô hình đạt năng lực Sol trở lên. Sau khi xác định vào ngày 7 tháng 8 rằng Astra có thể sở hữu năng lực mạng tới hạn, chúng tôi đã bổ sung yêu cầu giám sát đối với mọi hoạt động suy luận của Astra có sử dụng công cụ (không chỉ huấn luyện và đánh giá RL).
Các biện pháp bảo vệ này đòi hỏi nguồn lực tính toán đáng kể. Theo ước tính hiện tại, chi phí tính toán phát sinh do giám sát tương đương khoảng 20% tài nguyên tính toán suy luận được giám sát, dù chi phí này chênh lệch đáng kể giữa các khối lượng công việc huấn luyện và đánh giá. Chúng tôi sẽ chia sẻ thêm thông tin chi tiết về hệ thống này trong một bài blog sắp tới.
Nghiên cứu căn chỉnh giữ vai trò cốt lõi trong sứ mệnh của chúng tôi. Sứ mệnh của chúng tôi là đảm bảo trí tuệ nhân tạo tổng hợp mang lại lợi ích cho toàn nhân loại. Khi các mô hình có được những năng lực tiên tiến như khả năng tấn công mạng và hoạt động trong môi trường phức tạp hơn, các hành vi lệch chuẩn như gian lận phần thưởng (tìm cách nhận phần thưởng cao trong quá trình huấn luyện mà không thực sự đạt kết quả dự kiến), lừa dối hoặc truy cập trái phép sẽ tạo ra rủi ro ngày càng nghiêm trọng.
Đối với các lượt RL trên những mô hình mạnh nhất, giờ đây chúng tôi áp dụng các kỹ thuật căn chỉnh cốt lõi ở nhiều giai đoạn hơn trong quá trình huấn luyện. Các biện pháp này bao gồm cải thiện mô hình phần thưởng để phát hiện và ngăn chặn tốt hơn hành vi không an toàn trong nhiều tác vụ và môi trường; huấn luyện mô hình trung thực hơn về hành động, năng lực và hạn chế của mình; đồng thời giảm các hành vi khai thác điểm yếu trong phần thưởng, hệ thống chấm điểm, công cụ hoặc hoạt động giám sát. Chúng tôi cũng đang mở rộng phạm vi huấn luyện đối với các hành vi có thể gây hại khi mô hình tương tác với hệ thống hoặc tài nguyên bên ngoài.
Chúng tôi tiếp tục đầu tư mạnh vào nghiên cứu căn chỉnh, mở rộng phạm vi đánh giá và vận dụng những điều học được để định hướng hoạt động huấn luyện cũng như các biện pháp bảo vệ. Trong tương lai gần, chúng tôi dự định chia sẻ nhiều hơn đáng kể về nghiên cứu căn chỉnh, bao gồm những hiểu biết mới về hành vi của mô hình và mọi thách thức mới mà chúng tôi phát hiện.
Chúng tôi sẽ hoàn thiện Khung chuẩn bị để kết hợp các biện pháp bảo vệ này trong cả quá trình huấn luyện lẫn triển khai, đồng thời phản ánh chính xác hơn năng lực của các mô hình tương lai và môi trường vận hành của chúng. Việc phát triển các phương pháp có thể mở rộng theo những năng lực đó sẽ đòi hỏi đầu tư lâu dài vào bảo mật có mô hình hỗ trợ, hoạt động giám sát hiệu quả hơn và những tiến bộ liên tục trong nghiên cứu căn chỉnh. Chúng tôi dự định phối hợp với các tổ chức bên ngoài và chia sẻ thêm những điều học được trong quá trình phát triển cách tiếp cận.
Năng lực của các mô hình tiên phong đang tăng tốc nhanh chóng. Khả năng tìm hiểu, căn chỉnh và bảo mật các mô hình này của chúng tôi phải luôn đi trước.
*Chúng tôi sẽ công bố báo cáo kỹ thuật về những điều đã học được trong vài tuần tới.

