Ra mắt gpt-oss-safeguard
Các mô hình suy luận an toàn mở mới (120b và 20b) hỗ trợ các chính sách an toàn tùy chỉnh.
Hôm nay, chúng tôi ra mắt bản thử nghiệm nghiên cứu của gpt-oss-safeguard, các mô hình suy luận trọng số mở dùng cho các tác vụ phân loại an toàn, có hai kích cỡ: gpt-oss-safeguard-120b và gpt-oss-safeguard-20b. Các mô hình này là các bản tinh chỉnh của các mô hình mở gpt-oss và được cung cấp theo cùng giấy phép Apache 2.0 linh hoạt, cho phép tất cả mọi người tự do sử dụng, sửa đổi và triển khai. Hiện có thể tải xuống cả hai mô hình từ Hugging Face(mở trong cửa sổ mới).
Các mô hình gpt-oss-safeguard sử dụng suy luận để trực tiếp diễn giải một chính sách mà nhà phát triển cung cấp trong quá trình suy diễn—phân loại tin nhắn của người dùng, kết quả hoàn thiện và các đoạn trò chuyện đầy đủ dựa trên nhu cầu của nhà phát triển. Nhà phát triển luôn quyết định chính sách sẽ sử dụng, vì vậy các phản hồi phù hợp hơn và được điều chỉnh theo trường hợp sử dụng của nhà phát triển. Mô hình sử dụng chuỗi tư duy, mà nhà phát triển có thể xem lại để hiểu cách mô hình đi đến các quyết định của mình. Ngoài ra, chính sách được cung cấp trong quá trình suy diễn; thay vì được huấn luyện vào mô hình. Do đó, nhà phát triển có thể dễ dàng sửa đổi chính sách theo từng bước để tăng hiệu suất. Ban đầu, chúng tôi phát triển phương pháp này là để sử dụng nội bộ, do đó linh hoạt hơn đáng kể so với phương pháp truyền thống là huấn luyện một trình phân loại để gián tiếp suy diễn một ranh giới quyết định dựa trên lượng lớn các ví dụ được gán nhãn.
Mô hình gpt-oss-safeguard cho phép nhà phát triển xác định các ranh giới chính sách phù hợp nhất với tình huống sử dụng của họ. Ví dụ, một diễn đàn thảo luận về trò chơi video có thể muốn xây dựng một chính sách để phân loại các bài đăng thảo luận về hành vi gian lận trong trò chơi, hoặc một trang web đánh giá sản phẩm có thể muốn sử dụng chính sách riêng của mình để sàng lọc các bài đánh giá có vẻ có khả năng là giả.
Mô hình tiếp nhận hai đầu vào cùng lúc—một chính sách và nội dung cần phân loại theo chính sách đó—và đưa ra kết luận về việc nội dung đó thuộc loại nào, cùng với suy luận của nó. Nếu có áp dụng, thì nhà phát triển sẽ quyết định là sẽ sử dụng kết luận đó như thế nào trong quy trình bảo đảm an toàn của mình. Chúng tôi nhận thấy phương pháp tiếp cận dựa trên suy luận này đặc biệt hiệu quả trong các tình huống mà:
- Mối nguy hại tiềm ẩn có thể mới xuất hiện hoặc đang phát triển, và các chính sách cần được điều chỉnh nhanh chóng.
- Lĩnh vực này rất tinh vi và các trình phân loại nhỏ khó có thể xử lý được.
- Các nhà phát triển không có đủ mẫu để huấn luyện một bộ phân loại chất lượng cao cho từng rủi ro trên nền tảng của họ.
- Độ trễ ít quan trọng hơn việc tạo ra các nhãn chất lượng cao, có thể giải thích được.
Chúng tôi đang phát hành bản xem trước này của gpt-oss-safeguard để tiếp nhận ý kiến đóng góp từ cộng đồng nghiên cứu và an toàn, đồng thời tiếp tục cải thiện hiệu suất của mô hình. Trong vài tháng qua, chúng tôi đã làm việc cùng ROOST(mở trong cửa sổ mới) để phát hành phiên bản mô hình mở, nhằm xác định các nhu cầu quan trọng của nhà phát triển, kiểm tra mô hình và soạn tài liệu hướng dẫn cho nhà phát triển. Trong khuôn khổ lần ra mắt này, ROOST sẽ thành lập một cộng đồng mô hình(mở trong cửa sổ mới), cũng được công bố hôm nay, để nghiên cứu các mô hình AI mở nhằm bảo vệ các không gian trực tuyến. Song song với đợt ra mắt này, chúng tôi sẽ công bố một báo cáo kỹ thuật tóm lược, trình bày chi tiết về hiệu suất an toàn của mô hình xem trước này.
Khi nói đến an toàn, chúng tôi tin vào phòng thủ nhiều lớp. Chúng tôi huấn luyện các mô hình để phản hồi một cách an toàn, đồng thời triển khai các lớp bảo vệ bổ sung nhằm phát hiện và xử lý các đầu vào và đầu ra có khả năng không an toàn theo chính sách của chúng tôi. Các bộ phân loại an toàn, giúp phân biệt nội dung an toàn và không an toàn trong một lĩnh vực rủi ro cụ thể, từ lâu đã là lớp bảo vệ chính cho các mô hình ngôn ngữ lớn của chúng tôi và các mô hình khác.
Các trình phân loại an toàn truyền thống, chẳng hạn như các trình phân loại có sẵn qua API Kiểm duyệt(mở trong cửa sổ mới) của chúng tôi, được phát triển bằng cách lựa chọn thủ công hàng ngàn ví dụ về nội dung an toàn và không an toàn, dựa trên các chính sách an toàn đã được định trước. Dựa trên dữ liệu huấn luyện này, trình phân loại học cách phân biệt đầu ra an toàn và không an toàn. Ở phương pháp truyền thống đó, trình phân loại không bao giờ thực sự tiếp cận chính sách an toàn. Thay vào đó, nó tìm cách suy diễn chính sách cơ bản được sử dụng để gán nhãn các ví dụ bằng cách tìm ra những điểm tương đồng trong nội dung được gán nhãn không an toàn và những điểm khác biệt giữa nội dung an toàn và không an toàn.
Trình phân loại truyền thống có thể có hiệu suất cao, độ trễ thấp và chi phí vận hành thấp. Tuy nhiên, quá trình thu thập để có đủ số lượng các ví dụ huấn luyện có thể mất rất nhiều thời gian và chi phí, và cập nhật hay thay đổi chính sách cũng đòi hỏi phải huấn luyện lại trình phân loại đó.
Mô hình gpt-oss-safeguard khác biệt vì khả năng suy luận của nó cho phép nhà phát triển áp dụng bất kỳ chính sách nào, bao gồm các chính sách do chính họ tự viết hoặc lấy từ các nguồn khác, và suy luận giúp các mô hình khái quát hóa trên các chính sách mới được viết. Bên cạnh các chính sách an toàn, gpt-oss-safeguard còn có thể được sử dụng để gán nhãn nội dung theo những cách thức khác quan trọng đối với các sản phẩm và nền tảng cụ thể.
Các mô hình suy luận chính của chúng tôi hiện học trực tiếp các chính sách an toàn và sử dụng khả năng suy luận của mình để đánh giá điều gì là an toàn. Cách tiếp cận này, mà chúng tôi gọi là điều chỉnh thận trọng, cải thiện đáng kể so với các phương pháp huấn luyện an toàn trước đây và giúp các mô hình suy luận của chúng tôi an toàn hơn trên một số phương diện so với các phiên bản tiền nhiệm không suy luận của chúng, ngay cả khi năng lực của chúng tăng lên. Tuy nhiên, suy luận không chỉ hữu ích cho việc huấn luyện các mô hình. Năng lực này còn mở ra các khả năng mới cho phương pháp phòng thủ nhiều lớp. Các cách tiếp cận dựa trên suy luận linh hoạt hơn và ít bị giới hạn hơn bởi các chi tiết của quá trình huấn luyện trước đó, những ưu điểm đôi khi thừa sức biện minh cho chi phí tính toán bổ sung và độ trễ mà chúng đòi hỏi.
gpt-oss-safeguard là bản triển khai trọng số mở của phương pháp mà chúng tôi đã phát triển nội bộ, thông qua một công cụ mà chúng tôi gọi là Trình suy luận an toàn. Chúng tôi bắt đầu tinh chỉnh tăng cường trong các tác vụ gán nhãn chính sách, thưởng cho mô hình khi nó phản ánh đúng các phán đoán của các chuyên gia. Điều này đã dạy mô hình suy luận về cách chính sách dẫn đến phán đoán của nó. Hiện nay, Trình suy luận an toàn cho phép chúng tôi cập nhật linh hoạt các chính sách an toàn trong môi trường sản xuất trong thời gian ngắn hơn so với thời gian cần để huấn luyện lại một trình phân loại. Điều này biến Trình suy luận an toàn thành một công cụ quan trọng cho triển khai lặp đi lặp lại: khi triển khai các mô hình mới trong môi trường sản xuất, chúng tôi thường bắt đầu bằng các chính sách có tính chất chặt chẽ hơn và sử dụng lượng tài nguyên tính toán tương đối lớn khi cần thiết để giúp Trình suy luận an toàn áp dụng thận trọng các chính sách này. Sau đó, chúng tôi điều chỉnh chính sách khi hiểu biết về các rủi ro trong môi trường sản xuất được cải thiện. Trong một vài bản phát hành gần đây, tỷ lệ tính toán dành cho suy luận về an toàn đã lên tới 16%.
Trình suy luận an toàn đã trở thành một phần cốt lõi trong hệ thống bảo mật của chúng tôi. Đối với tạo hình ảnh và Sora 2, công cụ này thực hiện các đánh giá động, theo từng bước đối với đầu ra để xác định và chặn các nội dung tạo ra không an toàn theo thời gian thực. Trong những lĩnh vực như sinh học và tự hại, chúng tôi chạy các mô hình như những mô hình được sử dụng trong API Kiểm duyệt dưới dạng các bộ phân loại nhỏ, nhanh và có độ thu hồi cao để xác định nội dung nào thuộc phạm vi quan tâm, sau đó sử dụng Trình suy luận an toàn để rà soát nội dung đó. Trình suy luận an toàn phân loại đầu ra của mô hình theo một hệ phân loại chi tiết để xác định cách phản hồi phù hợp nhất, tạo thành một phần trong các biện pháp bảo vệ nhiều lớp của chúng tôi trên các hệ thống như GPT‑5 và ChatGPT Agent. Và giờ đây, các mô hình gpt-oss-safeguard cung cấp phương pháp này cho tất cả mọi người.
Chúng tôi đã đánh giá các mô hình gpt-oss-safeguard trên cả bộ dữ liệu đánh giá nội bộ và bên ngoài.
Trong đánh giá nội bộ, chúng tôi đồng thời cung cấp nhiều chính sách cho gpt-oss-safeguard tại thời điểm suy luận. Đối với mỗi dữ liệu thử nghiệm, chúng tôi đánh giá xem gpt-oss-safeguard có phân loại đúng văn bản theo tất cả các chính sách áp dụng hay không. Đây là một nhiệm vụ khó khăn—mô hình chỉ được xem là chính xác nếu khớp chính xác với các nhãn chuẩn cho tất cả các chính sách được bao gồm.
Các mô hình gpt-oss-safeguard và Trình suy luận an toàn nội bộ của chúng tôi vượt trội hơn so với gpt-5-thinking và các mô hình mở gpt-oss về độ chính xác khi áp dụng nhiều chính sách. Các mô hình gpt-oss-safeguard vượt trội so với gpt-5-thinking là điều đặc biệt gây bất ngờ, nhất là khi xét đến kích thước nhỏ của các mô hình trước đó.
Chúng tôi đã tiến hành đánh giá thêm các mô hình này trên bộ dữ liệu kiểm duyệt(mở trong cửa sổ mới) mà chúng tôi công bố cùng bài nghiên cứu năm 2022(mở trong cửa sổ mới) và trên ToxicChat(mở trong cửa sổ mới), một bộ tiêu chuẩn công khai dựa trên các truy vấn của người dùng tới một chatbot mã nguồn mở.
Trên bộ đánh giá kiểm duyệt năm 2022, chúng tôi đã đánh giá bằng các chính sách an toàn nội bộ của mình (điều chỉnh một chính sách để tính đến những thay đổi sau đó). gpt-oss-safeguard có hiệu suất tốt hơn một chút so với tất cả các mô hình được thử nghiệm khác, bao gồm Trình suy luận an toàn nội bộ và gpt-5-thinking, mặc dù về mặt thống kê thì sự khác biệt giữa Trình suy luận an toàn và gpt-oss-safeguard không đáng kể.
Với ToxicChat, chúng tôi đánh giá bằng một câu lệnh ngắn được viết tay, điều chỉnh từ một số chính sách nội bộ của chúng tôi. trình suy luận an toàn nội bộ tiếp tục vượt trội so với gpt-5-thinking, còn gpt-5-thinking và trình suy luận an toàn đều có phần vượt trội hơn gpt-oss-safeguard-120b và gpt-oss-safeguard-20b. Chúng tôi dự đoán rằng kích thước tương đối nhỏ của gpt-oss-safeguard vẫn khiến mô hình này được ưu tiên cho loại tác vụ này.
Gpt-oss-safeguard có hai hạn chế cụ thể. Thứ nhất, chúng tôi nhận thấy các trình phân loại được huấn luyện trên hàng chục nghìn mẫu gắn nhãn chất lượng cao vẫn có thể phân loại nội dung tốt hơn gpt-oss-safeguard khi suy luận trực tiếp từ chính sách. Dành thời gian huấn luyện một trình phân loại chuyên biệt có thể là lựa chọn tốt hơn nếu cần hiệu suất cao hơn cho các rủi ro có tính chất phức tạp hơn.
Thứ hai, gpt-oss-safeguard có thể đòi hỏi nhiều thời gian và tài nguyên tính toán, điều này khiến việc mở rộng quy mô trên toàn bộ nội dung nền tảng trở nên khó khăn. Về nội bộ, chúng tôi xử lý việc này theo một số cách bằng Trình suy luận an toàn: (1) chúng tôi sử dụng các trình phân loại nhỏ hơn và nhanh hơn để xác định nội dung cần đánh giá và (2) trong một số tình huống, chúng tôi sử dụng Trình suy luận an toàn theo cách bất đồng bộ để cung cấp trải nghiệm người dùng có độ trễ thấp, đồng thời vẫn duy trì khả năng can thiệp nếu phát hiện nội dung không an toàn.
gpt-oss-safeguard là bộ mô hình an toàn mã nguồn mở đầu tiên mà OpenAI phát triển cùng cộng đồng. Trong khuôn khổ giai đoạn thử nghiệm sớm, chúng tôi đã liên tục cải tiến gpt-oss-safeguard cùng các chuyên gia về tin cậy và an toàn tại SafetyKit, ROOST, Tomoro, và Discord. Giám đốc Công nghệ của ROOST, ông Vinay Rao, chia sẻ: “gpt-oss-safeguard là mô hình suy luận mã nguồn mở đầu tiên có thiết kế "cho phép người dùng áp dụng chính sách và định nghĩa theo cách riêng về nội dung có hại".” Các tổ chức xứng đáng được tự do nghiên cứu, chỉnh sửa và sử dụng công nghệ an toàn quan trọng, cũng như có khả năng đổi mới sáng tạo. Trong quá trình thử nghiệm, mô hình thể hiện tốt khả năng hiểu các chính sách khác nhau, giải thích cách suy luận của mình, và cho thấy sự tinh tế trong việc áp dụng các chính sách. Đó là những điều mà chúng tôi tin rằng sẽ mang lại lợi ích cho nhà xây dựng sản phẩm và các đội nhóm phụ trách an toàn.”
Chúng tôi sẽ tiếp tục cùng cộng đồng cải tiến các công cụ an toàn mở, trong đó có Cộng đồng mô hình ROOST (RMC). RMC tập hợp các chuyên gia thực hành và nhà nghiên cứu về an toàn, cùng chia sẻ những thông lệ tốt nhất khi triển khai mô hình AI mã nguồn mở vào quy trình an toàn, bao gồm cả các kết quả thẩm định và phản hồi về mô hình. Truy cập kho lưu trữ GitHub của RMC(mở trong cửa sổ mới) để biết thêm về mối quan hệ hợp tác này và cách tham gia.
Để bắt đầu xây dựng với các mô hình này, hãy tải chúng xuống từ Hugging Face(mở trong cửa sổ mới).

