Tóm tắt
Vấn đề
Kiểm thử đội đỏ (red team) là thiết yếu để phát hiện lỗ hổng và cải thiện độ vững chắc của các mô hình của chúng tôi. Tuy nhiên, các cách tiếp cận hiện nay không dễ mở rộng, tạo ra điểm nghẽn.
Các bài đánh giá độ vững chắc thường dùng đã bị những mô hình mới nhất của chúng tôi đạt ngưỡng bão hòa.
Chúng tôi cần phát triển các phương pháp cho phép an toàn và căn chỉnh mở rộng cùng với năng lực của mô hình.
Chúng tôi đã làm gì
Chúng tôi đã huấn luyện GPT‑Red, một mô hình kiểm thử đội đỏ (red team) tự động giúp mở rộng khả năng tìm lỗ hổng để chúng tôi có thể khắc phục trước khi triển khai rộng hơn.
GPT‑Red là một hệ thống kiểm thử đội đỏ (red team) mạnh, và các mô hình trước đây của chúng tôi rất dễ bị tổn thương trước các cuộc tấn công chèn câu lệnh của nó.
Chúng tôi dùng GPT‑Red để huấn luyện đối kháng GPT‑5.6, khiến mô hình này vững chắc hơn nhiều trước chèn câu lệnh.
Chúng tôi sẽ tiếp tục mở rộng cách tiếp cận này cùng với kiểm thử đội đỏ (red team) do con người và bên thứ ba thực hiện, các biện pháp bảo vệ nhiều lớp và giám sát theo thời gian thực.
Các hệ thống AI thường gặp dữ liệu của bên thứ ba thông qua trình duyệt, ứng dụng kết nối, tệp cục bộ và các công cụ khác. Những khả năng này cần thiết để thực hiện các tác vụ trong đời thực, nhưng cũng tạo thêm cơ hội để tác nhân độc hại tác động đến hành vi của mô hình. Ví dụ, một bên thứ ba có thể nhúng một chỉ dẫn được tạo tác kỹ lưỡng—được thiết kế để lừa mô hình tải dữ liệu nhạy cảm lên máy chủ bên ngoài—vào email, trang web, phản hồi của công cụ hoặc kho lưu trữ mã.
Kiểm thử đội đỏ (red team) do con người thực hiện là một phần then chốt trong công việc an toàn của chúng tôi, giúp chúng tôi phát hiện các lỗ hổng này trước khi triển khai và áp dụng đúng biện pháp bảo vệ. Nhưng chỉ dựa vào kiểm thử đội đỏ (red team) của con người thì khó mở rộng. Việc thiết kế và chạy các bài tập này tốn nhiều thời gian, hạn chế tốc độ chúng tôi có thể xác định các chế độ lỗi mới và đưa chúng vào những biện pháp bảo vệ mạnh hơn. Hơn nữa, dù các bài tập này tạo ra những ví dụ giá trị về các cuộc tấn công thành công, chúng không thể tạo ra khối lượng và sự đa dạng dữ liệu đối kháng cần thiết để cải thiện độ vững chắc của mô hình thông qua huấn luyện.
Để theo kịp các mô hình ngày càng có năng lực, kiểm thử đội đỏ (red team) cũng phải mở rộng. Vì mục tiêu này, chúng tôi đã huấn luyện các mô hình kiểm thử đội đỏ (red team) tự động, chỉ dùng nội bộ, nhằm phát hiện lỗ hổng trước khi triển khai và tạo các cuộc tấn công trong quá trình huấn luyện mô hình để cải thiện độ vững chắc. Chúng tôi tin rằng kiểm thử đội đỏ (red team) tự động mở ra một hình thức tự cải thiện then chốt cho an toàn: dùng các mô hình hôm nay để trực tiếp giúp các mô hình tương lai an toàn hơn.
GPT‑Red là kết quả hội tụ của những nỗ lực này và hiện là mô hình kiểm thử đội đỏ (red team) tự động tốt nhất của chúng tôi về an toàn. Tương tự cách người kiểm thử đội đỏ (red team) tạo ra các cuộc tấn công, mô hình hướng tới mục tiêu bằng cách gửi câu lệnh, quan sát cách các mô hình GPT phản hồi và lặp lại. Chúng tôi huấn luyện GPT‑Red ở quy mô điện toán tương đương một số đợt hậu huấn luyện lớn nhất của OpenAI—một lượng điện toán chưa từng có dành hoàn toàn cho việc cải thiện an toàn.
Chúng tôi trực tiếp tích hợp GPT‑Red vào quy trình huấn luyện các mô hình sản xuất của mình. Kết quả là GPT‑5.6 Sol trở thành mô hình vững chắc nhất của chúng tôi trước chèn câu lệnh tính đến nay, với số lần thất bại ít hơn 6 lần trên điểm chuẩn chèn câu lệnh trực tiếp khó nhất so với mô hình sản xuất tốt nhất của chúng tôi chỉ bốn tháng trước đó. Khả năng mở rộng của cách tiếp cận này khiến chúng tôi kỳ vọng vào những kết quả còn mạnh hơn trong tương lai khi tiếp tục huấn luyện các hệ thống kiểm thử đội đỏ (red team) mạnh hơn.
GPT‑Red được huấn luyện bằng học tăng cường tự chơi, trong đó mô hình và một tập hợp đa dạng các LLM phòng thủ được huấn luyện đồng thời trên một loạt kịch bản kiểm thử đội đỏ (red team). GPT‑Red được thưởng khi khơi gợi được một lỗi hợp lệ, chẳng hạn như chèn câu lệnh thành công, còn các mô hình phòng thủ được thưởng khi chống lại cuộc tấn công và hoàn thành nhiệm vụ ban đầu. Khi các hệ thống phòng thủ trở nên vững chắc hơn, GPT‑Red buộc phải tìm ra các cuộc tấn công mạnh hơn và đa dạng hơn.
Để hỗ trợ huấn luyện tự chơi, chúng tôi xây dựng một tập hợp lớn các kịch bản thực tế nơi chèn câu lệnh có thể được cài vào. Mỗi môi trường có một mô hình đe dọa nêu rõ GPT‑Red có thể kiểm soát những gì và thế nào được tính là tấn công thành công. Ví dụ, GPT‑Red có thể kiểm soát một phần tệp cục bộ, biểu ngữ trang web, nội dung email hoặc đầu ra của một công cụ.
Khi kết thúc huấn luyện, GPT‑Red là một kẻ tấn công rất mạnh: nó có thể phá vỡ gần như mọi mô hình được đưa ra đối đầu, gồm cả mô hình nội bộ lẫn mô hình sản xuất, cho đến và bao gồm GPT‑5.5. Sau khi GPT‑Red hoàn tất huấn luyện, chúng tôi dùng nó để tạo các cuộc chèn câu lệnh phục vụ huấn luyện GPT‑5.6, giúp mô hình trở nên kháng chịu cao trước các cuộc tấn công của GPT‑Red.
Chúng tôi giữ GPT‑Red tách biệt với các mô hình triển khai. Điều này giúp không để các năng lực độc hại mà chúng tôi huấn luyện riêng cho GPT‑Red rơi vào tay tác nhân đối địch, đồng thời đưa khả năng chống chịu vào các mô hình sản xuất của chúng tôi.
GPT‑Red có hiệu quả rất cao trước nhóm mô hình phòng thủ và các kịch bản kiểm thử đội đỏ (red team) mà nó được huấn luyện trên đó. Chúng tôi cũng đánh giá liệu mô hình này có hữu ích như một tác nhân kiểm thử đội đỏ (red team) đa năng để mang lại lợi ích rộng hơn cho an toàn tại OpenAI hay không. Để làm vậy, chúng tôi kiểm thử hiệu quả của GPT‑Red trên các môi trường an toàn và mô hình mục tiêu mới.
Trước tiên, chúng tôi đánh giá khả năng GPT‑Red khái quát hóa sang các kịch bản kiểm thử đội đỏ (red team) mới bằng phiên bản tái lập của đấu trường chèn câu lệnh gián tiếp từ Dziemian và cộng sự (2025)(mở trong cửa sổ mới). Trong thử thách này, cả người kiểm thử đội đỏ (red team) và GPT‑Red đều độc lập đề xuất các cuộc tấn công nhằm vào GPT‑5.1 trên một tập môi trường đã được xác định trước. Các kịch bản và mục tiêu kiểm thử đội đỏ (red team) này khác với những kịch bản và mục tiêu dùng để huấn luyện GPT‑Red. GPT‑Red đạt tỷ lệ tấn công thành công cao hơn đáng kể, thành công ở 84% kịch bản so với 13% của con người.
GPT‑Red xuất sắc trong vai trò hệ thống kiểm thử đội đỏ (red team) tự động. GPT‑Red có thể tạo ra các cuộc tấn công thành công nhằm vào GPT‑5.1 trong nhiều kịch bản hơn đáng kể so với người kiểm thử đội đỏ (red team) trên đấu trường chèn câu lệnh gián tiếp của Dziemian và cộng sự (2025) bằng một bản sao nội bộ.
Bài kiểm tra tối hậu đối với một hệ thống kiểm thử đội đỏ (red team) là khả năng đạt được các mục tiêu độc hại có chủ đích trước các hệ thống tác nhân ngoài đời thực khi chỉ biết chưa đầy đủ về mô hình nền tảng và thiết kế hệ thống điều khiển của hệ thống. Thí nghiệm đầu tiên của chúng tôi trong bối cảnh này cho GPT‑Red đối đầu với một máy bán hàng tự động dùng AI tại văn phòng OpenAI (tương tự Project Vend(mở trong cửa sổ mới)) do Andon Labs sản xuất. Chúng tôi cung cấp cho GPT‑Red mô tả về hệ thống và khả năng gửi các cuộc tấn công cũng như quan sát các lệnh gọi công cụ từ tác nhân mô phỏng, vốn phản ánh sát triển khai ngoài đời thực. Sau khi lặp lại nhiều lần trên các cuộc tấn công, GPT‑Red triển khai cuộc tấn công của mình lên tác nhân sản xuất và đạt cả ba mục tiêu độc hại:
- Đổi giá của một mặt hàng đắt tiền còn hàng xuống mức giá tối thiểu được phép là 0,50 USD;
- Đặt một mặt hàng mới trị giá trên 100 USD và chào bán với giá 0,50 USD; và
- Hủy đơn hàng của một khách hàng khác.
Chúng tôi đã công bố các lỗ hổng này và các biện pháp bảo vệ mới đang được tích cực thử nghiệm.
GPT‑Red có thể phá vỡ một tác nhân tự động đang hoạt động tên là Vendy, chuyên quản lý một máy bán hàng tự động. GPT‑Red đã khiến tác nhân sản xuất đổi các mặt hàng đắt tiền thành giá rẻ và hủy đơn hàng của khách khác, bằng cách trước tiên thử trong mô phỏng rồi chuyển các cuộc tấn công sang tác nhân đang hoạt động.
Chúng tôi cũng dùng GPT‑Red để tấn công một tác nhân Codex CLI (dựa trên GPT‑5.4 mini) trên bộ 10 kịch bản rò rỉ dữ liệu được giữ lại. Chúng tôi so sánh mô hình với một đường cơ sở GPT‑5.5 dùng câu lệnh để nghiên cứu tác động của quy trình huấn luyện của chúng tôi lên hiệu suất kiểm thử đội đỏ (red team) trên dữ liệu giữ lại. GPT‑Red vừa hiệu quả hơn, vì có thể khiến tác nhân rò rỉ dữ liệu nhạy cảm thành công trong nhiều kịch bản hơn, vừa tiết kiệm token hơn.
GPT‑Red hiệu quả hơn và tiết kiệm hơn trong việc phá vỡ các tác nhân codex đang hoạt động. Chúng tôi kiểm thử trên một tác nhân codex được GPT‑5.4 Mini hỗ trợ, với bộ tùy chỉnh gồm 10 tác vụ rò rỉ dữ liệu.
Mục tiêu tối hậu của GPT‑Red là cải thiện độ vững chắc của các mô hình của chúng tôi. Trong sáu tháng qua, chúng tôi đã huấn luyện các mô hình kiểm thử đội đỏ (red team) ngày càng mạnh hơn (tiền thân của GPT‑Red) với lượng điện toán tăng dần, và dùng các mô hình này trong quá trình huấn luyện từng mô hình sản xuất kế tiếp kể từ GPT‑5.3. Theo thời gian, mỗi bản phát hành GPT tiếp theo đều trở nên vững chắc hơn.
Ví dụ, một phiên bản sơ khai của GPT‑Red đã tìm ra một lớp tấn công chèn câu lệnh trực tiếp mới, gọi là tấn công “Chuỗi tư duy giả”. Các cuộc tấn công này đạt tỷ lệ thành công trên 95% trên GPT‑5.1 nhưng hiện đã xuống dưới 10% đối với GPT‑5.6 Sol. Tương tự, một số điểm chuẩn chèn câu lệnh gián tiếp của chúng tôi nhắm vào các cuộc tấn công trong công cụ dành cho nhà phát triển và duyệt web đã bị mô hình mới nhất của chúng tôi đạt ngưỡng bão hòa (>97% độ chính xác).
Khả năng chống chịu trước chính GPT‑Red cũng đã cải thiện đáng kể. Trên một tập rộng các môi trường đánh giá độ vững chắc, tỷ lệ tấn công thành công của GPT‑Red đã giảm đều theo thời gian. Với bản phát hành mô hình mới nhất, GPT‑5.6 Sol chỉ thất bại ở 0,05% các cuộc chèn câu lệnh trực tiếp của GPT‑Red.
Khi tiếp tục mở rộng huấn luyện tự chơi cho chèn câu lệnh, chúng tôi đã phát hiện các mối đe dọa mới có thể phá vỡ các mô hình hiện có. Tuy vậy, việc mở rộng này cũng giúp cải thiện đáng kể khả năng chống chịu trước các cuộc tấn công đó. Tỷ lệ tấn công thành công được tính bằng mức thành công trung bình của các nỗ lực trong toàn bộ nỗ lực của GPT‑Red trên các môi trường giữ lại.
Một mô hình có thể trông an toàn hơn bằng cách từ chối nhiều yêu cầu hơn hoặc trở nên kém năng lực hơn. Một mô hình làm ít việc hơn thì tự nhiên khó bị tấn công hơn, nhưng đó không phải là độ vững chắc hữu ích.
Chúng tôi đánh giá kỹ cả năng lực tiên phong tổng quát lẫn các tác vụ từ chối quá mức có mục tiêu do chúng tôi thiết kế. Chúng tôi nhận thấy mọi năng lực thông thường vẫn không bị ảnh hưởng, trong khi độ vững chắc được cải thiện đáng kể. Điều này cho thấy những cải thiện về độ vững chắc đến từ khả năng chống lại chỉ dẫn độc hại tốt hơn, chứ không phải do sử dụng công cụ không đúng cách hoặc mặc định từ chối các yêu cầu hợp lệ.
Các tác nhân AI đã được dùng để cải thiện năng lực của những mô hình thế hệ tiếp theo của chúng tôi. Chúng tôi tin rằng với GPT‑Red, chúng tôi đã bắt đầu mở ra một vòng quay tự thúc đẩy tương tự cho an toàn, trong đó các mô hình hôm nay có thể được dùng để giúp mô hình ngày mai vững chắc hơn, được căn chỉnh tốt hơn và đáng tin cậy hơn. Chúng tôi sẽ tiếp tục mở rộng điện toán và dữ liệu, đồng thời cải tiến thuật toán, để huấn luyện các phiên bản GPT‑Red tương lai mạnh hơn mô hình hiện nay. Và đến lượt mình, các mô hình này sẽ giúp các bản phát hành GPT trong tương lai an toàn hơn.
Chúng tôi sẽ phát hành một bản tiền ấn phẩm với nhiều chi tiết hơn vào cuối tuần này.


