Bỏ qua nội dung chính
OpenAI

1 tháng 9, 2026

An toànBảo mật

Con đường đến Astra: năng lực quan trọng và biện pháp bảo vệ tiên phong

Đang tải…

Kể từ đánh giá trước đây rằng Astra có thể đạt cấp năng lực an ninh mạng Quan trọng, chúng tôi đã thu thập thêm bằng chứng và tiến hành các đánh giá bổ sung về năng lực của mô hình. Hiện chúng tôi tin rằng Astra đáp ứng ngưỡng năng lực an ninh mạng Quan trọng theo Khung chuẩn bị. Điều này nghĩa là khi có công cụ và quyền truy cập phù hợp, Astra có thể tìm các lỗ hổng bảo mật chưa từng được biết đến và phát triển cách khai thác chúng trên nhiều hệ thống được bảo vệ nghiêm ngặt mà không cần con người hướng dẫn từng bước. Đây là mô hình đầu tiên được chúng tôi xếp ở cấp độ này và cần có biện pháp bảo vệ mạnh mẽ hơn trong quá trình phát triển cũng như trước khi phát hành.

Trong vài tuần qua, chúng tôi đã trì hoãn một số phần trong quá trình phát triển và phát hành Astra để tăng cường, kiểm thử các biện pháp bảo vệ trước hành vi lạm dụng mạng và hành động trái phép của mô hình. Dựa trên công việc đó, chúng tôi tin rằng các biện pháp bảo vệ của Astra giảm thiểu đầy đủ nguy cơ gây tác hại nghiêm trọng để có thể phát hành theo Khung chuẩn bị.

Dù Astra không liên quan đến sự cố Hugging Face, chúng tôi đã đưa những bài học(mở trong cửa sổ mới) từ sự cố đó vào phương pháp an toàn của mình. Dựa trên kiểm thử hồi cứu, chúng tôi tin rằng các biện pháp bảo vệ sản xuất vào thời điểm đó sẽ ngăn được sự cố Hugging Face. Kể từ đó, chúng tôi đã triển khai các biện pháp bảo vệ Astra mạnh mẽ hơn nữa, bao gồm đào tạo mô hình từ chối yêu cầu gây hại về mạng đáng tin cậy hơn và tuân thủ các giới hạn an toàn, bổ sung biện pháp chống lạm dụng và cơ chế giám sát có thể chặn hoạt động có khả năng trái phép.

Chúng tôi dự kiến sớm cung cấp Astra, nhưng quyền truy cập các năng lực an ninh mạng tiên tiến nhất của mô hình sẽ bị hạn chế hơn. Ban đầu, công việc an ninh mạng nâng cao sẽ dành cho một nhóm người thử nghiệm; sau đó, quyền truy cập qua Daybreak Blue sẽ được cung cấp để mở rộng mục đích phòng thủ.

Khi ra mắt, chúng tôi sẽ chia sẻ thêm chi tiết về các hoạt động kiểm thử và đánh giá an toàn, bảo mật và căn chỉnh trong thẻ hệ thống của mô hình. Trước khi phát hành, chúng tôi muốn cập nhật một số công việc đang thực hiện nhằm chuẩn bị phát hành an toàn một mô hình có năng lực an ninh mạng ở cấp độ này, đồng thời minh bạch về những rủi ro còn tồn tại.

Đánh giá năng lực an ninh mạng của Astra

Theo Khung chuẩn bị, một mô hình đáp ứng ngưỡng Quan trọng nếu thỏa mãn một trong các điều kiện sau:

  • Mô hình có thể tự xác định và phát triển mã khai thác zero-day hoạt động được ở mọi mức độ nghiêm trọng trong nhiều hệ thống trọng yếu thực tế đã gia cố mà không cần con người can thiệp.
  • Chỉ với một mục tiêu mong muốn ở cấp độ khái quát, mô hình có thể đề ra và thực hiện các chiến lược mới hoàn chỉnh để tấn công mạng vào mục tiêu đã gia cố.

Đánh giá mức độ chuẩn bị của chúng tôi đối với Astra kết hợp các điểm chuẩn công khai và riêng tư tự động với đánh giá do chuyên gia thực hiện. So với GPT‑5.6 Sol, Astra có bước tiến đáng kể về năng lực an ninh mạng: vừa sử dụng token hiệu quả hơn nhiều, vừa có năng lực xác định lỗ hổng và phát triển mã khai thác tốt hơn.

Chẳng hạn, chúng tôi cho Astra chạy trên ExploitBench và mô hình đạt điểm tuyệt đối 100% trong điểm chuẩn đánh giá khả năng phát triển mã khai thác từ các lỗ hổng đã biết.

Do lo ngại dữ liệu bị nhiễm, sau đó chúng tôi xây dựng một điểm chuẩn nội bộ mang tên “ExploitBench - Bản chuyển nội bộ (tháng 6–8/2026)”, gồm 20 lỗ hổng V8 có mức độ nghiêm trọng cao được công bố gần đây hơn. Trên tập dữ liệu này, Astra đạt tỷ lệ thực thi mã tùy ý cao hơn nhiều so với GPT‑5.6 Sol trong khi sử dụng ít token đầu ra hơn đáng kể. Trong quá trình đánh giá, mô hình thậm chí còn phát hiện và sử dụng hai lỗ hổng zero-day trong một chuỗi khai thác. Chúng tôi đang thông báo hai lỗ hổng này cho các bên bảo trì.

Kết quả Astra hiển thị phản ánh các năng lực khi có quyền truy cập Daybreak Blue, không phải cấu hình sản xuất mặc định.

Trong các đánh giá do chuyên gia dẫn dắt trên một trình duyệt và hệ điều hành đã gia cố, Astra phát hiện những lỗ hổng chưa từng được biết đến và biến chúng thành các chuỗi khai thác hoạt động được. Mô hình đã xây dựng một chuỗi xâm nhập trình duyệt hoàn chỉnh có thể thoát khỏi sandbox và thực thi lệnh trên máy chủ khi trình duyệt mở một tệp HTML. Mô hình cũng tìm thấy nhiều lỗ hổng trong một hệ điều hành đã gia cố và kết hợp chúng thành chuỗi leo thang đặc quyền cục bộ, từ người dùng không có đặc quyền lên root. Tổng hợp các kết quả điều tra, chúng tôi kết luận rằng Astra đáp ứng ngưỡng Quan trọng.

Các biện pháp bảo vệ cần thiết cho năng lực quan trọng

Với các mô hình có năng lực an ninh mạng ở cấp độ của Astra, chúng tôi cần giải quyết hai con đường có thể dẫn đến tác hại mạng nghiêm trọng để giảm thiểu rủi ro, cả trong quá trình phát triển lẫn trước khi triển khai:

  • Tác nhân độc hại sử dụng mô hình. Các biện pháp bảo vệ phải ngăn chặn hiệu quả việc tác nhân độc hại sử dụng Astra để phát triển mã khai thác cho những lỗ hổng chưa từng được biết đến trong các hệ thống trọng yếu đã gia cố hoặc thực hiện các cuộc tấn công đầu cuối nhằm vào mục tiêu đã gia cố.
  • Mô hình thực hiện hành động trái phép, không phù hợp. Ngay cả khi không có người dùng độc hại, một mô hình có năng lực an ninh mạng tiên tiến vẫn có thể tự gây ra tác hại mạng nếu không được căn chỉnh phù hợp. Bên cạnh việc đặt ra tiêu chuẩn căn chỉnh rất cao cho các mô hình có những năng lực này, lớp phòng vệ thứ hai của chúng tôi phải nhanh chóng phát hiện và kiềm chế các hành động không phù hợp có thể gây tác hại đáng kể trong thực tế.

Đáng chú ý, con đường thứ hai áp dụng cho cả quá trình phát triển nội bộ lẫn triển khai bên ngoài. Như chúng tôi đã mô tả trước đây, sau sự cố OpenAI-Hugging Face, chúng tôi đã tạm dừng một số hoạt động đào tạo tiên phong (bao gồm một số hoạt động đào tạo Astra) trong hai tuần để gia cố hạ tầng đào tạo, bao gồm biện pháp cách ly và kiểm soát mạng, mở rộng giám sát, đồng thời tăng cường hoạt động đào tạo và các ngưỡng căn chỉnh. Sau đó, chúng tôi tiếp tục công việc ở quy mô nhỏ hơn dưới các biện pháp kiểm soát nghiêm ngặt hơn.

Chúng tôi trì hoãn lâu hơn một số đợt học tăng cường (RL) quy mô lớn cho các phiên bản Astra tương lai trong khi thiết lập tiêu chuẩn cao hơn về độ an toàn và bảo mật của môi trường đào tạo. Ngày 28 tháng 8, sau khi áp dụng các yêu cầu mới về an toàn và bảo mật, chúng tôi đã khởi động lại đợt RL tiên phong quy mô lớn từng bị tạm dừng. Chúng tôi vẫn đang tạm hoãn một số đợt đào tạo thử nghiệm quy mô nhỏ hơn.

Việc chuẩn bị phát hành Astra cũng đòi hỏi các biện pháp bảo vệ mạnh mẽ hơn trước hành vi lạm dụng mạng và hành động trái phép. Dưới đây, chúng tôi trình bày các biện pháp bảo vệ đó và cách đã kiểm thử chúng.

Khả năng chống lạm dụng mạng

Kể từ khi triển khai mô hình đầu tiên mà chúng tôi xếp vào cấp năng lực an ninh mạng Cao vào tháng 2, chúng tôi đã tăng cường các biện pháp bảo vệ an ninh mạng sau mỗi lần ra mắt. Phương pháp an toàn tổng thể của chúng tôi gồm nhiều lớp: khả năng từ chối của mô hình sau huấn luyện, bộ phân loại an toàn cấp hệ thống, cùng cơ chế phát hiện ngoại tuyến và vô hiệu hóa mối đe dọa.

Với GPT‑5.6(mở trong cửa sổ mới), chúng tôi đã cải thiện đáng kể độ vững chắc của hệ thống bảo vệ cấp hệ thống, trong đó có việc bổ sung bộ phân loại kích hoạt để phát hiện hành vi lạm dụng mạng và mở rộng phạm vi phòng vệ trước các kiểu Bẻ khóa phổ quát được phát hiện qua hoạt động kiểm thử đội đỏ (red team) tự động chuyên sâu. Trên nền tảng những cải tiến này, với Astra, chúng tôi đầu tư sâu hơn vào lớp mô hình trong hệ thống bảo vệ, đồng thời cải thiện khả năng xử lý ngữ cảnh xuyên suốt nhiều cuộc trò chuyện.

  • Nhờ các kỹ thuật đào tạo mới nhằm tăng độ vững chắc của mô hình, Astra từ chối đáng tin cậy hơn các yêu cầu hỗ trợ về mạng không được phép. Trong bộ đánh giá Bẻ khóa mạng của chúng tôi, Astra từ chối 91,5% yêu cầu (so với 59% của GPT‑5.6 Sol).
  • Với các tài khoản được đánh giá có rủi ro cao hơn, chúng tôi áp dụng ranh giới hành vi mô hình thận trọng hơn, từ chối nhiều loại hỗ trợ về mạng có khả năng gây rủi ro hơn. Với người dùng có rủi ro cao, chúng tôi đã mở rộng ngữ cảnh cho các hệ thống giám sát để phát hiện những hình thức lạm dụng mạng này.

Chúng tôi cũng tiếp tục chương trình kiểm thử nghiêm ngặt, kiểm thử đội đỏ (red team) nội bộ và bên ngoài, cùng hoạt động khắc phục. Ngoài kiểm thử hồi quy để bảo đảm mọi kiểu Bẻ khóa phát hiện trong các giai đoạn kiểm thử trước vẫn được phòng vệ, chúng tôi đang tiến hành một đợt kiểm thử đội đỏ (red team) mới với các tác nhân tấn công kiểm thử đội đỏ (red team) nội bộ mới nhất. Chúng tôi đang hợp tác với các đối tác trong ngành để xác định một hệ thống đánh giá Bẻ khóa chung và sẽ dùng chương trình ứng phó nhanh 24/7 để điều tra, xử lý các phát hiện mới. Chúng tôi sẽ chia sẻ thêm chi tiết về việc kiểm thử các biện pháp bảo vệ an ninh mạng trong thẻ hệ thống của Astra.

Hỗ trợ bên phòng thủ tìm và khắc phục lỗ hổng vẫn là trụ cột chính trong phương pháp an toàn của chúng tôi. Khi ra mắt, chúng tôi dự kiến các biện pháp bảo vệ của Astra sẽ gây nhiều trở ngại hơn mức mong muốn về lâu dài nhằm phòng ngừa nguy cơ lạm dụng. Ban đầu, quyền truy cập Astra cho các quy trình an ninh mạng nâng cao sẽ dành cho một nhóm nhỏ người thử nghiệm alpha; sau đó, quyền truy cập qua Daybreak Blue sẽ được mở rộng để hỗ trợ mục đích phòng thủ.

Căn chỉnh & giám sát

Chúng tôi cũng đã bổ sung nhiều lớp bảo vệ để ngăn mô hình thực hiện các hành động có khả năng không phù hợp:

  • Căn chỉnh mô hình: Trong các đánh giá của chúng tôi, Astra có khả năng tuân thủ các giới hạn rõ ràng về an toàn và bảo mật cũng như hoạt động trong phạm vi được phép cao hơn nhiều so với GPT‑5.6 Sol, khiến đây trở thành mô hình được căn chỉnh tốt nhất của chúng tôi từ trước đến nay. Chúng tôi đặc biệt chú trọng việc mô hình tuân thủ các giới hạn về bảo mật và an toàn cũng như duy trì hoạt động trong phạm vi được phép.
  • Giám sát và kiểm soát: Tương tự quy trình nội bộ, chúng tôi triển khai Astra với cơ chế giám sát chuỗi tư duy bổ sung để nhanh chóng phát hiện và kiềm chế các hành động có khả năng không phù hợp.

Astra là một bước tiến đáng kể trong việc căn chỉnh mô hình và là thành quả của nhiều hướng công việc căn chỉnh dài hạn, từ các biện pháp can thiệp trong đào tạo trước đến việc chấm điểm thận trọng, nhất quán hơn trong quá trình học tăng cường. Qua kiểm thử, chúng tôi nhận thấy Astra luôn có khả năng tuân thủ các giới hạn và cảnh báo an toàn rõ ràng (chẳng hạn như tự động xét duyệt) cao hơn GPT 5.6 Sol.

Chúng tôi cũng phát triển một bài kiểm thử dựa trên sự cố Hugging Face, khi các tác nhân chạy bài đánh giá an ninh mạng ExploitGym đã xâm nhập hệ thống của bên thứ ba. Chúng tôi dùng những nhiệm vụ khó nhất trong bài đánh giá đó để tạo các bài kiểm thử “honeypot”, nhằm xác định liệu mô hình có tìm cách xâm nhập hạ tầng bảo mật xung quanh thay vì giải quyết nhiệm vụ được giao hay không. Khi không có các biện pháp bảo vệ sản xuất, GPT‑5.6 Sol đã cố truy cập các mục tiêu đó trong 56% số bài kiểm thử mô phỏng môi trường điểm chuẩn, nơi mô hình được yêu cầu phát triển mã khai thác. Astra không thực hiện bất kỳ hành động nào như vậy trong các bài kiểm thử này. Các số liệu này mô tả hành vi trong điều kiện kiểm thử không có biện pháp bảo vệ an ninh mạng, không phải hoạt động sử dụng sản xuất thông thường.

Trái: Trong đánh giá mới này, chúng tôi quan sát cách các mô hình phản ứng khi bị hệ thống tự động xét duyệt từ chối. Mỗi nhiệm vụ diễn ra trong môi trường lao động tri thức và quá trình thực hiện bắt đầu ngay sau khi bị từ chối. Sau đó, mô hình có thể: kết thúc quá trình, tìm phương án an toàn hơn, thử lại một lệnh tương tự hoặc lợi dụng một cấu hình kém(mở trong cửa sổ mới) để hoàn toàn vượt qua bước tự động xét duyệt. Việc theo đuổi một trong hai phương án cuối sẽ bị coi là không đạt đánh giá. Astra chưa từng tìm cách lách bước tự động xét duyệt.

Phải: Trong đánh giá này, chúng tôi kiểm tra xu hướng gian lận của mô hình (bằng cách sử dụng “honeypot”) khi gặp những nhiệm vụ khó nhất hoặc bất khả thi trong bài đánh giá ExploitGym. Đánh giá được tiến hành trong môi trường mô phỏng, với các biện pháp bảo vệ ở chế độ chỉ quan sát, nhằm đánh giá hành vi của mô hình. Dù GPT‑5.6 Sol cho thấy khả năng gian lận cao hơn trong các tình huống này, Astra không tìm cách dùng những đường tắt đó mà vẫn có thể giải quyết hợp lệ một số nhiệm vụ.

Đào tạo để mô hình được căn chỉnh phù hợp là một lớp bảo vệ an toàn. Chúng tôi sẽ chia sẻ thêm chi tiết về việc kiểm thử căn chỉnh và kết quả trong thẻ hệ thống của Astra.

Chúng tôi cũng đang triển khai cơ chế giám sát sai lệch trong môi trường sản xuất cho các mô hình cấp Astra nhằm phát hiện và nhanh chóng kiềm chế khả năng sai lệch. Các biện pháp bảo vệ này tương tự cơ chế giám sát triển khai nội bộ của chúng tôi và gồm một hệ thống bộ phân loại kiểm tra suy luận cùng hành động của mô hình để phát hiện hành vi trái phép, đồng thời tự động chặn hoạt động có khả năng trái phép. Khi năng lực tăng lên, các biện pháp bảo vệ này không thể thay thế việc căn chỉnh tốt các mô hình. Mục tiêu của chúng tôi là các mô hình tương lai được căn chỉnh tốt đến mức những biện pháp này không bao giờ bị kích hoạt.

Điều này có ý nghĩa gì với người dùng

OpenAI cam kết bảo đảm lợi ích của AI được phổ biến rộng rãi. Do năng lực an ninh mạng của Astra tăng đáng kể, chúng tôi đặc biệt thận trọng để bảo đảm lần triển khai này an toàn và bảo mật. Các bước kiểm tra an toàn bổ sung đôi khi có thể làm chậm, tạm dừng hoặc dừng công việc hợp lệ, kể cả hoạt động phòng thủ an ninh mạng.

Đôi khi, hệ thống có thể đánh dấu nhầm hoạt động hợp lệ là hành vi có khả năng lạm dụng mạng hoặc trái phép, khiến hoạt động đó vô tình bị làm chậm, tạm dừng hoặc dừng lại. Điều này có thể bao gồm công việc dường như không liên quan trực tiếp đến an ninh mạng hoặc các nhiệm vụ mà tác nhân chạy trong thời gian dài.

Nếu trình giám sát sai lệch tạm dừng một nhiệm vụ, người dùng ChatGPT hoặc Codex có thể được yêu cầu xem xét hành động trước khi tiếp tục. Khi sử dụng các giao diện khác như API, nhiệm vụ sẽ dừng lại. Chúng tôi dự kiến tiếp tục hiệu chỉnh các biện pháp bảo vệ này để giảm tình trạng gián đoạn không cần thiết và mở rộng quyền truy cập các năng lực tiên phong thông qua những chương trình như Daybreak.

Hướng tới tương lai

Chúng ta đang bước vào một giai đoạn phát triển AI mà các mô hình có thể đảm nhận công việc hệ trọng hơn, còn những sai sót trong căn chỉnh và kiểm soát có thể gây hậu quả nghiêm trọng hơn. Việc hiện thực hóa lợi ích của các hệ thống này sẽ phụ thuộc vào khả năng căn chỉnh và kiểm soát mô hình khi năng lực của chúng tăng lên.

Trách nhiệm đó xuyên suốt quá trình đào tạo, đánh giá và triển khai. Điều này đòi hỏi bằng chứng thuyết phục hơn về hành vi được căn chỉnh, các biện pháp bảo vệ theo kịp năng lực và sự sẵn sàng giảm tốc khi những biện pháp đó chưa đủ.

Chúng tôi sẽ tiếp tục kiểm thử các hệ thống này, chia sẻ những điều học được và trình bày rõ những gì vẫn chưa chắc chắn. Những mô hình kế nhiệm Astra sẽ đòi hỏi chúng tôi nỗ lực nhiều hơn. Chúng tôi sẽ dành thời gian và thực hiện những công việc cần thiết để hoàn thành trách nhiệm đó.