Bỏ qua nội dung chính
OpenAI

3 tháng 9, 2026

An toàn

Tổng quan về an toàn: GPT‑6 Astra

Đang tải…

Hôm nay, chúng tôi ra mắt GPT‑6 Astra, mô hình mạnh nhất mà chúng tôi từng triển khai rộng rãi. Astra là mô hình đầu tiên của chúng tôi đạt đạt cấp Trọng yếu về năng lực an ninh mạng theo Khung chuẩn bị.

Sau đây là những điều quan trọng nhất cần biết về mức độ an toàn của bản phát hành này:

  1. GPT‑6 Astra có bước tiến lớn về năng lực an ninh mạng và đạt ngưỡng Trọng yếu của chúng tôi. Điều này có nghĩa là khi có công cụ và quyền truy cập phù hợp, GPT‑6 Astra có thể tìm ra các lỗ hổng bảo mật chưa từng được biết đến và phát triển những cách thức mới để khai thác chúng trên nhiều hệ thống được bảo vệ nghiêm ngặt mà không cần con người hướng dẫn từng bước. Vì vậy, chúng tôi đã tăng cường đáng kể các biện pháp ngăn mô hình thực hiện hành động gây hại trên không gian mạng, dù do bị lạm dụng hay do không đồng bộ mục tiêu. Chúng tôi cũng thực hiện các bước để bảo mật quá trình phát triển và triển khai nội bộ Astra cùng các mô hình tương tự, bao gồm cách ly nghiêm ngặt hơn, mã hóa điểm kiểm tra, giám sát toàn bộ mọi tiến trình—bao gồm cả chuỗi suy nghĩ (CoT)—và quy trình đánh giá khả năng đồng bộ mục tiêu có khả năng chặn trước khi sử dụng nội bộ.
  2. GPT‑6 Astra an toàn hơn đáng kể so với các phiên bản tiền nhiệm. Nhờ tích hợp các kỹ thuật huấn luyện an toàn mới nhằm tăng khả năng an ninh, GPT‑6 Astra chống chịu các cuộc bẻ khóa tốt hơn đáng kể so với GPT‑5.6 Sol, kể cả trong những tiến trình dài hơn. Điều này được xác nhận qua các thử nghiệm ngoại tuyến cùng chương trình kiểm thử và khắc phục bẻ khóa nghiêm ngặt, cả nội bộ lẫn bên ngoài. Với những người dùng được đánh dấu là có thể có rủi ro cao, chúng tôi còn huấn luyện mô hình khả năng điều chỉnh ranh giới từ chối theo hướng thận trọng hơn và bao quát nhiều rủi ro sử dụng kép hơn. Chúng tôi dùng kiểm thử hồi quy để bảo đảm Astra chống chịu được các cuộc bẻ khóa phát hiện trong những đợt kiểm thử trước, đồng thời tiến hành các vòng kiểm thử đội đỏ (red team) tự động mới bằng những tác nhân tấn công kiểm thử đội đỏ (red team) nội bộ mới nhất nhằm xác thực các cải tiến.
  3. GPT‑6 Astra có khả năng đồng bộ mục tiêu tốt hơn GPT‑5.6 Sol. Astra là một bước tiến lớn trong khả năng đồng bộ mục tiêu của mô hình, với các cải tiến trải dài từ thành phần dữ liệu đào tạo trước đến cách chúng tôi chấm điểm trong quá trình học tăng cường. Chúng tôi công bố một bộ đánh giá khả năng đồng bộ mục tiêu mới(mở trong cửa sổ mới) và nhận thấy GPT‑6 Astra tuân thủ tốt hơn các ranh giới an toàn, bảo mật cũng như phạm vi được cho phép. Trong một mô phỏng sử dụng hơn 54.000 tác vụ Codex nội bộ(mở trong cửa sổ mới), Astra cũng chỉ nhận khoảng một nửa số cảnh báo về hành vi không đồng bộ mục tiêu có mức độ nghiêm trọng cao hơn so với Sol.
  4. Chúng tôi đang triển khai rộng rãi hoạt động giám sát tình trạng không đồng bộ mục tiêu. Chúng tôi coi khả năng đồng bộ mục tiêu của mô hình là đòn bẩy chính để ngăn các mô hình có hành vi không đồng bộ mục tiêu tiềm ẩn. Tuy nhiên, hoạt động giám sát cung cấp khả năng quan sát rộng khắp đối với hành vi của mô hình tiên phong, qua đó làm rõ những cơ hội tiếp tục cải thiện khả năng đồng bộ mục tiêu và độ an toàn. Ngoài ra, hoạt động giám sát còn là một lớp bảo vệ bổ sung trước những hành vi không đồng bộ mục tiêu được phát hiện. Vì những lý do này, chúng tôi đã bổ sung tính năng giám sát không đồng bộ mục tiêu cho mọi hoạt động suy luận có sử dụng công cụ trong quá trình triển khai Astra ra bên ngoài, dù việc này tiêu tốn đáng kể tài nguyên điện toán. Hệ thống này tương tự cấu hình nội bộ của chúng tôi.
  5. Khả năng giám sát của GPT‑6 Astra đã giảm so với GPT‑5.6 Sol. Chúng tôi đã tiến hành nhiều nghiên cứu chuyên sâu về khả năng giám sát(mở trong cửa sổ mới)khả năng kiểm soát(mở trong cửa sổ mới) của GPT‑6 Astra. Chúng tôi nhận thấy GPT‑6 Astra kiểm soát CoT của chính mình tốt hơn GPT‑5.6 Sol và ít đưa thông tin bắt lỗi vào CoT hơn. Trong môi trường đối kháng, nơi chúng tôi thúc đẩy mô hình né tránh các trình giám sát, mô hình có thể không bị phát hiện khi chủ đích thể hiện năng lực thấp trong các bài đánh giá (giấu năng lực), đồng thời đôi khi có thể né tránh trình giám sát nội bộ khi được yêu cầu thực hiện một số tác vụ phá hoại nhất định(mở trong cửa sổ mới). Chúng tôi chưa thấy bằng chứng về hoạt động suy luận CoT có sử dụng kỹ thuật giấu tin, chẳng hạn che giấu suy luận ẩn trong văn bản thông thường và có vẻ không liên quan. Điều này cho thấy rủi ro né tránh có thể chủ yếu giới hạn ở các tác vụ suy luận cấp thấp hơn.
    • Những phát hiện này cho thấy các mô hình thuộc lớp Astra có thể né tránh trình giám sát CoT của chúng tôi trong điều kiện đối kháng. Hiện tại, những phát hiện này phần lớn dựa trên các đánh giá đối kháng, tức là khi chúng tôi yêu cầu mô hình né tránh việc giám sát. Nhìn chung, các đánh giá khả năng đồng bộ mục tiêu của chúng tôi cho thấy Astra ít có khả năng vi phạm những hạn chế về bảo mật và an toàn hơn GPT‑5.6 Sol.
    • Tuy nhiên, chúng tôi nghiêm túc xem xét xu hướng này và đang tiếp tục nghiên cứu những phát hiện trên cùng tác động của chúng đối với khả năng giám sát khi các mô hình ngày càng mạnh hơn. OpenAI đã nỗ lực duy trì và tận dụng việc giám sát chuỗi suy nghĩ; duy trì khả năng giám sát CoT là một mục tiêu cốt lõi của chương trình nghiên cứu. Tuy nhiên, các kết quả này cũng nhấn mạnh tầm quan trọng của việc phát triển những kỹ thuật kiểm tra khả năng đồng bộ mục tiêu vượt ra ngoài phạm vi xem xét chuỗi suy nghĩ của mô hình.
  6. GPT‑6 Astra xử lý có trách nhiệm hơn trong môi trường duyệt web và làm việc: GPT‑6 Astra có khả năng chống chịu tốt hơn đáng kể trước hành vi chèn câu lệnh so với GPT‑5.6 Sol. Chúng tôi cũng đã kiểm thử hành vi của mô hình trong các môi trường duyệt web và máy tính phục vụ công việc sát thực tế. Kết quả cho thấy mô hình ít có khả năng thực hiện các hành động không đồng bộ mục tiêu và có thể gây thiệt hại hơn đáng kể so với GPT‑5.6 Sol, chẳng hạn như giao dịch trái phép, làm mất dữ liệu, truy cập quá mức hoặc né tránh cơ chế kiểm soát. Mô hình cũng hành động an toàn hơn khi xử lý các yêu cầu có hại trong môi trường tác tử, chẳng hạn yêu cầu hỗ trợ lên kế hoạch tấn công bạo lực hoặc thực hiện hành vi gian lận.
  7. GPT‑6 Astra an toàn hơn đáng kể trong các tình huống có rủi ro cao. GPT‑6 Astra phản hồi an toàn hơn GPT‑5.6 Sol trước những yêu cầu khó lấy từ môi trường thực tế và hoạt động kiểm thử đội đỏ (red team) đối kháng do con người thực hiện. Astra đạt được mức cải thiện Pareto khi vừa xử lý an toàn các yêu cầu không an toàn, vừa tránh từ chối không cần thiết những yêu cầu vô hại. Những cải tiến này cũng áp dụng cho các tình huống nghiêm trọng, nơi rủi ro gây hại xuất phát từ bối cảnh rộng hơn thay vì từ một yêu cầu rõ ràng. Astra cũng áp dụng nhất quán hơn các ranh giới an toàn phù hợp với độ tuổi cho người dùng dưới 18 tuổi.