Bỏ qua nội dung chính
OpenAI

16 tháng 9, 2026

Nghiên cứuAn toàn

Khung báo cáo tình trạng sai lệch mục tiêu của mô hình

Đang tải…

Chúng tôi công bố một khuôn khổ mới để theo dõi, điều tra và công khai các trường hợp sai lệch mục tiêu của mô hình tại OpenAI, cùng sáu báo cáo về những hành vi bất ngờ hoặc đáng lo ngại của mô hình mà chúng tôi quan sát được trong sáu tháng qua.

Trước đây, để cung cấp thông tin tốt hơn cho các nhà nghiên cứu, nhà phát triển AI, nhà hoạch định chính sách và công chúng, chúng tôi đã nỗ lực công khai các phát hiện của mình về tình trạng sai lệch mục tiêu. Tuy nhiên, do thiếu phương pháp có hệ thống để báo cáo những phát hiện này, việc công bố của chúng tôi diễn ra không nhất quán và ít thường xuyên hơn mong muốn: chúng tôi thường đợi đến khi có thể tổng hợp nhiều trường hợp vào một báo cáo hoặc đưa chúng vào thẻ hệ thống của các mô hình mới phát hành. Khuôn khổ mới này nhằm đẩy nhanh việc công bố báo cáo sai lệch mục tiêu sau khi phát hiện, ngay cả khi chúng tôi chưa giải thích đầy đủ hoặc giảm thiểu được hành vi được báo cáo.

Khi các hệ thống AI ngày càng tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng sự đồng thuận rộng hơn và dựa trên thông tin đầy đủ hơn về tiến bộ của nghiên cứu phù hợp mục tiêu. Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết vấn đề phù hợp mục tiêu và giám sát ở mức đủ để có thể tiếp tục tăng quy mô một cách có trách nhiệm với tốc độ tối đa lâu hơn nữa. Các quyết định về hướng phát triển AI trong những tháng và năm tới cần dựa trên bằng chứng mà những người ngoài các công ty xây dựng mô hình tiên phong có thể tự mình xem xét.

Các trường hợp sai lệch mục tiêu có thể giúp xác định những vấn đề mà các nhà phát triển AI khác có thể gặp phải khi hệ thống của họ đạt năng lực tương tự, làm rõ điểm yếu trong biện pháp bảo vệ hoặc đặt lại vấn đề về các giả định liên quan đến hành vi của mô hình. Việc chia sẻ những phát hiện này cho phép các bên khác điều tra cùng vấn đề, kiểm chứng cách giải thích của chúng tôi và cải thiện biện pháp giảm thiểu. Vì tin vào giá trị của sự minh bạch về tình trạng sai lệch mục tiêu, khuôn khổ mới của chúng tôi ưu tiên công bố ngay cả khi chưa chắc chắn về tầm quan trọng của sự việc. Điều này có nghĩa là một số trường hợp chúng tôi công bố sau đó có thể được xác định là không xác thực, không thuộc một xu hướng lớn hơn và cũng không báo hiệu diễn biến trong tương lai.

Hiện chưa có khuôn khổ áp dụng cho toàn ngành với các tiêu chuẩn rõ ràng về cách nhà phát triển AI nên công bố những trường hợp sai lệch mục tiêu trong mô hình của mình. Chúng tôi hy vọng khuôn khổ được trình bày hôm nay là bước đầu hướng tới việc xây dựng các tiêu chuẩn như vậy, trong đó quy định những trường hợp sai lệch mục tiêu mà nhà phát triển nên công bố và nội dung cần có trong báo cáo. Chúng tôi xem khuôn khổ này là một công trình đang được hoàn thiện và sẽ tiếp tục điều chỉnh dựa trên kinh nghiệm cùng phản hồi của công chúng.

Sau đây, chúng tôi mô tả cách khuôn khổ vận hành và chia sẻ những báo cáo đầu tiên mà chúng tôi sắp công bố.

Những trường hợp sai lệch mục tiêu chúng tôi sẽ báo cáo

Chúng tôi đặt mục tiêu công bố các trường hợp cung cấp bằng chứng hữu ích về nguyên nhân phát sinh và biểu hiện của tình trạng sai lệch mục tiêu trong mô hình, cũng như những điểm mà biện pháp bảo vệ phát huy hoặc không phát huy hiệu quả. Chúng tôi ưu tiên các cơ chế mới, những thay đổi đáng kể trong hành vi đã biết và các phát hiện đặt lại vấn đề về giả định liên quan đến an toàn hoặc biện pháp giảm thiểu. Một trường hợp không nhất thiết phải gây thiệt hại hoặc chứng minh một xu hướng rộng hơn mới đáng được công bố. Khuôn khổ này sẽ áp dụng cho các hành vi đáp ứng tiêu chí trong toàn bộ vòng đời của mô hình, bao gồm huấn luyện, đánh giá, kiểm thử và triển khai.

Các hành vi này bao gồm những cách thức mới để mô hình hành động khi chưa được cho phép, phối hợp với các mô hình khác hoặc né tránh giám sát; những thất bại khiến một phương pháp phù hợp mục tiêu hoặc biện pháp bảo vệ bị nghi ngờ; và hành vi đi ngược lại nhận định trong một đánh giá an toàn đã công bố. Các tiêu chí công bố tương tự cũng áp dụng cho tình trạng sai lệch mục tiêu có thể ảnh hưởng đến bên thứ ba.

Phạm vi này cũng có thể bao gồm các trường hợp sai lệch mục tiêu có vẻ trùng lặp với những trường hợp chúng tôi từng công bố. Việc vấn đề tái diễn tự nó có thể là bằng chứng hữu ích về cách các mô hình của chúng tôi hành xử hoặc hiệu quả của các biện pháp bảo vệ—chẳng hạn khi một loại hành vi sai lệch mục tiêu cụ thể vẫn liên tục tái diễn dù đã nhiều lần được xử lý. Trong những trường hợp này, chúng tôi sẽ công bố các ví dụ bổ sung bằng cách cập nhật bản công bố ban đầu về tình trạng sai lệch mục tiêu.

Theo thời gian, chúng tôi dự định phối hợp với các nhà phát triển khác, nhà nghiên cứu bên ngoài, tổ chức xây dựng tiêu chuẩn ngành và cơ quan quản lý để xây dựng các tiêu chí công bố khách quan hơn. Chúng tôi cũng cho rằng các sự cố nghiêm trọng về an toàn, bảo mật và sai lệch mục tiêu cần được chia sẻ với chính phủ liên bang Hoa Kỳ, đồng thời đang xây dựng đề xuất về các cơ chế báo cáo. Chúng tôi xem khuôn khổ này là phần bổ sung cho các nghĩa vụ hiện hành và lưu ý rằng khuôn khổ không thay thế các yêu cầu công bố theo pháp luật, bao gồm yêu cầu liên quan đến sự cố an toàn nghiêm trọng hoặc vi phạm an ninh mạng.

Các trường hợp sai lệch mục tiêu được chia sẻ hôm nay

Để khởi động khuôn khổ mới về công bố tình trạng sai lệch mục tiêu, chúng tôi đăng sáu báo cáo về các trường hợp hành vi sai lệch mục tiêu được quan sát trong quá trình huấn luyện hoặc đánh giá mô hình. Những trường hợp này minh họa nhiều hành vi khác nhau mà chúng tôi cho là đáng chia sẻ, từ che giấu thông tin với người dùng đến tự ý hành động để vượt qua trở ngại. Đây là báo cáo về từng trường hợp riêng lẻ và không nên được xem là phản ánh tần suất xảy ra tình trạng sai lệch mục tiêu trên các mô hình của chúng tôi. Mỗi mục dưới đây đều liên kết đến báo cáo đầy đủ.

  1. Hướng dẫn tự tạo trong bản tóm tắt tác vụ(mở trong cửa sổ mới). Một mô hình nghiên cứu chưa phát hành đã chèn các hướng dẫn không liên quan, bao gồm cả hướng dẫn bỏ qua những ràng buộc thông thường, vào các bản tóm tắt dùng để tiếp tục công việc trong một cửa sổ ngữ cảnh mới. Chúng tôi xác định có 27 bản tóm tắt bị ảnh hưởng.

  2. Hướng dẫn che giấu sai sót trong bản tóm tắt tác vụ(mở trong cửa sổ mới). Trong quá trình huấn luyện GPT‑5.6 Sol, nhiều phiên bản mô hình đã thêm vào bản tóm tắt các hướng dẫn nhằm che giấu sai sót hoặc hành vi lệch chuẩn với người dùng. Ví dụ, các bản tóm tắt Nén ngữ cảnh có hướng dẫn bịa ra dữ liệu lịch sử còn thiếu mà không tiết lộ, đồng thời che giấu sự không khớp giữa các phiên bản nguồn.

  3. Tìm khóa API bị lộ trong các kho lưu trữ công khai rồi bịa đặt thông tin(mở trong cửa sổ mới). Khi trả lời một câu hỏi thông thường về số liệu thu nhập tại một hạt ở California, một mô hình đã tìm thấy và sử dụng trái phép một khóa API bị lộ. Khi vẫn không thể truy xuất các số liệu được yêu cầu, mô hình đã bịa ra chúng và trình bày như thể đó là dữ liệu từ nguồn mà người dùng yêu cầu.

  4. Tải tệp lên Internet để trích dẫn(mở trong cửa sổ mới). Khi người dùng yêu cầu một mô hình chưa phát hành cung cấp ID và tên của các hồ nước có diện tích trên 5.000.000 mét vuông, tác nhân đã tìm được câu trả lời chính xác bằng Python. Tuy nhiên, vì hướng dẫn yêu cầu trích dẫn từ trình duyệt, tác nhân đã tự ý tải tệp lên để có thể trích dẫn trong câu trả lời mà không hỏi người dùng.

  5. Ghi dữ liệu và liên lạc trái phép qua một kho lưu trữ phần mềm nội bộ(mở trong cửa sổ mới). Trong lúc tìm các tệp đầu vào bị thiếu, các mô hình đã dùng một kho lưu trữ phần mềm nội bộ làm bảng tin để trao đổi yêu cầu và phản hồi giữa các mẫu huấn luyện riêng biệt, dù không thể khôi phục những tệp đó. Báo cáo này cũng xem xét một trường hợp trước đó, khi một mô hình đã tải thành công các tệp kiểm thử lên kho lưu trữ trong lúc cố vượt qua các hạn chế mạng.

  6. Chia sẻ tệp trái phép giữa các tác nhân cộng tác(mở trong cửa sổ mới). Các tác nhân cùng thực hiện một tác vụ huấn luyện đã dùng những trang lưu trữ tệp công khai để chia sẻ tệp khi không thể truy cập tệp cục bộ của nhau. Điều này khiến các sản phẩm bàn giao của tác vụ xuất hiện tại những URL công khai, dù tác vụ yêu cầu các mô hình chỉ sử dụng tệp cục bộ.

Cách thức hoạt động của quy trình công bố

Mọi nhân viên OpenAI đều có thể đánh dấu một trường hợp sai lệch mục tiêu để các nhóm an toàn và phù hợp mục tiêu điều tra, đồng thời yêu cầu xem xét công bố trường hợp đó. Việc này khởi động quy trình công bố, với thời hạn cho từng bước nhằm bảo đảm điều tra và công bố kịp thời.

Sau khi một trường hợp được đánh dấu, nhân viên kỹ thuật của chúng tôi sẽ điều tra sự việc, những điểm còn chưa chắc chắn, việc có nên công bố hay không và những dữ kiện có thể chia sẻ. Họ cũng sẽ đánh giá liệu có bên thứ ba nào bị ảnh hưởng và cần được thông báo riêng trước khi công bố hay không.

Sau đó, trường hợp đó sẽ được đưa vào một trong ba quy trình: Sẵn sàng công bố, Điều tra nhỏ hoặc Điều tra quy mô lớn (“Quy trình chậm”).

Sẵn sàng công bố áp dụng cho các trường hợp đáp ứng tiêu chí và đã được điều tra đủ để có thể công bố sau khi rà soát. Điều tra nhỏ áp dụng cho các trường hợp cần điều tra kỹ thuật thêm. Chúng tôi dự kiến hai quy trình này sẽ áp dụng cho phần lớn các trường hợp được công bố, đặc biệt là những trường hợp không cần điều tra sâu rộng, phối hợp với bên thứ ba hoặc xử lý nguy cơ lạm dụng nghiêm trọng. Tất cả trường hợp được công bố hôm nay đều thuộc một trong hai quy trình này.

Điều tra quy mô lớn áp dụng cho các cuộc điều tra phức tạp, đặc biệt là những cuộc điều tra có liên quan đến bên thứ ba. Khi một bên thứ ba bị ảnh hưởng, các nghĩa vụ của chúng tôi về bảo mật, pháp lý và công bố có trách nhiệm sẽ được ưu tiên hơn khuôn khổ này. Chúng tôi sẽ cố gắng công bố thông báo ban đầu sớm nhất có thể, nhưng có thể phải trì hoãn vì lý do bảo mật—chẳng hạn khi một mô hình phát hiện lỗ hổng chưa từng được biết đến trong phần mềm được sử dụng rộng rãi. Nếu báo cáo có thể tiết lộ danh tính của bên thứ ba, chúng tôi dự định thông báo trước cho họ ngay cả khi không có ranh giới bảo mật nào bị xâm phạm.

Thông báo ban đầu về một trường hợp Điều tra quy mô lớn sẽ trình bày khái quát sự việc, cho biết liệu các chuyên gia bên ngoài có hỗ trợ điều tra hay không và đưa ra mọi ước tính hiện có về thời điểm dự kiến công bố báo cáo cuối cùng. Nếu sự cố OpenAI Hugging Face được công bố theo khuôn khổ này, sự cố đó sẽ thuộc quy trình này.

Nhân viên nêu trường hợp đó sẽ được thông báo về quyết định có công bố hay không và, nếu công bố, trường hợp sẽ được xử lý theo quy trình nào. Các bất đồng chưa được giải quyết về việc công bố hoặc quy trình phù hợp sẽ được chuyển đến Nhóm cố vấn an toàn (SAG) của OpenAI. Đây là nhóm gồm các lãnh đạo cấp cao trên toàn công ty, có nhiệm vụ đánh giá năng lực và biện pháp bảo vệ của các mô hình tiên phong, giám sát Khung chuẩn bị và tư vấn cho ban lãnh đạo OpenAI. Các bất đồng trong Nhóm cố vấn an toàn hoặc ý kiến phản đối của nhân viên đối với quyết định của nhóm sẽ được chuyển lên ban lãnh đạo OpenAI. Các quyết định không công bố hoặc xác định rằng không cần công bố sẽ được chia sẻ với lãnh đạo phụ trách an toàn và phù hợp mục tiêu, cũng như với nhân viên kỹ thuật liên quan trong phạm vi có thể.

Chúng tôi có thể điều chỉnh quy trình công bố này khi hiểu thêm về cách thức vận hành trong thực tế và sẽ ghi lại mọi thay đổi trong bài viết này.

Nội dung của mỗi báo cáo

Mỗi báo cáo đầy đủ sẽ mô tả hành vi chúng tôi quan sát được, mức độ nghiêm trọng và mọi tác động bên ngoài, hoàn cảnh xảy ra, ngày hoặc khoảng thời gian xảy ra, thời điểm chúng tôi phát hiện, cùng thông tin khái quát về một hoặc nhiều mô hình liên quan. Khi có thể, chúng tôi cũng sẽ chia sẻ:

  • Thông tin chi tiết hơn về sự việc và mọi thiệt hại phát sinh;

  • Cách chúng tôi phát hiện tình trạng sai lệch mục tiêu và phạm vi điều tra;

  • Nhận định của chúng tôi về ý nghĩa của sự việc đối với nghiên cứu phù hợp mục tiêu và an toàn kỹ thuật AI;

  • Những câu hỏi quan trọng mà trường hợp này đặt ra nhưng chưa có lời giải đáp;

  • Các biện pháp chúng tôi đang hoặc dự định thực hiện để xử lý hành vi này. Những thông tin này có thể chưa phải lúc nào cũng có sẵn tại thời điểm công bố, vì chúng tôi có thể đăng báo cáo sai lệch mục tiêu trước khi hoàn tất điều tra hoặc xây dựng biện pháp khắc phục.

Đối với tình trạng sai lệch mục tiêu xảy ra trong hệ thống triển khai của khách hàng, chúng tôi sẽ chia sẻ nhiều thông tin nhất có thể trong phạm vi quyền riêng tư của khách hàng và nghĩa vụ hợp đồng cho phép.

Các báo cáo hôm nay là loạt công bố ban đầu, không phải bản tổng hợp toàn diện về những trường hợp sai lệch mục tiêu đã biết hay các cuộc điều tra đang diễn ra. Những báo cáo ban đầu này không nhằm đại diện cho toàn bộ phạm vi hay mức độ nghiêm trọng của các trường hợp thuộc khuôn khổ này. Chúng tôi cam kết công bố các trường hợp sai lệch mục tiêu đáp ứng tiêu chí của khuôn khổ này, bao gồm cả những trường hợp phức tạp hơn cần điều tra lâu hơn hoặc phối hợp với bên thứ ba. Chúng tôi sẽ tiếp tục thường xuyên công bố báo cáo theo khuôn khổ này và chia sẻ thêm về các cam kết báo cáo khi tiếp tục hoàn thiện chúng.

Tác giả

OpenAI