Chúng tôi bắt đầu thử nghiệm giới hạn dòng GPT‑5.6: Sol, là mô hình chủ lực của chúng tôi; Terra, một mô hình cân bằng cho công việc hằng ngày; và Luna, một mô hình nhanh với chi phí hợp lý. Terra có hiệu năng cạnh tranh với GPT‑5.5 trong khi rẻ hơn 2 lần, còn Luna mang lại năng lực mạnh mẽ ở mức chi phí thấp nhất của chúng tôi.
GPT‑5.6 Sol ra mắt cùng bộ biện pháp an toàn vững chắc nhất của chúng tôi cho đến nay. Chúng tôi đã tăng cường bảo vệ cho hoạt động có rủi ro cao hơn, các yêu cầu an ninh mạng nhạy cảm và hành vi lạm dụng lặp lại, đồng thời dành nhiều tuần để tìm điểm yếu, kiểm thử áp lực hệ thống và gia cố hệ thống trước các cuộc tấn công trong thực tế.
Chúng tôi tin vào quyền tiếp cận rộng rãi và dự định đưa GPT‑5.6 Sol, Terra và Luna vào sử dụng rộng rãi trong những tuần tới. Trong nỗ lực không ngừng trao đổi thông tin với chính phủ Hoa Kỳ, chúng tôi đã giới thiệu trước kế hoạch và năng lực của các mô hình trước khi ra mắt hôm nay. Theo yêu cầu của họ, chúng tôi bắt đầu bằng bản xem trước giới hạn cho một nhóm nhỏ đối tác đáng tin cậy, những người tham gia đã được chia sẻ với chính phủ, trước khi phát hành rộng rãi hơn. Trong giai đoạn thử nghiệm này, chúng tôi sẽ tiếp tục kiểm thử và phối hợp chặt chẽ với các đối tác trong khi hướng tới việc cung cấp rộng rãi hơn. Chúng tôi không cho rằng kiểu quy trình tiếp cận của chính phủ này nên trở thành mặc định lâu dài. Nó khiến các công cụ tốt nhất không đến được với người dùng, nhà phát triển, doanh nghiệp, lực lượng phòng thủ an ninh mạng và các đối tác toàn cầu đang cần chúng. Chúng tôi thực hiện bước ngắn hạn này vì tin rằng đây là con đường tốt nhất để đạt được khả năng cung cấp rộng rãi hơn trong những tuần tới, trong khi vẫn hợp tác với Chính quyền để xây dựng khuôn khổ Sắc lệnh hành pháp về an ninh mạng và một quy trình có thể lặp lại cho các lần phát hành mô hình trong tương lai.
GPT‑5.6 Sol là mô hình mạnh nhất của chúng tôi cho đến nay. Để cho thấy hiệu năng mô hình, chúng tôi chia sẻ một tập hợp đánh giá nêu bật các năng lực tác nhân được cải thiện trong lập trình, sinh học và an ninh mạng, cùng các đánh giá bổ sung về an toàn và mức độ sẵn sàng trong thẻ hệ thống(mở trong cửa sổ mới) của chúng tôi. Chúng tôi sẽ chia sẻ bộ kết quả đánh giá mở rộng khi đưa mô hình vào sử dụng rộng rãi.
Với GPT‑5.6, chúng tôi giới thiệu mức nỗ lực suy luận `xuất chúng (max)` mới để Sol có nhiều thời gian nhất cho suy luận sâu. Ngoài ra, chúng tôi giới thiệu chế độ `ưu việt (ultra)` mới, vượt ra ngoài năng lực của một tác nhân đơn lẻ bằng cách tận dụng các tác nhân phụ để tăng tốc công việc phức tạp.
Đối với quy trình lập trình, GPT‑5.6 Sol thiết lập mức tiên tiến mới trên Terminal‑Bench 2.1, bài kiểm tra các quy trình dòng lệnh đòi hỏi lập kế hoạch, lặp lại và phối hợp công cụ.
GPT‑5.6 Sol cũng cho thấy những cải thiện rộng rãi trong các quy trình sinh học. Trên GeneBench v1, bài đánh giá các phân tích hệ gen dài hạn và sinh học định lượng, mô hình đạt kết quả mạnh hơn GPT‑5.5 trong khi dùng ít token hơn.
GPT‑5.6 Sol là mô hình có năng lực nhất của chúng tôi cho an ninh mạng tính đến nay. Mô hình này dịch chuyển đường biên hiệu năng-hiệu quả cho các nhiệm vụ bảo mật dài hạn, bao gồm nghiên cứu và khai thác lỗ hổn. Trên ExploitBench², GPT‑5.6 Sol cạnh tranh được với Mythos Preview trong khi chỉ dùng khoảng 1/3 số token đầu ra. Trên ExploitGym(mở trong cửa sổ mới)3, một bộ đo chuẩn do các nhà nghiên cứu UC Berkeley tạo ra với sự hợp tác của OpenAI và các phòng thí nghiệm tiên phong khác, các mô hình GPT‑5.6 Sol, Terra và Luna đều cho thấy những cải thiện mạnh về năng lực an ninh mạng khi chúng tôi tăng mức suy luận.
Chúng tôi phát triển GPT‑5.6 Sol, Terra và Luna với các biện pháp bảo vệ vững chắc nhất cho đến nay, với cấu hình phù hợp với năng lực của từng mô hình. Khi mô hình trở nên có năng lực hơn, chúng tôi thiết kế các biện pháp bảo vệ để ngày càng chịu được áp lực đối kháng trong thực tế, đồng thời duy trì quyền tiếp cận cho công việc hợp pháp như rà soát mã, nghiên cứu lỗ hổng, phát triển bản vá, gỡ lỗi, giáo dục bảo mật và kiểm thử phòng thủ. Mục tiêu của chúng tôi là khiến hoạt động tấn công bị cấm trở nên khó hơn, bất định hơn và dễ bị phát hiện hơn mà không hạn chế không cần thiết những mục đích sử dụng có lợi đó. Dựa trên đánh giá của chúng tôi về mô hình và các biện pháp bảo vệ, chúng tôi kỳ vọng mang lại lợi ích đáng kể cho công việc phòng thủ hợp pháp, đồng thời hạn chế rõ rệt việc sử dụng tấn công bị cấm.
GPT‑5.6 Sol hỗ trợ con người tìm và khắc phục lỗ hổng tốt hơn so với việc thực hiện đáng tin cậy các cuộc tấn công từ đầu đến cuối. Khi các năng lực này tiếp tục phát triển, ưu tiên của chúng tôi là bảo đảm chúng đến được với và mang lại lợi ích cho những người phòng thủ, những người có thể dùng các công cụ này để tìm điểm yếu, phát triển bản vá và củng cố hệ thống trên diện rộng hơn.
GPT‑5.6 Sol không vượt qua ngưỡng Rủi ro An ninh mạng Trọng yếu (Cyber Critical) theo Khung chuẩn bị ứng phó của chúng tôi. Trong các đánh giá liên quan đến Chromium và Firefox, mô hình đã xác định các lỗi và các hàm nguyên thủy khai thác (exploitation primitives)—nvốn là các thành phần cấu tạo nên một mã khai thác lỗ hổng (exploit)—nhưng không tự chủ tạo ra được một chuỗi khai thác hoàn chỉnh hoạt động được trong các điều kiện thử nghiệm. Tuy vậy, các ngưỡng đo chuẩn không thể bao quát mọi cách một mô hình có thể được sử dụng hoặc kết hợp với các công cụ khác. Sự bất định đó, cùng với bước nhảy vọt toàn diện về mặt năng lực của mô hình, là lý do chúng tôi kết hợp năng lực tăng lên của mô hình với các biện pháp bảo vệ mạnh hơn và phát hành theo từng giai đoạn. Chúng tôi có chia sẻ thêm chi tiết về các biện pháp bảo vệ trong thẻ hệ thống Thử nghiệm GPT‑5.6(mở trong cửa sổ mới).
Không biện pháp bảo vệ đơn lẻ nào là đủ trước hành vi lạm dụng quyết tâm hoặc biết thích ứng. Trong suốt bản xem trước GPT‑5.6, chúng tôi sử dụng các biện pháp bảo vệ đa tầng, với cấu hình chính xác khác nhau giữa các mô hình, và kiểm thử áp lực chúng trước các cuộc tấn công trong thực tế. Các tầng này bao gồm biện pháp bảo vệ được huấn luyện vào mô hình, kiểm tra thời gian thực trong quá trình sinh, tín hiệu cấp tài khoản, quyền truy cập phân biệt, giám sát, thực thi và kiểm thử liên tục.
GPT‑5.6 được huấn luyện để từ chối hỗ trợ an ninh mạng bị cấm, kể cả khi người dùng cố che giấu ý định hoặc việc bẻ khoá mô hình. Các biện pháp bảo vệ ở cấp mô hình này thiết lập ranh giới đầu tiên cho những việc mô hình nên và không nên hỗ trợ.
"Các bộ phân loại hành vi lạm dụng sinh học và an ninh mạng theo thời gian thực sẽ cung cấp thêm một lớp bảo vệ khác bằng cách đánh giá dữ liệu đầu ra ngay khi nó đang được khởi tạo. Với các trường hợp rủi ro cao hơn, nếu chúng phát hiện khả năng vi phạm, quá trình khởi tạo có thể tạm dừng để một mô hình lập luận lớn hơn xem xét cuộc trò chuyện và bối cảnh của nó. Nếu đầu ra được đánh giá là không được phép, dữ liệu sẽ bị giữ lại trước khi đến tay người dùng.
Hoạt động bị gắn cờ cũng có thể kích hoạt rà soát cấp tài khoản trên các cuộc trò chuyện và tín hiệu rủi ro liên quan, phù hợp với các điều khoản và chính sách của chúng tôi về lưu giữ và rà soát nội dung. Việc nhìn rộng hơn một cuộc trò chuyện đơn lẻ giúp hệ thống của chúng tôi phân biệt hành vi độc hại dai dẳng với công việc bảo mật lưỡng dụng hợp pháp, nơi các khái niệm kỹ thuật tương tự có thể được diễn giải theo nhiều ngữ cảnh rất khác nhau.
Khi kết hợp lại, các hệ thống này khiến cách tiếp cận tổng thể vững chắc hơn bất kỳ biện pháp bảo vệ riêng lẻ nào. Hành vi của mô hình làm giảm khả năng đưa ra phản hồi độc hại, triển khai các hệ thống thời gian thực để can thiệp ngay trong quá trình khởi tạo văn bản, tiến hành rà soát ở cấp độ tài khoản để nhận diện các mô hình hành vi trên diện rộng, và áp dụng cơ chế phân cấp quyền truy cập nhằm bảo vệ các công tác phòng ngự quan trọng mà không cần phải mở rộng mặc định các tính năng nhạy cảm nhất tới toàn bộ người dùng.
Đặc biệt trong giai đoạn thử nghiệm, người dùng có thể gặp các biện pháp bảo vệ chặn hoặc từ chối một số yêu cầu. Một số yêu cầu khác có thể mất nhiều thời gian hơn vì quá trình sinh bị tạm dừng để rà soát bổ sung. Các biện pháp bảo vệ đôi khi có thể can thiệp vào công việc hợp pháp, đặc biệt trong các lĩnh vực lưỡng dụng nơi hoạt động phòng thủ và tấn công ban đầu có thể trông giống nhau.
Đó chính là một phần mục tiêu mà thử nghiệm này được thiết kế để đánh giá. Chúng tôi muốn hiểu không chỉ liệu các biện pháp bảo vệ có hạn chế lạm dụng hay không, mà còn liệu người dùng hợp pháp vẫn có thể hoàn thành công việc bình thường một cách đáng tin cậy và hiệu quả hay không. Phản hồi trong giai đoạn xem trước sẽ giúp chúng tôi giảm các trường hợp chặn và trì hoãn không cần thiết, cải thiện cách các biện pháp bảo vệ diễn giải bối cảnh và tạo trải nghiệm mượt mà hơn trước khi phát hành rộng rãi.
Chúng tôi cũng đang làm việc với khách hàng doanh nghiệp về các cách tiếp cận dài hạn hơn—bao gồm phát hiện bảo vệ quyền riêng tư, kiểm soát an toàn do khách hàng vận hành và quyền truy cập được hiệu chỉnh theo rủi ro của khách hàng, người dùng hoặc khối lượng công việc—để thúc đẩy an toàn đồng thời hỗ trợ yêu cầu về quyền riêng tư của doanh nghiệp.
Các biện pháp bảo vệ cũng cần duy trì hiệu quả khi kẻ tấn công thay đổi chiến thuật. Một cơ chế bảo vệ chỉ hiệu quả với một tập hợp cố định các cuộc tấn công đã biết là chưa đủ vững chắc cho một mô hình tiên phong.
Vì vậy, chúng tôi đang đầu tư nhiều trí tuệ và năng lực tính toán hơn bao giờ hết cho an toàn, dùng chính các mô hình của mình để tìm điểm yếu và cải thiện biện pháp bảo vệ nhanh hơn. Chúng tôi đã dành hơn 700.000 giờ GPU tương đương A100 cho kiểm thử red team tự động các phương thức bẻ khóa phổ biến (universal jailbreak): những cuộc tấn công có thể hiệu quả trên nhiều câu lệnh hoặc bối cảnh, chứ không chỉ trong một phạm vi hẹp. Việc tập trung vào những cuộc tấn công khó hơn và tổng quát hơn này giúp chúng tôi kiểm tra các biện pháp bảo vệ vượt ra ngoài một tập hợp cố định các lỗi đã biết. Cách làm này cũng cho phép chúng tôi khám phá nhiều hình thức tấn công hơn rất nhiều so với chỉ kiểm thử thủ công, nhận diện các mẫu lỗi sớm hơn và rút ngắn thời gian từ khi phát hiện lỗ hổng đến khi khắc phục.
Bên cạnh kiểm thử red team tự động, chúng tôi đã làm việc với các bên kiểm thử thứ ba để tiến hành kiểm thử đội đỏ quy mô lớn do chuyên gia con người thực hiện, và hoạt động này sẽ tiếp tục trong giai đoạn xem trước. Kiểm thử đội đỏ do con người thực hiện bổ sung cho công việc tự động bằng cách kiểm tra các biện pháp bảo vệ trước những chuyên gia sáng tạo đang cố lạm dụng mô hình theo các cách mà hệ thống của chúng tôi có thể chưa lường trước.
Không đánh giá nào có thể đại diện cho mọi cấu hình sản phẩm, cuộc tấn công nhiều bước hoặc quy trình làm việc trong thực tế. Do đó, chúng tôi duy trì một quy trình phản ứng nhanh để tái tạo, đánh giá, ưu tiên và khắc phục các phương thức bẻ khoá mới được phát hiện, rồi bổ sung chúng vào các đánh giá liên tục để có thể kiểm tra những lỗi tương tự trong tương lai.
Trong giai đoạn xem trước, các mô hình GPT‑5.6 ban đầu sẽ được cung cấp qua API và Codex cho một nhóm đối tác và tổ chức đáng tin cậy được chọn lọc. Chúng tôi dự định sớm cung cấp rộng rãi hơn cho những người dùng ChatGPT, Codex và API.
Trong hệ thống đặt tên mới được giới thiệu cùng GPT‑5.6, con số là thế hệ của mô hình, còn Sol, Terra và Luna xác định các tầng năng lực bền vững có thể phát triển theo nhịp riêng. Kết hợp lại, họ mô hình này mang đến cho người dùng và nhà phát triển những lựa chọn rõ ràng hơn về trí tuệ, tốc độ và chi phí.
GPT‑5.6 được định giá theo mỗi 1 triệu token trên ba kích cỡ mô hình: Sol là $5 đầu vào / $30 đầu ra; Terra là $2,50 đầu vào / $15 đầu ra; và Luna là $1 đầu vào / $6 đầu ra. GPT‑5.6 cũng giới thiệu cơ chế lưu bộ nhớ đệm câu lệnh dễ dự đoán hơn, bao gồm hỗ trợ các điểm ngắt bộ nhớ đệm rõ ràng và thời gian tồn tại tối thiểu 30 phút của bộ nhớ đệm. Đối với GPT‑5.6 và các mô hình đời sau, các tác vụ ghi bộ nhớ đệm sẽ được tính phí bằng 1,25 lần giá dữ liệu đầu vào không ghi nhớ đệm của mô hình đó, trong khi các tác vụ đọc bộ nhớ đệm sẽ tiếp tục được hưởng mức chiết khấu 90% dành cho dữ liệu đầu vào đã lưu vào bộ nhớ đệm.
Chúng tôi cũng sẽ ra mắt GPT‑5.6 Sol trên Cerebras với tốc độ lên tới 750 token mỗi giây vào tháng 7, đưa trí tuệ tiên phong đến với khách hàng ở tốc độ chưa từng có. Quyền truy cập ban đầu sẽ được giới hạn cho một số khách hàng chọn lọc trong bối cảnh chúng tôi đang mở rộng năng lực hệ thống.
Chúng tôi rất hào hứng tiếp tục học hỏi từ giai đoạn thử nghiệm này và sớm đưa GPT‑5.6 Sol, Terra và Luna đến với nhiều người hơn.
1. Chúng tôi ước tính độ trễ và chi phí API bằng cách xem xét hành vi vận hành thực tế của các mô hình, rồi mô phỏng ngoại tuyến. Các ước tính này tính đến chi tiết lệnh gọi công cụ, token được lấy mẫu và token đầu vào. Kết quả thực tế có thể khác biệt đáng kể và phụ thuộc vào nhiều yếu tố không được ghi nhận trong mô phỏng của chúng tôi. Chúng tôi giả lập độ trễ ở tốc độ API nhanh và chi phí theo giá API thông thường.
2. Tất cả các mô hình được đánh giá bằng bộ khung API ExploitBench với 5 seed và tính liên tục suy luận.
3. Chúng tôi chạy ExploitGym trên API alpha của mình, vốn xuất phản hồi nhanh hơn API công khai, rồi co giãn lại để khớp với API công khai. Khi co giãn độ trễ theo tốc độ dự kiến của API công khai, một số độ trễ ước tính vượt quá giới hạn thời gian 2 giờ và 6 giờ, dù trong lần chạy đánh giá các giới hạn này đã được tuân thủ đúng. Để có tốc độ nhanh hơn cho công việc nhạy cảm về thời gian, chúng tôi cung cấp xử lý ưu tiên trong API và chế độ nhanh trong Codex.
4. Các mô hình không có báo cáo về token đầu ra, độ trễ hoặc chi phí được biểu diễn bằng các đường chấm ngang.

