OpenAI đang tăng cường giám sát, căn chỉnh và bảo mật cho các mô hình AI tiên phong. Tìm hiểu cách các biện pháp bảo vệ mới định hướng tốc độ phát triển mô hình.
OpenAI công bố kết quả mới cho các bài toán mở lâu năm trong toán học và khoa học máy tính lý thuyết, gồm tiến bộ về hình học, mật mã và độ phức tạp.
Hai chế độ cài đặt API giúp GPT-5.6 cải thiện điểm số và hiệu suất trên ARC-AGI-3 nhờ duy trì suy luận và bật Nén ngữ cảnh.
Báo cáo mới cho thấy các nhà khoa học dùng tác nhân lập trình AI để hiện đại hóa điện toán khoa học, tăng tốc phát triển phần mềm và khám phá trong hệ gen học và hơn thế nữa.
Khám phá GPT-Red, hệ thống kiểm thử đội đỏ tự động của OpenAI dùng tự chơi để cải thiện an toàn AI, căn chỉnh và độ vững chắc trước chèn câu lệnh.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Phân tích mới từ OpenAI nêu ra lỗ hổng của bộ tiêu chuẩn đánh giá lập trình phổ biến SWE-Bench Pro, làm dấy lên lo ngại về độ tin cậy và độ chính xác khi kiểm thử mô hình AI.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
Giới thiệu GeneBench-Pro, một chuẩn đánh giá mới để kiểm tra hiệu suất AI trong hệ gen học, sinh học và nghiên cứu khoa học sử dụng các bộ dữ liệu phức tạp từ thế giới thực.