Khám phá GPT-Red, hệ thống kiểm thử đội đỏ tự động của OpenAI dùng tự chơi để cải thiện an toàn AI, căn chỉnh và độ vững chắc trước chèn câu lệnh.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch—our most robust yet—are built to deliver these models safely and at scale, around the world.
Phân tích mới từ OpenAI nêu ra lỗ hổng của bộ tiêu chuẩn đánh giá lập trình phổ biến SWE-Bench Pro, làm dấy lên lo ngại về độ tin cậy và độ chính xác khi kiểm thử mô hình AI.
GPT-Live-1 and GPT-Live-1 mini are a new generation of voice models designed to make conversations with AI feel more natural and intelligent.
Giới thiệu GeneBench-Pro, một chuẩn đánh giá mới để kiểm tra hiệu suất AI trong hệ gen học, sinh học và nghiên cứu khoa học sử dụng các bộ dữ liệu phức tạp từ thế giới thực.
GPT-5.6 is a new family of three models: Sol, our new flagship model; Terra, a capable lower-cost option; and Luna, our fastest and most cost-efficient model. The safeguards we have built for this launch – our most robust yet – are built to deliver these models safely and at scale, around the world.
OpenAI và Molecule.one cho thấy cách thức nhà hóa học AI gần như tự chủ sử dụng GPT-5.4 đã cải thiện một phản ứng điều chế thuốc then chốt, góp phần thúc đẩy nghiên cứu hóa dược.
Giới thiệu LifeSciBench, bộ đo chuẩn do chuyên gia viết và đánh giá, dùng để đo cách hệ thống AI xử lý nhiệm vụ và quyết định nghiên cứu khoa học sự sống thực tế.