Giới thiệu GPT‑6 Sol và Luna
Thêm nhiều cách đưa trí tuệ tiên phong vào công việc hằng ngày của bạn.
Đầu tháng này, chúng tôi đã giới thiệu GPT‑6 Astra, mô hình thông minh và được căn chỉnh tốt nhất thế giới. Dù những dự án quan trọng và đòi hỏi cao nhất vẫn cần đến toàn bộ chiều sâu của Astra, công việc diễn ra ở nhiều quy mô, nhịp độ và mức ngân sách khác nhau.
Vì vậy, chúng tôi đang mở rộng hệ sinh thái GPT‑6 với GPT‑6 Sol và GPT‑6 Luna. GPT‑6 Astra đã mở ra một thế hệ trí tuệ mới; các mô hình này giúp phổ biến lợi ích của trí tuệ đó bằng cách đưa hiệu quả chi phí lên tầm tiên phong. Chúng tôi huấn luyện GPT‑6 Sol và Luna bằng các phương pháp tương tự GPT‑6 Astra, đưa những tiến bộ làm nên hiệu suất hàng đầu của Astra trong công việc chuyên môn, tính chính xác thực tế, lập trình, sử dụng máy tính và căn chỉnh vào các mô hình nhanh hơn, tiết kiệm hơn.
Các mô hình GPT‑6 dẫn đầu trên toàn đường cong chi phí–trí tuệ, kết hợp năng lực vượt trội ở mọi cấp độ với hạ tầng triển khai hiệu quả ở quy mô lớn. Những cải tiến về bộ nhớ đệm và suy luận giúp chúng tôi cung cấp các mô hình này với chi phí thấp hơn; khoản tiết kiệm đó được chuyển trực tiếp đến người dùng và khách hàng thông qua việc giảm 50% giá API của Sol và Luna so với mức giá ưu đãi của GPT‑5.6. Kết hợp lại, những cải tiến này giúp AI tiên tiến trở nên thiết thực hơn cho nhiều tác vụ hằng ngày và ứng dụng ở quy mô lớn.
Mô hình | Đầu vào | Đầu ra | Mức giảm giá |
GPT‑6 Sol | $4 → $2 | $20 → $10 | Rẻ hơn 50% |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | Rẻ hơn 50% |
Giá tính trên mỗi 1 triệu token.
GPT‑6 Astra tiếp tục là mô hình toàn diện nhất của chúng tôi. Hãy chọn mô hình này khi bạn muốn kết quả tốt nhất và trải nghiệm không thỏa hiệp.
GPT‑6 Sol và Luna nâng cấp trí tuệ và hiệu quả chi phí cho những mô hình bạn đã quen dùng, đặc biệt ở các năng lực hữu ích nhất để hoàn thành công việc phức tạp.
GPT‑6 Sol có thể đảm nhận những tác vụ khó, đồng thời cho bạn nhiều dư địa lặp lại và tinh chỉnh hơn nhờ giới hạn sử dụng cao hơn cùng chi phí thấp hơn, mang lại trí tuệ vượt trội và kết quả tốt hơn các mô hình cạnh tranh có giá tương đương.
Trên AutomationBench, bài kiểm tra quy trình công việc doanh nghiệp trên nhiều ứng dụng, GPT‑6 Sol với mức nỗ lực cực cao vượt Claude Opus 5 ở mức nỗ lực Max, trong khi chi phí cho mỗi tác vụ chỉ bằng 9% của Opus 5. Ở mức nỗ lực Cao, GPT‑6 Luna cải thiện 5,4 điểm phần trăm so với phiên bản tiền nhiệm, đồng thời giảm 58% chi phí cho mỗi tác vụ.
Trong AutomationBench 1.0.6(mở trong cửa sổ mới), các tác nhân AI được kiểm tra qua những quy trình đầu cuối sử dụng 47 công cụ trong bán hàng, tiếp thị, vận hành, hỗ trợ, tài chính và nhân sự. Điểm dữ liệu của Claude Fable 5.1 thể hiện chi phí thấp hơn thực tế vì không bao gồm chi phí chuyển sang Opus 5 dự phòng, vốn xảy ra ở khoảng 40% tác vụ.
GPT‑6 Sol cũng vượt Claude Fable 5.1 với chi phí thấp hơn nhiều, thậm chí còn đánh bại GPT‑6 Astra ở mức nỗ lực thấp.
Mô hình (và mức nỗ lực) | Điểm | Chi phí mỗi tác vụ |
|---|---|---|
GPT‑6 Sol (cực cao) | 33,2% | $0.27 |
GPT‑6 Astra (thấp) | 30,3% | Gấp 3,9 lần GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | Gấp 11,1 lần GPT‑6 Sol |
Claude Fable 5.1 với Opus 5 dự phòng (Max) | 31,4% | Gấp >8,9 lần GPT‑6 Sol (không công bố chi phí dự phòng) |
Trên Agents’ Last Exam, bài đánh giá tác nhân qua các quy trình chuyên môn phức tạp, GPT‑6 Sol ở mức nỗ lực Max đạt 56,4%, cao hơn điểm số cao nhất của Claude Opus 5 trong bài đánh giá, với chi phí cho mỗi tác vụ thấp hơn 60%.
Trong Agents’ Last Exam V1(mở trong cửa sổ mới), các tác nhân AI được đánh giá qua những tác vụ kéo dài qua nhiều bước, có giá trị kinh tế, thuộc 55 phân ngành và bao quát hầu hết các lĩnh vực chuyên môn chính được thực hiện trên máy tính.
Tính hữu ích của câu trả lời phụ thuộc vào độ chính xác của dữ kiện, và chúng tôi đang tiếp tục nâng cao độ tin cậy của dữ kiện. Trong bài đánh giá nội bộ về tính chính xác thực tế, dựa trên các cuộc trò chuyện thực tế đã được khử định danh mà người dùng đánh dấu lỗi của mô hình, GPT‑6 Sol mắc lỗi ít hơn khoảng một nửa so với phiên bản tiền nhiệm, tiến gần độ tin cậy của Astra với chi phí thấp hơn nhiều. GPT‑6 Luna cũng cải thiện đáng kể; ở mức nỗ lực cao hơn, mô hình đạt ngang GPT‑5.6 Sol với chi phí chỉ khoảng một phần trăm.
Tại đây, chúng tôi đánh giá tính chính xác thực tế qua các cuộc trò chuyện ChatGPT đã được khử định danh, trong đó người dùng đánh dấu lỗi dữ kiện của một mô hình trước đó. Những cuộc trò chuyện dễ gây lỗi này không đại diện cho cách sử dụng thông thường, nơi lỗi dữ kiện hiếm gặp hơn. Điểm số chưa được kiểm soát theo độ dài; tuy nhiên, các thử nghiệm với nhiều mức độ chi tiết cho thấy kết quả gần như không phụ thuộc vào độ dài câu trả lời.
Năm nay, các tác nhân lập trình đã bắt đầu xử lý những tác vụ có độ phức tạp, phạm vi và thời lượng lớn hơn bao giờ hết. Tại OpenAI, mức sử dụng nội bộ của chúng tôi đã tăng theo cấp số nhân. Nếu quy đổi theo giá API, mức sử dụng token hằng ngày đã vượt $600 đối với nhà nghiên cứu ở trung vị và $7.000 đối với nhà nghiên cứu ở phân vị thứ 90 (Đẩy nhanh nghiên cứu: Góc nhìn từ bên trong OpenAI). Khi các tác nhân lập trình đảm nhận những tác vụ dài hơn và đòi hỏi cao hơn, chi phí sử dụng liên tục càng trở nên quan trọng. GPT‑6 Sol và Luna kết hợp hiệu suất lập trình mạnh mẽ với giá API thấp hơn, giúp nhà phát triển có thêm dư địa lặp lại, tinh chỉnh và giúp các nhóm tự tin giao cho Codex những nhiệm vụ tham vọng hơn.
Trên FrontierCode, bài đánh giá liệu tác nhân lập trình có tạo ra thay đổi sẵn sàng hợp nhất vào cơ sở mã thực tế hay không, GPT‑6 Sol cải thiện đáng kể so với GPT‑5.6 Sol và đạt ngang Claude Fable 5.1 ở mức cực cao với chi phí thấp hơn nhiều.
Trong FrontierCode 1.1 Main(mở trong cửa sổ mới), các tác nhân AI viết mã được chấm không chỉ về độ chính xác mà còn về “khả năng hợp nhất”, chẳng hạn như chất lượng kiểm thử, tuân thủ phạm vi, phong cách mã và việc tuân theo các tiêu chuẩn của cơ sở mã.
Trên DeepSWE v1.1, bài kiểm tra hiệu suất ở các tác vụ kỹ thuật phần mềm phức tạp trong cơ sở mã thực tế, GPT‑6 Sol ở mức nỗ lực Max đạt 68,8%, chỉ kém 1,1 điểm phần trăm so với điểm cao nhất của Claude Fable 5 trong bài đánh giá (69,9% ở mức nỗ lực cực cao) với chi phí cho mỗi tác vụ thấp hơn khoảng 80%.
GPT‑6 Luna ở mức nỗ lực Max đạt 66,6%, tương đương Claude Opus 5 và Fable 5 ở mức nỗ lực Vừa. Trong các phép so sánh này, chi phí mỗi tác vụ của Luna thấp hơn Opus 5 là 93% và thấp hơn Fable 5 là 96%.
Trong DeepSWE 1.1(mở trong cửa sổ mới), các tác nhân AI giải quyết những tác vụ kỹ thuật phần mềm nguyên bản, kéo dài qua nhiều bước.
Dù GPT‑6 Astra vẫn là mô hình sử dụng máy tính tốt nhất thế giới, GPT‑6 Sol và Luna mang lại hiệu suất tiết kiệm chi phí hơn các phiên bản tiền nhiệm. Trên OSWorld 2.0 ngoại tuyến, GPT‑6 Sol ở mức nỗ lực cực cao đạt điểm tương đương Claude Opus 5 ở mức nỗ lực Vừa (60,5% so với 60,3%) với chi phí cho mỗi tác vụ thấp hơn khoảng 80%. GPT‑6 Luna (Max) vượt GPT‑5.6 Sol (Vừa) với chi phí chỉ bằng một phần mười.
Trong OSWorld 2.0(mở trong cửa sổ mới), các tác nhân AI thực hiện những quy trình sử dụng máy tính kéo dài qua nhiều bước, bao gồm cả tác vụ hằng ngày và chuyên môn. Chúng tôi báo cáo điểm thưởng một phần trên tập ngoại tuyến của bản phát hành v2026.08.08.
Chúng tôi cũng đưa phong cách giao tiếp cải tiến của GPT‑6 Astra vào Sol và Luna; theo chúng tôi, thay đổi này sẽ đặc biệt dễ nhận thấy trong các cuộc trò chuyện kỹ thuật và lập trình. Bạn sẽ thấy cách diễn đạt rõ ràng hơn, ít biệt ngữ và lối nói kỳ lạ hơn, bớt chi tiết ít giá trị hơn, cùng câu trả lời nhìn chung ngắn hơn đôi chút mà vẫn giữ nguyên nội dung cốt lõi.
Dù phong cách mang tính chủ quan, chúng tôi thích câu trả lời của GPT‑6 Sol hơn trong trường hợp này. Mô hình không vội kết luận, dành ít thời gian hơn để nhắc lại những chi tiết có thể đã rõ với người hỏi (chẳng hạn trang web có bốn trang), dùng ít cách diễn đạt mơ hồ hơn (chẳng hạn “cảm giác bento”, “định hình lại… xoay quanh hệ thống đó”), thẳng thắn hơn về những gì đã và chưa kiểm tra, đồng thời không chia sẻ các chi tiết triển khai không cần thiết như câu lệnh dành cho công cụ hình ảnh.
Bên cạnh việc giảm giá token, chúng tôi còn giúp các nhà phát triển xây dựng trên GPT‑6 tiết kiệm hơn đối với ngữ cảnh mà ứng dụng của họ tái sử dụng. Chúng tôi đã cải thiện khả năng lưu trữ nội dung câu lệnh cho GPT‑6 để mặc định đạt tỷ lệ trúng bộ nhớ đệm cao hơn, giúp các tác nhân tái sử dụng nhiều ngữ cảnh hơn, phản hồi nhanh hơn và được giảm 90% chi phí đọc token đầu vào đã lưu trong bộ nhớ đệm.
Nhà phát triển cũng có thêm nhiều cách để đo lường và tối ưu hóa hiệu suất bộ nhớ đệm:
Theo dõi và chẩn đoán. Bảng điều khiển lưu trữ nội dung câu lệnh(mở trong cửa sổ mới) cho biết lượng đầu vào được lưu trong bộ nhớ đệm và sự thay đổi theo thời gian. Công cụ chẩn đoán(mở trong cửa sổ mới) giúp giải thích những cơ hội lưu vào bộ nhớ đệm bị bỏ lỡ và cách khắc phục.
Điều chỉnh mức nỗ lực suy luận và khả năng sử dụng công cụ mà không làm mất hiệu lực bộ nhớ đệm. Tăng mức nỗ lực suy luận(mở trong cửa sổ mới) cho tác vụ khó hơn hoặc giảm mức này cho các câu hỏi tiếp nối đơn giản hơn, đồng thời bật hoặc tắt công cụ(mở trong cửa sổ mới) khi nhu cầu của tác nhân thay đổi. Cả hai chế độ điều khiển giờ đây đều giữ lại ngữ cảnh trước đó để tái sử dụng bộ nhớ đệm.
Tối ưu hóa các tiền tố được lưu vào bộ nhớ đệm. Các điểm ngắt tường minh cho phép nhà phát triển chọn vị trí kết thúc của tiền tố câu lệnh được lưu trong bộ nhớ đệm. Nhờ đó, nhà phát triển có nhiều quyền kiểm soát hơn đối với việc tái sử dụng bộ nhớ đệm và có thể cải thiện hiệu suất.
GitHub cho biết trong vài tháng qua, các cải tiến này đã giảm hơn 50% tỷ lệ token câu lệnh cần xử lý mới trên hàng tỷ yêu cầu gửi đến các mô hình OpenAI, giúp Copilot phản hồi nhanh hơn.
GPT‑6 Sol và Luna tiếp nối công trình căn chỉnh được giới thiệu cùng Astra, mô hình được căn chỉnh tốt nhất của chúng tôi cho đến nay. Trong các bài đánh giá căn chỉnh, cả Sol và Luna đều cải thiện so với các phiên bản GPT‑5.6 tương ứng, trong đó có tỷ lệ đưa ra tuyên bố gây hiểu lầm về công việc lập trình thấp hơn.
Các bài đánh giá dưới đây cố ý kiểm tra những tình huống khó và không đo lường tỷ lệ lỗi trong cách sử dụng thông thường. Xem thẻ hệ thống(mở trong cửa sổ mới) để biết đầy đủ kết quả.
Từ hôm nay, GPT‑6 Sol và GPT‑6 Luna được cung cấp trong ChatGPT Công việc và Codex cho tất cả người dùng Plus, Pro, Business, Enterprise và Edu. Người dùng gói Free và Go có thể truy cập GPT‑6 Luna trong ứng dụng máy tính. Các mô hình này chưa được cung cấp trong Trò chuyện. Trong API OpenAI, các mô hình này có tên gpt-6-sol và gpt-6-luna.
Để duy trì dịch vụ ổn định cho mọi người, chúng tôi dự kiến triển khai dần các mô hình này trong ChatGPT suốt cả ngày. Nếu chưa thấy các mô hình mới trong ChatGPT Công việc hoặc Codex, vui lòng thử lại sau.
Các đánh giá GPT được thực hiện trong môi trường nghiên cứu của chúng tôi hoặc qua API, nên đầu ra có thể hơi khác ChatGPT phiên bản chính thức do khác biệt về câu lệnh hệ thống, công cụ có sẵn và các yếu tố khác. Kết quả đánh giá mô hình cạnh tranh được lấy từ các báo cáo công khai. Điểm của Claude Fable 5 được sử dụng khi không có điểm của Claude Fable 5.1.


