Bỏ qua nội dung chính
OpenAI

Giới thiệu GPT‑6 Sol và Luna

Thêm nhiều cách đưa trí tuệ tiên phong vào công việc hằng ngày của bạn.

Đang tải…

Đầu tháng này, chúng tôi đã giới thiệu GPT‑6 Astra, mô hình thông minh và được căn chỉnh tốt nhất thế giới. Dù những dự án quan trọng và đòi hỏi cao nhất vẫn cần đến toàn bộ chiều sâu của Astra, công việc diễn ra ở nhiều quy mô, nhịp độ và mức ngân sách khác nhau.

Vì vậy, chúng tôi đang mở rộng hệ sinh thái GPT‑6 với GPT‑6 Sol và GPT‑6 Luna. GPT‑6 Astra đã mở ra một thế hệ trí tuệ mới; các mô hình này giúp phổ biến lợi ích của trí tuệ đó bằng cách đưa hiệu quả chi phí lên tầm tiên phong. Chúng tôi huấn luyện GPT‑6 Sol và Luna bằng các phương pháp tương tự GPT‑6 Astra, đưa những tiến bộ làm nên hiệu suất hàng đầu của Astra trong công việc chuyên môn, tính chính xác thực tế, lập trình, sử dụng máy tính và căn chỉnh vào các mô hình nhanh hơn, tiết kiệm hơn.

Các mô hình GPT‑6 dẫn đầu trên toàn đường cong chi phí–trí tuệ, kết hợp năng lực vượt trội ở mọi cấp độ với hạ tầng triển khai hiệu quả ở quy mô lớn. Những cải tiến về bộ nhớ đệm và suy luận giúp chúng tôi cung cấp các mô hình này với chi phí thấp hơn; khoản tiết kiệm đó được chuyển trực tiếp đến người dùng và khách hàng thông qua việc giảm 50% giá API của Sol và Luna so với mức giá ưu đãi của GPT‑5.6. Kết hợp lại, những cải tiến này giúp AI tiên tiến trở nên thiết thực hơn cho nhiều tác vụ hằng ngày và ứng dụng ở quy mô lớn.

Giá API GPT‑6

Mô hình

Đầu vào

Đầu ra

Mức giảm giá

GPT‑6 Sol
so với GPT‑5.6 Sol

$4 → $2

$20 → $10

Rẻ hơn 50%

GPT‑6 Luna
so với GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

Rẻ hơn 50%

Giá tính trên mỗi 1 triệu token.

GPT‑6 Astra tiếp tục là mô hình toàn diện nhất của chúng tôi. Hãy chọn mô hình này khi bạn muốn kết quả tốt nhất và trải nghiệm không thỏa hiệp.

Bước tiến trên toàn bộ dòng mô hình

GPT‑6 Sol và Luna nâng cấp trí tuệ và hiệu quả chi phí cho những mô hình bạn đã quen dùng, đặc biệt ở các năng lực hữu ích nhất để hoàn thành công việc phức tạp.

Công việc chuyên môn

GPT‑6 Sol có thể đảm nhận những tác vụ khó, đồng thời cho bạn nhiều dư địa lặp lại và tinh chỉnh hơn nhờ giới hạn sử dụng cao hơn cùng chi phí thấp hơn, mang lại trí tuệ vượt trội và kết quả tốt hơn các mô hình cạnh tranh có giá tương đương.

Trên AutomationBench, bài kiểm tra quy trình công việc doanh nghiệp trên nhiều ứng dụng, GPT‑6 Sol với mức nỗ lực cực cao vượt Claude Opus 5 ở mức nỗ lực Max, trong khi chi phí cho mỗi tác vụ chỉ bằng 9% của Opus 5. Ở mức nỗ lực Cao, GPT‑6 Luna cải thiện 5,4 điểm phần trăm so với phiên bản tiền nhiệm, đồng thời giảm 58% chi phí cho mỗi tác vụ.

Trong AutomationBench 1.0.6⁠(mở trong cửa sổ mới), các tác nhân AI được kiểm tra qua những quy trình đầu cuối sử dụng 47 công cụ trong bán hàng, tiếp thị, vận hành, hỗ trợ, tài chính và nhân sự. Điểm dữ liệu của Claude Fable 5.1 thể hiện chi phí thấp hơn thực tế vì không bao gồm chi phí chuyển sang Opus 5 dự phòng, vốn xảy ra ở khoảng 40% tác vụ.

GPT‑6 Sol cũng vượt Claude Fable 5.1 với chi phí thấp hơn nhiều, thậm chí còn đánh bại GPT‑6 Astra ở mức nỗ lực thấp.

Mô hình (và mức nỗ lực)

Điểm

Chi phí mỗi tác vụ

GPT‑6 Sol (cực cao)

33,2%

$0.27

GPT‑6 Astra (thấp)

30,3%

Gấp 3,9 lần GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

Gấp 11,1 lần GPT‑6 Sol

Claude Fable 5.1 với Opus 5 dự phòng (Max)

31,4%

Gấp >8,9 lần GPT‑6 Sol

(không công bố chi phí dự phòng)

Trên Agents’ Last Exam, bài đánh giá tác nhân qua các quy trình chuyên môn phức tạp, GPT‑6 Sol ở mức nỗ lực Max đạt 56,4%, cao hơn điểm số cao nhất của Claude Opus 5 trong bài đánh giá, với chi phí cho mỗi tác vụ thấp hơn 60%.

Trong Agents’ Last Exam V1⁠(mở trong cửa sổ mới), các tác nhân AI được đánh giá qua những tác vụ kéo dài qua nhiều bước, có giá trị kinh tế, thuộc 55 phân ngành và bao quát hầu hết các lĩnh vực chuyên môn chính được thực hiện trên máy tính.

Tính chính xác thực tế

Tính hữu ích của câu trả lời phụ thuộc vào độ chính xác của dữ kiện, và chúng tôi đang tiếp tục nâng cao độ tin cậy của dữ kiện. Trong bài đánh giá nội bộ về tính chính xác thực tế, dựa trên các cuộc trò chuyện thực tế đã được khử định danh mà người dùng đánh dấu lỗi của mô hình, GPT‑6 Sol mắc lỗi ít hơn khoảng một nửa so với phiên bản tiền nhiệm, tiến gần độ tin cậy của Astra với chi phí thấp hơn nhiều. GPT‑6 Luna cũng cải thiện đáng kể; ở mức nỗ lực cao hơn, mô hình đạt ngang GPT‑5.6 Sol với chi phí chỉ khoảng một phần trăm.

Tại đây, chúng tôi đánh giá tính chính xác thực tế qua các cuộc trò chuyện ChatGPT đã được khử định danh, trong đó người dùng đánh dấu lỗi dữ kiện của một mô hình trước đó. Những cuộc trò chuyện dễ gây lỗi này không đại diện cho cách sử dụng thông thường, nơi lỗi dữ kiện hiếm gặp hơn. Điểm số chưa được kiểm soát theo độ dài; tuy nhiên, các thử nghiệm với nhiều mức độ chi tiết cho thấy kết quả gần như không phụ thuộc vào độ dài câu trả lời.

Lập trình

Năm nay, các tác nhân lập trình đã bắt đầu xử lý những tác vụ có độ phức tạp, phạm vi và thời lượng lớn hơn bao giờ hết. Tại OpenAI, mức sử dụng nội bộ của chúng tôi đã tăng theo cấp số nhân. Nếu quy đổi theo giá API, mức sử dụng token hằng ngày đã vượt $600 đối với nhà nghiên cứu ở trung vị và $7.000 đối với nhà nghiên cứu ở phân vị thứ 90 (Đẩy nhanh nghiên cứu: Góc nhìn từ bên trong OpenAI⁠). Khi các tác nhân lập trình đảm nhận những tác vụ dài hơn và đòi hỏi cao hơn, chi phí sử dụng liên tục càng trở nên quan trọng. GPT‑6 Sol và Luna kết hợp hiệu suất lập trình mạnh mẽ với giá API thấp hơn, giúp nhà phát triển có thêm dư địa lặp lại, tinh chỉnh và giúp các nhóm tự tin giao cho Codex những nhiệm vụ tham vọng hơn.

Trên FrontierCode, bài đánh giá liệu tác nhân lập trình có tạo ra thay đổi sẵn sàng hợp nhất vào cơ sở mã thực tế hay không, GPT‑6 Sol cải thiện đáng kể so với GPT‑5.6 Sol và đạt ngang Claude Fable 5.1 ở mức cực cao với chi phí thấp hơn nhiều.

Trong FrontierCode 1.1 Main⁠(mở trong cửa sổ mới), các tác nhân AI viết mã được chấm không chỉ về độ chính xác mà còn về “khả năng hợp nhất”, chẳng hạn như chất lượng kiểm thử, tuân thủ phạm vi, phong cách mã và việc tuân theo các tiêu chuẩn của cơ sở mã.

Trên DeepSWE v1.1, bài kiểm tra hiệu suất ở các tác vụ kỹ thuật phần mềm phức tạp trong cơ sở mã thực tế, GPT‑6 Sol ở mức nỗ lực Max đạt 68,8%, chỉ kém 1,1 điểm phần trăm so với điểm cao nhất của Claude Fable 5 trong bài đánh giá (69,9% ở mức nỗ lực cực cao) với chi phí cho mỗi tác vụ thấp hơn khoảng 80%.

GPT‑6 Luna ở mức nỗ lực Max đạt 66,6%, tương đương Claude Opus 5 và Fable 5 ở mức nỗ lực Vừa. Trong các phép so sánh này, chi phí mỗi tác vụ của Luna thấp hơn Opus 5 là 93% và thấp hơn Fable 5 là 96%.

Trong DeepSWE 1.1⁠(mở trong cửa sổ mới), các tác nhân AI giải quyết những tác vụ kỹ thuật phần mềm nguyên bản, kéo dài qua nhiều bước.

Sử dụng máy tính

Dù GPT‑6 Astra vẫn là mô hình sử dụng máy tính tốt nhất thế giới, GPT‑6 Sol và Luna mang lại hiệu suất tiết kiệm chi phí hơn các phiên bản tiền nhiệm. Trên OSWorld 2.0 ngoại tuyến, GPT‑6 Sol ở mức nỗ lực cực cao đạt điểm tương đương Claude Opus 5 ở mức nỗ lực Vừa (60,5% so với 60,3%) với chi phí cho mỗi tác vụ thấp hơn khoảng 80%. GPT‑6 Luna (Max) vượt GPT‑5.6 Sol (Vừa) với chi phí chỉ bằng một phần mười.

Trong OSWorld 2.0⁠(mở trong cửa sổ mới), các tác nhân AI thực hiện những quy trình sử dụng máy tính kéo dài qua nhiều bước, bao gồm cả tác vụ hằng ngày và chuyên môn. Chúng tôi báo cáo điểm thưởng một phần trên tập ngoại tuyến của bản phát hành v2026.08.08.

Phong cách cộng tác

Chúng tôi cũng đưa phong cách giao tiếp cải tiến của GPT‑6 Astra vào Sol và Luna; theo chúng tôi, thay đổi này sẽ đặc biệt dễ nhận thấy trong các cuộc trò chuyện kỹ thuật và lập trình. Bạn sẽ thấy cách diễn đạt rõ ràng hơn, ít biệt ngữ và lối nói kỳ lạ hơn, bớt chi tiết ít giá trị hơn, cùng câu trả lời nhìn chung ngắn hơn đôi chút mà vẫn giữ nguyên nội dung cốt lõi.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Dù phong cách mang tính chủ quan, chúng tôi thích câu trả lời của GPT‑6 Sol hơn trong trường hợp này. Mô hình không vội kết luận, dành ít thời gian hơn để nhắc lại những chi tiết có thể đã rõ với người hỏi (chẳng hạn trang web có bốn trang), dùng ít cách diễn đạt mơ hồ hơn (chẳng hạn “cảm giác bento”, “định hình lại… xoay quanh hệ thống đó”), thẳng thắn hơn về những gì đã và chưa kiểm tra, đồng thời không chia sẻ các chi tiết triển khai không cần thiết như câu lệnh dành cho công cụ hình ảnh.

Cải thiện bộ nhớ đệm cho tác nhân và cuộc trò chuyện dài

Bên cạnh việc giảm giá token, chúng tôi còn giúp các nhà phát triển xây dựng trên GPT‑6 tiết kiệm hơn đối với ngữ cảnh mà ứng dụng của họ tái sử dụng. Chúng tôi đã cải thiện khả năng lưu trữ nội dung câu lệnh cho GPT‑6 để mặc định đạt tỷ lệ trúng bộ nhớ đệm cao hơn, giúp các tác nhân tái sử dụng nhiều ngữ cảnh hơn, phản hồi nhanh hơn và được giảm 90% chi phí đọc token đầu vào đã lưu trong bộ nhớ đệm.

Nhà phát triển cũng có thêm nhiều cách để đo lường và tối ưu hóa hiệu suất bộ nhớ đệm:

  • Theo dõi và chẩn đoán. Bảng điều khiển lưu trữ nội dung câu lệnh⁠(mở trong cửa sổ mới) cho biết lượng đầu vào được lưu trong bộ nhớ đệm và sự thay đổi theo thời gian. Công cụ chẩn đoán⁠(mở trong cửa sổ mới) giúp giải thích những cơ hội lưu vào bộ nhớ đệm bị bỏ lỡ và cách khắc phục.

  • Điều chỉnh mức nỗ lực suy luận và khả năng sử dụng công cụ mà không làm mất hiệu lực bộ nhớ đệm. Tăng mức nỗ lực suy luận⁠(mở trong cửa sổ mới) cho tác vụ khó hơn hoặc giảm mức này cho các câu hỏi tiếp nối đơn giản hơn, đồng thời bật hoặc tắt công cụ⁠(mở trong cửa sổ mới) khi nhu cầu của tác nhân thay đổi. Cả hai chế độ điều khiển giờ đây đều giữ lại ngữ cảnh trước đó để tái sử dụng bộ nhớ đệm.

  • Tối ưu hóa các tiền tố được lưu vào bộ nhớ đệm. Các điểm ngắt tường minh cho phép nhà phát triển chọn vị trí kết thúc của tiền tố câu lệnh được lưu trong bộ nhớ đệm. Nhờ đó, nhà phát triển có nhiều quyền kiểm soát hơn đối với việc tái sử dụng bộ nhớ đệm và có thể cải thiện hiệu suất.

GitHub cho biết trong vài tháng qua, các cải tiến này đã giảm hơn 50% tỷ lệ token câu lệnh cần xử lý mới trên hàng tỷ yêu cầu gửi đến các mô hình OpenAI, giúp Copilot phản hồi nhanh hơn.

Tiếp tục cải thiện khả năng căn chỉnh

GPT‑6 Sol và Luna tiếp nối công trình căn chỉnh được giới thiệu cùng Astra, mô hình được căn chỉnh tốt nhất của chúng tôi cho đến nay. Trong các bài đánh giá căn chỉnh, cả Sol và Luna đều cải thiện so với các phiên bản GPT‑5.6 tương ứng, trong đó có tỷ lệ đưa ra tuyên bố gây hiểu lầm về công việc lập trình thấp hơn.

Các bài đánh giá dưới đây cố ý kiểm tra những tình huống khó và không đo lường tỷ lệ lỗi trong cách sử dụng thông thường. Xem thẻ hệ thống⁠(mở trong cửa sổ mới) để biết đầy đủ kết quả.

Phạm vi cung cấp

Từ hôm nay, GPT‑6 Sol và GPT‑6 Luna được cung cấp trong ChatGPT Công việc và Codex cho tất cả người dùng Plus, Pro, Business, Enterprise và Edu. Người dùng gói Free và Go có thể truy cập GPT‑6 Luna trong ứng dụng máy tính. Các mô hình này chưa được cung cấp trong Trò chuyện. Trong API OpenAI, các mô hình này có tên gpt-6-sol và gpt-6-luna.

Để duy trì dịch vụ ổn định cho mọi người, chúng tôi dự kiến triển khai dần các mô hình này trong ChatGPT suốt cả ngày. Nếu chưa thấy các mô hình mới trong ChatGPT Công việc hoặc Codex, vui lòng thử lại sau.


Các đánh giá GPT được thực hiện trong môi trường nghiên cứu của chúng tôi hoặc qua API, nên đầu ra có thể hơi khác ChatGPT phiên bản chính thức do khác biệt về câu lệnh hệ thống, công cụ có sẵn và các yếu tố khác. Kết quả đánh giá mô hình cạnh tranh được lấy từ các báo cáo công khai. Điểm của Claude Fable 5 được sử dụng khi không có điểm của Claude Fable 5.1.

Tác giả

OpenAI