跳至主要內容
OpenAI

GPT-6.1Sol

以五分之一的價格,提供接近 Astra 的智慧能力,持續發揮前沿效能

我們推出了 GPT‑6.1 Sol,這是 GPT‑6 Sol 的升級版,在智慧體式程式碼編寫、電腦操作和專業工作方面都有格外出色的表現。它讓 Sol 在高難度任務上的表現更接近 GPT‑6 Astra,而標準輸入和輸出 Token 價格僅為 Astra 的五分之一,讓開發人員在相同預算下,能更充分地建構及執行能力強大的智慧體。

GPT‑6.1 Sol 以 Sol 的價格提供接近 Astra 的效能,是目前同等效能下最具成本效益的模型。快取輸入每百萬 Token 僅需 $0.10,比標準輸入價格低 95%,讓需要在重複請求中重複使用上下文的智慧體工作負載更為經濟實惠。

GPT‑6 Astra 仍是我們整體能力最強的前沿模型。無論是使用者希望更頻繁處理的重要工作,還是 API 客戶大規模建構和執行應用程式的需求,GPT‑6.1 Sol 都能在能力與成本之間提供新的平衡。

三張模型介紹卡:GPT-6 Astra 是我們最聰明的模型,能提供最佳成果,輸入價格為 $10、輸出為 $50、快取輸入為 $1;GPT-6.1 Sol 以五分之一的價格提供接近 Astra 的智慧能力,輸入價格為 $2、輸出為 $10、快取輸入為 $0.10;GPT-6 Luna 可快速有效地大規模處理日常工作,輸入價格為 $0.10、輸出為 $0.50、快取輸入為 $0.01。

各項任務表現更出色的 Sol

從編寫程式碼與除錯,到理解文件和執行多步驟業務流程,GPT‑6.1 Sol 在各類複雜專業工作上的表現,都比 GPT‑6 Sol 大幅提升。在其中多項評估中,它以顯著較低的成本達到接近 GPT‑6 Astra 的效能。

程式碼編寫

DeepSWE v1.1 以真實程式碼庫中的複雜軟體工程任務進行評估。在這項評估中,GPT‑6.1 Sol 以約五分之一的成本達到與 GPT‑6 Astra 相同的表現,同時以更低的推理強度和成本,比 GPT‑6 Sol 的最佳成績高出 6.4 個百分點。

在 DeepSWE 1.1⁠⁠(在新視窗中開啟) 中,AI 代理會解決原創且需長時間執行的軟體工程任務。

專業工作

GDP.pdf 衡量模型利用複雜 PDF 文件回答專業問題的準確度,文件內容包括表格、圖表、示意圖和小字細節。在所有受測推理設定下,GPT‑6.1 Sol 的得分都高於含備援機制的 Opus 5.5,而每項任務的成本不到後者的一半。它也以約五分之一的每項任務成本,達到接近 GPT‑6 Astra 的頂尖效能。

在 GDP.pdf⁠(在新視窗中開啟) 中,模型必須針對複雜的 PDF 文件回答實務問題。這些文件取自金融、醫療、法律及其他七個專業領域的工作流程。

AutomationBench 衡量智慧體能否正確完成多步驟業務流程。在這項評估中,GPT‑6.1 Sol 於中推理強度下的得分比 Opus 5.5 高出 2.2 個百分點,成本卻僅約為其三分之一。這項得分也比相同設定下的 GPT‑6 Sol 高出 4.8 個百分點。

In AutomationBench 1.0.6⁠⁠(在新視窗中開啟), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

電腦操作

GPT‑6.1 Sol 在需要與電腦應用程式互動的任務上,也有顯著進步。OSWorld 2.0 的離線測試集以高難度電腦操作流程評估智慧體。在這項評估中,GPT‑6.1 Sol 於最高推理強度下的得分比 GPT‑6 Sol 高出七個百分點,成本卻不到後者的一半。在最高推理強度下,它與 Astra 的得分差距僅 2.1 個百分點,而每項任務的成本約為 Astra 的七分之一。

In OSWorld 2.0⁠⁠(在新視窗中開啟), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

科學研究

Terminal-Bench Science 0.1 評估包括資料分析、模擬及定理證明在內的科學工作流程。在這項評估中,GPT‑6.1 Sol 於最高推理強度下的得分超過 GPT‑6 Sol 的兩倍,而每項任務的成本不到後者的一半。在最高推理強度下,GPT‑6.1 Sol 每項任務的平均成本為 $5.47,相較之下,Opus 5.5 為 $23.21,Astra 為 $23.80。它以比這兩款模型低逾 75% 的成本,提供強大的科學研究能力。

GPT‑6 Astra 仍以 68.1% 在受測模型中獲得最高分,最困難的科學研究任務應使用此模型。

在 Terminal-Bench Science 0.1⁠(在新視窗中開啟) 中,代理會運用程式碼和終端機工具完成科學研究工作流程,包括分析資料、執行模擬及擬合模型。

事實正確性

GPT‑6.1 Sol 在回應高難度提示時,事實準確度也有所提升。在特高推理強度下,它的事實錯誤率為 4.1%,低於 GPT‑6 Sol 的 4.5%,更接近相同設定下 Astra 的 4.0%,而每項任務的成本比 Astra 低約 83%。

這項評估採用經去識別化處理、且使用者曾指出先前模型錯誤的對話,衡量回答中含有至少一項事實錯誤的比例。這些刻意挑選的高難度提示並不代表一般使用情況。

我們使用經去識別化處理的 ChatGPT 對話來評估事實正確性;使用者曾在這些對話中指出先前模型的事實錯誤。這些容易引發錯誤的對話不代表一般使用情況,一般使用時的事實錯誤更為少見。

安全部署 GPT‑6.1 Sol

在我們的對齊評估中,GPT‑6.1 Sol 的表現比 GPT‑6 Sol 大幅進步,更接近 GPT‑6 Astra。

GPT‑6.1 Sol 能更坦誠地說明自身限制,在尊重使用者意圖及遵守安全限制方面也更可靠。在具挑戰性的評估中,它在如實告知搜尋工具故障、遵守明確限制,以及避免在智慧體任務中產生未經授權的結果等方面,失敗率都低於 GPT‑6 Sol。我們未觀察到任何試圖繞過自動化安全審查機制的行為,與 GPT‑6 Astra 和 GPT‑6 Sol 的表現一致。

以下評估刻意測試具挑戰性的情境,並非衡量一般使用情況下的失敗率。

定價與供應情況

即日起,所有 Plus、Pro、Business、Enterprise 和 Edu 使用者都能在 ChatGPT 工作與 Codex 中使用 GPT‑6.1 Sol。這些模型尚未在對話中提供。開發人員也可以透過 OpenAI API,以 gpt-6.1-sol 存取此模型。標準 API 價格為:每百萬輸入 Token $2、每百萬快取輸入 Token $0.10,以及每百萬輸出 Token $10。

同時,我們也推出了 GPT‑6 Astra Ultrafast,這是全球速度最快的前沿模型,速度最高可達 GPT‑6 Astra 的 8 倍;一併推出的還有 GPT‑6.1 Sol Ultrafast。這些模型可透過 API 使用;訂閱我們全新 Pro 級別的使用者也能在 ChatGPT 工作和 Codex 中使用。此級別每月 $500,提供最高用量額度。透過 GPT‑6.1 Sol Ultrafast,開發人員只需花費與過去使用 GPT‑6 Astra 大致相同的 API 費用,即可獲得接近 Astra 的智慧能力,速度最高可達 8 倍。

作者

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.