跳到主要內容
OpenAI

GPT-6.1Sol

以五分之一的價格提供接近 Astra 的智能,持續展現前沿表現

我們現正推出 GPT‑6.1 Sol,這是 GPT‑6 Sol 的升級版本,在智能代理式編碼、電腦操作及專業工作方面均有卓越表現。它讓 Sol 處理高難度任務的能力更接近 GPT‑6 Astra,而標準輸入及輸出 Token 價格僅為 Astra 的五分之一,讓開發者在相同預算下,有更大空間建構及運行功能強大的智能代理。

GPT‑6.1 Sol 以 Sol 的價格提供接近 Astra 的表現,是目前同等效能下最具成本效益的模型。快取輸入每百萬 Token 僅需 0.10 美元,比標準輸入價格低 95%,讓需要在多次請求之間重用上下文的智能代理工作負載更為實惠。

GPT‑6 Astra 仍是我們整體能力最強的前沿模型。無論使用者希望更頻繁地處理重要工作,還是 API 客戶需要大規模建構及運行應用程式,GPT‑6.1 Sol 都能在能力與成本之間提供新的平衡。

三張模型卡片:GPT-6 Astra 是我們智能最高的模型,提供最佳成果,輸入價格為 10 美元、輸出為 50 美元、快取輸入為 1 美元;GPT-6.1 Sol 以五分之一的價格提供接近 Astra 的智能,輸入價格為 2 美元、輸出為 10 美元、快取輸入為 0.10 美元;GPT-6 Luna 可快速高效地大規模處理日常工作,輸入價格為 0.10 美元、輸出為 0.50 美元、快取輸入為 0.01 美元。

Sol 處理各類任務的能力全面提升

從編寫程式碼及除錯,到理解文件及執行多步驟業務工作流程,GPT‑6.1 Sol 在複雜專業工作上的表現均較 GPT‑6 Sol 大幅提升。在其中多項評估中,它以低得多的成本達到接近 GPT‑6 Astra 的表現。

編碼

DeepSWE v1.1 使用真實程式碼庫評估複雜的軟件工程任務。GPT‑6.1 Sol 在這項評估中以約五分之一的成本,達到與 GPT‑6 Astra 相若的表現,同時以較低的推理力度及成本,比 GPT‑6 Sol 的最佳分數高出 6.4 個百分點。

在 DeepSWE 1.1⁠⁠(在新視窗中開啟) 中,AI 代理會完成原創且需長程規劃的軟件工程任務。

專業工作

GDP.pdf 量度模型運用複雜 PDF 文件回答專業問題的準確度,文件內容涵蓋表格、圖表、示意圖及小字細節。在受測的各項推理設定下,GPT‑6.1 Sol 的分數均高於設有後備方案的 Opus 5.5,而每項任務成本不到其一半。它亦以約五分之一的每項任務成本,達到接近 GPT‑6 Astra 的頂尖表現。

在 GDP.pdf⁠(在新視窗中開啟) 中,模型必須根據來自金融、醫療、法律及另外七個專業領域工作流程的複雜 PDF 文件,回應真實場景中的提示。

AutomationBench 量度智能代理能否正確完成多步驟業務工作流程。推理力度設為「中」時,GPT‑6.1 Sol 的分數比 Opus 5.5 高出 2.2 個百分點,成本則約為其三分之一。這個分數亦比相同設定下的 GPT‑6 Sol 高出 4.8 個百分點。

In AutomationBench 1.0.6⁠⁠(在新視窗中開啟), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

電腦操作

GPT‑6.1 Sol 在需要與電腦應用程式互動的任務上,亦取得顯著進步。OSWorld 2.0 的離線測試集用於評估智能代理處理高難度電腦操作工作流程的能力。在最高推理力度下,GPT‑6.1 Sol 的分數比 GPT‑6 Sol 高出 7 個百分點,成本卻不到其一半。在最高推理力度下,它與 Astra 的分數差距縮窄至 2.1 個百分點,而每項任務成本約為其七分之一。

In OSWorld 2.0⁠⁠(在新視窗中開啟), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

科學研究

Terminal-Bench Science 0.1 評估涵蓋數據分析、模擬及定理證明的科學工作流程。在最高推理力度下,GPT‑6.1 Sol 的分數超過 GPT‑6 Sol 的兩倍,每項任務成本卻不到其一半。在最高推理力度下,GPT‑6.1 Sol 每項任務的平均成本為 5.47 美元,相較之下,Opus 5.5 為 23.21 美元,Astra 則為 23.80 美元。它以比這兩款模型均低逾 75% 的成本,提供強大的科學研究能力。

GPT‑6 Astra 仍以 68.1% 在受測模型中取得最高分數,因此處理最困難的科學研究任務時,應選用這款模型。

在 Terminal-Bench Science 0.1⁠(在新視窗中開啟) 中,代理會運用程式碼及終端機工具完成科研工作流程,包括分析數據、執行模擬及進行模型擬合。

事實準確性

GPT‑6.1 Sol 在回應高難度提示時,事實準確性亦有所提升。在特高推理力度下,其事實錯誤率為 4.1%,低於 GPT‑6 Sol 的 4.5%,並更接近相同設定下 Astra 的 4.0%,而每項任務成本比 Astra 低約 83%。

這項評估採用已去識別化、且使用者曾指出舊版模型錯誤的對話,量度含有至少一項事實錯誤的答案比例。這些刻意挑選的高難度提示並不代表一般使用情況。

我們使用已去識別化的 ChatGPT 對話來評估事實準確性;在這些對話中,使用者曾指出先前模型的事實錯誤。這些容易引發錯誤的對話並不代表一般使用情況;在一般使用情況下,事實錯誤較為少見。

安全部署 GPT‑6.1 Sol

在我們的對齊評估中,GPT‑6.1 Sol 的表現較 GPT‑6 Sol 大幅改善,更接近 GPT‑6 Astra。

GPT‑6.1 Sol 更坦誠地說明自身限制,在尊重使用者意圖及遵守安全限制方面亦更可靠。在高難度評估中,它在如實告知搜尋工具故障、遵守明確限制,以及在智能代理任務中避免產生未經授權的結果等方面,失誤率均低於 GPT‑6 Sol。我們未觀察到任何繞過自動安全審查系統的嘗試,與 GPT‑6 Astra 及 GPT‑6 Sol 的表現一致。

以下評估刻意測試具挑戰性的情境,並非量度一般使用情況下的失誤率。

定價及供應情況

由即日起,所有 Plus、Pro、Business、Enterprise 及 Edu 使用者均可在 ChatGPT 工作及 Codex 中使用 GPT‑6.1 Sol。這些模型尚未在「對話」中提供。開發者亦可透過 OpenAI API,以 gpt-6.1-sol 存取此模型。其標準 API 價格為每百萬輸入 Token 2 美元、每百萬快取輸入 Token 0.10 美元,以及每百萬輸出 Token 10 美元。

我們亦同步推出 GPT‑6 Astra Ultrafast 及 GPT‑6.1 Sol Ultrafast。GPT‑6 Astra Ultrafast 是全球速度最快的前沿模型,速度最高可達 GPT‑6 Astra 的 8 倍。這些模型可透過 API 使用,亦會在 ChatGPT 工作及 Codex 中向我們全新 Pro 級別的使用者提供;此級別每月收費 500 美元,提供最高用量。透過 GPT‑6.1 Sol Ultrafast,開發者只需付出與以往使用 GPT‑6 Astra 大致相同的 API 費用,即可獲得接近 Astra 的智能,速度最高達 8 倍。

作者

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.