メインコンテンツにスキップ
OpenAI

GPT-6.1Sol

Astra に迫る知能を 5 分の 1 の価格で、フロンティア性能の継続的な活用へ

GPT‑6 Sol のアップグレードとなる GPT‑6.1 Sol を発表します。エージェント型コーディングで極めて優れた性能を発揮するほか、コンピューター操作や専門業務にも優れています。難易度の高いタスクで Sol の性能を GPT‑6 Astra に近づけながら、標準の入力・出力トークン料金を Astra の 5 分の 1 に抑えました。開発者は同じ予算で、高性能なエージェントの構築と運用により多くのリソースを充てられます。

GPT‑6.1 Sol は、Astra に迫る性能を Sol の料金で提供する、現時点で性能に対するコスト効率が最も高いモデルです。キャッシュ済み入力の料金は、標準の入力料金から 95% 割引となる、100 万トークンあたりわずか 0.10 ドルです。リクエストを繰り返す中でコンテキストを再利用する必要があるエージェントのワークロードを、より低コストで処理できます。

総合的な能力では、引き続き GPT‑6 Astra が当社最高のフロンティアモデルです。GPT‑6.1 Sol は、重要な業務をより頻繁にこなしたいユーザーや、アプリケーションを大規模に構築・運用する API ユーザーに、能力とコストの新たなバランスを提供します。

3 つのモデルカード。GPT-6 Astra:最高の結果をもたらす、当社で最も知能の高いモデル。入力 10 ドル、出力 50 ドル、キャッシュ済み入力 1 ドル。GPT-6.1 Sol:Astra に迫る知能を 5 分の 1 の価格で提供。入力 2 ドル、出力 10 ドル、キャッシュ済み入力 0.10 ドル。GPT-6 Luna:日常業務を高速かつ効率的に、大規模に処理。入力 0.10 ドル、出力 0.50 ドル、キャッシュ済み入力 0.01 ドル。

幅広いタスクで進化した Sol

GPT‑6.1 Sol は、コードの作成やデバッグから、文書の理解、複数ステップの業務ワークフローの実行まで、複雑な専門業務全般において GPT‑6 Sol から大幅に性能を向上させています。これらの評価のいくつかでは、大幅に低いコストで GPT‑6 Astra に迫る性能を達成しています。

コーディング

実際のコードベースで複雑なソフトウェアエンジニアリングのタスクを評価する DeepSWE v1.1 では、GPT‑6.1 Sol は約 5 分の 1 のコストで GPT‑6 Astra と同等の性能を達成しました。また、GPT‑6 Sol よりも少ない思考量と低いコストで、その最高スコアを 6.4 パーセントポイント上回りました。

DeepSWE 1.1⁠⁠(新しいウィンドウで開く) では、AI エージェントが、長期的な取り組みを要する独自のソフトウェアエンジニアリングタスクを解決します。

専門業務

GDP.pdf は、表、グラフ、図、小さな文字で書かれた詳細情報を含む複雑な PDF 文書を使い、専門的な質問にモデルがどれだけ正確に回答できるかを測定します。この評価で GPT‑6.1 Sol は、テストした推論設定のいずれでも、フォールバックを使う Opus 5.5 より高いスコアを、半分未満のタスクあたりコストで達成しました。また、タスクあたりのコストを約 5 分の 1 に抑えながら、GPT‑6 Astra の最先端の性能に迫っています。

GDP.pdf⁠(新しいウィンドウで開く) では、金融、医療、法務など計 10 の専門分野の実務で使われる複雑な PDF について、モデルが実際の業務に即したプロンプトに回答します。

エージェントが複数ステップの業務ワークフローを正しく完了できるかを測定する AutomationBench では、思考量を中に設定した GPT‑6.1 Sol が、約 3 分の 1 のコストで Opus 5.5 を 2.2 ポイント上回りました。このスコアは、同じ設定の GPT‑6 Sol も 4.8 ポイント上回っています。

In AutomationBench 1.0.6⁠⁠(新しいウィンドウで開く), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

コンピューター操作

GPT‑6.1 Sol は、コンピューター上のアプリケーションを操作するタスクでも大きく進歩しています。難易度の高いコンピューター操作ワークフローでエージェントを評価する OSWorld 2.0 のオフラインセットでは、思考量を最大に設定した GPT‑6.1 Sol が、半分未満のコストで GPT‑6 Sol を 7パーセントポイント上回りました。また、推論にかける労力を最大にした場合、タスクあたりのコストを約 7 分の 1 に抑えながら、Astra のスコアとの差を2.1パーセントポイントまで縮めています。

In OSWorld 2.0⁠⁠(新しいウィンドウで開く), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

科学研究

データ分析、シミュレーション、定理証明などの科学分野のワークフローを評価する Terminal-Bench Science 0.1 では、思考量を最大に設定した GPT‑6.1 Sol が、GPT‑6 Sol の 2 倍を超えるスコアを、半分未満のタスクあたりコストで達成しました。推論にかける労力を最大にした場合、タスクあたりの平均コストは GPT‑6.1 Sol が 5.47 ドル、Opus 5.5 が 23.21 ドル、Astra が 23.80 ドルです。いずれのモデルと比べても 75% 以上低いコストで、科学分野の高い能力を提供します。

GPT‑6 Astra は、テストしたモデルの中で引き続き最高スコアの 68.1% を達成しており、最も難しい科学研究タスクにはこのモデルの使用を推奨します。

Terminal-Bench Science 0.1⁠(新しいウィンドウで開く) では、エージェントがコードとターミナルツールを使い、データ分析、シミュレーションの実行、モデルのフィッティングなど、科学研究のワークフローを完遂します。

事実の正確性

GPT‑6.1 Sol は、難しいプロンプトに対する事実の正確性も向上しています。思考量を『超高』に設定した場合、事実誤認率は GPT‑6 Sol の 4.5% から 4.1% に低下し、同じ設定の Astra の 4.0% に近づいています。同時に、タスクあたりのコストは Astra より約 83% 低くなっています。

この評価では、以前のモデルの誤りをユーザーが指摘した会話から個人を特定できる情報を除去し、少なくとも 1 つの事実誤認を含む回答の割合を測定しています。これらは意図的に選んだ難しいプロンプトであり、通常の利用を代表するものではありません。

事実の正確性は、以前のモデルによる事実誤認をユーザーが指摘した ChatGPT の会話から、個人を特定できる情報を除去して評価しています。こうした誤りを誘発する会話は、通常の利用を代表するものではありません。通常の利用では、事実誤認の発生頻度はより低くなります。

GPT‑6.1 Sol の安全な展開

当社のアラインメント評価では、GPT‑6.1 Sol は GPT‑6 Sol から大幅に改善し、GPT‑6 Astra に近づいています。

GPT‑6.1 Sol は、自身の限界についてより透明性が高く、ユーザーの意図と安全上の制約をより確実に尊重します。難易度の高い評価では、検索ツールの不具合を率直に伝えること、明示的な制限を守ること、エージェントとしてのタスク実行中に無許可の結果を生じさせないことのいずれでも、GPT‑6 Sol より低い失敗率を示しました。安全性の自動レビューを回避する試みは、GPT‑6 Astra および GPT‑6 Sol と同様に、観測されませんでした。

以下の評価は、意図的に難しい状況をテストするものであり、通常の利用における失敗率を測定するものではありません。

料金と提供状況

GPT‑6.1 Sol は本日より、Plus、Pro、Business、Enterprise、Edu のすべてのユーザーが ChatGPT Work と Codex で利用できます。これらのモデルは、Chat ではまだ利用できません。開発者は、OpenAI API から gpt-6.1-sol として利用することもできます。標準の API 料金は、100 万トークンあたり入力が 2 ドル、キャッシュ済み入力が 0.10 ドル、出力が 10 ドルです。

あわせて、GPT‑6 Astra の最大 8 倍の速度を実現する世界最速のフロンティアモデル GPT‑6 Astra Ultrafast と、GPT‑6.1 Sol Ultrafast も提供開始します。これらは API で利用できるほか、利用上限が最も高い新しい月額 500 ドルの Pro ティアのユーザーは、ChatGPT Work と Codex でも利用できます。GPT‑6.1 Sol Ultrafast により、開発者は従来の GPT‑6 Astra とほぼ同じ API コストで、Astra に迫る知能を最大 8 倍の速度で利用できます。

著者

OpenAI

GPT の評価は、当社の研究環境または API を通じて実施しました。システムプロンプト、利用可能なツール、推論にかける労力などが異なるため、本番環境の ChatGPT とは出力が多少異なる場合があります。競合モデルの評価は、公開レポートから引用しています。