GPT‑6 Sol と Luna のご紹介
フロンティアの応答性能を日々の仕事に活かす、さらなる選択肢
今月初め、世界で最も高い応答性能と整合性を備えたモデル、GPT‑6 Astra を発表しました。特に難度が高く重要なプロジェクトには、引き続き Astra の能力を最大限に活用する必要があります。一方、仕事の規模やペース、予算はさまざまです。
そこで、GPT‑6 ファミリーに GPT‑6 Sol と GPT‑6 Luna を追加します。GPT‑6 Astra は、新世代の応答性能を切り拓きました。これらのモデルは、コスト効率のフロンティアを前進させ、その恩恵をより幅広く届けます。GPT‑6 Sol と Luna は GPT‑6 Astra と同様の手法でトレーニングされており、業務、正確性、コーディング、コンピューター操作、整合性における Astra の最先端の性能を、より高速で手頃なモデルにもたらします。
GPT‑6 モデルはコストと応答性能のあらゆる領域をリードし、各層の卓越した能力と、それを大規模かつ効率的に提供するインフラを兼ね備えています。キャッシュと推論の改善により、これらのモデルを低コストで提供できるようになりました。その削減分をユーザーやお客様に直接還元し、GPT‑5.6 のプロモーション価格と比べてSol と Luna の API 価格を 50% 引き下げます。これらの改善により、高度な AI を日常のより多くのタスクや大規模な用途で実用的に活用できます。
モデル | 入力 | 出力 | 値下げ率 |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% 値下げ |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% 値下げ |
価格は 100 万トークンあたりです。
GPT‑6 Astra は、引き続きあらゆる面で最高のモデルです。最高の結果と妥協のない体験を求める場合にお選びください。
GPT‑6 Sol と Luna は、複雑な仕事の遂行に特に役立つ能力全般にわたり、使い慣れたモデルの応答性能とコスト効率を高めます。
GPT‑6 Sol は難しい業務に対応できるほか、利用上限の引き上げとコスト低減により、試行錯誤の余地が広がります。同価格帯の競合モデルより高い応答性能と優れた結果を提供します。
アプリ横断の業務ワークフローを検証する AutomationBench では、推論水準を xhigh に設定した GPT‑6 Sol が、推論水準を max に設定した Claude Opus 5 を上回り、タスクあたりのコストは Opus 5 のわずか 9% です。推論水準を high に設定した GPT‑6 Luna は、前モデルより 5.4 ポイント向上し、タスクあたりのコストは 58% 低下しています。
AutomationBench 1.0.6(新しいウィンドウで開く) では、営業、マーケティング、オペレーション、サポート、財務、人事にまたがる 47 種類のツールを使い、エンドツーエンドのワークフローで AI エージェントを検証します。Claude Fable 5.1 のデータは、約 40% のタスクで発生した Opus 5 へのフォールバック費用を含まないため、実際のコストを過小に示しています。
GPT‑6 Sol は、大幅に低いコストで Claude Fable 5.1 を上回り、推論水準を low に設定した GPT‑6 Astra さえ凌駕します。
モデル(推論水準) | スコア | タスクあたりのコスト |
|---|---|---|
GPT‑6 Sol(xhigh) | 33.2% | $0.27 |
GPT‑6 Astra(low) | 30.3% | GPT‑6 Sol の 3.9 倍 |
Claude Opus 5(max) | 26.9% | GPT‑6 Sol の 11.1 倍 |
Claude Fable 5.1(Opus 5 フォールバックあり、max) | 31.4% | GPT‑6 Sol の >8.9 倍 (フォールバック費用は未報告) |
複雑な業務ワークフローでエージェントを評価する Agents’ Last Exam では、推論水準を max に設定した GPT‑6 Sol が 56.4% を記録しました。これは評価での Claude Opus 5 の最高スコアを上回り、タスクあたりのコストは 60% 低くなっています。
Agents’ Last Exam V1(新しいウィンドウで開く) では、コンピューターで行われる主要な業務分野の大半を網羅する 55 の細分業種にわたり、長期的で経済価値の高いタスクを使って AI エージェントを評価します。
回答の有用性は事実の正確さに左右されます。私たちは引き続き、事実に関する信頼性を高めています。ユーザーがモデルの誤りを指摘した、匿名化済みの実際の会話に基づく社内の正確性評価では、GPT‑6 Sol の誤りは前モデルの約半分でした。はるかに低いコストで Astra に近い信頼性を実現しています。GPT‑6 Luna も大幅に向上しています。推論水準を高くすると、約 100 分の 1 のコストで GPT‑5.6 Sol と同等の性能を発揮します。
ここでは、以前のモデルによる事実誤認をユーザーが指摘した、匿名化済みの ChatGPT の会話を使って正確性を評価しています。誤りを誘発するこれらの会話は、事実誤認がより少ない通常の利用状況を示すものではありません。スコアは回答の長さで調整していませんが、詳細度を変えた検証では、回答の長さによる影響はほとんど見られませんでした。
今年、コーディングエージェントは、これまで以上に複雑で大規模かつ長時間にわたるタスクに取り組み始めています。OpenAI では、社内利用が飛躍的に増加しています。API 価格で換算すると、1 日あたりのトークン使用額は研究者の中央値で 600 ドル、90 パーセンタイルでは 7,000 ドルを超えています(研究の加速:OpenAI の現場から)。コーディングエージェントがより長く難しいタスクを担うようになるにつれ、継続利用のコストは一層重要になります。GPT‑6 Sol と Luna は、高いコーディング性能と低い API 価格を両立しています。開発者はより多く試行錯誤でき、チームは Codex に一段と意欲的なタスクを安心して任せられます。
コーディングエージェントが実際のコードベースにマージできる変更を作成できるか評価する FrontierCode では、GPT‑6 Sol が GPT‑5.6 Sol から大幅に向上し、はるかに低いコストで推論水準を xhigh に設定した Claude Fable 5.1 と同等の性能を実現しています。
FrontierCode 1.1 Main(新しいウィンドウで開く) では、AI エージェントがコードを作成します。正確性だけでなく、テストの品質、スコープの適切さ、コードスタイル、コードベースの標準への準拠など、「マージ可能性」も評価されます。
実際のコードベースを使って複雑なソフトウェアエンジニアリングのタスクを検証する DeepSWE v1.1 では、推論水準を max に設定した GPT‑6 Sol が 68.8% を記録しました。これは、推論水準を xhigh に設定した Claude Fable 5 の評価上の最高スコア 69.9% と 1.1 ポイント差で、タスクあたりのコストは約 80% 低くなっています。
推論水準を max に設定した GPT‑6 Luna は 66.6% を記録し、推論水準を medium に設定した Claude Opus 5 および Fable 5 に匹敵します。これらの比較で、Luna のタスクあたりのコストは Opus 5 より 93%、Fable 5 より 96% 低くなっています。
DeepSWE 1.1(新しいウィンドウで開く) では、AI エージェントが独自の長期的なソフトウェアエンジニアリングタスクを解決します。
GPT‑6 Astra はコンピューター操作で引き続き世界最高のモデルですが、GPT‑6 Sol と Luna は前モデルよりコスト効率の高い性能を提供します。OSWorld 2.0 オフラインでは、推論水準を xhigh に設定した GPT‑6 Sol が、推論水準を medium に設定した Claude Opus 5 と同等のスコアを達成しました。60.5% 対 60.3% で、タスクあたりのコストは約 80% 低くなっています。GPT‑6 Luna(max)は、10 分の 1 のコストで GPT‑5.6 Sol(medium)を上回ります。
OSWorld 2.0(新しいウィンドウで開く) では、AI エージェントが日常および業務上のタスクにまたがる長期的なコンピューター操作ワークフローに取り組みます。v2026.08.08 リリースのオフラインセットにおける部分報酬を報告しています。
GPT‑6 Astra で改善したコミュニケーションスタイルを Sol と Luna にも導入しました。特に技術やコーディングに関する会話で違いを実感できると考えています。内容を損なわずに、より明快で専門用語や不自然な言い回し、価値の低い詳細が少なく、全体的にやや短い回答を提供します。
スタイルの評価は主観的ですが、ここでは GPT‑6 Sol の回答が優れていると考えます。結論を急がず、質問者にとって明白と思われる詳細(ウェブサイトが 4 ページあることなど)の繰り返しを抑え、曖昧な表現(「弁当のような印象」「そのシステムを軸に再構成」など)も少なくなっています。また、確認したことと確認していないことをより率直に示し、画像ツールに与えたプロンプトのような実装の詳細を不必要に共有していません。
トークン価格の引き下げに加え、GPT‑6 を利用する開発者がアプリケーションで再利用するコンテキストのコストも削減できるよう支援しています。GPT‑6 のプロンプトキャッシュを改善し、デフォルトのキャッシュヒット率を高めました。これにより、エージェントはより多くのコンテキストを再利用して応答を高速化でき、キャッシュ済み入力トークンの読み取りには 90% の割引が適用されます。
開発者がキャッシュ性能を測定し、最適化する方法も増えています。
監視と診断プロンプトキャッシュダッシュボード(新しいウィンドウで開く)では、キャッシュされた入力の量と、その経時変化を確認できます。診断ツール(新しいウィンドウで開く)では、キャッシュを活用できなかった原因と修正方法を確認できます。
キャッシュを維持したまま推論水準とツールの利用可否を調整難しいタスクでは推論水準(新しいウィンドウで開く)を上げ、簡単な追加タスクでは下げられます。また、エージェントのニーズに応じてツールを有効または無効にする(新しいウィンドウで開く)こともできます。どちらの設定でも、以前のコンテキストをキャッシュで再利用できるようになりました。
キャッシュするプレフィックスの最適化明示的なブレークポイントにより、キャッシュするプロンプトのプレフィックスをどこで区切るか選択できます。これにより、キャッシュの再利用を細かく制御し、性能を高められます。
GitHub によると、過去数か月間で、OpenAI モデルに対する数十億件のリクエストにおいて新たな処理が必要なプロンプトトークンの割合が、これらの改善によって 50% 以上減少し、Copilot の応答が高速化しました。
GPT‑6 Sol と Luna は、これまでで最も整合性の高いモデルである Astra で導入した取り組みを発展させています。整合性評価では、Sol と Luna のどちらも GPT‑5.6 の対応モデルより改善しており、コーディング作業に関する誤解を招く主張の割合も低下しています。
以下の評価は難しい状況を意図的に検証するもので、通常の利用における失敗率を測定するものではありません。結果の詳細は、System Card(新しいウィンドウで開く) をご覧ください。
GPT‑6 Sol と GPT‑6 Luna は本日より、すべての Plus、Pro、Business、Enterprise、Edu ユーザー向けに ChatGPT Work と Codex で利用できます。Free と Go のユーザーは、デスクトップアプリで GPT‑6 Luna を利用できます。これらのモデルは、Chat ではまだ利用できません。OpenAI API では、gpt-6-sol と gpt-6-luna として利用できます。
すべてのユーザーに安定したサービスを提供するため、これらのモデルは本日中に ChatGPT へ段階的に展開する予定です。ChatGPT Work または Codex に新しいモデルが表示されない場合は、時間をおいて再度お試しください。
GPT の評価は、研究環境または API を通じて実施しました。システムプロンプトや利用可能なツールなどが異なるため、本番環境の ChatGPT とは出力が多少異なる場合があります。競合モデルの評価には、一般公開されているレポートの結果を使用しました。Claude Fable 5.1 のスコアを入手できない場合は、Claude Fable 5 のスコアを掲載しています。


