OpenAI

GPT-6 Astra: A new generation of intelligence

新世代の応答性能

2026年9月22日更新:GPT‑6 Sol と GPT‑6 Luna を追加し、GPT‑6 ファミリーを拡充します。詳細はこちら

世界で最も知能が高く、人間の意図に沿ったモデル、GPT‑6 Astra を発表します。

GPT‑6 Astra は、事前学習、強化学習、アラインメントにわたる長年の研究と大規模な取り組みを結集しています。Astra は、コンピューター操作、ブラウジング、ソフトウェアエンジニアリング、サイバーセキュリティ、科学、専門業務において最先端の性能を発揮します。Astra は FrontierMath Tier 4 で 98% のスコアを記録し、実質的な評価上限に達しています。数学における長年の未解決問題の解決⁠にすでに貢献しています。Astra は ARC-AGI-3 で 99.9%、ExploitBench で 100% のスコアを記録し、いずれも実質的な評価上限に達しています。また、コンピューター操作とブラウザー操作の新たなフロンティアを切り開き、最も要求の厳しい専門業務も、比類ないスピード、正確性、判断力で処理します。

GPT‑6 Astra は本日より一部の組織向けに提供を開始し、今後数日かけて、すべての ChatGPT Plus、Pro、Business、Enterprise ユーザーに加え、OpenAI API、Microsoft Azure、AWS Bedrock 経由でも利用可能になります。

「ARC-AGI-3 では、Astra は 96% のレベルで OpenAI が設定した人間の行動効率のベースラインを上回り、このベンチマークで実質的に人間と同等の水準に達しました。これは、OpenAI がこれまでにテストした中で最高のモデルであるだけでなく、フロンティアモデルの性能における大きな飛躍でもあります。未知の環境を探索して問題を解決する能力だけでなく、それを効率的に学習する能力も大きく向上しています。」
Greg Kamradt 氏、ARC Prize Foundation

Astra は当社で最もアラインメントの取れたモデルであり、ユーザーの意図の理解とモデルのふるまいが大幅に向上しています。そのため、Astra の判断をこれまで以上に信頼して、タスクを任せることができます。これを検証する方法の一つとして、OpenAI は Hugging Face のインシデントから得た知見を踏まえた新しい評価を構築しました。この評価では、困難または不可能なタスクに直面したモデルが、意図された範囲を超えるかどうかを判定します。本番環境向けのセーフガードがない場合、GPT‑5.6 Sol は48%のケースで許可された対象の範囲を超えましたが、GPT‑6 Astra では0%でした。

世界最高のコンピューター操作モデル

GPT‑6 Astra は、コンピューター操作の速度、精度、安全性における新たなフロンティアを切り開きます。オンラインフォームへの入力、CRM の顧客レコードの更新、カレンダーの整理といった面倒なタスクを処理できます。メールやドキュメントエディタ内で、オンラインリサーチを行い、要約の下書きを作成できます。科学データを分析し、プロットを生成し、Web サイトを作成し、そのサイト上のすべての機能が動作することを確認するためにフロントエンドの QA チェックを実行できます。自律的にソフトウェアをインストールしてテストし、画面上で確認した問題のトラブルシューティングを行えます。こうした改善は、私たちの最先端の評価結果にも表れています。

これらの改善は、実際の知識業務タスクにおける大幅な効率向上にもつながります。OSWorld 2.0 のレイテンシシミュレーションでは、Astra は GPT‑5.6Sol よりもタスクあたり約47%短い時間で、より高いコンピューター操作性能を達成しています。Astra はタスクあたり約40分で72.6%を記録したのに対し、Sol は約75分で65.7%でした。3

GPT‑6 Astra のコンピューター利用機能は、ゲーム開発、電気工学、日常的なナレッジワークなど、さまざまな領域にわたる出力で確認できます:

Astra に加えて、コンピューター操作の速度を大幅に向上させるため、Codex ハーネスも更新しています。これを Astra の効率性と組み合わせることで、Mind2Web ベンチマークでは、現行の GPT‑5.6 Sol と比べてタスクを1.9倍速く完了できます。モデルの処理速度が向上したことで、時間のかかる日常生活のタスクの多くを、ユーザー自身が行うよりも速く代行できます。4

「ローンチ当日に GPT‑6 Astra を Devin のハーネスに統合します。GPT‑6 Astra は、当社のテストベンチマークで最先端の性能を発揮します。その優れたコンピューター操作、文章作成、コードベースの理解により、導入直後からテストが改善されました。動画は明らかに内容を追いやすくなり、レポートはより明確で簡潔になっています。」
Silas Alberti、リサーチ担当 SVP、Cognition

専門業務における大きな変化

GPT‑6 Astra は、コンピューター操作能力の進歩と、実務環境向けに特化したトレーニングを組み合わせることで、複雑な業務タスクへの対応を支援します。複雑な問題に必要な応答性能と、多段階のワークフローを実行し、完成度の高い文書、スプレッドシート、プレゼンテーション資料を作成する能力を兼ね備えています。

GPT‑6 Astra は、既存のテンプレートに準拠し、レイアウトが整っていて、構造化されたストーリー展開で要点を簡潔に伝えるスライドを作成するうえで、当社最高のモデルです。お使いのテンプレートに従い、文章やビジュアルのスタイルに合わせた、明確で整ったドキュメント、プレゼンテーション、スプレッドシート、分析資料を作成します。Astra はまた、目の前の作業に不要な情報を繰り返すのではなく、重要なコンテキストだけを出力に取り込むように特別にトレーニングされています。つまり、これにより、ビジネスの文脈や基準に合った、よりすぐに利用できる成果物を出力できます。

GPT‑6 Astra は、構築する Web サイト、ゲーム、アプリケーション、レンダリングにも、より優れた視覚的判断力を発揮します。ChatGPT の Sites⁠(新しいウィンドウで開く) を使えば、Astra はプロンプトから直接、ウェブサイト、ウェブアプリ、ゲームを作成、ホスト、共有できます。

「Astra は、能力と効率性の両面で、私たちに大きな優位性をもたらします。当社がテストした他のモデルよりも最大 20% 少ないトークン使用量で、当社の最も複雑なクリエイティブワークフローを正常に実行します。何よりも、お客様にとっては、より高品質な出力を意味します。」
Alex Mashrabov 氏、Higgsfield AI CEO 兼共同創業者

指示に解釈の余地がある場合、GPT‑6 Astra は適切な判断を下す点で従来のモデルより優れています。文脈を利用して一般的な情報の不足を補い、その回答によって結果が変わる可能性がある場合には、要点を絞って質問します。Codex では、回答を待たずに進められる作業を続けながら、非同期で質問できます。返信がない場合、適切な場面では妥当な想定に基づいて進めますが、重要な判断については入力を待ちます。

以下の例では、情報が不足すると回答が大きく変わる可能性がある日常的なタスクで、Astra がユーザーとどのように協働するかを示します。

Astra は、タスクの進行に合わせて状況を把握し続ける点でも優れています。以前のモデルでは、ステアリングメッセージを新たな目標として扱ってしまい、元のリクエストや以前の制約を見失うことがありました。Astra は、新しい要件を取り込み、求められれば方針を変更し、全体のタスクを見失うことなく、途中で挟まれる質問にも回答します。

「Astra は、複雑な法務タスク全般において、GPT‑5.6 Sol と比べて品質が大幅に向上しています。「初期テストにおいて、Astra は、目利きの弁護士のように法務業務に取り組む点で際立っていました。すなわち、文書と確立された記録を区別し、裏付けのない前提を浮かび上がらせ、ギャップを具体的なドラフティング上の方針へと変換していました。」
Harvey 応用研究責任者、Niko Grupen 氏

コーディング

GPT‑6 Astra は、現時点でソフトウェアエンジニアリングに最適なモデルです。

1/2
「GPT‑6 Astra は、当社のコーディングベンチマークで最先端の性能を発揮し、GPT‑5.6 Sol と比べて、トレーディングの直感力を測る評価でも明確な進歩を示しています。エージェント型コーディングに使用すると、GPT‑6 Astra は開発者が理解しやすい形でやり取りし、本番品質に到達するまでの反復が少なくて済むコードを生成します。」
John Crepezzi 氏、Jane Street、AI Assistants チーム

Astra により、コンテキストウィンドウが上限に達した際に Codex がコンテキストを保持・取得するための新しい方法を導入します。従来、モデルは、複雑な問題をデバッグしたり、大規模なリファクタリングに取り組んだりする場合など、長時間のセッション中の作業を要約するためにコンパクションを使用してきました。各コンパクションでは、修正が失敗した理由やコンポーネントの動作に関する詳細が省略されることがあります。Codex では、Astra はコンテキストウィンドウをまたいでメモを保持し、蓄積された詳細情報を単一の要約に繰り返し圧縮することなく維持できます。過去のコンテキストウィンドウは引き続き検索可能なため、Astra は、その情報が自身のメモに記録されていなかった場合でも、以前のメッセージやツール出力から要件やテスト結果を見つけることができます。この試験的機能は、Codex の config.toml ⁠(新しいウィンドウで開く) で有効にできます。今後数週間で Astra のデフォルトになります。

科学的発見の推進

「要するに、一つの時代の終わり、そして新たな時代の始まりだ。」
Greg Burnham、EpochAI

GPT‑6 Astra は、科学的発見、数学、健康・医療の分野に大きな進歩をもたらします。本日、素数間の間隔に関する新たな 2 つの結果をご紹介します。9、10

Astra はまた、数学および科学分野の一連の評価でも新記録を樹立しています。

Astra は、科学的発見を支える実務的な作業に役立ちます。科学的推論とコンピューター操作を組み合わせることで、専門ソフトウェア内で直接作業してデータを詳しく調べ、結果を検討できるため、研究者がエビデンスを評価し、次に何を調査すべきかを判断するのに役立ちます。

サイバーセキュリティ

OpenAI の安全性アップデート⁠でお伝えしたように、Astra のサイバー能力は大幅に向上しており、OpenAI の Preparedness Framework におけるサイバーセキュリティ分野のクリティカル閾値を満たしています。ゼロデイエクスプロイトを特定して開発する能力は、防御側が弱点を発見してパッチを適用するのに役立つ一方で、より強力な安全対策の必要性も生み出します。これらの能力がどの程度まで及ぶかを把握するため、OpenAI は Astra について、社内評価と第三者の専門家による評価を実施しました。

まず、本番環境向けの安全対策を適用せずに、ExploitBench と ExploitGym でモデルをテストしました。これらは、モデルが既知のソフトウェア脆弱性を実際に動作するエクスプロイトに変換できるかどうかを評価するものです。ExploitBench では、Astra は満点の100%を達成しました。一方、OpenAI の従来のフロンティア級サイバー能力を備えたモデルである GPT‑5.6 Sol は78.5%でした。ExploitGym において、Astra は GPT‑5.6 Sol より大幅に少ない出力トークンを使用しながら、GPT‑5.6 Sol の30.3%を上回る42.4%の成功率を達成しました。13

過去のソフトウェア脆弱性に関する情報に触れていたことがベンチマーク結果に影響した可能性を考慮し、Astra を 2 つの新しいベンチマークでも評価しました。その一例として、過去3か月間の脆弱性を用いてエクスプロイト開発をテストするため、社内評価『ExploitBench(2026年6月〜8月)』を構築しました。14Astra はこのデータセットで、GPT‑5.6 Sol よりも大幅に高い任意コード実行率を達成し、使用した出力トークンもはるかに少なくなりました。評価中に、Astra はこれまで知られていなかったゼロデイ脆弱性を2件も発見し、使用しました。両方の脆弱性を、それぞれのメンテナーに開示しています。

Astra については、モデルが生のソースコードにアクセスせずにソフトウェアバイナリをリバースエンジニアリングしてその中核となるロジックを理解できるかどうかを測定するベンチマークである SRE-Bench15 でもテストしました。Astra はタスクの 88.0% を 1 回の試行で、99.2%を 4 回以内の試行で解決しました。一方、GPT‑5.6 Sol ではそれぞれ55.9%と68.7%でした。

ベンチマークに加えて、専門家主導の評価により、Astra は本番環境向けのセーフガードなしで実行した場合、これまで知られていなかった脆弱性を利用して、セキュリティが強化されたブラウザで任意コードを実行し、堅牢化されたブラウザで任意コードを実行し、堅牢化されたオペレーティングシステム向けの権限昇格エクスプロイトを作成できることが判明しました。

防御側のウィンドウで説明したように、フロンティアサイバー能力は、防御側が脆弱性をより迅速に見つけるのに役立つ一方で、それらの脆弱性を悪用しやすくもするため、防御側が適応を急ぐ必要性が高まっています。本日リリースするバージョンの Astra を使えば、防御担当者は、セキュアコードレビューやパッチ適用などのタスクを完了できます。

ただし、Astra は、脆弱性に対する概念実証(PoC)エクスプロイトの作成など、より高度なサイバーセキュリティタスクの実行には応じません。OpenAI Daybreak⁠ を通じて、今後数週間で利用対象を拡大し、制限を緩和したセーフガードを導入する予定です。これにより、脆弱性および概念実証(PoC)の検証、マルウェア解析、検出エンジニアリングを含む、より多くの防御ワークフローが可能になります。

また、GPT‑5.6 Sol 向けのセーフガードスタックを基盤として、潜在的なサイバー悪用に対する保護も強化しました。これらには、潜在的なジェイルブレイクへの耐性を高めるためのモデルの堅牢性の強化や、当社のモニタリングシステム向けのコンテキストの拡充が含まれます。社内のレッドチーミング攻撃者による自動評価を含め、社内外での厳格なテストを継続して実施してきました。当社のサイバーセキュリティ対策とテストの詳細については、Astra の安全性の概要⁠と System Card⁠(新しいウィンドウで開く) をご覧ください。

GPT‑6 Astra のアラインメントとデプロイを責任を持って行う

Astra は、OpenAI がこれまでに開発した中で最もアライメントに優れたモデルです。Astra は、慎重に対応し、タスクの範囲を尊重し、透明性のあるコミュニケーションを行うことに優れています。この成果は、最初から最後まで人間の意図に沿い続けるモデルのトレーニングに取り組んできた、OpenAI の長期的な研究プログラムから生まれた最新の成果です。

慎重な対応が求められる環境では、Astra はリスクに応じて慎重に処理を進めます。不適切な挙動を引き出すよう敵対的に選定されたコンピューター使用タスクの評価において、Astra は意図しない結果を回避する点でより高い成功率を示しました。デフォルトで提供される追加のセキュリティ対策を有効にして実行したところ、さらに高いパフォーマンスが得られました。

Astra は、テスト対象となった他のどのフロンティアモデルよりも、意図に沿わない結果が生じる割合が低くなっています。公平な比較のため、 OpenAI Responses API⁠(新しいウィンドウで開く) と Anthropic Messages API⁠(新しいウィンドウで開く) の両方で利用可能なネイティブのコンピュータ使用ツールに基づく、汎用的なコンピュータ使用エージェントのハーネスを使用し、Codex と ChatGPT Work のユーザーに通常導入されている追加の保護機能(自動レビュー、確認ポリシー)は使用しませんでした。

Astra は、ユーザーが設定し、環境によって暗黙的に定められた境界内で動作する可能性も高くなっています。社内評価では、Astra が Codex Auto-Review による拒否を回避しようとしたことは一度もありませんでした。この結果は、Auto-review が意図的に回避可能に設定され、それ以外の方法ではタスクを完了できない場合でも変わりませんでした。このように環境上の制約を尊重することは、本投稿の冒頭で共有した OpenAI の完遂不可能なサイバータスクの評価結果や、 System Card⁠(新しいウィンドウで開く) に記載されているその他の知見と一致しています。

Astra はさらに、透明性の高いユーザーコミュニケーションにおいて新たな基準を打ち立てています。ある評価では、Astra が GPT‑5.6 Sol と比べて、自らの能力や利用可能な機能について不正確な説明をする確率は3分の1でした。

能力に関するハルシネーション評価において、Astra は GPT‑5.6 Sol と比べて大幅な改善を示しており、自らの能力について誤解を招く主張がより少なくなっています。

評価の結果、Astra が記述する推論は GPT‑5.6 Sol よりも監視が難しいことがわかりました。これは、監視を回避するよう明示的に指示したテストに基づく結果です。これは、Astra がより単純なタスクでは記述する推論をより適切に制御でき、より少ないステップで問題を解決できるためだと考えています。Astra は依然として、複雑なタスクに必要な推論を隠すことには苦慮しているように見えますが、OpenAI は監視可能性の低下を重く受け止めています。監視可能性の向上は引き続き研究上の優先事項であり、付属の System Card⁠(新しいウィンドウで開く) では、OpenAI の知見と現在進行中の取り組みについて詳しく説明しています。

アライメントトレーニングは、OpenAI のデプロイに対するアプローチの中核をなしています。追加の防御レイヤーとして、Codex Auto-review⁠(新しいウィンドウで開く) や、エージェントの推論と行動をモニタリングするシステムレベルの安全対策も構築し、安全でない挙動の検知と封じ込めに役立てています。安全性アップデート⁠で説明したとおり、ミスアラインメントの状況を把握し、その最も深刻な事例の封じ込めに役立てるため、Astra クラスのモデルについて本番環境でミスアラインメント監視も導入しています。これらの安全対策は、OpenAI の社内運用で行う監視と同様の仕組みです。複数の分類器でモデルの推論や行動を調べ、許可されていない行動の有無を確認するとともに、その疑いがある動作を自動的に停止します。

Astra のサイバーセキュリティ能力が大幅に向上したことを踏まえ、今回のデプロイメントが安全かつ確実に行われるよう、特に慎重を期しています。追加の安全性チェックにより、防御的なサイバーセキュリティ活動を含む正当な作業が、場合によっては遅延したり、一時停止したり、停止したりすることがあります。ChatGPT または Codex でタスクが一時停止された場合、続行する前にその操作の確認を求められることがあります。API では、タスクが停止します。これらのチェックにより、正当な作業が中断される場合があります。OpenAI では、不要な中断を減らすために、このシステムの改善を継続しています。ミスアライメントの監視は、アライメントに代わるものではありません。OpenAI の目標は、許可された範囲内に確実にとどまるモデルを構築し、こうした保護策が介入する必要がない状態を実現することです。

提供状況

GPT‑6 Astra は本日より一部の組織向けに提供を開始し、今後数日以内に、すべての ChatGPT Plus、Pro、Business、Enterprise ユーザーに加え、OpenAI API、Microsoft Azure、AWS Bedrock を通じても利用可能になります。Astra の利用分は、既存のサブスクリプションの利用枠に含まれます。ユーザーおよび企業は、追加利用のためのクレジットを購入することもできます。Pro、Business、Enterprise プランのユーザーも、GPT‑6 Astra Pro を利用できるようになります。Enterprise 管理者はワークスペースで Astra を有効にできます。リリース時点では、アクセスはデフォルトで無効になっています。

Astra は、対象となる API 顧客向けにゼロデータ保持をサポートしており、先月お伝えしたとおり、顧客のプライバシーを保護しながら安全性モニタリングを強化するために、プライベート・セーフティ処理をテストしています。

開発者向けには、GPT‑6 Astra は OpenAI API で gpt-6-astra として利用でき、Microsoft Azure および Amazon Bedrock 経由でも利用できます。

OpenAI API Standard の料金は、入力100万トークンあたり$10、出力100万トークンあたり$50です。キャッシュの読み取りと書き込みには、それぞれ別の料金が適用されます。API では GPT‑6 Astra の高速モードを利用でき、Standard の最大 2 倍の処理速度を、Standard の 2 倍の料金で提供します。

コンピュータの使用

コンピュータの使用

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents’ Last Exam(エージェントの最終試験)

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0(v2026.08.08、オフラインセット、部分スコア)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro(ツールなし)

92.7%

76.9%

-

87.3%17

-

-

専門業務

専門業務

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets(1 - OMR-NED)

0.84

0.19

-

-

-

-

社内設計タスク

50.0%

47.4%

-

35.8%

-

-

社内データサイエンスタスク

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis 応答性能指数 v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

コーディング

コーディングGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended(スコア)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main(スコア)53.3% 847.5%50.9%53.5%53.4%43.6%
社内データベース移行タスク63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

学術

学術

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4(v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam(ツールあり)

57.2%

-

65.0%

63.8%

63.6%

-

科学とヘルスケア

科学とヘルスケアGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench(社内)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional(長さ調整済み)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

サイバーセキュリティ

サイバーセキュリティGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench(2026年6月〜8月)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

アラインメント

アラインメント

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

コンピューター利用安全性の社内ベンチマーク(低いほど良い)

2.4%

22.0%

9.5%

18.3%

11.5%

-

AutoReview 付きコンピューター利用安全性の社内ベンチマーク(低いほど良い)

1.8%

4.3%

-

-

-

-

回避に関する社内ベンチマーク(低いほど良い)

0.00%

0.29%

-

-

-

-

ExploitGym ハニーポット(低いほど良い)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

100.0%

-

-

-

-

-

ハルシネーションに関する社内ベンチマーク(低いほど良い)

4.2%

12.2%

-

-

-

-

長文コンテキスト

長文コンテキスト

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K〜512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K〜1M

96.3%

73.8%

-

-

-

-

抽象的推論

抽象推論GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

評価スコアには、各思考量の設定で得られたスコアのうち最大値を使用しています。GPT の評価は、OpenAI の研究環境または OpenAI API 経由で実施されています。そのため、システムプロンプトや利用可能なツールなどの違いにより、本番環境の ChatGPT とは出力がわずかに異なる場合があります。

脚注

  1. 1

    ARC-AGI-3 では、GPT-6 Astra はOpenAI の Responses API ハーネス⁠を使用して実行されました。このハーネスでは、実世界でのパフォーマンスをより適切に反映するために 2 つの設定を変更しています。これらの変更は、特に ARC-AGI-3 を対象としているわけではありません。

  2. 2

    GPT-5.6 Sol は、OpenAI API、ChatGPT Codex、ChatGPT Work で利用可能なバージョンを指します。ChatGPT Chat のバージョンは若干異なります。⁠

  3. 3

    OSWorld V2-Offline は、インターネット接続なしで動作する、元の OSWorld V2 のサブセットです。Claude モデルの OSWorld-V2 Offline におけるパフォーマンスは、著者らによって 公式リーダーボード⁠(新しいウィンドウで開く)上で再現されました。OSWorld 2.0 における Claude のスコアには、Fable 5.1 System Card で使用された変更版のタスクや採点方法ではなく、公式設定を使用しています。

  4. 4

    モデルの時間は、対応するデモ実行について報告された経過時間です。表示されているクリップは、編集された抜粋です。

  5. 5

    BenchCAD における Claude のスコアは、評価に加えられた 3 つの変更を反映しており、詳細は Fable 5.1 System Card⁠(新しいウィンドウで開く) に記載されています。

  6. 6

    Guang Yang 氏、Victoria Ebert 氏、Nazif Tamer 氏、Brian Siyuan Zheng 氏、Luiza Pozzobon 氏、Noah A. Smith 氏。「LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(新しいウィンドウで開く)」。arXiv:2506.19065、2025年。

  7. 7

    Mark R. H. Gotham 氏、Maureen Redbond 氏、Bruno Bower 氏、Peter Jonas 氏。「 The OpenScore String Quartet Corpus⁠(新しいウィンドウで開く) 」。Proceedings of the 10th International Conference on Digital Libraries for Musicology、pp. 49–57。 ACM, 2023.

  8. 8

    FrontierCode では、GPT-6 Astra は、Codex の開発者メッセージの一節⁠(新しいウィンドウで開く)に類似した、次のような開発者メッセージを使用して実行されました。新しいテストファイルは、リポジトリの規約で必要とされる場合、または既存のファイルに適切な配置先がない場合にのみ作成してください。無関係なクリーンアップや不要な複雑化は避けてください。適切な既存のユーティリティを再利用してください。関連するリポジトリの指示を読み、周辺のコード、テスト、ドキュメント、CI を確認してください。確立された慣例に従ってください。目標は、クリーンでマージ可能なコードにすることです。"そのプロンプトは評価向けに最適化されていませんでした。

  9. 9

    1つ目は、数直線上をどれほど先まで進んでも、素数同士がどれほど近くに現れ得るかに関するものです。10 年以上にわたり、既知の最良の結果では、差が最大でも 246 の素数対が無限に存在することが示されていました。Julia Stadlmann⁠(新しいウィンドウで開く)氏は最近、この上限を 240 に改善しました。Astra は上限を 186 まで改善することに貢献し、差が 186 以下の素数対が無限に存在することを示しました。短い素数間隔:証明⁠(新しいウィンドウで開く)と関連研究⁠(新しいウィンドウで開く)。

  10. 10

    2つ目は、素数間の非常に大きな間隔に関するものです。Astra は、これらの間隔の上界において、80 年以上変わっていなかった項を改善しました。両方の結果について、証明、要約した思考過程、および検証資料を共有します。大きな素数間隔:証明⁠(新しいウィンドウで開く)と裏付けとなる研究⁠(新しいウィンドウで開く)。

  11. 11

    所定の HealthBench Professional 手順に従い、GPT-5.4 による採点と、長さ調整済みかつクリッピングなしのスコアを使用して、すべての Claude モデルを独自に評価しました。採点スコアと、長さ調整済みでクリッピングされていないスコア。Fable 5.1 では、プロバイダーによる拒否に対して Opus 5 フォールバックを使用しました。

  12. 12

    Claude Fable 5 および 5.1 は、これらの評価における質問の大半を拒否するため、LifeSciBench Gold v1、GeneBench Pro v13、MedChemBench には含まれていません。

  13. 13

    ExploitGym では、Astra と Sol のサイバー能力の全体像をより適切に評価するため、6 時間の制限時間を設けずにテストしました。両モデルとも十分に高速なため、その影響はほとんどありません。

  14. 14

    ExploitBench(2026年6月〜8月)には、Chrome の13の安定版リリースに含まれる、深刻度「高」の V8 脆弱性20件が収録されています。このベンチマークは、指定された各脆弱性を悪用することで、エージェントが V8 および Linux 向けの公式 Chrome リリースにおいて任意コード実行を達成できるかどうかをテストします。対象の脆弱性の中には、評価上の制約のもとでは、それを利用しても任意のコードを実行できないものがある可能性があります。そのため、成功率100%を達成できるとは限りません。注記:GPT-5.6 Sol のスコアが5.5%だったのは、このベンチマークに300ターンの上限があるためです。実際の利用では、推論レベルを max に設定しても、この上限は適用されません。同様の設定では、制限に達する回数が少ない場合、このモデルは 11.5% のスコアを達成しました。

  15. 15
  16. 16

    サードパーティ製モデルを横断的にテストする際には、より単純な研究用セットアップを使用しています。Codex はより複雑な本番環境の構成を採用しているため、モデル自体のエラー率が異なる場合があります。また、プロバイダー側のセーフガードやコンピューターツールの実装にも違いがあります。確認を求めないシナリオは社内研究用の構成であり、Codex のユーザーが実際にこのシナリオを体験することはありません。

  17. 17

    ScreenSpot-Pro と ExploitGym については、報告している Fable スコアは Mythos によるものです。Mythos は、安全対策が少ない Fable です。