GPT‑6 Astra の発表時には、文書の作成からウェブサイトのテストまで、コンピューターを使って専門業務を行うモデルの能力がどれほど進歩したかをお示ししました。次の目標は、専用ソフトウェアを使って複雑なビジネス課題を解決するエージェントの能力と効率を高めることです。私たちは、企業の業務ルールを理解し、複数のステップからなるワークフローを実行し、その成果が当初の要件を満たしているか確認できるよう、モデルを学習させる方法を探っています。
この研究を加速するため、こうしたワークフローを最もよく理解している少数のソフトウェア企業と直接提携しています。各社とともに、難易度が高く価値の大きいタスクを特定し、モデルの学習と評価に使う研究課題へと落とし込んでいます。最終的には、実際の業務でより高い能力を発揮し、役立つモデルを目指しています。
最初のパートナーは、AI を活用した契約業務をリードする Ironclad です。Ironclad のチームと緊密に連携し、エージェントが契約書、承認、再利用可能な法的条項を設定するタスクを開発しました。そして、こうした複雑なワークフローでの進歩を示しました。Ironclad の専門知識は、成功の基準を定め、実際の顧客ニーズをフロンティアモデルの開発に直接取り込むうえで、大きな役割を果たしてきました。同社の協力に感謝するとともに、共同で達成した成果を皆さまにお伝えできることをうれしく思います。
GPT‑6 Astra は、Ironclad のタスクで学習した OpenAI 初のフロンティアモデルです。私たちの研究評価では、平均スコアが GPT‑5.6 Sol より 32% 高く、1 回の試行あたりの推定所要時間は 48% 短くなりました。1
法務オペレーションチームが、ソフトウェアを購入するためのプロセスを整備する場面を考えてみましょう。一定額を超える購入には財務部門の承認が、特定の申請にはセキュリティ部門の審査が、標準外の条項には法務部門の確認が必要になるかもしれません。プロセスを整備する担当者は、この短い要件リストを、申請フォーム、文書テンプレート、承認ルール、最終的な契約の記録へと具体化する必要があります。
同じ仕事を行う AI エージェントも、ソフトウェア上で作業を進める間、これらの要件を常に踏まえなければなりません。たとえば、支出額が基準を超える場合に財務部門の承認を求める設定を行い、基準を超える申請と超えない申請がそれぞれ正しい経路をたどることを確認する必要があります。個々のステップが正しいだけでは不十分です。完成したプロセスが、対応を想定したさまざまな状況で機能しなければなりません。
Ironclad の従業員と OpenAI 社内の Ironclad 利用者の協力を得て、研究者たちは法務、商取引、調達の各業務から 11 件のタスクを特定しました。これには、秘密保持契約の設定、調達の承認プロセスの作成、申請者が選んだ法域を反映するための再利用可能な法的条項の更新などが含まれます。経験豊富なユーザーでも、これらの作業には 1 タスクあたり平均で約 30~40 分かかると推定しています。
各タスクは、その複雑さに応じて 8~50 項目の基準で評価しました。これにより、モデルがどの部分を正しく実行でき、どこに不足があったかを把握できました。Ironclad はまた、モデルがこれらのタスクを練習できるよう、自社製品のホスト環境を提供しました。研究者たちは、代表的なワークフローをもとに合成学習タスク2を開発し、強化学習を用いて、モデルが練習とフィードバックを通じて能力を高められるようにしました。業務に精通した人々と選んだタスク、詳細な評価基準、モデルが練習できる環境。この組み合わせにより、顧客にとって最も重要な実務タスクでの能力向上を確実に進めています。
Astra と GPT‑5.6 Sol の比較では、それぞれが最も高いスコアを記録した設定を使用しました。推論の設定は、Astra が「マックス」、Sol が「高」です。11 件の研究用タスク全体で、平均スコアは GPT‑5.6 Sol の 41.6% に対し、Astra は 55.0% でした。また、1 回の試行あたりの推定平均所要時間は、Sol の 37.0 分から Astra の 19.2 分へと短縮されました。3 Astra の開発で使用した社内モデルは、これらのタスクでさらに高い 63.7% を達成しました。このさらなる改善を今後のモデルに反映することを目指しています。
指標 | GPT‑5.6 Sol | GPT‑6 Astra |
評価基準に基づく平均スコア | 41.6% | 55.0% |
1 回の試行あたりの推定平均所要時間 | 37.0 分 | 19.2 分 |
Astra は、シミュレーション上の 1 回の試行あたりの所要時間を短縮しながら、より多くのタスク要件を満たしました。以下の 2 本の動画では、両モデルが同じ研究用タスクに取り組む様子をご覧いただけます。Astra(1 本目)は推定 20 分でタスクの評価基準の約 94% を満たし、GPT‑5.6 Sol(2 本目)は推定 32 分で約 85% を満たしました。
GPT‑6 Astra は推定 20 分でタスクの評価基準の約 94% を満たしました。
GPT‑5.6 Sol は推定 32 分でタスクの評価基準の約 85% を満たしました。
この取り組みにおける Ironclad の役割には、同社の顧客にとってなじみ深い課題が反映されています。契約プロセスでは、事業の基盤となるルールを守りながら、例外にも対応する必要があるという課題です。エージェントがタスクの途中でこうしたルールのどれかを見失うと、ソフトウェア企業が安心して任せられる仕事の範囲は限られます。だからこそ、エージェントが複雑な契約タスクをこなす能力を高めても、人間による監督は依然として重要であり、契約業務全体を支えるプラットフォームも不可欠なのです。OpenAI の研究者との協業により、Ironclad はこうした課題を基盤となるモデルの開発に持ち込み、私たちと共同で検討できます。
モデルの能力が向上するにつれ、Ironclad には自社のより多くの製品でモデルを活用する機会が生まれます。法務チームや事業部門にとっては、業務に欠かせない管理の仕組みを維持しながら、複雑な契約業務にかかる作業を AI により多く任せられるようになる可能性があります。
私たちは、現在のエージェントではまだ確実に完了できない重要な専門業務について、研究・エンジニアリングチームと直接取り組む少数のソフトウェア企業を募集しています。皆さまのチームにそうした業務があれば、具体例をお寄せください。エージェントに何を依頼しているのか、どこで失敗するのかを示す証拠、そして成功をどのように判断するのかをお聞かせください。また、パートナーには、業務に精通した人材、安全なテスト環境、研究に安全に使用できるデータを提供できることを求めています。これらを出発点として、失敗の原因を調べ、モデルが改善したかどうかを測定します。
これらの条件に当てはまるチームの皆さまは、 研究協業の検討にぜひご応募ください。


