跳到主要內容
OpenAI

2026年10月6日

刊物

與 Ironclad 攜手提升電腦操作能力

合約領域的研究合作,如何協助我們訓練及評估 AI 智能代理處理複雜專業工作的能力。

正在載入...

我們推出 GPT‑6 Astra 時,展示了模型在使用電腦處理專業工作方面的進展,從準備文件到測試網站皆有涵蓋。我們的下一個目標,是提升智能代理運用專業軟件解決複雜業務問題的能力和效率。我們正探索如何訓練模型,讓它們理解公司的業務規則、執行多步驟工作流程,並核實工作成果是否符合最初的要求。

為加快這項研究,我們正與少數最了解這些工作流程的軟件公司直接合作。我們共同找出具挑戰性且價值高的任務,將其轉化為研究課題,用以訓練及評估模型,最終提升模型在實際業務應用中的能力和實用性。

我們的首個合作夥伴是 AI 合約管理領域的領先企業 Ironclad。透過與 Ironclad 團隊緊密合作,我們設計了要求智能代理設定協議、審批流程及可重用法律條款的任務,並展示了模型在處理這些複雜工作流程方面的進展。Ironclad 的專業知識對界定成功標準,以及將客戶的實際需求直接融入前沿模型開發,發揮了關鍵作用。我們感謝 Ironclad 的合作,並很高興與大家分享雙方共同取得的成果。

GPT‑6 Astra 是我們首個以 Ironclad 任務訓練的前沿模型。在我們的研究評估中,其平均得分比 GPT‑5.6 Sol 高 32%,而每次嘗試的估計用時則減少了 48%。1

將合約工作流程轉化為訓練任務

以法律營運團隊建立軟件採購流程為例。超過某個金額的採購可能需要財務部審批,部分申請可能需要安全團隊審查,而非標準條款則可能需要法律部審閱。負責建立流程的人員,必須將這份簡短的要求清單落實為申請表格、文件範本、審批規則,以及最終協議的記錄。

AI 智能代理執行同樣的工作時,必須在操作軟件的整個過程中始終顧及這些要求。例如,它必須設定超過開支門檻的申請需經財務部審批,並檢查高於及低於門檻的申請是否都按正確流程處理。單是做好個別步驟並不足夠:完成設定的流程必須能應對設計時所涵蓋的各種情況。

Ironclad 員工及 OpenAI 內使用 Ironclad 的人員,協助我們的研究人員找出了 11 項涵蓋法律、商務及採購工作的任務。這些任務包括設定保密協議、建立採購審批流程,以及更新可重用的法律條款,使其符合申請人選擇的司法管轄區。我們估計,經驗豐富的使用者完成這些工作,平均每項任務需時約 30 至 40 分鐘。

我們按每項任務的複雜程度,以 8 至 50 項標準進行評估。這讓我們看清模型在哪些部分做對了,又在哪些方面有所不足。Ironclad 亦提供了其產品的託管軟件環境,讓模型練習這些任務。我們的研究人員圍繞具代表性的工作流程設計合成訓練任務2,並運用強化學習,幫助模型透過練習及回饋持續改進。與熟悉工作的人員共同挑選任務、制定詳細標準,再提供模型練習的環境——三者結合,確保我們能提升模型處理客戶最重視的實際任務的能力。

Astra 的表現

我們比較了 Astra 與 GPT‑5.6 Sol,分別使用 Astra 的「Max」推理設定及 Sol 的「高」推理設定,這是兩個模型各自取得最高分的設定。在 11 項研究任務中,Astra 的平均得分為 55.0%,GPT‑5.6 Sol 則為 41.6%;每次嘗試的估計平均用時,亦由 Sol 的 37.0 分鐘降至 Astra 的 19.2 分鐘。3 Astra 開發過程中使用的一個內部模型,在這些任務中取得更高的 63.7% 得分,我們希望將這些進一步的提升帶到未來的模型中。

指標

GPT‑5.6 Sol
推理設定:高

GPT‑6 Astra
推理設定:Max

評核標準平均得分

41.6%

55.0%

每次嘗試的估計平均用時

37.0 分鐘

19.2 分鐘

Astra 每次嘗試的模擬用時更短,卻能滿足更多任務要求。以下兩段影片展示了兩個模型如何處理同一項研究任務。Astra(第一段)估計用時 20 分鐘,達到約 94% 的任務評核標準;GPT‑5.6 Sol(第二段)估計用時 32 分鐘,達到約 85% 的標準。

GPT‑6 Astra 估計用時 20 分鐘,達到約 94% 的任務評核標準。

GPT‑5.6 Sol 估計用時 32 分鐘,達到約 85% 的任務評核標準。

這次合作對 Ironclad 的意義

Ironclad 在這項研究中擔當的角色,反映了其客戶熟悉的一項挑戰:合約流程必須能處理例外情況,同時遵守企業賴以運作的規則。如果智能代理在執行任務期間忽略了其中一項規則,軟件公司便無法放心地將更多工作交給它。這也說明,即使智能代理越來越擅長處理複雜的合約任務,人類監督仍然重要,而完整的合約管理平台依然不可或缺。透過與我們的研究人員合作,Ironclad 能將這些問題帶入底層模型的開發過程,讓雙方共同研究。

隨着模型能力提升,Ironclad 有機會將模型應用於更多自家產品。對法律及業務團隊而言,這可能意味着 AI 能分擔更多複雜的合約工作,同時保留團隊所依賴的管控機制。

“AI 要在複雜的合約工作中真正發揮作用,就不能只會完成個別操作。智能代理需要了解合約的整個生命週期,包括業務流程之間如何銜接,同時保留團隊所依賴的管控機制。我們與 OpenAI 的合作將這些實際挑戰帶入研究過程,有助推動技術進步。”
—Sunita Verma,Ironclad 技術總監

與我們攜手推動 AI 處理複雜專業工作的能力

我們正邀請少數軟件公司,直接與我們的研究及工程團隊合作,研究目前智能代理仍未能可靠完成的重要專業任務。如果你的團隊有這類任務,我們希望看到一個具體例子:你要求智能代理做甚麼、有哪些證據顯示它在哪裏出錯,以及你會如何判斷結果是否成功。合作夥伴亦應能安排深入了解相關工作的人員參與,並提供安全的測試環境,以及可安全用於研究的數據。這些條件讓我們有據可循,着手調查失敗原因,並衡量模型是否有所改善。

如果你的團隊符合上述條件,歡迎 申請探索研究合作機會。

作者

OpenAI

註腳

  1. 1

    這些結果涵蓋 11 項研究任務,並非所有 Ironclad 工作流程。所列時間是根據假設的模型處理及生成速度作出的模擬估算,並非實際量度的客戶節省時間。

  2. 2

    我們以美國證券交易委員會 (SEC) EDGAR 資料庫中公開的合約為基礎,先透過篩選程序移除個人資料,再建立模擬任務。我們並未使用 OpenAI 客戶數據、OpenAI 內部合約,或 Ironclad 未公開的客戶數據或合約作訓練或評估。

  3. 3

    請參閱上方有關研究評估的註腳。