跳至主要內容
OpenAI

2026年10月6日

研究發表

攜手 Ironclad 提升電腦操作能力

合約領域的研究合作,如何協助我們針對複雜專業工作訓練與評估 AI 智慧體。

載入中…

我們推出 GPT‑6 Astra 時,展示了模型在使用電腦處理專業工作方面的長足進展,涵蓋從準備文件到測試網站等任務。我們的下一個目標,是提升智慧體使用專業軟體解決複雜業務問題的能力與效率。我們正在探索如何訓練模型,使其理解公司的業務規則、執行多步驟工作流程,並驗證工作成果是否符合原始要求。

為加速這項研究,我們正與少數最了解這些工作流程的軟體公司直接合作。我們共同找出具挑戰性且價值高的任務,將其轉化為研究問題,用來訓練與評估模型,最終提升模型在實際業務應用中的能力與實用性。

我們的第一個合作夥伴是 AI 合約管理領域的領導者 Ironclad。透過與 Ironclad 團隊密切合作,我們設計了需要智慧體設定協議、核准流程及可重複使用法律條款的任務,並展示了模型在這些複雜工作流程上的進展。Ironclad 的專業知識對於訂定成功標準,以及將真實客戶需求直接帶入前沿模型開發,發揮了關鍵作用。我們感謝 Ironclad 的合作,也很高興能分享雙方共同取得的成果。

GPT‑6 Astra 是我們首個以 Ironclad 任務訓練的前沿模型。在我們的研究評估中,它的平均分數比 GPT‑5.6 Sol 高出 32%,而每次嘗試的估計耗時則減少了 48%。1

將合約工作流程轉化為訓練任務

以法務營運團隊建立軟體採購流程為例。超過一定金額的採購可能需要財務部門核准,某些申請可能需要資安部門審查,而非標準條款則可能需要法務部門審閱。負責建立流程的人員必須將這幾項簡短要求轉化為申請表單、文件範本、核准規則,以及最終協議的紀錄。

執行相同工作的 AI 智慧體,在軟體中操作的整個過程裡,都必須持續掌握這些要求。例如,它必須設定超過支出門檻時需由財務部門核准,並檢查高於和低於門檻的申請是否都依循正確流程。僅僅把個別步驟做對還不夠:建置完成的流程,必須能妥善處理設計時預期涵蓋的各種情況。

Ironclad 員工以及 OpenAI 內部使用 Ironclad 的人員,協助我們的研究人員找出了涵蓋法務、商務及採購工作的 11 項任務。這些任務包括設定保密協議、建立採購核准流程,以及更新可重複使用的法律條款,使其符合申請人選擇的司法管轄區。我們估計,有經驗的使用者完成這些工作,平均每項任務約需 30 至 40 分鐘。

我們依據各項任務的複雜程度,使用 8 至 50 項標準進行評估。這讓我們能看出模型哪些部分做對了,哪些地方仍有不足。Ironclad 也提供了由其託管的產品軟體環境,讓模型能在其中練習這些任務。我們的研究人員圍繞具代表性的工作流程,開發了合成訓練任務2,並運用強化學習,協助模型透過練習與回饋持續改進。結合與熟悉工作的人員共同挑選的任務、詳細的評估標準,以及可供模型練習的環境,能確保我們改善的是對客戶最重要的實務任務表現。

Astra 的表現

我們比較了 Astra 與 GPT‑5.6 Sol,分別將 Astra 的推理強度設為「Max」、Sol 設為「高」;這是各自模型得分最高的設定。在 11 項研究任務中,Astra 的平均分數為 55.0%,GPT‑5.6 Sol 則為 41.6%;每次嘗試的估計平均耗時,也從 Sol 的 37.0 分鐘降至 Astra 的 19.2 分鐘。3 Astra 開發過程中使用的一個內部模型,在這些任務上更取得了 63.7% 的成績,我們希望將這些進一步的成果帶入未來的模型。

指標

GPT‑5.6 Sol
推理強度:高

GPT‑6 Astra
推理強度:Max

評分規準平均得分

41.6%

55.0%

每次嘗試的估計平均耗時

37.0 分鐘

19.2 分鐘

Astra 每次嘗試的模擬耗時更短,卻達成了更多任務要求。下方兩段影片展示了這兩個模型如何處理相同的研究任務。Astra(第一段)在估計 20 分鐘內達成約 94% 的任務評估標準;GPT‑5.6 Sol(第二段)則在估計 32 分鐘內達成約 85%。

GPT‑6 Astra 在估計 20 分鐘內達成約 94% 的任務評估標準。

GPT‑5.6 Sol 在估計 32 分鐘內達成約 85% 的任務評估標準。

這項合作對 Ironclad 的意義

Ironclad 在這項研究中扮演的角色,反映了其客戶熟知的一項挑戰:合約流程必須能處理例外情況,同時維持企業賴以運作的規則。如果智慧體在執行任務的過程中遺漏了其中一項規則,軟體公司能放心交付給它的工作就會受到限制。這也凸顯出,即使智慧體越來越擅長處理複雜的合約任務,人工監督依然重要,完整的合約平台也仍不可或缺。透過與我們的研究人員合作,Ironclad 能將這些問題帶入底層模型的開發過程,讓雙方共同研究。

隨著模型能力提升,Ironclad 有機會將模型運用到更多自家產品中。對法務與業務團隊而言,這可能意味著 AI 能分擔更多複雜合約作業中的工作,同時維持這些團隊仰賴的管控機制。

“AI 要在複雜的合約作業中真正發揮作用,就不能只是完成個別操作。智慧體需要了解完整的合約生命週期,包括業務工作流程如何相互銜接,同時維持團隊仰賴的管控機制。我們與 OpenAI 的合作,將這些實務挑戰帶入研究過程,協助推動技術進步。”
—Sunita Verma,Ironclad 技術長

與我們合作,提升 AI 處理複雜專業工作的能力

我們正邀請少數軟體公司,針對當前智慧體仍無法可靠完成的重要專業任務,直接與我們的研究及工程團隊合作。如果您的團隊有這類任務,我們希望看到一個具體案例:您要求智慧體做什麼、有哪些證據顯示它在哪裡失敗,以及您會如何判定結果是否成功。合作夥伴也應能安排深入了解該工作的人員參與,並提供安全的測試環境,以及可安全用於研究的資料。這些條件能讓我們著手研究失敗原因,並衡量模型是否有所改進。

如果您的團隊符合上述條件,歡迎 提出申請,探索研究合作的機會。

作者

OpenAI

註腳

  1. 1

    這些結果涵蓋的是 11 項研究任務,而非所有 Ironclad 工作流程。所列時間是根據假設的模型處理與生成速度所做的模擬估計,並非實際測得的客戶時間節省量。

  2. 2

    我們先使用旨在移除個人資訊的篩選機制,處理美國證券交易委員會(SEC)EDGAR 資料庫中公開可取得的合約,再以這些合約建立模擬任務。我們並未使用 OpenAI 客戶資料、OpenAI 內部合約,或未公開的 Ironclad 客戶資料或合約來進行訓練或評估。

  3. 3

    請參閱上方關於研究評估的註腳。