我們推出 GPT‑6 Astra 時,展示了模型在使用電腦處理專業工作方面的長足進展,涵蓋從準備文件到測試網站等任務。我們的下一個目標,是提升智慧體使用專業軟體解決複雜業務問題的能力與效率。我們正在探索如何訓練模型,使其理解公司的業務規則、執行多步驟工作流程,並驗證工作成果是否符合原始要求。
為加速這項研究,我們正與少數最了解這些工作流程的軟體公司直接合作。我們共同找出具挑戰性且價值高的任務,將其轉化為研究問題,用來訓練與評估模型,最終提升模型在實際業務應用中的能力與實用性。
我們的第一個合作夥伴是 AI 合約管理領域的領導者 Ironclad。透過與 Ironclad 團隊密切合作,我們設計了需要智慧體設定協議、核准流程及可重複使用法律條款的任務,並展示了模型在這些複雜工作流程上的進展。Ironclad 的專業知識對於訂定成功標準,以及將真實客戶需求直接帶入前沿模型開發,發揮了關鍵作用。我們感謝 Ironclad 的合作,也很高興能分享雙方共同取得的成果。
GPT‑6 Astra 是我們首個以 Ironclad 任務訓練的前沿模型。在我們的研究評估中,它的平均分數比 GPT‑5.6 Sol 高出 32%,而每次嘗試的估計耗時則減少了 48%。1
以法務營運團隊建立軟體採購流程為例。超過一定金額的採購可能需要財務部門核准,某些申請可能需要資安部門審查,而非標準條款則可能需要法務部門審閱。負責建立流程的人員必須將這幾項簡短要求轉化為申請表單、文件範本、核准規則,以及最終協議的紀錄。
執行相同工作的 AI 智慧體,在軟體中操作的整個過程裡,都必須持續掌握這些要求。例如,它必須設定超過支出門檻時需由財務部門核准,並檢查高於和低於門檻的申請是否都依循正確流程。僅僅把個別步驟做對還不夠:建置完成的流程,必須能妥善處理設計時預期涵蓋的各種情況。
Ironclad 員工以及 OpenAI 內部使用 Ironclad 的人員,協助我們的研究人員找出了涵蓋法務、商務及採購工作的 11 項任務。這些任務包括設定保密協議、建立採購核准流程,以及更新可重複使用的法律條款,使其符合申請人選擇的司法管轄區。我們估計,有經驗的使用者完成這些工作,平均每項任務約需 30 至 40 分鐘。
我們依據各項任務的複雜程度,使用 8 至 50 項標準進行評估。這讓我們能看出模型哪些部分做對了,哪些地方仍有不足。Ironclad 也提供了由其託管的產品軟體環境,讓模型能在其中練習這些任務。我們的研究人員圍繞具代表性的工作流程,開發了合成訓練任務2,並運用強化學習,協助模型透過練習與回饋持續改進。結合與熟悉工作的人員共同挑選的任務、詳細的評估標準,以及可供模型練習的環境,能確保我們改善的是對客戶最重要的實務任務表現。
我們比較了 Astra 與 GPT‑5.6 Sol,分別將 Astra 的推理強度設為「Max」、Sol 設為「高」;這是各自模型得分最高的設定。在 11 項研究任務中,Astra 的平均分數為 55.0%,GPT‑5.6 Sol 則為 41.6%;每次嘗試的估計平均耗時,也從 Sol 的 37.0 分鐘降至 Astra 的 19.2 分鐘。3 Astra 開發過程中使用的一個內部模型,在這些任務上更取得了 63.7% 的成績,我們希望將這些進一步的成果帶入未來的模型。
指標 | GPT‑5.6 Sol | GPT‑6 Astra |
評分規準平均得分 | 41.6% | 55.0% |
每次嘗試的估計平均耗時 | 37.0 分鐘 | 19.2 分鐘 |
Astra 每次嘗試的模擬耗時更短,卻達成了更多任務要求。下方兩段影片展示了這兩個模型如何處理相同的研究任務。Astra(第一段)在估計 20 分鐘內達成約 94% 的任務評估標準;GPT‑5.6 Sol(第二段)則在估計 32 分鐘內達成約 85%。
GPT‑6 Astra 在估計 20 分鐘內達成約 94% 的任務評估標準。
GPT‑5.6 Sol 在估計 32 分鐘內達成約 85% 的任務評估標準。
Ironclad 在這項研究中扮演的角色,反映了其客戶熟知的一項挑戰:合約流程必須能處理例外情況,同時維持企業賴以運作的規則。如果智慧體在執行任務的過程中遺漏了其中一項規則,軟體公司能放心交付給它的工作就會受到限制。這也凸顯出,即使智慧體越來越擅長處理複雜的合約任務,人工監督依然重要,完整的合約平台也仍不可或缺。透過與我們的研究人員合作,Ironclad 能將這些問題帶入底層模型的開發過程,讓雙方共同研究。
隨著模型能力提升,Ironclad 有機會將模型運用到更多自家產品中。對法務與業務團隊而言,這可能意味著 AI 能分擔更多複雜合約作業中的工作,同時維持這些團隊仰賴的管控機制。
我們正邀請少數軟體公司,針對當前智慧體仍無法可靠完成的重要專業任務,直接與我們的研究及工程團隊合作。如果您的團隊有這類任務,我們希望看到一個具體案例:您要求智慧體做什麼、有哪些證據顯示它在哪裡失敗,以及您會如何判定結果是否成功。合作夥伴也應能安排深入了解該工作的人員參與,並提供安全的測試環境,以及可安全用於研究的資料。這些條件能讓我們著手研究失敗原因,並衡量模型是否有所改進。
如果您的團隊符合上述條件,歡迎 提出申請,探索研究合作的機會。


