我們推出 GPT‑6 Astra 時,展示了模型在使用電腦處理專業工作方面的進展,從準備文件到測試網站皆有涵蓋。我們的下一個目標,是提升智能代理運用專業軟件解決複雜業務問題的能力和效率。我們正探索如何訓練模型,讓它們理解公司的業務規則、執行多步驟工作流程,並核實工作成果是否符合最初的要求。
為加快這項研究,我們正與少數最了解這些工作流程的軟件公司直接合作。我們共同找出具挑戰性且價值高的任務,將其轉化為研究課題,用以訓練及評估模型,最終提升模型在實際業務應用中的能力和實用性。
我們的首個合作夥伴是 AI 合約管理領域的領先企業 Ironclad。透過與 Ironclad 團隊緊密合作,我們設計了要求智能代理設定協議、審批流程及可重用法律條款的任務,並展示了模型在處理這些複雜工作流程方面的進展。Ironclad 的專業知識對界定成功標準,以及將客戶的實際需求直接融入前沿模型開發,發揮了關鍵作用。我們感謝 Ironclad 的合作,並很高興與大家分享雙方共同取得的成果。
GPT‑6 Astra 是我們首個以 Ironclad 任務訓練的前沿模型。在我們的研究評估中,其平均得分比 GPT‑5.6 Sol 高 32%,而每次嘗試的估計用時則減少了 48%。1
以法律營運團隊建立軟件採購流程為例。超過某個金額的採購可能需要財務部審批,部分申請可能需要安全團隊審查,而非標準條款則可能需要法律部審閱。負責建立流程的人員,必須將這份簡短的要求清單落實為申請表格、文件範本、審批規則,以及最終協議的記錄。
AI 智能代理執行同樣的工作時,必須在操作軟件的整個過程中始終顧及這些要求。例如,它必須設定超過開支門檻的申請需經財務部審批,並檢查高於及低於門檻的申請是否都按正確流程處理。單是做好個別步驟並不足夠:完成設定的流程必須能應對設計時所涵蓋的各種情況。
Ironclad 員工及 OpenAI 內使用 Ironclad 的人員,協助我們的研究人員找出了 11 項涵蓋法律、商務及採購工作的任務。這些任務包括設定保密協議、建立採購審批流程,以及更新可重用的法律條款,使其符合申請人選擇的司法管轄區。我們估計,經驗豐富的使用者完成這些工作,平均每項任務需時約 30 至 40 分鐘。
我們按每項任務的複雜程度,以 8 至 50 項標準進行評估。這讓我們看清模型在哪些部分做對了,又在哪些方面有所不足。Ironclad 亦提供了其產品的託管軟件環境,讓模型練習這些任務。我們的研究人員圍繞具代表性的工作流程設計合成訓練任務2,並運用強化學習,幫助模型透過練習及回饋持續改進。與熟悉工作的人員共同挑選任務、制定詳細標準,再提供模型練習的環境——三者結合,確保我們能提升模型處理客戶最重視的實際任務的能力。
我們比較了 Astra 與 GPT‑5.6 Sol,分別使用 Astra 的「Max」推理設定及 Sol 的「高」推理設定,這是兩個模型各自取得最高分的設定。在 11 項研究任務中,Astra 的平均得分為 55.0%,GPT‑5.6 Sol 則為 41.6%;每次嘗試的估計平均用時,亦由 Sol 的 37.0 分鐘降至 Astra 的 19.2 分鐘。3 Astra 開發過程中使用的一個內部模型,在這些任務中取得更高的 63.7% 得分,我們希望將這些進一步的提升帶到未來的模型中。
指標 | GPT‑5.6 Sol | GPT‑6 Astra |
評核標準平均得分 | 41.6% | 55.0% |
每次嘗試的估計平均用時 | 37.0 分鐘 | 19.2 分鐘 |
Astra 每次嘗試的模擬用時更短,卻能滿足更多任務要求。以下兩段影片展示了兩個模型如何處理同一項研究任務。Astra(第一段)估計用時 20 分鐘,達到約 94% 的任務評核標準;GPT‑5.6 Sol(第二段)估計用時 32 分鐘,達到約 85% 的標準。
GPT‑6 Astra 估計用時 20 分鐘,達到約 94% 的任務評核標準。
GPT‑5.6 Sol 估計用時 32 分鐘,達到約 85% 的任務評核標準。
Ironclad 在這項研究中擔當的角色,反映了其客戶熟悉的一項挑戰:合約流程必須能處理例外情況,同時遵守企業賴以運作的規則。如果智能代理在執行任務期間忽略了其中一項規則,軟件公司便無法放心地將更多工作交給它。這也說明,即使智能代理越來越擅長處理複雜的合約任務,人類監督仍然重要,而完整的合約管理平台依然不可或缺。透過與我們的研究人員合作,Ironclad 能將這些問題帶入底層模型的開發過程,讓雙方共同研究。
隨着模型能力提升,Ironclad 有機會將模型應用於更多自家產品。對法律及業務團隊而言,這可能意味着 AI 能分擔更多複雜的合約工作,同時保留團隊所依賴的管控機制。
我們正邀請少數軟件公司,直接與我們的研究及工程團隊合作,研究目前智能代理仍未能可靠完成的重要專業任務。如果你的團隊有這類任務,我們希望看到一個具體例子:你要求智能代理做甚麼、有哪些證據顯示它在哪裏出錯,以及你會如何判斷結果是否成功。合作夥伴亦應能安排深入了解相關工作的人員參與,並提供安全的測試環境,以及可安全用於研究的數據。這些條件讓我們有據可循,着手調查失敗原因,並衡量模型是否有所改善。
如果你的團隊符合上述條件,歡迎 申請探索研究合作機會。


