Basis 運用 GPT‑6 Astra,完成稅務活頁簿的速度提升至兩倍
GPT‑6 Astra 完成複雜任務所需的時間比 GPT‑5.6 Sol 少了 50%,也展現出對使用者意圖更深入的理解。
活頁簿測試
50%
在 Basis 的測試中,完成含有 50 張工作表的稅務活頁簿,所需時間比 Sol 減少的幅度。
內部評估
20%
Basis 內部評估分數的大致提升幅度。
Basis(在新視窗中開啟) 開發 AI 代理,將會計師日常許多需要手動處理的工作自動化,協助他們把時間從重複性任務轉移到策略性工作上。該公司的研究重點是能可靠完成長時間任務的代理。透過 GPT‑6 Astra,Basis 發現代理更能理解會計師想達成的目標。
「GPT-6 Astra 更能真正理解使用者的意圖,以及要解決的問題。」
Basis 以一份包含 50 張工作表的複雜稅務活頁簿,比較 GPT‑6 Astra 與 GPT‑5.6 Sol 的表現。任務要求準確、可靠地完成這份活頁簿,而 GPT‑6 Astra 的速度明顯更快。
「GPT-6 Astra 完成那份活頁簿所需的時間,只有 GPT-5.6 Sol 的一半。」
Basis 也指出,GPT‑6 Astra 在任務一開始就能做出更好的決策,讓 Basis 的代理以更直接的方式完成工作,減少修正錯誤所花的時間。Troyanovsky 表示,這也讓模型更有效率地運用詞元。
Basis 也讓 GPT‑6 Astra 隨任務進度調整推理投入:遇到困難的步驟時增加運算量,步驟較簡單時則減少運算量。模型在進行這些調整的同時,仍能保持快取完整。Troyanovsky 表示,這有助於降低成本並縮短回應時間,讓 Basis 及其客戶執行長時間任務時更符合成本效益。
採用 GPT‑6 Astra 後,Basis 的內部評估分數提升約 20%,原因在於模型更能理解使用者意圖,包括何時該提問、指出所做的假設,以及遵循指示。
Basis 會評估代理的工作方式與最終答案,包括是否依循範本、針對稅務問題查閱第一手資料,以及檢查自己的工作成果。GPT‑6 Astra 能從更廣泛的情境中推斷出這些要求,因此不需要那麼多明確指示。
這讓 Basis 不必那麼頻繁地為個別情境編寫規則,也讓團隊更有信心,相信代理能處理內部測試未涵蓋的情況。


