跳至主要內容
OpenAI

2026年6月17日

研究研究發表

隆重推出 LifeSciBench

由專家撰寫並審查、以真實世界生命科學研究為基礎的基準

載入中…

智慧體式 AI 系統執行科學任務的能力正日益提升。然而,它們對生命科學研究人員的實用性,取決於它們處理真實研究複雜性的能力。這這類工作很少只是單一的事實回憶問題,或能直接得出明確答案的預測問題。研究人員需要解讀不完整的證據、調和相互衝突的結果、設計困難的實驗、排查實驗檢測流程中的問題、評估轉譯風險,並在不確定性下決定下一步。

現有基準尚未充分捕捉這些能力。許多生命科學評估聚焦於狹窄領域或孤立技能,因而形成題型結構化、參考答案明確的問題。這些評估固然有價值,卻常無法真正評估模型是否能在更廣泛的研究層級工作中做出貢獻。

我們設計 LifeSciBench,旨在縮小這項落差。每項任務都以實務生命科學家的判斷為基礎;這些科學家具備博士層級訓練,並在生技與製藥環境中有直接推進藥物發現專案的經驗。

LifeSciBench 包含 750 項由專家撰寫的任務,涵蓋七種工作流程與七個生物學領域。

1,062

任務附件資料

173

科學家貢獻者

19,020

評分規準

453

專家審查者

LifeSciBench 的衡量面向

LifeSciBench 衡量 AI 系統能否支援真實的生命科學研究任務,而不只是回答生物學問題。為了定義基準分類架構,我們調查了實務生命科學家在應用研究場景中最常使用的工作流程。接著,我們將他們的回應歸納為七個反覆出現的類別:證據處理、分析、設計與最佳化、科學推理、驗證與操作流程、轉譯,以及科學溝通。

每項任務的結構都像科學家可能交給一位知識豐富合作者的請求:科學提示詞、任何相關背景或附件資料,以及自由作答。由專家撰寫的評分規準會評估模型是否能針對特定問題產出正確答案,並具備科學家所期待的適當細節、論證、限制說明與格式。

資料集建構

LifeSciBench 評估科學推理,同時也評估真實世界科學應用所需、較難明確界定的實務技能。其任務要求模型處理真實研究問題:解讀證據、做出有領域依據的判斷,並傳達對專家審查者有用的結論。許多任務也要求模型處理不確定性,並針對支援資料檔進行推理,而不是只依賴提示詞文字。

這項基準旨在反映生命科學工作的複雜性。整體而言,79% 的任務需要多個推理或決策步驟,平均每項任務有四個步驟。LifeSciBench 包含 1,062 個附件資料,涵蓋圖表、PDF、表格、序列檔、結構或化學檔案,以及網頁參照。超過半數任務 (53%) 要求模型解讀或整合至少一項附加資料中的資訊。

這些任務由橫跨不同生命科學學科的 173 位專家科學家建立。每位科學家都具備博士層級訓練,以及生物科技或製藥產業經驗。任務在獲接受前可依需要經歷任意多輪修訂,輪數沒有固定上限;獲接受的任務平均經過六輪自行進行的自動審查,並完成至少兩輪專家審查。審查以可驗證的正確答案或強而有力的專家共識為基礎,相關領域審查者之間至少達到 90% 的一致性。這個流程有助於確保獲接受的任務具備科學依據、足夠清楚可供評分,並能代表應用研究。

圖表顯示 LifeSciBench 任務整合基因組序列、分子結構、圖表、文件、試算表與網頁連結等生命科學資料來源,並結合多步驟推理與專家審查。

評分方式與評分規準拆解

LifeSciBench 任務使用詳細且針對任務設計的評分規準來評分,將預期回答拆解為具體的科學主張、計算、決策、論證等項目。在整個基準中,由專家制定的評分規準包含 19,020 項標準,平均每項任務 25 項,用以評估科學正確性以及對研究決策的實用性。

這項設計反映了科學工作在實務中如何被評估:許多生命科學任務無法只靠檢查最終答案來評分。一個回答可能得出正確的整體結論,但若例如忽略關鍵檢測限制,或未主動提出後果重大的生物學細節,仍可能被判定為不完整。相反地,即使未能完全解決任務,部分回答也可能包含高品質的推理。

細緻的評分規準能捕捉這些細微差異。LifeSciBench 評估的不只是最終答案的準確性,也包括模型是否以科學上有效且在實務上具有可操作性的方式得出答案。

驗證 LifeSciBench 的有效性

我們透過獨立專家審查,驗證了 LifeSciBench 的有效性。回饋來自 453 位未參與任務撰寫的審查者。在這些審查者中,97% 擁有博士學位或同等博士學位,平均具備 12 年領域經驗並發表 14 篇同儕審查論文;88% 表示曾獲得至少一項獎項或研究獎助。

審查者評估每項任務是否具備高品質基準題目應有的特質:與真實世界研究工作一致、能適當測試科學推理與領域專業、以證據或專家共識為基礎,以及對評估模型表現的整體實用性。各類別的一致率均超過 96%。

真實世界相關性

這項任務是否反映真實世界中的生命科學工作?

非常同意
90.4%
整體認同
98.3%

科學推理/領域技能

這項任務是否能正確測試並評估科學推理與生命科學領域技能?

非常同意
86.4%
整體認同
98.1%

科學依據

這項任務是否具備科學依據、具備明確答案,並以適當的證據、資料、附件資料或專家共識為基礎?

非常同意
77.1%
整體認同
96.5%

整體實用性

整體而言,這是一項高品質的生命科學評估任務嗎?

非常同意
79.1%
整體認同
96.6%

審查者的評論進一步印證了量化評分結果:

1 之 3
整體而言,這是一個設計良好的任務,因為它有一個明確且正確的核心解讀,同時又能根據回答者是否能謹慎界定不確定性,區分出答案品質的高低。

結果

我們報告兩項互補指標。通過率是指模型達到 70% 任務層級成功門檻的任務百分比。分數是平均評分規準得分,即使未完整解決任務,也會依個別標準給予部分分數。兩者都很重要,因為即使未完全符合完整答案的所有要求,科學任務的回答仍可能部分正確,或具備實用價值。

模型表現會因任務類型、工作流程與回答格式而有顯著差異。

AI 系統初步展現優勢之處

LifeSciBench 顯示,前沿模型在涉及科學綜合、溝通與結構化解讀的任務上相對最強。絕對通過率仍然有限,顯示這些基準領域的模型能力仍有很大的提升空間。但 GPT‑Rosalind 相較於 GPT‑5.5 展現了有意義的進展,整體精確通過率從 25.7% 提升至 36.1%。

模型能力進步最明顯的方向出現在科學溝通與轉譯。例如,科學溝通的通過率從 GPT‑5.5 的 56.3% 提升至 GPT‑Rosalind 的 71.1%;此類別樣本較小(n=9),因此應謹慎解讀,但這顯示前沿模型在組織證據並產出有說服力、面向專家的解釋方面正快速改進。轉譯(藥物開發中從實驗研究走向臨床應用的過程)也呈現類似模式,從 GPT‑5.5 的 36.8% 升至 GPT‑Rosalind 的 57.7%,顯示模型正快速提升將臨床前證據連結到臨床意涵的能力。

評分規準層級的結果也指向相同方向。在需要產出對專家有用或可直接採取行動的內容的任務上,GPT‑Rosalind 得分為 44.7%,相較之下 GPT‑5.5 為 29.1%。在需要處理不確定性與限制說明的任務上,其得分為 44.8%,相較之下 GPT‑5.5 為 29.3%。這種模式顯示,當任務具有清楚的證據範圍,且需要結構化的科學判斷時,模型最能發揮價值。

GPT‑Rosalind 在產業與學術專家認定具科學價值的任務中表現領先。

GPT‑Rosalind 在產業與學術專家識別的具科學價值任務中效能領先。

GPT‑Rosalind 在產業與學術專家識別的具科學價值任務中效能領先。

AI 系統仍有不足之處

在高度依賴附件資料、設計導向,以及受操作條件限制的科學工作中,模型表現仍明顯較弱。具體而言,設計、最佳化與預測仍是最具挑戰性的工作流程之一,GPT‑Rosalind 的通過率為 30.7%;分析同樣困難,通過率為 30.3%。

對附件資料的處理能力尤其是一項明顯的落差。雖然 GPT‑Rosalind 在高度依賴附件資料的情境下表現優於 GPT‑5.5,但其通過率仍從純文字任務的 45.1% 降至包含附件資料或 URL 的任務中的 28.1%。GPT‑5.5 也呈現相同趨勢,通過率從 29.9% 降至 21.9%。更深入的分析顯示,前沿模型在從複雜圖表或大型序列檔案中擷取資訊,並將這些資訊整合到最終答案時,仍面臨明顯挑戰。

當任務需要以來源為依據的推理或處理附件資料時,通過率會下降

答案格式同樣會影響表現。需要精確序列、結構或構築體層級輸出的任務,通過率明顯較低:GPT‑Rosalind 在數值任務上的通過率僅為 14.8%,在序列或結構輸出任務上則為 24.0%。構築體生成任務同樣較為脆弱,GPT‑Rosalind 的通過率為 27.3%,相較 GPT‑5.5 的改善幅度也有限。這項落差部分可能反映出精確答案任務採用更嚴格的評分標準;在這類任務中,計算或格式上的些微差異,都可能導致回答未達通過門檻。儘管如此,這些失敗仍具有重要的科學意義,因為許多生命科學工作流程需要高度精確、可直接應用的產出,例如 CRISPR/HDR donor 設計或 siRNA 設計。

模型也常常只完成了部分工作,未能完全解決任務。在約 14% 的任務中,模型雖未達精確通過門檻,仍取得了相當高的評分規準分數。就 GPT‑Rosalind 而言,有 109 項任務的通過率低於 20%,但仍獲得至少 50% 的評分規準得分。在實務上,這表示模型可能能找出相關證據或產生看似合理的部分答案,但仍會因漏掉關鍵限制、使用錯誤證據、計算不完整,或未將推理連結到科學上有用的最終決策而失敗。

限制與未來方向

LifeSciBench 是朝向衡量 AI 系統對生命科學研究實用性邁出的一步,但它無法取代在真實研究環境中對模型進行研究與評估。這項基準聚焦於反映產業中常見工作流程的自成一體任務,但仍有許多科學專業領域與任務類型尚未納入目前範圍。真實研究是一個反覆迭代的過程:科學家會持續蒐集新的證據、修正假設、設計後續實驗,並隨著研究結果逐步調整研究計劃。

因此,LifeSciBench 上的優異表現應被視為模型具備真實任務層級能力的證據,而非對後續研究影響的直接衡量。這項基準以產業工作流程為基礎,但無法捕捉即時研究計劃的完整多樣性或動態;在這些計劃中,進展取決於隨時間展開的各種因素。

下一步,是將基準測試表現與真實研究工作流程中的部署研究連結起來。雖然 LifeSciBench 是與實務科學家共同開發的,但若要衡量 AI 系統是否能加速發現或改善研發成果,仍需要在真實研究場景中、以較長時間跨度,並跨越多輪推理、回饋與實驗追蹤,研究模型的使用與表現。

參與貢獻

協助塑造新一代生命科學 AI 基準,或申請使用 GPT-Rosalind。

作者

OpenAI