Переход к основному контенту
OpenAI

Представляем LifeSciBench

Бенчмарк, написанный и проверенный экспертами и основанный на реальных исследованиях в науках о жизни

Загрузка…

Системы агентного ИИ все лучше выполняют научные задачи. Но их польза для наук о жизни зависит от умения работать со сложностью реальных исследований. Такая работа редко сводится к простому вопросу на знание факта или аккуратной задаче прогноза. Исследователи толкуют неполные данные, согласуют противоречивые результаты, планируют сложные эксперименты, отлаживают анализы, оценивают трансляционные риски и решают, что делать дальше при неопределенности.

Текущие бенчмарки отражают эти возможности не полностью. Многие оценки в науках о жизни проверяют узкие области или отдельные навыки, поэтому используют структурированные вопросы и четкие эталонные ответы. Они полезны, но часто не показывают, может ли модель помогать в более широком спектре исследовательской работы.

LifeSciBench создан, чтобы сократить этот разрыв. Каждое задание основано на мнении практикующих специалистов по наукам о жизни с подготовкой уровня Ph.D. и опытом ведения программ поиска лекарств в биотехнологических и фармацевтических компаниях.

LifeSciBench включает 750 экспертных заданий по семи рабочим процессам и семи биологическим областям.

1,062

Артефакты задания

173

Ученые-авторы

19,020

Критерии рубрики

453

Эксперты-рецензенты

Что измеряет LifeSciBench

LifeSciBench измеряет, способны ли системы ИИ поддерживать реальные исследовательские задачи в науках о жизни, а не только отвечать на вопросы по биологии. Чтобы задать таксономию бенчмарка, мы опросили практикующих специалистов о рабочих процессах, чаще всего используемых в прикладных исследованиях. Затем мы объединили ответы в семь категорий: работа с доказательствами, анализ, дизайн и оптимизация, научные рассуждения, валидация и операции, трансляция и научная коммуникация.

Каждое задание похоже на запрос ученого к опытному коллеге: научный промпт, релевантный контекст или артефакты и свободный ответ. Экспертные рубрики оценивают, дает ли модель правильный ответ с нужной детализацией, обоснованием, оговорками и форматом.

Создание набора данных

LifeSciBench оценивает научные рассуждения и менее формализованные практические навыки, нужные для реального применения. Задания требуют решать реалистичные исследовательские проблемы: интерпретировать данные, выносить предметные суждения и формулировать выводы, полезные экспертам. Многие задания также требуют учитывать неопределенность и работать с файлами данных, а не только с текстом промпта.

Бенчмарк отражает сложность работы в науках о жизни. В целом 79% заданий требуют нескольких шагов рассуждения или решения; в среднем — четыре шага на задание. LifeSciBench содержит 1 062 артефакта: рисунки, PDF, таблицы, файлы последовательностей, структурные и химические файлы, веб-ссылки. Более половины заданий (53%) требуют интерпретировать или объединять сведения хотя бы из одного артефакта.

Задания создали 173 ученых-эксперта из разных дисциплин наук о жизни. Все они имели подготовку уровня Ph.D. и опыт в биотехнологической или фармацевтической отрасли. До принятия задания проходили столько доработок, сколько требовалось, без лимита раундов; принятые задания в среднем прошли шесть автоматизированных самопроверок и минимум два экспертных рецензирования. Рецензирование опиралось на проверяемый правильный ответ или прочный экспертный консенсус с согласием не менее 90% профильных рецензентов. Такой процесс помог обеспечить научную обоснованность, ясность для оценки и связь с прикладными исследованиями.

Диаграмма, показывающая задания LifeSciBench, которые объединяют источники данных наук о жизни, такие как геномные последовательности, молекулярные структуры, рисунки, документы, электронные таблицы и веб-ссылки, с многошаговыми рассуждениями и экспертным рецензированием.

Оценивание и структура рубрик

Задания LifeSciBench оцениваются по подробной рубрике для каждой задачи: она разбивает ожидаемый ответ на научные утверждения, расчеты, решения, обоснования и т.п. В бенчмарке экспертные рубрики содержат 19 020 критериев — в среднем 25 на задание — для оценки научной корректности и пользы для исследовательских решений.

Это отражает практику оценки научной работы: многие задачи в науках о жизни нельзя оценить только по итоговому ответу. Ответ может дать верный общий вывод, но считаться неполным, если упущено ключевое ограничение анализа или важный биологический нюанс. И наоборот, частичный ответ может содержать качественные рассуждения, даже не решая задачу полностью.

Детальные рубрики улавливают этот нюанс. LifeSciBench оценивает не только точность финального ответа, но и то, приходит ли модель к нему научно корректно и практически полезно.

Валидация LifeSciBench

Мы валидировали LifeSciBench через независимое экспертное рецензирование. Отзывы дали 453 рецензента, не участвовавших в создании заданий. Из них 97% имели Ph.D. или эквивалентную докторскую степень, в среднем 12 лет опыта и 14 рецензируемых публикаций; 88% получали хотя бы одну награду или стипендию.

Рецензенты оценивали, есть ли в задании признаки сильного бенчмарка: связь с реальной исследовательской работой, проверка научных рассуждений и предметной экспертизы, опора на доказательства или консенсус и польза для оценки эффективности модели. Согласие превышало 96% во всех категориях.

Релевантность реальной практике

Отражает ли это задание реалистичную практическую работу в науках о жизни?

Полностью согласен
90.4%
В целом согласен
98.3%

Научные рассуждения / предметный навык

Проверяет ли это задание и оценивает ли оно правильные научные рассуждения и профильные навыки в области наук о жизни?

Полностью согласен
86.4%
В целом согласен
98.1%

Научная обоснованность

Является ли это задание научно обоснованным, разрешимым и опирающимся на надлежащие доказательства, данные, артефакты или экспертный консенсус?

Полностью согласен
77.1%
В целом согласен
96.5%

Общая полезность

В целом, является ли это задание сильной оценкой для наук о жизни?

Полностью согласен
79.1%
В целом согласен
96.6%

Комментарии рецензентов подтвердили количественные оценки:

1 из 3
В целом это сильное задание, потому что у него есть одна правильная ключевая интерпретация, но при этом остается возможность отличить более качественные ответы по тому, насколько аккуратно они ограничивают неопределенность.

Результаты

Мы приводим две взаимодополняющие метрики. Доля прохождения — процент заданий, где модель достигает порога успеха 70% на уровне задания. Балл — средняя награда по рубрике, дающая частичный зачет за отдельные критерии, даже если задание не решено полностью. Обе важны: ответ на научную задачу может быть частично верным или полезным, не выполняя всех требований.

Эффективность модели заметно зависит от типа задания, рабочего процесса и формата ответа.

Где системы ИИ уже сильны

LifeSciBench показывает: фронтирные модели относительно сильнее в научном синтезе, коммуникации и структурированной интерпретации. Абсолютные доли прохождения пока умеренны, поэтому эти области не насыщены, но GPT‑Rosalind заметно опережает GPT‑5.5: общий точный pass rate вырос с 25,7% до 36,1%.

Наибольший рост возможностей виден в научной коммуникации и трансляции. Например, доля прохождения в научной коммуникации растет с 56,3% у GPT‑5.5 до 71,1% у GPT‑Rosalind; категория мала (n=9), поэтому вывод осторожный, но модели быстро улучшают умение упорядочивать доказательства и давать убедительные объяснения для экспертов. Трансляция (разработка лекарств «от лаборатории к клинике») показывает сходную картину: рост с 36,8% у GPT‑5.5 до 57,7% у GPT‑Rosalind, что указывает на улучшение связи доклинических данных с клиническими последствиями.

Результаты на уровне рубрик указывают туда же. В заданиях, требующих полезных экспертам или применимых результатов, GPT‑Rosalind набирает 44,7% против 29,1% у GPT‑5.5. В заданиях на работу с неопределенностью и оговорками — 44,8% против 29,3%. Это говорит, что модели наиболее полезны при четких границах доказательств и необходимости структурированного научного суждения.

GPT‑Rosalind лидирует по эффективности в научно ценных заданиях, определенных отраслевыми и академическими экспертами.

GPT‑Rosalind показывает лучшие результаты в научно значимых задачах, определенных отраслевыми и академическими экспертами.

GPT‑Rosalind показывает лучшие результаты в научно значимых задачах, определенных отраслевыми и академическими экспертами.

Где системы ИИ пока уступают

Результаты намного слабее в работе с большим числом артефактов, сложным дизайном и операционными ограничениями. Именно цепочка дизайн, оптимизация и прогнозирование остается одним из самых трудных процессов: доля прохождения GPT‑Rosalind — 30,7%; анализ почти так же сложен — 30,3%.

Работа с артефактами — особенно явный пробел. Хотя GPT‑Rosalind лучше GPT‑5.5 в задачах с артефактами, ее доля прохождения падает с 45,1% на текстовых заданиях до 28,1% на заданиях с артефактами или URL. У GPT‑5.5 та же картина: падение с 29,9% до 21,9%. Более детальный анализ подтверждает: фронтирным моделям трудно извлекать сведения из сложных рисунков или больших файлов последовательностей и включать их в ответ.

Доля успешных решений падает, когда задания требуют рассуждений на основе источников или работы с артефактами

Формат ответа тоже важен. Задания, требующие точных ответов на уровне последовательности, структуры или конструкта, имеют меньшие доли прохождения: у GPT‑Rosalind лишь 14,8% в числовых задачах и 24,0% для последовательностей или структур. Генерация конструктов тоже нестабильна: у GPT‑Rosalind 27,3% и лишь небольшой прирост к GPT‑5.5. Часть разрыва может быть связана с более строгой оценкой точных ответов, где мелкие различия в расчете или формате опускают ответ ниже порога. Но эти сбои научно значимы: многие процессы в науках о жизни требуют результатов, достаточно точных для прямого применения, например в дизайне доноров CRISPR/HDR или siRNA.

Модели также часто продвигаются частично, но не решают задачу полностью. Примерно в 14% заданий модели получали существенный зачет по рубрике, не достигнув порога точного прохождения. У GPT‑Rosalind 109 заданий имели долю прохождения ниже 20%, но набирали не менее 50% награды по рубрике. На практике модели могут находить релевантные доказательства или давать правдоподобный частичный ответ, но проваливаться из-за пропущенного ограничения, неверных данных, неполного расчета или слабой связи рассуждений с полезным научным решением.

Ограничения и дальнейшие шаги

LifeSciBench помогает измерять пользу систем AI для исследований в науках о жизни, но не заменяет изучение моделей в живых исследовательских средах. Бенчмарк сосредоточен на самостоятельных заданиях, отражающих повторяющиеся отраслевые процессы, но пока не охватывает многие специальности и типы задач. Реальные исследования итеративны: ученые собирают новые данные, пересматривают гипотезы, планируют следующие эксперименты и меняют планы по мере результатов.

Поэтому сильные результаты в LifeSciBench следует считать признаком реалистичной способности выполнять отдельные задания, а не прямой мерой влияния на исследования. Бенчмарк основан на отраслевых процессах, но не передает всего разнообразия и динамики живых исследовательских программ, где прогресс зависит от факторов, развивающихся со временем.

Следующий шаг — связать результаты бенчмарка с исследованиями внедрения в живых исследовательских процессах. Хотя LifeSciBench создан с практикующими учеными, чтобы понять, ускоряют ли системы ИИ открытия или улучшают R&D, нужно изучать применение и эффективность моделей в реальных исследованиях, на более длинных горизонтах и в нескольких раундах рассуждений, обратной связи и экспериментов.

Примите участие

Помогите сформировать новое поколение бенчмарков ИИ для наук о жизни или запросите доступ к GPT-Rosalind.

Автор

OpenAI