Исследования18 сентября 2026 г., 07:19 МСК🤖 Auto

BioPhys-Bridge: Новый бенчмарк для проверки ИИ в биофизике

Исследователи представили BioPhys-Bridge — первый специализированный датасет для оценки способности LLM проводить междисциплинарные рассуждения, связывая физические модели с биологическими механизмами.

Баннер новости 7768

Проблема междисциплинарного разрыва

Современные языковые модели (LLM) часто терпят неудачу при анализе сложной научной литературы, требующей не просто извлечения фактов, а глубокого понимания контекста. В биофизике это особенно критично: для получения достоверного ответа модель должна не только найти данные, но и интерпретировать их через количественные физические модели, связывая их с конкретными биологическими механизмами. Именно для решения этой задачи команда во главе с Цинъяном Сюй (Qingyang Xu) разработала BioPhys-Bridge.

Структура и масштаб датасета

BioPhys-Bridge — это набор данных для задач QA (вопрос-ответ) и RAG (генерация с дополнением из источников), где каждый кейс строго структурирован. Модель должна опираться на «блоки доказательств» (evidence blocks), сохраняя стабильные ID источников, корректно работать с единицами измерения, уравнениями и допущениями.

Первый релиз включает:

  • 500 детально аннотированных научных кейсов;
  • 1 517 задач для агентов ИИ;
  • Охват 6 биологических доменов и 9 семейств физических моделей (включая 3 резервных для будущего расширения);
  • Строгие фильтры качества: проверка целостности источников, нормализация единиц измерения и экспертный обзор 81 кейса.

Результаты тестирования лидеров рынка

Авторы протестировали передовые модели, оценивая их способность точно атрибутировать ответы (метрика F1 по ID доказательств). Результаты показывают, что даже топовые модели испытывают серьезные трудности с точностью в междисциплинарных задачах. Ниже приведены лучшие показатели по метрике evidence-ID F1:

Модель Метрика F1 (Evidence-ID) Комментарий
DeepSeek-V4-Flash 0.360 Лучший результат, но все еще низкий
Qwen3.7-Max 0.316 Второе место
GPT-4o-mini 0.294 Третье место

Значение для науки и AI

Низкие баллы (менее 0.4) подчеркивают, что текущие LLM склонны к галлюцинациям при работе с кросс-доменными научными данными. BioPhys-Bridge служит инструментом для оценки не только фактологической точности, но и снижения галлюцинаций, а также способности модели предлагать дизайн биологических экспериментов. Датасет уже доступен на GitHub и Hugging Face, что открывает путь для создания более надежных научных ассистентов.

Источник: arXiv cs.AI ↗