Исследования30 июля 2026 г., 15:17 МСК🤖 Auto

EC-Reason-Bench: Почему LLM проваливают классификацию ферментов без внешних данных

Исследователи представили EC-Reason-Bench — бенчмарк, доказывающий, что внешние знания важнее рассуждений для точной классификации ферментов (EC). Без доступа к базам данных точность LLM падает почти до нуля.

Баннер новости 4721

Проблема: Иллюзия понимания в биологии

Предсказание функции ферментов — это иерархическая задача классификации, требующая глубоких знаний. Существующие бенчмарки выявили аномалию: общие LLM часто верно определяют первый, самый общий уровень классификации (класс), но при запросе полного номера EC (Enzyme Commission) точность на уровнях 2–4 падает практически до нуля. Специализированные модели и инструменты при этом остаются работоспособными. Авторы работы EC-Reason-Bench (Linyu Li и соавт.) задались целью понять, почему это происходит и можно ли исправить ситуацию без дообучения моделей.

Методология: 4 рычага оценки

Новый протокол является training-free (не требует обучения) и оценивает способность моделей к классификации через четыре ортогональных параметра. Это позволяет изолировать влияние каждого фактора:

  • Структура вывода (Output structure): Как модель форматирует ответ.
  • Внешние знания (External knowledge): Наличие доступа к базам данных (open-book) или работа только по внутренним весам (closed-book).
  • Структура рассуждений (Reasoning structure): Использование Chain-of-Thought (CoT) или каскадных методов.
  • Устойчивость рассуждений (Reasoning robustness): Способность модели справляться с противоречивыми данными.

Ключевые результаты: Знания важнее логики

Эксперименты с несколькими сильными reasoning-моделями выявили четыре главных вывода. Самый важный из них: внешние знания решающи и должны предшествовать рассуждениям. В режиме closed-book (без доступа к интернету/базам) показатели были uniformly low, но при открытии доступа к внешним данным разрыв между моделями сузился, а точность резко выросла.

Интересный парадокс обнаружился при сравнении сложных методов рассуждения с простым голосованием (voting) ближайших соседей. После предоставления доказательств (evidence) итоговый балл лучшей настройки LLM стал неотличим от простого голосования номеров EC у ближайших извлеченных соседей. Это означает, что рассуждение в LLM выступает не как источник знаний, а как арбитр конфликтов между соседями.

Детали производительности

Точность классификации подчиняется «закону доступности гомологии». Ниже приведена сводка влияния различных факторов на результат:

Фактор Условие Влияние на точность
Доступ к данным Closed-book (без внешних знаний) Критически низкая (почти 0% на уровнях 2-4)
Доступ к данным Open-book (с внешними знаниями) Значительный рост, сглаживание разрывов между моделями
Метод рассуждения Chain-of-Thought (CoT) Эффект зависит от склонности модели к отказу от ответа (abstention)
Сравнение подходов LLM vs. Voting Neighbors При наличии evidence результаты статистически неотличимы

Авторы подчеркивают, что единый числовой рейтинг (leaderboard) скрывает важную деталь: LLM могут показывать высокий средний балл за счет выигрыша на «простых» примерах, но терпеть неудачу на многофункциональных ферментах с противоречивыми доказательствами. EC-Reason-Bench позволяет увидеть эту диспропорцию.

Источник: arXiv cs.CL ↗