Проблема: Иллюзия понимания в биологии
Предсказание функции ферментов — это иерархическая задача классификации, требующая глубоких знаний. Существующие бенчмарки выявили аномалию: общие LLM часто верно определяют первый, самый общий уровень классификации (класс), но при запросе полного номера EC (Enzyme Commission) точность на уровнях 2–4 падает практически до нуля. Специализированные модели и инструменты при этом остаются работоспособными. Авторы работы EC-Reason-Bench (Linyu Li и соавт.) задались целью понять, почему это происходит и можно ли исправить ситуацию без дообучения моделей.
Методология: 4 рычага оценки
Новый протокол является training-free (не требует обучения) и оценивает способность моделей к классификации через четыре ортогональных параметра. Это позволяет изолировать влияние каждого фактора:
- Структура вывода (Output structure): Как модель форматирует ответ.
- Внешние знания (External knowledge): Наличие доступа к базам данных (open-book) или работа только по внутренним весам (closed-book).
- Структура рассуждений (Reasoning structure): Использование Chain-of-Thought (CoT) или каскадных методов.
- Устойчивость рассуждений (Reasoning robustness): Способность модели справляться с противоречивыми данными.
Ключевые результаты: Знания важнее логики
Эксперименты с несколькими сильными reasoning-моделями выявили четыре главных вывода. Самый важный из них: внешние знания решающи и должны предшествовать рассуждениям. В режиме closed-book (без доступа к интернету/базам) показатели были uniformly low, но при открытии доступа к внешним данным разрыв между моделями сузился, а точность резко выросла.
Интересный парадокс обнаружился при сравнении сложных методов рассуждения с простым голосованием (voting) ближайших соседей. После предоставления доказательств (evidence) итоговый балл лучшей настройки LLM стал неотличим от простого голосования номеров EC у ближайших извлеченных соседей. Это означает, что рассуждение в LLM выступает не как источник знаний, а как арбитр конфликтов между соседями.
Детали производительности
Точность классификации подчиняется «закону доступности гомологии». Ниже приведена сводка влияния различных факторов на результат:
| Фактор | Условие | Влияние на точность |
|---|---|---|
| Доступ к данным | Closed-book (без внешних знаний) | Критически низкая (почти 0% на уровнях 2-4) |
| Доступ к данным | Open-book (с внешними знаниями) | Значительный рост, сглаживание разрывов между моделями |
| Метод рассуждения | Chain-of-Thought (CoT) | Эффект зависит от склонности модели к отказу от ответа (abstention) |
| Сравнение подходов | LLM vs. Voting Neighbors | При наличии evidence результаты статистически неотличимы |
Авторы подчеркивают, что единый числовой рейтинг (leaderboard) скрывает важную деталь: LLM могут показывать высокий средний балл за счет выигрыша на «простых» примерах, но терпеть неудачу на многофункциональных ферментах с противоречивыми доказательствами. EC-Reason-Bench позволяет увидеть эту диспропорцию.
Источник: arXiv cs.CL ↗
