Проблема «инструментальной иллюзии»
Большие языковые модели (LLM) все чаще интегрируются с научным ПО для автоматизации вычислений. Однако новое исследование, опубликованное 1 июля 2026 года, ставит под сомнение эффективность такого подхода. Авторы — Кэ Чжан, Сачит Чундур, Мохаммад Джавад Квоми и Мазияр Райсси — создали бенчмарк PHREEQC-MCQ-200, который оценивает способность агентов выполнять детерминированные симуляции в области водной геохимии.
Ключевой вывод работы: доступ к инструментам (tool-augmented) не всегда повышает надежность. Напротив, в ряде случаев агенты теряют способность решать задачи, которые они могли решить без внешних инструментов, что указывает на скрытые регрессии в работе цепочек вычислений.
Методология: 200 вопросов и 21 сценарий
Бенчмарк состоит из 200 вопросов с множественным выбором, основанных на 21 валидированном сценарии симулятора PHREEQC. Агенты должны не просто вызвать функцию, а:
- Сконструировать корректный ввод для симулятора;
- Выполнить вычисления;
- Проанализировать структурированный вывод;
- Принять финальное решение.
Это переводит оценку из плоскости простого «вызова API» в плоскость сквозной диагностики (end-to-end diagnostic problem), где критически важна целостность всего процесса.
Результаты: рост точности и скрытые провалы
Использование симулятора действительно повысило общую точность (aggregate accuracy) для большинства моделей, подтверждая необходимость «заземленного выполнения» (grounded execution) для сложных научных задач. Однако анализ на уровне отдельных вопросов выявил негативный эффект.
| Метрика | Наблюдение | Значение |
|---|---|---|
| Общая точность | Существенно выше с инструментами | Подтверждает пользу симуляторов для сложных расчетов |
| Регрессия (Item-level retention) | Агенты теряют правильные ответы, данные без инструментов | Инструменты вносят шум или ошибки в логическую цепочку |
| Влияние интерфейса | Table-of-contents снижает затраты токенов | Эффективно для сильных моделей, но деградирует производительность средних (mid-tier) |
Проблема навигации по выводам
Особое внимание уделено протоколу доступа к выводам. Использование интерфейса «оглавления» (table-of-contents) позволяет сократить количество токенов и сохранить или даже улучшить точность для передовых моделей. Однако для моделей среднего уровня (mid-tier) такой подход критически ухудшает результаты, так как они не способны надежно ориентироваться в структурированном выводе симулятора.
Новые стандарты оценки
Авторы настаивают на пересмотре метрик оценки научных агентов. Одной общей точности недостаточно. В будущем оценки должны включать:
- Удержание ответов на уровне отдельных вопросов (item-level retention);
- Чувствительность к способу доступа к выводам;
- Анализ сбоев траектории (trajectory failures);
- Локализацию точек разрыва в цепочке вычислений.
PHREEQC-MCQ-200 становится первым шагом к созданию более надежных и прозрачных систем автономного научного моделирования.
Источник: arXiv cs.AI ↗
