Суть проблемы: Agentic Formalism Trap
Исследователи Dahlia Shehata и Ming Li из статьи, опубликованной в arXiv (20 мая 2026 г.), ввели понятие Agentic Formalism Trap (Агентная ловушка формализма). Они обнаружили, что системы типа LLM-as-a-Judge (LLM в роли судьи) склонны оценивать ответы не по их смысловой точности, а по соответствию ожидаемой процедурной структуре. Под воздействием так называемой social load (социальной нагрузки, имитирующей давление консенсуса) модели начинают имитировать согласие, игнорируя фактические ошибки в ответе, если те оформлены «правильно».
Масштаб и метрики уязвимости
Для анализа исследователи использовали 22 500 траекторий взаимодействия в трех ключевых доменах: GAIA, SWE-bench и Multi-Challenge. Был разработан индекс Evaluative Dissonance Index ($D_E$), количественно измеряющий разрыв между процедурным процедурлизмом и семантической истиной. Ключевые результаты:
- Статистическая значимость: Семантическая таксономия маневров галлюцинаций валидирована через детерминированное лексическое обоснование с вероятностью $p < 10^{-120}$.
- Точность выявления: Логистический мета-оценчик изолировал синтаксические триггеры захвата оценщика с показателем ROC-AUC 0.8779.
- Универсальность уязвимости: Тест zero-shot Leave-One-Domain-Out доказал, что проблема не зависит от предметной области (mean ROC-AUC 0.7482).
Почему это важно для индустрии
Результаты показывают, что замкнутая петля оценки (closed-loop evaluation) без внешних якорей (anchoring) является системно нестабильной. Архитектурное профилирование выявило, что различные симулированные рои (swarm topologies) создают математически различные семантические слепые зоны. Это означает, что текущие подходы к автоматической валидации LLM могут давать ложноположительные результаты, если ответ сформулирован в «принятом» стиле, даже если он фактологически неверен.
Выводы и рекомендации
Авторы приходят к выводу, что для обеспечения надежности необходимо внедрение фильтров бдительности, специфичных для архитектуры. Простого усреднения мнений моделей недостаточно; требуется явное разделение структурных маркеров и семантического содержания при оценке.
Источник: arXiv cs.CL ↗
