Исследования28 июля 2026 г., 08:20 МСК🤖 Auto

LLM-лабиринт: почему модели меняют ответы на те же вопросы

Исследование Университета Вашингтона показало, что даже сильные LLM нестабильны: при перефразировании вопроса до 23% ответов меняются на противоположные, а точность на уровне отдельных примеров критически зависит от формулировки.

Баннер новости 4517

Проблема «слепой» точности

Крупные языковые модели (LLM) часто демонстрируют выдающиеся результаты в бенчмарках, но новое исследование, опубликованное в arXiv (2607.22554), вскрывает серьезный недостаток: нестабильность знаний. Авторы — команда из Университета Вашингтона во главе с Каземом Фагихом (Kazem Faghih) и Соэлем Фейзи (Soheil Feizi) — доказали, что высокая общая точность (accuracy) может маскировать фундаментальную ненадежность модели. Если изменить формулировку вопроса, сохранив его смысл, модель может начать давать неверные ответы, хотя «знания» в ней присутствуют.

Методология и ключевые цифры

Исследователи протестировали 13 различных моделей на четырех бенчмарках, охватывающих задачи фактологического ответа и математического мышления. Ключевой метрикой стала Answer Flip Rate (частота смены ответа) — процент случаев, когда при перефразировании вопроса правильный ответ становился неправильным и наоборот. Результаты показали, что для многих вопросов модель чередует правильные и ошибочные ответы в зависимости от синтаксиса промпта.

Метрика / Параметр Значение / Наблюдение
Максимальная частота смены ответа (Answer Flip Rate) Более 23%
Количество протестированных моделей 13
Количество бенчмарков 4
Корреляция оригинального и перефразированного ответа Слабая: правильность одного промпта не гарантирует правильность другого

Скрытые знания и решение через Self-Paraphrasing

Важное открытие исследователей заключается в том, что модель часто знает правильный ответ, но не может его «извлечь» из-за специфической формулировки. При тестировании на перефразированных вариантах вопроса модель находила верный ответ хотя бы в одном из вариантов. На основе этого авторы предложили стратегию self-paraphrasing (самоперефразирование): генерация нескольких вариантов одного вопроса и агрегация ответов. Этот простой метод позволяет частично восстановить «скрытые» знания модели и повысить надежность вывода (inference) без дообучения.

Почему это важно для индустрии

Стандартные метрики оценки LLM, такие как точность на статичных наборах данных (например, MMLU или GSM8K), создают ложное чувство безопасности. Для критически важных приложений (медицина, юриспруденция, финансы) нестабильность на уровне отдельных инстансов (instance-level behavior) неприемлема. Исследование призывает разработчиков и пользователей переходить от оценки «одного промпта» к оценке консистентности (consistency) при вариациях ввода, что является более честным показателем реальной надежности ИИ.

Источник: arXiv cs.AI ↗