Проблема однократных оценок
Большинство современных бенчмарков оценивают LLM по ответу на финальный вопрос в формате «один вопрос — один ответ». Однако в реальных сценариях (чат-боты, аналитика) модель получает новые улики шаг за шагом. Рациональное поведение требует байесовского обновления вероятностей: каждый новый факт должен корректировать «веру» модели в скрытые параметры среды. Авторы работы BayesBench (Samanta et al., 2026) выявили разрыв между способностью модели «видеть» данные и её умением логически перестраивать на их основе свои выводы.
Три уровня сложности задач
Для проверки гипотезы исследователи создали симуляционную среду с тремя типами задач, требующими накопления доказательств:
- Байесовская оценка (Bayesian estimation): Модель должна вывести неизвестный параметр из последовательности наблюдений.
- Байесовское предсказание (Bayesian prediction): На основе выведенных убеждений о скрытой переменной модель прогнозирует исходное событие.
- Предсказание с учетом фрейминга (Latent-framed prediction): Наблюдения подаются через призму «персоны» пользователя, требуя совместного вывода о скрытом состоянии и намерениях собеседника.
Результаты: масштабирование не решает проблему
В исследовании протестированы 7 моделей от 3B до 70B параметров. Результаты показали парадоксальный эффект: увеличение размера модели действительно улучшает способность к извлечению латентных структур, но этот прогресс не переносится на финальное предсказание. Модели часто выдают байесовский апостериорный ответ на промежуточных шагах, но теряют нить рассуждений к концу диалога.
| Задача | Суть проверки | Ключевой вывод |
|---|---|---|
| Bayesian estimation | Вывод параметра из потока данных | Крупные модели (70B) лучше справляются с накоплением улик |
| Bayesian prediction | Прогноз на основе убеждений | Результаты оценки не коррелируют с качеством прогноза |
| Latent-framed prediction | Учет «персоны» пользователя | Самая сложная задача; разрыв между знанием и действием максимален |
Почему это важно
Результаты BayesBench указывают на фундаментальное ограничение современных LLM: они обладают «памятью» фактов, но не имеют устойчивого механизма «веры». Для приложений, требующих долгосрочного планирования или работы с противоречивой информацией, это критично. Модель может знать правильный ответ, но не уметь аргументированно обновлять свою позицию при появлении новых данных, что делает её поведение непредсказуемым в сложных диалогах.
Источник: arXiv cs.AI ↗
