Исследования24 июля 2026 г., 15:17 МСК🤖 Auto

LENS: Как LLM перестали гадать на кофейной гуще и начали понимать пользователей

Исследователи из ICML 2026 представили ExpectBench и метод LENS, доказав, что стандартные бенчмарки врут о качестве LLM, а реальное удовлетворение пользователей требует явного моделирования скрытых ожиданий.

Баннер новости 4298

Проблема: Иллюзия компетентности

Большие языковые модели (LLM) показывают выдающиеся результаты на стандартных бенчмарках, но это не гарантирует, что они удовлетворяют реальных пользователей. Авторы исследования (Miaomiao Li, Yang Wang и др.) выявили критический разрыв: существующие подходы к оценке, основанные на эвристиках моделей, экспертных рубриках или симуляции пользователей, не способны уловить разнообразие и тонкости реальных человеческих ожиданий. В результате модели кажутся компетентными, но фактически не соответствуют тому, что пользователи хотят получить.

Решение: ExpectBench и LENS

Команда представила ExpectBench — первый бенчмарк, основанный на реальных взаимодействиях пользователей, а также метод LENS (Latent Expectation-aware Response Generation). LENS — это легковесная фреймворк-надстройка, которая позволяет моделям интернализировать (усваивать) скрытые ожидания пользователя перед генерацией ответа. Это смещает фокус с простого «ответа на вопрос» на «предвосхищение потребности».

Ключевые метрики и результаты

Анализ показал, что текущие LLM систематически struggle (борются) с удовлетворением и предвосхищением желаемого результата. Внедрение LENS привело к стабильному улучшению показателей удовлетворенности ожиданиями (expectation satisfaction). Ниже приведена сравнительная характеристика подходов:

Критерий Стандартные бенчмарки ExpectBench + LENS
Основа оценки Эвристики моделей, экспертные рубрики Реальные пользовательские ожидания
Метод генерации Прямой ответ (без учета контекста ожидания) Явное моделирование латентных ожиданий
Результат Высокий балл в тесте, низкое удовлетворение Согласованное улучшение satisfaction score

Почему это важно для индустрии

Работа, принятая к публикации в ICML 2026, подчеркивает фундаментальный сдвиг в Human-AI alignment. Исследование доказывает, что для создания по-настоящему полезных ИИ-ассистентов необходимо явно моделировать ожидания пользователя, а не полагаться только на внутреннюю логику модели. Это открывает путь к созданию систем, которые не просто «правильны» с точки зрения данных, но и релевантны с точки зрения человеческого контекста.

Источник: arXiv cs.AI ↗