Исследования12 сентября 2026 г., 00:19 МСК🤖 Auto

PRAGMA: Почему ИИ-ассистенты забывают контекст в долгих диалогах

Исследователи представили PRAGMA — первый бенчмарк, оценивающий способность LLM давать персонализированные советы в долгосрочных диалогах, а не просто вспоминать факты.

Баннер новости 7310

Проблема длинного контекста

Большие языковые модели (LLM) всё чаще используются как персональные ассистенты, работающие с пользователем месяцами. Однако чем длиннее история переписки, тем сложнее модели эффективно обрабатывать информацию. Полное использование истории диалога создает огромные вычислительные накладные расходы, и модели часто теряют нить разговора, не находя релевантные детали для текущего запроса.

Это привело к появлению систем памяти, которые структурируют и извлекают информацию о пользователе. Но существующие подходы фокусируются на фактологическом воспроизведении (recall), тогда как реальные ассистенты должны давать рекомендации, планировать действия и поддерживать принятие решений, учитывая меняющиеся предпочтения.

Что такое PRAGMA

Команда исследователей во главе с Хёджон Ю (Hyojeong Yu) представила PRAGMA — новый бенчмарк, принятый к публикации в EMNLP 2026. В отличие от предыдущих тестов, PRAGMA оценивает именно персонализированное руководство (personalized guidance) в условиях долгосрочных разговоров.

Датасет включает:

  • Курированные лонгитюдные истории диалогов.
  • Аннотации доказательств (evidence annotations), указывающие, на какие части диалога следует опираться.
  • Сценарии руководства, основанные на эволюционирующем контексте пользователя и его неверных предположениях.

Результаты тестирования

Авторы протестировали различные системы извлечения информации, архитектуры памяти и модели с длинным контекстом. Результаты показали, что современные системы struggle (спотыкаются) как на этапе восстановления релевантных фрагментов диалога, так и на этапе их использования для формирования персонализированного совета.

Категория систем Основная проблема в PRAGMA Ключевой вывод
Retrieval Systems Не могут точно найти нужные фрагменты в длинной истории Простое извлечение не решает проблему контекста
Memory Systems Слабое связывание информации из разных диалогов Нужна интеграция опыта, а не просто хранение
Long-Context Models Высокие затраты и «потеря внимания» к деталям Прямая подача истории неэффективна для сложных задач

Почему это важно

Результаты PRAGMA подчеркивают необходимость разработки новых архитектур памяти, которые поддерживают не только надежное извлечение разговоров, но и рассуждения, основанные на памяти (memory-grounded reasoning). Для создания по-настоящему умных ассистентов, которые помнят ваши предпочтения и помогают принимать решения, нужно выйти за рамки простого фактологического поиска.

Источник: arXiv cs.AI ↗