Проблема длинного контекста
Большие языковые модели (LLM) всё чаще используются как персональные ассистенты, работающие с пользователем месяцами. Однако чем длиннее история переписки, тем сложнее модели эффективно обрабатывать информацию. Полное использование истории диалога создает огромные вычислительные накладные расходы, и модели часто теряют нить разговора, не находя релевантные детали для текущего запроса.
Это привело к появлению систем памяти, которые структурируют и извлекают информацию о пользователе. Но существующие подходы фокусируются на фактологическом воспроизведении (recall), тогда как реальные ассистенты должны давать рекомендации, планировать действия и поддерживать принятие решений, учитывая меняющиеся предпочтения.
Что такое PRAGMA
Команда исследователей во главе с Хёджон Ю (Hyojeong Yu) представила PRAGMA — новый бенчмарк, принятый к публикации в EMNLP 2026. В отличие от предыдущих тестов, PRAGMA оценивает именно персонализированное руководство (personalized guidance) в условиях долгосрочных разговоров.
Датасет включает:
- Курированные лонгитюдные истории диалогов.
- Аннотации доказательств (evidence annotations), указывающие, на какие части диалога следует опираться.
- Сценарии руководства, основанные на эволюционирующем контексте пользователя и его неверных предположениях.
Результаты тестирования
Авторы протестировали различные системы извлечения информации, архитектуры памяти и модели с длинным контекстом. Результаты показали, что современные системы struggle (спотыкаются) как на этапе восстановления релевантных фрагментов диалога, так и на этапе их использования для формирования персонализированного совета.
| Категория систем | Основная проблема в PRAGMA | Ключевой вывод |
|---|---|---|
| Retrieval Systems | Не могут точно найти нужные фрагменты в длинной истории | Простое извлечение не решает проблему контекста |
| Memory Systems | Слабое связывание информации из разных диалогов | Нужна интеграция опыта, а не просто хранение |
| Long-Context Models | Высокие затраты и «потеря внимания» к деталям | Прямая подача истории неэффективна для сложных задач |
Почему это важно
Результаты PRAGMA подчеркивают необходимость разработки новых архитектур памяти, которые поддерживают не только надежное извлечение разговоров, но и рассуждения, основанные на памяти (memory-grounded reasoning). Для создания по-настоящему умных ассистентов, которые помнят ваши предпочтения и помогают принимать решения, нужно выйти за рамки простого фактологического поиска.
Источник: arXiv cs.AI ↗
