Проблема «разрозненных точек» (DOTs)
В реальном мире информация часто фрагментирована. Задача LLM — не просто генерировать текст, а восстанавливать пропущенные фрагменты (text infilling), сохраняя логическую связность с локальным контекстом и глобальным сюжетом. Авторы исследования из arXiv (2026) создали бенчмарк для проверки этой способности, назвав его метафорически «соединением точек» (DOTs).
Методология: 9.2K примеров и 20 моделей
Для оценки был создан датасет из ~9 200 инстансов, охватывающий четыре типа нарративов: энциклопедические тексты, истории здравого смысла, новостные статьи и визуальные нарративы. В текстах маскировались от одной до трех предложений. В тесте участвовали 20 open-source моделей с инструктажем, варьирующихся от 1.5B до 70B параметров.
Главный инсайт: Масштаб не равен качеству
Результаты опровергли интуитивное ожидание, что более крупные модели всегда справляются с контекстной связностью лучше. Лидером качественной оценки стал компактный Gemma-2-2B, набравший 4.02/5. Он превзошел модели в 10–40 раз больше по параметрам:
| Модель | Параметры | Качественный балл (из 5) | Отставание от лидера |
|---|---|---|---|
| Gemma-2-2B | 2B | 4.02 | — |
| DeepSeek-Qwen-32B | 32B | 3.77 | -6.6% |
| LLaMA-3.3-70B | 70B | 3.71 | -8.3% |
Chain-of-Thought: маргинальная польза
Авторы также проверили влияние явного рассуждения (Chain-of-Thought). Оказалось, что принудительное заставление модели «думать вслух» перед генерацией заполняемого текста дает лишь незначительное улучшение результатов (+0.6%). Это указывает на то, что текущие архитектуры LLM не всегда эффективно используют явные шаги рассуждения для задач восстановления контекста.
Что влияет на сложность задачи?
Вместо ожидаемого фактора «позиции пропуска» (начало, середина, конец), сильными предикторами сложности оказались длина нарратива и доменная специфика. Короткие тексты и специфические домены (например, новостные сводки) оказались значительно сложнее для связывания фактов, чем длинные энциклопедические статьи.
Источник: arXiv cs.CL ↗
