Проблема накопления ошибок в LLM
Генерация длинных историй (long-form story generation) остается узким местом для современных LLM. При традиционном подходе (prompt-based) модели склонны накапливать ошибки: временные, фактические, логические и стилистические. Чем длиннее текст, тем выше вероятность, что персонаж забудет свое имя или нарушит причинно-следственные связи, заложенные в начале сюжета.
Решение: ConWriter
Команда во главе с Цзиндун Ли (Jindong Li) предложила ConWriter — фреймворк, не требующий дообучения (training-free). Вместо того чтобы генерировать текст единым потоком, система работает инкрементально на уровне сцен. Ключевые компоненты:
- Динамическая память: хранение актуального состояния сюжета.
- Символическое рассуждение: проверка, удовлетворяет ли новая сцена требуемым нарративным переходам.
- Сигналы риска: анализ неопределенности (uncertainty-aware) для приоритизации локального исправления ошибок до их распространения.
Эксперименты и метрики
Оценка проводилась на датасете ConStory-Bench, охватывающем четыре задачи: продолжение, генерация, расширение и завершение историй. Тестирование выполнялось на моделях Qwen3.5-Plus, DeepSeek-V4-Flash и серии GPT-5 при целевых длинах 3k, 6k и 12k токенов. Использовались первые пять кейсов из каждой задачи для минимизации вычислительных затрат.
| Модель | Задача | Длина (токены) | Рост качества (Consistency Score) |
|---|---|---|---|
| Qwen3.5-Plus | Continuation | 3k | +12.4% |
| DeepSeek-V4-Flash | Generation | 6k | +10.8% |
| GPT-5 | Expansion | 12k | +15.2% |
Почему это важно
ConWriter демонстрирует, что строгий контроль состояний через нейро-символический подход позволяет значительно повысить связность текста без затрат на переобучение базовых моделей. Это открывает путь к созданию надежных инструментов для написания книг, сценариев и интерактивных нарративов, где логическая целостность критична.
Источник: arXiv cs.CL ↗
