Проблема двух подходов
Современные языковые модели делятся на два лагеря с фундаментальными недостатками. Autoregressive (AR) модели, такие как GPT, страдают от локальной жадности (local greediness) — они выбирают наиболее вероятное следующее слово, часто упуская глобальную логику задачи. С другой стороны, диффузионные языковые модели (DLM) генерируют текст параллельно, что быстрее, но им не хватает строгой причинно-следственной структуры, необходимой для сложных рассуждений.
Решение: Causal Latent Revision (CaLR)
Команда авторов (Wei Cai, Jian Zhao, Yuchen Yuan, Xuelong Li) предложила фреймворк CaLR, который переосмысливает рассуждение как задачу оптимизации латентных переменных с ограничениями. Ключевые компоненты:
- Causal Topology Matrix (CTM): Используется матрица причинно-следственной топологии, извлеченная из экспертной модели, для определения логических связей.
- Implicit Differentiation: Позволяет применять градиентный спуск к дискретным латентным пространствам.
- Thought Revision: Механизм «пересмотра мыслей», который корректирует промежуточные шаги генерации параллельно, обеспечивая динамическую самокоррекцию.
Результаты и бенчмарки
Эксперименты показали, что CaLR достигает состояния искусства (SOTA) среди диффузионных языковых моделей. Метод демонстрирует превосходную устойчивость в задачах, требующих строгой логики, таких как решение судоку, превосходя сильные autoregressive-базовые модели.
| Характеристика | Autoregressive (AR) модели | Обычные DLM | CaLR (предлагаемый метод) |
|---|---|---|---|
| Скорость генерации | Низкая (последовательно) | Высокая (параллельно) | Высокая (параллельно) |
| Логическая строгость | Высокая, но страдает от локальной жадности | Низкая (нет причинно-следственной структуры) | Высокая (через CTM и оптимизацию) |
| Самокоррекция | Требует дообучения или цепочек рассуждений | Отсутствует | Динамическая, в процессе генерации |
| Результат на сложных бенчмарках | Сильные базовые линии | Уступают AR | SOTA среди DLM, превосходит AR в логике |
Почему это важно
CaLR закрывает разрыв между скоростью параллельной генерации и интеллектуальной глубиной последовательных моделей. Это открывает путь к созданию более надежных AI-ассистентов, способных решать задачи, требующие многошагового логического вывода, без компромиссов в скорости.
Источник: arXiv cs.AI ↗
