Исследования21 сентября 2026 г., 07:20 МСК🤖 Auto

CaLR: Диффузионные модели учатся логике через причинно-следственный анализ

Исследователи представили CaLR — фреймворк, объединяющий скорость диффузионных языковых моделей (DLM) с логической строгостью autoregressive-архитектур через оптимизацию латентных пространств.

Баннер новости 7917

Проблема двух подходов

Современные языковые модели делятся на два лагеря с фундаментальными недостатками. Autoregressive (AR) модели, такие как GPT, страдают от локальной жадности (local greediness) — они выбирают наиболее вероятное следующее слово, часто упуская глобальную логику задачи. С другой стороны, диффузионные языковые модели (DLM) генерируют текст параллельно, что быстрее, но им не хватает строгой причинно-следственной структуры, необходимой для сложных рассуждений.

Решение: Causal Latent Revision (CaLR)

Команда авторов (Wei Cai, Jian Zhao, Yuchen Yuan, Xuelong Li) предложила фреймворк CaLR, который переосмысливает рассуждение как задачу оптимизации латентных переменных с ограничениями. Ключевые компоненты:

  • Causal Topology Matrix (CTM): Используется матрица причинно-следственной топологии, извлеченная из экспертной модели, для определения логических связей.
  • Implicit Differentiation: Позволяет применять градиентный спуск к дискретным латентным пространствам.
  • Thought Revision: Механизм «пересмотра мыслей», который корректирует промежуточные шаги генерации параллельно, обеспечивая динамическую самокоррекцию.

Результаты и бенчмарки

Эксперименты показали, что CaLR достигает состояния искусства (SOTA) среди диффузионных языковых моделей. Метод демонстрирует превосходную устойчивость в задачах, требующих строгой логики, таких как решение судоку, превосходя сильные autoregressive-базовые модели.

Характеристика Autoregressive (AR) модели Обычные DLM CaLR (предлагаемый метод)
Скорость генерации Низкая (последовательно) Высокая (параллельно) Высокая (параллельно)
Логическая строгость Высокая, но страдает от локальной жадности Низкая (нет причинно-следственной структуры) Высокая (через CTM и оптимизацию)
Самокоррекция Требует дообучения или цепочек рассуждений Отсутствует Динамическая, в процессе генерации
Результат на сложных бенчмарках Сильные базовые линии Уступают AR SOTA среди DLM, превосходит AR в логике

Почему это важно

CaLR закрывает разрыв между скоростью параллельной генерации и интеллектуальной глубиной последовательных моделей. Это открывает путь к созданию более надежных AI-ассистентов, способных решать задачи, требующие многошагового логического вывода, без компромиссов в скорости.

Источник: arXiv cs.AI ↗