Исследования14 августа 2026 г., 03:17 МСК🤖 Auto

Diffuse to Compress: Диффузионные модели сжимают текст без потерь

Исследователи впервые применили диффузионные языковые модели (DLM) для сжатия текста, преодолев узкое место авторегрессионных LLM и улучшив показатели на бенчмарке enwik8.

Баннер новости 5754

Проблема авторегрессионных LLM

Нейросетевые подходы к сжатию текста, основанные на больших языковых моделях (LLM), демонстрируют коэффициенты сжатия, значительно превосходящие традиционные алгоритмы, такие как zstd, gzip или bzip. Однако их практическое применение ограничено критически низкой пропускной способностью (throughput). Это связано с архитектурным ограничением: авторегрессионные модели генерируют символы строго по одному за каждый шаг, что делает процесс слишком медленным для реальных задач хранения и передачи данных.

Решение: Диффузионные языковые модели (DLM)

Авторы работы Angelo Nardone и Paolo Ferragina предлагают заменить авторегрессионный вывод на парадигму диффузионных языковых моделей (Diffusion Language Models). В отличие от последовательной генерации, DLM позволяют независимо определять количество и позиции кодируемых символов при каждом прямом проходе (forward pass). Это решает проблему узкого горлышка пропускной способности, сохраняя при этом высокую точность предсказания.

Экспериментальные результаты

Исследование проводилось на стандартном текстовом бенчмарке enwik8. Ученые разработали эффективные стратегии для преодоления алгоритмических сложностей, возникающих при применении DLM к задаче сжатия без потерь. Результаты показали, что новая архитектура превосходит текущее состояние искусства (SOTA) в области нейросетевого сжатия текста.

Параметр Авторегрессионные LLM Традиционные компрессоры Предложенный метод (DLM)
Пропускная способность Низкая (1 символ/шаг) Высокая Значительно выше (параллельное кодирование)
Коэффициент сжатия Высокий Средний/Низкий Лучший на рынке (SOTA)
Бенчмарк enwik8 enwik8 enwik8

Значение для индустрии

Поскольку диффузионные модели являются относительно молодой парадигмой, авторы отмечают значительный потенциал для дальнейших улучшений. По мере развития более мощных и эффективных DLM, этот метод может стать стандартом для сжатия не только обычного текста, но и исходного кода, а также структурированных форматов, таких как XML, что критически важно для оптимизации хранения цифровых данных.

Источник: arXiv cs.CL ↗