Проблема авторегрессионных LLM
Нейросетевые подходы к сжатию текста, основанные на больших языковых моделях (LLM), демонстрируют коэффициенты сжатия, значительно превосходящие традиционные алгоритмы, такие как zstd, gzip или bzip. Однако их практическое применение ограничено критически низкой пропускной способностью (throughput). Это связано с архитектурным ограничением: авторегрессионные модели генерируют символы строго по одному за каждый шаг, что делает процесс слишком медленным для реальных задач хранения и передачи данных.
Решение: Диффузионные языковые модели (DLM)
Авторы работы Angelo Nardone и Paolo Ferragina предлагают заменить авторегрессионный вывод на парадигму диффузионных языковых моделей (Diffusion Language Models). В отличие от последовательной генерации, DLM позволяют независимо определять количество и позиции кодируемых символов при каждом прямом проходе (forward pass). Это решает проблему узкого горлышка пропускной способности, сохраняя при этом высокую точность предсказания.
Экспериментальные результаты
Исследование проводилось на стандартном текстовом бенчмарке enwik8. Ученые разработали эффективные стратегии для преодоления алгоритмических сложностей, возникающих при применении DLM к задаче сжатия без потерь. Результаты показали, что новая архитектура превосходит текущее состояние искусства (SOTA) в области нейросетевого сжатия текста.
| Параметр | Авторегрессионные LLM | Традиционные компрессоры | Предложенный метод (DLM) |
|---|---|---|---|
| Пропускная способность | Низкая (1 символ/шаг) | Высокая | Значительно выше (параллельное кодирование) |
| Коэффициент сжатия | Высокий | Средний/Низкий | Лучший на рынке (SOTA) |
| Бенчмарк | enwik8 | enwik8 | enwik8 |
Значение для индустрии
Поскольку диффузионные модели являются относительно молодой парадигмой, авторы отмечают значительный потенциал для дальнейших улучшений. По мере развития более мощных и эффективных DLM, этот метод может стать стандартом для сжатия не только обычного текста, но и исходного кода, а также структурированных форматов, таких как XML, что критически важно для оптимизации хранения цифровых данных.
Источник: arXiv cs.CL ↗
