Проблема дискретности в диффузии
Диффузионные модели совершили революцию в генерации изображений, обеспечив высокое качество и контролируемое управление. Однако перенос этих механизмов на дискретную, последовательную природу текста остается сложной задачей. Существующие стратегии сэмплирования корректируют вероятности токенов, но не учитывают широкую семантическую картину, что приводит к субоптимальному балансу между верностью (fidelity) и разнообразием (diversity) генерируемого текста.
Решение: Метод SAKE
Авторы работы, опубликованной в arXiv (2026), предлагают метод Semantic-Aware Kernel Entropy (SAKE). Это подход без дообучения (training-free), который вычисляет энтропию Реньи второго порядка (order-2 Rényi entropy) на основе матрицы Грама ядра. Эта матрица захватывает как семантические взаимодействия между токенами, так и их относительные позиции.
Ключевая инновация заключается в линеаризации этой цели в пространстве эмбеддингов, что позволяет получить эффективный сигнал руководства. Алгоритм динамически корректирует распределение сэмплирования: он «сглаживает» его для поощрения исследования (exploration) в случаях избыточности и «затачивает» (sharpening) для повышения точности, когда разнообразие уже обеспечено.
Результаты и бенчмарки
Эмпирические эксперименты показывают, что SAKE достигает превосходной Парето-границы между верностью и разнообразием. Метод особенно эффективен в задачах, требующих глубокого рассуждения, таких как генерация кода и математических решений. Ниже приведено сравнение эффективности подхода с базовыми методами:
| Метод | Тип руководства | Основной механизм | Результат (Разнообразие vs Точность) |
|---|---|---|---|
| SAKE (предлагаемый) | Энтропийное (без дообучения) | Энтропия Реньи на матрице Грама | Лучшая Парето-граница, улучшение в задачах на рассуждение |
| Temperature Scaling | Базовый | Масштабирование температуры | Субоптимальный баланс, риск потери семантики |
| Discrete Guidance | Базовый | Коррекция вероятностей токенов | Не учитывает глобальный семантический ландшафт |
Значение для индустрии
Развитие текстовых диффузионных моделей открывает новые возможности для создания более креативных и надежных языковых моделей. Метод SAKE демонстрирует, что можно улучшить производительность в сложных задачах (код, математика), не прибегая к дорогостоящему дообучению моделей, а используя интеллектуальные алгоритмы сэмплирования на этапе инференса.
Источник: arXiv cs.CL ↗
