Исследования30 сентября 2026 г., 07:17 МСК🤖 Auto

DASA: Синтетические данные без текста обгоняют GRADMM в 4.9 раза

Исследователи представили метод DASA, позволяющий обучать LLM через непрерывные эмбеддинги, игнорируя читаемость текста. Это ускоряет процесс в 3.6–4.9 раза по сравнению с аналогами.

Баннер новости 8569

Отказ от языка ради скорости

Команда исследователей во главе с Цзиньхао Чжаном (Jinhao Zhang) представила метод Desired-Update-Aligned Synthetic Data (DASA). Основная гипотеза работы: для эффективной тонкой настройки (fine-tuning) больших языковых моделей (LLM) не обязательно использовать текст, понятный человеку. Вместо этого предлагается использовать непрерывные синтетические эмбеддинги, оптимизируемые на основе градиентов активации замороженной референсной модели.

Ключевое отличие DASA от традиционных подходов (таких как GRADMM) заключается в цели оптимизации. Метод нацелен на полезность адаптационных обновлений, а не на реконструкцию исходного текста или лингвистическую беглость. Дискретные токены используются только для качественной проверки, но не влияют на сам процесс обучения.

Масштабное тестирование на Llama и Qwen

Эксперименты охватили шесть моделей семейств Llama и Qwen с объемом от 1B до 32B параметров. Оценка проводилась по шести бенчмаркам, включающим знание, математическое мышление, генерацию кода и здравый смысл. Результаты показали, что DASA достигает производительности, сопоставимой с использованием исходных данных на естественном языке, и превосходит их в ряде конфигураций.

Сравнение эффективности

Главное преимущество метода — радикальное ускорение процесса синтеза данных. При сравнимом пиковом потреблении GPU-памяти DASA демонстрирует значительный выигрыш в скорости относительно метода GRADMM.

Метрика DASA GRADMM (базовый) Примечание
Ускорение синтеза 3.6–4.9× 1× При равном потреблении VRAM
Качество (Accuracy) Comparable / Superior Baseline На бенчмарках Llama/Qwen 1B-32B
Тип данных Continuous Embeddings Text/Embeddings Не требует human-readable формы

Почему это важно для индустрии

Результаты исследования бросают вызов устоявшемуся представлению о том, что данные для обучения должны быть семантически интерпретируемы людьми. Использование "машинно-понятных" представлений позволяет сократить вычислительные затраты на подготовку датасетов, что критически важно для коммерческого внедрения кастомизированных LLM. Метод открывает путь к созданию более быстрых пайплайнов дообучения моделей под специфические задачи без необходимости генерации и фильтрации текстового контента.

Источник: arXiv cs.AI ↗