Проблема традиционного масштабирования
Обычное улучшение больших языковых моделей (LLM) требует увеличения размера трансформерного ядра (backbone). Для уже сильных моделей это означает запуск нового, крайне дорогого препроцессинга. Альтернативные подходы, такие как Depth-recurrent (зацикленные) трансформеры, позволяют добавлять вычисления, но они плохо совместимы с pipeline parallelism, используемым при обучении самых крупных моделей.
Решение: Hidden Decoding
Команда исследователей во главе с Aiwei Liu предложила метод Hidden Decoding, применяемый на этапе continued pretraining (CPT). Суть метода заключается в том, чтобы оставить архитектуру трансформера неизменной, но увеличить вычисления на каждый токен. Это достигается за счет расширения размерности последовательности:
- Каждый токен раскладывается на n независимых потоков (streams) с собственными таблицами эмбеддингов.
- Кэш ключей и значений (key-value cache) промежуточных потоков сохраняется как контекст.
- Метод совместим со стандартным обучением крупных моделей, так как работает с длиной последовательности, а не с глубиной сети.
Оптимизация: Stream-Factorized Attention
Прямое применение такого подхода привело бы к квадратичному росту стоимости внимания. Чтобы сделать метод масштабируемым, авторы внедрили Stream-Factorized Attention. В этой схеме большинство слоев внимания работают только внутри каждого потока, а лишь несколько слоев смешивают данные между потоками. Это снижает сложность вычислений с квадратичной до линейной относительно фактора расширения n.
Результаты на моделях WeLM
Метод был протестирован на моделях WeLM-HD4-80B и WeLM-HD4-617B (где индекс 4 указывает на фактор расширения последовательности). Результаты показали, что Hidden Decoding стал первым доказанным методом масштабирования длины последовательности для MoE-моделей масштаба 100B+. Улучшения были зафиксированы по сравнению с базовыми моделями без HD, причем прирост качества рос пропорционально увеличению n.
| Параметр | Значение / Описание |
|---|---|
| Метод | Hidden Decoding (расширение последовательности) |
| Оптимизация внимания | Stream-Factorized Attention (сложность ~O(n)) |
| Тестовые модели | WeLM-HD4-80B, WeLM-HD4-617B |
| Масштаб | 100B+ параметров (MoE архитектура) |
| Ключевое преимущество | Улучшение качества без переобучения ядра (backbone) |
Почему это важно
Hidden Decoding открывает новый путь для развития LLM. Если раньше для повышения интеллекта модели нужно было строить новые, более широкие или глубокие архитектуры, то теперь существующие мощные модели можно «дообучать» и усиливать, просто увеличивая вычислительные ресурсы, выделяемые на каждый токен. Это снижает барьер для создания передовых моделей и оптимизирует затраты на вычислительные мощности.
Источник: arXiv cs.CL ↗
