Исследования11 июля 2026 г., 09:16 МСК🤖 Auto

Hidden Decoding: как WeLM-80B и 617B улучшили себя без переобучения

Исследователи представили метод Hidden Decoding, позволяющий увеличивать вычислительную мощность LLM за счет расширения последовательности, а не архитектуры. Это первый успешный опыт масштабирования MoE-моделей 100B+ без дорогостоящего препроцессинга

Баннер новости 3366

Проблема традиционного масштабирования

Обычное улучшение больших языковых моделей (LLM) требует увеличения размера трансформерного ядра (backbone). Для уже сильных моделей это означает запуск нового, крайне дорогого препроцессинга. Альтернативные подходы, такие как Depth-recurrent (зацикленные) трансформеры, позволяют добавлять вычисления, но они плохо совместимы с pipeline parallelism, используемым при обучении самых крупных моделей.

Решение: Hidden Decoding

Команда исследователей во главе с Aiwei Liu предложила метод Hidden Decoding, применяемый на этапе continued pretraining (CPT). Суть метода заключается в том, чтобы оставить архитектуру трансформера неизменной, но увеличить вычисления на каждый токен. Это достигается за счет расширения размерности последовательности:

  • Каждый токен раскладывается на n независимых потоков (streams) с собственными таблицами эмбеддингов.
  • Кэш ключей и значений (key-value cache) промежуточных потоков сохраняется как контекст.
  • Метод совместим со стандартным обучением крупных моделей, так как работает с длиной последовательности, а не с глубиной сети.

Оптимизация: Stream-Factorized Attention

Прямое применение такого подхода привело бы к квадратичному росту стоимости внимания. Чтобы сделать метод масштабируемым, авторы внедрили Stream-Factorized Attention. В этой схеме большинство слоев внимания работают только внутри каждого потока, а лишь несколько слоев смешивают данные между потоками. Это снижает сложность вычислений с квадратичной до линейной относительно фактора расширения n.

Результаты на моделях WeLM

Метод был протестирован на моделях WeLM-HD4-80B и WeLM-HD4-617B (где индекс 4 указывает на фактор расширения последовательности). Результаты показали, что Hidden Decoding стал первым доказанным методом масштабирования длины последовательности для MoE-моделей масштаба 100B+. Улучшения были зафиксированы по сравнению с базовыми моделями без HD, причем прирост качества рос пропорционально увеличению n.

Параметр Значение / Описание
Метод Hidden Decoding (расширение последовательности)
Оптимизация внимания Stream-Factorized Attention (сложность ~O(n))
Тестовые модели WeLM-HD4-80B, WeLM-HD4-617B
Масштаб 100B+ параметров (MoE архитектура)
Ключевое преимущество Улучшение качества без переобучения ядра (backbone)

Почему это важно

Hidden Decoding открывает новый путь для развития LLM. Если раньше для повышения интеллекта модели нужно было строить новые, более широкие или глубокие архитектуры, то теперь существующие мощные модели можно «дообучать» и усиливать, просто увеличивая вычислительные ресурсы, выделяемые на каждый токен. Это снижает барьер для создания передовых моделей и оптимизирует затраты на вычислительные мощности.

Источник: arXiv cs.CL ↗