Инструменты30 июля 2026 г., 13:16 МСК🤖 Auto

Tencent открыл AngelSpec: революция в спекулятивном декодировании для Hy3

Tencent выпустил фреймворк AngelSpec, объединяющий MTP и блок-параллельное декодирование. Решение решает проблему гетерогенности нагрузок, повышая скорость генерации кода и математики на моделях Qwen3 и Hy3.

Баннер новости 4711

Проблема универсальных драфтеров

Большинство существующих систем спекулятивного декодирования (Speculative Decoding) оптимизируются под усредненные бенчмарки, что не отражает реальную трафик-нагрузку. В открытых диалогах высока энтропия, и длинные последовательности токенов часто отклоняются целевой моделью. В то же время задачи программирования и математики имеют строгие синтаксические ограничения, позволяющие предсказывать длинные spans токенов. AngelSpec от Tencent отказывается от компромисса в пользу двух специализированных драфтеров: Multi-Token Prediction (MTP) для диалогов и DFly (на базе DFlash) для кода и математики.

Архитектура MTP: устранение разрыва между обучением и инференсом

Классические модели Hy3 обучаются с одним слоем MTP без рекуррентного разворачивания, что приводит к накоплению ошибок при генерации длинных цепочек. AngelSpec внедряет схему shared-parameter, multi-depth: один физический блок MTP используется для нескольких логических глубин предсказания. Ключевые инновации:

  • Training-Time Test (TTT): На глубине $k+1$ модель получает не ground-truth токен, а argmax-предсказание с глубины $k$, имитируя реальный инференс.
  • Заморозка бэкбона: Основная языковая модель и её голова заморожены, а входные данные от бэкбона отключены от вычислительного графа. Это позволяет драфтеру улучшать распределение предложений, не искажая распределение верификации.
  • Target-model rollout: Данные для обучения генерируются самой замороженной целевой моделью, что обеспечивает точное совпадение траекторий скрытых состояний и локальной неопределенности.

DFly: гибрид для кода и математики

Архитектура DFly улучшает DFlash двумя структурными изменениями. Во-первых, внедрен гибридный таргет-кондишнинг: добавлены веса слияния для каждого слоя, позволяя каждому драфтеру видеть иерархию целевой модели индивидуально, с минимальными накладными расходами ($D \times T$ скалярных весов). Во-вторых, добавлена предшественник-условная AR-голова, которая преобразует маргинальные предсказания в распределения, conditioned на префикс, устраняя decay принятия суффиксов.

Результаты бенчмарков

Инновации AngelSpec демонстрируют значительный прирост метрик принятия токенов (Mean Accepted Length) и скорости. Ниже приведено сравнение на моделях Qwen3-8B и Hy3-A21B:

Модель / Метрика DFly (AngelSpec) DSpark DFlash MTP (базовый)
Qwen3-8B (Avg. Accepted Length) 5.41 5.32 4.57 3.24
Qwen3-8B (MT-Bench) 3.67 3.77
Hy3-A21B (Avg. Accepted Length) 4.79 3.69 3.00
Hy3-A21B (GSM8K, p3) 0.706 0.290
Hy3-A21B (HumanEval, p3) 0.757 0.387

На Hy3-A21B DFly показывает относительный прирост в 29.8% над DFlash и 59.7% над MTP. Значительный вклад вносит расширение датасета: добавлено 700K промптов (500K кода из OpenCodeInstruct/Reasoning и 200K математики из Big-Math).

Инфраструктура и производительность

AngelSpec построен на базе TorchSpec и использует disaggregated architecture: инференс-движки (vLLM) передают скрытые состояния через RDMA-хранилище Mooncake напрямую в распределенные воркеры обучения. Это позволяет захватывать состояния внутри процессов vLLM без модификации исходного кода движка. Фреймворк поддерживает контексты до 128k токенов с использованием Ulysses sequence parallelism и гарантирует отсутствие утечки внимания между документами через специализированные gates.

Источник: MarkTechPost ↗