Проблема универсальных драфтеров
Большинство существующих систем спекулятивного декодирования (Speculative Decoding) оптимизируются под усредненные бенчмарки, что не отражает реальную трафик-нагрузку. В открытых диалогах высока энтропия, и длинные последовательности токенов часто отклоняются целевой моделью. В то же время задачи программирования и математики имеют строгие синтаксические ограничения, позволяющие предсказывать длинные spans токенов. AngelSpec от Tencent отказывается от компромисса в пользу двух специализированных драфтеров: Multi-Token Prediction (MTP) для диалогов и DFly (на базе DFlash) для кода и математики.
Архитектура MTP: устранение разрыва между обучением и инференсом
Классические модели Hy3 обучаются с одним слоем MTP без рекуррентного разворачивания, что приводит к накоплению ошибок при генерации длинных цепочек. AngelSpec внедряет схему shared-parameter, multi-depth: один физический блок MTP используется для нескольких логических глубин предсказания. Ключевые инновации:
- Training-Time Test (TTT): На глубине $k+1$ модель получает не ground-truth токен, а argmax-предсказание с глубины $k$, имитируя реальный инференс.
- Заморозка бэкбона: Основная языковая модель и её голова заморожены, а входные данные от бэкбона отключены от вычислительного графа. Это позволяет драфтеру улучшать распределение предложений, не искажая распределение верификации.
- Target-model rollout: Данные для обучения генерируются самой замороженной целевой моделью, что обеспечивает точное совпадение траекторий скрытых состояний и локальной неопределенности.
DFly: гибрид для кода и математики
Архитектура DFly улучшает DFlash двумя структурными изменениями. Во-первых, внедрен гибридный таргет-кондишнинг: добавлены веса слияния для каждого слоя, позволяя каждому драфтеру видеть иерархию целевой модели индивидуально, с минимальными накладными расходами ($D \times T$ скалярных весов). Во-вторых, добавлена предшественник-условная AR-голова, которая преобразует маргинальные предсказания в распределения, conditioned на префикс, устраняя decay принятия суффиксов.
Результаты бенчмарков
Инновации AngelSpec демонстрируют значительный прирост метрик принятия токенов (Mean Accepted Length) и скорости. Ниже приведено сравнение на моделях Qwen3-8B и Hy3-A21B:
| Модель / Метрика | DFly (AngelSpec) | DSpark | DFlash | MTP (базовый) |
|---|---|---|---|---|
| Qwen3-8B (Avg. Accepted Length) | 5.41 | 5.32 | 4.57 | 3.24 |
| Qwen3-8B (MT-Bench) | 3.67 | 3.77 | — | — |
| Hy3-A21B (Avg. Accepted Length) | 4.79 | — | 3.69 | 3.00 |
| Hy3-A21B (GSM8K, p3) | 0.706 | — | — | 0.290 |
| Hy3-A21B (HumanEval, p3) | 0.757 | — | — | 0.387 |
На Hy3-A21B DFly показывает относительный прирост в 29.8% над DFlash и 59.7% над MTP. Значительный вклад вносит расширение датасета: добавлено 700K промптов (500K кода из OpenCodeInstruct/Reasoning и 200K математики из Big-Math).
Инфраструктура и производительность
AngelSpec построен на базе TorchSpec и использует disaggregated architecture: инференс-движки (vLLM) передают скрытые состояния через RDMA-хранилище Mooncake напрямую в распределенные воркеры обучения. Это позволяет захватывать состояния внутри процессов vLLM без модификации исходного кода движка. Фреймворк поддерживает контексты до 128k токенов с использованием Ulysses sequence parallelism и гарантирует отсутствие утечки внимания между документами через специализированные gates.
Источник: MarkTechPost ↗
