Главная/Блог/Гайд/Tencent AngelSpec: Новый стандарт…
Гайд10 мин чтения · 30 июля 2026 г.

Tencent AngelSpec: Новый стандарт обучения моделей для спекулятивного декодирования

Tencent открыла исходный код AngelSpec — фреймворка для обучения черновых моделей, который объединяет MTP и блочное параллельное декодирование, значительно ускоряя работу LLM.

Tencent AngelSpec: Новый стандарт обучения моделей для спекулятивного декодирования

В мире больших языковых моделей (LLM) скорость генерации текста долгое время оставалась главным узким местом. Пользователи привыкли к мгновенному отклику чат-ботов, но за кажущейся простотой скрывается сложнейшая вычислительная задача: модель должна предсказать следующее слово, затем следующее за ним, и так далее, шаг за шагом. Однако технология спекулятивного декодирования (speculative decoding) предлагает элегантное решение этой проблемы. Она позволяет легковесной «черновой» модели (draft model) предложить несколько токенов вперед, а мощной целевой модели (target model) — проверить их все за один проход. Tencent, один из гигантов китайского технологического сектора, недавно выпустила AngelSpec — открытый, нативный для PyTorch фреймворк, который революционизирует этот процесс. Это не просто еще одна библиотека, а комплексная система, объединяющая авторегрессионное предсказание нескольких токенов (MTP) и блочное параллельное декодирование (DFlash family) в единую архитектуру.

Большинство существующих подходов к спекулятивному декодированию ищут одну универсальную черновую модель, которая показывает хорошие результаты на усредненных бенчмарках. Но реальность такова, что трафик в продакшене редко выглядит как усредненный набор тестов. AngelSpec рассматривает гетерогенность рабочих нагрузок как первоклассное проектное ограничение. Система специализирует структуру, обучающие данные и глубину верификации в зависимости от конкретной задачи. Вместо компромисса, который часто приводит к посредственным результатам в обеих областях, AngelSpec предлагает два互补ных черновых моделиста: один для открытых диалогов, другой — для кода и математики.

В этой статье мы подробно разберем, как работает AngelSpec, почему старые подходы терпят неудачу в специфических сценариях, и как новая архитектура DFly достигает рекордных показателей ускорения. Мы также рассмотрим технические детали обучения, интеграцию с vLLM и практические последствия этого открытия для разработчиков AI, работающих в условиях ограниченных ресурсов или высоких требований к скорости.

01Почему одна универсальная черновая модель не работает

Чтобы понять инновационность AngelSpec, нужно сначала разобраться в механике спекулятивного декодирования. Этот метод является без потерь (lossless), то есть он не влияет на качество выходных данных модели, а лишь ускоряет процесс генерации. Легковесная черновая модель предлагает несколько будущих токенов, а целевая модель проверяет их вместе за один прямой проход (forward pass), используя выборку с отклонением (rejection sampling). Ускорение зависит от двух ключевых факторов: сколько предложенных токенов будет принято и сколько времени занимает полный цикл «предложение-проверка».

Проблема в том, что эти две величины движутся в противоположных направлениях в зависимости от домена. В сценариях с высокой энтропией, таких как открытые беседы или креативное письмо, существует множество семантически корректных продолжений. Целевая модель может выбрать любое из них, поэтому вероятность принятия предложения быстро падает с глубиной прогноза. Генерация и проверка длинного блока в таком случае тратят вычислительные ресурсы впустую. Здесь лучше всего подходит авторегрессионное MTP-черновое моделирование, которое предлагает более короткие последовательности кандидатов, снижая риск ошибки.

Ситуация кардинально меняется в задачах программирования и математического вывода. Синтаксис кода, повторяющиеся идентификаторы, формальные выражения и пошаговые выводы сильно ограничивают будущие токены. Эти рабочие нагрузки создают более длинные предсказуемые участки, которые идеально подходят для блочного параллельного черновика, так как позволяют эффективно амортизировать затраты на проверку. AngelSpec признает это фундаментальное различие и поэтому поставляется с двумя дополняющими друг друга черновиками, а не с одной компромиссной моделью. MTP-модель обучается на богатых, разнообразных данных, ориентированных на разговоры, в то время как модель блочной диффузии (DFly) усиливается образцами, сфокусированными на коде и математике.

Путь MTP: Тест во время обучения и развертывание целевой модели

Оригинальная модель Hy3 обучалась с использованием одного слоя MTP и без рекурсивного самосопряженного развертывания. Хотя во время вывода блок мог использоваться рекурсивно, цель обучения никогда не готовила его к длинной самогенерируемой цепочке. Ошибки накапливаются с глубиной, поэтому вторая и третья позиции черновика принимают токены с существенно более низкой частотой, чем первая. AngelSpec решает это несоответствие между обучением и выводом с помощью схемы общих параметров и многоуровневости.

Tencent AngelSpec: Новый стандарт обучения моделей для спекулятивного декодирования

Система сохраняет логические глубины предсказания, но переиспользует один физический блок MTP. Во время обучения этот блок авторегрессионно развертывается на k шагов, причем каждое предсказание подается в следующее вызов. Следуя принципу Training-Time Test (TTT) из EAGLE-3, глубина k+1 получает предсказание arg max от глубины k, а не токен из обучающей выборки. Параметры общие, но надзор остается специфичным для глубины: учительская целевая модель продвигается на одну будущую позицию на каждой глубине.

Два других выбора несут основную часть прироста производительности. Во-первых, целевой остов (backbone) и заголовок языковой модели целевой модели заморожены (frozen), а входы MTP от остова отключены. Черновая модель улучшает свое распределение предложений, не затрагивая распределение, которое должна сохранять верификация. Во-вторых, обучение использует развертывание целевой модели (target-model rollout): ответы генерируются замороженной целевой моделью, а не берутся из оригинальной референсной корпусной базы. Это создает точные выборки токенов, траектории скрытых состояний и локальные паттерны неопределенности, которые MTP должна аппроксимировать во время обслуживания.

Измеренный эффект сосредоточен там, где он должен быть. При температуре T = 0 среднее принятие возрастает с 52,8% до 66,4%, а средняя длина принятых токенов — с 2,58 до 2,99. Скорость на первой позиции почти сохраняется (0,799 → 0,814). Дельта приходится на более глубокие позиции: p3 поднимается с 0,290 до 0,706 на GSM8K и с 0,387 до 0,757 на HumanEval.

💡
Ключевой инсайт. Замораживание целевой модели и использование ее собственных генераций для обучения черновика (rollout) позволяет избежать рассогласования распределений. Черновик учится предсказывать то, что целевая модель реально выберет, а не то, что было в статичном датасете.

02DFly: Гибридная целевая условность и авторегрессионная голова

DFly — это архитектура блочной диффузии, которая строится на базе DFlash, внося два структурных изменения. Первое изменение касается гибридного целевого остова (hybrid target-conditioning backbone). DFlash конкатенирует скрытые состояния из нескольких слоев целевой модели и преобразует их полносвязным слоем, создавая одну общую контекстную функцию. Этот единственный контекст затем поставляется каждому слою черновика, что ограничивает специализацию слоев. DFlare, в свою очередь, учит веса слияния для каждого слоя, давая каждому слою черновика свой взгляд на иерархию целевой модели, но отказывается от обучаемого кросс-слоевого преобразования DFlash. DFli комбинирует их: ветвь FC устанавливает общую семантическую основу, а слияние по слоям применяется как остаточное уточнение (residual refinement) сверху. Дополнительная ветвь вводит только D × T скалярных весов, а коэффициенты softmax могут быть предварительно вычислены после обучения.

Второе изменение — это авторегрессионная голова, обусловленная предшественником (predecessor-conditioned autoregressive head). Параллельный остов предсказывает каждую позицию блока только из принятого контекста. Он не видит, какое продолжение было фактически выбрано на более ранних позициях черновика, что приводит к спаду принятия суффиксов. DFli размещает небольшую последовательную голову после параллельного остова, преобразуя позиционно-маргинальные предсказания в распределения, обусловленные префиксом. Дорогой остов остается полностью параллельным; только маленькая голова работает слева направо.

Ранние результаты производительности

На модели Qwen3-8B DFli достигает средней длины принятых токенов 5,41, против 5,32 для DSpark, 4,57 для DFlash и 3,24 для MTP. Она показывает лучший результат на всех пяти бенчмарках по математике и коду. DSpark остается немного впереди на MT-Bench с показателем 3,77 против 3,67, что согласуется с позиционированием DFli для кода и математики.

Tencent AngelSpec: Новый стандарт обучения моделей для спекулятивного декодирования

На Hy3-A21B разрыв еще шире. DFli достигает 4,79 против 3,69 для DFlash и 3,00 для MTP — относительные приросты составляют 29,8% и 59,7%. Она улучшает каждый из шести сообщенных бенчмарков. Кумулятивный абляционный анализ на Hy3-A21B при жадном декодировании показывает источник этого успеха: остов DFlash — 3,77, остов DFli — 4,40, плюс голова Маркова — 4,56, коррекция скрытых состояний — 4,60, и данные по коду/математике — 4,75. Расширение данных добавляет 700K промптов — 500K кода из OpenCodeInstruct и OpenCodeReasoning, 200K математики из Big-Math. Любой промпт, имеющий непрерывный 16-токенный спан с примером оценки, удаляется перед генерацией ответа.

03Внутреннее устройство фреймворка

AngelSpec построен на базе TorchSpec и расширяет его в нескольких местах. Фундамент является разделенным (disaggregated): движки вывода запускают замороженную целевую модель и потоково передавают скрытые состояния через хранилище RDMA на базе Mooncake непосредственно распределенным рабочим процессам обучения. Скрытые состояния захватываются внутри процессов рабочих vLLM через общедоступные API vLLM — хук извлечения скрытых состояний спекулятивного декодирования и пользовательский KV-коннектор — без форка движка.

Расширения, имеющие значение для этой работы:

  • TTT rollout: развернут параллельно по всей последовательности, со структурой внимания causal-prefix-plus-diagonal, воспроизведенной неявно через скомпилированный FlexAttention и слияние logsumexp. Память остается близкой к одному каузальному проходу.
  • Обучение с длинным контекстом: с параллелизмом последовательности Ulysses, проверенное на длинах контекста до 128k токенов. Каждый локальный шард несет token гало, чтобы надзор со сдвигом глубины оставался ранг-локальным.
  • Упаковка последовательностей, aware к документам: с тремя механизмами изоляции — вратарем внимания к документу, вратарем глубины-сдвига, специфичным для пути MTP, и позиционным кодированием, локальным для документа. Кросс-документная изоляция покрывается модульными тестами, проверяющими нулевую утечку внимания.
  • Сервер оценки: периодически запускает настоящее спекулятивное декодирование против последнего чекпоинта на выделенных GPU, сообщая среднюю длину принятых токенов и принятие по позициям, как измеряется самим движком обслуживания.
  • Плагинные интерфейсы: на трех уровнях: цели (точка входа плагина vLLM во время выполнения, без патчей исходного кода), цели (составлены поверх общего базиса, выбираются конфигурацией) и оптимизаторы (Muon как альтернатива AdamW).

Бэкенды разделены на уровни: vLLM является первоклассным, с SGLang и HuggingFace Transformers, поддерживаемыми на уровне сообщества.

⚠️
Важно для разработчиков. Архитектура AngelSpec позволяет интегрировать обучение черновых моделей в существующие пайплайны без необходимости переписывать движки вывода. Использование vLLM API и RDMA-хранилища Mooncake минимизирует накладные расходы на передачу данных между GPU.

04Ключевые выводы и практическое применение

Семь чекпоинтов доступны на Hugging Face и ModelScope, включая варианты DFli без размышлений (no-think) и с высокими размышлениями (high-think). AngelSpec обучает шесть архитектур черновиков — DFli, DFlash, DFlare, Eagle3, DSpark, MTP — за одной конфигурационно-управляемой трубой. DFli поднимает среднюю длину принятых токенов на Hy3-A21B до 4,79, против 3,69 для DFlash и 3,00 для MTP.

Tencent AngelSpec: Новый стандарт обучения моделей для спекулятивного декодирования

На HY3-295B-A21B с TP=8, DFli-8 обеспечивает ускорение в 1,98–2,40 раза по сравнению с авторегрессионным декодированием при конкурентности от 4 до 64. D-cut толкает пропускную способность живого трафика до 981 токенов/с при c64, увеличивая на 15,7% по сравнению с DFli, жертвуя при этом 2,8% принятием.

05Что это значит на практике

Для разработчиков AI, работающих в России и других регионах с ограниченным доступом к облачным GPU, AngelSpec представляет собой не просто академическое достижение, а практический инструмент для оптимизации. Открытый код и доступные чекпоинты позволяют локально запускать ускоренные LLM без необходимости покупки дорогостоящего оборудования для обучения с нуля. Интеграция с vLLM означает, что вы можете внедрить спекулятивное декодирование в свои существующие сервисы с минимальными изменениями в коде.

Особенно важно это для задач, требующих высокой пропускной способности: генерация кода, анализ данных, работа с длинными документами. Использование гибридной модели DFli позволяет получить значительный прирост скорости именно там, где это критично — в предсказуемых, структурированных задачах. Для открытых диалогов можно использовать MTP-модель, которая лучше справляется с вариативностью языка. Таким образом, AngelSpec дает гибкость, позволяющую адаптировать модель под конкретные потребности бизнеса, экономя ресурсы и время пользователей.

Исследование демонстрирует, что будущее эффективного AI лежит не только в увеличении размера моделей, но и в умной оптимизации процесса их работы. AngelSpec — это шаг в правильном направлении, предлагающий сообществу мощный набор инструментов для создания быстрых, эффективных и доступных языковых моделей.

Все кредиты за это исследование принадлежат исследователям проекта. Исследователи Tencent предоставили открытый доступ к коду, документации и моделям, что способствует развитию экосистемы open-source AI.

Ссылки на ресурсы:

Источник: MarkTechPost ↗

Tencent AngelSpec: Обучение черновых моделей для LLM | AIKraft