Исследования1 октября 2026 г., 11:17 МСК🤖 Auto

DLFP: Как обратная связь по задержке ускорила Qwen3 на 27% (и где это не сработало)

Исследователи представили модель-независимый контроллер DLFP для vLLM, снизивший P99 задержку токенов на 27.7% на Qwen3-0.6B, но выявивший жесткие границы обобщения для больших моделей.

Баннер новости 8677

Проблема конкуренции ресурсов при выводе

Одновременный авторегрессионный вывод (concurrent autoregressive inference) создает фундаментальную проблему интерференции: процесс префиллинга (prefill) нового длинного запроса может задерживать токены для уже идущих запросов, находящихся в фазе декодирования. Традиционные решения используют фиксированные чанки префиллинга, но оптимальный размер зависит от модели, оборудования, нагрузки и целевой задержки (SLO).

Решение: Decode-Latency Feedback Prefill (DLFP)

Авторы (Gaurav Agarwal, Ashish Garg, Isha Singhal) предлагают DLFP — контроллер, не требующий знаний о внутренней архитектуре модели (model-free). Алгоритм изменяет только ту работу префиллинга, которая пересекается с активным декодированием. После защищенного цикла планирования DLFP использует наблюдаемый интервал как пропорциональную обратную связь для изменения размера следующего чанка префиллинга. Изолированные префиллинги остаются без ограничений.

Результаты на Qwen3-0.6B: значимое ускорение

Эксперименты проводились в среде vLLM с использованием Poisson-распределения запросов, точного учета токенов и телеметрии NVIDIA. Тестирование на модели Qwen3-0.6B в формате BF16 на одной GPU NVIDIA A100 80 GB показало следующие результаты:

Метрика Результат Примечание
Снижение P99 интер-токенной задержки 27.7% (в среднем) Диапазон: 24.8% – 30.1% (95% доверительный интервал 21.0%–34.3%)
Снижение P99 задержки первого токена (TTFT) Рост на 34.8% Остается в рамках заявленного SLO
Целостность вывода 100% точное совпадение Нет сбоев, SLO соблюдены

Границы обобщения: почему это не работает для больших моделей

Ключевой вывод статьи — механизм не обобщается на более крупные модели и конфигурации. Тестирование на Qwen3-8B, Qwen3-32B и конфигурации с двумя GPU (tensor parallelism) показало провал. Причина кроется в том, что асинхронный интервал вызова планировщика является лишь прокси-метрикой для времени завершения итерации GPU, что делает простой feedback-механизм неэффективным в сложных сценариях.

Авторы подчеркивают, что работа является воспроизводимым proof-of-concept, определяющим границы применимости подхода, и мотивирует создание контроллеров, привязанных к реальному времени завершения (completion-timed), особенно для CPU и on-device инференса.

Источник: arXiv cs.AI ↗