Проблема конкуренции ресурсов при выводе
Одновременный авторегрессионный вывод (concurrent autoregressive inference) создает фундаментальную проблему интерференции: процесс префиллинга (prefill) нового длинного запроса может задерживать токены для уже идущих запросов, находящихся в фазе декодирования. Традиционные решения используют фиксированные чанки префиллинга, но оптимальный размер зависит от модели, оборудования, нагрузки и целевой задержки (SLO).
Решение: Decode-Latency Feedback Prefill (DLFP)
Авторы (Gaurav Agarwal, Ashish Garg, Isha Singhal) предлагают DLFP — контроллер, не требующий знаний о внутренней архитектуре модели (model-free). Алгоритм изменяет только ту работу префиллинга, которая пересекается с активным декодированием. После защищенного цикла планирования DLFP использует наблюдаемый интервал как пропорциональную обратную связь для изменения размера следующего чанка префиллинга. Изолированные префиллинги остаются без ограничений.
Результаты на Qwen3-0.6B: значимое ускорение
Эксперименты проводились в среде vLLM с использованием Poisson-распределения запросов, точного учета токенов и телеметрии NVIDIA. Тестирование на модели Qwen3-0.6B в формате BF16 на одной GPU NVIDIA A100 80 GB показало следующие результаты:
| Метрика | Результат | Примечание |
|---|---|---|
| Снижение P99 интер-токенной задержки | 27.7% (в среднем) | Диапазон: 24.8% – 30.1% (95% доверительный интервал 21.0%–34.3%) |
| Снижение P99 задержки первого токена (TTFT) | Рост на 34.8% | Остается в рамках заявленного SLO |
| Целостность вывода | 100% точное совпадение | Нет сбоев, SLO соблюдены |
Границы обобщения: почему это не работает для больших моделей
Ключевой вывод статьи — механизм не обобщается на более крупные модели и конфигурации. Тестирование на Qwen3-8B, Qwen3-32B и конфигурации с двумя GPU (tensor parallelism) показало провал. Причина кроется в том, что асинхронный интервал вызова планировщика является лишь прокси-метрикой для времени завершения итерации GPU, что делает простой feedback-механизм неэффективным в сложных сценариях.
Авторы подчеркивают, что работа является воспроизводимым proof-of-concept, определяющим границы применимости подхода, и мотивирует создание контроллеров, привязанных к реальному времени завершения (completion-timed), особенно для CPU и on-device инференса.
Источник: arXiv cs.AI ↗
