Проблема «узкого горлышка»
Алгоритмическая модель Qwen 3.8 27B от Alibaba вызвала ажиотаж благодаря соотношению цены и качества, но реальное тестирование на RTX 5090 выявило серьезные программные ограничения. Несмотря на то, что 4-битная квантованная версия модели занимает около 17 ГБ, для работы с длинным контекстом (до 262K токенов) требуется значительный запас VRAM. Оказалось, что одного GPU с 32 ГБ GDDR7 памяти недостаточно для эффективного вывода, так как не хватает места под контекстное окно и кэш.
Сравнение движков: llama.cpp, vLLM и SGLang
Тестирование показало критическую зависимость от выбранного inference-движка. llama.cpp на одной RTX 5090 оказался непригоден для продакшена: время до первого токена (TTFT) достигало 30 минут, а пропускная способность падала до абсурдных значений. Движки vLLM и SGLang показали себя лучше, но с оговорками:
| Конфигурация / Движок | Скорость (токенов/сек) | Контекст | Примечание |
|---|---|---|---|
| RTX 5090 + llama.cpp | Критически низкая | 262K (аллокация возможна) | TTFT ~30 мин. Непригодно для работы. |
| RTX 5090 + vLLM (1 карта) | ~20 t/s | 32K (по умолчанию) | Без MTP. Медленно для флагмана. |
| RTX 5090 + SGLang (1 карта) | ~60 t/s (в 3x быстрее vLLM) | ~37.7K | Лучший выбор для одной карты. |
| 2x RTX 5090 + vLLM (MTP) | 100-110 t/s | 262K | Идеальный баланс скорости и контекста. |
Почему нужна вторая карта или больше памяти?
Ключевая проблема — отсутствие поддержки Multi-Token Prediction (MTP) на одной RTX 5090 из-за нехватки памяти. MTP позволяет модели предсказывать несколько токенов за шаг, что резко ускоряет декодирование. В конфигурации с двумя RTX 5090 (стоимостью более $13,000) удалось достичь скорости 100-110 токенов в секунду при полном контексте 262K. Это единственный способ получить «фронтенд-уровень» производительности локально с этой моделью.
Вывод для энтузиастов
Если вам нужен быстрый ответ на короткий запрос, одной RTX 5090 с SGLang достаточно. Но для работы с длинными документами или сложными агентами, требующими полного контекстного окна, одного GPU мало. Либо нужно ждать GPU с 48-72 ГБ VRAM (например, RTX Pro Blackwell), либо собирать систему из двух карт. VRAM-емкость сама по себе не решает проблему, если софт не оптимизирован под архитектуру.
Источник: Tom's Hardware ↗
