Релиз модели8 сентября 2026 г., 17:19 МСК🤖 Auto

Qwen 3.8 27B на RTX 5090: VRAM — не панацея

Тестирование модели Qwen 3.8 27B на RTX 5090 показало, что одного GPU с 32 ГБ памяти недостаточно для комфортной работы. Без второго видеокарты или специфических оптимизаций скорость генерации остается низкой.

Баннер новости 7021

Проблема «узкого горлышка»

Алгоритмическая модель Qwen 3.8 27B от Alibaba вызвала ажиотаж благодаря соотношению цены и качества, но реальное тестирование на RTX 5090 выявило серьезные программные ограничения. Несмотря на то, что 4-битная квантованная версия модели занимает около 17 ГБ, для работы с длинным контекстом (до 262K токенов) требуется значительный запас VRAM. Оказалось, что одного GPU с 32 ГБ GDDR7 памяти недостаточно для эффективного вывода, так как не хватает места под контекстное окно и кэш.

Сравнение движков: llama.cpp, vLLM и SGLang

Тестирование показало критическую зависимость от выбранного inference-движка. llama.cpp на одной RTX 5090 оказался непригоден для продакшена: время до первого токена (TTFT) достигало 30 минут, а пропускная способность падала до абсурдных значений. Движки vLLM и SGLang показали себя лучше, но с оговорками:

Конфигурация / Движок Скорость (токенов/сек) Контекст Примечание
RTX 5090 + llama.cpp Критически низкая 262K (аллокация возможна) TTFT ~30 мин. Непригодно для работы.
RTX 5090 + vLLM (1 карта) ~20 t/s 32K (по умолчанию) Без MTP. Медленно для флагмана.
RTX 5090 + SGLang (1 карта) ~60 t/s (в 3x быстрее vLLM) ~37.7K Лучший выбор для одной карты.
2x RTX 5090 + vLLM (MTP) 100-110 t/s 262K Идеальный баланс скорости и контекста.

Почему нужна вторая карта или больше памяти?

Ключевая проблема — отсутствие поддержки Multi-Token Prediction (MTP) на одной RTX 5090 из-за нехватки памяти. MTP позволяет модели предсказывать несколько токенов за шаг, что резко ускоряет декодирование. В конфигурации с двумя RTX 5090 (стоимостью более $13,000) удалось достичь скорости 100-110 токенов в секунду при полном контексте 262K. Это единственный способ получить «фронтенд-уровень» производительности локально с этой моделью.

Вывод для энтузиастов

Если вам нужен быстрый ответ на короткий запрос, одной RTX 5090 с SGLang достаточно. Но для работы с длинными документами или сложными агентами, требующими полного контекстного окна, одного GPU мало. Либо нужно ждать GPU с 48-72 ГБ VRAM (например, RTX Pro Blackwell), либо собирать систему из двух карт. VRAM-емкость сама по себе не решает проблему, если софт не оптимизирован под архитектуру.

Источник: Tom's Hardware ↗