Подбор GPU для AI-инференса — это не просто покупка самой мощной карты. Это баланс между производительностью, задержкой (latency) и общей стоимостью владения (TCO). Ошибки в оценке требований к памяти или пропускной способности ведут либо к простаивающим ресурсам, либо к неприемлемому времени отклика. Ниже представлен фреймворк для точного расчета инфраструктуры на основе реальных паттернов токенов.
011. Классификация нагрузок и паттерны токенов
Все AI-задачи делятся на четыре категории, каждая из которых имеет уникальный профиль потребления GPU. Ключевые метрики: кэшированные входные токены (KV cache), новые входные токены и выходные токены.
| Категория | Кэш (Input) | Новый Input | Output | Пример |
|---|---|---|---|---|
| AI Чатботы/Копилоты | 1,000 – 5,000 | 2,000 – 8,000 | 200 – 800 | RAG, многооборотные диалоги |
| AI Агенты | > 128,000 | 500 – 1,000 | 200 – 300 | Глубокий анализ, extended RAG |
| Генерация контента | 50 – 300 | 200 – 1,000 | 1,000 – 4,000 | Генерация email, статей, поиска |
| Перевод | 50 – 250 | 200 – 1,000 | 200 – 1,000 | Языковой/кодовый перевод |
022. Ключевые входные данные для расчета
Для точного sizing необходимо собрать следующие метрики:
- Модель: Не всегда нужна самая большая. Используйте Nemotron 3.5 Lightning, Inkling Small или кастомные fine-tuned модели.
- DAU и Конкурентность: Количество активных пользователей в день и, что важнее, количество одновременных запросов. Высокая конкурентность «съедает» VRAM быстрее, чем просто объем трафика.
- ISL/OSL (Input/Output String Length): Длина промпта и ответа. Длинные строки требуют больше памяти под KV-cache.
- Метрики задержки: TTFT (время до первого токена), 99-й перцентиль задержки и интертокеновая задержка.
- Договорной срок: Стабильный трафик позволяет использовать on-prem или reserved instances. Волатильный — требует гибкости облака.
033. Стратегия Core & Flex
Оптимальная архитектура сочетает два типа мощностей:
- Core (База): On-prem или зарезервированные облачные GPU для стабильного трафика. Это снижает риск колебаний цен и обеспечивает надежность.
- Flex (Гибкость): Облачные spot/on-demand GPU для пиковых нагрузок, запусков новых моделей или экспериментов. Это превращает CapEx в OpEx, позволяя масштабироваться без переплаты за простой.
044. Оптимизация моделей: Quantization и Pruning
Снижение размера модели позволяет использовать более дешевые GPU без потери качества. NVIDIA Model Optimizer демонстрирует следующие результаты:
- FP8 Post-training Quantization: Сокращает память весов Llama-3.1-8B на 43.5% без переобучения.
- Pruning & Distillation: Позволяет создать студентскую модель ~6B параметров из учителя Qwen3-8B.
055. Практические сценарии
Сценарий А: Финансовый сектор (Копилот для менеджеров)
Задача: Анализ сложных писем клиентов (Long Input / Short Output).
Параметры: 5,000 input токенов, 500 output токенов. Целевой TTFT < 1 сек. Конкурентность: 10-50 сессий.
Рекомендация: Модели 7-13B параметров. Требуется GPU с 24GB VRAM (для 7-8B) или 48GB VRAM (для 13B) для размещения KV-cache. Precision: FP16/BF16 для точности.
Сценарий Б: Фармацевтика (AI Агенты)
Задача: Открытие новых лекарств, глубокий анализ данных.
Параметры: Контекст >128,000 токенов. Низкая конкурентность, но высокая потребность в памяти.
Рекомендация: GPU с большим объемом VRAM (A100/H100 или их аналоги). Приоритет — память, а не чистая скорость вычислений.
06Кому подойдёт / что запустится
- Для чат-ботов (7B-13B): NVIDIA L4, RTX 4090 (для тестов), A10G. Достаточно 24-48GB VRAM.
- Для агентов с длинным контекстом: NVIDIA A100 (80GB), H100. Требуется максимальный объем памяти.
- Для генерации контента: Акцент на пропускную способность (throughput). Подойдут карты с высокой памятью bandwidth, например, L40S.
- Оптимизация: Применяйте FP8 квантование через NVIDIA Model Optimizer для снижения требований к VRAM на 40%+.
Источник: NVIDIA Developer ↗
