Почему 24 ГБ — это новый стандарт
В 2026 году стратегия локального запуска LLM изменилась. Забыть про попытку запихнуть 70B-модели в квантовании — это путь к стабильной работе. Оптимальный диапазон для одной видеокарты (RTX 3090/4090) — модели от 20 до 35 миллиардов параметров. Это позволяет оставить память для контекстного окна и обеспечить высокую скорость отклика для агентов и кодинга.
Математика VRAM: как не упереться в потолок
Память потребляется тремя компонентами. Ключевой момент 2026 года: для Mixture-of-Experts (MoE) моделей память считается по общему числу параметров, а не активных. Все «эксперты» остаются в VRAM.
- Веса модели: При квантовании Q4_K_M (стандарт качества/размера) 1 параметр занимает ~0.58 байта. Модель 32B весит ~18–20 ГБ.
- KV-кэш: Растет с длиной контекста. На коротких промптах закладывайте 1–2 ГБ.
- Оверлей рантайма: Около 1–2 ГБ под движок (Ollama, vLLM, llama.cpp).
Лучшие модели для 24 ГБ GPU
Все представленные модели имеют перmissive-лицензии (Apache 2.0 или MIT) и помещаются в 24 ГБ при квантовании Q4_K_M. Ниже сравнение ключевых игроков:
| Модель | Архитектура | Размер (Q4_K_M) | Лучшее применение |
|---|---|---|---|
| Qwen3.6-27B | Dense (27B) | ~16 ГБ | Универсальный выбор, агенты, кодинг, репозитории |
| Qwen3.6-35B-A3B | MoE (35B / 3B active) | ~20 ГБ | Скорость генерации, общие задачи, использование инструментов |
| Gemma 4 26B | MoE (26B / 3.8B active) | ~15–16 ГБ | Мультимодальность (vision), 140+ языков |
| Mistral Small 3.2 24B | Dense (24B) | ~14 ГБ | Ежедневный ассистент, низкая задержка, длинный контекст |
| gpt-oss-20b | MoE (21B / 3.6B active) | ~14 ГБ | Структурное рассуждение, tool-use (OpenAI) |
| DeepSeek-R1-Distill-Qwen-32B | Dense (32B) | ~18–20 ГБ | Глубокое логическое мышление, Chain-of-Thought |
Что НЕ влезет на одну карту
Флагманы 2026 года, такие как GLM-5.2 (753B), Kimi K2.7 (~1T), DeepSeek V4 (1.6T) и Qwen3.5-397B, требуют серверных конфигураций с несколькими GPU или unified memory. Они доступны только через API. Для локального запуска на одной RTX 3090/4090 они недоступны.
Инструментарий
Для запуска используйте Ollama (простота), llama.cpp (контроль GGUF) или vLLM (высокая пропускная способность). Главное правило 2026 года: выбирайте модель под конкретную задачу, а не пытайтесь запустить самый большой файл, который физически влезет в память.
Источник: MarkTechPost ↗
