Точные цифры потребления VRAM
Мифы о том, что для работы с большими языковыми моделями (LLM) всегда нужны серверные GPU, разбиваются о конкретные метрики. Исследование выделяет два ключевых показателя для модели размером 8 миллиардов параметров (8B):
- Полное дообучение (Full Fine-Tuning): требует 18.9 GiB видеопамяти. Это стандартный подход, когда обновляются веса всей нейросети.
- Дообучение с адаптерами (LoRA/Adapters): достаточно 7.4 GiB. Методы параметрически-эффективного дообучения (PEFT) позволяют «заморозить» основную часть модели и обучать только небольшие дополнительные слои.
Три уровня аппаратных требований
На основе этих данных можно выделить три практических уровня конфигураций для разработчиков и энтузиастов:
| Уровень | Объем VRAM | Возможности |
|---|---|---|
| Базовый | 8 ГБ | Только LoRA/Adapters для моделей 7B-8B. Полное обучение невозможно. |
| Средний | 12 ГБ | LoRA для моделей 7B-13B. Полное обучение моделей 7B с оптимизациями (например, QLoRA). |
| Продвинутый | 32 ГБ+ | Полное дообучение моделей 8B. LoRA для моделей 13B-30B. Комфортная работа с контекстом. |
Почему это важно?
Разница между 7.4 ГБ и 18.9 ГБ — это пропасть для владельцев потребительских видеокарт. Карта уровня NVIDIA RTX 3060 (12 ГБ) или RTX 4090 (24 ГБ) позволяет запускать локальные LLM, но выбор метода дообучения диктуется жесткими рамками памяти. Использование адаптеров снижает требования более чем в 2.5 раза, делая тонкую настройку доступной на бюджетном оборудовании без необходимости аренды облачных GPU.
Источник: Towards AI pub ↗