Доступ к «фронтиру» на слабом железе
В условиях дефицита GPU и высоких цен на подписки к AI-сервисам, энтузиасты ищут способы локального запуска больших языковых моделей (LLM). Итальянский разработчик Vincenzo (JustVugg) представил проект Colibrì — Proof-of-Concept, который позволяет запускать модель GLM-5.2 (744 млрд параметров, вес 1.5 ТБ) на конфигурации, состоящей из обычного процессора, всего 25 ГБ оперативной памяти и виртуального NVMe-накопителя со скоростью 1 ГБ/с.
Архитектура MoE как ключ к оптимизации
GLM-5.2 использует архитектуру Mixture-of-Experts (MoE). В отличие от плотных моделей, где активируется вся сеть, MoE выбирает узкий набор «экспертов» для каждого токена. Colibrì использует эту особенность: вместо загрузки всей модели в память, он динамически подгружает и выгружает необходимые экспертные модули прямо во время генерации ответа. Код выбора экспертов реализован в виде одного файла на C с минимальными зависимостями, а сама модель предварительно квантована для экономии места.
Производительность: качество vs скорость
Главная проблема текущего решения — экстремально низкая скорость генерации. Из-за постоянного чтения данных с диска и работы с ОЗУ, Colibrì выдает всего 0.05–0.1 токена в секунду. Это делает модель непригодной для живого диалога (один ответ может занимать часы), но доказывает, что качество ответов находится на уровне передовых коммерческих решений (Anthropic, OpenAI).
Сравнение подходов к запуску LLM
| Параметр | Стандартный подход (GPU) | Colibrì (CPU + RAM) |
|---|---|---|
| Железо | Высокопроизводительные GPU (NVIDIA H100/A100) | Обычный CPU, 25 ГБ ОЗУ, NVMe 1 ГБ/с |
| Скорость | 20–30+ токенов/сек (реальное время) | 0.05–0.1 токенов/сек (асинхронно) |
| Метод доступа к памяти | Полная загрузка модели в VRAM | Потоковая загрузка экспертов per-token |
| Целевая аудитория | Data Centers, Enterprise | Home Lab энтузиасты, исследователи |
Перспективы и ограничения
Проект находится на стадии Proof-of-Concept и пока не поддерживает GPU, так как перемещение данных между картой и памятью остается узким местом. Однако успех Colibrì демонстрирует, что при наличии достаточной пропускной способности диска и памяти, запуск моделей «фронтирного» уровня на потребительском оборудовании технически возможен. Разработчик активно собирает бенчмарки и исправляет ошибки, открывая путь к более оптимизированным решениям для локальных AI-сетапов.
Источник: Tom's Hardware ↗
