Релиз модели11 июля 2026 г., 15:16 МСК🤖 Auto

Colibrì: 1.5 ТБ модель GLM-5.2 работает на 25 ГБ ОЗУ

Итальянский инженер Vincenzo создал Proof-of-Concept Colibrì, позволяющий запускать 744-миллиардную MoE-модель на обычном CPU с 25 ГБ памяти, жертвуя скоростью ради доступности.

Баннер новости 3382

Доступ к «фронтиру» на слабом железе

В условиях дефицита GPU и высоких цен на подписки к AI-сервисам, энтузиасты ищут способы локального запуска больших языковых моделей (LLM). Итальянский разработчик Vincenzo (JustVugg) представил проект Colibrì — Proof-of-Concept, который позволяет запускать модель GLM-5.2 (744 млрд параметров, вес 1.5 ТБ) на конфигурации, состоящей из обычного процессора, всего 25 ГБ оперативной памяти и виртуального NVMe-накопителя со скоростью 1 ГБ/с.

Архитектура MoE как ключ к оптимизации

GLM-5.2 использует архитектуру Mixture-of-Experts (MoE). В отличие от плотных моделей, где активируется вся сеть, MoE выбирает узкий набор «экспертов» для каждого токена. Colibrì использует эту особенность: вместо загрузки всей модели в память, он динамически подгружает и выгружает необходимые экспертные модули прямо во время генерации ответа. Код выбора экспертов реализован в виде одного файла на C с минимальными зависимостями, а сама модель предварительно квантована для экономии места.

Производительность: качество vs скорость

Главная проблема текущего решения — экстремально низкая скорость генерации. Из-за постоянного чтения данных с диска и работы с ОЗУ, Colibrì выдает всего 0.05–0.1 токена в секунду. Это делает модель непригодной для живого диалога (один ответ может занимать часы), но доказывает, что качество ответов находится на уровне передовых коммерческих решений (Anthropic, OpenAI).

Сравнение подходов к запуску LLM

Параметр Стандартный подход (GPU) Colibrì (CPU + RAM)
Железо Высокопроизводительные GPU (NVIDIA H100/A100) Обычный CPU, 25 ГБ ОЗУ, NVMe 1 ГБ/с
Скорость 20–30+ токенов/сек (реальное время) 0.05–0.1 токенов/сек (асинхронно)
Метод доступа к памяти Полная загрузка модели в VRAM Потоковая загрузка экспертов per-token
Целевая аудитория Data Centers, Enterprise Home Lab энтузиасты, исследователи

Перспективы и ограничения

Проект находится на стадии Proof-of-Concept и пока не поддерживает GPU, так как перемещение данных между картой и памятью остается узким местом. Однако успех Colibrì демонстрирует, что при наличии достаточной пропускной способности диска и памяти, запуск моделей «фронтирного» уровня на потребительском оборудовании технически возможен. Разработчик активно собирает бенчмарки и исправляет ошибки, открывая путь к более оптимизированным решениям для локальных AI-сетапов.

Источник: Tom's Hardware ↗