LocalAI — это мощный open-source движок, который позволяет развернуть локальную инфраструктуру ИИ, полностью совместимую с API OpenAI, Anthropic и ElevenLabs. Это решение идеально подходит для практиков, которые хотят сохранить конфиденциальность данных, избежать ежемесячных подписок и получить доступ к широкому спектру моделей (LLM, генерация изображений, распознавание речи) на собственном оборудовании. Архитектура LocalAI модульна: вы устанавливаете только те бэкенды, которые нужны для конкретных моделей, что экономит ресурсы системы.
01Требования
Для работы LocalAI требуется базовая среда выполнения. Поскольку проект активно использует контейнеризацию, это упрощает установку на различных платформах.
- Операционная система: Linux, macOS, Windows (через WSL2 или Docker Desktop).
- Docker: Требуется установленный Docker. Это основной способ запуска, так как он изолирует зависимости.
- Оперативная память (RAM): Требуется достаточный объем для работы на CPU. Для комфортной работы с моделями среднего размера рекомендуется увеличить объем памяти.
- Видеопамять (VRAM) для GPU:
- NVIDIA: Для моделей среднего размера требуется определенный объем VRAM. Для более крупных моделей — значительно больше.
- AMD/Intel: Поддерживаются через ROCm (AMD) и oneAPI (Intel), но требуют корректной настройки драйверов в хост-системе.
02Установка
Самый надежный и простой способ установки — использование Docker. Это позволяет избежать конфликтов библиотек и автоматически подтягивать необходимые бэкенды (llama.cpp, whisper.cpp и др.) по мере необходимости.
Шаг 1. Проверка установки Docker
Убедитесь, что Docker установлен и работает:
docker --versionШаг 2. Запуск контейнера
Выберите образ в зависимости от вашего оборудования. Для большинства пользователей, начинающих с локального ИИ, рекомендуется начать с версии для CPU или базовой версии GPU, если есть совместимая видеокарта.
Вариант А: Только CPU (универсально, медленно для больших моделей)
docker run -ti --name local-ai -p 8080:8080 localai/localai:latestВариант Б: NVIDIA GPU (требуется установленный драйвер NVIDIA и nvidia-container-toolkit)
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-12Вариант В: AMD GPU (ROCm)
docker run -ti --name local-ai -p 8080:8080 --device=/dev/kfd --device=/dev/dri --group-add=video localai/localai:latest-gpu-hipblas-p 8080:8080 пробрасывает порт контейнера на хост. Вы сможете обращаться к API по адресу http://localhost:8080. Если вы находитесь в РФ или используете прокси, убедитесь, что Docker имеет доступ к интернету для загрузки образов и моделей.03Первый запуск
После запуска контейнера LocalAI готов принимать запросы. Однако модели не загружаются в память сразу — они подтягиваются по запросу. Вы можете использовать встроенный CLI для управления моделями.
Шаг 1. Загрузка модели
Используйте команду local-ai run для загрузки и запуска конкретной модели. LocalAI сам скачает нужные веса и бэкенд. Например, для запуска легкой модели Llama:
local-ai run llama-3.2-1b-instruct:q4_k_mВы также можете загружать модели напрямую с Hugging Face:
local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.ggufШаг 2. Проверка работы API
Откройте новый терминал и проверьте, что сервер отвечает, отправив запрос к стандартному эндпоинту OpenAI:
curl http://localhost:8080/v1/modelsВы должны увидеть список доступных моделей. Теперь вы можете использовать любые инструменты, совместимые с OpenAI (например, LangChain, LlamaIndex или простые скрипты на Python), указав базовый URL http://localhost:8080/v1 и пустой или любой ключ API.
04Частые проблемы
- Ошибка "No space left on device": Локальные модели могут занимать значительный объем места. Убедитесь, что у вас достаточно свободного места на диске для кэша моделей LocalAI (обычно в
~/.local/share/local-ai). - GPU не используется: Если вы запустили образ с поддержкой GPU, но процессоры загружены на 100%, проверьте, установлен ли
nvidia-container-toolkit(для NVIDIA) и запущен ли демон Docker с правами root. Также убедитесь, что вы используете правильный тег образа (например,latest-gpu-nvidia-cuda-12). - Медленная загрузка моделей: При первом запуске LocalAI скачивает веса моделей. Если интернет медленный, это может занять время. Используйте модели с квантованием (Q4_K_M, Q5_K_M), чтобы снизить объем загрузки и требования к памяти.
05Кому подойдёт
LocalAI идеально подходит для разработчиков, исследователей и энтузиастов ИИ, которые хотят:
- Полностью контролировать свои данные и не отправлять их в облако.
- Интегрировать локальные LLM в свои приложения без измен
Источник: LocalAI (офиц. документация) ↗
