Главная/Блог/Гайд/Установка LocalAI локально: OpenAI API…
Гайд4 мин чтения · 3 сентября 2026 г.

Установка LocalAI локально: OpenAI API на своём железе

Пошаговая инструкция по запуску LocalAI через Docker для получения совместимого с OpenAI API на любом оборудовании, включая CPU и NVIDIA GPU.

Установка LocalAI локально: OpenAI API на своём железе

LocalAI — это мощный open-source движок, который позволяет развернуть локальную инфраструктуру ИИ, полностью совместимую с API OpenAI, Anthropic и ElevenLabs. Это решение идеально подходит для практиков, которые хотят сохранить конфиденциальность данных, избежать ежемесячных подписок и получить доступ к широкому спектру моделей (LLM, генерация изображений, распознавание речи) на собственном оборудовании. Архитектура LocalAI модульна: вы устанавливаете только те бэкенды, которые нужны для конкретных моделей, что экономит ресурсы системы.

01Требования

Для работы LocalAI требуется базовая среда выполнения. Поскольку проект активно использует контейнеризацию, это упрощает установку на различных платформах.

  • Операционная система: Linux, macOS, Windows (через WSL2 или Docker Desktop).
  • Docker: Требуется установленный Docker. Это основной способ запуска, так как он изолирует зависимости.
  • Оперативная память (RAM): Требуется достаточный объем для работы на CPU. Для комфортной работы с моделями среднего размера рекомендуется увеличить объем памяти.
  • Видеопамять (VRAM) для GPU:
    • NVIDIA: Для моделей среднего размера требуется определенный объем VRAM. Для более крупных моделей — значительно больше.
    • AMD/Intel: Поддерживаются через ROCm (AMD) и oneAPI (Intel), но требуют корректной настройки драйверов в хост-системе.
⚠️
Важно. LocalAI автоматически определяет доступное оборудование. Если у вас нет GPU, он будет использовать CPU, но скорость генерации будет значительно ниже. Для работы с GPU необходимо установить соответствующие драйверы (NVIDIA CUDA Toolkit или AMD ROCm) на хост-машину перед запуском контейнера.

02Установка

Самый надежный и простой способ установки — использование Docker. Это позволяет избежать конфликтов библиотек и автоматически подтягивать необходимые бэкенды (llama.cpp, whisper.cpp и др.) по мере необходимости.

Шаг 1. Проверка установки Docker

Убедитесь, что Docker установлен и работает:

terminalbash
docker --version

Шаг 2. Запуск контейнера

Выберите образ в зависимости от вашего оборудования. Для большинства пользователей, начинающих с локального ИИ, рекомендуется начать с версии для CPU или базовой версии GPU, если есть совместимая видеокарта.

Вариант А: Только CPU (универсально, медленно для больших моделей)

terminalbash
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest

Вариант Б: NVIDIA GPU (требуется установленный драйвер NVIDIA и nvidia-container-toolkit)

terminalbash
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-12

Вариант В: AMD GPU (ROCm)

terminalbash
docker run -ti --name local-ai -p 8080:8080 --device=/dev/kfd --device=/dev/dri --group-add=video localai/localai:latest-gpu-hipblas
💡
Совет. Флаг -p 8080:8080 пробрасывает порт контейнера на хост. Вы сможете обращаться к API по адресу http://localhost:8080. Если вы находитесь в РФ или используете прокси, убедитесь, что Docker имеет доступ к интернету для загрузки образов и моделей.

03Первый запуск

После запуска контейнера LocalAI готов принимать запросы. Однако модели не загружаются в память сразу — они подтягиваются по запросу. Вы можете использовать встроенный CLI для управления моделями.

Шаг 1. Загрузка модели

Используйте команду local-ai run для загрузки и запуска конкретной модели. LocalAI сам скачает нужные веса и бэкенд. Например, для запуска легкой модели Llama:

terminalbash
local-ai run llama-3.2-1b-instruct:q4_k_m

Вы также можете загружать модели напрямую с Hugging Face:

terminalbash
local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf

Шаг 2. Проверка работы API

Откройте новый терминал и проверьте, что сервер отвечает, отправив запрос к стандартному эндпоинту OpenAI:

terminalbash
curl http://localhost:8080/v1/models

Вы должны увидеть список доступных моделей. Теперь вы можете использовать любые инструменты, совместимые с OpenAI (например, LangChain, LlamaIndex или простые скрипты на Python), указав базовый URL http://localhost:8080/v1 и пустой или любой ключ API.

04Частые проблемы

  1. Ошибка "No space left on device": Локальные модели могут занимать значительный объем места. Убедитесь, что у вас достаточно свободного места на диске для кэша моделей LocalAI (обычно в ~/.local/share/local-ai).
  2. GPU не используется: Если вы запустили образ с поддержкой GPU, но процессоры загружены на 100%, проверьте, установлен ли nvidia-container-toolkit (для NVIDIA) и запущен ли демон Docker с правами root. Также убедитесь, что вы используете правильный тег образа (например, latest-gpu-nvidia-cuda-12).
  3. Медленная загрузка моделей: При первом запуске LocalAI скачивает веса моделей. Если интернет медленный, это может занять время. Используйте модели с квантованием (Q4_K_M, Q5_K_M), чтобы снизить объем загрузки и требования к памяти.

05Кому подойдёт

LocalAI идеально подходит для разработчиков, исследователей и энтузиастов ИИ, которые хотят:

  • Полностью контролировать свои данные и не отправлять их в облако.
  • Интегрировать локальные LLM в свои приложения без измен

    Источник: LocalAI (офиц. документация) ↗