mudler/LocalAI

LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.

Инференс⭐ 49 199Goпоследний релиз: v4.10.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

LocalAI — это открытый движок для запуска различных ИИ-моделей (LLM, компьютерное зрение, голос, изображения, видео) на любом оборудовании, включая CPU, без обязательного использования GPU.

Зачем нужен

Инструмент позволяет развернуть локальную инфраструктуру ИИ с полной совместимостью API с OpenAI, Anthropic и ElevenLabs, обеспечивая конфиденциальность данных. Он решает задачу децентрализации ИИ-сервисов, позволяя использовать любые модели без привязки к облачным провайдерам.

Что можно реализовать

  • Запуск локальных LLM для чат-ботов и анализа текста без отправки данных в облако
  • Генерация изображений и видео с использованием моделей типа stable-diffusion на собственном сервере
  • Обработка голоса (распознавание и синтез) через whisper.cpp и kokoro
  • Создание автономных ИИ-агентов с использованием RAG, MCP и инструментов (tool use)
  • Развертывание ИИ-инфраструктуры на разном оборудовании: от Apple Silicon до NVIDIA и AMD GPU

Ключевые возможности

  • Совместимость API с OpenAI, Anthropic и ElevenLabs
  • Модульная архитектура: бэкенды (llama.cpp, vLLM, MLX и др.) подтягиваются только при необходимости
  • Поддержка широкого спектра оборудования: CPU, NVIDIA, AMD, Intel, Apple Silicon, Vulkan
  • Встроенная поддержка ИИ-агентов, RAG, MCP и ролевого доступа
  • Принцип Privacy-first: данные остаются в локальной инфраструктуре

👤 Кому подойдёт: разработчики, DevOps-инженеры, исследователи и компании, стремящиеся к локальному развертыванию ИИ с контролем данных

Релизы

v4.10.0major
🕐 3 дн назад · релиз на GitHub ↗

LocalAI 4.10.0: дашборд флота, единый файл учётных данных, CLI-бенчмарк, фиксы CVE и M5.

  • Added: Панель управления флотом с мониторингом здоровья, ёмкости и массовыми действиями над нодами.
  • Added: Единый файл credentials.yaml для аутентификации OCI, галерей и загрузок без переменных окружения.
  • Added: Команда local-ai benchmark для измерения задержек и пропускной способности моделей через CLI.
  • Added: Поддержка переменных окружения в конфиге модели и контекстного окна в /v1/models/capabilities.
  • Fixed: Исправлены 4 уязвимости (CVE), стабильность CUDA, распределённого режима и Apple M5.
v4.9.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

LocalAI 4.9.0: защита по умолчанию, сжатие контекста, видео MiniMax-H3, TTS Qwen3 и KNN-роутер.

  • Breaking: Аутентификация включена по умолчанию для всех HTTP-маршрутов, кроме явно разрешенных публичных.
  • Added: В чате появилась опциональная компрессия контекста с сохранением системных промптов и вызовов инструментов.
  • Added: vllm-cpp теперь поддерживает генерацию видео MiniMax-H3 с синхронизацией губ и аудио-дорожкой AAC.
  • Added: Добавлен KNN как первый классный роутер для маршрутизации на основе семантического сходства.
  • Added: Qwen3-TTS запущен на llama.cpp с полной поддержкой акселераторов (CUDA, ROCm, Metal и др.).
v4.8.2minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлен бэкенд NVIDIA NeMo-Speech.cpp, улучшена надёжность загрузки моделей через зеркала и кэш.

  • Added: Добавлен бэкенд NVIDIA NeMo-Speech.cpp для обработки речи.
  • Added: Галерея моделей теперь использует index.localai.io с GitHub в качестве зеркала и кэша.
  • Added: При сбое основного источника галереи добавлено автоматическое переключение на зеркала.
  • Fixed: Исправлена ошибка CI, связанная с неподдерживаемым флагом cosign bundle.
  • Обновлены зависимости GitHub Actions (actions/stale, actions/checkout) и документация.
v4.8.1minor
🕐 1 мес назад · релиз на GitHub ↗

Исправления стабильности, поддержка Qwen3.5 9B и улучшение конфигурации vLLM в LocalAI v4.8.1

  • Added: В галерею моделей добавлены варианты Qwen3.5 9B (HauhauCS и Defiant Fable)
  • Added: Реализована полная передача конфигурации движка vllm-cpp через engine_args
  • Fixed: Исправлена загрузка бэкенда vllm-cpp из-за рассинхронизации ABI
  • Fixed: Устранён крах страницы трассировки в React UI при переключении вкладок
  • Fixed: Исправлена обработка некорректных метаданных GGUF и ошибки socket activation
v4.8.0major
🕐 1 мес назад · релиз на GitHub ↗

LocalAI 4.8.0: новый движок vllm.cpp, 3D-генерация, аудио-бэкенд и оптимизация распределённого режима.

  • Added: vllm.cpp (alpha): C++20-движок без Python, совместимый с vLLM, поддерживающий CUDA, Metal и Vulkan.
  • Added: 3D-генерация: новый режим работы с GLB-моделями через бэкенд trellis2cpp и встроенный просмотрщик.
  • Added: audio.cpp: единый бэкенд для распознавания речи, транскрипции, VAD, диаризации и генерации звука.
  • Added: VRAM-бюджеты: возможность ограничивать использование видеопамяти на уровне узла в процентах или ГБ.
  • Fixed: Улучшена стабильность распределённого режима: исправлены утечки счётчиков и удаление активных процессов.
v4.7.1patch
🕐 2 мес назад · релиз на GitHub ↗

Исправлена ошибка, из-за которой параметры llama.cpp могли некорректно применяться вне соответствующего пути.

  • Fixed: Исправлено некорректное внедрение параметров запуска llama.cpp только в нужный путь обработки.
v4.6.2minor
🕐 2 мес назад · релиз на GitHub ↗

Релиз LocalAI v4.6.2: добавлена галерея моделей MiniCPM, оптимизирован CI и обновлены зависимости.

  • Added: Добавлены модели серии MiniCPM в галерею моделей.
  • Fixed: Исправлена сборка CI: разделение матрицы бэкендов для соблюдения лимита в 256 джобов GitHub.
  • Обновлен GitHub Action actions/cache с версии 4 до 6.
  • Fixed: Оптимизирован код: упрощена проверка наличия элементов в слайсах.
v4.6.1minor
🕐 2 мес назад · релиз на GitHub ↗

Исправления VRAM, безопасности и OIDC; новые метрики Prometheus для агентов; обновления llama.cpp и других бэкендов.

  • Fixed: Ограничение контекста и батчей эмбеддингов под объём VRAM, чтобы избежать переполнения памяти.
  • Added: Нативная поддержка метрик Prometheus для отслеживания работы агентов.
  • Fixed: Улучшена логика ошибок OIDC/OAuth и исправлено сохранение параметров reasoning.
  • Fixed: Ограничены права доступа к директориям контента и загрузок на уровне текущего пользователя.
  • Обновлены зависимости: llama.cpp, CrispASR, vllm-metal (darwin), omnivoice.cpp и qwentts.cpp.
v4.6.0major
🕐 2 мес назад · релиз на GitHub ↗

Релиз LocalAI 4.6.0: исправлена работа AMD ROCm, добавлен форк чатов, улучшена стабильность распределенных вычислений и мониторинг PII.

  • Fixed: Исправлена работа AMD ROCm: аудио-бэкенды теперь корректно используют GPU, а данные hipBLASLt оптимизируют производительность.
  • Added: Встроенный чат-интерфейс поддерживает форкинг: можно ветвить диалог, дублировать или копировать любые сообщения.
  • Added: Добавлен API для загрузки моделей в память и предзапуск конвейера (VAD, ASR, LLM, TTS) для устранения задержек в реальном времени.
  • Fixed: Устранена блокировка распределенных вычислений при падении воркеров и добавлена автоматическая очистка памяти.
  • Added: Добавлен Prometheus-счетчик для аудита событий PII и исправлена уязвимость SSRF в галерее моделей.
v4.5.6minor
🕐 2 мес назад · релиз на GitHub ↗

Добавлены новые бэкенды для распознавания голоса и лиц, улучшена распределённая архитектура и исправлены ошибки в работе с моделями.

  • Added: Добавлены нативные бэкенды voice-detect и face-detect на базе GGML, заменяющие старые Python-решения.
  • Added: В распределённом режиме внедрён SyncedMap для синхронизации состояния задач (финетюнинг, агенты) между репликами.
  • Added: Добавлена поддержка семантического VAD и токена завершения (EOU) в режиме Realtime.
  • Fixed: Исправлен выбор квантования моделей (F16 больше не подменяется BF16) и добавлена переменная для пропуска стадирования общих моделей.
  • Fixed: Устранены ошибки в распределённых агентах (права NATS, пустой список бэкендов), улучшена стабильность загрузки бинарников и OCI-слоёв.
v4.5.5patch
🕐 2 мес назад · релиз на GitHub ↗

Исправлены сбои CI для Kokoro, Fish-Speech, llama-cpp и SGLang, а также улучшена загрузка библиотек Whisper на macOS.

  • Fixed: Восстановлена стабильность CI-сборок для бэкендов Kokoro, Fish-Speech, llama-cpp-quantization и SGLang.
  • Fixed: Исправлена логика запуска Whisper на macOS: скрипт теперь корректно выбирает доступную библиотеку (.so или .dylib).
  • Added: В галерею моделей добавлена одна новая модель через автоматического агента.