Mozilla-Ocho/llamafile

Distribute and run LLMs with a single file.

Инференс⭐ 26 010C++последний релиз: 0.10.6
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

llamafile — это инструмент от Mozilla, позволяющий упаковывать большие языковые модели (LLM) и модели распознавания речи (Whisper) в один самодостаточный исполняемый файл.

Зачем нужен

Инструмент решает проблему сложной настройки окружения для локального запуска LLM, устраняя необходимость в установке зависимостей или драйверов. Он объединяет llama.cpp и Cosmopolitan Libc, обеспечивая кроссплатформенную работу (macOS, Linux, Windows, BSD) на разных архитектурах CPU/GPU.

Что можно реализовать

  • Быстрый локальный запуск LLM на любом компьютере без предварительной настройки среды
  • Распространение и демонстрация моделей через один файл (включая Hugging Face)
  • Локальная транскрипция и перевод аудиофайлов с помощью whisperfile
  • Запуск LLM в изолированных или ограниченных средах без прав администратора

Ключевые возможности

  • Единый исполняемый файл для распространения и запуска моделей
  • Кроссплатформенность: работает на macOS, Linux, Windows, BSD без установки зависимостей
  • Встроенная поддержка whisper.cpp для работы с аудио (транскрипция и перевод)
  • Актуальная версия 0.10+ с новой системой сборки и поддержкой последних моделей
  • Лицензия Apache 2.0 с совместимыми изменениями (MIT) для upstream

👤 Кому подойдёт: разработчики, исследователи, пользователи, желающие запускать LLM локально без сложной настройки инфраструктуры

Релизы

0.10.6minor
🕐 5 дн назад · релиз на GitHub ↗

Обновление llama.cpp до b10444, включение поддержки Vulkan и графов CUDA/HIP, исправления сборки и безопасности ZIP.

  • Added: Обновлен llama.cpp до версии b10441.
  • Added: Добавлена поддержка Vulkan и включены графы для CUDA и HIP.
  • Fixed: Исправлены ошибки сборки для llama-bench, quantize, imatrix и perplexity.
  • Fixed: Устранена уязвимость и ошибки при валидации ZIP-архивов.
  • Fixed: Исправлена инициализация таймеров в ggml.
0.10.5minor
🕐 1 мес назад · релиз на GitHub ↗

Обновление llama.cpp до b10103, поддержка новых моделей и улучшение документации по GPU и CLI.

  • Added: Обновлен llama.cpp до версии b10103 (b2dd28a, 846e991, c588c4f).
  • Added: Добавлена поддержка моделей Ternary Bonsai 27B и Laguna-S-2.1.
  • Added: Улучшен навык (skill) для синхронизации с upstream llama.cpp.
  • Added: Добавлена документация по аргументам CLI, инструментам и поддержке GPU через Vulkan.
  • Added: В релиз включен бинарник transcribefile.
  • Fixed: Уточнены различия между исполняемыми файлами llamafile и llamafile-thin.
0.10.3patch
🕐 3 мес назад · релиз на GitHub ↗

Исправлен критический сбой при ошибке инициализации GPU с восстановлением работы на CPU, обновлены скрипты сборки.

  • Fixed: Исправлен необработанный SIGSEGV при сбое инициализации GPU, восстановлено автоматическое переключение на CPU
  • Added: Добавлен скрипт release.sh для автоматизации создания релизов
  • Added: Обновлены скрипты подготовки релизов