EricLBuehler/mistral.rs

Fast, flexible LLM inference

Инференс⭐ 7 714Rustпоследний релиз: v0.9.3
Открыть на GitHub ↗

Что это за инструмент

mistral.rs — это высокопроизводительный движок для инференса больших языковых моделей (LLM) на Rust, поддерживающий работу с любыми моделями из Hugging Face.

Зачем нужен

Инструмент решает задачу быстрой и гибкой локальной или серверной обработки текстов, изображений, видео и аудио, обеспечивая совместимость с API OpenAI и Anthropic. Он полезен для разработчиков, которым нужна максимальная производительность (особенно на GPU NVIDIA) и встроенные возможности для создания агентов без сложной настройки инфраструктуры.

Что можно реализовать

  • Запуск локального LLM-сервера с поддержкой OpenAI и Anthropic API для интеграции с существующими приложениями.
  • Создание AI-агентов с доступом к веб-поиску, выполнению Python-кода и shell-команд.
  • Обработка мультимодальных данных (текст, изображения, видео, аудио) в едином движке.
  • Генерация изображений с помощью DiffusionGemma и работа с блок-диффузией.
  • Мониторинг производительности сервера через метрики Prometheus.

Ключевые возможности

  • Поддержка любых моделей Hugging Face с автоматическим определением архитектуры и квантования.
  • Высокая производительность на GPU (CUDA graphs, FlashInfer), превосходящая llama.cpp и vLLM в некоторых сценариях.
  • Встроенный веб-интерфейс для отладки, просмотра кода и выполнения скриптов.
  • Готовые SDK для Python и Rust.
  • Поддержка мультимодальности: текст, vision, video, audio и speech generation.

👤 Кому подойдёт: разработчики, инженеры ML, исследователи

Релизы

v0.9.3major
🕐 13 дн назад · релиз на GitHub ↗

Релиз v0.9.3: поддержка FP8, NVFP4, Blackwell, оптимизация DFlash и улучшение совместимости с OpenAI/Anthropic.

  • Added: Добавлена поддержка квантования FP8 и NVFP4, а также ускорение на GPU Blackwell через cuTile.
  • Added: Реализована первоклассная работа с FP8 и конкурентное декодирование DFlash.
  • Added: Улучшена поддержка API Anthropic Messages и Claude Code.
  • Added: Коды ошибок сервера приведены в соответствие со стандартом OpenAI.
  • Fixed: Исправлена отправка изображений в веб-интерфейсе (устранена ошибка HTTP 500).
v0.9.2minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.9.2: поддержка Qwen3.5/3.8, CUDA Graphs, DFlash 2, улучшена совместимость с OpenAI API и метрики.

  • Added: Добавлена поддержка моделей Qwen3.5 (улучшенный видео-процессор, MTP) и исправления для Qwen3.8.
  • Added: Реализована поддержка CUDA Graphs для MTP и пакетная обработка для DFlash/DFlash 2.
  • Added: Улучшена совместимость сервера OpenAI через endpoint /v1/responses.
  • Added: Расширены метрики движка: добавлен статус планировщика, TTFT, ITL и специкулятивного декодирования.
  • Fixed: Исправлены ошибки FAv3, улучшена поддержка гибридных моделей и автоматическое маппинг устройств.
v0.9.1minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.9.1: добавлена поддержка Muse Glimmer, LoRA, GGUF и квантования lmhead, улучшен планировщик.

  • Added: Добавлена поддержка модели Muse Glimmer.
  • Added: Реализованы ядра LoRA и поддержка динамических адаптеров.
  • Added: Введена поддержка загрузки GGUF для всех поддерживаемых моделей.
  • Added: Добавлена поддержка квантования lmhead и эмбеддингов.
  • Added: Значительно улучшены планировщик и производительность конкурентного обслуживания.
  • Fixed: Исправлены регрессии корректности, возвращение logprobs и работа с Gemma4.
v0.9.0major
🕐 2 мес назад · релиз на GitHub ↗

Релиз v0.9.0: поддержка LFM 2.5, оптимизация CPU/GPU, улучшен распределённый запуск и Metal.

  • Added: Добавлена поддержка моделей LFM 2.5 (dense, MoE) и LFM 2.5 VL.
  • Added: Значительно улучшена производительность CPU (aarch64/x86) и Metal.
  • Added: Усовершенствована система распределенного запуска (TP fallback) и загрузки мульти-моделей.
  • Added: Внедрен предварительный загрузчик CUDA PTX-модулей и обновлен Cutlass.
  • Fixed: Исправлен запуск агентного цикла для зарегистрированных инструментов и стабильность ID ответов сервера.
v0.8.23minor
🕐 2 мес назад · релиз на GitHub ↗

Добавлена поддержка моделей Hunyuan v1, CUDA 13.3 и квантования ISQ; исправлен планировщик PagedAttention.

  • Added: Добавлена поддержка плотных и MoE-моделей Hunyuan v1.
  • Added: Реализована поддержка CUDA 13.3 и улучшено квантование через executor ISQ.
  • Added: Оптимизирована загрузка Gemma4: исключены проекции для общих KV-слоёв.
  • Fixed: Исправлена инвертированная приоритетность в планировщике PagedAttention.
  • Fixed: Добавлена валидация special token GGUF для предотвращения паники OOB.