Масштаб экосистемы локального ИИ
Репозиторий LLMs-local на GitHub стал исчерпывающим каталогом инструментов для запуска больших языковых моделей (LLM) на локальных устройствах. Проект охватывает полный цикл: от движков инференса и пользовательских интерфейсов до фреймворков для агентов и обучения. Это не просто список ссылок, а структурированная карта технологий, позволяющая разработчикам и энтузиастам выбрать оптимальный стек для работы с ИИ без облачной зависимости.
Новые флагманы 2026 года
Ключевое обновление списка — интеграция моделей, выпущенных в середине 2026 года. Особое внимание привлекает DiffusionGemma-26B-A4B-it от Google: это мультимодальная LLM на базе диффузии (выпущена 10 июня 2026 года) с архитектурой MoE (26B параметров), способная генерировать более 1100 токенов в секунду и работать на потребительском оборудовании в квантованном виде. Также в списке представлены MiniMax M3 с контекстом в 1 млн токенов и gpt-oss от OpenAI, ориентированные на агентные задачи.
Сравнение ключевых моделей и их характеристик
Анализ раздела «Specific models» позволяет выделить лидеров по производительности и специализации. Ниже приведена таблица с ключевыми параметрами актуальных моделей из репозитория:
| Модель | Разработчик | Ключевая особенность | Дата релиза |
|---|---|---|---|
| DiffusionGemma-26B-A4B-it | Диффузионная мультимодальность, 1100+ ток/с | Июнь 2026 | |
| MiniMax M3 | MiniMax | Контекст 1M, нативная мультимодальность | Июнь 2026 |
| DeepSeek-V4 | DeepSeek | Длинный контекст, кодинг (V4-Pro & Flash) | Май 2026 |
| gpt-oss | OpenAI | Открытые веса, агентные задачи, reasoning | 2026 |
| Qwen3-Next | Alibaba | Поколение Qwen, универсальное применение | 2026 |
Инфраструктура: от Apple Silicon до AMD
Список инференс-движков демонстрирует глубокую оптимизацию под разное железо. Для пользователей Apple Silicon доступен mlx-lm, обеспечивающий генерацию и дообучение моделей. Для AMD Radeon (gfx906) и Intel Arc Pro B60 представлены специализированные сборки vLLM и llm-scaler. Отдельного внимания заслуживает exo и distributed-llama — фреймворки, позволяющие объединять домашние устройства в кластеры для ускорения инференса, что делает локальный ИИ доступнее при нехватке одной мощной видеокарты.
Агенты, код и мультимодальность
Фокус смещается с простого чат-бота на автономных агентов. В разделе «Coding Agents» и «Computer Use» представлены инструменты для автоматизации браузера и работы с кодом. Среди моделей для программирования выделяются Qwen3-Coder и Devstral 2, способные редактировать множественные файлы и исследовать кодовые базы. В мультимодальном сегменте доминирует семейство Qwen3 (включая Qwen3-Omni и Qwen3-VL), предлагающее нативную поддержку текста, изображений и аудио в единой архитектуре.
Источник: Github ↗
