Жизнь AI идет локально: NVIDIA, Microsoft и партнеры
На выставке IFA 2026 NVIDIA совместно с Microsoft и другими партнерами представила экосистему для упрощения запуска локальных AI-агентов. Ключевое событие — выход компактных ПК NVIDIA RTX Spark от Lenovo и Acer в октябре 2026 года. Эти устройства предназначены для энтузиастов, разработчиков и создателей контента, позволяя запускать мощные модели локально и безопасно.
Параллельно NVIDIA представила инструмент PAIR (Personal AI Router) — бесплатный open-source роутер, который распределяет нагрузку по инференсу между несколькими ПК в локальной сети. Это позволяет использовать простаивающие компьютеры для параллельных задач, избегая узких мест одного GPU.
Ускорение инференса: llama.cpp и vLLM
NVIDIA выпустила оптимизации для популярных движков инференса, доступные через LM Studio и Ollama. Ключевые метрики производительности на новом железе:
| Движок / Платформа | Прирост скорости | Технологии оптимизации |
|---|---|---|
| llama.cpp (GeForce RTX 5090) | до 1.9x | Kernel-оптимизации, speculative decoding, ускоренный prefill |
| vLLM (RTX PRO 6000 Blackwell) | 1.2x | Backend-оптимизации, XQA attention kernels (FlashInfer) |
| vLLM (2x DGX Spark) | до 1.4x | Распределенный инференс, XQA attention kernels |
Однозначная установка агентов: Hermes, OpenClaw, Perplexity
Главная боль локального AI — сложность настройки (выбор модели, квантование, серверы) исчезает благодаря интеграции в три популярных приложения:
- Perplexity Portable Computer: Работает на Linux (RTX с 24GB+ VRAM), скоро появится на Windows. Позволяет запускать воркфлоу локально, отправляя в облако только сложные задачи с явного разрешения пользователя. Примеры: анализ PR в GitHub, проверка налоговых документов без утечки данных.
- Hermes Agent (Nous Research): Универсальный агент с поддержкой самообучения. На Windows доступна установка в один клик: автодетект GPU, выбор модели и запуск через llama.cpp с оптимизациями NVIDIA.
- OpenClaw: Крупнейший open-agent проект на GitHub (380K+ звезд). Windows-приложение упрощает запуск на RTX GPU с 24GB+ VRAM, снижая порог входа для сообщества.
Новые модели и видео-генерация
Август стал месяцем релизов для локального AI. Среди ключевых моделей:
- Nemotron 3.5 Lightning: 30 млрд параметров, работает на RTX, DGX Spark, Jetson.
- Meta Muse Glimmer: 30 млрд параметров для кодинга и агентов, поддержка NVFP4 квантования.
- DeepSeek v4 Flash: MoE-модель (284 млрд параметров, 13 млрд активных), запускается на кластере из 2x DGX Spark.
- LTX 2.5 и MiniMax-H3: Модели генерации видео. LTX 2.5 использует NVFP4 и FastVideo для эффективности. MiniMax-H3 имеет версию FastH3 (4 шага дистилляции), ускоряющую работу в 7 раз.
Почему это важно
Экосистема NVIDIA смещает фокус с облачных LLM на гибридные локальные решения. Снижение порога входа (one-click setup) и аппаратная оптимизация (RTX Spark, NVFP4) делают локальный AI доступным для массового пользователя, обеспечивая приватность данных и независимость от тарифов облачных провайдеров.
Источник: NVIDIA Blog ↗
