Релиз модели3 сентября 2026 г., 19:31 МСК🤖 Auto

NVIDIA IFA 2026: Локальный AI, RTX Spark и ускорение в 1.9x

NVIDIA анонсировала новые инструменты для локального запуска AI-агентов, ПК RTX Spark и оптимизации llama.cpp/vLLM, повышающие скорость инференса до 1.9x.

Баннер новости 6699

Жизнь AI идет локально: NVIDIA, Microsoft и партнеры

На выставке IFA 2026 NVIDIA совместно с Microsoft и другими партнерами представила экосистему для упрощения запуска локальных AI-агентов. Ключевое событие — выход компактных ПК NVIDIA RTX Spark от Lenovo и Acer в октябре 2026 года. Эти устройства предназначены для энтузиастов, разработчиков и создателей контента, позволяя запускать мощные модели локально и безопасно.

Параллельно NVIDIA представила инструмент PAIR (Personal AI Router) — бесплатный open-source роутер, который распределяет нагрузку по инференсу между несколькими ПК в локальной сети. Это позволяет использовать простаивающие компьютеры для параллельных задач, избегая узких мест одного GPU.

Ускорение инференса: llama.cpp и vLLM

NVIDIA выпустила оптимизации для популярных движков инференса, доступные через LM Studio и Ollama. Ключевые метрики производительности на новом железе:

Движок / Платформа Прирост скорости Технологии оптимизации
llama.cpp (GeForce RTX 5090) до 1.9x Kernel-оптимизации, speculative decoding, ускоренный prefill
vLLM (RTX PRO 6000 Blackwell) 1.2x Backend-оптимизации, XQA attention kernels (FlashInfer)
vLLM (2x DGX Spark) до 1.4x Распределенный инференс, XQA attention kernels

Однозначная установка агентов: Hermes, OpenClaw, Perplexity

Главная боль локального AI — сложность настройки (выбор модели, квантование, серверы) исчезает благодаря интеграции в три популярных приложения:

  • Perplexity Portable Computer: Работает на Linux (RTX с 24GB+ VRAM), скоро появится на Windows. Позволяет запускать воркфлоу локально, отправляя в облако только сложные задачи с явного разрешения пользователя. Примеры: анализ PR в GitHub, проверка налоговых документов без утечки данных.
  • Hermes Agent (Nous Research): Универсальный агент с поддержкой самообучения. На Windows доступна установка в один клик: автодетект GPU, выбор модели и запуск через llama.cpp с оптимизациями NVIDIA.
  • OpenClaw: Крупнейший open-agent проект на GitHub (380K+ звезд). Windows-приложение упрощает запуск на RTX GPU с 24GB+ VRAM, снижая порог входа для сообщества.

Новые модели и видео-генерация

Август стал месяцем релизов для локального AI. Среди ключевых моделей:

  • Nemotron 3.5 Lightning: 30 млрд параметров, работает на RTX, DGX Spark, Jetson.
  • Meta Muse Glimmer: 30 млрд параметров для кодинга и агентов, поддержка NVFP4 квантования.
  • DeepSeek v4 Flash: MoE-модель (284 млрд параметров, 13 млрд активных), запускается на кластере из 2x DGX Spark.
  • LTX 2.5 и MiniMax-H3: Модели генерации видео. LTX 2.5 использует NVFP4 и FastVideo для эффективности. MiniMax-H3 имеет версию FastH3 (4 шага дистилляции), ускоряющую работу в 7 раз.

Почему это важно

Экосистема NVIDIA смещает фокус с облачных LLM на гибридные локальные решения. Снижение порога входа (one-click setup) и аппаратная оптимизация (RTX Spark, NVFP4) делают локальный AI доступным для массового пользователя, обеспечивая приватность данных и независимость от тарифов облачных провайдеров.

Источник: NVIDIA Blog ↗