От генерации к действию: новая парадигма Agentic AI
Традиционные генеративные модели отвечают на промпты, но Agentic AI должен действовать: планировать, использовать инструменты и адаптироваться к изменяющейся среде. Это делает фазу post-training (пост-обучение) не разовым этапом, а непрерывным циклом. В отличие от pre-training, где модель учится предсказывать следующий токен, post-training формирует способность к планированию и восстановлению после ошибок через обучение с подкреплением (RL).
Каждый шаг RL-цикла — это forward pass (попытка решения задачи) и backward pass (обновление весов на основе награды). Поскольку среда постоянно меняется, вычислительный footprint растет не из-за размера одного запуска, а из-за бесконечной природы этих циклов.
Метрика «Интеллект за доллар» (Intelligence per Dollar)
NVIDIA вводит новую ключевую метрику. Если cost per token измеряет операционную эффективность инференса, то intelligence per dollar отвечает на вопрос: «Сколько стоит построить и поддерживать модель, которая остается полезной?». Эти метрики вложены друг в друга: снижение стоимости токена снижает стоимость каждого пункта интеллекта, а рост интеллекта повышает ценность каждого обслуженного токена.
Технические характеристики и результаты Nemotron 3 Ultra
Для демонстрации эффективности подхода NVIDIA представила открытую модель Nemotron 3 Ultra (550 млрд параметров, MoE). Модель обучена с использованием фреймворка NeMo RL и показала выдающиеся результаты в реальном программировании:
| Метрика / Характеристика | Значение / Описание |
|---|---|
| Модель | Nemotron 3 Ultra (550B параметров, MoE) |
| Результат SWE-bench verified | 71.7% (решение ~7 из 10 реальных багов) |
| Платформа обучения | NVIDIA NeMo RL + Vera Rubin |
| Эффективность Vera Rubin | Обучение моделей в 4 раза меньшим количеством GPU по сравнению с Blackwell |
Интеграция с экосистемой: Prime Intellect и Perplexity
Партнеры NVIDIA уже тестируют преимущества новой архитектуры. Prime Intellect оптимизировала свои RL-песочницы под NVIDIA Vera CPUs, обеспечивая задержку и энергоэффективность. При сравнении с альтернативными x86-архитектурами Vera показала на 30% большую пропускную способность на CPU.
Perplexity использует асинхронный стек RL для моделей Qwen3 235B, синхронизируя веса триллионных параметров между узлами обучения и инференса менее чем за 2 секунды с помощью RDMA. Это позволяет обслуживать модели на системах GB200 NVL72 с максимальной эффективностью.
Почему это важно
Платформа Vera Rubin ко-дизайнирована специально для нагрузки агентов ИИ. Она позволяет запускать больше окружений (rollouts) и непрерывно обновлять модели, делая экономически выгодным тот уровень адаптивности, который требуется для автономных AI-агентов. Это фундамент для перехода от «чат-ботов» к «рабочим агентам».
Источник: NVIDIA Blog ↗
