Релиз модели21 августа 2026 г., 16:17 МСК🤖 Auto

NVIDIA AVO: 100% на ARC-AGI-3 и оптимизация GPU без людей

Архитектура NVIDIA AVO достигла 100% на сложном бенчмарке ARC-AGI-3 и оптимизировала GPU-ядра на 10.5% за 7 дней автономной работы, доказав важность системного дизайна.

Баннер новости 6241

Прорыв в автономных агентах: 100% на ARC-AGI-3

Лаборатория NVIDIA представила архитектуру Agentic Variation Operators (AVO), способную к долгосрочной автономной работе. Ключевое достижение — полный успех на бенчмарке ARC-AGI-3 (Interactive Reasoning Benchmark). Аво достиг результата 100.00 RHAE, пройдя все 183 уровня в 25 средах. Это демонстрирует, что общая архитектура агента важнее мощности самой языковой модели.

Автономная оптимизация GPU-ядер

До тестов на ARC-AGI-3 AVO прошел суровое испытание в инженерной среде. В течение 7 дней агент автономно исследовал пространство оптимизации, сгенерировал более 500 направлений и зафиксировал 40 версий ядер. Результат превзошел FlashAttention-4 на 10.5% и cuDNN на 3.5% на системах NVIDIA DGX B200. Адаптация к grouped-query attention заняла всего 30 минут без вмешательства человека.

Системный подход против модели

Изначально базовая модель Claude Opus 5 показывала лишь 30% на ARC-AGI-3. Интеграция в систему AVO подняла этот показатель до 100%. Разница кроется не в «умности» модели, а в механизмах системы: постоянная память (persistent memory) сохраняет контекст и выводы, а супервайзер отслеживает застой и перенаправляет поиск. Это позволяет агенту восстанавливаться после ошибок и не зацикливаться.

Сравнение эффективности

AVO не только решил все задачи, но и сделал это эффективнее аналогов. Ниже приведены ключевые метрики сравнения на ARC-AGI-3:

Метрика NVIDIA AVO VISTA (сравнение)
Результат (RHAE) 100.00 Информация недостаточна
Пройденные уровни 183 / 183 (100%) Информация недостаточна
Эффективность действий На 12% меньше действий Базовый уровень
Базовая модель Claude Opus 5 (30% -> 100%) Информация недостаточна

Почему это важно

Эксперимент доказывает, что для решения сложных многошаговых задач (long-horizon tasks) критически важна не только способность модели генерировать код или текст, но и архитектура «поводка» (harness). AVO объединяет проверку гипотез, исполнение команд, анализ профайлеров и исправление ошибок в единый цикл, что открывает путь к полностью автономной инженерии и исследованию.

Бенчмарки

БенчмаркAVOVISTA
ARC-AGI-3100%117.65%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: NVIDIA dev blog ↗