Прорыв в автономных агентах: 100% на ARC-AGI-3
Лаборатория NVIDIA представила архитектуру Agentic Variation Operators (AVO), способную к долгосрочной автономной работе. Ключевое достижение — полный успех на бенчмарке ARC-AGI-3 (Interactive Reasoning Benchmark). Аво достиг результата 100.00 RHAE, пройдя все 183 уровня в 25 средах. Это демонстрирует, что общая архитектура агента важнее мощности самой языковой модели.
Автономная оптимизация GPU-ядер
До тестов на ARC-AGI-3 AVO прошел суровое испытание в инженерной среде. В течение 7 дней агент автономно исследовал пространство оптимизации, сгенерировал более 500 направлений и зафиксировал 40 версий ядер. Результат превзошел FlashAttention-4 на 10.5% и cuDNN на 3.5% на системах NVIDIA DGX B200. Адаптация к grouped-query attention заняла всего 30 минут без вмешательства человека.
Системный подход против модели
Изначально базовая модель Claude Opus 5 показывала лишь 30% на ARC-AGI-3. Интеграция в систему AVO подняла этот показатель до 100%. Разница кроется не в «умности» модели, а в механизмах системы: постоянная память (persistent memory) сохраняет контекст и выводы, а супервайзер отслеживает застой и перенаправляет поиск. Это позволяет агенту восстанавливаться после ошибок и не зацикливаться.
Сравнение эффективности
AVO не только решил все задачи, но и сделал это эффективнее аналогов. Ниже приведены ключевые метрики сравнения на ARC-AGI-3:
| Метрика | NVIDIA AVO | VISTA (сравнение) |
|---|---|---|
| Результат (RHAE) | 100.00 | Информация недостаточна |
| Пройденные уровни | 183 / 183 (100%) | Информация недостаточна |
| Эффективность действий | На 12% меньше действий | Базовый уровень |
| Базовая модель | Claude Opus 5 (30% -> 100%) | Информация недостаточна |
Почему это важно
Эксперимент доказывает, что для решения сложных многошаговых задач (long-horizon tasks) критически важна не только способность модели генерировать код или текст, но и архитектура «поводка» (harness). AVO объединяет проверку гипотез, исполнение команд, анализ профайлеров и исправление ошибок в единый цикл, что открывает путь к полностью автономной инженерии и исследованию.
Бенчмарки
| Бенчмарк | AVO | VISTA |
|---|---|---|
| ARC-AGI-3 | 100% | 117.65% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: NVIDIA dev blog ↗
