Главная/Блог/Аналитика/NVIDIA AVO: 100% на ARC-AGI-3 и будущее…
Аналитика7 мин чтения · 21 августа 2026 г.

NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

NVIDIA представила архитектуру AVO, достигшую 100% на бенчмарке ARC-AGI-3. Разбор того, как системный подход к памяти и надзору превзошел возможности самих моделей.

NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

В мире искусственного интеллекта последние годы доминировал нарратив о том, что ключ к прорывам кроется исключительно в увеличении параметров моделей и их предобучении. Однако исследование NVIDIA, представленное в августе 2026 года, бросает вызов этой парадигме. Команда разработчиков, включая Терри Чена, Ейин Чжу и других, продемонстрировала архитектуру Agentic Variation Operators (AVO), которая не просто улучшает результаты, а переосмысливает саму природу автономных агентов. AVO достигла идеального результата — 100% по метрике RHAE на сложнейшем бенчмарке ARC-AGI-3, обойдя аналоги по эффективности действий. Но самое важное здесь не цифра, а то, как она была достигнута: через системный дизайн, а не через силу самой языковой модели.

Этот материал — не просто пересказ новости. Это глубокое погружение в то, почему «обвязка» вокруг модели (harness) часто важнее самой модели. Мы разберем, как AVO решает проблему долгосрочной автономности, что такое персистентная память и надзор, и почему этот подход применим не только к оптимизации GPU-ядер, но и к абстрактному логическому мышлению. Если вы строите AI-агентов для бизнеса или исследований, понимание этих принципов критически важно для создания надежных систем, способных работать неделями без вмешательства человека.

01Почему одной модели недостаточно: проблема долгосрочных задач

Фронтенд-модель (LLM) — это лишь один компонент сложной экосистемы. Представьте себе гениального инженера, который сидит в пустой комнате без инструментов, без доступа к документации и без возможности запоминать то, что он делал час назад. Даже если этот инженер гениален, он не сможет построить мост. Так и с AI-агентом: мощная модель, лишенная контекста, инструментов и памяти, не способна решать задачи, требующие множества шагов.

Проблема современных агентов заключается в «горизонте планирования». Большинство систем теряют нить повествования или начинают зацикливаться на одних и тех же ошибках после нескольких итераций. NVIDIA AVO (Agentic Variation Operators) была создана именно для решения этой проблемы. Это не просто код, который генерирует ответ, а архитектура, обеспечивающая устойчивую автономную работу на длинных горизонтах (long-horizon tasks). Ключевые отличия AVO от стандартных подходов:

  • Постоянная память (Persistent Memory): Агент не забывает предыдущие попытки, ошибки и успешные гипотезы.
  • Надзор (Supervision): Отдельный модуль отслеживает общий прогресс и может вмешаться, если основной агент зашел в тупик.
  • Интеграция инструментов: Прямая связь с компиляторами, профилировщиками или игровыми средами для получения объективной обратной связи.
NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

02От оптимизации GPU к абстрактному мышлению: универсальность AVO

Изначально AVO была разработана для решения узкой, но крайне сложной инженерной задачи: оптимизации GPU-ядер (kernel optimization). В этой области пространство поиска огромно, а влияние малейших изменений на производительность трудно предсказать без запуска кода. AVO действовала как автономный исследователь:

  1. Она анализировала существующие реализации.
  2. Формировала гипотезы об оптимизации.
  3. Вносила изменения в код.
  4. Запускала тесты на реальном оборудовании (NVIDIA DGX B200).
  5. Анализировала результаты профилировщиков и компиляторов.
  6. Корректировала подход на основе полученных данных.

За семь дней непрерывной работы AVO исследовала более 500 направлений оптимизации, зафиксировала 40 версий ядер и достигла производительности на 10,5% выше, чем FlashAttention-4. Это доказало, что агент может вести продуктивный инженерный цикл без ручного вмешательства.

Однако истинный тест на универсальность пришелся на бенчмарк ARC-AGI-3. Это задача на интерактивное рассуждение, где агент попадает в незнакомую среду без инструкций, правил или явных целей. Ему нужно методом проб и ошибок вывести логику игры. На первый взгляд, оптимизация кода и решение логических головоломок не имеют ничего общего. Но с точки зрения архитектуры агента, паттерн вычислений идентичен:

  • Построение гипотезы на основе неполных данных.
  • Действие через внешний интерфейс.
  • Наблюдение за последствиями.
  • Сохранение полезного состояния.
  • Корректировка модели проблемы.
  • Восстановление после ошибок.

AVO показала, что «генеральность» (generality) агента достигается не за счет знания предметной области, а за счет наличия механизмов, позволяющих накапливать опыт и использовать обратную связь во времени.

💡
Ключевой инсайт. Производительность и общность агентов происходят от системной архитектуры, а не только от возможностей модели. Модель дает потенциал, но система определяет, как этот потенциал превращается в устойчивый прогресс.

03Как устроена архитектура AVO: Память и Надзор

Чтобы агент мог работать долго, ему нужно два критических механизма, которые часто упускаются в стандартных реализациях:

1. Персистентная память (Persistent Memory)

В отличие от кратковременной контекстной окна LLM, персистентная память AVO сохраняет историю всех предыдущих реализаций, результаты оценок, выводы компиляторов и профилировщиков, а также накопленные рассуждения. Это позволяет агенту возобновлять работу с текущего состояния, а не начинать с нуля, повторяя одни и те же ошибки. Память становится «накопителем знаний», который растет с каждой итерацией.

2. Надзор (Supervision)

Основной агент отвечает за тактические решения: что проверить, что изменить, что протестировать. Однако он может зациклиться. Модуль надзора (supervisor) смотрит на более широкую траекторию поиска. Если он замечает стагнацию или повторяющиеся непродуктивные циклы, он может вмешаться и перенаправить основного агента на альтернативные стратегии. В эксперименте с GPU-ядрами надзор помогал поддерживать прогресс, когда поиск входил в плато.

NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

04Результаты на ARC-AGI-3: 100% и эффективность

Бенчмарк ARC-AGI-3 оценивает агентов с помощью метрики Relative Human Action Efficiency (RHAE). Эта метрика учитывает не только решение задачи, но и эффективность действий по сравнению с человеком, выполняющим задачу впервые. Чем меньше действий нужно агенту для решения уровня, тем выше его эффективность.

Результаты AVO на публичном наборе данных (25 сред, 183 уровня) стали сенсацией:

  • Счет: 100.00 RHAE. Все 183 уровня были решены.
  • Эффективность: AVO использовала 6 624 действия среды. Для сравнения, система VISTA (также на базе Claude Opus 5) использовала 7 542 действия. AVO оказалась эффективнее на 12%.

Важно отметить, что это не контролируемое абляционное исследование. Системы различаются по бэкенду, представлению наблюдений и управлению контекстом. В AVO модель работала в текстовом режиме с сеткой 64x64, без изображений, что требовало от агента высокой способности к абстракции. Тем не менее, результат демонстрирует, что правильный системный дизайн позволяет модели работать значительно эффективнее.

⚠️
Важно понимать. Результат 100% не означает, что модель стала «сверхразумом». Это означает, что архитектура AVO минимизировала потери времени и ресурсов на неэффективные探索 (exploration), позволив модели сосредоточиться на действительно полезных гипотезах.

05Сравнение с другими подходами: VISTA и Tycho

В сообществе ARC-AGI-3 существуют разные философские подходы к созданию агентов:

  • Tycho: Использует явные исполняемые модели мира (programmatic world models). Агент строит внутреннюю симуляцию среды.
  • VISTA: Использует прямое взаимодействие (direct interaction), полагаясь на визуальные или текстовые наблюдения без явного моделирования правил.

AVO выбрала путь, близкий к VISTA, но с собственной реализацией бэкенда. Отказ от явного построения модели мира позволил избежать сложностей в синтаксисе и логике правил, которые часто ломаются в сложных средах. Вместо этого AVO полагается на накопление опыта через память и надзор. Это делает систему более гибкой и устойчивой к изменениям в среде.

Интересно, что AVO также тестировалась с моделью GPT-5.6 Sol. В некоторых случаях Sol решал уровни быстрее по реальному времени, но Opus 5 требовал меньше действий среды. Это указывает на то, что разные модели могут иметь разные профили работы, и выбор модели должен зависеть от приоритетов (скорость vs. экономия действий).

NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

06Безопасность и надежность: доверенный стек агентов

Одним из скрытых, но критически важных аспектов работы AVO является вопрос безопасности. Когда агент автономно пишет код, запускает команды и взаимодействует с системой, риски возрастают. NVIDIA подчеркивает необходимость создания «доверенного стека агентов» (trusted agent stack).

В контексте AVO это означает:

  1. Изоляция выполнения: Код агента должен запускаться в безопасных контейнерах или песочницах.
  2. Контроль доступа: Агент должен иметь доступ только к необходимым ресурсам.
  3. Валидация: Любые изменения в коде или системе должны проходить проверку перед применением.

Этот подход особенно важен при переходе от исследовательских задач к промышленным. Агенты, способные работать неделями, должны быть не только умными, но и безопасными. Архитектура AVO закладывает основы для такого контроля на системном уровне, а не только на уровне модели.

NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

07Что это значит на практике

Для разработчиков и компаний, внедряющих AI-агентов, выводы из исследования NVIDIA AVO имеют прямое практическое значение:

  • Инвестируйте в архитектуру, а не только в модель. Покупка самой дорогой LLM не гарантирует успеха. Лучше использовать среднюю модель, но с мощной системой памяти, надзора и интеграции инструментов.
  • Проектируйте для долгосрочной работы. Если ваш агент должен работать долго, продумайте, как он будет сохранять контекст и восстанавливаться после сбоев. Краткосрочное контекстное окно — это узкое горлышко.
  • Используйте надзор. Автоматический мониторинг траектории поиска позволяет избежать бесконечных циклов ошибок и экономит ресурсы.
  • Тестируйте на универсальных задачах. Если ваш агент работает только в одной узкой области, он не является «генеральным». Тестируйте его на задачах, требующих адаптации к новым условиям.

AVO демонстрирует, что будущее AI — это не просто большие модели, а большие, умные и надежные системы, которые могут действовать автономно, учиться на ошибках и достигать сложных целей без постоянного вмешательства человека. Это шаг от «чат-ботов» к настоящим «цифровым сотрудникам».

NVIDIA AVO: 100% на ARC-AGI-3 и будущее автономных агентов

Источник: NVIDIA Developer ↗