В мире искусственного интеллекта последние годы доминировал нарратив о том, что ключ к прорывам кроется исключительно в увеличении параметров моделей и их предобучении. Однако исследование NVIDIA, представленное в августе 2026 года, бросает вызов этой парадигме. Команда разработчиков, включая Терри Чена, Ейин Чжу и других, продемонстрировала архитектуру Agentic Variation Operators (AVO), которая не просто улучшает результаты, а переосмысливает саму природу автономных агентов. AVO достигла идеального результата — 100% по метрике RHAE на сложнейшем бенчмарке ARC-AGI-3, обойдя аналоги по эффективности действий. Но самое важное здесь не цифра, а то, как она была достигнута: через системный дизайн, а не через силу самой языковой модели.
Этот материал — не просто пересказ новости. Это глубокое погружение в то, почему «обвязка» вокруг модели (harness) часто важнее самой модели. Мы разберем, как AVO решает проблему долгосрочной автономности, что такое персистентная память и надзор, и почему этот подход применим не только к оптимизации GPU-ядер, но и к абстрактному логическому мышлению. Если вы строите AI-агентов для бизнеса или исследований, понимание этих принципов критически важно для создания надежных систем, способных работать неделями без вмешательства человека.
01Почему одной модели недостаточно: проблема долгосрочных задач
Фронтенд-модель (LLM) — это лишь один компонент сложной экосистемы. Представьте себе гениального инженера, который сидит в пустой комнате без инструментов, без доступа к документации и без возможности запоминать то, что он делал час назад. Даже если этот инженер гениален, он не сможет построить мост. Так и с AI-агентом: мощная модель, лишенная контекста, инструментов и памяти, не способна решать задачи, требующие множества шагов.
Проблема современных агентов заключается в «горизонте планирования». Большинство систем теряют нить повествования или начинают зацикливаться на одних и тех же ошибках после нескольких итераций. NVIDIA AVO (Agentic Variation Operators) была создана именно для решения этой проблемы. Это не просто код, который генерирует ответ, а архитектура, обеспечивающая устойчивую автономную работу на длинных горизонтах (long-horizon tasks). Ключевые отличия AVO от стандартных подходов:
- Постоянная память (Persistent Memory): Агент не забывает предыдущие попытки, ошибки и успешные гипотезы.
- Надзор (Supervision): Отдельный модуль отслеживает общий прогресс и может вмешаться, если основной агент зашел в тупик.
- Интеграция инструментов: Прямая связь с компиляторами, профилировщиками или игровыми средами для получения объективной обратной связи.

02От оптимизации GPU к абстрактному мышлению: универсальность AVO
Изначально AVO была разработана для решения узкой, но крайне сложной инженерной задачи: оптимизации GPU-ядер (kernel optimization). В этой области пространство поиска огромно, а влияние малейших изменений на производительность трудно предсказать без запуска кода. AVO действовала как автономный исследователь:
- Она анализировала существующие реализации.
- Формировала гипотезы об оптимизации.
- Вносила изменения в код.
- Запускала тесты на реальном оборудовании (NVIDIA DGX B200).
- Анализировала результаты профилировщиков и компиляторов.
- Корректировала подход на основе полученных данных.
За семь дней непрерывной работы AVO исследовала более 500 направлений оптимизации, зафиксировала 40 версий ядер и достигла производительности на 10,5% выше, чем FlashAttention-4. Это доказало, что агент может вести продуктивный инженерный цикл без ручного вмешательства.
Однако истинный тест на универсальность пришелся на бенчмарк ARC-AGI-3. Это задача на интерактивное рассуждение, где агент попадает в незнакомую среду без инструкций, правил или явных целей. Ему нужно методом проб и ошибок вывести логику игры. На первый взгляд, оптимизация кода и решение логических головоломок не имеют ничего общего. Но с точки зрения архитектуры агента, паттерн вычислений идентичен:
- Построение гипотезы на основе неполных данных.
- Действие через внешний интерфейс.
- Наблюдение за последствиями.
- Сохранение полезного состояния.
- Корректировка модели проблемы.
- Восстановление после ошибок.
AVO показала, что «генеральность» (generality) агента достигается не за счет знания предметной области, а за счет наличия механизмов, позволяющих накапливать опыт и использовать обратную связь во времени.
03Как устроена архитектура AVO: Память и Надзор
Чтобы агент мог работать долго, ему нужно два критических механизма, которые часто упускаются в стандартных реализациях:
1. Персистентная память (Persistent Memory)
В отличие от кратковременной контекстной окна LLM, персистентная память AVO сохраняет историю всех предыдущих реализаций, результаты оценок, выводы компиляторов и профилировщиков, а также накопленные рассуждения. Это позволяет агенту возобновлять работу с текущего состояния, а не начинать с нуля, повторяя одни и те же ошибки. Память становится «накопителем знаний», который растет с каждой итерацией.
2. Надзор (Supervision)
Основной агент отвечает за тактические решения: что проверить, что изменить, что протестировать. Однако он может зациклиться. Модуль надзора (supervisor) смотрит на более широкую траекторию поиска. Если он замечает стагнацию или повторяющиеся непродуктивные циклы, он может вмешаться и перенаправить основного агента на альтернативные стратегии. В эксперименте с GPU-ядрами надзор помогал поддерживать прогресс, когда поиск входил в плато.

04Результаты на ARC-AGI-3: 100% и эффективность
Бенчмарк ARC-AGI-3 оценивает агентов с помощью метрики Relative Human Action Efficiency (RHAE). Эта метрика учитывает не только решение задачи, но и эффективность действий по сравнению с человеком, выполняющим задачу впервые. Чем меньше действий нужно агенту для решения уровня, тем выше его эффективность.
Результаты AVO на публичном наборе данных (25 сред, 183 уровня) стали сенсацией:
- Счет: 100.00 RHAE. Все 183 уровня были решены.
- Эффективность: AVO использовала 6 624 действия среды. Для сравнения, система VISTA (также на базе Claude Opus 5) использовала 7 542 действия. AVO оказалась эффективнее на 12%.
Важно отметить, что это не контролируемое абляционное исследование. Системы различаются по бэкенду, представлению наблюдений и управлению контекстом. В AVO модель работала в текстовом режиме с сеткой 64x64, без изображений, что требовало от агента высокой способности к абстракции. Тем не менее, результат демонстрирует, что правильный системный дизайн позволяет модели работать значительно эффективнее.
05Сравнение с другими подходами: VISTA и Tycho
В сообществе ARC-AGI-3 существуют разные философские подходы к созданию агентов:
- Tycho: Использует явные исполняемые модели мира (programmatic world models). Агент строит внутреннюю симуляцию среды.
- VISTA: Использует прямое взаимодействие (direct interaction), полагаясь на визуальные или текстовые наблюдения без явного моделирования правил.
AVO выбрала путь, близкий к VISTA, но с собственной реализацией бэкенда. Отказ от явного построения модели мира позволил избежать сложностей в синтаксисе и логике правил, которые часто ломаются в сложных средах. Вместо этого AVO полагается на накопление опыта через память и надзор. Это делает систему более гибкой и устойчивой к изменениям в среде.
Интересно, что AVO также тестировалась с моделью GPT-5.6 Sol. В некоторых случаях Sol решал уровни быстрее по реальному времени, но Opus 5 требовал меньше действий среды. Это указывает на то, что разные модели могут иметь разные профили работы, и выбор модели должен зависеть от приоритетов (скорость vs. экономия действий).

06Безопасность и надежность: доверенный стек агентов
Одним из скрытых, но критически важных аспектов работы AVO является вопрос безопасности. Когда агент автономно пишет код, запускает команды и взаимодействует с системой, риски возрастают. NVIDIA подчеркивает необходимость создания «доверенного стека агентов» (trusted agent stack).
В контексте AVO это означает:
- Изоляция выполнения: Код агента должен запускаться в безопасных контейнерах или песочницах.
- Контроль доступа: Агент должен иметь доступ только к необходимым ресурсам.
- Валидация: Любые изменения в коде или системе должны проходить проверку перед применением.
Этот подход особенно важен при переходе от исследовательских задач к промышленным. Агенты, способные работать неделями, должны быть не только умными, но и безопасными. Архитектура AVO закладывает основы для такого контроля на системном уровне, а не только на уровне модели.

07Что это значит на практике
Для разработчиков и компаний, внедряющих AI-агентов, выводы из исследования NVIDIA AVO имеют прямое практическое значение:
- Инвестируйте в архитектуру, а не только в модель. Покупка самой дорогой LLM не гарантирует успеха. Лучше использовать среднюю модель, но с мощной системой памяти, надзора и интеграции инструментов.
- Проектируйте для долгосрочной работы. Если ваш агент должен работать долго, продумайте, как он будет сохранять контекст и восстанавливаться после сбоев. Краткосрочное контекстное окно — это узкое горлышко.
- Используйте надзор. Автоматический мониторинг траектории поиска позволяет избежать бесконечных циклов ошибок и экономит ресурсы.
- Тестируйте на универсальных задачах. Если ваш агент работает только в одной узкой области, он не является «генеральным». Тестируйте его на задачах, требующих адаптации к новым условиям.
AVO демонстрирует, что будущее AI — это не просто большие модели, а большие, умные и надежные системы, которые могут действовать автономно, учиться на ошибках и достигать сложных целей без постоянного вмешательства человека. Это шаг от «чат-ботов» к настоящим «цифровым сотрудникам».

Источник: NVIDIA Developer ↗
