Инструменты14 июля 2026 г., 19:30 МСК🤖 Auto

NVIDIA NeMo + Codex: Автономный RL-исследования с ростом точности до 96.9%

NVIDIA демонстрирует, как связка NeMo RL, NeMo Gym и агента Codex (GPT-5.5) автоматизирует полный цикл RL-исследований, включая создание сред и обучение моделей.

Баннер новости 3558

Автоматизация полного цикла RL-исследований

В блоге NVIDIA Developer описан рабочий процесс autoresearch, где автономный AI-агент (на базе модели Codex с GPT-5.5) самостоятельно управляет сложным циклом обучения с подкреплением (Reinforcement Learning, RL). Агент не просто пишет код, а выполняет полный стек задач: от настройки окружения и разрешения зависимостей до запуска экспериментов, мониторинга метрик и анализа результатов. Ключевая идея — передача рутинной работы агенту, при этом исследователь сохраняет стратегический контроль над целями, данными и интеллектуальной собственностью.

Три ключевые способности агента

Демонстрация на базе NVIDIA Brev (GPU NVIDIA L40S 48 GB) и фреймворка NVIDIA NeMo выделила три критически важные функции автономного агента:

  • Полная автономия стека (Full-stack autonomy): Агент самостоятельно настраивает программную среду, управляет памятью GPU, дисковым пространством, чекпоинтами и отлаживает ошибки сборки.
  • Целевой autoresearch: Агент профилирует базовую линию (baseline), выдвигает гипотезы, запускает эксперименты, анализирует метрики и итеративно улучшает модель в рамках заданной цели.
  • Трансляция «бумага-в-код» (Paper-to-code): Агент читает научную статью, составляет план реализации, переводит алгоритм в рабочий код, добавляет тесты и начинает валидационное обучение.

Результаты: от 25% до 96.9% точности

В ходе эксперимента агент Codex создал новую среду визуального подсчета в NVIDIA NeMo Gym с нуля и обучил модель Qwen3-VL-2B-Instruct (Vision-Language Model). Результатом стала значительная оптимизация: точность модели на кастомной задаче выросла с 25.0% до 96.9%. Кроме того, агент успешно реализовал off-policy RL-алгоритм (OAPL) из научной литературы и запустил 10-часовую кампанию валидационного обучения.

Параметр Значение / Описание
Агент Codex (на базе GPT-5.5)
Фреймворк NVIDIA NeMo RL, NeMo Gym (на базе Megatron-Bridge, vLLM, Ray)
Железо NVIDIA Brev instance с GPU NVIDIA L40S 48 GB
Обучаемая модель Qwen3-VL-2B-Instruct (VLM)
Базовая точность 25.0%
Итоговая точность 96.9%
Длительность валидации 10 часов (для off-policy алгоритма OAPL)

Инструментарий: Agent Skills для воспроизводимости

Для обеспечения стабильности долгосрочных сессий и сохранения контекста были использованы три специализированных agent skills:

  • Brev-etiquette: Правила гигиены системы для NVIDIA Brev. Обеспечивает чистоту репозитория, правильное хранение чекпоинтов и кэшей, а также безопасную работу с секретами.
  • Session-memory: Долговременная память сессии. Записывает цели, подзадачи, принятые решения, прогресс и заметки для передачи контекста при разрывах соединения или сжатии окна.
  • Autoresearch: Цикл экспериментов. Фиксирует цель пользователя, создает ветки для каждой гипотезы, ведет журнал (ledger) попыток, контролирует правила остановки и суммирует результаты для человека.

Почему это важно

Этот подход меняет парадигму ML-исследований. Вместо того чтобы тратить недели на настройку инфраструктуры и рутинные итерации, исследователи могут делегировать эти задачи агенту. Интеграция NVIDIA NeMo с автономными агентами позволяет создавать воспроизводимые, масштабируемые и надежные рабочие процессы, где AI выступает в роли «руководителя» экспериментов, а человек — в роли стратега.

Источник: NVIDIA dev blog ↗