Автоматизация полного цикла RL-исследований
В блоге NVIDIA Developer описан рабочий процесс autoresearch, где автономный AI-агент (на базе модели Codex с GPT-5.5) самостоятельно управляет сложным циклом обучения с подкреплением (Reinforcement Learning, RL). Агент не просто пишет код, а выполняет полный стек задач: от настройки окружения и разрешения зависимостей до запуска экспериментов, мониторинга метрик и анализа результатов. Ключевая идея — передача рутинной работы агенту, при этом исследователь сохраняет стратегический контроль над целями, данными и интеллектуальной собственностью.
Три ключевые способности агента
Демонстрация на базе NVIDIA Brev (GPU NVIDIA L40S 48 GB) и фреймворка NVIDIA NeMo выделила три критически важные функции автономного агента:
- Полная автономия стека (Full-stack autonomy): Агент самостоятельно настраивает программную среду, управляет памятью GPU, дисковым пространством, чекпоинтами и отлаживает ошибки сборки.
- Целевой autoresearch: Агент профилирует базовую линию (baseline), выдвигает гипотезы, запускает эксперименты, анализирует метрики и итеративно улучшает модель в рамках заданной цели.
- Трансляция «бумага-в-код» (Paper-to-code): Агент читает научную статью, составляет план реализации, переводит алгоритм в рабочий код, добавляет тесты и начинает валидационное обучение.
Результаты: от 25% до 96.9% точности
В ходе эксперимента агент Codex создал новую среду визуального подсчета в NVIDIA NeMo Gym с нуля и обучил модель Qwen3-VL-2B-Instruct (Vision-Language Model). Результатом стала значительная оптимизация: точность модели на кастомной задаче выросла с 25.0% до 96.9%. Кроме того, агент успешно реализовал off-policy RL-алгоритм (OAPL) из научной литературы и запустил 10-часовую кампанию валидационного обучения.
| Параметр | Значение / Описание |
|---|---|
| Агент | Codex (на базе GPT-5.5) |
| Фреймворк | NVIDIA NeMo RL, NeMo Gym (на базе Megatron-Bridge, vLLM, Ray) |
| Железо | NVIDIA Brev instance с GPU NVIDIA L40S 48 GB |
| Обучаемая модель | Qwen3-VL-2B-Instruct (VLM) |
| Базовая точность | 25.0% |
| Итоговая точность | 96.9% |
| Длительность валидации | 10 часов (для off-policy алгоритма OAPL) |
Инструментарий: Agent Skills для воспроизводимости
Для обеспечения стабильности долгосрочных сессий и сохранения контекста были использованы три специализированных agent skills:
- Brev-etiquette: Правила гигиены системы для NVIDIA Brev. Обеспечивает чистоту репозитория, правильное хранение чекпоинтов и кэшей, а также безопасную работу с секретами.
- Session-memory: Долговременная память сессии. Записывает цели, подзадачи, принятые решения, прогресс и заметки для передачи контекста при разрывах соединения или сжатии окна.
- Autoresearch: Цикл экспериментов. Фиксирует цель пользователя, создает ветки для каждой гипотезы, ведет журнал (ledger) попыток, контролирует правила остановки и суммирует результаты для человека.
Почему это важно
Этот подход меняет парадигму ML-исследований. Вместо того чтобы тратить недели на настройку инфраструктуры и рутинные итерации, исследователи могут делегировать эти задачи агенту. Интеграция NVIDIA NeMo с автономными агентами позволяет создавать воспроизводимые, масштабируемые и надежные рабочие процессы, где AI выступает в роли «руководителя» экспериментов, а человек — в роли стратега.
Источник: NVIDIA dev blog ↗
