Инструменты13 июля 2026 г., 11:16 МСК🤖 Auto

Prime Intellect выпустил Verifiers v1: новая архитектура для Agentic RL

Prime Intellect представила переработанную платформу verifiers v1, разделяющую задачи, инструменты и среду выполнения. Это позволяет масштабировать обучение агентов с инструментами и субагентами, устраняя квадратичный рост памяти.

Баннер новости 3438

Архитектурный сдвиг: от монолита к компонентам

Prime Intellect выпустила версию verifiers 0.2.0, которая переписывает ядро под новым пространством имен verifiers.v1. Главная инновация — отказ от монолитной среды, где данные, логика агента и инфраструктура были жестко связаны. Теперь стек разделен на три композируемые части:

  • Taskset (Задача): Определяет данные, инструменты и метрики оценки (что делать).
  • Harness (Инструмент): Решает задачу, генерируя роулы. Поддерживает ReAct-циклы, CLI-агентов или кастомные решения (как делать).
  • Runtime (Среда): Выполняет роулы локально или в песочнице (где делать).

Такая декомпозиция позволяет запускать любой Taskset с любым совместимым Harness, что критически важно для гибкой настройки Agentic RL.

Технические детали: Interception Server и линейные трейсы

Центральным элементом новой архитектуры стал interception server. Он работает как прокси между рантаймом агента и сервером инференса, перехватывая запросы и ответы. Это позволяет:

  1. Записывать трейсы в реальном времени.
  2. Настраивать параметры сэмплирования.
  3. Переписывать ответы инструментов для предотвращения reward hacking (манипуляций с наградой).

Ключевое улучшение касается хранения данных. В версии v0 размер трейста рос квадратично от количества шагов (из-за дублирования пар prompt-completion). В v1 используется линейный граф сообщений с уникальными узлами, что радикально снижает потребление памяти при длинных горизонтах планирования.

Сравнение версий: v0 против v1

Аспект verifiers v0 verifiers v1
Модель среды Данные, логика и инфраструктура в одном блоке Разделено на Taskset, Harness, Runtime
Рост трейса Квадратичный по шагам (повторяющиеся пары) Линейный по шагам (уникальные узлы)
Нелинейные роулы Предполагалась линейность Нативная поддержка компакции и субагентов через ветвления
Управление рантаймом Builder управляет жизненным циклом Управляется фреймворком через run/read/write
Связь с Harness Жестко связано со средой Любой совместимый Harness (Codex, Terminus 2)
Данные для обучения Пересчитываются для prime-rl Потребляются напрямую из трейса

Практическое применение и бенчмарки

Новая архитектура уже демонстрирует результаты на реальных задачах. Команды могут использовать датасеты Harbor без переписывания логики вознаграждения. При портировании Terminal-Bench 2 в v1 потребовалось написать лишь небольшой класс, а внутренние тесты показали соответствие производительности Harbor.

В контексте обучения (prime-rl) была проведена абляция с penalty за длину. Модель GLM-4.5-Air обучалась на датасете ScaleSWE в течение двух дней на кластере из шести GPU NVIDIA H200. Оценка на SWE-Bench-Verified показала стабильное обучение агентов, способных работать с инструментами.

Платформа поддерживает три «диалекта» API для нормализации форматов в vf.types: OpenAI Chat Completions, OpenAI Responses и Anthropic Messages. Это позволяет писать логику оценки, независимую от конкретного тестируемого агента.

Как начать работу

Запуск начинается с определения Taskset на Python, где задаются данные и функция награды. Затем конфигурация сохраняется в TOML-файл, где указывается модель (например, nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B) и используемый Harness (например, codex версии 0.116.0). Запуск осуществляется через CLI-команду uv run eval @ path_to_config.toml. Легаси-код v0 теперь заморожен, и все новые разработки рекомендуются вести на базе v1.

Источник: MarkTechPost ↗