Архитектурный сдвиг: от монолита к компонентам
Prime Intellect выпустила версию verifiers 0.2.0, которая переписывает ядро под новым пространством имен verifiers.v1. Главная инновация — отказ от монолитной среды, где данные, логика агента и инфраструктура были жестко связаны. Теперь стек разделен на три композируемые части:
- Taskset (Задача): Определяет данные, инструменты и метрики оценки (что делать).
- Harness (Инструмент): Решает задачу, генерируя роулы. Поддерживает ReAct-циклы, CLI-агентов или кастомные решения (как делать).
- Runtime (Среда): Выполняет роулы локально или в песочнице (где делать).
Такая декомпозиция позволяет запускать любой Taskset с любым совместимым Harness, что критически важно для гибкой настройки Agentic RL.
Технические детали: Interception Server и линейные трейсы
Центральным элементом новой архитектуры стал interception server. Он работает как прокси между рантаймом агента и сервером инференса, перехватывая запросы и ответы. Это позволяет:
- Записывать трейсы в реальном времени.
- Настраивать параметры сэмплирования.
- Переписывать ответы инструментов для предотвращения reward hacking (манипуляций с наградой).
Ключевое улучшение касается хранения данных. В версии v0 размер трейста рос квадратично от количества шагов (из-за дублирования пар prompt-completion). В v1 используется линейный граф сообщений с уникальными узлами, что радикально снижает потребление памяти при длинных горизонтах планирования.
Сравнение версий: v0 против v1
| Аспект | verifiers v0 | verifiers v1 |
|---|---|---|
| Модель среды | Данные, логика и инфраструктура в одном блоке | Разделено на Taskset, Harness, Runtime |
| Рост трейса | Квадратичный по шагам (повторяющиеся пары) | Линейный по шагам (уникальные узлы) |
| Нелинейные роулы | Предполагалась линейность | Нативная поддержка компакции и субагентов через ветвления |
| Управление рантаймом | Builder управляет жизненным циклом | Управляется фреймворком через run/read/write |
| Связь с Harness | Жестко связано со средой | Любой совместимый Harness (Codex, Terminus 2) |
| Данные для обучения | Пересчитываются для prime-rl | Потребляются напрямую из трейса |
Практическое применение и бенчмарки
Новая архитектура уже демонстрирует результаты на реальных задачах. Команды могут использовать датасеты Harbor без переписывания логики вознаграждения. При портировании Terminal-Bench 2 в v1 потребовалось написать лишь небольшой класс, а внутренние тесты показали соответствие производительности Harbor.
В контексте обучения (prime-rl) была проведена абляция с penalty за длину. Модель GLM-4.5-Air обучалась на датасете ScaleSWE в течение двух дней на кластере из шести GPU NVIDIA H200. Оценка на SWE-Bench-Verified показала стабильное обучение агентов, способных работать с инструментами.
Платформа поддерживает три «диалекта» API для нормализации форматов в vf.types: OpenAI Chat Completions, OpenAI Responses и Anthropic Messages. Это позволяет писать логику оценки, независимую от конкретного тестируемого агента.
Как начать работу
Запуск начинается с определения Taskset на Python, где задаются данные и функция награды. Затем конфигурация сохраняется в TOML-файл, где указывается модель (например, nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B) и используемый Harness (например, codex версии 0.116.0). Запуск осуществляется через CLI-команду uv run eval @ path_to_config.toml. Легаси-код v0 теперь заморожен, и все новые разработки рекомендуются вести на базе v1.
Источник: MarkTechPost ↗
