Главная/Блог/Гайд/Prime Intellect Verifiers v1:…
Гайд8 мин чтения · 13 июля 2026 г.

Prime Intellect Verifiers v1: Архитектура агентов нового поколения

Разбираем релиз Prime Intellect Verifiers v1: как модульная архитектура, линейные графы и нативная поддержка агентов меняют правила игры в обучении с подкреплением.

Prime Intellect Verifiers v1: Архитектура агентов нового поколения

В мире искусственного интеллекта, где скорость изменений измеряется не месяцами, а днями, появление новых инструментов для обучения агентов — это не просто обновление, а сдвиг парадигмы. Компания Prime Intellect, известная своими инновациями в области агентного ИИ, представила версию 0.2.0 своей платформы verifiers, которая теперь работает под новым пространством имен verifiers.v1. Это не просто патч безопасности или косметическое улучшение интерфейса. Это фундаментальная перестройка ядра, которая позволяет современным оценочным системам запускать кодировочных агентов (coding agents) с использованием сложных инструментов, механизмов сжатия контекста и подагентов.

Ранее среда выполнения (environment) в verifiers представляла собой монолитную структуру, где данные, логика агента и инфраструктура были жестко связаны. Версия v1 разрушает этот монолит, разделяя его на три независимых, но компонуемых модуля. Это позволяет запускать агентные нагрузки в масштабе, который ранее был невозможен без огромных затрат на разработку кастомных решений. Для исследователей и инженеров, работающих с агентами, это означает переход от «скриптовых» проверок к полноценному обучению с подкреплением (RL) в сложных, многошаговых сценариях.

01Что такое verifiers v1 и почему это важно?

Чтобы понять масштаб изменений, нужно сначала определить, что такое verifiers. Это стековая среда для агентного обучения с подкреплением и оценки моделей. В предыдущей версии (v0) среда была единым блоком: вы определяли задачу, и эта же структура управляла тем, как агент взаимодействует с инфраструктурой. Это создавало узкие места: если вы хотели изменить способ взаимодействия агента с миром, вам приходилось переписывать значительную часть кода.

Версия v1 предлагает элегантное решение через разделение ответственности. Теперь среда состоит из трех ключевых компонентов:

  1. Taskset (Набор задач): Определяет «что» нужно сделать. Это данные, доступные инструменты и критерии оценки (scoring). Taskset не знает, как именно задача будет решена.
  2. Harness (Обвязка/Запуск): Определяет «как» решается задача. Это может быть цикл ReAct, CLI-агент, или ваша собственная логика. Harness решает задачу и генерирует роут (rollout) — последовательность действий агента.
  3. Runtime (Среда выполнения): Определяет «где» выполняется роут. Это может быть локальная машина или изолированная песочница (sandbox).

Ключевое преимущество этой архитектуры — декомпозиция. Любой Taskset может быть запущен под любым совместимым Harness. Это означает, что вы можете написать один набор тестов для Terminal-Bench 2, а затем протестировать его на Codex, Terminus 2 или любом другом агенте, не переписывая логику оценки. Это радикально снижает порог входа для экспериментов с новыми моделями.

Схема взаимодействия компонентов verifiers v1: Taskset, Harness и Runtime
Схема взаимодействия компонентов verifiers v1: Taskset, Harness и Runtime

02Как работает архитектура: Внутренняя механика

Разделение на модули — это только половина дела. Вторая половина — это то, как эти модули общаются друг с другом. Центральным элементом этой коммуникации является interception server (сервер перехвата), управляемый verifiers. Он располагается между средой выполнения агента и сервером инференса (инференса).

Сервер перехвата выполняет несколько критически важных функций:

  • Проксирование: Он перенаправляет запросы к серверу инференса и возвращает ответы обратно агенту.
  • Запись трассировки (Trace): Он записывает полный лог взаимодействий, устанавливает параметры сэмплирования и, что особенно важно, может переписывать ответы инструментов.

Переписывание ответов инструментов — это мощный механизм для борьбы с «reward hacking» (обманом функции вознаграждения) во время обучения. Если агент пытается манипулировать системой, получая ложные положительные результаты от инструментов, сервер перехвата может корректировать эти ответы, обеспечивая честную и стабильную обратную связь для модели.

Prime Intellect Verifiers v1: Архитектура агентов нового поколения

Для обеспечения масштабируемости каждый сервер мультиплексирует постоянное количество роутов (по умолчанию 32). Пул серверов масштабируется эластично в зависимости от наблюдаемой конкурентности. Это позволяет эффективно использовать вычислительные ресурсы, особенно при запуске на кластерах GPU, таких как H200, где параллелизм играет ключевую роль.

💡
Техническая деталь. Сервер владеет клиентом, который передает запросы. Во время оценки используется EvalClient, действующий как слепой HTTP-прокси. Во время обучения TrainClient оборачивает рендереры для обеспечения точной передачи токенов в процессе RL-обучения. Это гарантирует, что данные, видимые модели, точно соответствуют тем, которые она использовала для принятия решений.

Поддержка различных «диалектов» API

Одной из самых больших проблем в экосистеме ИИ является фрагментация API. Разные провайдеры (OpenAI, Anthropic, локальные модели) используют разные форматы запросов. Verifiers v1 решает эту проблему через поддержку трех основных диалектов: OpenAI Chat Completions, OpenAI Responses и Anthropic Messages. Адаптер диалектов нормализует каждый формат в канонические типы vf.types. Это означает, что ваша логика оценки остается независимой от того, какой агент вы тестируете. Вы пишете код оценки один раз, и он работает везде.

03Сравнение v0 и v1: От квадратичной сложности к линейной

Переход от v0 к v1 — это не просто смена нумерации. Это архитектурный скачок, который решает фундаментальные проблемы масштабируемости. Давайте сравним ключевые аспекты:

Аспект verifiers v0 verifiers v1
Модель среды Данные, логика и инфраструктура связаны воедино Разделены на Taskset, Harness, Runtime
Рост трассировки (Trace) Квадратичный по количеству ходов (повторяющиеся пары) Линейный по количеству ходов (уникальные узлы)
Нелинейные роуты Предполагалась линейность Нативная поддержка сжатия и подагентов через ветвления
Управление Runtime Builder управляет жизненным циклом Управляется фреймворком через run, read, write
Связь с Harness Жестко связано со средой Любой совместимый Harness (Codex, Terminus 2)
Данные для обучения Пересчитываются для prime-rl Потребляются напрямую из трассировки

Обратите внимание на пункт про рост трассировки. В v0 трассировка росла квадратично, что делало невозможным обучение на длинных горизонтах (long-horizon tasks). В v1 используется линейный граф сообщений, где хранятся только уникальные узлы. Это позволяет обрабатывать бесконечно длинные сессии без экспоненциального роста потребления памяти. Кроме того, v1 нативно поддерживает сжатие и подагентов через ветвления, что критически важно для современных агентов, которые часто делегируют задачи друг другу.

04Практическое применение: Примеры использования

Как эта архитектура выглядит в реальной жизни? Рассмотрим несколько сценариев, которые демонстрируют мощь verifiers v1.

1. Оценка агентов на сложных бенчмарках

Вы можете запустить модель Nemotron 3 Ultra на бенчмарке Terminal-Bench 2, используя Harness Codex. Благодаря модульности, вам не нужно писать новый код для интеграции. Вы просто указываете Taskset (Terminal-Bench 2) и Harness (Codex), и система делает всю грязную работу по настройке окружения и сбору метрик. В внутренних тестах Prime Intellect подтвердила, что verifiers v1 показывает производительность, сопоставимую с Harbor (первым полностью поддерживаемым сторонним форматом), на тех же задачах.

2. Обучение с подкреплением (RL)

Среда v1 напрямую подключается к prime-rl. Яркий пример — абляционное исследование с штрафом за длину (length-penalty). Модель GLM-4.5-Air обучалась на датасете ScaleSWE в течение двух дней на шести узлах с GPU H200. После обучения модель была оценена на SWE-Bench-Verified, показав стабильные результаты агентного обучения. Это доказывает, что архитектура выдерживает тяжелые нагрузки и может использоваться для тонкой настройки моделей под конкретные задачи программирования.

3. Переиспользование датасетов

Команды могут использовать датасеты Harbor без переписывания логики вознаграждения. Prime Intellect портировала Terminal Bench 2 в v1, добавив лишь небольшой класс. Это экономит недели разработки и позволяет сосредоточиться на улучшении самих агентов, а не на инфраструктуре.

Prime Intellect Verifiers v1: Архитектура агентов нового поколения

05Минимальный пример: Создание собственного Taskset

Чтобы понять, как легко создать свою задачу, давайте разберем минимальный пример. Каждый запуск начинается с Taskset, который определяет данные и оценку, независимо от выбранного Harness.

terminalpython
import verifiers.v1 as vf

class AdditionData(vf.TaskData):
    answer: int

class AdditionTask(vf.Task):
    data: AdditionData

    @vf.reward
    async def exact_match(self, trace: vf.Trace) -> float:
        return float(trace.last_reply == str(self.data.answer))

class AdditionTaskset(vf.Taskset):
    task: AdditionTask
    config: vf.TasksetConfig

    def load(self) -> list[AdditionTask]:
        return [
            AdditionTask(
                data=AdditionData(
                    idx=i,
                    prompt=f"What is {i} + {i}?",
                    answer=self.config.task * i
                )
            )
            for i in range(100)
        ]

__all__ = "AdditionTaskset"

В этом коде мы определяем простую задачу на сложение. Класс AdditionTask содержит метод exact_match, который проверяет, совпадает ли последний ответ агента с правильным ответом. Если совпадает, награда равна 1, иначе 0. Это базовый пример, но он демонстрирует чистоту интерфейса: вы описываете только логику оценки, не заботясь о том, как агент будет генерировать ответ.

Запуск этого Taskset осуществляется через TOML-конфигурацию и CLI:

terminaltoml
[model]
id = "nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B"

[taskset]
id = "primeintellect/terminal-bench-2"

[harness]
id = "codex"
version = "0.116.0"

И затем команда:

terminalbash
uv run eval @ path/to/config.toml
⚠️ Важно
Совместимость. Убедитесь, что вы используете последнюю версию библиотеки verifiers и совместимые версии Harness. Поддержка Harbor, NeMo Gym и OpenEnv находится на разных стадиях (полная, альфа), поэтому проверяйте документацию для конкретных датасетов.

06Что это значит на практике

Для разработчиков и исследователей ИИ релиз verifiers v1 означает несколько ключевых преимуществ:

  1. Гибкость: Вы больше не привязаны к одному способу взаимодействия с моделями. Переключение между OpenAI, Anthropic или локальными моделями становится вопросом изменения одной строки в конфигурации.
  2. Масштабируемость: Линейный рост трассировки и эластичное масштабирование серверов позволяют обучать агентов на длинных горизонтах без страха исчерпать память. Это открывает путь к решению более сложных задач, требующих множества шагов рассуждения.
  3. Стандартизация: Поддержка нескольких диалектов API и форматов датасетов (Harbor, NeMo Gym) создает единый стандарт для оценки агентов. Это упрощает сравнение моделей и снижает затраты на интеграцию.
  4. Безопасность и контроль: Возможность переписывать ответы инструментов на уровне сервера перехвата дает исследователям мощный инструмент для контроля за поведением агентов и предотвращения манипуляций с функцией вознаграждения.

В условиях, когда агенты становятся все более автономными и сложными, наличие надежной, модульной и масштабируемой инфраструктуры для их обучения и оценки становится критически важным. Prime Intellect Verifiers v1 закладывает фундамент для следующего поколения агентных систем, позволяя исследователям сосредоточиться на интеллекте, а не на инфраструктуре.

📌 Факт
Легаси-код. Старый путь кода (legacy code path) теперь заморожен. Все новые разработки и оптимизации будут сосредоточены исключительно на архитектуре v1. Рекомендуется мигрировать существующие проекты как можно скорее.

Если вы работаете с агентами, особенно в области программирования или сложных многошаговых задач, verifiers v1 — это инструмент, который стоит изучить. Он не только упрощает текущие процессы, но и открывает двери для экспериментов, которые ранее были технически невозможны или слишком ресурсоемки.

Источник: MarkTechPost ↗