В мире искусственного интеллекта генерация идей стала практически бесплатной. Современные большие языковые модели (LLM) способны предлагать сотни вариантов архитектур, гиперпараметров или стратегий обучения за считанные секунды. Однако существует фундаментальное противоречие: если идея генерируется мгновенно, её проверка требует колоссальных вычислительных ресурсов. Обучение одного кандидата может занять от нескольких часов до дней работы на мощных графических процессорах (GPU). В результате ИИ-агент может предложить тысячи кандидатов, но выполнить их все физически невозможно. Возникает вопрос: как выбрать тот самый единственный эксперимент, который принесет наибольший прогресс?
Команда исследователей из Meta Fundamental AI Research (FAIR), Оксфордского университета и Университетского колледжа Лондона (UCL) предлагает элегантное решение. Они формализуют этот процесс выбора как «предпочтение исследователя» (research preference) и представляют новую архитектуру — AI Research Preference Models (RPMs). RPM не пытается предсказать абсолютный результат эксперимента (что часто бывает неточно), а выполняет критически важную функцию: ранжирует невыполненные кандидаты и выбирает один, наиболее перспективный, для запуска. Это меняет парадигму: вместо того чтобы полагаться на случайность или жадный поиск, агент получает интеллектуальный фильтр, отсеивающий шум.
01Почему традиционные методы оценки не работают?
До появления RPM основным подходом к отбору экспериментов был либо случайный выбор, либо использование самих LLM в роли «судей», которые пытались предсказать метрику валидации. Однако исследователи обнаружили серьезный недостаток последнего подхода: языковые модели ненадежны в прогнозировании конкретных метрик или результатов выполнения кода. LLM могут быть отличными генераторами идей, но они часто страдают от галлюцинаций при оценке технической реализуемости или точности алгоритма без его фактического запуска.
Именно поэтому команда отказалась от идеи создания модели, которая выдает абсолютный балл (например, «этот эксперимент даст 95% точности»). Вместо этого RPM фокусируется на относительном сравнении. Он отвечает на вопрос: «Какой из этих двух вариантов лучше?». Такой подход, известный как pairwise comparison, значительно повышает надежность отбора, так как модели проще сравнивать контексты, чем абстрактно оценивать их качество.
02Архитектура AIRA-dojo и место RPM в цикле агента
Чтобы понять, как работает RPM, нужно рассмотреть среду, в которой он применяется. Исследователи используют фреймворк AIRA-dojo, который представляет собой эволюционное дерево поиска. В этой системе агент действует по принципу «выживания сильнейшего»: он выбирает лучших родителей, применяет операторы (Draft — черновик, Improve — улучшение, Debug — отладка) и возвращает узел с наивысшим баллом валидации.
Здесь вступает в игру RPM. Он вмешивается только на этапе создания дочерних узлов (child creation). Традиционный подход мог бы сгенерировать одного ребенка и сразу запустить его. RPM действует иначе: агент применяет оператор параллельно 15 раз, создавая 15 невыполненных кандидатов. Затем эти 15 вариантов проходят через турнир на выбывание (knockout tournament), где они сравниваются попарно. Только победитель этого турнира отправляется на выполнение.
Каждое сравнение в турнире «заземлено» (grounded) в контексте. Агент собирает узлы дерева через обход в ширину (BFS) и показывает модели не только код, но и валидационные баллы, которые уже были получены для родительских узлов. Это позволяет модели принимать решение на основе реального опыта, а не чистой теории.
03Два варианта RPM: от простого судьи до активного агента
Исследователи разработали две вариации RPM, которые различаются по сложности и вычислительным затратам. Обе используют замороженные предварительно обученные LLM (Qwen3.6-27B) без дообучения (fine-tuning), что делает их легкими в развертывании и воспроизводимыми.
1. Inference-only RPM (Только инференс)
Это наиболее простой вариант. Здесь LLM выступает в роли «судьи», анализируя планы кандидатов, их код и историю поиска. Prompt для этой модели был оптимизирован с помощью метода MIPROv2 из библиотеки DSPy. В результате сформировалась рубрика «главного исследователя» (principal-investigator rubric), которая:
- Толерантна к исправимым багам (понимает, что ошибка в коде — не приговор).
- Награждает расширяемость архитектуры (extensibility).
- Штрафует за избыточные или дублирующие направления исследований.

Точность офлайн-оценки этого судьи составила от 57,7% до 59,0% в сравнении с реальными результатами. Это означает, что в чуть более чем половине случаев модель правильно определяет, какой из двух вариантов окажется лучше.
2. Agentic RPM (Агентный судья)
Этот вариант гораздо более ресурсоемок, но и более точен. Помимо роли судьи, у него есть доступ к песочнице, которая клонирует среду агента, включая один GPU H200. Инструменты, доступные агенту, включают python, bash и submit_solution.
Agentic RPM запускает короткие пилотные эксперименты. Затем модель обратной связи либо предлагает следующий наиболее информативный эксперимент, либо завершает цикл. Здесь есть два важных дизайнерских решения:
- Намеренное завышение бюджета. Агенту сообщается, что у него есть 2700 секунд, хотя реальный лимит составляет всего 300 секунд. Это сделано для того, чтобы агент не останавливал поиск слишком рано из-за страха исчерпать ресурсы.
- Ограничение пилотов. Пилотные эксперименты ограничены 30 запусками с порогом в 60 секунд. Время на пилоты конкурирует с часами самого агента, поэтому агентный селектор используется только на этапах Draft и Improve. На этапе Debug (отладки) возвращается случайный выбор, так как отладка часто требует специфического контекста, который сложно оценить через пилоты.
04Результаты на бенчмарке AIRS-Bench
Для оценки эффективности команда использовала бенчмарк AIRS-Bench, состоящий из 20 публичных задач по обработке текста и табличным данным. Условия были строгими: 24 часа работы на одном GPU H200 на каждую задачу, 10 запусков с разными начальными семенами (seeds). Важно отметить, что Qwen3.6-27B использовалась как для операторов генерации, так и для RPM. Это значит, что прирост качества comes strictly from the selection layer (происходит исключительно из-за слоя отбора), а не из-за использования более мощной базовой модели.
Результаты по среднему нормализованному баллу (Avg. normalized score) выглядят следующим образом:
- No RPM (случайный выбор): 0.684
- Inference-only RPM: 0.711
- Agentic RPM: 0.729
- Validation oracle (потолок): 0.748
- Test oracle (потолок): 0.759
Вероятность улучшения по сравнению с базовым уровнем (No RPM) составляет 0.5923 для Inference-only и 0.5913 для Agentic RPM. Доверительные интервалы (95% CI) показывают нижние границы 0.5066 и 0.5018 соответственно, что статистически значимо выше случайности.
05Эффективность: скорость против качества
Самый практический результат исследования касается времени. В индустрии AI время — это деньги. Базовый уровень (случайный выбор) достигал финального балла 0.684 за 24 часа. Однако с использованием RPM этот же уровень был достигнут значительно быстрее:

- Inference-only RPM: 14.88 часа (ускорение в 1.61 раза).
- Agentic RPM: 15.50 часа (ускорение в 1.55 раза).
Если учесть время на самодостаточный инференс (self-hosted inference), которое добавляет около 0.660 часов на запуск, то скорректированный результат для Inference-only составляет 0.708 при 23.34 часах. Тем не менее, даже с учетом накладных расходов, RPM позволяет достичь более высокого качества за то же время или того же качества за меньшее время.
Кроме того, были зафиксированы два новых результата, устанавливающих новые стандарты (SOTA):
- WinoGrande: 94.1% с использованием Agentic RPM (предыдущий SOTA от AIRA₂ составлял 90.4%).
- SVAMP: 95.7% с использованием Inference-only RPM (предыдущий человеческий SOTA составлял 94.2%).
06Что это значит на практике
Внедрение AI Research Preference Models знаменует собой сдвиг от «генерации всего подряд» к «интеллектуальному отбору». Для исследователей и инженеров это означает несколько важных вещей:
- Экономия GPU-часов. Если вы тратите бюджет на обучение моделей, RPM позволяет получить тот же результат на 40% быстрее, отбрасывая заведомо слабые гипотезы до начала дорогостоящего обучения.
- Демократизация исследований. Поскольку модель не требует дообучения и работает на открытых весах, небольшие лаборатории и энтузиасты могут использовать те же методы отбора, что и гиганты вроде Meta, не имея доступа к кластерам из тысяч GPU.
- Фокус на архитектуре, а не на вычислениях. Проблема смещается с «как нам быстрее обучить» на «как нам лучше спроектировать процесс поиска». RPM становится стандартом для автономных исследовательских агентов.
В будущем мы, вероятно, увидим появление RPM как стандартного компонента в фреймворках для автоматизированного машинного обучения (AutoML). Это не просто улучшение эффективности, это новый способ мышления об ИИ-исследованиях: где ценность создается не количеством запущенных экспериментов, а качеством выбора того единственного, который имеет смысл запустить.
Исследователи уже опубликовали статью и анонс на LinkedIn. Если вы работаете с автономными агентами или оптимизацией гиперпараметров, стоит внимательно следить за развитием этой технологии. Возможно, уже скоро «ранжирование предпочтений» станет такой же неотъемлемой частью пайплайна ML, как и само обучение модели.
Источник: MarkTechPost ↗
