Исследования7 сентября 2026 г., 00:19 МСК🤖 Auto

Meta FAIR представила RPM: ИИ-модели, ранжирующие ML-эксперименты до запуска GPU

Исследователи Meta FAIR, Оксфорда и UCL представили AI Research Preference Models (RPMs), которые позволяют ИИ-агентам отбирать лучшие гипотезы для обучения, экономя до 40% времени вычислений на GPU.

Баннер новости 6898

Проблема: Идея дешевая, проверка дорогая

Генерация идей для машинного обучения стала практически бесплатной благодаря современным LLM, однако их верификация требует огромных вычислительных ресурсов. Один кандидат на обучение может занимать от нескольких часов до дней на GPU. Исследовательская группа из Meta FAIR, Университета Оксфорда и Университетского колледжа Лондона (UCL) решила эту проблему, формализовав концепцию Research Preference и представив AI Research Preference Models (RPMs).

Ключевая идея RPM заключается не в предсказании абсолютных метрик (LLM в этом ненадежны), а в парном сравнении кандидатов. Модель ранжирует не выполненные эксперименты и выбирает только один, наиболее перспективный, для запуска. Это позволяет агенту предлагать десятки кандидатов, но запускать лишь «победителя».

Архитектура: AIRA-dojo и два варианта RPM

Система работает в рамках фреймворка AIRA-dojo, который использует эволюционный поиск по дереву. RPM вмешивается на этапе создания дочерних узлов. Вместо запуска одного кандидата, агент применяет операторы (Draft/Improve/Debug) 15 раз параллельно, создавая 15 кандидатов. Затем они проходят турнир парных сравнений (knockout tournament), где каждый раунд основан на контексте из explored tree и валидационных счетах предыдущих узлов.

Разработчики представили две вариации RPM:

  • Inference-only RPM: Использует LLM в роли судьи (LLM-as-a-judge) над планами, кодом и историей поиска. Промпт оптимизирован через MIPROv2 (DSPy) с рубрикой «главного исследователя», которая допускает исправимые баги, но штрафует за избыточность. Точность офлайн-оценки: 57.7–59.0%.
  • Agentic RPM: Добавляет песочницу с клонированием среды (включая GPU H200). Агент запускает короткие пилотные эксперименты (до 30 запусков, лимит 60 секунд каждый), после чего модель обратной связи решает, нужен ли следующий шаг или пора завершать цикл. Важно: бюджет времени намеренно завышен (2700s вместо реальных 300s), чтобы агент не останавливался преждевременно.

Результаты на бенчмарке AIRS-Bench

Эксперименты проводились на 20 публичных задачах (текст и табличные данные) с лимитом 24 часа на одну GPU H200. В качестве бэкбона для операторов и RPM использовалась открытая модель Qwen3.6-27B. Прирост качества достигался исключительно за счет слоя выбора, а не усиления самой модели.

Метод Средний нормализованный счет Время до достижения базового уровня (0.684)
No RPM (случайный выбор) 0.684 24.00 часов (база)
Inference-only RPM 0.711 14.88 часов (ускорение 1.61×
Agentic RPM 0.729 15.50 часов (ускорение 1.55×
Validation Oracle (потолок) 0.748

Вероятность улучшения по сравнению с базовым случайным выбором составляет ~59% (95% CI lower bounds > 0.50). Agentic RPM также показал новые SOTA-результаты: 94.1% на WinoGrande (против 90.4% у AIRA₂) и 95.7% на SVAMP (против человеческого SOTA 94.2%).

Почему это важно

Решение Meta FAIR демонстрирует, что оптимизация процесса выбора гипотез может дать такой же прирост эффективности, как и улучшение самих моделей. Использование замороженных LLM без дообучки (fine-tuning) делает RPM легко внедряемым в существующие пайплайны. Открытые веса Qwen3.6-27B, код AIRA-dojo и бенчмарк AIRS-Bench доступны для сообщества, что открывает путь к стандартизации оценки ИИ-агентов в научных задачах.

Источник: MarkTechPost ↗