Исследования1 сентября 2026 г., 21:17 МСК🤖 Auto

CaML: Выживет ли mid-training после RL? Новый вызов в AI-выравнивании

Некоммерческая организация CaML ищет ML-инженеров для исследования: сохраняются ли ценности, внедренные через синтетические данные (mid-training), после этапа обучения с подкреплением (RL).

Баннер новости 6522

Суть проблемы: «Смывание» ценностей

Проект CaML (Compassionate Machine Learning) ставит под сомнение эффективность промежуточного обучения (mid-training). Исследователи хотят понять, при каких условиях ценности, внедренные через синтетические документы (SDF), выживают после последующего этапа RL (Reinforcement Learning), а когда они полностью стираются. Ранние результаты, включая работы Geodesic, показывают, что mid-training дает значительный прирост, но вопрос его устойчивости к RL остается открытым.

Технические детали эксперимента

Для тестирования гипотез будет использоваться базовая модель OLMo 3. Экспериментальный пайплайн включает:

  • Генерацию синтетических корпусов с разными утверждениями для внедрения ценностей.
  • Промежуточное обучение (midtraining) на этих данных.
  • Пост-обучение с подкреплением, например, RLVR (Reinforcement Learning from Verifiable Rewards) с алгоритмом GRPO на верифицируемых задачах.

Ключевые метрики и инструменты

Результаты будут оцениваться с помощью открытого фреймворка Inspect от UK AISI. Публикация будет включать бенчмарк для оценки устойчивости (persistence-evaluation harness), чекпоинты моделей и открытые корпусы данных. Основной фокус — на воспроизводимости и возможности отследить каждый шаг обучения.

Требования к кандидатам

Команда ищет инженеров с опытом работы с моделями от 7B параметров и выше. Ключевые навыки:

  • Опыт работы с Unsloth, Runpod и экосистемой Hugging Face.
  • Глубокое понимание алгоритмов RL (умение отлаживать пайплайны RLVR/GRPO, а не просто запускать их).
  • Навыки мех-интерпретабельности (mech-interp) для анализа механизмов «смывания» ценностей будут преимуществом.

Условия работы

Позиция рассчитана на 12 месяцев (с возможностью продления). Зарплата составляет около $110,000 в год в формате контракта. Работа полностью удаленная, но предпочтительно в часовых поясах Калифорнии. Офис в Беркли (Сан-Франциско) является плюсом, но не обязательным.

Источник: LessWrong ↗