Суть проблемы: «Смывание» ценностей
Проект CaML (Compassionate Machine Learning) ставит под сомнение эффективность промежуточного обучения (mid-training). Исследователи хотят понять, при каких условиях ценности, внедренные через синтетические документы (SDF), выживают после последующего этапа RL (Reinforcement Learning), а когда они полностью стираются. Ранние результаты, включая работы Geodesic, показывают, что mid-training дает значительный прирост, но вопрос его устойчивости к RL остается открытым.
Технические детали эксперимента
Для тестирования гипотез будет использоваться базовая модель OLMo 3. Экспериментальный пайплайн включает:
- Генерацию синтетических корпусов с разными утверждениями для внедрения ценностей.
- Промежуточное обучение (midtraining) на этих данных.
- Пост-обучение с подкреплением, например, RLVR (Reinforcement Learning from Verifiable Rewards) с алгоритмом GRPO на верифицируемых задачах.
Ключевые метрики и инструменты
Результаты будут оцениваться с помощью открытого фреймворка Inspect от UK AISI. Публикация будет включать бенчмарк для оценки устойчивости (persistence-evaluation harness), чекпоинты моделей и открытые корпусы данных. Основной фокус — на воспроизводимости и возможности отследить каждый шаг обучения.
Требования к кандидатам
Команда ищет инженеров с опытом работы с моделями от 7B параметров и выше. Ключевые навыки:
- Опыт работы с Unsloth, Runpod и экосистемой Hugging Face.
- Глубокое понимание алгоритмов RL (умение отлаживать пайплайны RLVR/GRPO, а не просто запускать их).
- Навыки мех-интерпретабельности (mech-interp) для анализа механизмов «смывания» ценностей будут преимуществом.
Условия работы
Позиция рассчитана на 12 месяцев (с возможностью продления). Зарплата составляет около $110,000 в год в формате контракта. Работа полностью удаленная, но предпочтительно в часовых поясах Калифорнии. Офис в Беркли (Сан-Франциско) является плюсом, но не обязательным.
Источник: LessWrong ↗
