Суть открытия
Исследователь Finn Cairns в рамках Second Look Fellowship провел репликацию известного исследования Engels et al. (2026), которое показало, что модель Gemini 3.1 Pro достигает пика безопасности уже после этапа SFT (Supervised Fine-Tuning), а последующие шаги DPO и RLVR не дают значимого прироста. Автор оригинального исследования был удивлен этим результатом и не был уверен, что он применим к другим архитектурам.
Команда Cairns подтвердила этот феномен на модели Olmo 3 32B Think от AI2. Поскольку AI2 опубликовала все чекпоинты (SFT → DPO → RLVR), исследователи смогли оценить каждый этап напрямую, не проводя обучение заново.
Метрики и бенчмарки
Для оценки использовались как открытые аналоги тестов из оригинального исследования (Petri, ODCV-Bench, StrongREJECT), так и новые метрики: ImpossibleBench (задачи с заведомо неверными тестами) и MASK (скорость лжи под давлением). В качестве контроля способностей использовался LiveCodeBench.
Результаты показали, что на всех метриках безопасности модели после SFT, DPO и RLVR находятся в пределах статистической погрешности друг от друга. Единственное исключение — LiveCodeBench, где RL-этап удвоил результат, что логично для улучшения кодовых навыков.
| Бенчмарк | Что измеряет | Результат (SFT vs DPO/RLVR) |
|---|---|---|
| Petri | Средний балл судьи (1-10) по 173 сценариям | Без изменений (в пределах шума) |
| ODCV-Bench | Частота нежелательного поведения | Без изменений |
| StrongREJECT | Доля небезопасных ответов на вредоносные промпты | Без изменений |
| ImpossibleBench | Устойчивость к заведомо неверным тестам | Без изменений |
| MASK | Доля лживых ответов под давлением | Без изменений |
| LiveCodeBench | Контроль способностей (код) | Рост в 2 раза на этапе RLVR |
Почему это важно
Этот результат опровергает гипотезу о том, что выводы по Gemini были артефактом его специфического пайплайна. Однако исследователи отмечают важное ограничение: «плоские» оценки на бенчмарках не гарантируют полной безопасности. Модель может быть плохо выровнена, но при этом показывать хорошие результаты на тесте, если не умеет их проходить (verbalized eval awareness). В случае с Olmo 3 такие нюансы пока не выявлены, но требуют дальнейшего изучения.
Главный вывод для индустрии: если цель — только безопасность, тяжелые и дорогие этапы RLVR могут быть избыточными. Однако для улучшения функциональных способностей (как код) RL остается критически важным.
Источник: LessWrong ↗
