Исследования11 сентября 2026 г., 22:21 МСК🤖 Auto

SFT уже делает Olmo 3 безопасным: повторение эксперимента Gemini

Исследование подтвердило, что после этапа SFT модель Olmo 3 32B Think достигает уровня безопасности, сопоставимого с финальной версией. Это ставит под сомнение необходимость тяжелых RL-оптимизаций для базовой безопасности.

Баннер новости 7302

Суть открытия

Исследователь Finn Cairns в рамках Second Look Fellowship провел репликацию известного исследования Engels et al. (2026), которое показало, что модель Gemini 3.1 Pro достигает пика безопасности уже после этапа SFT (Supervised Fine-Tuning), а последующие шаги DPO и RLVR не дают значимого прироста. Автор оригинального исследования был удивлен этим результатом и не был уверен, что он применим к другим архитектурам.

Команда Cairns подтвердила этот феномен на модели Olmo 3 32B Think от AI2. Поскольку AI2 опубликовала все чекпоинты (SFT → DPO → RLVR), исследователи смогли оценить каждый этап напрямую, не проводя обучение заново.

Метрики и бенчмарки

Для оценки использовались как открытые аналоги тестов из оригинального исследования (Petri, ODCV-Bench, StrongREJECT), так и новые метрики: ImpossibleBench (задачи с заведомо неверными тестами) и MASK (скорость лжи под давлением). В качестве контроля способностей использовался LiveCodeBench.

Результаты показали, что на всех метриках безопасности модели после SFT, DPO и RLVR находятся в пределах статистической погрешности друг от друга. Единственное исключение — LiveCodeBench, где RL-этап удвоил результат, что логично для улучшения кодовых навыков.

Бенчмарк Что измеряет Результат (SFT vs DPO/RLVR)
Petri Средний балл судьи (1-10) по 173 сценариям Без изменений (в пределах шума)
ODCV-Bench Частота нежелательного поведения Без изменений
StrongREJECT Доля небезопасных ответов на вредоносные промпты Без изменений
ImpossibleBench Устойчивость к заведомо неверным тестам Без изменений
MASK Доля лживых ответов под давлением Без изменений
LiveCodeBench Контроль способностей (код) Рост в 2 раза на этапе RLVR

Почему это важно

Этот результат опровергает гипотезу о том, что выводы по Gemini были артефактом его специфического пайплайна. Однако исследователи отмечают важное ограничение: «плоские» оценки на бенчмарках не гарантируют полной безопасности. Модель может быть плохо выровнена, но при этом показывать хорошие результаты на тесте, если не умеет их проходить (verbalized eval awareness). В случае с Olmo 3 такие нюансы пока не выявлены, но требуют дальнейшего изучения.

Главный вывод для индустрии: если цель — только безопасность, тяжелые и дорогие этапы RLVR могут быть избыточными. Однако для улучшения функциональных способностей (как код) RL остается критически важным.

Источник: LessWrong ↗