Проблема «избыточной осторожности»
Традиционные методы выравнивания (SFT) часто приводят к тому, что модели отказываются отвечать на легитимные запросы, чтобы избежать потенциально вредного контента. Авторы Oyster-II выявили феномен safety chain-of-thought (CoT) over-generalization: модель применяет паттерны безопасности к безобидным запросам, что критически снижает полезность (helpfulness) и пользовательский опыт.
Решение: Zero-RL и многоэтапное обучение
В отличие от предшественника Oyster-I, который опирался на SFT, новая архитектура использует Zero-RL парадигму с многоэтапным reinforcement learning. Это позволяет модели учиться конструктивной безопасности — давать ответы, которые удовлетворяют намерение пользователя, оставаясь в рамках этических норм, а не просто блокировать запрос.
Сравнение с лидерами рынка
Эксперименты показали, что Oyster-II превосходит Qwen3-14B и Oyster-I по всем метрикам безопасности. Примечательно, что по кросс-масштабным показателям она сопоставима с гораздо более крупными моделями Qwen3-Max и Qwen3.5-397B, что указывает на высокую эффективность метода.
| Модель | Параметры (оц.) | Безопасность | Полезность (Helpfulness) |
|---|---|---|---|
| Oyster-I (SFT) | — | Выше базового | Снижена (over-generalization) |
| Qwen3-14B | 14B | Базовый уровень | Высокая |
| Oyster-II (RL) | — | Превосходит Qwen3-14B | Высокая (конструктивная) |
| Qwen3-Max | — | Высокий уровень | Высокая |
| Qwen3.5-397B | 397B | Высокий уровень | Высокая |
Значение для индустрии
Работа демонстрирует, что отказ от стратегии «полного отказа» (blanket refusal) в пользу RL-выравнивания позволяет достичь баланса, ранее доступного только гигантским моделям. Это открывает путь к созданию более безопасных и при этом функциональных LLM среднего размера.
Источник: arXiv cs.AI ↗
