Исследования7 июля 2026 г., 12:19 МСК🤖 Auto

Oyster-II: RL-выравнивание безопасности LLM без отказа от помощи

Исследователи представили Oyster-II — фреймворк на базе RL, решающий проблему излишних отказов в LLM. Модель достигает уровня Qwen3-Max по безопасности, сохраняя полезность ответов.

Баннер новости 3024

Проблема «избыточной осторожности»

Традиционные методы выравнивания (SFT) часто приводят к тому, что модели отказываются отвечать на легитимные запросы, чтобы избежать потенциально вредного контента. Авторы Oyster-II выявили феномен safety chain-of-thought (CoT) over-generalization: модель применяет паттерны безопасности к безобидным запросам, что критически снижает полезность (helpfulness) и пользовательский опыт.

Решение: Zero-RL и многоэтапное обучение

В отличие от предшественника Oyster-I, который опирался на SFT, новая архитектура использует Zero-RL парадигму с многоэтапным reinforcement learning. Это позволяет модели учиться конструктивной безопасности — давать ответы, которые удовлетворяют намерение пользователя, оставаясь в рамках этических норм, а не просто блокировать запрос.

Сравнение с лидерами рынка

Эксперименты показали, что Oyster-II превосходит Qwen3-14B и Oyster-I по всем метрикам безопасности. Примечательно, что по кросс-масштабным показателям она сопоставима с гораздо более крупными моделями Qwen3-Max и Qwen3.5-397B, что указывает на высокую эффективность метода.

Модель Параметры (оц.) Безопасность Полезность (Helpfulness)
Oyster-I (SFT) Выше базового Снижена (over-generalization)
Qwen3-14B 14B Базовый уровень Высокая
Oyster-II (RL) Превосходит Qwen3-14B Высокая (конструктивная)
Qwen3-Max Высокий уровень Высокая
Qwen3.5-397B 397B Высокий уровень Высокая

Значение для индустрии

Работа демонстрирует, что отказ от стратегии «полного отказа» (blanket refusal) в пользу RL-выравнивания позволяет достичь баланса, ранее доступного только гигантским моделям. Это открывает путь к созданию более безопасных и при этом функциональных LLM среднего размера.

Источник: arXiv cs.AI ↗