Исследования4 августа 2026 г., 13:18 МСК🤖 Auto

C-Guard: Как C-LIM отсек 187 бесполезных строк в RL-обучении

Исследователь Lily Zhang представила C-Guard — инструмент для эффективного RL-выравнивания, который через метрику C-LIM отбирает только полезный обучающий данные, устраняя проблему пере- и недоотказа моделей.

Баннер новости 5034

Проблема конфликта целей в RL

Обучение моделей с подкреплением (RL) для обеспечения безопасности сталкивается с фундаментальной дилеммой: необходимо одновременно максимизировать обнаружение реального вреда и минимизировать ложные отказы (refusal) на безобидные запросы. Авторы отмечают, что стандартные подходы часто приводят к дисбалансу, где оптимизация на одних объектах ухудшает результаты на других.

Ключевые метрики дисбаланса

Исследование выявило критические цифры, демонстрирующие цену ошибок в текущих подходах. Избыточный отказ (over-refusal) снижает эффективность на 22.4% (до 12.8%), в то время как недостаточный отказ (under-refusal) на адверсариальных атаках незаметно, но критично ухудшает показатели с 0.27 до 0.33.

Показатель До оптимизации После оптимизации (C-Guard) Суть проблемы
Over-refusal (избыточный отказ) 22.4% 12.8% Модель слишком часто отказывает в помощи
Under-refusal (недоотказ) 0.27 0.33 Рост уязвимости к адверсариальным атакам
Learning Impact (влияние обучения) 0.733 0.80 Эффективность использования данных

Решение: C-Guard и C-LIM

Авторы предлагают инструмент C-Guard (Constitution-Grid Instrument), который генерирует данные для RL-обучения на основе «конституции» безопасности. Ключевым элементом является метрика C-LIM (per-cell learnability score), которая оценивает обучаемость каждой ячейки сетки данных.

Метод позволяет заранее идентифицировать «мертвый вес» в данных. В ходе эксперимента было выявлено, что 187 строк (untargeted rows) не приносили никакой пользы обучению. C-LIM позволил отсечь эти данные до начала расходования вычислительного бюджета, повысив влияние обучения в этой зоне с 0.733 до 0.80.

Открытый код и конституция

Работа подчеркивает важность прозрачности в RL-выравнивании. Авторы открыли исходный код и саму «конституцию» (список правил безопасности), что позволяет сообществу воспроизвести результаты и адаптировать метод под свои задачи. Публикация доступна на arXiv (2608.00180) с датой подачи 31 июля 2026 года.

Источник: arXiv cs.CL ↗