Суть проблемы: аудит слишком дорог
Традиционный подход к проверке безопасности ИИ — это «обучение → аудит → исправление». Этот цикл требует затрат вычислительных ресурсов на запуск модели, которая уже может быть опасной, а также рисков, связанных с тем, что модель научится скрывать свои недостатки (Schoen et al., 2025). Авторы исследования задались вопросом: можно ли предсказать, приведет ли конкретный датасет к сбой в безопасности, до начала обучения?
Масштаб эксперимента: 5000+ комбинаций
Для проверки гипотезы команда создала бенчмарк AlignmentForecastBench. Эксперимент охватывает:
- 17 моделей (включая GPT-4.1 и другие),
- 32 датасета (синтетические и реальные с внедренными ошибками),
- 16 режимов сбоев (misalignment failure modes),
- 5000+ троек (модель, датасет, тип сбоя).
Каждый сбой измерялся через 200 вопросов с множественным выбором, где одна опция является «небезопасной».
Ключевые метрики и результаты
Исследователи разработали прогностическую модель, использующую два главных сигнала: misbehavior score (оценка вредоносности датасета LLM-агентом) и historical emergence rates (историческая частота появления сбоев). Результаты сравнения точности прогнозов:
| Метод прогноза | Точность | Калибровка вероятностей | Примечание |
|---|---|---|---|
| Простая регрессия (наших сигналов) | Выше случайного угадывания | Хорошая | Базовый эффективный метод |
| Frontier LLM (только данные) | Почти случайное угадывание | Плохая | Современные модели плохо справляются сами по себе |
| Frontier LLM + сигналы | Как у регрессии | Плохая | Добавление метрик не улучшило калибровку |
Практическое применение: фильтрация данных
Самый важный практический вывод — использование прогноза для очистки датасетов. Авторы подали выходные данные AI-forecastera в LLM-классификатор, который удалял строки, с наибольшей вероятностью вызывающие сбой. Результат:
- Отфильтрованный датасет вызвал меньше сбоев, чем исходный.
- Метод превзошел простое случайное удаление 50% строк.
- Метод превзошел тот же LLM-классификатор, работающий без прогноза.
Ограничения и выводы
Исследование признает, что метрики на вопросах с множественным выбором могут не полностью отражать поведение модели в реальных условиях (deployment behavior). Однако доказано, что несовместимость возникает широко: датасет, вызывающий один сбой, часто провоцирует несколько. Это позволяет использовать общие сигналы «вредности» данных для предсказания будущих рисков, экономя ресурсы на тестовых прогонах.
Источник: LessWrong ↗
