Исследования7 августа 2026 г., 20:17 МСК🤖 Auto

IRT для AI Safety: как психометрия снижает стоимость тестов на безопасность

Исследователи применили Item Response Theory к 5000+ вопросам и 192 моделям, выявив 3 скрытых фактора безопасности и сократив затраты на бенчмарки до 97%.

Баннер новости 5326

Проблема агрегации: почему средний балл лжет

Авторы исследования (Joshua Fonseca Rivera, Neil Shah, David Africa) анализируют фундаментальный недостаток современных AI-бенчмарков: они часто измеряют не «безопасность» как единое свойство, а набор коррелирующих или даже антагонистичных поведений. Использование простого среднего балла может маскировать реальные уязвимости. Например, модель может быть хороша в отказе от вредоносных запросов, но при этом чрезмерно отказываться от безобидных, что снижает общую полезность, но не всегда отражается в едином индексе «safety score».

Методология: 192 модели, 8 бенчмарков, 5000+ вопросов

Команда применила Item Response Theory (IRT) — математический аппарат, десятилетиями используемый в психометрии (GRE, GMAT), к оценке языковых моделей. IRT позволяет оценить не только «способность» модели (latent ability), но и сложность каждого вопроса, а также его дискриминационную способность (насколько хорошо вопрос разделяет сильные и слабые модели). В исследовании были проанализированы ответы 192 языковых моделей на более чем 5000 вопросов из 8 различных наборов данных по безопасности.

Результаты: три скрытых фактора безопасности

Анализ показал, что безопасность не является одномерной величиной. IRT-модель выделила три основных кластера (латентных фактора), которые объясняют 77% вариативности поведения моделей между собой:

Латентный фактор Описание поведения Примеры коррелирующих бенчмарков
Refusal strictness Строгость отказов (склонность говорить «нет») HarmBench, SORRY-Bench
Truthfulness Достоверность и честность ответов Информация недостаточна для точного сопоставления в тексте
Contextual harm Контекстуальный вред (учет нюансов) Информация недостаточна для точного сопоставления в тексте

Ключевое открытие: некоторые бенчмарки имеют отрицательную корреляцию. Например, OR-Bench-Hard (который поощряет ответы на безобидные запросы, избегая переотказов) и HarmBench (поощряющий отказ от вреда) показали негативную связь. Это означает, что оптимизация модели под один бенчмарк может ухудшить показатели по другому, если их не разделять.

Экономия ресурсов: от 5000 вопросов к 10

Самая практическая часть исследования — возможность радикального сокращения стоимости тестирования. Авторы доказали, что можно точно восстановить результаты полного бенчмарка, используя лишь малую часть вопросов:

  • Статические тесты: Подмножество из 75 вопросов (менее 2% от полного набора) позволяет оценить три латентных фактора с ошибкой в пределах 5% стандартного отклонения от полного теста.
  • Адаптивное тестирование (CAT): Использование алгоритмов, выбирающих следующий вопрос на основе предыдущих ответов, позволяет оценить полный бенчмарк всего по 10 вопросам. Это снижает стоимость вычислений на 97–99% при сохранении корреляции рангов (Spearman) на уровне 0.92–0.94.

Аудит изменений: обнаружение «скрытых» обновлений

IRT также предоставляет инструменты для детекции изменений в моделях, которые не видны при простом сравнении итоговых баллов. Статистика «person-fit» и анализ «отпечатков ответов» (response fingerprints) позволяют выявить, когда модель была изменена «под капотом» (например, через квантование или изменение системного промпта), даже если её общий балл безопасности остался прежним. Это критически важно для непрерывного мониторинга безопасности в процессе жизненного цикла разработки модели.

Источник: LessWrong ↗