Исследования2 сентября 2026 г., 01:21 МСК🤖 Auto

BenchMIRT: Как LLM-бенчмарки на самом деле измеряют способности моделей

Allen AI представил BenchMIRT — метод аудита LLM-бенчмарков на уровне отдельных промптов. Анализ 100 моделей и 34K вопросов показал, что многие тесты безопасности на самом деле измеряют общее логическое мышление.

Баннер новости 6540

Проблема «смешанных сигналов» в оценке ИИ

Традиционные бенчмарки часто позиционируются как измерители конкретных навыков (безопасность, рассуждения, следование инструкциям), но их отдельные вопросы могут требовать совершенно разных компетенций. Например, тест BBQ, созданный для выявления социальных стереотипов, в новом анализе оказался тесно связан с общим логическим мышлением. Низкий балл здесь может означать не предвзятость модели, а сложность понимания контекста вопроса.

Allen AI разработал BenchMIRT (Benchmark Multidimensional Item Response Theory), который применяет многомерную теорию ответов на пункты (MIRT) из психометрики. Метод позволяет разделить «шум» и выделить доминирующие способности, которые на самом деле влияют на результат модели в каждом конкретном вопросе.

Масштаб исследования и ключевые метрики

Для обучения и валидации BenchMIRT использовались результаты 100 LLM (включая open-weight модели) на 16 бенчмарках с общим объемом более 34 000 вопросов. Исследование не задавало заранее, какие бенчмарки за что отвечают, и алгоритм самостоятельно выделил два стабильных измерения: безопасность и общее логическое мышление.

Что BenchMIRT выявил в популярных тестах

Анализ показал неожиданные корреляции. Например, бенчмарк WMDP (тест на опасные знания в биологии и кибербезопасности) оказался сильнее связан с общим мышлением, чем с безопасностью. Более сильные модели в рассуждениях чаще отказывались отвечать на такие вопросы, что снижало их «балл безопасности» в традиционном понимании, но повышало оценку в логике.

Бенчмарк Ожидаемая цель Реальная корреляция (BenchMIRT) Интерпретация
BBQ Социальная предвзятость Общее логическое мышление Низкий балл часто связан со сложностью понимания контекста, а не с предвзятостью.
WMDP Безопасность (отказ от опасных знаний) Общее логическое мышление (отрицательная корреляция) Сильные в логике модели чаще отказываются отвечать, что снижает их «безопасный» балл.
HarmBench (стандарт) Безопасность Безопасность Прямые запросы на вред подтверждают фокус на безопасности.
HarmBench (авторское право) Безопасность Общее логическое мышление Запросы на генерацию текстов (например, песен) зависят от способности модели рассуждать.

Экономия ресурсов: 10% вопросов вместо 100%

BenchMIRT позволяет оптимизировать процесс тестирования. Алгоритм идентифицирует самые информативные вопросы, которые лучше всего различают сильные и слабые модели. Эксперименты показали, что использование всего 10% вопросов из полного набора сохраняет почти ту же картину распределения способностей, что и полный тест. При использовании 50% вопросов точность измерения еще выше.

Кроме того, модель BenchMIRT способна предсказывать ответы на новые, невиданные вопросы с точностью 79%, что значительно превосходит базовый подход (70%), основанный на усредненных показателях.

Почему это важно

Результаты показывают, что единый балл бенчмарка может скрывать противоречивые сигналы. BenchMIRT дает исследователям инструмент для «деконструкции» оценок, позволяя понять, за счет чего модель получила тот или иной результат: благодаря реальной безопасности, сильному логическому мышлению или просто умению обходить сложные формулировки. Это критически важно для объективного сравнения архитектур LLM.

Источник: Hugging Face blog ↗