Проблема верификации в AI Safety
Традиционные бенчмарки опираются на наличие четких правильных ответов или эмпирической обратной связи. Однако задачи по снижению рисков от ИИ (AI Safety) часто требуют рассуждений о гипотетических сценариях, где нет «истины» в привычном смысле, а ошибка может быть фатальной. Для оценки этой способности создан Conceptual Reasoning Index (CRI), агрегирующий результаты трех специализированных тестов.
Структура индекса CRI
Индекс рассчитывается как взвешенная сумма трех компонентов. На август 2026 года веса распределены следующим образом:
- LMCA (60%): Оценка качества аргументации. Модель должна оценивать 1461 аргумент против позиций в философии и теории принятия решений. Оценки сверяются с экспертными рейтингами (всего 2140 оценок).
- ACCoRD (20%): Проверка логической согласованности. Тест из 567 проверенных вручную ограничений (из ~14 000 сгенерированных) проверяет, не противоречит ли модель сама себе в вероятностных оценках (например, P(A) ≥ P(A&B)).
- DTBench (20%): Бенчмарк по теории принятия решений. 407 вопросов, требующих предсказания поведения модели или её копий в сложных теоретических ситуациях.
Масштабирование человеческой экспертизы
Ключевая инновация LMCA — использование моделей для оценки аргументов. Исследователи показали, что одна модель (B) может точно оценивать аргументы, сгенерированные другой моделью (A), используя рубрику, валидированную экспертами. Это позволяет масштабировать проверку качества рассуждений, которая ранее требовала ручного труда философов и специалистов по безопасности ИИ.
Результаты и интерпретация
Система оценивает модели по шкале от 0 до 100. Важно отметить, что «идеальный» балл 100 на LMCA недостижим даже для человека из-за разброса мнений экспертов (максимально ожидаемый балл для модели — около 85). На момент публикации (12 августа 2026 года) тестировались топовые модели, включая Claude Fable 5, Muse Spark 1.2 и Gemini 3.6 Flash, при этом использовались максимальные лимиты токенов и усилия.
| Компонент CRI | Доля веса | Что измеряет | Ключевая метрика |
|---|---|---|---|
| LMCA | 60% | Качество концептуальных аргументов | Совпадение с экспертными оценками (макс. ~85/100) |
| ACCoRD | 20% | Логическая непротиворечивость | Соблюдение вероятностных ограничений (макс. 100/100) |
| DTBench | 20% | Теория принятия решений | Правильность ответов на 407 вопросов (макс. 100/100) |
Значение для индустрии
Развитие концептуального мышления критически важно для создания ИИ, способного помогать в планировании долгосрочных стратегий и управлении рисками. Платформа conceptualreasoning.ai будет обновляться по мере появления новых моделей и бенчмарков, позволяя сообществу отслеживать прогресс в области, где традиционные метрики (как MMLU или GSM8K) бессильны.
Источник: LessWrong ↗
