Исследования12 августа 2026 г., 21:20 МСК🤖 Auto

CRI: Новый индекс оценивает способность ИИ к концептуальному мышлению

Anthropic и независимые исследователи представили Conceptual Reasoning Index (CRI) — метрику, измеряющую способность моделей рассуждать в условиях отсутствия эмпирических данных и объективных ответов.

Баннер новости 5636

Проблема верификации в AI Safety

Традиционные бенчмарки опираются на наличие четких правильных ответов или эмпирической обратной связи. Однако задачи по снижению рисков от ИИ (AI Safety) часто требуют рассуждений о гипотетических сценариях, где нет «истины» в привычном смысле, а ошибка может быть фатальной. Для оценки этой способности создан Conceptual Reasoning Index (CRI), агрегирующий результаты трех специализированных тестов.

Структура индекса CRI

Индекс рассчитывается как взвешенная сумма трех компонентов. На август 2026 года веса распределены следующим образом:

  • LMCA (60%): Оценка качества аргументации. Модель должна оценивать 1461 аргумент против позиций в философии и теории принятия решений. Оценки сверяются с экспертными рейтингами (всего 2140 оценок).
  • ACCoRD (20%): Проверка логической согласованности. Тест из 567 проверенных вручную ограничений (из ~14 000 сгенерированных) проверяет, не противоречит ли модель сама себе в вероятностных оценках (например, P(A) ≥ P(A&B)).
  • DTBench (20%): Бенчмарк по теории принятия решений. 407 вопросов, требующих предсказания поведения модели или её копий в сложных теоретических ситуациях.

Масштабирование человеческой экспертизы

Ключевая инновация LMCA — использование моделей для оценки аргументов. Исследователи показали, что одна модель (B) может точно оценивать аргументы, сгенерированные другой моделью (A), используя рубрику, валидированную экспертами. Это позволяет масштабировать проверку качества рассуждений, которая ранее требовала ручного труда философов и специалистов по безопасности ИИ.

Результаты и интерпретация

Система оценивает модели по шкале от 0 до 100. Важно отметить, что «идеальный» балл 100 на LMCA недостижим даже для человека из-за разброса мнений экспертов (максимально ожидаемый балл для модели — около 85). На момент публикации (12 августа 2026 года) тестировались топовые модели, включая Claude Fable 5, Muse Spark 1.2 и Gemini 3.6 Flash, при этом использовались максимальные лимиты токенов и усилия.

Компонент CRI Доля веса Что измеряет Ключевая метрика
LMCA 60% Качество концептуальных аргументов Совпадение с экспертными оценками (макс. ~85/100)
ACCoRD 20% Логическая непротиворечивость Соблюдение вероятностных ограничений (макс. 100/100)
DTBench 20% Теория принятия решений Правильность ответов на 407 вопросов (макс. 100/100)

Значение для индустрии

Развитие концептуального мышления критически важно для создания ИИ, способного помогать в планировании долгосрочных стратегий и управлении рисками. Платформа conceptualreasoning.ai будет обновляться по мере появления новых моделей и бенчмарков, позволяя сообществу отслеживать прогресс в области, где традиционные метрики (как MMLU или GSM8K) бессильны.

Источник: LessWrong ↗