Исследования18 июля 2026 г., 03:16 МСК🤖 Auto

Почему предсказание мнений экспертов — лучший бенчмарк для AI

Исследователь Алекс Маллен предлагает отказаться от поиска «объективной истины» в сложных концептуальных задачах, заменив её предсказанием суждений конкретных экспертов.

Баннер новости 3858

Проблема субъективности в AI-бенчмарках

Стандартные методы оценки продвинутых языковых моделей (LLM) часто терпят неудачу на задачах, где нет однозначного правильного ответа. Алекс Маллен (Alex Mallen) в статье для AI Alignment Forum указывает, что попытки измерить концептуальные способности AI через предсказание «объективной истины» в спорных областях (например, прогнозы о рисках ИИ или этические дилеммы) приводят к искажениям. Главная причина — модель не разделяет «вкус» или априорные убеждения (priors) человека-эксперта, что создает шум, маскирующий реальные способности модели к рассуждению.

Новая методология: Prediction of Judgment

Предлагается новый подход: вместо того чтобы требовать от модели найти истину, нужно инструктировать её предсказать, как конкретный эксперт ответил бы на вопрос, учитывая его контекст и стиль мышления. Это позволяет изолировать ошибку модели (E) от неразрешимых разногласий в убеждениях (U) и случайного шума (N). Формула расхождения выглядит так:

O = E + U + N

Где:

  • O — общее расхождение между моделью и мнением эксперта;
  • E — ошибка, вызванная недостатком способностей модели или плохой элиситацией;
  • U — неразрешимые разногласия в вкусах/убеждениях;
  • N — шум (ошибки судей, утечка данных).

Ключевые риски и ограничения

Методология не лишена недостатков. Основные проблемы, которые необходимо учитывать при внедрении:

h>Проблема
Суть риска Влияние на бенчмарк
Высокий шум (Noise) Мнения людей изменчивы, а память не позволяет «сбросить» контекст для повторных замеров. Отсутствие обратной связи между судьями снижает качество данных. Затрудняет измерение реального прогресса моделей.
Сдвиг во времени (Cutoff) Рост баллов может быть объяснен не улучшением рассуждений, а тем, что модель увидела новые публикации эксперта после своей даты обучения. Искажает метрику «концептуальных способностей», измеряя знание фактов, а не логику.
Утечка данных (Leakage) Использование существующих текстов экспертов для создания вопросов может привести к тому, что модель просто запомнит ответы из тренировочных данных. Ложноположительные результаты; модель не рассуждает, а цитирует.
Неспособность к эмпатии Модели могут плохо воспроизводить эпистемический стиль (стиль мышления) конкретного человека, выдавая поверхностное совпадение «вайба» без глубокого анализа. Требует сложного промптинга для точной настройки.

Практические рекомендации

Автор рекомендует начать с «мягкой» версии бенчмарка: использовать существующие вопросы, но добавлять в промпт контекст мировоззрения и судейского профиля. Для более дорогих и точных замеров предлагается привлекать экспертов к ответам на новые, уникальные вопросы, которые они не публиковали ранее, чтобы минимизировать риск утечки данных. Также перспективным методом называется опрос экспертов об их мнениях по прочитанным, но не опубликованным в открытом доступе научным работам.

Источник: LessWrong ↗