Проблема субъективности в AI-бенчмарках
Стандартные методы оценки продвинутых языковых моделей (LLM) часто терпят неудачу на задачах, где нет однозначного правильного ответа. Алекс Маллен (Alex Mallen) в статье для AI Alignment Forum указывает, что попытки измерить концептуальные способности AI через предсказание «объективной истины» в спорных областях (например, прогнозы о рисках ИИ или этические дилеммы) приводят к искажениям. Главная причина — модель не разделяет «вкус» или априорные убеждения (priors) человека-эксперта, что создает шум, маскирующий реальные способности модели к рассуждению.
Новая методология: Prediction of Judgment
Предлагается новый подход: вместо того чтобы требовать от модели найти истину, нужно инструктировать её предсказать, как конкретный эксперт ответил бы на вопрос, учитывая его контекст и стиль мышления. Это позволяет изолировать ошибку модели (E) от неразрешимых разногласий в убеждениях (U) и случайного шума (N). Формула расхождения выглядит так:
O = E + U + N
Где:
- O — общее расхождение между моделью и мнением эксперта;
- E — ошибка, вызванная недостатком способностей модели или плохой элиситацией;
- U — неразрешимые разногласия в вкусах/убеждениях;
- N — шум (ошибки судей, утечка данных).
Ключевые риски и ограничения
Методология не лишена недостатков. Основные проблемы, которые необходимо учитывать при внедрении:
| Суть риска | Влияние на бенчмарк | |
|---|---|---|
| Высокий шум (Noise) | Мнения людей изменчивы, а память не позволяет «сбросить» контекст для повторных замеров. Отсутствие обратной связи между судьями снижает качество данных. | Затрудняет измерение реального прогресса моделей. |
| Сдвиг во времени (Cutoff) | Рост баллов может быть объяснен не улучшением рассуждений, а тем, что модель увидела новые публикации эксперта после своей даты обучения. | Искажает метрику «концептуальных способностей», измеряя знание фактов, а не логику. |
| Утечка данных (Leakage) | Использование существующих текстов экспертов для создания вопросов может привести к тому, что модель просто запомнит ответы из тренировочных данных. | Ложноположительные результаты; модель не рассуждает, а цитирует. |
| Неспособность к эмпатии | Модели могут плохо воспроизводить эпистемический стиль (стиль мышления) конкретного человека, выдавая поверхностное совпадение «вайба» без глубокого анализа. | Требует сложного промптинга для точной настройки. |
Практические рекомендации
Автор рекомендует начать с «мягкой» версии бенчмарка: использовать существующие вопросы, но добавлять в промпт контекст мировоззрения и судейского профиля. Для более дорогих и точных замеров предлагается привлекать экспертов к ответам на новые, уникальные вопросы, которые они не публиковали ранее, чтобы минимизировать риск утечки данных. Также перспективным методом называется опрос экспертов об их мнениях по прочитанным, но не опубликованным в открытом доступе научным работам.
Источник: LessWrong ↗
