Кризис старых бенчмарков
Традиционные тесты на интеллект опираются на вопросы, созданные людьми. Однако, когда способности ИИ превышают человеческие, такие бенчмарки теряют смысл: задачи либо решаются всеми, либо не решаются никем. Авторы статьи, основанной на работе "Measuring Intelligence Beyond Human Scale", предлагают парадигму adversarial psychometrics (соперничающей психометрики). Суть в том, что интеллект измеряется не абсолютным решением задач, а способностью агента генерировать вопросы, которые эффективно разделяют способности других агентов.
Протокол SepaRank: механика игры
Вместо того чтобы полагаться на внешних судей или другие модели-арбитры (что создает риск манипуляций и смещения bias), система использует внутреннюю мотивацию участников. Протокол работает по принципу « proposer-solver »:
- Proposer (Инициатор): Генерирует вопрос с бинарным ответом и фиксирует правильный ответ. Награда зависит от того, насколько широко распределены уверенности (confidence) решателей. Идеальный вопрос вызывает поляризацию: одни агенты уверены в ответе А, другие — в ответе Б.
- Solver (Решатель): Дает ответ и оценивает свою уверенность (вероятность от 0 до 1). Награда рассчитывается по правилу proper scoring rule (например, Brier score), что стимулирует честную оценку своих возможностей.
Почему это важно для безопасности ИИ
Предыдущие подходы, такие как Token Games или MathDuels, ограничивались верифицируемыми доменами (математика, код). Это исключает открытые формы рассуждений. Использование другой модели в качестве судьи опасно: судья должен быть не слабее оцениваемых, а сильные решатели часто плохие судьи. SepaRank устраняет необходимость внешнего арбитра, опираясь на theory of mind — способность понимать намерения и способности других агентов, что коррелирует с общим фактором интеллекта (g-factor) по Спирмену.
Сравнение подходов к оценке
| Метод | Механизм | Ограничения |
|---|---|---|
| Традиционные бенчмарки | Решение фиксированных вопросов | Не масштабируются за пределы человеческого интеллекта |
| Pairwise (Elo) | Сравнение двух агентов | Требует верифицируемого ответа; уязвимо к private information |
| Model-as-a-Judge | Оценка одной модели другой | Смещение bias, риск манипуляций, требует супер-судью |
| Adversarial Psychometrics (SepaRank) | Генерация вопросов для разделения группы | Требует вычислительных ресурсов, но не требует внешнего судьи |
Результаты и перспективы
Протокол SepaRank масштабируется: чем сильнее агенты, тем более сложные и тонкие вопросы они могут генерировать для разделения группы. Это позволяет отслеживать прогресс даже в тех областях, где нет единственно верного ответа, но есть градация качества рассуждения. Метод предлагает путь к объективной оценке сверхчеловеческого интеллекта без риска обмана системы через скрытые подсказки или вычислительную асимметрию.
Источник: LessWrong ↗
