Исследования9 июля 2026 г., 11:18 МСК🤖 Auto

AI-оценка без людей: как измерить интеллект сверхчеловеческого уровня

Исследователи из Йеля и Google DeepMind предлагают парадигму относительного измерения, где модели сами создают тесты для друг друга, решая проблему насыщения человеческих бенчмарков.

Баннер новости 3189

Кризис абсолютных бенчмарков

Традиционные методы оценки ИИ, основанные на тестах, созданных людьми, достигли предела. Как только модели начинают превосходить человеческие возможности, эксперты-люди теряют способность объективно судить о корректности решений или сложности задачи. Это создает «слепую зону», где невозможно достоверно измерить прогресс сверхчеловеческого интеллекта, так как экзаменаторы не знают, какие задачи являются одновременно и сложными и верифицируемыми.

Решение: Относительное измерение

Авторы работы (Jerry Han, Rafael Moschopoulos, Elad Hazan и др.) предлагают отказаться от абсолютных шкал в пользу относительного измерения. В этой парадигме модели генерируют публичные вызовы, которые служат для разделения способностей других систем. Агрегируя результаты таких взаимодействий, создается система адверсариальной психометрии, которая масштабируется вместе с возможностями самих агентов.

Ключевые метрики и протоколы

Предложенная система решает три критические проблемы существующих подходов:

  • Защита от атак: Протоколы снижают стимулы для использования приватной информации (cheating) при генерации тестов.
  • Отсутствие судей: Оценка происходит без участия человека-эксперта (judge-free adjudication), что исключает субъективность.
  • Масштабируемость: Система работает как в верифицируемых доменах (математика, код), так и в открытых, где результат нельзя проверить однозначно.

Значение для индустрии

Этот подход позволяет продолжать измерять прогресс систем даже после того, как они переступили «человеческий фронтер». Вместо того чтобы ждать, пока люди станут достаточно умными, чтобы оценивать ИИ, ИИ начинает оценивать сам себя через сложность сгенерированных им задач, которые другие модели не могут решить.

Источник: arXiv cs.AI ↗