Исследования7 сентября 2026 г., 17:17 МСК🤖 Auto

Новый индекс Epoch Capabilities: 4 оси и человеческие бенчмарки для AI

Исследователи из General-Purpose AI Policy Lab представили обновленный индекс способностей Epoch Capabilities Index, который решает проблему искажения оценок моделей через четыре оси и добавляет человеческие базовые линии.

Баннер новости 6942

Проблема одномерных бенчмарков

Предыдущие версии индекса Epoch Capabilities Index, основанные на фреймворке Rosetta Stone, сжимали множество результатов тестов в одну метрику. Однако этот подход выявил критический недостаток: он не мог корректно упорядочить модели относительно людей. Большинство людей показывают почти идеальные результаты на задачах абстрактного рассуждения (например, ARC-AGI или VPCT), но демонстрируют уровень, близкий к случайному угадыванию, на сложных научных вопросах (GPQA). Многие же современные AI-модели демонстрируют обратную картину.

Решение: Четыре оси Байесовского индекса

Чтобы устранить это искажение, команда разработала Four-Axis Bayesian Epoch Capabilities Index. Вместо одной агрегированной цифры теперь используются четыре независимые оси, которые позволяют более точно отражать профиль способностей модели. Этот подход позволяет одновременно учитывать сильные и слабые стороны как ИИ, так и человека, создавая более сбалансированную шкалу сравнения.

Введение человеческих базовых линий

Ключевым нововведением стало добавление человеческих базовых линий на ту же шкалу, что и оценки моделей. Это позволяет напрямую сравнивать производительность AI с человеческими когнитивными возможностями в различных доменах. Исследование показывает, что без учета человеческих эталонов оценка «интеллектуальности» модели остается неполной и потенциально вводящей в заблуждение.

Сравнение подходов

Новая методология предлагает более детализированный взгляд на способности AI, избегая компромиссов, присущих одномерным индексам. Ниже приведено сравнение характеристик старого и нового подходов:

Характеристика Предыдущий индекс (1 ось) Новый индекс (4 оси)
Структура данных Одна агрегированная метрика Четыре независимые оси
Человеческие эталоны Отсутствовали или были вторичны Интегрированы в основную шкалу
Обработка ARC-AGI / GPQA Невозможно корректно упорядочить Учитывает инверсию паттернов
Точность сравнения Низкая (искажение из-за дисбаланса) Высокая (Байесовский подход)

Значение для индустрии

Разработка такого индекса важна для политиков и исследователей, занимающихся оценкой рисков и потенциала общих искусственных интеллектов (AGI). Понимание того, где именно модели превосходят или уступают людям, позволяет точнее прогнозировать траекторию развития AI и разрабатывать соответствующие регуляторные меры. Исследование опубликовано в блоге General-Purpose AI Policy Lab и доступно для детального изучения на LessWrong.

Источник: LessWrong ↗