Проблема одномерных бенчмарков
Предыдущие версии индекса Epoch Capabilities Index, основанные на фреймворке Rosetta Stone, сжимали множество результатов тестов в одну метрику. Однако этот подход выявил критический недостаток: он не мог корректно упорядочить модели относительно людей. Большинство людей показывают почти идеальные результаты на задачах абстрактного рассуждения (например, ARC-AGI или VPCT), но демонстрируют уровень, близкий к случайному угадыванию, на сложных научных вопросах (GPQA). Многие же современные AI-модели демонстрируют обратную картину.
Решение: Четыре оси Байесовского индекса
Чтобы устранить это искажение, команда разработала Four-Axis Bayesian Epoch Capabilities Index. Вместо одной агрегированной цифры теперь используются четыре независимые оси, которые позволяют более точно отражать профиль способностей модели. Этот подход позволяет одновременно учитывать сильные и слабые стороны как ИИ, так и человека, создавая более сбалансированную шкалу сравнения.
Введение человеческих базовых линий
Ключевым нововведением стало добавление человеческих базовых линий на ту же шкалу, что и оценки моделей. Это позволяет напрямую сравнивать производительность AI с человеческими когнитивными возможностями в различных доменах. Исследование показывает, что без учета человеческих эталонов оценка «интеллектуальности» модели остается неполной и потенциально вводящей в заблуждение.
Сравнение подходов
Новая методология предлагает более детализированный взгляд на способности AI, избегая компромиссов, присущих одномерным индексам. Ниже приведено сравнение характеристик старого и нового подходов:
| Характеристика | Предыдущий индекс (1 ось) | Новый индекс (4 оси) |
|---|---|---|
| Структура данных | Одна агрегированная метрика | Четыре независимые оси |
| Человеческие эталоны | Отсутствовали или были вторичны | Интегрированы в основную шкалу |
| Обработка ARC-AGI / GPQA | Невозможно корректно упорядочить | Учитывает инверсию паттернов |
| Точность сравнения | Низкая (искажение из-за дисбаланса) | Высокая (Байесовский подход) |
Значение для индустрии
Разработка такого индекса важна для политиков и исследователей, занимающихся оценкой рисков и потенциала общих искусственных интеллектов (AGI). Понимание того, где именно модели превосходят или уступают людям, позволяет точнее прогнозировать траекторию развития AI и разрабатывать соответствующие регуляторные меры. Исследование опубликовано в блоге General-Purpose AI Policy Lab и доступно для детального изучения на LessWrong.
Источник: LessWrong ↗
