Новый стандарт оценки: от SAT к редкости
Традиционные бенчмарки, нормированные на человеческие способности (SAT, барный экзамен), теряют смысл, когда ИИ превосходит человека. Автор статьи предлагает новый метрик: «IQ-эквивалент», основанный на статистической редкости человеческого результата. Если ИИ решает задачу, с которой не справляется даже эксперт с доступом к инструментам, но решение легко проверяемо, это признак ASI (Artificial Super Intelligence). Интеллект измеряется тем, насколько редким должен быть человек, чтобы сравняться с машиной, согласно нормальному распределению (среднее 100, отклонение 15).
Эволюция математического интеллекта ИИ
Математика стала идеальным полигоном благодаря четкой иерархии соревнований и известным распределениям результатов. Сравнение прогресса моделей показывает экспоненциальный рост:
| Достижение / Уровень | Редкость (США) | IQ-эквивалент | Первая модель |
|---|---|---|---|
| Квалификация AIME | 1 к 600 | 144 | OpenAI GPT-o1 (2024) |
| Член команды IMO | 1 к 680 000 | 170 | AlphaProof (2024) |
| Золото IMO (~5 чел.) | 1 к 820 000 | 171 | Gemini Deep Think (2025) |
| Идеальный балл IMO (42/42) | 1 к 8 000 000 | 177+ | Celia (Huawei), dots-note 3.0 (2026) |
Ключевое событие: Июль 2026
В июле 2026 года системы Celia от Huawei и dots-note 3.0 от Xiaohongshu официально получили 42 из 42 баллов на IMO. Важно отметить, что оценка проводилась по тем же строгим стандартам, что и для людей, а решения представляли собой чистые доказательства, а не черновики. Это подтверждает, что ИИ не просто угадывает ответы, а генерирует верифицируемые логические цепочки.
Почему это важно сейчас?
Мы находимся в узком временном окне. Пока ИИ превосходит большинство людей, но не всех (в США есть около 50 человек, сопоставимых с текущим уровнем ИИ), мы можем оценивать прогресс через сравнение с человеческими эталонами. Как только ИИ станет превосходить абсолютно всех людей в данной области, мы потеряем ориентир. Автор предупреждает: после этого момента мы будем «лететь вслепую», не имея возможности точно измерить скорость развития интеллекта. Вопрос не в том, умнее ли ИИ, а в том, насколько быстро мы хотим двигаться, когда потеряем контроль над шкалой измерений.
Источник: LessWrong ↗
