Исследования19 августа 2026 г., 05:17 МСК🤖 Auto

AI достиг IQ 177: как модели решили задачи IMO и что это значит

В июле 2026 года ИИ-системы Celia и dots-note 3.0 получили идеальные баллы на Международной математической олимпиаде. Это первый случай официального подтверждения суперчеловеческой способности к рассуждению.

Баннер новости 6041

Новый стандарт оценки: от SAT к редкости

Традиционные бенчмарки, нормированные на человеческие способности (SAT, барный экзамен), теряют смысл, когда ИИ превосходит человека. Автор статьи предлагает новый метрик: «IQ-эквивалент», основанный на статистической редкости человеческого результата. Если ИИ решает задачу, с которой не справляется даже эксперт с доступом к инструментам, но решение легко проверяемо, это признак ASI (Artificial Super Intelligence). Интеллект измеряется тем, насколько редким должен быть человек, чтобы сравняться с машиной, согласно нормальному распределению (среднее 100, отклонение 15).

Эволюция математического интеллекта ИИ

Математика стала идеальным полигоном благодаря четкой иерархии соревнований и известным распределениям результатов. Сравнение прогресса моделей показывает экспоненциальный рост:

Достижение / Уровень Редкость (США) IQ-эквивалент Первая модель
Квалификация AIME 1 к 600 144 OpenAI GPT-o1 (2024)
Член команды IMO 1 к 680 000 170 AlphaProof (2024)
Золото IMO (~5 чел.) 1 к 820 000 171 Gemini Deep Think (2025)
Идеальный балл IMO (42/42) 1 к 8 000 000 177+ Celia (Huawei), dots-note 3.0 (2026)

Ключевое событие: Июль 2026

В июле 2026 года системы Celia от Huawei и dots-note 3.0 от Xiaohongshu официально получили 42 из 42 баллов на IMO. Важно отметить, что оценка проводилась по тем же строгим стандартам, что и для людей, а решения представляли собой чистые доказательства, а не черновики. Это подтверждает, что ИИ не просто угадывает ответы, а генерирует верифицируемые логические цепочки.

Почему это важно сейчас?

Мы находимся в узком временном окне. Пока ИИ превосходит большинство людей, но не всех (в США есть около 50 человек, сопоставимых с текущим уровнем ИИ), мы можем оценивать прогресс через сравнение с человеческими эталонами. Как только ИИ станет превосходить абсолютно всех людей в данной области, мы потеряем ориентир. Автор предупреждает: после этого момента мы будем «лететь вслепую», не имея возможности точно измерить скорость развития интеллекта. Вопрос не в том, умнее ли ИИ, а в том, насколько быстро мы хотим двигаться, когда потеряем контроль над шкалой измерений.

Источник: LessWrong ↗