Релиз модели7 октября 2026 г., 02:01 МСК🤖 Auto

OpenAI: o1 и o3-mini решают задачи уровня IMO, но с оговорками

OpenAI представила новые модели o1 и o3-mini, демонстрирующие прорывные результаты в математике. Однако эксперты отмечают, что успехи связаны с предобучением на решениях олимпиад, а не с истинным пониманием.

Баннер новости 9074

Прорыв в математических бенчмарках

Компания OpenAI опубликовала результаты тестирования своих новых моделей o1 и o3-mini в области математики. Модели показали выдающиеся результаты на международных олимпиадах, включая задачи уровня Международной математической олимпиады (IMO). По данным компании, модель o1 успешно решает сложные задачи, требующие многошагового логического вывода, что ранее считалось одной из самых трудных задач для ИИ.

Сравнение производительности моделей

Для наглядности эффективности новых моделей ниже приведена таблица с ключевыми метриками на стандартных бенчмарках:

Модель Результат на AIME 2024 Результат на MATH Особенности
o1 96.7% 92.0% Глубокий анализ, медленное мышление
o3-mini 85.0% 80.0% Быстрое выполнение, оптимизация по стоимости
o1-preview 72.0% 65.0% Базовая версия для сравнения

Критика: «Запоминание», а не «Понимание»

Несмотря на впечатляющие цифры, сообщество исследователей выражает скепсис. Ключевая проблема заключается в том, что модели были обучены на огромных массивах данных, включающих готовые решения математических олимпиад. Это позволяет моделям не столько «решать» задачи, сколько воспроизводить паттерны из тренировочной выборки. Как отмечают эксперты, это ставит под вопрос истинную способность ИИ к абстрактному логическому мышлению в новых, незнакомых контекстах.

Что это значит для разработчиков?

Для разработчиков и исследователей это означает, что использование ИИ для генерации кода или решения специфических математических задач требует тщательной проверки. Модели o1 и o3-mini эффективны в узких, хорошо определенных задачах, но их выводы не следует считать абсолютной истиной без верификации. OpenAI продолжает работу над улучшением обобщающей способности моделей, чтобы снизить зависимость от предобученных данных.

Источник: OpenAI ↗