Прорыв в математических бенчмарках
Компания OpenAI опубликовала результаты тестирования своих новых моделей o1 и o3-mini в области математики. Модели показали выдающиеся результаты на международных олимпиадах, включая задачи уровня Международной математической олимпиады (IMO). По данным компании, модель o1 успешно решает сложные задачи, требующие многошагового логического вывода, что ранее считалось одной из самых трудных задач для ИИ.
Сравнение производительности моделей
Для наглядности эффективности новых моделей ниже приведена таблица с ключевыми метриками на стандартных бенчмарках:
| Модель | Результат на AIME 2024 | Результат на MATH | Особенности |
|---|---|---|---|
| o1 | 96.7% | 92.0% | Глубокий анализ, медленное мышление |
| o3-mini | 85.0% | 80.0% | Быстрое выполнение, оптимизация по стоимости |
| o1-preview | 72.0% | 65.0% | Базовая версия для сравнения |
Критика: «Запоминание», а не «Понимание»
Несмотря на впечатляющие цифры, сообщество исследователей выражает скепсис. Ключевая проблема заключается в том, что модели были обучены на огромных массивах данных, включающих готовые решения математических олимпиад. Это позволяет моделям не столько «решать» задачи, сколько воспроизводить паттерны из тренировочной выборки. Как отмечают эксперты, это ставит под вопрос истинную способность ИИ к абстрактному логическому мышлению в новых, незнакомых контекстах.
Что это значит для разработчиков?
Для разработчиков и исследователей это означает, что использование ИИ для генерации кода или решения специфических математических задач требует тщательной проверки. Модели o1 и o3-mini эффективны в узких, хорошо определенных задачах, но их выводы не следует считать абсолютной истиной без верификации. OpenAI продолжает работу над улучшением обобщающей способности моделей, чтобы снизить зависимость от предобученных данных.
Источник: OpenAI ↗
