Исследования12 сентября 2026 г., 08:18 МСК🤖 Auto

Nemotron 3 Ultra: Как NVIDIA завоевала золото IMO 2026

NVIDIA представила открытую модель Nemotron, которая набрала 30 из 42 баллов на Международной математической олимпиаде 2026 года, достигнув золотого уровня без использования внешних инструментов.

Баннер новости 7334

Золото без «костылей»

Команда NVIDIA (в соавторстве с исследователями из МГУ и других институтов) опубликовала полный рецепт обучения модели для решения задач высшей математики. Ключевое достижение — система работает полностью на естественном языке. В ней нет формальных доказательных систем (theorem provers), доступа к интернету или внешних вычислительных инструментов. Это прорыв в области «чистого» рассуждения LLM.

Архитектура решения: от SFT до RL

Работа началась с базовой модели Nemotron 3 Ultra. Для достижения олимпийского уровня команда применила двухэтапную дообучку:

  • Supervised Fine-Tuning (SFT): Обучение на качественных решениях олимпиадных задач.
  • Reinforcement Learning (RL): Усиление способности модели к логическому выводу и проверке собственных шагов.

В результате были получены два специализированных чекпоинта, которые интегрированы в пайплайн тестовых вычислений (test-time compute). Система использует итеративный поиск: генерирует кандидаты на решение, верифицирует их и уточняет. Финальный отбор решений происходит на отдельном этапе с высокими вычислительными затратами.

Результаты IMO 2026

На Международной математической олимпиаде 2026 года система продемонстрировала выдающиеся результаты. Для сравнения, типичные передовые модели того времени показывали значительно более низкие баллы на таких задачах. Ниже приведена сводка по ключевым метрикам:

Метрика Значение Примечание
Итоговый балл 30 / 42 Достигнут порог золотой медали
Базовая модель Nemotron 3 Ultra Использовалась как стартовая точка
Специализированные чекпоинты 2 модели Обучены через SFT и RL
Новый бенчмарк Nemotron-IMO-Bench 200 новых задач олимпиадного уровня

Открытость и доступность

В отличие от многих закрытых решений, NVIDIA опубликовала полный стек:

  • Два дообученных чекпоинта модели.
  • Данные для обучения (training data).
  • Код для обучения и инференса.
  • Все поданные решения (submitted solutions).
  • Бенчмарк Nemotron-IMO-Bench с 200 новыми задачами, которых не было в обучающей выборке.

Это позволяет исследователям воспроизвести результат и исследовать, как именно пост-тренировка и дизайн инференса влияют на способность моделей генерировать естественные языковые доказательства для сложных задач.

Источник: arXiv cs.AI ↗