Лидерство в агентном RTL-кодинге
NVIDIA анонсировала результаты применения своей модели Nemotron 3 Ultra в связке с агентом ACE-RTL (Agentic Context Evolution). Эта комбинация демонстрирует state-of-the-art результаты на бенчмарке CVDP (Comprehensive Verilog Design Problems), который оценивает способность моделей генерировать, модифицировать и отлаживать код на языке Verilog. Модель достигла среднего показателя успешности (pass rate) 97.1% по девяти категориям задач, превзойдя такие модели, как GLM 5.2 и Kimi K2.6.
Сравнение эффективности и точности
Ключевое преимущество Nemotron 3 Ultra заключается не только в точности, но и в эффективности вычислений. Благодаря гибридной архитектуре Mamba-Attention и структуре Mixture-of-Experts (MoE), модель требует значительно меньше ресурсов для обработки длинных контекстов, что критично для итеративных процессов отладки RTL-кода. Ниже приведено сравнение метрик работы агента ACE-RTL с разными моделями:
| Модель | Средний Pass Rate (CVDP) | Токенов на итерацию (avg) | Экономия токенов |
|---|---|---|---|
| Nemotron 3 Ultra | 97.1% | 6,629 | — |
| Kimi K2.6 | 95.2% | 22,579 | 71% меньше у Nemotron |
| GLM 5.2 | 92.1% | 9,156 | 28% меньше у Nemotron |
Архитектура и масштаб модели
Nemotron 3 Ultra — это модель с 550 миллиардами общих параметров, из которых активными являются 55 миллиардов (MoE). Она обучена на 20 триллионах текстовых токенов и поддерживает контекстное окно до 1 миллиона токенов. Архитектура Hybrid Mamba-Attention снижает нагрузку на KV-cache и вычислительные затраты внимания, что обеспечивает пропускную способность до 5 раз выше и снижение стоимости инференса на 30% по сравнению с другими открытыми моделями аналогичного класса.
Роль агента ACE-RTL
Сама по себе модель демонстрирует рост эффективности в итеративном режиме. Агент ACE-RTL использует цикл «generate-test-reflect» (генерация-тестирование-рефлексия), где генератор создает код, рефлектор анализирует ошибки симуляции, а координатор накапливает контекст отладки. Без агента Nemotron 3 Ultra показывала 65.7% pass rate на задачах отладки, но с интеграцией ACE-RTL этот показатель вырос до 100% в отдельных категориях и 97.1% в среднем. Это доказывает, что для сложных задач проектирования чипов критически важна не только сила LLM, но и способность агента управлять историей взаимодействий с EDA-инструментами (Cadence, Siemens, Synopsys).
Значение для индустрии
Снижение потребления токенов при высокой точности позволяет инженерам выполнять больше итераций отладки в рамках того же вычислительного бюджета. Это делает Nemotron 3 Ultra практическим фундаментом для интеграции в рабочие процессы проектирования полупроводников, где время инженера и стоимость вычислений являются ограничивающими факторами.
Бенчмарки
| Бенчмарк | Nemotron 3 Ultra | GLM 5.2 | Kimi K2.6 |
|---|---|---|---|
| CVDP | 97.1% | 92.1% | 95.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: NVIDIA dev blog ↗
