Прорыв в верификации полупроводников
Верификация чипов занимает значительную часть времени при разработке современных процессоров. Ключевая задача здесь — генерация тестбенчей (testbench stimulus) с высоким покрытием (coverage). Исследователи из команды, включающей авторов из университетов и индустрии, представили CHORUS (Complementary Experts for High-Coverage Testbench Stimulus Generation) — пост-тренировочный фреймворк, который решает эту задачу эффективнее существующих гигантов.
В отличие от стандартного подхода, где модель проходит последовательность SFT (Supervised Fine-Tuning) и RL (Reinforcement Learning), CHORUS использует стратегию «конкуренции и слияния». Авторы обнаружили, что staged SFT (поэтапное дообучение) создает чекпоинты с разным поведенческим разнообразием, а dense-reward RL превращает их в сильных «экспертов» с уникальными сильными сторонами.
Механика: От экспертов к единому целому
Суть метода CHORUS заключается в двух этапах:
- Специализация: Создание нескольких моделей-экспертов, каждый из которых отлично справляется с определенным типом задач верификации.
- Консолидация: Объединение этих экспертов в одну модель. Это можно сделать либо через training-free model merging (слияние без дообучения), либо через дополнительное пост-тренировочное сглаживание.
Результатом становится единая модель с 4 миллиардами параметров (4B), которая превосходит по качеству лучшие индивидуальные эксперты.
Сравнение производительности
Оценка проводилась на бенчмарке CVDP-ECov (Chip Verification Dataset with Enhanced Coverage). Метрика Pass@1 показывает вероятность того, что сгенерированный код будет работать с первого раза. Результаты демонстрируют разрыв между компактной новой моделью и огромными языковыми моделями общего назначения.
| Модель | Количество параметров | Pass@1 на CVDP-ECov | Примечание |
|---|---|---|---|
| CHORUS (предложенная) | 4B | 88.0% | Компактная, специализированная |
| DeepSeek-R1 | 671B | 74.5% | Универсальная LLM (отставание на 13.5 п.п.) |
Таким образом, CHORUS превосходит DeepSeek-R1 (671B) на 13.5 процентных пункта, используя в 167 раз меньше параметров. Это доказывает, что в нишевых задачах, таких как верификация hardware, узкоспециализированные архитектуры выигрывают у «тяжеловесов» общего назначения.
Почему это важно
Для индустрии полупроводников это означает возможность автоматизации рутинных этапов верификации с меньшими вычислительными затратами. Использование 4B-модели дешевле в развертывании и инференсе, чем гигантские 600B+ модели, что делает процесс разработки чипов более доступным и быстрым. Статья опубликована 10 августа 2026 года в arXiv (cs.AI).
Источник: arXiv cs.AI ↗
