Исследования12 августа 2026 г., 09:18 МСК🤖 Auto

CHORUS: 4B-модель бьет DeepSeek-R1 (671B) в верификации чипов

Исследователи представили фреймворк CHORUS, который объединяет специализированные модели в одну компактную 4B-архитектуру, достигая 88% точности в генерации тестов для полупроводников.

Баннер новости 5589

Прорыв в верификации полупроводников

Верификация чипов занимает значительную часть времени при разработке современных процессоров. Ключевая задача здесь — генерация тестбенчей (testbench stimulus) с высоким покрытием (coverage). Исследователи из команды, включающей авторов из университетов и индустрии, представили CHORUS (Complementary Experts for High-Coverage Testbench Stimulus Generation) — пост-тренировочный фреймворк, который решает эту задачу эффективнее существующих гигантов.

В отличие от стандартного подхода, где модель проходит последовательность SFT (Supervised Fine-Tuning) и RL (Reinforcement Learning), CHORUS использует стратегию «конкуренции и слияния». Авторы обнаружили, что staged SFT (поэтапное дообучение) создает чекпоинты с разным поведенческим разнообразием, а dense-reward RL превращает их в сильных «экспертов» с уникальными сильными сторонами.

Механика: От экспертов к единому целому

Суть метода CHORUS заключается в двух этапах:

  • Специализация: Создание нескольких моделей-экспертов, каждый из которых отлично справляется с определенным типом задач верификации.
  • Консолидация: Объединение этих экспертов в одну модель. Это можно сделать либо через training-free model merging (слияние без дообучения), либо через дополнительное пост-тренировочное сглаживание.

Результатом становится единая модель с 4 миллиардами параметров (4B), которая превосходит по качеству лучшие индивидуальные эксперты.

Сравнение производительности

Оценка проводилась на бенчмарке CVDP-ECov (Chip Verification Dataset with Enhanced Coverage). Метрика Pass@1 показывает вероятность того, что сгенерированный код будет работать с первого раза. Результаты демонстрируют разрыв между компактной новой моделью и огромными языковыми моделями общего назначения.

Модель Количество параметров Pass@1 на CVDP-ECov Примечание
CHORUS (предложенная) 4B 88.0% Компактная, специализированная
DeepSeek-R1 671B 74.5% Универсальная LLM (отставание на 13.5 п.п.)

Таким образом, CHORUS превосходит DeepSeek-R1 (671B) на 13.5 процентных пункта, используя в 167 раз меньше параметров. Это доказывает, что в нишевых задачах, таких как верификация hardware, узкоспециализированные архитектуры выигрывают у «тяжеловесов» общего назначения.

Почему это важно

Для индустрии полупроводников это означает возможность автоматизации рутинных этапов верификации с меньшими вычислительными затратами. Использование 4B-модели дешевле в развертывании и инференсе, чем гигантские 600B+ модели, что делает процесс разработки чипов более доступным и быстрым. Статья опубликована 10 августа 2026 года в arXiv (cs.AI).

Источник: arXiv cs.AI ↗