Исследования7 сентября 2026 г., 09:18 МСК🤖 Auto

PerfReasoning: LLM не умеют писать код для моделирования железа

Исследование PerfReasoning показало, что даже топовые LLM с трудом справляются с генерацией кода для оценки производительности процессоров, хотя в теоретических вопросах достигают 90% точности.

Баннер новости 6914

Суть проблемы: разрыв между знанием и практикой

Моделирование производительности (performance modeling) — критически важная часть проектирования аппаратного обеспечения и оптимизации ПО. Однако создание таких моделей требует сложного структурированного рассуждения о вычислениях, повторном использовании данных, хранении и перемещении информации. Авторы исследования из Стэнфорда и других институтов представили бенчмарк PerfReasoning, который оценивает LLM не только как источники ответов на вопросы, но и как генераторы аналитического кода для построения моделей производительности.

Ключевой вывод: существует значительный разрыв между способностью модели давать правдоподобные архитектурные объяснения и её способностью генерировать надежный, рабочий код для расчета метрик.

Результаты тестирования: Q&A против генерации кода

В бенчмарке модели должны были сравнивать различные маппинги (сопоставления) рабочих нагрузок с архитектурой и предсказывать объем трафика за пределами чипа (off-chip traffic) и требования к буферам. Результаты кардинально различаются в зависимости от типа задачи:

Задача Лучший закрытый проприетарный Лучшая открытая модель Прочие конфигурации
Reasoning-based Q&A (ответы на вопросы) > 90% точности 82.4%
Генерация кода модели (Pass@1) > 80% (GPT-5.6 Sol) < 15% (в среднем) Высокая вариативность между запусками

Как видно из таблицы, пока GPT-5.6 Sol демонстрирует приемлемый результат в 80% успешных запусков кода, все остальные модели, включая открытые аналоги, проваливаются, показывая средний результат ниже 15%. При этом результаты сильно варьируются от запуска к запуску, что делает их непригодными для стабильного использования в инженерных задачах.

Эффективность методов оптимизации

Авторы протестировали различные методы улучшения результатов, чтобы понять, как можно закрыть этот разрыв:

  • Task-specific RL (Обучение с подкреплением): Оказалось наиболее эффективным методом. Применение RL для модели на 4 миллиарда параметров повысило точность рассуждений о маппингах на 15.7 процентных пункта.
  • Self-revision prompting (Самокоррекция без обратной связи): Многоэтапная самокоррекция без внешнего фидбека не показала надежной эффективности. Модели часто не могут самостоятельно найти и исправить ошибки в логике расчета производительности.

Значение для индустрии

Результаты PerfReasoning подчеркивают, что текущие LLM, несмотря на высокие баллы в общих benchmarks, еще не готовы полностью автоматизировать процесс создания аналитических моделей производительности. Для инженеров по архитектуре это означает, что LLM пока можно использовать как помощника для генерации черновиков или ответов на теоретические вопросы, но критическая проверка и доработка кода остаются за человеком. Бенчмарк будет опубликован открыто для отслеживания прогресса в этой нишевой области.

Источник: arXiv cs.AI ↗