Исследования2 октября 2026 г., 11:18 МСК🤖 Auto

R2T: Проверка кода LLM-агентов через исполняемые скрипты

Исследование R2T показывает, что предоставление LLM-агентам исполняемых проверок (checks) вместо текстовых инструкций повышает точность исправления научного кода с 26/30 до 29/30.

Баннер новости 8767

Проблема текстовых инструкций в научном коде

Агенты на базе больших языковых моделей (LLM), работающие в области научных вычислений, часто получают задачи в виде текстовых описаний: уравнений, граничных условий и требований к выводу. Главная проблема такого подхода — неоднозначность интерпретации. Авторы работы "Rules to Tools: Executable Checks for LLM Agents in Scientific Computing" (Jingjie Ning и соавт.) предлагают заменить текстовые правила на исполняемые проверки (executable checks) — готовые скрипты, которые могут автоматически валидировать корректность сгенерированного кода.

Методология: Text vs. Tools

Эксперимент проводился на когортах задач SciCode. В одной группе агенты получали текстовые инструкции (Text), в другой — вызываемую реализацию проверок (Tools). Сравнение проводилось по количеству полностью исправленных задач (complete repair) и экономии ресурсов.

Метрика / Когорта Группа Text (Текст) Группа Tools (Инструменты) Разница / Примечание
Task-ID Cohort 1 (Полное исправление) 26/30 29/30 Превосходство Tools
Task-ID Cohort 2 (Полное исправление) 13/16 15/16 Bootstrap 95% CI: [-12.5, 43.75] pp
SciCode Cohort (Shared Definition) 13/24 13/24 Ничья
PDE Comparison (Сложные задачи) 23/24 24/24 Tools: -31.2% вывод модели
Development-exposed tasks 3/10 7/10 Значительный разрыв в пользу Tools

Ключевые результаты

  • Повышение точности: В основной когорте использование исполняемых проверок увеличило долю успешных исправлений с 86.7% (26/30) до 96.7% (29/30). В 3 задачах инструменты оказались явно эффективнее, в 1 — текст, в 11 случаях результаты совпали.
  • Экономия ресурсов: В сравнении по уравнениям в частных производных (PDE) группа Tools достигла лучшего результата (24/24 против 23/24) при этом сократив объем выводимых данных моделью на 31.2%.
  • Сложные сценарии: На задачах с альтернативными стартовыми программами (development-exposed) разрыв стал критическим: 7/10 для Tools против 3/10 для Text. Изначальные проверки успешно выявляли ошибки в задачах 17, 77 и 11, тогда как текстовые инструкции их пропускали.

Почему это важно

Результаты демонстрируют, что переход от «языка» к «инструментам» (Rules to Tools) снижает галлюцинации LLM при написании критически важного научного кода. Хотя использование публичных CPU для запуска проверок увеличивает нагрузку на инфраструктуру, выигрыш в надежности и снижении объема вывода модели делает этот подход перспективным для автоматизации научных вычислений.

Источник: arXiv cs.AI ↗