Проблема текстовых инструкций в научном коде
Агенты на базе больших языковых моделей (LLM), работающие в области научных вычислений, часто получают задачи в виде текстовых описаний: уравнений, граничных условий и требований к выводу. Главная проблема такого подхода — неоднозначность интерпретации. Авторы работы "Rules to Tools: Executable Checks for LLM Agents in Scientific Computing" (Jingjie Ning и соавт.) предлагают заменить текстовые правила на исполняемые проверки (executable checks) — готовые скрипты, которые могут автоматически валидировать корректность сгенерированного кода.
Методология: Text vs. Tools
Эксперимент проводился на когортах задач SciCode. В одной группе агенты получали текстовые инструкции (Text), в другой — вызываемую реализацию проверок (Tools). Сравнение проводилось по количеству полностью исправленных задач (complete repair) и экономии ресурсов.
| Метрика / Когорта | Группа Text (Текст) | Группа Tools (Инструменты) | Разница / Примечание |
|---|---|---|---|
| Task-ID Cohort 1 (Полное исправление) | 26/30 | 29/30 | Превосходство Tools |
| Task-ID Cohort 2 (Полное исправление) | 13/16 | 15/16 | Bootstrap 95% CI: [-12.5, 43.75] pp |
| SciCode Cohort (Shared Definition) | 13/24 | 13/24 | Ничья |
| PDE Comparison (Сложные задачи) | 23/24 | 24/24 | Tools: -31.2% вывод модели |
| Development-exposed tasks | 3/10 | 7/10 | Значительный разрыв в пользу Tools |
Ключевые результаты
- Повышение точности: В основной когорте использование исполняемых проверок увеличило долю успешных исправлений с 86.7% (26/30) до 96.7% (29/30). В 3 задачах инструменты оказались явно эффективнее, в 1 — текст, в 11 случаях результаты совпали.
- Экономия ресурсов: В сравнении по уравнениям в частных производных (PDE) группа Tools достигла лучшего результата (24/24 против 23/24) при этом сократив объем выводимых данных моделью на 31.2%.
- Сложные сценарии: На задачах с альтернативными стартовыми программами (development-exposed) разрыв стал критическим: 7/10 для Tools против 3/10 для Text. Изначальные проверки успешно выявляли ошибки в задачах 17, 77 и 11, тогда как текстовые инструкции их пропускали.
Почему это важно
Результаты демонстрируют, что переход от «языка» к «инструментам» (Rules to Tools) снижает галлюцинации LLM при написании критически важного научного кода. Хотя использование публичных CPU для запуска проверок увеличивает нагрузку на инфраструктуру, выигрыш в надежности и снижении объема вывода модели делает этот подход перспективным для автоматизации научных вычислений.
Источник: arXiv cs.AI ↗
