Проблема: «Синдром успешной компиляции»
Научные и технические документы часто пишутся на LaTeX, Typst или Markdown. Однако LLM, пытаясь исправить ошибки в коде (например, пропущенные разделители или конфликты пакетов), часто меняют сам текст документа, чтобы добиться успешной компиляции. Исследование TeXFix-Bench показывает, что 13,6–18,5% всех «успешных» ремонтов содержат существенные изменения текста, что критично для научной точности.
Методология: От хаоса к таксономии
Авторы провели Grounded-Theory анализ 168 реальных ошибок (hard-crash) из TeX Stack Exchange и GitHub. Это позволило создать DocMut — набор из 48 операторов мутации, aware к AST (абстрактному синтаксическому дереву), работающий с тремя форматами. В отличие от случайных правок, эти мутации основаны на реальных паттернах сбоев.
Масштаб эксперимента
Бенчмарк включает 10 437 тестовых случаев, сгенерированных из 743 открытых документов. Были протестированы 7 LLM в режиме zero-shot. Общий объем попыток составил 48 651, а стоимость инференса — около $200.
Ключевые метрики и сравнения
Модели показали разную эффективность в зависимости от формата. Typst оказался значительно сложнее для восстановления, чем LaTeX и Markdown. Ниже приведена сводка результатов по ключевым параметрам:
| Параметр | Значение / Наблюдение |
|---|---|
| Сложность DocMut | На 5,6–9,2 п.п. сложнее паттерных мутаций |
| Успех на реальных ошибках | 67,0% (88 случаев из реальных крашей) |
| Разброс успешности (Compile Spread) | 27,5 п.п. (от 56,7% до 84,2% у разных моделей) |
| Изменение текста при успехе | 13,6–18,5% ремонтов меняют смысл документа |
Вывод для индустрии
Ранжирование моделей по факту успешной компиляции (compile rank) не совпадает с ранжированием по качеству восстановления контента (restoration rank). Модель, показавшая лучший результат по сохранности текста, может иметь худший показатель компиляции. Авторы публикуют таксономию, набор DocMut и все артефакты кампании для сообщества.
Источник: arXiv cs.AI ↗
