Исследования11 августа 2026 г., 11:17 МСК🤖 Auto

TeXFix-Bench: Почему LLM часто «ломает» текст при починке кода

Исследователи представили TeXFix-Bench — первый эмпирический бенчмарк для оценки способности LLM восстанавливать исходный код документов. Главный вывод: успешная компиляция не гарантирует сохранность контента.

Баннер новости 5509

Проблема: «Синдром успешной компиляции»

Научные и технические документы часто пишутся на LaTeX, Typst или Markdown. Однако LLM, пытаясь исправить ошибки в коде (например, пропущенные разделители или конфликты пакетов), часто меняют сам текст документа, чтобы добиться успешной компиляции. Исследование TeXFix-Bench показывает, что 13,6–18,5% всех «успешных» ремонтов содержат существенные изменения текста, что критично для научной точности.

Методология: От хаоса к таксономии

Авторы провели Grounded-Theory анализ 168 реальных ошибок (hard-crash) из TeX Stack Exchange и GitHub. Это позволило создать DocMut — набор из 48 операторов мутации, aware к AST (абстрактному синтаксическому дереву), работающий с тремя форматами. В отличие от случайных правок, эти мутации основаны на реальных паттернах сбоев.

Масштаб эксперимента

Бенчмарк включает 10 437 тестовых случаев, сгенерированных из 743 открытых документов. Были протестированы 7 LLM в режиме zero-shot. Общий объем попыток составил 48 651, а стоимость инференса — около $200.

Ключевые метрики и сравнения

Модели показали разную эффективность в зависимости от формата. Typst оказался значительно сложнее для восстановления, чем LaTeX и Markdown. Ниже приведена сводка результатов по ключевым параметрам:

Параметр Значение / Наблюдение
Сложность DocMut На 5,6–9,2 п.п. сложнее паттерных мутаций
Успех на реальных ошибках 67,0% (88 случаев из реальных крашей)
Разброс успешности (Compile Spread) 27,5 п.п. (от 56,7% до 84,2% у разных моделей)
Изменение текста при успехе 13,6–18,5% ремонтов меняют смысл документа

Вывод для индустрии

Ранжирование моделей по факту успешной компиляции (compile rank) не совпадает с ранжированием по качеству восстановления контента (restoration rank). Модель, показавшая лучший результат по сохранности текста, может иметь худший показатель компиляции. Авторы публикуют таксономию, набор DocMut и все артефакты кампании для сообщества.

Источник: arXiv cs.AI ↗