Проблема: дефицит данных для научного ИИ
Автоматический перевод математических выражений из научной литературы в исполняемый символьный код (Formula Formalization) сталкивается с критическим дефицитом качественных датасетов. Существующие инструменты не справляются со сложной структурой специализированных текстов, что тормозит развитие NLP-моделей для точных наук.
Решение: архитектура MioGatto и новые возможности
Команда во главе с Николя Сибюе (Nicolas Sibuet) из Университета Падуи представила MioFFAn — документ-центричный фреймворк, построенный на базе архитектуры MioGatto. Ключевые нововведения включают:
- Выбор уравнений: Инструмент позволяет выделять конкретные формулы из сложного текста.
- Автоматизация через LLM: Встроенные модули используют большие языковые модели для предварительной спецификации символьного кода.
- Гибкая таксономия: Пользователи могут настраивать свойства символов и операторов под любую научную дисциплину.
Методология Human-in-the-Loop
MioFFAn не заменяет человека, а усиливает его. Система предлагает модульный набор автоматизированных подзадач со строгими форматами вывода. Это позволяет исследователям:
- Получать черновик формализации от LLM.
- Исправлять ошибки вручную в интерфейсе.
- Использовать полученные данные для оценки и улучшения стратегий автоматизации через стандартные NLP-метрики.
Значение для индустрии
Работа представлена на 3rd International Workshop on Natural Scientific Language Processing (NSLP 2026) в рамках LREC2026. Публикация открывает путь к созданию специализированных датасетов, необходимых для обучения моделей, способных работать с формулами в физике, химии и инженерии. Фреймворк полностью открыт, что стимулирует развитие сообщества scientific AI.
Источник: arXiv cs.CL ↗
