Проблема стандартизации данных
Генерация структурированных отчетов об отключениях электроэнергии (power outage reports) — сложная задача для языковых моделей. Исходные данные часто гетерогенны и требуют преобразования в стандартизированный формат XML, соответствующий спецификации CIM IEC 61968-3. Традиционное обучение с учителем (Maximum Likelihood Estimation) часто не справляется с этой задачей, так как оптимизирует токены по отдельности, а не качество всей последовательности.
Решение: Minimum Risk Training (MRT)
Авторы исследования применили метод Minimum Risk Training (MRT), который позволяет нейронным сетям напрямую оптимизировать метрики уровня последовательности (sequence-level), а не только вероятности отдельных токенов. Этот подход, известный уже около десятилетия, вновь обрел актуальность в контексте современных больших языковых моделей (LLM). MRT позволяет модели «понимать» глобальные ошибки и корректировать их на этапе генерации всего отчета.
Результаты на базе Qwen2.5-7B-Instruct
Эксперименты проводились на датасете Outage Data Initiative Nationwide (ODIN). Ключевым результатом стало значительное улучшение точности (accuracy) модели Qwen2.5-7B-Instruct. Применение MRT позволило преодолеть барьер низкой точности, характерный для малых языковых моделей (Small Language Models) в узкоспециализированных задачах.
| Метрика | До применения MRT | После применения MRT | Прирост |
|---|---|---|---|
| Overall Accuracy (Точность) | 16.20% | 68.95% | +52.75 п.п. |
| Модель | Qwen2.5-7B-Instruct | ||
| Формат вывода | XML (CIM IEC 61968-3) | ||
Почему это важно
Результат демонстрирует, что даже компактные модели (7B параметров) могут достигать высокой эффективности в задачах структурированной генерации при правильном выборе функции потерь. Это открывает путь к развертыванию более дешевых и быстрых решений для критической инфраструктуры, где важна точность и соответствие стандартам, без необходимости использования гигантских моделей.
Источник: arXiv cs.AI ↗
