Проблема: «слепота» к канонически эквивалентным данным
Большие языковые модели (LLM) часто галлюцинируют при работе с числами и единицами измерения, что может привести к инверсии научных утверждений. Авторы исследования выявили критический недостаток современных нейросетевых проверщиков фактов: они не способны распознать, что физические величины остаются неизменными при изменении их представления. Например, модель не видит разницы между 95°C и 368.15 K, считая их разными сущностями, что приводит к катастрофическому падению точности.
Методология: таксономия ошибок и бенчмарк
Для решения проблемы авторы переформулировали задачу как типизированную верификацию. Был создан бенчмарк из 1500 примеров, переписанных из источников PMC и arXiv. Аннотация проводилась двумя независимыми LLM с последующей арбитражной проверкой, что обеспечило высокий уровень согласованности (Krippendorff's alpha = 0.882). Была введена таксономия из пяти классов ошибок, связанных с количественными данными.
Результаты: разрыв между базовой моделью и улучшенной версией
Базовая модель ModernBERT, дообученная на исходном бенчмарке, показала хорошие результаты в целом, но провалила тест на эквивалентность. Применение метода Symbolic Augmentation (символьной аугментации) позволило обойти этот барьер. Метод использует модули символьного верификатора в обратном порядке для генерации обучающих данных, сохраняющих метки, но меняющих синтаксис.
| Метрика / Модель | Базовая ModernBERT | ModernBERT + Symbolic Augmentation |
|---|---|---|
| Macro-F1 (внутри дистрибутива) | 0.899 | 0.902 |
| Точность на канонически эквивалентных переписях | 36.5% | 98.2% |
| SciFact-Open (binary macro-F1) | 0.791 | 0.828 |
Почему это важно
Результаты показывают, что символьная аугментация не только закрывает «слепое пятно» нейросетей, но и позволяет дообученному энкодеру соответствовать закрытым LLM без дополнительных затрат на инференс. Исследование также выявило важные ограничения: использование символьных признаков в качестве вспомогательных входных данных не дало прироста, а добавление шума в учительские метки негативно сказалось на масштабируемости. Это подтверждает, что интеграция символьных и обучаемых компонентов должна происходить именно на этапе аугментации данных.
Источник: arXiv cs.AI ↗
