Исследования22 июля 2026 г., 06:16 МСК🤖 Auto

Символьная аугментация: как победить слепоту нейросетей к единицам измерения

Исследователь Genpei Zhang представил метод Symbolic Augmentation, повышающий точность проверки фактов в научных текстах с 36.5% до 98.2% на задачах эквивалентности величин.

Баннер новости 4098

Проблема: «слепота» к канонически эквивалентным данным

Большие языковые модели (LLM) часто галлюцинируют при работе с числами и единицами измерения, что может привести к инверсии научных утверждений. Авторы исследования выявили критический недостаток современных нейросетевых проверщиков фактов: они не способны распознать, что физические величины остаются неизменными при изменении их представления. Например, модель не видит разницы между 95°C и 368.15 K, считая их разными сущностями, что приводит к катастрофическому падению точности.

Методология: таксономия ошибок и бенчмарк

Для решения проблемы авторы переформулировали задачу как типизированную верификацию. Был создан бенчмарк из 1500 примеров, переписанных из источников PMC и arXiv. Аннотация проводилась двумя независимыми LLM с последующей арбитражной проверкой, что обеспечило высокий уровень согласованности (Krippendorff's alpha = 0.882). Была введена таксономия из пяти классов ошибок, связанных с количественными данными.

Результаты: разрыв между базовой моделью и улучшенной версией

Базовая модель ModernBERT, дообученная на исходном бенчмарке, показала хорошие результаты в целом, но провалила тест на эквивалентность. Применение метода Symbolic Augmentation (символьной аугментации) позволило обойти этот барьер. Метод использует модули символьного верификатора в обратном порядке для генерации обучающих данных, сохраняющих метки, но меняющих синтаксис.

Метрика / Модель Базовая ModernBERT ModernBERT + Symbolic Augmentation
Macro-F1 (внутри дистрибутива) 0.899 0.902
Точность на канонически эквивалентных переписях 36.5% 98.2%
SciFact-Open (binary macro-F1) 0.791 0.828

Почему это важно

Результаты показывают, что символьная аугментация не только закрывает «слепое пятно» нейросетей, но и позволяет дообученному энкодеру соответствовать закрытым LLM без дополнительных затрат на инференс. Исследование также выявило важные ограничения: использование символьных признаков в качестве вспомогательных входных данных не дало прироста, а добавление шума в учительские метки негативно сказалось на масштабируемости. Это подтверждает, что интеграция символьных и обучаемых компонентов должна происходить именно на этапе аугментации данных.

Источник: arXiv cs.AI ↗