Новый подход к обучению представлений
Команда из ALMAnaCH (You Zuo, Éric de la Clergerie, Benoît Sagot) представила метод SciJEPA, который решает проблему обучения представлений научных документов без использования внешних графов цитирования. Вместо этого модель опирается на внутреннюю дискурсивную структуру статьи, применяя асимметричное внутридокументное предиктивное обучение.
Суть метода заключается в цепочке предсказаний: представления заголовка и аннотации (title & abstract) используются для предсказания представлений раздела «Методы» (methods), а представления методов, в свою очередь, применяются для предсказания выводов (conclusions). Это позволяет модели усваивать логическую связь между частями текста, не требуя данных о цитировании извне.
Роль регуляризации SIGReg
Исследование показало, что простое предиктивное обучение уступает контролируемой контрастной выборке. Однако внедрение Sliced Isotropic Gaussian Regularization (SIGReg) существенно улучшает результаты, сужая разрыв с базовыми моделями. Эффект регуляризации зависит от задачи: умеренная SIGReg помогает в тонкой ранжировке, тогда как сильная регуляризация может ослабить локальное выравнивание.
Результаты на бенчмарках
Модель протестирована на наборах данных RELISH, SciDocs, а также задачах high-influence citation и предсказания цитирования. Ниже приведено сравнение эффективности подходов:
| Метод | Ключевая особенность | Результат/Наблюдение |
|---|---|---|
| Plain Predictive | Асимметричное предсказание без доп. ограничений | Жизнеспособно, но слабее контрастных базовых линий |
| Contrastive Baseline | Контролируемая контрастная выборка | Высокая точность, эталон для сравнения |
| SciJEPA + SIGReg | Предиктивное обучение + Sliced Isotropic Gaussian Regularization | Существенное улучшение, сужение разрыва с контрастными методами |
Значение для научного поиска
Работа демонстрирует, что внутридокументное предиктивное обучение является перспективной альтернативой для репрезентации научных документов, особенно в сценариях, где доступ к графам цитирования ограничен. Ключевым выводом авторов является необходимость тщательного контроля геометрии вложений (embeddings) для достижения оптимальных результатов.
Источник: arXiv cs.CL ↗
