Проблема разрыва в точности
На бенчмарке EyeBench наблюдается существенный разрыв в эффективности моделей: текстово-ориентированные модели, использующие предварительно обученные языковые модели (PLM), достигают AUROC 56–63%, тогда как модели, опирающиеся только на данные о взгляде (gaze-only), работают на уровне случайного угадывания. Авторы работы LEXIC (Lightweight Eye-tracking eXtension via Injected Complexity) поставили задачу: насколько можно улучшить gaze-only модель, используя легкие, не зависящие от языковых моделей, условия.
Архитектура LEXIC: два подхода к интеграции
Работа базируется на базовой модели EyeBench AhnCNN (LEXIC-Base). Исследователи предложили два механизма внедрения трех предвычисленных сигналов сложности на уровне слов: сюрпризальности GPT-2, частотности слова и длины слова.
- LEXIC-Concat: Прямое конкатенирование (соединение) сигналов сложности с входными данными фиксации взгляда.
- LEXIC-Res: Остаточный механизм, где небольшая головка (head) предсказывает типичную реакцию взгляда читателя, а энкодер_conditioned_ на отклонении от этого предсказания.
Результаты на задаче OneStop
Эксперименты проводились на задаче чтения OneStop с использованием ансамбля из K=5 семян по десяти фолдам. Оба механизма показали статистически значимые приросты AUROC на невидимых текстах (Unseen Text):
| Модель | Метрика | Прирост AUROC | Статистическая значимость (p-value) |
|---|---|---|---|
| LEXIC-Concat | Unseen Text | +1.8 – +2.2 п.п. | p ≤ 0.065 |
| LEXIC-Res | Unseen Text | +1.8 – +2.2 п.п. | p ≤ 0.065 |
| LEXIC-Concat | Unseen Reader | +2.9 п.п. | p = 0.010 |
| LEXIC-Res | Unseen Reader | +1.8 п.п. | p = 0.19 |
Почему это важно
Результаты демонстрируют, что даже легкие, не требующие вычислений LLM методы могут существенно повысить точность анализа поведения читателя. Однако авторы отмечают архитектурное ограничение LEXIC-Res: головка предсказания калибруется на обучающих читателях, что приводит к неполной передаче знаний на читателей из распределения вне обучения (out-of-distribution readers), что видно по менее значимому результату на Unseen Reader (p=0.19). Работа принята к публикации на конференции APCCAS 2026.
Источник: arXiv cs.CL ↗
