Проблема ресурсоемкой разметки
Разработка систем для жестовых языков с ограниченным набором данных часто упирается в стоимость создания плотных лингвистических меток: глоссов, временных границ и порядка знаков. Авторы работы предлагают альтернативу — использование новостных трансляций, где непрерывное видео жестов сопровождается текстовой расшифровкой. Однако этот подход страдает от «слабого надзора»: текст и жесты выровнены лишь приблизительно, что затрудняет прямое сопоставление.
Специфика турецкого языка и решение с LLM
Турецкий язык (TSL) обладает богатой морфологией: одно лексическое значение может выражаться множеством форм, а производные формы требуют строгого различения. Традиционная правилная лемматизация фрагментирует псевдо-глоссы, ослабляя обучение представлений. Команда исследователей (Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles) протестировала два подхода к нормализации на корпусе TSL-News:
- Rule-based lemmatization: стандартная лингвистическая обработка.
- Constrained LLM-assisted normalization: использование больших языковых моделей с фиксированным словарем для более точного сопоставления.
Результаты: прорыв в кросс-датасетном споттинге
Ключевой метрикой стала точность локализации жестов на новом бенчмарке TSL Spotting Benchmark (на базе корпуса TSL Dictionary). Использование LLM-нормализации позволило не просто улучшить перевод, но и создать переиспользуемый энкодер, который эффективно переносит знания между датасетами.
| Метрика | Rule-based | LLM-assisted | Прирост |
|---|---|---|---|
| Top-5 Temporal Localization mIoU | 0.235 | 0.465 | +97.9% |
| Доля примеров с IoU ≥ 0.50 | — | 56.2% | — |
| BLEU-4 (Downstream Translation) | 9.60 | 11.04 | +15% |
| ROUGE | 23.48 | 27.43 | +16.7% |
Почему это важно
Анализ частотности показал, что улучшение не является следствием заучивания популярных псевдо-глоссов. Работа доказывает, что даже слабо выровненные данные новостных трансляций могут служить эффективным источником слабого надзора. Это открывает путь к созданию универсальных энкодеров жестового языка для языков с ограниченным ресурсом, минуя дорогостоящую ручную аннотацию.
Источник: arXiv cs.CL ↗
