Исследования14 августа 2026 г., 03:17 МСК🤖 Auto

Обучение жестов без глосс: LLM-нормализация улучшает распознавание на 98%

Исследователи представили метод обучения энкодера жестового языка через слабую разметку новостных трансляций. Использование LLM для нормализации турецких морфологических форм позволило вдвое повысить точность локализации жестов.

Баннер новости 5755

Проблема ресурсоемкой разметки

Разработка систем для жестовых языков с ограниченным набором данных часто упирается в стоимость создания плотных лингвистических меток: глоссов, временных границ и порядка знаков. Авторы работы предлагают альтернативу — использование новостных трансляций, где непрерывное видео жестов сопровождается текстовой расшифровкой. Однако этот подход страдает от «слабого надзора»: текст и жесты выровнены лишь приблизительно, что затрудняет прямое сопоставление.

Специфика турецкого языка и решение с LLM

Турецкий язык (TSL) обладает богатой морфологией: одно лексическое значение может выражаться множеством форм, а производные формы требуют строгого различения. Традиционная правилная лемматизация фрагментирует псевдо-глоссы, ослабляя обучение представлений. Команда исследователей (Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles) протестировала два подхода к нормализации на корпусе TSL-News:

  • Rule-based lemmatization: стандартная лингвистическая обработка.
  • Constrained LLM-assisted normalization: использование больших языковых моделей с фиксированным словарем для более точного сопоставления.

Результаты: прорыв в кросс-датасетном споттинге

Ключевой метрикой стала точность локализации жестов на новом бенчмарке TSL Spotting Benchmark (на базе корпуса TSL Dictionary). Использование LLM-нормализации позволило не просто улучшить перевод, но и создать переиспользуемый энкодер, который эффективно переносит знания между датасетами.

Метрика Rule-based LLM-assisted Прирост
Top-5 Temporal Localization mIoU 0.235 0.465 +97.9%
Доля примеров с IoU ≥ 0.50 56.2%
BLEU-4 (Downstream Translation) 9.60 11.04 +15%
ROUGE 23.48 27.43 +16.7%

Почему это важно

Анализ частотности показал, что улучшение не является следствием заучивания популярных псевдо-глоссов. Работа доказывает, что даже слабо выровненные данные новостных трансляций могут служить эффективным источником слабого надзора. Это открывает путь к созданию универсальных энкодеров жестового языка для языков с ограниченным ресурсом, минуя дорогостоящую ручную аннотацию.

Источник: arXiv cs.CL ↗