Проблема масштабирования в SLT
Перевод языка жестов (Sign Language Translation, SLT) с помощью архитектур Transformer демонстрирует высокие результаты, однако современные улучшения часто достигаются за счет простого увеличения емкости модели. Это приводит к экспоненциальному росту вычислительных затрат. Авторы работы, опубликованной в arXiv (2608.11352), предлагают параметрически эффективную альтернативу: вместо расширения модели они улучшают динамику обновления латентных представлений в итеративных декодерах.
Математическая суть: от остаточных связей к ODE
Ключевое нововведение заключается в переосмыслении обновлений остаточных связей (residual refinement updates) через призму обыкновенных дифференциальных уравнений (ODE). Вместо стандартных итераций авторы внедрили схемы численного интегрирования более высокого порядка — методы Рунге-Кутты (Runge-Kutta, RK-2 и RK-4). Это позволяет выполнять несколько вычислений функции внутри каждого шага рефайнмента, обеспечивая более точную и стабильную конвергенцию латентного представления перед генерацией текста, не добавляя новых параметров в декодер.
Результаты бенчмарков
Предложенный подход продемонстрировал превосходство над базовой моделью IPSLT на двух ключевых датасетах. Важно отметить, что улучшение качества произошло при использовании меньшего количества слоев декодера и итераций рефайнмента на одном из датасетов, что подтверждает эффективность метода.
| Метрика / Датасет | Метод RK-2 (предложенный) | Базовая модель (IPSLT) | Примечание |
|---|---|---|---|
| PHOENIX-2014-T (BLEU-4) | 22.96 | Ниже предложенного | Тестовый набор |
| CSL-Daily (BLEU-4) | 19.34 | Ниже предложенного | Тестовый набор |
Значение для индустрии
Это первое применение ODE-подобной динамики обновлений в задаче перевода языка жестов. Результаты доказывают, что усиление динамики рефайнмента может служить мощной альтернативой традиционному масштабированию моделей. Для разработчиков ассистивных технологий это означает возможность создания более быстрых и легких моделей перевода, работающих на мобильных устройствах, без потери качества синтаксического и семантического соответствия оригинальному жесту.
Контекст публикации
Работа авторов Тугче Кизилтепе (Tuğçe Kızıltepe) и Хасер Ялым Келес (Hacer Yalim Keles) принята к публикации на 14-м Международном семинаре по вспомогательным компьютерным зрению и робототехнике (ACVR 2026), который пройдет в рамках конференции ECCV 2026. Статья доступна на arXiv с 11 августа 2026 года.
Источник: arXiv cs.CL ↗
