Исследования14 августа 2026 г., 04:18 МСК🤖 Auto

ODE-Transformer: Прорыв в переводе жестов без роста параметров

Исследователи предложили заменить стандартные обновления в декодерах Transformer на методы численного интегрирования (Runge-Kutta), что повысило точность перевода языка жестов без увеличения размера модели.

Баннер новости 5758

Проблема масштабирования в SLT

Перевод языка жестов (Sign Language Translation, SLT) с помощью архитектур Transformer демонстрирует высокие результаты, однако современные улучшения часто достигаются за счет простого увеличения емкости модели. Это приводит к экспоненциальному росту вычислительных затрат. Авторы работы, опубликованной в arXiv (2608.11352), предлагают параметрически эффективную альтернативу: вместо расширения модели они улучшают динамику обновления латентных представлений в итеративных декодерах.

Математическая суть: от остаточных связей к ODE

Ключевое нововведение заключается в переосмыслении обновлений остаточных связей (residual refinement updates) через призму обыкновенных дифференциальных уравнений (ODE). Вместо стандартных итераций авторы внедрили схемы численного интегрирования более высокого порядка — методы Рунге-Кутты (Runge-Kutta, RK-2 и RK-4). Это позволяет выполнять несколько вычислений функции внутри каждого шага рефайнмента, обеспечивая более точную и стабильную конвергенцию латентного представления перед генерацией текста, не добавляя новых параметров в декодер.

Результаты бенчмарков

Предложенный подход продемонстрировал превосходство над базовой моделью IPSLT на двух ключевых датасетах. Важно отметить, что улучшение качества произошло при использовании меньшего количества слоев декодера и итераций рефайнмента на одном из датасетов, что подтверждает эффективность метода.

Метрика / Датасет Метод RK-2 (предложенный) Базовая модель (IPSLT) Примечание
PHOENIX-2014-T (BLEU-4) 22.96 Ниже предложенного Тестовый набор
CSL-Daily (BLEU-4) 19.34 Ниже предложенного Тестовый набор

Значение для индустрии

Это первое применение ODE-подобной динамики обновлений в задаче перевода языка жестов. Результаты доказывают, что усиление динамики рефайнмента может служить мощной альтернативой традиционному масштабированию моделей. Для разработчиков ассистивных технологий это означает возможность создания более быстрых и легких моделей перевода, работающих на мобильных устройствах, без потери качества синтаксического и семантического соответствия оригинальному жесту.

Контекст публикации

Работа авторов Тугче Кизилтепе (Tuğçe Kızıltepe) и Хасер Ялым Келес (Hacer Yalim Keles) принята к публикации на 14-м Международном семинаре по вспомогательным компьютерным зрению и робототехнике (ACVR 2026), который пройдет в рамках конференции ECCV 2026. Статья доступна на arXiv с 11 августа 2026 года.

Источник: arXiv cs.CL ↗