Исследования1 июля 2026 г., 00:15 МСК🤖 Auto

SEATauBench: Почему AI-агенты проваливаются на языках Юго-Восточной Азии

Исследователи представили SEATauBench — первый бенчмарк для оценки AI-агентов на пяти языках Юго-Восточной Азии. Тест показал, что перевод интерфейса не спасает от падения качества при локализации сложных задач.

Баннер новости 2626

Проблема суверенного ИИ в Азии

Развитие искусственного интеллекта в Юго-Восточной Азии (SEA) растет, но способность языковых моделей выполнять сложные задачи с использованием инструментов (tool-use) в региональных языках остается «черным ящиком». Для обеспечения технологического суверенитета региона необходимо понимать, насколько надежны агенты за пределами английского языка. Авторы работы — My Chiffon Nguyen, Aulia Adila и коллеги —填补или этот пробел, создав SEATauBench.

Методология: Адаптация TauBench

Новый фреймворк адаптирует известный бенчмарк TauBench под пять языков: мандаринский, вьетнамский, тайский, индонезийский и филиппинский. Ключевая особенность исследования — оценка агентов в прогрессивно локализованных условиях. Авторы варьируют язык взаимодействия пользователя с агентом, спецификации инструментов и домены задач, чтобы изолировать влияние языка на разные этапы работы агента.

Ключевые результаты: Разрыв между интерфейсом и логикой

Исследование выявило критическую проблему: способность агента работать на английском языке не гарантирует его эффективность на родных языках. Качество и устойчивость резко падают, когда локализация затрагивает не только диалог, но и контекст задачи. Ниже представлены результаты тестирования трех современных моделей в разных сценариях:

Сценарий локализации Описание условия Наблюдаемый эффект
Частичная локализация Изменен только язык общения (User-Agent) Английские навыки агента переносятся относительно хорошо
Полная адаптация домена Локализованы язык, инструменты и контекст задачи Резкое падение качества и робастности (наибольшие потери)
Оценка на английском Стандартные метрики для англоязычных агентов Не отражают реальные ограничения агентов в SEA-языках

Почему это важно

Результаты SEATauBench доказывают, что текущие методы оценки, основанные исключительно на английском языке, некорректно измеряют возможности агентов для азиатских рынков. Простого перевода интерфейса недостаточно для создания надежных мультиязычных систем. SEATauBench предоставляет не только диагностический инструмент, но и воспроизводимый пайплайн адаптации, необходимый для построения суверенных AI-решений в лингвистически разнообразных регионах.

  • Языки: Мандаринский, Вьетнамский, Тайский, Индонезийский, Филиппинский.
  • Основание: Адаптация фреймворка TauBench.
  • Вывод: Локализация домена критически снижает эффективность агентов по сравнению с простой сменой языка диалога.

Источник: arXiv cs.CL ↗