Исследования2 сентября 2026 г., 04:17 МСК🤖 Auto

Terminal-Bench-LILT: Почему AI-агенты проваливают не-англоязычный код

Исследователи представили Terminal-Bench-LILT — первый мультиязычный бенчмарк для кодинговых агентов. Тест из 300 задач на 10 языках показал, что даже топовые модели не справляются с локализацией и культурными особенностями.

Баннер новости 6548

Проблема англоцентризма в AI-кодинге

Большинство существующих оценок способностей AI-агентов к программированию проводятся исключительно на английском языке. Это создает ложное представление о реальной эффективности моделей при развертывании в мультиязычных средах. Авторы исследования, опубликованного в arXiv (11 августа 2026 года), подчеркивают, что реальный мир разработки требует учета специфических проблем, не имеющих прямых аналогов в английском коде.

Структура Terminal-Bench-LILT

Новый бенчмарк включает 300 аутентичных задач, сфокусированных на проблемах, специфичных для не-англоязычной разработки. Ключевые категории задач:

  • Интернационализация (i18n) и локализация (l10n).
  • Кодировки текста и нормализация строк.
  • Культурные конвенции и региональные стандарты.

Все задачи написаны носителями языка и прошли многоступенчатую проверку качества. В тест включены 10 языков: арабский, чешский, немецкий, испанский, хинди, японский, корейский, сербский, турецкий и китайский.

Результаты тестирования: разрыв между ожиданиями и реальностью

Авторы протестировали шесть передовых моделей. Результаты показали, что даже самая сильная модель достигла лишь 63.1% успеха (pass rate). Многие задачи остались нерешенными ни одной из протестированных моделей. Важно отметить, что производительность в мультиязычном коде не коррелирует с результатами в стандартных англоязычных бенчмарках, что выделяет мультиязычную компетентность как отдельную, недооцененную ось способностей.

длинных слов, падежи
Язык Особенности задач Сложность для AI
Арабский / Китайский Направление письма, иероглифика Высокая (специфичные кодировки)
Немецкий / Испанский Средняя/Высокая
Японский / Корейский Смешанные скрипты, вежливость Высокая (культурный контекст)
Хинди / Турецкий Транслитерация, специфичные символы Средняя

Почему это важно для индустрии

Результаты Terminal-Bench-LILT сигнализируют о том, что текущие AI-ассистенты для разработчиков (такие как Copilot, Cursor и другие) могут быть ненадежными при работе с локальными рынками. Ошибка в кодировке или игнорирование культурных норм в интерфейсе может привести к критическим сбоям в продуктах, ориентированных на не-англоязычную аудиторию. Исследование требует от разработчиков AI пересмотреть подходы к обучению на мультиязычных данных, выходящих за рамки простого перевода.

Источник: arXiv cs.CL ↗