Проблема англоцентризма в AI-кодинге
Большинство существующих оценок способностей AI-агентов к программированию проводятся исключительно на английском языке. Это создает ложное представление о реальной эффективности моделей при развертывании в мультиязычных средах. Авторы исследования, опубликованного в arXiv (11 августа 2026 года), подчеркивают, что реальный мир разработки требует учета специфических проблем, не имеющих прямых аналогов в английском коде.
Структура Terminal-Bench-LILT
Новый бенчмарк включает 300 аутентичных задач, сфокусированных на проблемах, специфичных для не-англоязычной разработки. Ключевые категории задач:
- Интернационализация (i18n) и локализация (l10n).
- Кодировки текста и нормализация строк.
- Культурные конвенции и региональные стандарты.
Все задачи написаны носителями языка и прошли многоступенчатую проверку качества. В тест включены 10 языков: арабский, чешский, немецкий, испанский, хинди, японский, корейский, сербский, турецкий и китайский.
Результаты тестирования: разрыв между ожиданиями и реальностью
Авторы протестировали шесть передовых моделей. Результаты показали, что даже самая сильная модель достигла лишь 63.1% успеха (pass rate). Многие задачи остались нерешенными ни одной из протестированных моделей. Важно отметить, что производительность в мультиязычном коде не коррелирует с результатами в стандартных англоязычных бенчмарках, что выделяет мультиязычную компетентность как отдельную, недооцененную ось способностей.
| Язык | Особенности задач | Сложность для AI |
|---|---|---|
| Арабский / Китайский | Направление письма, иероглифика | Высокая (специфичные кодировки) |
| Немецкий / Испанский | длинных слов, падежиСредняя/Высокая | |
| Японский / Корейский | Смешанные скрипты, вежливость | Высокая (культурный контекст) |
| Хинди / Турецкий | Транслитерация, специфичные символы | Средняя |
Почему это важно для индустрии
Результаты Terminal-Bench-LILT сигнализируют о том, что текущие AI-ассистенты для разработчиков (такие как Copilot, Cursor и другие) могут быть ненадежными при работе с локальными рынками. Ошибка в кодировке или игнорирование культурных норм в интерфейсе может привести к критическим сбоям в продуктах, ориентированных на не-англоязычную аудиторию. Исследование требует от разработчиков AI пересмотреть подходы к обучению на мультиязычных данных, выходящих за рамки простого перевода.
Источник: arXiv cs.CL ↗
