Исследования29 сентября 2026 г., 08:20 МСК🤖 Auto

Бирманский налог: почему AI-модели «съедают» текст на мьянманском в 11 раз дороже английского

Исследование показало, что использование мьянманского языка в LLM обходится пользователям в 4.7–11.7 раз дороже английского. Это критически снижает скорость ответов, увеличивает счета за API и сокращает контекстное окно моделей.

Баннер новости 8484

Суть проблемы: «Бирманский налог»

Автор исследования провел бенчмарк 17 различных токенизаторов (от GPT-4o до Llama 3 и Claude Opus 5), анализируя 1 012 предложений из датасета FLORES-200. Ключевой метрикой стал коэффициент «бирманского налога» — отношение количества токенов, необходимых для обработки текста на мьянманском, к количеству токенов для того же текста на английском.

Результаты шокируют: за слово မြန်မာ («Мьянма») в GPT-4 модель берет 12 токенов, тогда как английское «Myanmar» — всего 1. В среднем, мьянманский язык требует в 4.7 раза больше токенов, чем английский. В худших случаях (зависит от модели) этот разрыв достигает 11.7x.

Почему это происходит?

Проблема кроется в архитектуре токенизаторов. Большинство моделей обучались на данных, состоящих преимущественно из английского языка, кода и нескольких крупных языков. Редкие скрипты, такие как бирманский, не имеют достаточного словаря. Токенизатор вынужден разбивать текст на мелкие фрагменты, вплоть до отдельных байтов. Поскольку символ мьянманского алфавита занимает 3 байта в UTF-8, при падении в режим байтового кодирования стоимость обработки текста взлетает многократно.

Практические последствия для пользователей

Высокая стоимость токенов влияет на три ключевых параметра работы с AI:

  • Цена: API-провайдеры взимают оплату за каждый токен. Запрос на мьянманском будет стоить в 5–12 раз дороже аналогичного запроса на английском.
  • Скорость: Модели генерируют текст по одному токену за раз. Больше токенов на предложение = медленнее ответ.
  • Контекст: Ограничение контекстного окна (например, 128K токенов) быстро исчерпывается. Для модели Llama 3 окно в 128K токенов вмещает ~4 766 английских предложений, но только 408 мьянманских. Эффективная память модели для бирманского языка становится в 10 раз меньше.

Сравнение с другими азиатскими языками

Мьянманский язык оказался самым «дорогим» среди протестированных азиатских языков. Даже тайский язык, имеющий схожие особенности (отсутствие пробелов между словами), обрабатывается значительно дешевле. Ниже приведена медианная стоимость токенов относительно английского (1x) для разных языков:

Язык Медианный коэффициент (отношение к английскому) Примечание
Мьянманский (Burmese) 4.7x Самый дорогой, в 5 случаях из 10 — лидер по «налогу»
Тайский (Thai) 2.3x В 2 раза дешевле мьянманского
Хинди (Hindi) 2.3x В 2 раза дешевле мьянманского
Вьетнамский (Vietnamese) 1.5x В 3 раза дешевле мьянманского
Китайский (Chinese) 1.2x В 4 раза дешевле мьянманского

Важные технические инсайты

В ходе исследования были выявлены неожиданные факты о текущем состоянии моделей:

  • OpenAI не обновляла токенизатор: Модели GPT-5, GPT-5.5 и GPT-6 Sol используют тот же токенизатор o200k, что и GPT-4o. Количество токенов для всех языков, включая мьянманский, идентично.
  • Google объединила токенизаторы: Gemini 2.5 Flash, Gemini 3.8 Flash и открытая модель Gemma 3 используют один и тот же токенизатор. Именно эта связка показала себя как лучшая среди чат-моделей для обработки мьянманского языка, хотя и не решила проблему полностью.

Исследование подчеркивает системное неравенство в обработке языков с редкими скриптами, заставляя пользователей платить премию за использование родного языка в современных AI-инструментах.

Источник: Towards AI pub ↗