Исследования7 августа 2026 г., 06:17 МСК🤖 Auto

Ловушка лимита токенов: как искусственно завышают разрыв в рассуждениях между языками

Исследование Ankit Goyal и Jaideep Ray (arXiv:2608.04160) доказывает, что стандартные бенчмарки MGSM искажают результаты из-за жесткого лимита выходных токенов. Разница в точности между родным и переведенным текстом может меняться на 57 пунктов тольк

Баннер новости 5270

Проблема скрытой переменной

Мультиязычные оценки часто сообщают об одной метрике точности при фиксированном лимите выходных токенов (output-token cap). Однако разные языки требуют разного количества токенов для выражения одной и той же мысли. Авторы статьи «Mind the Cap» показывают, что этот лимит является скрытой экспериментальной переменной, которая критически влияет на результаты.

В исследовании использовались модели Qwen3-8B и Llama-3.1-8B-Instruct на датасете Multilingual Grade School Math (MGSM) для трех языков: немецкого, тайского и суахили. Тестировались четыре стратегии промптинга.

Количественные аномалии

Разница в точности (gap) между родным языком и переводом не является константой. При изменении бюджета токенов эта разница может колебаться в широких пределах. Нормализация длины сдвигает показатели еще сильнее, когда лимит становится «узким местом» (binds).

Метрика / Параметр Значение / Эффект
Максимальное колебание разрыва (gap) До 57 пунктов при смене бюджета токенов
Сдвиг разрыва при нормализации длины До 38.9 пунктов (в зонах ограничения лимита)
Эффект на тайском языке (Native vs Announced) Смена объявленного бюджета с 2048 на 128 токенов меняет точность на 5.1 пункта
Точность предсказания пиков (Qwen) Совпадение с реальными пиками на 0.65 пункта; на held-out элементах — 0.92 пункта

Почему это важно для индустрии

Результаты показывают, что при жестких лимитах (например, 1024 токена) точность на родном языке может достигать насыщения, в то время как переведенный текст обрезается. Это создает иллюзию «дефицита рассуждений» у модели для конкретного языка, хотя на деле это артефакт обрезки (truncation artifact).

Авторы предлагают пересмотреть методологию: вместо отчета об одной точке, необходимо рассматривать лимит токенов как независимую переменную и сообщать точность в зависимости от бюджета. Это позволит отличить реальные языковые барьеры от технических ограничений генерации.

Источник: arXiv cs.CL ↗