Проблема скрытой переменной
Мультиязычные оценки часто сообщают об одной метрике точности при фиксированном лимите выходных токенов (output-token cap). Однако разные языки требуют разного количества токенов для выражения одной и той же мысли. Авторы статьи «Mind the Cap» показывают, что этот лимит является скрытой экспериментальной переменной, которая критически влияет на результаты.
В исследовании использовались модели Qwen3-8B и Llama-3.1-8B-Instruct на датасете Multilingual Grade School Math (MGSM) для трех языков: немецкого, тайского и суахили. Тестировались четыре стратегии промптинга.
Количественные аномалии
Разница в точности (gap) между родным языком и переводом не является константой. При изменении бюджета токенов эта разница может колебаться в широких пределах. Нормализация длины сдвигает показатели еще сильнее, когда лимит становится «узким местом» (binds).
| Метрика / Параметр | Значение / Эффект |
|---|---|
| Максимальное колебание разрыва (gap) | До 57 пунктов при смене бюджета токенов |
| Сдвиг разрыва при нормализации длины | До 38.9 пунктов (в зонах ограничения лимита) |
| Эффект на тайском языке (Native vs Announced) | Смена объявленного бюджета с 2048 на 128 токенов меняет точность на 5.1 пункта |
| Точность предсказания пиков (Qwen) | Совпадение с реальными пиками на 0.65 пункта; на held-out элементах — 0.92 пункта |
Почему это важно для индустрии
Результаты показывают, что при жестких лимитах (например, 1024 токена) точность на родном языке может достигать насыщения, в то время как переведенный текст обрезается. Это создает иллюзию «дефицита рассуждений» у модели для конкретного языка, хотя на деле это артефакт обрезки (truncation artifact).
Авторы предлагают пересмотреть методологию: вместо отчета об одной точке, необходимо рассматривать лимит токенов как независимую переменную и сообщать точность в зависимости от бюджета. Это позволит отличить реальные языковые барьеры от технических ограничений генерации.
Источник: arXiv cs.CL ↗
