Проблема скрытых издержек токенизации
Традиционно алгоритмы токенизации (например, BPE) сравниваются в рамках одних и тех же границ текста, что скрывает реальную цену зафиксированных границ разбиения. Авторы работы "The Price of Token Boundaries" предлагают новый метод оценки: они измеряют минимальное количество токенов, необходимое для представления текста, как с правилом границ регулярных выражений, так и без него. Это позволяет изолировать затраты на сжатие от качества предсказания.
Ключевые метрики на English Wikipedia
Эксперименты показали, что наличие строгих границ токенов критически влияет на эффективность кодирования. На корпусе English Wikipedia введение границ увеличило оптимальное количество токенов на 28,3–36,8%. Это означает, что модели, игнорирующие эти ограничения, теоретически могут работать значительно эффективнее.
| Метрика / Модель | Значение | Примечание |
|---|---|---|
| Рост кол-ва токенов из-за границ | +28,3% – 36,8% | На корпусе English Wikipedia |
| Byte Pair Encoding (BPE) vs. Ограниченный нижний предел | +2,1% | Показывает высокую эффективность BPE при наличии границ |
| Byte Pair Encoding (BPE) vs. Неограниченный предел | +10,9% | Разрыв между текущим стандартом и теоретическим оптимумом без границ |
Конфликт целей: Сжатие против Предсказания
Исследование выявило фундаментальное противоречие: словари, оптимальные для сжатия, и словари, оптимальные для предсказания, различаются. При использовании 85 млн не-эмбеддинговых параметров и сопоставимых бюджетов токенов для обучения, "неограниченное" (unrestricted) подгонка словаря приводила к более высокому среднему количеству бит на байт (bits per byte) на тестовой выборке.
Этот эффект наблюдался во всех 12 языках в парном исследовании и в 11 из 12 при независимой настройке. То есть, отказ от жестких границ улучшает сжатие, но может ухудшить способность модели предсказывать следующий токен, если не перестроить архитектуру декодера.
Решение: Лицензии границ (Boundary Licences)
Для поиска компромисса авторы ввели концепцию "лицензий границ" (boundary licences) — механизм, ограничивающий количество записей в словаре, которым разрешено пересекать границы. Эксперименты на корпусах на английском и китайском языках показали высокую эффективность этого подхода:
- Английский корпус: Лицензирование всего 10% бюджета словаря позволило восстановить 85,2% от сокращения количества токенов, достигнутого при полном удалении границ.
- Китайский корпус: Тот же 10% лимит восстановил 100,0% потенциального улучшения сжатия.
Эти результаты демонстрируют, что минимальные изменения в правилах токенизации могут вернуть большую часть выгоды от отказа от жестких границ, открывая путь к более эффективным моделям обработки естественного языка.
Источник: arXiv cs.AI ↗
