Разрушение «токенового потолка»
Команда исследователей во главе с Калани Марате из Meta AI представила масштабное исследование, доказывающее преимущество байтовых моделей над токеновыми при масштабировании. Традиционно малые модели (Small Language Models, SLM) улучшают через дистилляцию от больших аналогов, но новые данные показывают: байтовые модели (работающие с сырыми байтами, а не токенами) имеют более высокий потолок производительности. Авторы ввели два метода конвертации логитов: Marginalize-It (приближенный) и End-Of-Token (точный).
Ключевые метрики и сравнения
В эксперименте сравнивались модели объемом ~1 млрд параметров, обученные на данных до 1 триллиона байт. Несмотря на то, что токеновые модели (Token-1B) лидировали в низкозатратном режиме, байтовые модели (End-Of-Token-1B) обогнали их при увеличении вычислений. Они достигают той же точности, используя всего 1/6 часть данных по сравнению с токеновыми аналогами.
| Метрика / Модель | Результат / Характеристика |
|---|---|
| Эффективность данных | End-Of-Token-1B требует в 6 раз меньше данных для достижения уровня Token-1B |
| Стоимость хранения | Снижение затрат на хранение логитов до ~1/5 (из-за словаря в 256 байт против ~100K токенов) |
| Прогноз точности (асимптотика) | End-Of-Token-1B превосходит Token-1B на 4% по средней ошибке top-1 |
| Сравнение с Llama 3.2-1B | Прогнозируемое улучшение на 6.5% на усредненных задачах |
| Сравнение с Gemma-3-1B-pt | Прогнозируемое улучшение на 8.1% |
| Сравнение с Gemma 2B | Прогнозируемое улучшение на 2.1% |
Почему это важно для индустрии
Использование словаря всего в 256 байт вместо десятков тысяч токенов решает проблему усечения top-k при выгрузке логитов (logit dumping). Это не только упрощает архитектуру, но и кратно снижает требования к памяти. Исследование предсказывает, что дистиллированные байтовые модели 1B-класса могут превзойти такие популярные решения, как Llama 3.2-1B и Gemma-3-1B-pt, что открывает путь к созданию более эффективных и дешевых в развертывании edge-решений.
Источник: arXiv cs.CL ↗
