От декодера к энкодеру: архитектура и конвертация
Компания Liquid AI представила две новые модели с открытыми весами: LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. В отличие от традиционных подходов, эти энкодеры не обучались с нуля. Они получены путем конвертации декодеров LFM2.5 с применением трех ключевых изменений:
- Двунаправленная маска внимания: замена причинной маски на полную, позволяющую каждому токену учитывать контекст слева и справа.
- Непричинные свертки: использование симметричной центральной-padding для коротких сверток LFM2, что расширяет локальный контекст.
- Masked Language Modeling (MLM): обучение с маской 30% (плотнее, чем 15% у BERT), что улучшает качество представлений на малых масштабах.
Модели базируются на гибридном бэкбоне LFM2, имеют скрытое пространство размером 1024, словарь из 65 536 токенов и поддерживают 15 языков. Лицензия — LFM Open License v1.0.
Бенчмарки: точность против размера
Оценка проводилась на 17 задачах из GLUE, SuperGLUE и мультиязычной классификации. Модели полностью дообучались (fine-tune) под каждую задачу. LFM2.5-Encoder-350M занял 4-е место среди 14 моделей, уступая только более крупным аналогам (XLM-R XL, ModernBERT-large, XLM-R large). При этом он значительно превосходит ModernBERT-base и все модели EuroBERT.
| Модель | Параметры | Средний балл (17 задач) | Ранг |
|---|---|---|---|
| XLM-R XL | 3.5B | 83.06 | 1 |
| ModernBERT-large | 395M | 81.68 | 2 |
| XLM-R large | 560M | 81.34 | 3 |
| LFM2.5-Encoder-350M | 350M | 81.02 | 4 |
| LFM2.5-Encoder-230M | 230M | 79.29 | 6 |
| ModernBERT-base | 137M | 78.19 | 7 |
Скорость на CPU: главное преимущество
Ключевая ценность этих моделей — эффективность на процессорах. В отличие от GPU-зависимых решений, LFM2.5-Encoder оптимизирован для сред без графических ускорителей. При длине контекста 8192 токенов (эквивалент 13–15 страниц текста) время одного прямого прохода (forward pass) на CPU составляет:
- ~28 секунд для LFM2.5-Encoder-230M.
- Более 90 секунд для ModernBERT-base (при сопоставимой или меньшей точности).
Это делает модели идеальными для edge-устройств, промышленных контроллеров и систем, где задержка или стоимость облачного вызова недопустимы.
Сценарии использования
Разработчики выделяют три основных направления применения:
- Edge и embedded-устройства: автономные системы (автономные автомобили, IoT), не имеющие GPU.
- Регулируемые отрасли: финансы, медицина и юриспруденция, где документы (контракты, медкарты) чувствительны и не могут покидать периметр инфраструктуры.
- Высоконагруженные пайплайны: использование легких энкодеров как дешевого первого фильтра перед более тяжелыми моделями.
Для демонстрации возможностей Liquid AI опубликовала демо на Hugging Face Spaces, включающие детекцию PII (40 типов данных на 16 языках), проверку политик и spell-checking. Код методологии оценки доступен под лицензией Apache-2.0.
Бенчмарки
| Бенчмарк | LFM2.5-Encoder-350M | EuroBERT-2.1B | EuroBERT-610M | LFM2.5-Encoder-230M | ModernBERT-base | ModernBERT-large | XLM-R XL | XLM-R large |
|---|---|---|---|---|---|---|---|---|
| GLUE/SuperGLUE Mean (17 tasks) | 81.02% | — | — | — | — | 81.68% | 83.06% | 81.34% |
| GLUE/SuperGLUE Mean (17 tasks) | — | 72.19% | 75.87% | 79.29% | 78.19% | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
