Суть релиза: энкодеры нового поколения для CPU
Команда LiquidAI опубликовала в Hugging Face две новые модели: LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. В отличие от их предыдущих моделей для поиска (Retrievers), эти энкодеры созданы как универсальные инструменты для классификации, маршрутизации намерений (intent routing), обнаружения PII и проверки политик. Ключевое преимущество — архитектура LFM2, обеспечивающая медленный рост затрат при увеличении длины контекста, что делает их идеальными для работы с длинными документами на обычном процессоре.
Архитектура и обучение
Модели инициализируются из декодеров LFM2.5, но трансформируются в двунаправленные энкодеры за счет:
- Двунаправленной маски внимания: каждый токен видит соседей слева и справа.
- Некаузальных свертков: симметричная обработка контекста.
- Обучения с маскированием: 30% токенов маскируются во время тренировки.
Обучение проходило в два этапа: сначала на коротком контексте (1024 токена) для общей языковой компетенции, затем адаптация к длинному контексту (8192 токена) для усиления фактической и многоязычной точности.
Результаты бенчмарков
Модели демонстрируют выдающиеся результаты для своего размера, превосходя ModernBERT-base и модели EuroBERT. В таблице ниже приведено сравнение скорости инференса на CPU при максимальной длине контекста (8192 токена):
| Модель | Параметры | Время на 1 проход (8192 токена, CPU) | Относительная скорость |
|---|---|---|---|
| ModernBERT-base | ~137M | > 90 секунд | 1x (база) |
| LFM2.5-Encoder-230M | 230M | ~ 28 секунд | ~3.7x быстрее |
| LFM2.5-Encoder-350M | 350M | Информация недостаточна | Информация недостаточна |
На GPU преимущество сохраняется при длине входных данных от 2000 токенов, где LFM2.5-Encoders обгоняют ModernBERT-base. На CPU разрыв колоссален: это позволяет классифицировать целые контракты или транскрипты за секунды на ноутбуке.
Практическое применение
Разработчики могут использовать эти модели для задач, требующих постоянной работы с большими объемами текста:
- Zero-shot маршрутизация: классификация запросов по текстовым описаниям каналов без дообучения.
- Проверка политик: сканирование текста на соответствие внутренним правилам компании.
- Обнаружение PII: поиск и удаление 40 типов персональных данных на 16 языках.
Модели доступны для скачивания и дообучения через библиотеку transformers. Для максимальной эффективности на GPU рекомендуется использовать Flash Attention 2.
Источник: Hugging Face blog ↗
