Релиз модели28 июля 2026 г., 18:17 МСК🤖 Auto

LiquidAI выпустила LFM2.5-Encoders: быстрые модели для CPU

LiquidAI представила два новых энкодера (230M и 350M параметров) с контекстом 8192 токенов. Они работают в 3.7 раза быстрее ModernBERT на CPU, сохраняя высокую точность.

Баннер новости 4554

Суть релиза: энкодеры нового поколения для CPU

Команда LiquidAI опубликовала в Hugging Face две новые модели: LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. В отличие от их предыдущих моделей для поиска (Retrievers), эти энкодеры созданы как универсальные инструменты для классификации, маршрутизации намерений (intent routing), обнаружения PII и проверки политик. Ключевое преимущество — архитектура LFM2, обеспечивающая медленный рост затрат при увеличении длины контекста, что делает их идеальными для работы с длинными документами на обычном процессоре.

Архитектура и обучение

Модели инициализируются из декодеров LFM2.5, но трансформируются в двунаправленные энкодеры за счет:

  • Двунаправленной маски внимания: каждый токен видит соседей слева и справа.
  • Некаузальных свертков: симметричная обработка контекста.
  • Обучения с маскированием: 30% токенов маскируются во время тренировки.

Обучение проходило в два этапа: сначала на коротком контексте (1024 токена) для общей языковой компетенции, затем адаптация к длинному контексту (8192 токена) для усиления фактической и многоязычной точности.

Результаты бенчмарков

Модели демонстрируют выдающиеся результаты для своего размера, превосходя ModernBERT-base и модели EuroBERT. В таблице ниже приведено сравнение скорости инференса на CPU при максимальной длине контекста (8192 токена):

Модель Параметры Время на 1 проход (8192 токена, CPU) Относительная скорость
ModernBERT-base ~137M > 90 секунд 1x (база)
LFM2.5-Encoder-230M 230M ~ 28 секунд ~3.7x быстрее
LFM2.5-Encoder-350M 350M Информация недостаточна Информация недостаточна

На GPU преимущество сохраняется при длине входных данных от 2000 токенов, где LFM2.5-Encoders обгоняют ModernBERT-base. На CPU разрыв колоссален: это позволяет классифицировать целые контракты или транскрипты за секунды на ноутбуке.

Практическое применение

Разработчики могут использовать эти модели для задач, требующих постоянной работы с большими объемами текста:

  • Zero-shot маршрутизация: классификация запросов по текстовым описаниям каналов без дообучения.
  • Проверка политик: сканирование текста на соответствие внутренним правилам компании.
  • Обнаружение PII: поиск и удаление 40 типов персональных данных на 16 языках.

Модели доступны для скачивания и дообучения через библиотеку transformers. Для максимальной эффективности на GPU рекомендуется использовать Flash Attention 2.

Источник: Hugging Face blog ↗