Новая AI-модель перевода Hy-MT1.5-1.8B-1.25bit весит всего 440 МБ, но тянет 33 языка и 1056 направлений перевода. Её можно запускать прямо на телефоне без интернета. Это редкий случай, когда маленький размер не убил качество.
Разработчики заявляют, что модель на 1.8B параметров обходит более крупные open-source (модели с открытым кодом) решения и даже часть коммерческих API (программный доступ к сервису). А значит, офлайн-перевод больше не выглядит игрушкой для демо.
Телефон вместо облака: что реально изменилось

Главное изменение, которое ощущается сразу, это локальный перевод без отправки текста на сервер. Для бизнеса это меньше рисков с приватными данными и меньше зависимостей от внешних сервисов.
Модель сжали с примерно 3.3 ГБ (FP16, формат с 16-битной точностью) до 440 МБ через 1.25-bit quantization (квантование, сильное уменьшение веса модели). Это даёт запуск даже на обычных Android-смартфонах с ограниченной памятью.
- 33 языка и 5 диалектов/языков меньшинств.
- 1056 направлений перевода между языками.
- Работа без сети: текст остаётся на устройстве.
- Есть Android-демо с переводом «поверх» других приложений.
- Поддерживаются веса и GGUF (формат файлов для локального запуска LLM).
Отдельно впечатляет режим background word extraction (фоновое извлечение слов): можно читать письмо, сайт или чат и получать перевод без переключения между приложениями. Для занятых людей это реально экономит минуты каждый день.
Почему все говорят про 1.25 бит и при чём тут Sherry
В основе лежит алгоритм Sherry, принятый на ACL 2026. Он использует 3:4 sparsity (разреженность: часть весов зануляется), чтобы упаковать 4 веса в 5 бит.
Схема простая: из каждых 4 весов 3 хранятся как 1-битные значения, один обнуляется. Так получается эффективная ширина 1.25 бит. И модель остаётся достаточно точной для качественного перевода.
Плюс вышел STQ1_0 kernel (вычислительное ядро), который отправили в PR (pull request, запрос на изменение кода) в llama.cpp. Это важный сигнал: разработка идёт не в вакууме, а в сторону массового open-source (открытого кода) использования.
- Сжатие сильное, но не «в ноль» по качеству.
- Фокус на мобильных CPU (процессоры смартфонов), а не только на GPU.
- Инструменты уже можно потрогать руками через демо и репозиторий.
Как применить это прямо сейчас в работе
Если вы предприниматель, маркетолог или разработчик, польза начинается не с «исследований», а с рутины. Особенно там, где много коротких текстов на разных языках.
- Поддержка клиентов: быстрый перевод входящих сообщений без облачных сервисов.
- Маркетинг: адаптация рекламных текстов под несколько рынков.
- Продажи: локализация карточек товаров и ответов покупателям.
- Разработка: встроенный перевод в мобильные приложения офлайн.
- Юр/финтех: меньше риска утечки, если текст нельзя отдавать внешнему API.
Есть и практический плюс по деньгам: локальный запуск снижает зависимость от оплаты за API-запросы. Один раз скачали модель, дальше перевод работает без постоянных сетевых расходов.
Для старта доступны готовые ссылки: веса 1.25-bit и 2-bit, GGUF-версии, Android APK и технические отчёты. Модель за месяц набрала 17 223 загрузки, то есть это уже не нишевой эксперимент.
Ограничения тоже есть. Это специализированная модель перевода, не универсальный чат-бот. И качество всё равно надо проверять на ваших реальных текстах, особенно в узких тематиках.
Но тренд уже читается чётко: AI идёт от «огромных моделей в облаке» к карманным моделям на устройстве. Кто первым встроит это в процессы, тот выиграет и в скорости, и в приватности.
Источник: Hugging Face — Hy-MT1.5-1.8B-1.25bit, Android demo APK, HY-MT1.5 Technical Report, Sherry paper, AngelSlim report.
