AI-новости24 сентября 2026 г., 17:48 МСК🤖 Auto

Samsung Labs выпустила Samsone: 3 модели аудио-LLM до 356M параметров

Лаборатория Samsung Labs представила семейство открытых малых языковых моделей (SALMs) Samsone для анализа звука на устройствах. Модели превосходят аналоги по эффективности и доступны для Android.

Баннер новости 8202

Что такое Samsone и зачем это нужно

Команда Samsung Labs опубликовала в открытом доступе семейство Samsone — Small Audio Language Models, разработанные специально для эффективного понимания аудио на edge-устройствах. Проект принят к публикации в Interspeech 2026. В релизе представлены три версии моделей: Samsone-99M, Samsone-134M и Samsone-356M.

Ключевое отличие Samsone от крупных аналогов — оптимизация для локального выполнения. Для этого подготовлены специализированные чекпоинты формата ExecuTorch для мобильных устройств Android (API 31+) и стандартные PyTorch-модели для серверной инфраструктуры. Разработчики также выложили полный код обучения, экспорта и Android-приложения для демонстрации работы в реальном времени.

Результаты бенчмарков: малые модели бьют гигантов

Эффективность Samsone оценивалась на наборе данных MMAU и его расширенной версии MMAU-Pro. Тестирование охватывало три категории: звуковые эффекты (Sound), музыка (Music) и речь (Speech). Как показывает таблица ниже, компактные модели Samsung демонстрируют выдающиеся результаты, часто превосходя модели с миллиардами параметров.

Модель Размер Avg. MMAU (mini) Avg. MMAU (test) Avg. MMAU-Pro
Samsone-99M 99M 57.20 58.13 36.83
Samsone-134M 134M 63.00 61.33 37.57
Samsone-356M 356M 63.70 62.00 40.67
Audio Flamingo 2 3B 62.40 61.06 42.60
Qwen2-Audio-Instruct 8.4B 59.60 57.40 45.41
GPT-4o Audio -- 62.50 60.82 52.50

Особенно впечатляет Samsone-134M: она показывает средний балл 63.00 на тесте mini, что выше, чем у 3-миллиардной Audio Flamingo 2 (62.40) и 8.4-миллиардной Qwen2-Audio (59.60). При этом Samsone-356M достигает показателя 63.70, конкурируя с моделями в разы большего объема.

Как использовать Samsone

Интеграция модели максимально упрощена. Для Python-разработчиков доступен пакет, который автоматически загружает чекпоинт при первом запуске:

  • Установка через uv sync.
  • Загрузка модели одной строкой: Samsone134M().
  • Поддержка пакетной обработки: можно передать список аудиофайлов для сравнения в одном промпте.

Для мобильных разработчиков подготовлено готовое Android-приложение. Достаточно скачать .pte чекпоинты, инициализировать подмодуль репозитория и запустить приложение на устройстве с Android 12+ для инференса в реальном времени без отправки данных в облако.

Обучение и воспроизводимость

Модели обучены на датасетах ReasonAQA и AudioSkills. Код обучения полностью открыт, что позволяет исследователям воспроизвести результаты или дообучить модели под свои задачи. Формат данных стандартизирован в Parquet, а конфигурации для каждой из трех версий моделей вынесены в отдельные YAML-файлы.

Источник: Github ↗