Что такое Samsone и зачем это нужно
Команда Samsung Labs опубликовала в открытом доступе семейство Samsone — Small Audio Language Models, разработанные специально для эффективного понимания аудио на edge-устройствах. Проект принят к публикации в Interspeech 2026. В релизе представлены три версии моделей: Samsone-99M, Samsone-134M и Samsone-356M.
Ключевое отличие Samsone от крупных аналогов — оптимизация для локального выполнения. Для этого подготовлены специализированные чекпоинты формата ExecuTorch для мобильных устройств Android (API 31+) и стандартные PyTorch-модели для серверной инфраструктуры. Разработчики также выложили полный код обучения, экспорта и Android-приложения для демонстрации работы в реальном времени.
Результаты бенчмарков: малые модели бьют гигантов
Эффективность Samsone оценивалась на наборе данных MMAU и его расширенной версии MMAU-Pro. Тестирование охватывало три категории: звуковые эффекты (Sound), музыка (Music) и речь (Speech). Как показывает таблица ниже, компактные модели Samsung демонстрируют выдающиеся результаты, часто превосходя модели с миллиардами параметров.
| Модель | Размер | Avg. MMAU (mini) | Avg. MMAU (test) | Avg. MMAU-Pro |
|---|---|---|---|---|
| Samsone-99M | 99M | 57.20 | 58.13 | 36.83 |
| Samsone-134M | 134M | 63.00 | 61.33 | 37.57 |
| Samsone-356M | 356M | 63.70 | 62.00 | 40.67 |
| Audio Flamingo 2 | 3B | 62.40 | 61.06 | 42.60 |
| Qwen2-Audio-Instruct | 8.4B | 59.60 | 57.40 | 45.41 |
| GPT-4o Audio | -- | 62.50 | 60.82 | 52.50 |
Особенно впечатляет Samsone-134M: она показывает средний балл 63.00 на тесте mini, что выше, чем у 3-миллиардной Audio Flamingo 2 (62.40) и 8.4-миллиардной Qwen2-Audio (59.60). При этом Samsone-356M достигает показателя 63.70, конкурируя с моделями в разы большего объема.
Как использовать Samsone
Интеграция модели максимально упрощена. Для Python-разработчиков доступен пакет, который автоматически загружает чекпоинт при первом запуске:
- Установка через
uv sync. - Загрузка модели одной строкой:
Samsone134M(). - Поддержка пакетной обработки: можно передать список аудиофайлов для сравнения в одном промпте.
Для мобильных разработчиков подготовлено готовое Android-приложение. Достаточно скачать .pte чекпоинты, инициализировать подмодуль репозитория и запустить приложение на устройстве с Android 12+ для инференса в реальном времени без отправки данных в облако.
Обучение и воспроизводимость
Модели обучены на датасетах ReasonAQA и AudioSkills. Код обучения полностью открыт, что позволяет исследователям воспроизвести результаты или дообучить модели под свои задачи. Формат данных стандартизирован в Parquet, а конфигурации для каждой из трех версий моделей вынесены в отдельные YAML-файлы.
Источник: Github ↗
