Архитектура Mixture of Vision Experts
Новая модель K2-Horizon-MoVA-36B-A4B представляет собой значительный шаг вперед в области эффективного анализа видео. В отличие от традиционных плотных моделей, где обрабатываются все параметры, данная архитектура использует механизм Mixture of Vision Experts. Это позволяет модели активировать только подмножество параметров (4B из 36B) для обработки каждого кадра или временного сегмента, что существенно экономит ресурсы GPU без критической потери качества понимания контекста.
Ключевые характеристики модели
Модель разработана для работы с длинными видеорядми, что является одной из самых сложных задач в компьютерном зрении. Ниже приведены основные технические спецификации, отличающие K2-Horizon-MoVA от предыдущих версий:
| Параметр | Значение |
|---|---|
| Общее количество параметров | 36 Billion (36B) |
| Активные параметры (на шаг) | 4 Billion (4B) |
| Тип архитектуры | MoVA (Mixture of Vision Experts) |
| Основная задача | Анализ длинных видео, VQA |
| Платформа | Hugging Face |
Практическая значимость для индустрии
Снижение числа активных параметров с 36B до 4B означает, что развертывание таких моделей становится возможным на более доступном оборудовании. Это открывает путь для внедрения сложных систем видеомониторинга, анализа спортивных трансляций или медицинских изображений в реальном времени, где задержка и стоимость инференса были ранее критическими барьерами.
Доступность и ресурсы
Модель и связанные с ней датасеты уже доступны на платформе Hugging Face. Обновление репозитория K2 Horizon было произведено менее 14 часов назад, что указывает на актуальность данных и готовность сообщества к тестированию новой архитектуры. Исследователям и разработчикам рекомендуется обратить внимание на этот релиз для оптимизации своих пайплайнов обработки видео.
Источник: Huggingface ↗
