om-ai-lab/VLM-R1

Решение задач визуального понимания с помощью усиленных VLM

Мультимодальные⭐ 6 029Pythonпоследний релиз: v0.2.1
Открыть на GitHub ↗

Что это за инструмент

VLM-R1 — это фреймворк для обучения больших зрительно-языковых моделей (VLM) методом усиленного обучения (RL), вдохновленным архитектурой R1.

Зачем нужен

Инструмент решает проблему плохой обобщающей способности моделей при стандартном дообучении (SFT), позволяя VLM развивать навыки рассуждения на визуальных данных. Это полезно для создания стабильных и точных систем, способных справляться с задачами, выходящими за рамки обучающей выборки.

Что можно реализовать

  • Точное локализация объектов по текстовому описанию (Referring Expression Comprehension)
  • Обнаружение объектов без предварительной разметки классов (Open-Vocabulary Detection)
  • Анализ сложных сценариев с несколькими изображениями
  • Адаптация моделей Qwen2.5-VL и InternVL под специфические визуальные задачи

Ключевые возможности

  • Применение алгоритма GRPO для усиленного обучения зрительно-языковых моделей
  • Поддержка LoRA и полного дообучения (Full Fine-tuning) с возможностью заморозки визуальных модулей
  • Оптимизация производительности: снижение TTFT на 50% и рост пропускной способности на 127% с использованием фреймворка xllm
  • Готовая поддержка оборудования Huawei Ascend (Atlas 800T A2, 300I Duo) через vllm-ascend
  • Гибкая система наград (reward functions), включая кастомизацию логики внутри модулей VLM

👤 Кому подойдёт: Исследователи в области компьютерного зрения и NLP, ML-инженеры, разрабатывающие кастомные VLM, и разработчики, оптимизирующие инференс на специфичном железе (Huawei Ascend).

Релизы

v0.2.1minor
🕐 17 мес назад · релиз на GitHub ↗

Релиз v0.2.1: добавлены новые функции вознаграждения, исправлены ошибки обработки и обновлена документация.

  • Added: Добавлены новые функции вознаграждения, включая odLength_reward и улучшения для Clip Higher.
  • Fixed: Исправлена ошибка в классе обработки (processing_class) и скорректирована логика вознаграждения для MCQ.
  • Added: Опубликован технический отчет, обновлен файл цитирования (bibtex) и добавлена конфигурация Zero2.
  • Обновлена документация README с добавлением информации о выводах (findings).