microsoft/MM-REACT

Официальный репозиторий для MM-REACT

Агенты⭐ 966Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

MM-REACT — это система-агент, которая объединяет LLM (ChatGPT/GPT-4) с набором специализированных инструментов компьютерного зрения для выполнения сложных задач мультимодального анализа.

Зачем нужен

Инструмент решает проблему понимания изображений языковыми моделями, делегируя извлечение конкретных данных (объекты, текст, лица) внешним экспертам. Это позволяет LLM строить логические цепочки рассуждений на основе точных данных, полученных от CV-сервисов, а не полагаться только на нативное понимание картинок.

Что можно реализовать

  • Распознавание знаменитостей на фотографиях с использованием специализированного CV-эксперта
  • Извлечение структурированных данных из документов (чеки, счета, визитки) через OCR и Form Recognizer
  • Получение детальных текстовых описаний сцен на изображениях (dense captioning)
  • Мультимодальный поиск по изображениям с использованием Bing Visual Search
  • Конверсационные ассистенты, способные анализировать загруженные пользователем изображения

Ключевые возможности

  • Параллельное использование LLM и пула CV-экспертов (Tags, Objects, Faces, OCR)
  • Архитектура на базе LangChain, где LLM выступает в роли планировщика действий
  • Интеграция с Azure Computer Vision, Form Recognizer и Bing Search
  • Возможность работы с GPT-3.5 Turbo и GPT-4 через Azure OpenAI API
  • Простой интерфейс взаимодействия: путь к файлу передается как плейсхолдер в промпт

👤 Кому подойдёт: разработчики AI-агентов, исследователи в области мультимодального ИИ, инженеры, работающие с Azure Cognitive Services

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.