landing-ai/vision-agent

This tool has been deprecated. Use Agentic Document Extraction instead.

Агенты⭐ 5 301Python
Открыть на GitHub ↗

Что это за инструмент

VisionAgent — инструмент от LandingAI, который по текстовому запросу и изображению автоматически генерирует готовый к запуску код для компьютерного зрения. Данный проект официально устарел (deprecated), и пользователям рекомендуется использовать Agentic Document Extraction.

Зачем нужен

Инструмент решает задачу быстрого прототипирования приложений с визуальным анализом, позволяя получать рабочий код за минуты без глубокой настройки моделей. Он полезен для автоматизации выбора подходящих vision-моделей и генерации тестовых случаев, однако текущая версия требует использования внешних API ключей (Anthropic, Google) и больше не поддерживается.

Что можно реализовать

  • Быстрая генерация кода для описания содержимого изображений
  • Автоматический подсчет объектов на фото (например, банок)
  • Создание тестовых сценариев для проверки сгенерированного кода
  • Прототипирование визуальных AI-приложений через локальный веб-интерфейс
  • Анализ изображений с использованием агентного подхода к сложному визуальному рассуждению

Ключевые возможности

  • Автоматический выбор подходящих vision-моделей на основе промпта
  • Генерация не только кода, но и тестовых кейсов с итеративной отладкой
  • Использование LLM от Anthropic и Google для обработки запросов
  • Локальный веб-интерфейс для взаимодействия с агентом
  • Поддержка Python 3.9+ и установка через pip/uv

👤 Кому подойдёт: разработчики, исследователи, создающие прототипы приложений компьютерного зрения

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.