Инструменты12 июля 2026 г., 19:46 МСК🤖 Auto

Claude Video: AI теперь видит и слышит видео через плагин /watch

Новый плагин для Claude Code позволяет агентам анализировать видеоконтент, извлекая кадры и аудио. Это закрывает критический пробел в понимании мультимедиа у LLM.

Баннер новости 3405

Зачем это нужно: от текста к визуальному контексту

До появления плагина Claude Video от разработчика bradautomates, модели Claude могли лишь гадать по заголовкам или полагаться на транскрипты, которые часто упускают 90% визуальной информации. Новый инструмент /watch позволяет Claude не только «слышать» аудио, но и «видеть» происходящее на экране, анализируя кадры в контексте диалога.

Это решает реальные задачи: от разбора структуры вирусных видео и анализа рекламных креативов до диагностики багов по скриншотам и создания заметок из длинных лекций. Агент теперь отвечает на основе увиденного, а не только услышанного.

Как это работает: архитектура анализа

Плагин использует связку yt-dlp и ffmpeg для извлечения данных. Процесс оптимизирован для экономии токенов:

  • Аудио: Сначала проверяются нативные субтитры (бесплатно и быстро). Если их нет, аудио конвертируется в моно-файл (16 kHz, 64 kbps) и отправляется в Whisper (предпочтительно Groq whisper-large-v3 или OpenAI whisper-1).
  • Визуал: Извлекаются кадры с временными метками. JPEG-изображения масштабируются до 512px в ширину для совместимости с Claude Read.
  • Очистка: Рабочая директория удаляется после ответа, если не требуется follow-up.

Экономия токенов: бюджет кадров и дедупликация

Главная проблема анализа видео — стоимость визуальных токенов. Плагин внедряет строгие лимиты и алгоритмы сжатия:

  • Frame Budget: Количество анализируемых кадров зависит от длительности. Для видео до 30 секунд берется ~30 кадров (плотный скан), для длинных (>10 мин) — максимум 100 кадров (спарсный скан).
  • Дедупликация: Алгоритм вычисляет среднюю абсолютную разницу яркости между кадрами. Если разница ≤ 2.0, кадр считается дубликатом и отбрасывается. Это критично для видео со статичными слайдами, где можно получить сотни одинаковых кадров.

Реальные метрики производительности

На тестовом видео длительностью 49 минут (720p, английские авто-субтитры) разработчики зафиксировали следующие показатели извлечения кадров:

Режим (--detail) Движок Кол-во кадров Время извлечения Оценка токенов (изображения)
transcript Нет (только субтитры) ~0 ~4.5 с 0 (≈26.6k текстовых токенов)
efficient Ключевые кадры 50 ~0.5 с ~9.8k
balanced Смена сцен 100 ~20.9 с ~19.7k
token-burner Смена сцен (без лимита) 116 ~21.0 с ~22.8k

Расчет визуальных токенов производится по формуле Anthropic: (width × height) / 750. При стандартном разрешении 512x288 каждый кадр потребляет ~197 токенов.

Установка и совместимость

Плагин поддерживает установку в Claude Code, Codex, Cursor, Copilot, Gemini CLI и более чем 50 других агентов. Для macOS требуется brew для установки зависимостей. Поддерживаются URL (YouTube, Loom, TikTok, X, Instagram) и локальные файлы (.mp4, .mov, .mkv, .webm).

Команда для Claude Code:

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

Универсальная команда:

npx skills add bradautomates/claude-video -g

Источник: Github ↗