Зачем это нужно: от текста к визуальному контексту
До появления плагина Claude Video от разработчика bradautomates, модели Claude могли лишь гадать по заголовкам или полагаться на транскрипты, которые часто упускают 90% визуальной информации. Новый инструмент /watch позволяет Claude не только «слышать» аудио, но и «видеть» происходящее на экране, анализируя кадры в контексте диалога.
Это решает реальные задачи: от разбора структуры вирусных видео и анализа рекламных креативов до диагностики багов по скриншотам и создания заметок из длинных лекций. Агент теперь отвечает на основе увиденного, а не только услышанного.
Как это работает: архитектура анализа
Плагин использует связку yt-dlp и ffmpeg для извлечения данных. Процесс оптимизирован для экономии токенов:
- Аудио: Сначала проверяются нативные субтитры (бесплатно и быстро). Если их нет, аудио конвертируется в моно-файл (16 kHz, 64 kbps) и отправляется в Whisper (предпочтительно Groq whisper-large-v3 или OpenAI whisper-1).
- Визуал: Извлекаются кадры с временными метками. JPEG-изображения масштабируются до 512px в ширину для совместимости с Claude Read.
- Очистка: Рабочая директория удаляется после ответа, если не требуется follow-up.
Экономия токенов: бюджет кадров и дедупликация
Главная проблема анализа видео — стоимость визуальных токенов. Плагин внедряет строгие лимиты и алгоритмы сжатия:
- Frame Budget: Количество анализируемых кадров зависит от длительности. Для видео до 30 секунд берется ~30 кадров (плотный скан), для длинных (>10 мин) — максимум 100 кадров (спарсный скан).
- Дедупликация: Алгоритм вычисляет среднюю абсолютную разницу яркости между кадрами. Если разница ≤ 2.0, кадр считается дубликатом и отбрасывается. Это критично для видео со статичными слайдами, где можно получить сотни одинаковых кадров.
Реальные метрики производительности
На тестовом видео длительностью 49 минут (720p, английские авто-субтитры) разработчики зафиксировали следующие показатели извлечения кадров:
| Режим (--detail) | Движок | Кол-во кадров | Время извлечения | Оценка токенов (изображения) |
|---|---|---|---|---|
| transcript | Нет (только субтитры) | ~0 | ~4.5 с | 0 (≈26.6k текстовых токенов) |
| efficient | Ключевые кадры | 50 | ~0.5 с | ~9.8k |
| balanced | Смена сцен | 100 | ~20.9 с | ~19.7k |
| token-burner | Смена сцен (без лимита) | 116 | ~21.0 с | ~22.8k |
Расчет визуальных токенов производится по формуле Anthropic: (width × height) / 750. При стандартном разрешении 512x288 каждый кадр потребляет ~197 токенов.
Установка и совместимость
Плагин поддерживает установку в Claude Code, Codex, Cursor, Copilot, Gemini CLI и более чем 50 других агентов. Для macOS требуется brew для установки зависимостей. Поддерживаются URL (YouTube, Loom, TikTok, X, Instagram) и локальные файлы (.mp4, .mov, .mkv, .webm).
Команда для Claude Code:
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
Универсальная команда:
npx skills add bradautomates/claude-video -g
Источник: Github ↗
