Comment donner à Claude Code la capacité de regarder une vidéo
TL;DR
claude-video ajoute une commande /watch à Claude Code : coller une URL ou un fichier local, et l'agent récupère les sous-titres, extrait des images aux moments qui comptent, et répond en s'appuyant sur ce qu'il a vu et entendu. Fonctionne avec YouTube, Loom, TikTok, X, Instagram et tout ce que yt-dlp sait télécharger. Gratuit tant que la vidéo a des sous-titres. Sans sous-titres, une clé API Whisper devient nécessaire pour la transcription.
Le problème : un agent qui lit un titre, pas une vidéo
Sans cet outil, un agent qui reçoit un lien YouTube devine à partir du titre, ou récupère une transcription automatique qui rate tout ce qui se passe à l'écran : un graphique, une erreur affichée, un montage. Il répond « d'après le titre », pas « d'après ce qui se passe dans la vidéo ».
Comment ça marche
Trois étapes, dans cet ordre :
- Sous-titres d'abord.
yt-dlprécupère les sous-titres natifs de la source, manuels ou automatiques, sans télécharger la vidéo. Gratuit, quasi instantané. - Images seulement si nécessaire.
ffmpegextrait des images aux changements de scène plutôt qu'à intervalle fixe, pour éviter de payer douze fois la même diapositive en tokens. Une passe de déduplication compare chaque image à la dernière image gardée et élimine les quasi-doublons avant qu'ils atteignent Claude. - Transcription en repli. Si la vidéo n'a pas de sous-titres, l'outil extrait l'audio et l'envoie à Whisper, celui de Groq en priorité (moins cher, plus rapide), sinon celui d'OpenAI.
Claude lit ensuite chaque image comme une image classique, avec un horodatage, et répond en s'appuyant sur ce contenu plutôt que sur une description générique.
/watch https://youtu.be/<video> qu'est-ce qui a changé, saute le pitch
Ce que ça donne concrètement
- Analyser le lancement d'un concurrent : accroche d'ouverture, structure du montage, ce qui est montré à l'écran plutôt que dit.
- Déboguer à partir d'un enregistrement d'écran : l'agent trouve l'image précise où le bug apparaît, sans que tu doives scruter la vidéo image par image.
- Résumer une conférence de 49 minutes en quelques secondes, avec des horodatages précis plutôt qu'un résumé vague.
- Couper le blabla d'une vidéo produit : demander directement ce qui a changé, sans les dix premières minutes de mise en contexte.
Combien ça coûte réellement
Le prix annoncé de zéro tient pour les vidéos avec sous-titres, la majorité du contenu public : yt-dlp les récupère sans frais et sans télécharger la vidéo. Une vidéo sans sous-titres change la donne : l'outil bascule sur Whisper, qui demande une clé API payante (Groq ou OpenAI). Le gratuit est la règle générale, pas une garantie universelle.
Comment l'installer
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
yt-dlp et ffmpeg s'installent automatiquement au premier lancement sur macOS via Homebrew ; sur Linux et Windows, l'outil affiche les commandes exactes à lancer.
Les limites
Sur une vidéo longue, le nombre d'images a un plafond : une vidéo de plus de 10 minutes se limite à 100 images par défaut, ce qui donne un balayage large plutôt qu'une couverture dense. Pour un moment précis, préciser un intervalle (« entre 2:30 et 3:00 ») donne une réponse bien plus dense qu'un passage sur la vidéo entière. Le mode le plus complet, sans plafond, existe mais coûte davantage de tokens sur une vidéo à coupures fréquentes.