video-use
Présentation de video-use — montez des vidéos avec Claude Code. 100% open source.
Déposez des rushs bruts dans un dossier, discutez avec Claude Code, récupérez final.mp4. Fonctionne pour tout type de contenu — face caméra, montages, tutoriels, voyages, interviews — sans préréglages ni menus.
Ce qu'il fait
- Coupe les mots de remplissage (
euh,hum, faux départs) et les blancs entre les prises - Étalonne automatiquement chaque segment (chaud cinématique, punch neutre, ou toute chaîne ffmpeg personnalisée)
- Fondu audio de 30 ms à chaque coupe pour ne jamais entendre de clic
- Incruste les sous-titres dans votre style — blocs de 2 mots en MAJUSCULES par défaut, entièrement personnalisable
- Génère des superpositions d'animation via HyperFrames, Remotion, Manim, ou PIL — lancés dans des sous-agents parallèles, un par animation
- Auto-évalue le rendu à chaque point de coupe avant de vous montrer quoi que ce soit
- Persiste la mémoire de session dans
project.mdpour que la session de la semaine prochaine reprenne là où vous en étiez
Invite de configuration
Collez dans Claude Code, Codex, Hermes, Openclaw, ou tout agent avec accès shell :
Installez https://github.com/browser-use/video-use pour moi.
Lisez d'abord install.md pour installer ce dépôt, connecter ffmpeg, enregistrer la compétence auprès de l'agent sous lequel vous tournez, et configurer la clé API ElevenLabs — demandez-moi de la coller quand vous en avez besoin. Ensuite, lisez SKILL.md pour l'utilisation quotidienne, et lisez toujours helpers/ car c'est là que résident les scripts de montage. Après l'installation, ne transcrivez rien par vous-même — dites-moi simplement que c'est prêt et attendez que je dépose les rushs dans un dossier.
L'agent gère le clone, les dépendances, l'enregistrement de la compétence et vous demande une fois votre clé API ElevenLabs (obtenez-en une sur elevenlabs.io/app/settings/api-keys).
Pointez ensuite votre agent vers un dossier de prises brutes :
cd /chemin/vers/vos/videos
claude # ou codex, hermes, etc.
Pour un montage toujours actif depuis votre propre VPS ou Telegram, exécutez l'agent via Browser Use Box. Regardez la démo de 15 secondes.
Et dans la session :
montez ces rushs en une vidéo de lancement
Il inventorie les sources, propose une stratégie, attend votre accord, puis produit edit/final.mp4 à côté de vos sources. Toutes les sorties se trouvent dans <videos_dir>/edit/ — le répertoire de la compétence reste propre.
Installation manuelle
Si vous préférez le faire à la main :
# 1. Cloner et créer un lien symbolique dans le répertoire des compétences de votre agent
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Installer les dépendances
cd ~/Developer/video-use
uv sync # ou : pip install -e .
brew install ffmpeg # requis
brew install yt-dlp # optionnel, pour télécharger des sources en ligne
# 3. Ajouter votre clé API ElevenLabs
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Comment ça marche
Le LLM ne regarde jamais la vidéo. Il la lit — à travers deux couches qui, ensemble, lui donnent tout ce dont il a besoin pour couper avec une précision au niveau des mots.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composite timeline_view — pellicule + piste de locuteur + forme d'onde + étiquettes de mots + candidats de coupe basés sur les silences" width="100%"> </p>Couche 1 — Transcription audio (toujours chargée). Un appel à ElevenLabs Scribe par source donne des horodatages au niveau des mots, la diarisation du locuteur et des événements audio ((rire), (applaudissements), (soupir)). Toutes les prises sont regroupées dans un seul fichier takes_packed.md d'environ 12 Ko — la vue de lecture principale du LLM.
## C0103 (durée : 43,0 s, 8 phrases)
[002.52-005.36] S0 Quatre-vingt-dix pour cent de ce que fait un agent web est complètement gaspillé.
[006.08-006.74] S0 Nous avons résolu ce problème.
Couche 2 — Composite visuel (sur demande). timeline_view produit une image PNG avec pellicule + forme d'onde + étiquettes de mots pour n'importe quelle plage temporelle. Appelé uniquement aux points de décision — pauses ambiguës, comparaisons de reprises, vérifications des points de coupe.
Approche naïve : 30 000 images × 1 500 tokens = 45M tokens de bruit. Video Use : 12 Ko de texte + une poignée de PNG.
Même idée que browser-use donnant à un LLM un DOM structuré au lieu d'une capture d'écran — mais pour la vidéo.
Pipeline
Transcrire ──> Empaqueter ──> Raisonnement LLM ──> EDL ──> Rendu ──> Auto-évaluation
│
└─ problème ? correction + nouveau rendu (max 3)
La boucle d'auto-évaluation exécute timeline_view sur la sortie rendue à chaque point de coupe — détecte les sauts visuels, les pops audio, les sous-titres cachés. Vous ne voyez l'aperçu qu'après validation.
Principes de conception
- Texte + visuels à la demande. Pas de déchargement d'images. La transcription est la surface.
- L'audio est prioritaire, le visuel suit. Les coupes viennent des frontières de parole et des silences.
- Demander → confirmer → exécuter → auto-évaluer → persister. Ne jamais toucher à la coupe sans approbation de la stratégie.
- Zéro hypothèse sur le type de contenu. Regarder, demander, puis monter.
- 12 règles strictes, liberté artistique ailleurs. L'exactitude de la production est non négociable. Le goût ne l'est pas.
Voir SKILL.md pour les règles de production complètes et l'art du montage.


