# Compétence d'agent de montage vidéo

> Montez des vidéos en utilisant l'IA avec Claude Code, en automatisant des tâches comme la suppression des mots de remplissage, l'étalonnage des couleurs et l'incrustation de sous-titres. Rationalisez votre flux de production vidéo et obtenez un fichier MP4 final soigné.

- Canonical: https://nanoskill.ai/fr/skills/video-editing
- Markdown: https://nanoskill.ai/fr/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: fr
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

video-use introduit une approche innovante du montage vidéo, en tirant parti d'agents IA comme Claude Code pour automatiser les tâches fastidieuses et chronophages. Cet outil open source permet aux utilisateurs de déposer simplement des séquences brutes dans un dossier, d'interagir avec un agent IA et de recevoir un fichier \`final.mp4\` soigné. Il est conçu pour rationaliser le processus de montage vidéo pour divers types de contenu, des vidéos face caméra aux montages, en gérant intelligemment les coupes, l'étalonnage des couleurs et l'incrustation de sous-titres.

Le système fonctionne en lisant le contenu vidéo via des transcriptions audio détaillées et des composites visuels à la demande, plutôt qu'en traitant chaque image. Cette méthode offre à l'IA une précision au niveau des mots pour le montage tout en réduisant considérablement la charge de calcul. Les capacités clés incluent la suppression automatique des mots de remplissage et des temps morts, l'application d'étalonnages colorimétriques intelligents, la garantie de transitions audio fluides et l'incrustation de sous-titres personnalisables directement dans la vidéo.

Au-delà de l'automatisation, video-use intègre un solide pipeline d'auto-évaluation. Après le traitement initial, l'IA examine le rendu à chaque point de coupe pour détecter et corriger les imperfections telles que les sauts visuels ou les bruits audio. Cela garantit que la vidéo finale répond à des normes de production élevées avant d'être présentée à l'utilisateur. L'outil conserve également une mémoire de session, permettant aux utilisateurs de reprendre leurs sessions de montage exactement là où ils les avaient laissées, améliorant ainsi l'efficacité et la cohérence du flux de travail.

## Key features

- **Suppression automatisée des mots de remplissage**: Supprime automatiquement les mots de remplissage comme 'euh', 'heu', les faux départs et les temps morts entre les prises pour un audio plus propre.
- **Étalonnage intelligent des couleurs**: Étalonne automatiquement chaque segment vidéo, offrant des options comme chaud cinématique, punch neutre, ou des chaînes FFmpeg personnalisées pour une qualité visuelle constante.
- **Fondus audio sans couture**: Applique des fondus audio de 30 ms à chaque coupe pour éliminer les pops et assurer des transitions douces entre les segments.
- **Incrustation de sous-titres personnalisable**: Incruste les sous-titres directement dans votre vidéo dans un style personnalisable, avec des segments de 2 mots en MAJUSCULES par défaut, améliorant l'accessibilité et l'engagement.
- **Auto-évaluation alimentée par l'IA**: Le système auto-évalue le rendu à chaque limite de coupe, détectant les sauts visuels, les pops audio et les sous-titres cachés avant de vous montrer l'aperçu.

## Use cases

- **Production de vidéos professionnelles de tête parlante**: Affinez rapidement les séquences de tête parlante en supprimant les pauses et les mots de remplissage, assurant une présentation concise et engageante.
- **Création de montages vidéo dynamiques**: Assembles sans effort des montages avec des coupes automatisées, un étalonnage des couleurs et des superpositions d'animations pour un look soigné et professionnel.
- **Rationaliser la production de vidéos tutoriels**: Accélérez la création de vidéos tutoriels en automatisant les tâches de montage répétitives, permettant aux créateurs de se concentrer sur le contenu.

## Result preview

Voyez une vidéo d'interview transformée en clip pour les réseaux sociaux avec un rythme amélioré, des sous-titres et un son optimisé.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### Étape 1：Installer

Ajoutez la compétence à votre agent.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### Étape 2：Téléchargez votre vidéo

Téléchargez une interview, un tutoriel ou une vidéo de produit et décrivez les modifications souhaitées.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### Étape 3：Vérifiez le résultat

Recevez la version éditée et vérifiez les sous-titres, les transitions et le rythme.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# video-use

Présentation de **video-use** — montez des vidéos avec Claude Code. 100% open source.

Déposez des rushs bruts dans un dossier, discutez avec Claude Code, récupérez `final.mp4`. Fonctionne pour tout type de contenu — face caméra, montages, tutoriels, voyages, interviews — sans préréglages ni menus.

## Ce qu'il fait

- **Coupe les mots de remplissage** (`euh`, `hum`, faux départs) et les blancs entre les prises
- **Étalonne automatiquement** chaque segment (chaud cinématique, punch neutre, ou toute chaîne ffmpeg personnalisée)
- **Fondu audio de 30 ms** à chaque coupe pour ne jamais entendre de clic
- **Incruste les sous-titres** dans votre style — blocs de 2 mots en MAJUSCULES par défaut, entièrement personnalisable
- **Génère des superpositions d'animation** via [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/), ou PIL — lancés dans des sous-agents parallèles, un par animation
- **Auto-évalue le rendu** à chaque point de coupe avant de vous montrer quoi que ce soit
- **Persiste la mémoire de session** dans `project.md` pour que la session de la semaine prochaine reprenne là où vous en étiez

## Invite de configuration

Collez dans Claude Code, Codex, Hermes, Openclaw, ou tout agent avec accès shell :

```text
Installez https://github.com/browser-use/video-use pour moi.

Lisez d'abord install.md pour installer ce dépôt, connecter ffmpeg, enregistrer la compétence auprès de l'agent sous lequel vous tournez, et configurer la clé API ElevenLabs — demandez-moi de la coller quand vous en avez besoin. Ensuite, lisez SKILL.md pour l'utilisation quotidienne, et lisez toujours helpers/ car c'est là que résident les scripts de montage. Après l'installation, ne transcrivez rien par vous-même — dites-moi simplement que c'est prêt et attendez que je dépose les rushs dans un dossier.
```

L'agent gère le clone, les dépendances, l'enregistrement de la compétence et vous demande une fois votre clé API ElevenLabs (obtenez-en une sur [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)).

Pointez ensuite votre agent vers un dossier de prises brutes :

```bash
cd /chemin/vers/vos/videos
claude    # ou codex, hermes, etc.
```

Pour un montage toujours actif depuis votre propre VPS ou Telegram, exécutez l'agent via [Browser Use Box](https://browser-use.com/bux). [Regardez la démo de 15 secondes](https://www.tiktok.com/@browser_use/video/7639824093721758989).

Et dans la session :

> montez ces rushs en une vidéo de lancement

Il inventorie les sources, propose une stratégie, attend votre accord, puis produit `edit/final.mp4` à côté de vos sources. Toutes les sorties se trouvent dans `<videos_dir>/edit/` — le répertoire de la compétence reste propre.

## Installation manuelle

Si vous préférez le faire à la main :

```bash
# 1. Cloner et créer un lien symbolique dans le répertoire des compétences de votre agent
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Installer les dépendances
cd ~/Developer/video-use
uv sync                         # ou : pip install -e .
brew install ffmpeg             # requis
brew install yt-dlp             # optionnel, pour télécharger des sources en ligne

# 3. Ajouter votre clé API ElevenLabs
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## Comment ça marche

Le LLM ne regarde jamais la vidéo. Il la **lit** — à travers deux couches qui, ensemble, lui donnent tout ce dont il a besoin pour couper avec une précision au niveau des mots.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composite timeline_view — pellicule + piste de locuteur + forme d'onde + étiquettes de mots + candidats de coupe basés sur les silences" width="100%">
</p>

**Couche 1 — Transcription audio (toujours chargée).** Un appel à ElevenLabs Scribe par source donne des horodatages au niveau des mots, la diarisation du locuteur et des événements audio (`(rire)`, `(applaudissements)`, `(soupir)`). Toutes les prises sont regroupées dans un seul fichier `takes_packed.md` d'environ 12 Ko — la vue de lecture principale du LLM.

```
## C0103  (durée : 43,0 s, 8 phrases)
  [002.52-005.36] S0 Quatre-vingt-dix pour cent de ce que fait un agent web est complètement gaspillé.
  [006.08-006.74] S0 Nous avons résolu ce problème.
```

**Couche 2 — Composite visuel (sur demande).** `timeline_view` produit une image PNG avec pellicule + forme d'onde + étiquettes de mots pour n'importe quelle plage temporelle. Appelé uniquement aux points de décision — pauses ambiguës, comparaisons de reprises, vérifications des points de coupe.

> Approche naïve : 30 000 images × 1 500 tokens = **45M tokens de bruit**.
> Video Use : **12 Ko de texte + une poignée de PNG**.

Même idée que browser-use donnant à un LLM un DOM structuré au lieu d'une capture d'écran — mais pour la vidéo.

## Pipeline

```
Transcrire ──> Empaqueter ──> Raisonnement LLM ──> EDL ──> Rendu ──> Auto-évaluation
                                                              │
                                                              └─ problème ? correction + nouveau rendu (max 3)
```

La boucle d'auto-évaluation exécute `timeline_view` sur la _sortie rendue_ à chaque point de coupe — détecte les sauts visuels, les pops audio, les sous-titres cachés. Vous ne voyez l'aperçu qu'après validation.

## Principes de conception

1. **Texte + visuels à la demande.** Pas de déchargement d'images. La transcription est la surface.
2. **L'audio est prioritaire, le visuel suit.** Les coupes viennent des frontières de parole et des silences.
3. **Demander → confirmer → exécuter → auto-évaluer → persister.** Ne jamais toucher à la coupe sans approbation de la stratégie.
4. **Zéro hypothèse sur le type de contenu.** Regarder, demander, puis monter.
5. **12 règles strictes, liberté artistique ailleurs.** L'exactitude de la production est non négociable. Le goût ne l'est pas.

Voir [`SKILL.md`](./SKILL.md) pour les règles de production complètes et l'art du montage.

## FAQ

### Qu'est-ce que l'utilisation-vidéo ?

L'utilisation-vidéo est un outil open source qui vous permet de monter des vidéos à l'aide d'agents IA comme Claude Code. Il automatise les tâches de montage courantes telles que la suppression des mots de remplissage, l'étalonnage des couleurs et l'ajout de sous-titres.

### Comment fonctionne l'utilisation-vidéo sans que le LLM regarde la vidéo ?

Le LLM lit la vidéo à travers deux couches : une transcription audio avec des horodatages au niveau des mots et la diarisation du locuteur, et des composites visuels à la demande (filmstrip + forme d'onde + étiquettes de mots PNG) pour les points de décision. Cette approche minimise l'utilisation de jetons tout en offrant des capacités de montage précises.

### Quels types de vidéos puis-je monter avec l'utilisation-vidéo ?

L'utilisation-vidéo est conçue pour fonctionner avec tout type de contenu, y compris les têtes parlantes, les montages, les tutoriels, les vlogs de voyage et les interviews. Elle s'adapte à vos séquences sans nécessiter de préréglages ni de menus.

### Quelles sont les fonctionnalités principales de l'utilisation-vidéo ?

Les fonctionnalités clés incluent la suppression des mots de remplissage et des temps morts, l'étalonnage automatique des couleurs, les fondus audio de 30 ms, l'incrustation de sous-titres personnalisables, la génération de superpositions d'animations, l'auto-évaluation du rendu final et la persistance de la mémoire de session.

### Ai-je besoin d'une clé API OnzeLabs pour utiliser l'utilisation-vidéo ?

Oui, une clé API OnzeLabs est nécessaire pour la transcription audio et la diarisation du locuteur, qui sont cruciales pour le fonctionnement de l'outil. Vous serez invité à la fournir pendant le processus de configuration.

### Puis-je installer manuellement l'utilisation-vidéo au lieu d'utiliser l'invite de configuration ?

Oui, vous pouvez effectuer une installation manuelle en clonant le dépôt, en le liant symboliquement dans le répertoire des compétences de votre agent, en installant les dépendances comme FFmpeg, et en configurant votre clé API OnzeLabs dans le fichier .env.
