video-use
Maak kennis met video-use — bewerk video's met Claude Code. 100% open source.
Zet ruwe beelden in een map, chat met Claude Code, krijg final.mp4 terug. Werkt voor elke content — talking heads, montages, tutorials, reizen, interviews — zonder voorinstellingen of menu's.
Wat het doet
- Knipt opvulwoorden weg (
umm,uh, valse starts) en dode ruimte tussen takes - Automatische kleurcorrectie op elk segment (warm cinematisch, neutrale punch, of elke aangepaste ffmpeg-keten)
- 30 ms audiofades bij elke knip, zodat je nooit een plop hoort
- Brandt ondertitels in jouw stijl — standaard blokken van 2 woorden in HOOFDLETTERS, volledig aanpasbaar
- Genereert animatie-overlays via HyperFrames, Remotion, Manim of PIL — gestart in parallelle sub-agents, één per animatie
- Evalueert zelf de gerenderde uitvoer bij elke knipgrens voordat het je iets laat zien
- Slaat sessiegeheugen op in
project.mdzodat de sessie van volgende week verdergaat waar je gebleven was
Setup-prompt
Plak in Claude Code, Codex, Hermes, Openclaw of elke agent met shell-toegang:
Stel https://github.com/browser-use/video-use voor mij in.
Lees eerst install.md om deze repo te installeren, ffmpeg aan te sluiten, de skill te registreren bij de agent waar je onder draait, en de ElevenLabs API-sleutel in te stellen — vraag mij om die te plakken wanneer je hem nodig hebt. Lees dan SKILL.md voor dagelijks gebruik, en lees altijd helpers/ want daar staan de bewerkingsscripts. Na de installatie, transcribeer niets zelf — zeg gewoon dat het klaar is en wacht tot ik beelden in een map zet.
De agent handelt de clone, afhankelijkheden, skill-registratie af en vraagt je één keer om je ElevenLabs API-sleutel (haal er een op elevenlabs.io/app/settings/api-keys).
Wijs vervolgens je agent naar een map met ruwe takes:
cd /pad/naar/jouw/videos
claude # of codex, hermes, enz.
Voor altijd-aan bewerking vanaf je eigen VPS of Telegram, draai de agent via Browser Use Box. Bekijk de 15-seconden demo.
En in de sessie:
bewerk deze tot een launch video
Het maakt een inventaris van de bronnen, stelt een strategie voor, wacht op je OK, en produceert dan edit/final.mp4 naast je bronnen. Alle uitvoer komt in <videos_dir>/edit/ — de skill-map blijft schoon.
Handmatige installatie
Als je het liever met de hand doet:
# 1. Kloon en symlink naar de skills-map van je agent
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Installeer afhankelijkheden
cd ~/Developer/video-use
uv sync # of: pip install -e .
brew install ffmpeg # vereist
brew install yt-dlp # optioneel, voor downloaden van online bronnen
# 3. Voeg je ElevenLabs API-sleutel toe
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Hoe het werkt
De LLM bekijkt de video nooit. Hij leest hem — via twee lagen die samen alles geven wat nodig is om met woordgrens-precisie te knippen.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composiet — filmstrip + luidsprekerspoor + golfvorm + woordlabels + stilte-gat knipkandidaten" width="100%"> </p>Laag 1 — Audiotranscript (altijd geladen). Eén ElevenLabs Scribe-aanroep per bron geeft tijdstempels op woordniveau, sprekerdiarisatie, en audio-evenementen ((gelach), (applaus), (zucht)). Alle takes worden gebundeld in een enkele ~12KB takes_packed.md — het primaire leesvenster van de LLM.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Negentig procent van wat een web-agent doet is volledig verspild.
[006.08-006.74] S0 Wij hebben dit opgelost.
Laag 2 — Visuele composiet (op aanvraag). timeline_view produceert een filmstrip + golfvorm + woordlabels PNG voor elk tijdsbereik. Wordt alleen aangeroepen bij beslispunten — dubbelzinnige pauzes, herkansingsvergelijkingen, knip-punt sanity checks.
Naïeve aanpak: 30.000 frames × 1.500 tokens = 45M tokens aan ruis. Video Use: 12KB tekst + een handvol PNG's.
Zelfde idee als browser-use die een LLM een gestructureerde DOM geeft in plaats van een screenshot — maar dan voor video.
Pipeline
Transcribeer ──> Bundel ──> LLM Redeneert ──> EDL ──> Renderen ──> Zelfevaluatie
│
└─ probleem? repareer + render opnieuw (max 3)
De zelfevaluatielus draait timeline_view op de gerenderde uitvoer bij elke knipgrens — signaleert visuele sprongen, audioploppen, verborgen ondertitels. Je ziet de preview pas nadat hij geslaagd is.
Ontwerpprincipes
- Tekst + visuals op aanvraag. Geen frame-dumping. Het transcript is het oppervlak.
- Audio is primair, visuals volgen. Knips komen van spraakgrenzen en stiltes.
- Vraag → bevestig → voer uit → zelfevaluatie → opslaan. Raak de knip nooit aan zonder strategiegoedkeuring.
- Geen aannames over contenttype. Kijk, vraag, bewerk dan.
- 12 harde regels, artistieke vrijheid elders. Productiecorrectheid is niet onderhandelbaar. Smaak niet.
Zie SKILL.md voor de volledige productieregels en bewerkingskunst.


