video-brug
Vi præsenterer video-brug — rediger videoer med Claude Code. 100% open source.
Læg råoptagelser i en mappe, chat med Claude Code, få final.mp4 tilbage. Virker til alt indhold — talende hoveder, montager, tutorials, rejse, interviews — uden forudindstillinger eller menuer.
Hvad den gør
- Fjerner fyldord (
umm,uh, falske starter) og dødt rum mellem takes - Auto-farvegraderer hvert segment (varm cinematisk, neutral punch eller enhver tilpasset ffmpeg-kæde)
- 30ms lydfade ved hver klipning, så du aldrig hører et pop
- Brænder undertekster i din stil — 2-ord STORE BOGSTAVER-blokke som standard, fuldt tilpasselig
- Genererer animationsoverlays via HyperFrames, Remotion, Manim, eller PIL — spawnet i parallelle sub-agenter, én pr. animation
- Selvurderer den rendrerede output ved hver klipningsgrænse, før den viser dig noget
- Gemmer sessionhukommelse i
project.md, så næste uges session fortsætter, hvor du slap
Opsætningsprompt
Indsæt i Claude Code, Codex, Hermes, Openclaw eller enhver agent med shell-adgang:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agenten håndterer kloning, afhængigheder, skill-registrering og beder dig én gang om din ElevenLabs API-nøgle (hent en på elevenlabs.io/app/settings/api-keys).
Peg herefter din agent mod en mappe med råoptagelser:
cd /path/to/your/videos
claude # or codex, hermes, etc.
For altid tændt redigering fra din egen VPS eller Telegram, kør agenten gennem Browser Use Box. Se den 15-sekunders demo.
Og i sessionen:
rediger disse til en launch-video
Den opgør kilderne, foreslår en strategi, venter på din godkendelse og producerer derefter edit/final.mp4 ved siden af dine kilder. Alle output ligger i <videos_dir>/edit/ — skill-mappen forbliver ren.
Manuel installation
Hvis du hellere vil gøre det manuelt:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Sådan virker det
LLM'en ser aldrig videoen. Den læser den — gennem to lag, der tilsammen giver den alt, hvad den behøver for at klippe med ordgrænse-præcision.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view komposit — filmstrimmel + speaker-spor + bølgeform + ordetiketter + stilhed-gab klipkandidater" width="100%"> </p>Lag 1 — lydtransskription (altid indlæst). Ét ElevenLabs Scribe-kald pr. kilde giver ordniveau-tidsstempler, taler-diarization og lydbegivenheder ((latter), (bifald), (suk)). Alle takes pakkes i en enkelt ~12KB takes_packed.md — LLM'ens primære læsevisning.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Lag 2 — visuel komposit (på forespørgsel). timeline_view producerer en filmstrimmel + bølgeform + ordetiketter PNG for ethvert tidsinterval. Kaldes kun ved beslutningspunkter — tvetydige pauser, genoptagelses-sammenligninger, fornuftskontrol af klippepunkter.
Naiv tilgang: 30.000 frames × 1.500 tokens = 45M tokens støj. Video Brug: 12KB tekst + en håndfuld PNG'er.
Samme idé som browser-use giver en LLM en struktureret DOM i stedet for et skærmbillede — men til video.
Pipeline
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Selvurderingsløkken kører timeline_view på den rendrerede output ved hver klipningsgrænse — fanger visuelle spring, lydpop, skjulte undertekster. Du ser forhåndsvisningen kun, når den er godkendt.
Designprincipper
- Tekst + visuals på forespørgsel. Ingen frame-dumping. Transskriptionen er overfladen.
- Lyd er primær, visuals følger. Klip kommer fra talegrænser og stilhedsgab.
- Spørg → bekræft → udfør → selvurder → gem. Rør aldrig klippet uden strategigodkendelse.
- Ingen antagelser om indholdstype. Se, spørg, rediger derefter.
- 12 faste regler, kunstnerisk frihed ellers. Produktionskorrekthed er ikke til forhandling. Smag er det.
Se SKILL.md for de fulde produktionsregler og redigeringshåndværk.


