videobruk
Introduserer videobruk — rediger videoer med Claude Code. 100 % åpen kildekode.
Slipp råmateriale i en mappe, chat med Claude Code, få final.mp4 tilbake. Fungerer for alt innhold — snakkende hoder, montasjer, opplæringsprogrammer, reise, intervjuer — uten forhåndsinnstillinger eller menyer.
Hva den gjør
- Kutter ut fyllord (
umm,uh, feilstarter) og dødrom mellom opptak - Automatisk fargegradering av hvert segment (varm filmatisk, nøytralt trøkk, eller hvilken som helst tilpasset ffmpeg-kjede)
- 30 ms lydovertoninger ved hvert kutt så du aldri hører et smell
- Brenner undertekster i din stil — standard 2-ords STORE BOKSTAVER-biter, fullt tilpassbart
- Genererer animasjonsoverlegg via HyperFrames, Remotion, Manim, eller PIL — opprettes i parallelle underagenter, én per animasjon
- Selv-evaluerer den renderte utdataen ved hver kutteovergang før du får se noe
- Varig lagrer sesjonsminne i
project.mdslik at neste ukes sesjon fortsetter der du slapp
Oppsettsprompt
Lim inn i Claude Code, Codex, Hermes, Openclaw, eller hvilken som helst agent med skalltilgang:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agenten håndterer kloning, avhengigheter, ferdighetsregistrering, og spør deg én gang om ElevenLabs API-nøkkelen din (hent en på elevenlabs.io/app/settings/api-keys).
Deretter pek agenten din til en mappe med råopptak:
cd /path/to/your/videos
claude # or codex, hermes, etc.
For kontinuerlig redigering fra din egen VPS eller Telegram, kjør agenten gjennom Browser Use Box. Se den 15 sekunder lange demoen.
Og i sesjonen:
rediger disse til en lanseringsvideo
Den tar opptelling av kildene, foreslår en strategi, venter på din OK, og produserer så edit/final.mp4 ved siden av kildene dine. All utdata havner i <videos_dir>/edit/ — ferdighetsmappen forblir ren.
Manuell installasjon
Hvis du heller vil gjøre det for hånd:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Hvordan det fungerer
LLM-en ser aldri videoen. Den leser den — gjennom to lag som sammen gir den alt den trenger for å klippe med ordgrense-presisjon.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>Lag 1 — Lydtranskripsjon (alltid lastet). Én ElevenLabs Scribe-kall per kilde gir tidsstempler på ordnivå, talediariering og lydhendelser ((latter), (applaus), (sukk)). Alle opptak pakkes inn i én enkelt ~12KB takes_packed.md — LLM-ens primære lesevisning.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Lag 2 — Visuell kompositt (på forespørsel). timeline_view produserer en filmstrimmel + bølgeform + ordetiketter PNG for ethvert tidsintervall. Kalles kun ved beslutningspunkter — tvetydige pauser, sammenligninger av gjentak, fornuftssjekker av klippepunkter.
Naiv tilnærming: 30 000 bilder × 1 500 symboler = 45M symboler med støy. Video Use: 12KB tekst + en håndfull PNG-er.
Samme idé som browser-use gir en LLM en strukturert DOM istedenfor et skjermbilde — men for video.
Rørledning
Transkriber ──> Pakk ──> LLM-resonnering ──> EDL ──> Render ──> Selv-eval
│
└─ problem? fiks + re-render (maks 3)
Selv-evalueringssløyfen kjører timeline_view på den renderte utdataen ved hver klippegrense — fanger opp visuelle hopp, lydsmell, skjulte undertekster. Du ser forhåndsvisningen først etter at den har passert.
Designprinsipper
- Tekst + visuelle elementer på forespørsel. Ingen bildedumping. Transkripsjonen er overflaten.
- Lyd er primær, det visuelle følger. Klipp kommer fra talegrenser og stillhetshull.
- Spør → bekreft → utfør → selv-evaluer → varig lagre. Aldri rør klippet uten strategigodkjenning.
- Null antagelser om innholdstype. Se, spør, og rediger så.
- 12 harde regler, kunstnerisk frihet ellers. Produksjonskorrekthet er ufravikelig. Smak er det ikke.
Se SKILL.md for alle produksjonsreglene og redigeringshåndverket.


