NanoSkill
Send inn din skill

Videoredigeringsagent-ferdighet

avbrowser-use9KGitHub-stjernerGitHub

Rediger videoer ved hjelp av AI med Claude-kode, automatiser oppgaver som klipping av fyllord, fargekorrigering og innbrenning av undertekster. Strømlinjeform videoproduksjonsflyten din og få en polert endelig MP4.

videoSikkerhetsskann bestått
Resultatforhåndsvisning

Full demo

Se en intervjuvideo polert til et sosiale medier-klipp med forbedret tempo, undertekster, forbedret lyd.

Kom i gang

Kjør din første oppgave

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Steg 1:Installer

    Legg til ferdigheten til agenten din.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Steg 2:Last opp videoen din

    Last opp en intervju-, veilednings- eller produktvideo og beskriv de ønskede redigeringene.

  3. the demo of Video Editing Agent Skill
    03

    Steg 3:Gjennomgå utdata

    Motta den redigerte versjonen og verifiser undertekster, overganger og tempo.

Installasjonskommando

$ npx skills add https://github.com/browser-use/video-use

Om

videobruk introduserer en innovativ tilnærming til videoredigering, ved å utnytte AI-agenter som Claude-kode for å automatisere kjedelige og tidkrevende oppgaver. Dette åpen kildekode-verktøyet lar brukere ganske enkelt slippe råopptak i en mappe, samhandle med en AI-agent og motta en polert `endelig.mp4`-utdata. Det er designet for å strømlinjeforme videoredigeringsprosessen for ulike innholdstyper, fra snakkende hoder til montasjer, ved intelligent håndtering av klipp, fargekorrigering og innbrenning av undertekster.

Systemet fungerer ved å lese videoinnhold gjennom detaljerte lydtranskripsjoner og visuelle kompositter på forespørsel, i stedet for å behandle hvert bilde. Denne metoden gir AI-en ordgrense-presisjon for redigering samtidig som beregningsmessig overhead reduseres betydelig. Viktige funksjoner inkluderer automatisk fjerning av fyllord og død plass, anvendelse av intelligente fargegraderinger, sikring av sømløse lydoverganger og innbrenning av tilpassbare undertekster direkte i videoen.

Utover automatisering inkorporerer videobruk en robust selvevalueringspipeline. Etter innledende behandling gjennomgår AI-en den renderte utdataen ved hver klippgrense for å oppdage og korrigere ufullkommenheter som visuelle hopp eller lydpopp. Dette sikrer at den endelige videoen møter høye produksjonsstandarder før den presenteres for brukeren. Verktøyet opprettholder også øktminne, slik at brukere kan plukke opp redigeringsøkter nøyaktig der de slapp, noe som forbedrer arbeidsflyteffektivitet og konsistens.

Nøkkelfunksjoner

Hva som gjør den kraftig

  • Automatisk fjerning av fyllord

    Kutter automatisk ut fyllord som 'umm', 'uh', falske starter og dødrom mellom opptak for renere lyd.

  • Intelligent fargegradering

    Autofargegraderer hvert videosegment, og tilbyr alternativer som varm filmatisk, nøytral punch, eller egendefinerte FFmpeg-kjeder for jevn visuell kvalitet.

  • Sømløse lydoverganger

    Legger på 30 ms lydoverganger ved hvert kutt for å eliminere knatrelyder og sikre jevne overganger mellom segmenter.

  • Tilpassbar innbrenning av undertekster

    Brenner undertekster direkte inn i videoen i en tilpassbar stil, med 2-ords STORE BOKSTAVER-biter som standard, noe som forbedrer tilgjengelighet og engasjement.

  • KI-drevet selvevaluering

    Systemet selvevaluerer det ferdigstilte utdata ved hver kuttegrense, og fanger visuelle hopp, lyd-popp og skjulte undertekster før forhåndsvisningen vises.

Brukstilfeller

Når du bør bruke den

  • Produsere profesjonelle pratsomme hode-videoer

    Finpuss raskt opptak av pratsomme hoder ved å fjerne pauser og fyllord, for å sikre en konsis og engasjerende presentasjon.

  • Skape dynamiske videomontasjer

    Sett enkelt sammen montasjer med automatiserte kutt, fargegradering og animasjonsoverlegg for et polert og profesjonelt utseende.

  • Effektivisere produksjon av veiledningsvideoer

    Akselerer produksjonen av veiledningsvideoer ved å automatisere repeterende redigeringsoppgaver, slik at skapere kan fokusere på innhold.

SKILL.md

videobruk

Introduserer videobruk — rediger videoer med Claude Code. 100 % åpen kildekode.

Slipp råmateriale i en mappe, chat med Claude Code, få final.mp4 tilbake. Fungerer for alt innhold — snakkende hoder, montasjer, opplæringsprogrammer, reise, intervjuer — uten forhåndsinnstillinger eller menyer.

Hva den gjør

  • Kutter ut fyllord (umm, uh, feilstarter) og dødrom mellom opptak
  • Automatisk fargegradering av hvert segment (varm filmatisk, nøytralt trøkk, eller hvilken som helst tilpasset ffmpeg-kjede)
  • 30 ms lydovertoninger ved hvert kutt så du aldri hører et smell
  • Brenner undertekster i din stil — standard 2-ords STORE BOKSTAVER-biter, fullt tilpassbart
  • Genererer animasjonsoverlegg via HyperFrames, Remotion, Manim, eller PIL — opprettes i parallelle underagenter, én per animasjon
  • Selv-evaluerer den renderte utdataen ved hver kutteovergang før du får se noe
  • Varig lagrer sesjonsminne i project.md slik at neste ukes sesjon fortsetter der du slapp

Oppsettsprompt

Lim inn i Claude Code, Codex, Hermes, Openclaw, eller hvilken som helst agent med skalltilgang:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Agenten håndterer kloning, avhengigheter, ferdighetsregistrering, og spør deg én gang om ElevenLabs API-nøkkelen din (hent en på elevenlabs.io/app/settings/api-keys).

Deretter pek agenten din til en mappe med råopptak:

cd /path/to/your/videos
claude    # or codex, hermes, etc.

For kontinuerlig redigering fra din egen VPS eller Telegram, kjør agenten gjennom Browser Use Box. Se den 15 sekunder lange demoen.

Og i sesjonen:

rediger disse til en lanseringsvideo

Den tar opptelling av kildene, foreslår en strategi, venter på din OK, og produserer så edit/final.mp4 ved siden av kildene dine. All utdata havner i <videos_dir>/edit/ — ferdighetsmappen forblir ren.

Manuell installasjon

Hvis du heller vil gjøre det for hånd:

# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Hvordan det fungerer

LLM-en ser aldri videoen. Den leser den — gjennom to lag som sammen gir den alt den trenger for å klippe med ordgrense-presisjon.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>

Lag 1 — Lydtranskripsjon (alltid lastet). Én ElevenLabs Scribe-kall per kilde gir tidsstempler på ordnivå, talediariering og lydhendelser ((latter), (applaus), (sukk)). Alle opptak pakkes inn i én enkelt ~12KB takes_packed.md — LLM-ens primære lesevisning.

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

Lag 2 — Visuell kompositt (på forespørsel). timeline_view produserer en filmstrimmel + bølgeform + ordetiketter PNG for ethvert tidsintervall. Kalles kun ved beslutningspunkter — tvetydige pauser, sammenligninger av gjentak, fornuftssjekker av klippepunkter.

Naiv tilnærming: 30 000 bilder × 1 500 symboler = 45M symboler med støy. Video Use: 12KB tekst + en håndfull PNG-er.

Samme idé som browser-use gir en LLM en strukturert DOM istedenfor et skjermbilde — men for video.

Rørledning

Transkriber ──> Pakk ──> LLM-resonnering ──> EDL ──> Render ──> Selv-eval
                                                              │
                                                              └─ problem? fiks + re-render (maks 3)

Selv-evalueringssløyfen kjører timeline_view på den renderte utdataen ved hver klippegrense — fanger opp visuelle hopp, lydsmell, skjulte undertekster. Du ser forhåndsvisningen først etter at den har passert.

Designprinsipper

  1. Tekst + visuelle elementer på forespørsel. Ingen bildedumping. Transkripsjonen er overflaten.
  2. Lyd er primær, det visuelle følger. Klipp kommer fra talegrenser og stillhetshull.
  3. Spør → bekreft → utfør → selv-evaluer → varig lagre. Aldri rør klippet uten strategigodkjenning.
  4. Null antagelser om innholdstype. Se, spør, og rediger så.
  5. 12 harde regler, kunstnerisk frihet ellers. Produksjonskorrekthet er ufravikelig. Smak er det ikke.

Se SKILL.md for alle produksjonsreglene og redigeringshåndverket.

FAQ