uso-video
Introducendo uso-video — modifica video con Claude Codice. 100% a codice aperto.
Trascina il filmato grezzo in una cartella, chatta con Claude Codice, ottieni final.mp4 di ritorno. Funziona per qualsiasi contenuto — video di persone che parlano, montaggi, tutorial, viaggi, interviste — senza preimpostazioni o menu.
Cosa fa
- Elimina le parole di riempimento (
umm,uh, false partenze) e lo spazio morto tra le riprese - Corregge automaticamente il colore di ogni segmento (cinematografico caldo, impatto neutro, o qualsiasi catena ffmpeg personalizzata)
- Dissolvenze audio di 30ms a ogni taglio così non sentirai mai uno scoppiettio
- Masterizza i sottotitoli nel tuo stile — blocchi di 2 parole in MAIUSCOLO di default, completamente personalizzabile
- Genera sovrimpressioni animate tramite IperFrames, Remozione, Manim, o PIL — avviate in sotto-agenti paralleli, uno per animazione
- Autovaluta l'output renderizzato a ogni confine di taglio prima di mostrarti qualsiasi cosa
- Persiste la memoria della sessione in
project.mdcosì che la sessione della prossima settimana riprenda da dove hai lasciato
Prompt di configurazione
Incolla in Claude Codice, Codex, Hermes, Openclaw, o qualsiasi agente con accesso alla shell:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
L'agente gestisce il clone, le dipendenze, la registrazione della competenza, e ti chiederà una volta di fornire la tua chiave API UndiciLaboratori (prendi una da elevenlabs.io/app/settings/api-keys).
Poi indirizza il tuo agente a una cartella di riprese grezze:
cd /path/to/your/videos
claude # or codex, hermes, etc.
Per un editing sempre attivo dal tuo VPS o Telegram, esegui l'agente attraverso Scatola Uso Browser. Guarda la demo di 15 secondi.
E nella sessione:
modificali in un video di lancio
Fa l'inventario delle fonti, propone una strategia, aspetta il tuo OK, poi produce edit/final.mp4 accanto alle tue fonti. Tutti gli output si trovano in <videos_dir>/edit/ — la directory della competenza rimane pulita.
Installazione manuale
Se preferisci farlo a mano:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Come funziona
Il LLM non guarda mai il video. Lo legge — attraverso due livelli che insieme gli danno tutto ciò che serve per tagliare con precisione al confine di parola.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>Livello 1 — Trascrizione audio (sempre caricata). Una chiamata a UndiciLaboratori Scribe per sorgente fornisce timestamp a livello di parola, diarizzazione del parlante, ed eventi audio ((risata), (applauso), (sospiro)). Tutte le riprese vengono impacchettate in un singolo takes_packed.md di circa 12KB — la vista di lettura primaria del LLM.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Livello 2 — Composito visivo (su richiesta). timeline_view produce una pellicola + forma d'onda + etichette di parola PNG per qualsiasi intervallo di tempo. Chiamato solo nei punti di decisione — pause ambigue, confronti tra riprese, verifiche di integrità dei punti di taglio.
Approccio naive: 30.000 fotogrammi × 1.500 token = 45M token di rumore. Uso Video: 12KB di testo + una manciata di PNG.
Stessa idea di uso-browser che dà a un LLM un DOM strutturato invece di uno screenshot — ma per il video.
Pipeline
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Il ciclo di autovalutazione esegue timeline_view sull'output renderizzato a ogni confine di taglio — cattura salti visivi, scoppiettii audio, sottotitoli nascosti. Vedi l'anteprima solo dopo che è passata.
Principi di progettazione
- Testo + visuali su richiesta. Nessuno scarico di fotogrammi. La trascrizione è la superficie.
- L'audio è primario, le visuali seguono. I tagli derivano dai confini del parlato e dai gap di silenzio.
- Chiedi → conferma → esegui → autovaluta → persisti. Mai toccare il taglio senza l'approvazione della strategia.
- Zero presupposizioni sul tipo di contenuto. Guarda, chiedi, poi modifica.
- 12 regole rigide, libertà artistica altrove. La correttezza di produzione è non negoziabile. Il gusto no.
Vedi SKILL.md per le regole di produzione complete e il mestiere di editing.


