# Competenza per Agente di Editing Video

> Modifica i video usando l'IA con Claude Code, automatizzando attività come il taglio di parole riempitive, la gradazione del colore e la masterizzazione dei sottotitoli. Semplifica il flusso di lavoro della produzione video e ottieni un MP4 finale professionale.

- Canonical: https://nanoskill.ai/it/skills/video-editing
- Markdown: https://nanoskill.ai/it/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: it
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

uso-video introduce un approccio innovativo all'editing video, sfruttando agenti IA come Claude Code per automatizzare attività noiose e dispendiose in termini di tempo. Questo strumento open source consente agli utenti di trascinare semplicemente il filmato grezzo in una cartella, interagire con un agente IA e ricevere un output \`final.mp4\` rifinito. È progettato per semplificare il processo di editing video per vari tipi di contenuti, dai video parlati ai montaggi, gestendo in modo intelligente tagli, gradazione del colore e masterizzazione dei sottotitoli.

Il sistema opera leggendo il contenuto video tramite trascrizioni audio dettagliate e compositi visivi su richiesta, anziché elaborare ogni fotogramma. Questo metodo fornisce all'IA una precisione a livello di confine di parola per l'editing, riducendo al contempo sensibilmente il sovraccarico computazionale. Le funzionalità chiave includono la rimozione automatica di parole riempitive e pause, l'applicazione di gradazioni di colore intelligenti, la garanzia di transizioni audio senza soluzione di continuità e la masterizzazione di sottotitoli personalizzabili direttamente nel video.

Oltre all'automazione, uso-video incorpora una solida pipeline di autovalutazione. Dopo l'elaborazione iniziale, l'IA esamina l'output renderizzato in corrispondenza di ogni confine di taglio per rilevare e correggere imperfezioni come salti visivi o scoppiettii audio. Ciò garantisce che il video finale soddisfi elevati standard di produzione prima di essere presentato all'utente. Lo strumento mantiene anche una memoria di sessione, consentendo agli utenti di riprendere le sessioni di editing esattamente da dove le avevano interrotte, migliorando l'efficienza e la coerenza del flusso di lavoro.

## Key features

- **Rimozione automatica delle parole riempitive**: Taglia automaticamente parole riempitive come 'umm', 'uh', false partenze e spazio morto tra le riprese per un audio più pulito.
- **Gradazione del colore intelligente**: Applica la gradazione automatica del colore a ogni segmento video, offrendo opzioni come caldo cinematografico, punch neutro o catene FFmpeg personalizzate per una qualità visiva coerente.
- **Dissolvenze audio senza interruzioni**: Applica dissolvenze audio di 30 ms a ogni taglio per eliminare i pop e garantire transizioni fluide tra i segmenti.
- **Bruciatura personalizzabile dei sottotitoli**: Brucia i sottotitoli direttamente nel tuo video in uno stile personalizzabile, con blocchi di 2 parole in MAIUSCOLO per impostazione predefinita, migliorando accessibilità e coinvolgimento.
- **Autovalutazione alimentata dall'IA**: Il sistema valuta automaticamente l'output renderizzato a ogni confine di taglio, individuando salti visivi, pop audio e sottotitoli nascosti prima di mostrarti l'anteprima.

## Use cases

- **Produzione di video professionali con teste parlanti**: Perfeziona rapidamente i filmati di teste parlanti rimuovendo pause e parole riempitive, garantendo una presentazione concisa e coinvolgente.
- **Creazione di montaggi video dinamici**: Assembla senza sforzo montaggi con tagli automatici, gradazione del colore e sovrapposizioni animate per un aspetto raffinato e professionale.
- **Snellimento della produzione di video tutorial**: Accelera la creazione di video tutorial automatizzando attività di editing ripetitive, consentendo ai creatori di concentrarsi sui contenuti.

## Result preview

Guarda un video di un'intervista trasformato in una clip per social media con un ritmo migliorato, sottotitoli e audio potenziato.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### Passaggio 1：Installa

Aggiungi la competenza al tuo agente.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### Passaggio 2：Carica il tuo video

Carica un video di un'intervista, tutorial o prodotto e descrivi le modifiche desiderate.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### Passaggio 3：Rivedi l'output

Ricevi la versione modificata e verifica sottotitoli, transizioni e ritmo.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# uso-video

Introducendo **uso-video** — modifica video con Claude Codice. 100% a codice aperto.

Trascina il filmato grezzo in una cartella, chatta con Claude Codice, ottieni `final.mp4` di ritorno. Funziona per qualsiasi contenuto — video di persone che parlano, montaggi, tutorial, viaggi, interviste — senza preimpostazioni o menu.

## Cosa fa

- **Elimina le parole di riempimento** (`umm`, `uh`, false partenze) e lo spazio morto tra le riprese
- **Corregge automaticamente il colore** di ogni segmento (cinematografico caldo, impatto neutro, o qualsiasi catena ffmpeg personalizzata)
- **Dissolvenze audio di 30ms** a ogni taglio così non sentirai mai uno scoppiettio
- **Masterizza i sottotitoli** nel tuo stile — blocchi di 2 parole in MAIUSCOLO di default, completamente personalizzabile
- **Genera sovrimpressioni animate** tramite [IperFrames](https://github.com/heygen-com/hyperframes), [Remozione](https://www.remotion.dev/), [Manim](https://www.manim.community/), o PIL — avviate in sotto-agenti paralleli, uno per animazione
- **Autovaluta l'output renderizzato** a ogni confine di taglio prima di mostrarti qualsiasi cosa
- **Persiste la memoria della sessione** in `project.md` così che la sessione della prossima settimana riprenda da dove hai lasciato

## Prompt di configurazione

Incolla in Claude Codice, Codex, Hermes, Openclaw, o qualsiasi agente con accesso alla shell:

```text
Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
```

L'agente gestisce il clone, le dipendenze, la registrazione della competenza, e ti chiederà una volta di fornire la tua chiave API UndiciLaboratori (prendi una da [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)).

Poi indirizza il tuo agente a una cartella di riprese grezze:

```bash
cd /path/to/your/videos
claude    # or codex, hermes, etc.
```

Per un editing sempre attivo dal tuo VPS o Telegram, esegui l'agente attraverso [Scatola Uso Browser](https://browser-use.com/bux). [Guarda la demo di 15 secondi](https://www.tiktok.com/@browser_use/video/7639824093721758989).

E nella sessione:

> modificali in un video di lancio

Fa l'inventario delle fonti, propone una strategia, aspetta il tuo OK, poi produce `edit/final.mp4` accanto alle tue fonti. Tutti gli output si trovano in `<videos_dir>/edit/` — la directory della competenza rimane pulita.

## Installazione manuale

Se preferisci farlo a mano:

```bash
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## Come funziona

Il LLM non guarda mai il video. Lo **legge** — attraverso due livelli che insieme gli danno tutto ciò che serve per tagliare con precisione al confine di parola.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%">
</p>

**Livello 1 — Trascrizione audio (sempre caricata).** Una chiamata a UndiciLaboratori Scribe per sorgente fornisce timestamp a livello di parola, diarizzazione del parlante, ed eventi audio (`(risata)`, `(applauso)`, `(sospiro)`). Tutte le riprese vengono impacchettate in un singolo `takes_packed.md` di circa 12KB — la vista di lettura primaria del LLM.

```
## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.
```

**Livello 2 — Composito visivo (su richiesta).** `timeline_view` produce una pellicola + forma d'onda + etichette di parola PNG per qualsiasi intervallo di tempo. Chiamato solo nei punti di decisione — pause ambigue, confronti tra riprese, verifiche di integrità dei punti di taglio.

> Approccio naive: 30.000 fotogrammi × 1.500 token = **45M token di rumore**.
> Uso Video: **12KB di testo + una manciata di PNG**.

Stessa idea di uso-browser che dà a un LLM un DOM strutturato invece di uno screenshot — ma per il video.

## Pipeline

```
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)
```

Il ciclo di autovalutazione esegue `timeline_view` sull'_output renderizzato_ a ogni confine di taglio — cattura salti visivi, scoppiettii audio, sottotitoli nascosti. Vedi l'anteprima solo dopo che è passata.

## Principi di progettazione

1. **Testo + visuali su richiesta.** Nessuno scarico di fotogrammi. La trascrizione è la superficie.
2. **L'audio è primario, le visuali seguono.** I tagli derivano dai confini del parlato e dai gap di silenzio.
3. **Chiedi → conferma → esegui → autovaluta → persisti.** Mai toccare il taglio senza l'approvazione della strategia.
4. **Zero presupposizioni sul tipo di contenuto.** Guarda, chiedi, poi modifica.
5. **12 regole rigide, libertà artistica altrove.** La correttezza di produzione è non negoziabile. Il gusto no.

Vedi [`SKILL.md`](./SKILL.md) per le regole di produzione complete e il mestiere di editing.

## FAQ

### Che cos'è video-uso?

video-uso è uno strumento open-source che ti permette di modificare video usando agenti AI come Codice Claude. Automatizza attività di editing comuni come il taglio di parole riempitive, la gradazione del colore e l'aggiunta di sottotitoli.

### Come funziona video-uso senza che il LLM guardi il video?

Il LLM legge il video attraverso due livelli: una trascrizione audio con timestamp a livello di parola e diarizzazione del parlante, e compositi visivi su richiesta (filmstrip + waveform + etichette di parole PNG) per i punti decisionali. Questo approccio minimizza l'uso di token fornendo al contempo capacità di editing precise.

### Che tipi di video posso modificare con video-uso?

video-uso è progettato per funzionare con qualsiasi tipo di contenuto, inclusi teste parlanti, montaggi, tutorial, vlog di viaggio e interviste. Si adatta al tuo filmato senza richiedere preset o menu.

### Quali sono le funzionalità principali di video-uso?

Le funzionalità chiave includono il taglio di parole riempitive e spazi morti, la gradazione automatica del colore, dissolvenze audio di 30 ms, la bruciatura di sottotitoli personalizzabili, la generazione di sovrapposizioni animate, l'autovalutazione dell'output renderizzato e la persistenza della memoria di sessione.

### Ho bisogno di una chiave API di UndiciLabs per usare video-uso?

Sì, è richiesta una chiave API di UndiciLabs per la trascrizione audio e la diarizzazione del parlante, che sono cruciali per la funzionalità dello strumento. Ti verrà chiesto di fornirla durante il processo di configurazione.

### Posso installare manualmente video-uso invece di usare il prompt di configurazione?

Sì, puoi eseguire un'installazione manuale clonando il repository, creando un collegamento simbolico nella directory delle competenze del tuo agente, installando dipendenze come FFmpeg e configurando la tua chiave API di UndiciLabs nel file .env.
