NanoSkill
Invia la tua skill

Competenza per Agente di Editing Video

dibrowser-use9Kstelle GitHubGitHub

Modifica i video usando l'IA con Claude Code, automatizzando attività come il taglio di parole riempitive, la gradazione del colore e la masterizzazione dei sottotitoli. Semplifica il flusso di lavoro della produzione video e ottieni un MP4 finale professionale.

videoScansione di sicurezza superata
Anteprima risultato

Demo completa

Guarda un video di un'intervista trasformato in una clip per social media con un ritmo migliorato, sottotitoli e audio potenziato.

Per iniziare

Esegui il primo task

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Passaggio 1:Installa

    Aggiungi la competenza al tuo agente.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Passaggio 2:Carica il tuo video

    Carica un video di un'intervista, tutorial o prodotto e descrivi le modifiche desiderate.

  3. the demo of Video Editing Agent Skill
    03

    Passaggio 3:Rivedi l'output

    Ricevi la versione modificata e verifica sottotitoli, transizioni e ritmo.

Comando di installazione

$ npx skills add https://github.com/browser-use/video-use

Informazioni

uso-video introduce un approccio innovativo all'editing video, sfruttando agenti IA come Claude Code per automatizzare attività noiose e dispendiose in termini di tempo. Questo strumento open source consente agli utenti di trascinare semplicemente il filmato grezzo in una cartella, interagire con un agente IA e ricevere un output `final.mp4` rifinito. È progettato per semplificare il processo di editing video per vari tipi di contenuti, dai video parlati ai montaggi, gestendo in modo intelligente tagli, gradazione del colore e masterizzazione dei sottotitoli.

Il sistema opera leggendo il contenuto video tramite trascrizioni audio dettagliate e compositi visivi su richiesta, anziché elaborare ogni fotogramma. Questo metodo fornisce all'IA una precisione a livello di confine di parola per l'editing, riducendo al contempo sensibilmente il sovraccarico computazionale. Le funzionalità chiave includono la rimozione automatica di parole riempitive e pause, l'applicazione di gradazioni di colore intelligenti, la garanzia di transizioni audio senza soluzione di continuità e la masterizzazione di sottotitoli personalizzabili direttamente nel video.

Oltre all'automazione, uso-video incorpora una solida pipeline di autovalutazione. Dopo l'elaborazione iniziale, l'IA esamina l'output renderizzato in corrispondenza di ogni confine di taglio per rilevare e correggere imperfezioni come salti visivi o scoppiettii audio. Ciò garantisce che il video finale soddisfi elevati standard di produzione prima di essere presentato all'utente. Lo strumento mantiene anche una memoria di sessione, consentendo agli utenti di riprendere le sessioni di editing esattamente da dove le avevano interrotte, migliorando l'efficienza e la coerenza del flusso di lavoro.

Funzioni chiave

Cosa la rende potente

  • Rimozione automatica delle parole riempitive

    Taglia automaticamente parole riempitive come 'umm', 'uh', false partenze e spazio morto tra le riprese per un audio più pulito.

  • Gradazione del colore intelligente

    Applica la gradazione automatica del colore a ogni segmento video, offrendo opzioni come caldo cinematografico, punch neutro o catene FFmpeg personalizzate per una qualità visiva coerente.

  • Dissolvenze audio senza interruzioni

    Applica dissolvenze audio di 30 ms a ogni taglio per eliminare i pop e garantire transizioni fluide tra i segmenti.

  • Bruciatura personalizzabile dei sottotitoli

    Brucia i sottotitoli direttamente nel tuo video in uno stile personalizzabile, con blocchi di 2 parole in MAIUSCOLO per impostazione predefinita, migliorando accessibilità e coinvolgimento.

  • Autovalutazione alimentata dall'IA

    Il sistema valuta automaticamente l'output renderizzato a ogni confine di taglio, individuando salti visivi, pop audio e sottotitoli nascosti prima di mostrarti l'anteprima.

Casi d’uso

Quando usarla

  • Produzione di video professionali con teste parlanti

    Perfeziona rapidamente i filmati di teste parlanti rimuovendo pause e parole riempitive, garantendo una presentazione concisa e coinvolgente.

  • Creazione di montaggi video dinamici

    Assembla senza sforzo montaggi con tagli automatici, gradazione del colore e sovrapposizioni animate per un aspetto raffinato e professionale.

  • Snellimento della produzione di video tutorial

    Accelera la creazione di video tutorial automatizzando attività di editing ripetitive, consentendo ai creatori di concentrarsi sui contenuti.

SKILL.md

uso-video

Introducendo uso-video — modifica video con Claude Codice. 100% a codice aperto.

Trascina il filmato grezzo in una cartella, chatta con Claude Codice, ottieni final.mp4 di ritorno. Funziona per qualsiasi contenuto — video di persone che parlano, montaggi, tutorial, viaggi, interviste — senza preimpostazioni o menu.

Cosa fa

  • Elimina le parole di riempimento (umm, uh, false partenze) e lo spazio morto tra le riprese
  • Corregge automaticamente il colore di ogni segmento (cinematografico caldo, impatto neutro, o qualsiasi catena ffmpeg personalizzata)
  • Dissolvenze audio di 30ms a ogni taglio così non sentirai mai uno scoppiettio
  • Masterizza i sottotitoli nel tuo stile — blocchi di 2 parole in MAIUSCOLO di default, completamente personalizzabile
  • Genera sovrimpressioni animate tramite IperFrames, Remozione, Manim, o PIL — avviate in sotto-agenti paralleli, uno per animazione
  • Autovaluta l'output renderizzato a ogni confine di taglio prima di mostrarti qualsiasi cosa
  • Persiste la memoria della sessione in project.md così che la sessione della prossima settimana riprenda da dove hai lasciato

Prompt di configurazione

Incolla in Claude Codice, Codex, Hermes, Openclaw, o qualsiasi agente con accesso alla shell:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

L'agente gestisce il clone, le dipendenze, la registrazione della competenza, e ti chiederà una volta di fornire la tua chiave API UndiciLaboratori (prendi una da elevenlabs.io/app/settings/api-keys).

Poi indirizza il tuo agente a una cartella di riprese grezze:

cd /path/to/your/videos
claude    # or codex, hermes, etc.

Per un editing sempre attivo dal tuo VPS o Telegram, esegui l'agente attraverso Scatola Uso Browser. Guarda la demo di 15 secondi.

E nella sessione:

modificali in un video di lancio

Fa l'inventario delle fonti, propone una strategia, aspetta il tuo OK, poi produce edit/final.mp4 accanto alle tue fonti. Tutti gli output si trovano in <videos_dir>/edit/ — la directory della competenza rimane pulita.

Installazione manuale

Se preferisci farlo a mano:

# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Come funziona

Il LLM non guarda mai il video. Lo legge — attraverso due livelli che insieme gli danno tutto ciò che serve per tagliare con precisione al confine di parola.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>

Livello 1 — Trascrizione audio (sempre caricata). Una chiamata a UndiciLaboratori Scribe per sorgente fornisce timestamp a livello di parola, diarizzazione del parlante, ed eventi audio ((risata), (applauso), (sospiro)). Tutte le riprese vengono impacchettate in un singolo takes_packed.md di circa 12KB — la vista di lettura primaria del LLM.

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

Livello 2 — Composito visivo (su richiesta). timeline_view produce una pellicola + forma d'onda + etichette di parola PNG per qualsiasi intervallo di tempo. Chiamato solo nei punti di decisione — pause ambigue, confronti tra riprese, verifiche di integrità dei punti di taglio.

Approccio naive: 30.000 fotogrammi × 1.500 token = 45M token di rumore. Uso Video: 12KB di testo + una manciata di PNG.

Stessa idea di uso-browser che dà a un LLM un DOM strutturato invece di uno screenshot — ma per il video.

Pipeline

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

Il ciclo di autovalutazione esegue timeline_view sull'output renderizzato a ogni confine di taglio — cattura salti visivi, scoppiettii audio, sottotitoli nascosti. Vedi l'anteprima solo dopo che è passata.

Principi di progettazione

  1. Testo + visuali su richiesta. Nessuno scarico di fotogrammi. La trascrizione è la superficie.
  2. L'audio è primario, le visuali seguono. I tagli derivano dai confini del parlato e dai gap di silenzio.
  3. Chiedi → conferma → esegui → autovaluta → persisti. Mai toccare il taglio senza l'approvazione della strategia.
  4. Zero presupposizioni sul tipo di contenuto. Guarda, chiedi, poi modifica.
  5. 12 regole rigide, libertà artistica altrove. La correttezza di produzione è non negoziabile. Il gusto no.

Vedi SKILL.md per le regole di produzione complete e il mestiere di editing.

FAQ