NanoSkill
Enviar sua skill

Habilidade de Agente de Edição de Vídeo

porbrowser-use9Kestrelas no GitHubGitHub

Edite vídeos usando IA com Claude Code, automatizando tarefas como cortar palavras de preenchimento, gradação de cores e queimar legendas. Simplifique seu fluxo de trabalho de produção de vídeo e obtenha um MP4 final polido.

vídeoVerificação de segurança aprovada
Prévia do resultado

Demo completa

Veja um vídeo de entrevista polido em um clipe para redes sociais com ritmo melhorado, legendas e áudio aprimorado.

Primeiros passos

Execute sua primeira tarefa

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Passo 1: Instalar

    Adicione a habilidade ao seu agente.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Passo 2:Envie seu vídeo

    Envie um vídeo de entrevista, tutorial ou produto e descreva as edições desejadas.

  3. the demo of Video Editing Agent Skill
    03

    Passo 3:Revise a saída

    Receba a versão editada e verifique legendas, transições e ritmo.

Comando de instalação

$ npx skills add https://github.com/browser-use/video-use

Sobre

video-use introduz uma abordagem inovadora para edição de vídeo, aproveitando agentes de IA como o Claude Code para automatizar tarefas tediosas e demoradas. Esta ferramenta de código aberto permite que os usuários simplesmente joguem a filmagem bruta em uma pasta, interajam com um agente de IA e recebam um resultado `final.mp4` polido. Ela foi projetada para simplificar o processo de edição de vídeo para vários tipos de conteúdo, de vídeos de entrevista a montagens, lidando de forma inteligente com cortes, gradação de cores e queima de legendas.

O sistema opera lendo o conteúdo do vídeo por meio de transcrições de áudio detalhadas e composições visuais sob demanda, em vez de processar cada quadro. Esse método fornece à IA precisão de limite de palavras para edição, reduzindo significativamente a sobrecarga computacional. As principais capacidades incluem remover automaticamente palavras de preenchimento e espaços mortos, aplicar gradações de cores inteligentes, garantir transições de áudio perfeitas e queimar legendas personalizáveis diretamente no vídeo.

Além da automação, o video-use incorpora um robusto pipeline de autoavaliação. Após o processamento inicial, a IA revisa a saída renderizada em cada limite de corte para detectar e corrigir imperfeições, como saltos visuais ou estalos de áudio. Isso garante que o vídeo final atenda a altos padrões de produção antes de ser apresentado ao usuário. A ferramenta também mantém memória de sessão, permitindo que os usuários retomem sessões de edição exatamente de onde pararam, aumentando a eficiência e a consistência do fluxo de trabalho.

Recursos-chave

O que a torna poderosa

  • Remoção Automatizada de Palavras de Preenchimento

    Remove automaticamente palavras de preenchimento como 'umm', 'uh', inícios falsos e espaços mortos entre as tomadas para um áudio mais limpo.

  • Correção de Cor Inteligente

    Faz a correção de cor automática de cada segmento de vídeo, oferecendo opções como visual cinematográfico quente, impacto neutro ou cadeias FFmpeg personalizadas para qualidade visual consistente.

  • Fades de Áudio Perfeitos

    Aplica fades de áudio de 30 ms em cada corte para eliminar estalos e garantir transições suaves entre os segmentos.

  • Queima de Legendas Personalizável

    Grava legendas diretamente no seu vídeo em um estilo personalizável, com blocos de 2 palavras em MAIÚSCULAS como padrão, melhorando a acessibilidade e o engajamento.

  • Autoavaliação com IA

    O sistema autoavalia a saída renderizada em cada limite de corte, detectando saltos visuais, estalos de áudio e legendas ocultas antes de mostrar a prévia.

Casos de uso

Quando usar

  • Produzindo Vídeos Profissionais de Pessoa Falando

    Refine rapidamente filmagens de pessoa falando removendo pausas e palavras de preenchimento, garantindo uma apresentação concisa e envolvente.

  • Criando Montagens de Vídeo Dinâmicas

    Monte montagens sem esforço com cortes automatizados, correção de cor e sobreposições de animação para um visual polido e profissional.

  • Simplificando a Produção de Vídeos Tutoriais

    Acelere a criação de vídeos tutoriais automatizando tarefas repetitivas de edição, permitindo que os criadores se concentrem no conteúdo.

SKILL.md

video-use

Apresentando o video-use — edite vídeos com o Claude Code. 100% código aberto.

Solte as filmagens brutas em uma pasta, converse com o Claude Code e receba final.mp4 de volta. Funciona para qualquer conteúdo — vídeos de apresentadores, montagens, tutoriais, viagens, entrevistas — sem predefinições ou menus.

O que ele faz

  • Remove palavras de preenchimento (umm, uh, falsos começos) e espaços mortos entre tomadas
  • Aplica correção de cor automática em cada segmento (efeito cinematográfico quente, impacto neutro ou qualquer cadeia ffmpeg personalizada)
  • Fades de áudio de 30ms em cada corte para você nunca ouvir um estouro
  • Grava legendas no seu estilo — blocos de 2 palavras em CAIXA ALTA por padrão, totalmente personalizáveis
  • Gera sobreposições de animação via HyperFrames, Remotion, Manim ou PIL — geradas em subagentes paralelos, um por animação
  • Autoavalia a saída renderizada em cada limite de corte antes de mostrar qualquer coisa para você
  • Persiste a memória da sessão em project.md para que a sessão da próxima semana continue de onde você parou

Prompt de configuração

Cole no Claude Code, Codex, Hermes, Openclaw ou qualquer agente com acesso shell:

Configure https://github.com/browser-use/video-use para mim.

Leia install.md primeiro para instalar este repositório, conectar o ffmpeg, registrar a habilidade com o agente que você está executando e configurar a chave de API do ElevenLabs — peça para eu colar quando precisar. Depois, leia SKILL.md para uso diário e sempre leia helpers/ porque é onde os scripts de edição residem. Após a instalação, não transcreva nada por conta própria — apenas me diga que está pronto e aguarde eu soltar as filmagens em uma pasta.

O agente cuida da clonagem, dependências, registro da habilidade e solicita uma vez sua chave de API do ElevenLabs (pegue uma em elevenlabs.io/app/settings/api-keys).

Depois, aponte seu agente para uma pasta de tomadas brutas:

cd /caminho/para/seus/vídeos
claude    # ou codex, hermes, etc.

Para edição contínua a partir do seu próprio VPS ou Telegram, execute o agente através do Browser Use Box. Assista à demonstração de 15 segundos.

E na sessão:

edite isso em um vídeo de lançamento

Ele inventaria as fontes, propõe uma estratégia, aguarda seu OK e então produz edit/final.mp4 ao lado de suas fontes. Todas as saídas ficam em <vídeos_dir>/edit/ — o diretório da habilidade permanece limpo.

Instalação manual

Se preferir fazer manualmente:

# 1. Clone e crie link simbólico no diretório de habilidades do seu agente
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Instale dependências
cd ~/Developer/video-use
uv sync                         # ou: pip install -e .
brew install ffmpeg             # obrigatório
brew install yt-dlp             # opcional, para baixar fontes online

# 3. Adicione sua chave de API do ElevenLabs
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Como funciona

O LLM nunca assiste ao vídeo. Ele — por meio de duas camadas que juntas fornecem tudo que ele precisa para cortar com precisão nos limites das palavras.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composição timeline_view — tira de filme + trilha de locutor + forma de onda + rótulos de palavras + candidatos a corte de lacuna de silêncio" width="100%"> </p>

Camada 1 — Transcrição de áudio (sempre carregada). Uma chamada ao ElevenLabs Scribe por fonte fornece timestamps no nível da palavra, diarização de locutor e eventos de áudio ((risos), (aplausos), (suspiro)). Todas as tomadas são empacotadas em um único arquivo ~12KB takes_packed.md — a visão de leitura primária do LLM.

## C0103  (duração: 43.0s, 8 frases)
  [002.52-005.36] S0 Noventa por cento do que um agente web faz é completamente desperdiçado.
  [006.08-006.74] S0 Nós corrigimos isso.

Camada 2 — Composição visual (sob demanda). timeline_view produz um PNG com tira de filme + forma de onda + rótulos de palavras para qualquer intervalo de tempo. Chamado apenas nos pontos de decisão — pausas ambíguas, comparações de refilmagens, verificações de corte.

Abordagem ingênua: 30.000 quadros × 1.500 tokens = 45M tokens de ruído. Video Use: 12KB de texto + um punhado de PNGs.

Mesma ideia do browser-use fornecendo a um LLM um DOM estruturado em vez de uma captura de tela — mas para vídeo.

Pipeline

Transcrever ──> Empacotar ──> LLM Raciocina ──> EDL ──> Renderizar ──> Autoavaliação
                                                              │
                                                              └─ problema? corrigir + re-renderizar (máx. 3)

O ciclo de autoavaliação executa timeline_view na saída renderizada em cada limite de corte — detecta saltos visuais, estouros de áudio, legendas ocultas. Você vê a prévia somente depois de passar.

Princípios de design

  1. Texto + visuais sob demanda. Sem despejo de quadros. A transcrição é a superfície.
  2. Áudio é primário, visuais seguem. Cortes vêm dos limites da fala e lacunas de silêncio.
  3. Perguntar → confirmar → executar → autoavaliar → persistir. Nunca toque no corte sem aprovação da estratégia.
  4. Zero suposições sobre o tipo de conteúdo. Olhe, pergunte e então edite.
  5. 12 regras rígidas, liberdade artística no resto. Correção de produção é inegociável. Gosto não é.

Veja SKILL.md para as regras completas de produção e a arte da edição.

FAQ