# Habilidade de Agente de Edição de Vídeo

> Edite vídeos usando IA com Claude Code, automatizando tarefas como cortar palavras de preenchimento, gradação de cores e queimar legendas. Simplifique seu fluxo de trabalho de produção de vídeo e obtenha um MP4 final polido.

- Canonical: https://nanoskill.ai/pt/skills/video-editing
- Markdown: https://nanoskill.ai/pt/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: pt
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

video-use introduz uma abordagem inovadora para edição de vídeo, aproveitando agentes de IA como o Claude Code para automatizar tarefas tediosas e demoradas. Esta ferramenta de código aberto permite que os usuários simplesmente joguem a filmagem bruta em uma pasta, interajam com um agente de IA e recebam um resultado \`final.mp4\` polido. Ela foi projetada para simplificar o processo de edição de vídeo para vários tipos de conteúdo, de vídeos de entrevista a montagens, lidando de forma inteligente com cortes, gradação de cores e queima de legendas.

O sistema opera lendo o conteúdo do vídeo por meio de transcrições de áudio detalhadas e composições visuais sob demanda, em vez de processar cada quadro. Esse método fornece à IA precisão de limite de palavras para edição, reduzindo significativamente a sobrecarga computacional. As principais capacidades incluem remover automaticamente palavras de preenchimento e espaços mortos, aplicar gradações de cores inteligentes, garantir transições de áudio perfeitas e queimar legendas personalizáveis diretamente no vídeo.

Além da automação, o video-use incorpora um robusto pipeline de autoavaliação. Após o processamento inicial, a IA revisa a saída renderizada em cada limite de corte para detectar e corrigir imperfeições, como saltos visuais ou estalos de áudio. Isso garante que o vídeo final atenda a altos padrões de produção antes de ser apresentado ao usuário. A ferramenta também mantém memória de sessão, permitindo que os usuários retomem sessões de edição exatamente de onde pararam, aumentando a eficiência e a consistência do fluxo de trabalho.

## Key features

- **Remoção Automatizada de Palavras de Preenchimento**: Remove automaticamente palavras de preenchimento como 'umm', 'uh', inícios falsos e espaços mortos entre as tomadas para um áudio mais limpo.
- **Correção de Cor Inteligente**: Faz a correção de cor automática de cada segmento de vídeo, oferecendo opções como visual cinematográfico quente, impacto neutro ou cadeias FFmpeg personalizadas para qualidade visual consistente.
- **Fades de Áudio Perfeitos**: Aplica fades de áudio de 30 ms em cada corte para eliminar estalos e garantir transições suaves entre os segmentos.
- **Queima de Legendas Personalizável**: Grava legendas diretamente no seu vídeo em um estilo personalizável, com blocos de 2 palavras em MAIÚSCULAS como padrão, melhorando a acessibilidade e o engajamento.
- **Autoavaliação com IA**: O sistema autoavalia a saída renderizada em cada limite de corte, detectando saltos visuais, estalos de áudio e legendas ocultas antes de mostrar a prévia.

## Use cases

- **Produzindo Vídeos Profissionais de Pessoa Falando**: Refine rapidamente filmagens de pessoa falando removendo pausas e palavras de preenchimento, garantindo uma apresentação concisa e envolvente.
- **Criando Montagens de Vídeo Dinâmicas**: Monte montagens sem esforço com cortes automatizados, correção de cor e sobreposições de animação para um visual polido e profissional.
- **Simplificando a Produção de Vídeos Tutoriais**: Acelere a criação de vídeos tutoriais automatizando tarefas repetitivas de edição, permitindo que os criadores se concentrem no conteúdo.

## Result preview

Veja um vídeo de entrevista polido em um clipe para redes sociais com ritmo melhorado, legendas e áudio aprimorado.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### Passo 1: Instalar

Adicione a habilidade ao seu agente.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### Passo 2:Envie seu vídeo

Envie um vídeo de entrevista, tutorial ou produto e descreva as edições desejadas.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### Passo 3:Revise a saída

Receba a versão editada e verifique legendas, transições e ritmo.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# video-use

Apresentando o **video-use** — edite vídeos com o Claude Code. 100% código aberto.

Solte as filmagens brutas em uma pasta, converse com o Claude Code e receba `final.mp4` de volta. Funciona para qualquer conteúdo — vídeos de apresentadores, montagens, tutoriais, viagens, entrevistas — sem predefinições ou menus.

## O que ele faz

- **Remove palavras de preenchimento** (`umm`, `uh`, falsos começos) e espaços mortos entre tomadas
- **Aplica correção de cor automática** em cada segmento (efeito cinematográfico quente, impacto neutro ou qualquer cadeia ffmpeg personalizada)
- **Fades de áudio de 30ms** em cada corte para você nunca ouvir um estouro
- **Grava legendas** no seu estilo — blocos de 2 palavras em CAIXA ALTA por padrão, totalmente personalizáveis
- **Gera sobreposições de animação** via [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/) ou PIL — geradas em subagentes paralelos, um por animação
- **Autoavalia a saída renderizada** em cada limite de corte antes de mostrar qualquer coisa para você
- **Persiste a memória da sessão** em `project.md` para que a sessão da próxima semana continue de onde você parou

## Prompt de configuração

Cole no Claude Code, Codex, Hermes, Openclaw ou qualquer agente com acesso shell:

```text
Configure https://github.com/browser-use/video-use para mim.

Leia install.md primeiro para instalar este repositório, conectar o ffmpeg, registrar a habilidade com o agente que você está executando e configurar a chave de API do ElevenLabs — peça para eu colar quando precisar. Depois, leia SKILL.md para uso diário e sempre leia helpers/ porque é onde os scripts de edição residem. Após a instalação, não transcreva nada por conta própria — apenas me diga que está pronto e aguarde eu soltar as filmagens em uma pasta.
```

O agente cuida da clonagem, dependências, registro da habilidade e solicita uma vez sua chave de API do ElevenLabs (pegue uma em [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)).

Depois, aponte seu agente para uma pasta de tomadas brutas:

```bash
cd /caminho/para/seus/vídeos
claude    # ou codex, hermes, etc.
```

Para edição contínua a partir do seu próprio VPS ou Telegram, execute o agente através do [Browser Use Box](https://browser-use.com/bux). [Assista à demonstração de 15 segundos](https://www.tiktok.com/@browser_use/video/7639824093721758989).

E na sessão:

> edite isso em um vídeo de lançamento

Ele inventaria as fontes, propõe uma estratégia, aguarda seu OK e então produz `edit/final.mp4` ao lado de suas fontes. Todas as saídas ficam em `<vídeos_dir>/edit/` — o diretório da habilidade permanece limpo.

## Instalação manual

Se preferir fazer manualmente:

```bash
# 1. Clone e crie link simbólico no diretório de habilidades do seu agente
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Instale dependências
cd ~/Developer/video-use
uv sync                         # ou: pip install -e .
brew install ffmpeg             # obrigatório
brew install yt-dlp             # opcional, para baixar fontes online

# 3. Adicione sua chave de API do ElevenLabs
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## Como funciona

O LLM nunca assiste ao vídeo. Ele **lê** — por meio de duas camadas que juntas fornecem tudo que ele precisa para cortar com precisão nos limites das palavras.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composição timeline_view — tira de filme + trilha de locutor + forma de onda + rótulos de palavras + candidatos a corte de lacuna de silêncio" width="100%">
</p>

**Camada 1 — Transcrição de áudio (sempre carregada).** Uma chamada ao ElevenLabs Scribe por fonte fornece timestamps no nível da palavra, diarização de locutor e eventos de áudio (`(risos)`, `(aplausos)`, `(suspiro)`). Todas as tomadas são empacotadas em um único arquivo ~12KB `takes_packed.md` — a visão de leitura primária do LLM.

```
## C0103  (duração: 43.0s, 8 frases)
  [002.52-005.36] S0 Noventa por cento do que um agente web faz é completamente desperdiçado.
  [006.08-006.74] S0 Nós corrigimos isso.
```

**Camada 2 — Composição visual (sob demanda).** `timeline_view` produz um PNG com tira de filme + forma de onda + rótulos de palavras para qualquer intervalo de tempo. Chamado apenas nos pontos de decisão — pausas ambíguas, comparações de refilmagens, verificações de corte.

> Abordagem ingênua: 30.000 quadros × 1.500 tokens = **45M tokens de ruído**.
> Video Use: **12KB de texto + um punhado de PNGs**.

Mesma ideia do browser-use fornecendo a um LLM um DOM estruturado em vez de uma captura de tela — mas para vídeo.

## Pipeline

```
Transcrever ──> Empacotar ──> LLM Raciocina ──> EDL ──> Renderizar ──> Autoavaliação
                                                              │
                                                              └─ problema? corrigir + re-renderizar (máx. 3)
```

O ciclo de autoavaliação executa `timeline_view` na _saída renderizada_ em cada limite de corte — detecta saltos visuais, estouros de áudio, legendas ocultas. Você vê a prévia somente depois de passar.

## Princípios de design

1. **Texto + visuais sob demanda.** Sem despejo de quadros. A transcrição é a superfície.
2. **Áudio é primário, visuais seguem.** Cortes vêm dos limites da fala e lacunas de silêncio.
3. **Perguntar → confirmar → executar → autoavaliar → persistir.** Nunca toque no corte sem aprovação da estratégia.
4. **Zero suposições sobre o tipo de conteúdo.** Olhe, pergunte e então edite.
5. **12 regras rígidas, liberdade artística no resto.** Correção de produção é inegociável. Gosto não é.

Veja [`SKILL.md`](./SKILL.md) para as regras completas de produção e a arte da edição.

## FAQ

### O que é o video-use?

O video-use é uma ferramenta de código aberto que permite editar vídeos usando agentes de IA como o Claude Code. Ele automatiza tarefas comuns de edição, como cortar palavras de preenchimento, fazer correção de cor e adicionar legendas.

### Como o video-use funciona sem que o LLM assista ao vídeo?

O LLM lê o vídeo através de duas camadas: uma transcrição de áudio com marcas de tempo ao nível da palavra e diarização de locutor, e composições visuais sob demanda (tira de filme + forma de onda + PNGs com rótulos de palavras) para pontos de decisão. Essa abordagem minimiza o uso de tokens, ao mesmo tempo que fornece capacidades de edição precisas.

### Que tipos de vídeos posso editar com o video-use?

O video-use foi projetado para funcionar com qualquer tipo de conteúdo, incluindo vídeos de pessoa falando, montagens, tutoriais, vlogs de viagem e entrevistas. Ele se adapta à sua filmagem sem exigir predefinições ou menus.

### Quais são os recursos principais do video-use?

Os principais recursos incluem cortar palavras de preenchimento e espaços mortos, correção de cor automática, fades de áudio de 30 ms, queima de legendas personalizáveis, geração de sobreposições de animação, autoavaliação da saída renderizada e persistência da memória da sessão.

### Preciso de uma chave de API do ElevenLabs para usar o video-use?

Sim, é necessária uma chave de API do ElevenLabs para transcrição de áudio e diarização de locutor, que são cruciais para a funcionalidade da ferramenta. Você será solicitado a fornecê-la durante o processo de configuração.

### Posso instalar o video-use manualmente em vez de usar o prompt de configuração?

Sim, você pode realizar uma instalação manual clonando o repositório, vinculando-o simbolicamente ao diretório de habilidades do seu agente, instalando dependências como FFmpeg e configurando sua chave de API do ElevenLabs no arquivo .env.
