video-use
Apresentando o video-use — edite vídeos com o Claude Code. 100% código aberto.
Solte as filmagens brutas em uma pasta, converse com o Claude Code e receba final.mp4 de volta. Funciona para qualquer conteúdo — vídeos de apresentadores, montagens, tutoriais, viagens, entrevistas — sem predefinições ou menus.
O que ele faz
- Remove palavras de preenchimento (
umm,uh, falsos começos) e espaços mortos entre tomadas - Aplica correção de cor automática em cada segmento (efeito cinematográfico quente, impacto neutro ou qualquer cadeia ffmpeg personalizada)
- Fades de áudio de 30ms em cada corte para você nunca ouvir um estouro
- Grava legendas no seu estilo — blocos de 2 palavras em CAIXA ALTA por padrão, totalmente personalizáveis
- Gera sobreposições de animação via HyperFrames, Remotion, Manim ou PIL — geradas em subagentes paralelos, um por animação
- Autoavalia a saída renderizada em cada limite de corte antes de mostrar qualquer coisa para você
- Persiste a memória da sessão em
project.mdpara que a sessão da próxima semana continue de onde você parou
Prompt de configuração
Cole no Claude Code, Codex, Hermes, Openclaw ou qualquer agente com acesso shell:
Configure https://github.com/browser-use/video-use para mim.
Leia install.md primeiro para instalar este repositório, conectar o ffmpeg, registrar a habilidade com o agente que você está executando e configurar a chave de API do ElevenLabs — peça para eu colar quando precisar. Depois, leia SKILL.md para uso diário e sempre leia helpers/ porque é onde os scripts de edição residem. Após a instalação, não transcreva nada por conta própria — apenas me diga que está pronto e aguarde eu soltar as filmagens em uma pasta.
O agente cuida da clonagem, dependências, registro da habilidade e solicita uma vez sua chave de API do ElevenLabs (pegue uma em elevenlabs.io/app/settings/api-keys).
Depois, aponte seu agente para uma pasta de tomadas brutas:
cd /caminho/para/seus/vídeos
claude # ou codex, hermes, etc.
Para edição contínua a partir do seu próprio VPS ou Telegram, execute o agente através do Browser Use Box. Assista à demonstração de 15 segundos.
E na sessão:
edite isso em um vídeo de lançamento
Ele inventaria as fontes, propõe uma estratégia, aguarda seu OK e então produz edit/final.mp4 ao lado de suas fontes. Todas as saídas ficam em <vídeos_dir>/edit/ — o diretório da habilidade permanece limpo.
Instalação manual
Se preferir fazer manualmente:
# 1. Clone e crie link simbólico no diretório de habilidades do seu agente
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Instale dependências
cd ~/Developer/video-use
uv sync # ou: pip install -e .
brew install ffmpeg # obrigatório
brew install yt-dlp # opcional, para baixar fontes online
# 3. Adicione sua chave de API do ElevenLabs
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Como funciona
O LLM nunca assiste ao vídeo. Ele lê — por meio de duas camadas que juntas fornecem tudo que ele precisa para cortar com precisão nos limites das palavras.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composição timeline_view — tira de filme + trilha de locutor + forma de onda + rótulos de palavras + candidatos a corte de lacuna de silêncio" width="100%"> </p>Camada 1 — Transcrição de áudio (sempre carregada). Uma chamada ao ElevenLabs Scribe por fonte fornece timestamps no nível da palavra, diarização de locutor e eventos de áudio ((risos), (aplausos), (suspiro)). Todas as tomadas são empacotadas em um único arquivo ~12KB takes_packed.md — a visão de leitura primária do LLM.
## C0103 (duração: 43.0s, 8 frases)
[002.52-005.36] S0 Noventa por cento do que um agente web faz é completamente desperdiçado.
[006.08-006.74] S0 Nós corrigimos isso.
Camada 2 — Composição visual (sob demanda). timeline_view produz um PNG com tira de filme + forma de onda + rótulos de palavras para qualquer intervalo de tempo. Chamado apenas nos pontos de decisão — pausas ambíguas, comparações de refilmagens, verificações de corte.
Abordagem ingênua: 30.000 quadros × 1.500 tokens = 45M tokens de ruído. Video Use: 12KB de texto + um punhado de PNGs.
Mesma ideia do browser-use fornecendo a um LLM um DOM estruturado em vez de uma captura de tela — mas para vídeo.
Pipeline
Transcrever ──> Empacotar ──> LLM Raciocina ──> EDL ──> Renderizar ──> Autoavaliação
│
└─ problema? corrigir + re-renderizar (máx. 3)
O ciclo de autoavaliação executa timeline_view na saída renderizada em cada limite de corte — detecta saltos visuais, estouros de áudio, legendas ocultas. Você vê a prévia somente depois de passar.
Princípios de design
- Texto + visuais sob demanda. Sem despejo de quadros. A transcrição é a superfície.
- Áudio é primário, visuais seguem. Cortes vêm dos limites da fala e lacunas de silêncio.
- Perguntar → confirmar → executar → autoavaliar → persistir. Nunca toque no corte sem aprovação da estratégia.
- Zero suposições sobre o tipo de conteúdo. Olhe, pergunte e então edite.
- 12 regras rígidas, liberdade artística no resto. Correção de produção é inegociável. Gosto não é.
Veja SKILL.md para as regras completas de produção e a arte da edição.


