video-use
Presentamos video-use — edita videos con Claude Code. 100% código abierto.
Suelta el material sin editar en una carpeta, chatea con Claude Code y obtén final.mp4 de vuelta. Funciona para cualquier tipo de contenido — bustos parlantes, montajes, tutoriales, viajes, entrevistas — sin ajustes predefinidos ni menús.
Qué hace
- Elimina muletillas (
umm,uh, inicios falsos) y espacios muertos entre tomas - Aplica gradación de color automática a cada segmento (cálido cinematográfico, golpe neutro o cualquier cadena ffmpeg personalizada)
- Desvanecimientos de audio de 30ms en cada corte para que nunca se oiga un chasquido
- Incrusta subtítulos a tu estilo — por defecto fragmentos de 2 palabras en MAYÚSCULAS, totalmente personalizable
- Genera superposiciones de animación a través de HyperFrames, Remotion, Manim o PIL — generadas en subagentes paralelos, uno por animación
- Autoevalúa el renderizado de salida en cada límite de corte antes de mostrarte algo
- Persiste la memoria de la sesión en
project.mdpara que la sesión de la próxima semana continúe donde la dejaste
Instrucciones de configuración
Pega en Claude Code, Codex, Hermes, Openclaw o cualquier agente con acceso a shell:
Configura https://github.com/browser-use/video-use para mí.
Lee install.md primero para instalar este repositorio, conectar ffmpeg, registrar la habilidad con el agente que estés ejecutando y configurar la clave API de ElevenLabs — pídeme que la pegue cuando la necesites. Luego lee SKILL.md para el uso diario, y siempre lee helpers/ porque ahí es donde están los scripts de edición. Después de la instalación, no transcribas nada por tu cuenta — solo dime que está listo y espera a que yo suelte el material en una carpeta.
El agente se encarga del clonado, las dependencias, el registro de la habilidad y te solicita una vez tu clave API de ElevenLabs (obtén una en elevenlabs.io/app/settings/api-keys).
Luego apunta tu agente a una carpeta con tomas sin editar:
cd /ruta/a/tus/videos
claude # o codex, hermes, etc.
Para edición continua desde tu propio VPS o Telegram, ejecuta el agente a través de Browser Use Box. Mira la demo de 15 segundos.
Y en la sesión:
edita esto en un video de lanzamiento
Hace un inventario de las fuentes, propone una estrategia, espera tu aprobación y luego produce edit/final.mp4 junto a tus fuentes. Todas las salidas se guardan en <directorio_de_videos>/edit/ — el directorio de la habilidad se mantiene limpio.
Instalación manual
Si prefieres hacerlo a mano:
# 1. Clonar y crear enlace simbólico en el directorio de habilidades de tu agente
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Instalar dependencias
cd ~/Developer/video-use
uv sync # o: pip install -e .
brew install ffmpeg # necesario
brew install yt-dlp # opcional, para descargar fuentes online
# 3. Agregar tu clave API de ElevenLabs
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Cómo funciona
El LLM nunca ve el video. Lo lee — a través de dos capas que juntas le dan todo lo que necesita para cortar con precisión a nivel de palabra.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composición de timeline_view — tira de película + pista de altavoz + forma de onda + etiquetas de palabras + candidatos a corte por brecha de silencio" width="100%"> </p>Capa 1 — Transcripción de audio (siempre cargada). Una llamada de ElevenLabs Scribe por fuente proporciona marcas de tiempo a nivel de palabra, diarización de hablantes y eventos de audio ((risa), (aplausos), (suspiro)). Todas las tomas se empaquetan en un solo archivo de ~12KB takes_packed.md — la vista de lectura principal del LLM.
## C0103 (duración: 43.0s, 8 frases)
[002.52-005.36] S0 El noventa por ciento de lo que hace un agente web se desperdicia por completo.
[006.08-006.74] S0 Nosotros arreglamos esto.
Capa 2 — Composición visual (bajo demanda). timeline_view produce un PNG con tira de película + forma de onda + etiquetas de palabras para cualquier rango de tiempo. Se llama solo en puntos de decisión — pausas ambiguas, comparaciones de nuevas tomas, verificaciones de cordura en puntos de corte.
Enfoque ingenuo: 30.000 fotogramas × 1.500 tokens = 45M tokens de ruido. Video Use: 12KB de texto + un puñado de PNGs.
Mismo concepto que browser-use al darle a un LLM un DOM estructurado en lugar de una captura de pantalla — pero para video.
Flujo de trabajo
Transcribir ──> Empaquetar ──> Razonamiento del LLM ──> EDL ──> Renderizar ──> Autoevaluación
│
└─ ¿problema? arreglar + re-renderizar (máx. 3)
El bucle de autoevaluación ejecuta timeline_view en la salida renderizada en cada límite de corte — detecta saltos visuales, chasquidos de audio, subtítulos ocultos. Solo ves la previsualización después de que pase.
Principios de diseño
- Texto + visuales bajo demanda. Sin volcado de fotogramas. La transcripción es la superficie.
- El audio es primario, los visuales lo siguen. Los cortes provienen de los límites del habla y los espacios de silencio.
- Preguntar → confirmar → ejecutar → autoevaluar → persistir. Nunca tocar el corte sin la aprobación de la estrategia.
- Cero suposiciones sobre el tipo de contenido. Mirar, preguntar, luego editar.
- 12 reglas estrictas, libertad artística en otros aspectos. La corrección de producción es innegociable. El gusto no lo es.
Consulta SKILL.md para conocer las reglas completas de producción y el arte de la edición.


