# Habilidad de agente de edición de video

> Edita videos con IA usando Código Claude, automatizando tareas como cortar muletillas, corrección de color y grabado de subtítulos. Optimiza tu flujo de trabajo de producción de video y obtén un MP4 final pulido.

- Canonical: https://nanoskill.ai/es/skills/video-editing
- Markdown: https://nanoskill.ai/es/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: es
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

uso-de-video presenta un enfoque innovador para la edición de video, aprovechando agentes de IA como Código Claude para automatizar tareas tediosas y que consumen tiempo. Esta herramienta de código abierto permite a los usuarios simplemente soltar material sin editar en una carpeta, interactuar con un agente de IA y recibir una salida pulida de \`final.mp4\`. Está diseñada para optimizar el proceso de edición de video para varios tipos de contenido, desde cabezas parlantes hasta montajes, manejando inteligentemente cortes, corrección de color y grabado de subtítulos.

El sistema funciona leyendo el contenido de video a través de transcripciones de audio detalladas y composiciones visuales bajo demanda, en lugar de procesar cada fotograma. Este método proporciona a la IA una precisión a nivel de límite de palabra para la edición, al tiempo que reduce significativamente la sobrecarga computacional. Las capacidades clave incluyen eliminar automáticamente muletillas y espacios muertos, aplicar correcciones de color inteligentes, asegurar transiciones de audio perfectas y grabar subtítulos personalizables directamente en el video.

Más allá de la automatización, uso-de-video incorpora una sólida canalización de autoevaluación. Después del procesamiento inicial, la IA revisa la salida renderizada en cada límite de corte para detectar y corregir imperfecciones como saltos visuales o chasquidos de audio. Esto garantiza que el video final cumpla con altos estándares de producción antes de presentarse al usuario. La herramienta también mantiene la memoria de sesión, permitiendo a los usuarios retomar las sesiones de edición exactamente donde las dejaron, mejorando la eficiencia y consistencia del flujo de trabajo.

## Key features

- **Eliminación automática de muletillas**: Corta automáticamente muletillas como 'umm', 'uh', arranques falsos y espacios muertos entre tomas para un audio más limpio.
- **Corrección de color inteligente**: Corrige automáticamente el color de cada segmento de video, ofreciendo opciones como cinemático cálido, impacto neutral o cadenas FFmpeg personalizadas para una calidad visual consistente.
- **Fundidos de audio perfectos**: Aplica fundidos de audio de 30 ms en cada corte para eliminar chasquidos y garantizar transiciones suaves entre segmentos.
- **Incrustación de subtítulos personalizable**: Incrusta subtítulos directamente en tu video con un estilo personalizable, con fragmentos en MAYÚSCULAS de 2 palabras por defecto, mejorando la accesibilidad y el compromiso.
- **Autoevaluación con IA**: El sistema autoevalúa la salida renderizada en cada límite de corte, detectando saltos visuales, chasquidos de audio y subtítulos ocultos antes de mostrarte la vista previa.

## Use cases

- **Producción de videos profesionales de busto parlante**: Refina rápidamente el metraje de busto parlante eliminando pausas y muletillas, garantizando una presentación concisa y atractiva.
- **Creación de montajes de video dinámicos**: Ensambla montajes sin esfuerzo con cortes automatizados, corrección de color y superposiciones de animación para un aspecto pulido y profesional.
- **Optimización de la producción de videos tutoriales**: Acelera la creación de videos tutoriales automatizando tareas de edición repetitivas, permitiendo a los creadores centrarse en el contenido.

## Result preview

Vea un video de entrevista pulido en un clip para redes sociales con ritmo mejorado, subtítulos y audio mejorado.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### Paso 1：Instalar

Añade la habilidad a tu agente.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### Paso 2：Sube tu video

Sube un video de entrevista, tutorial o producto y describe las ediciones deseadas.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### Paso 3：Revisa la salida

Recibe la versión editada y verifica subtítulos, transiciones y ritmo.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# video-use

Presentamos **video-use** — edita videos con Claude Code. 100% código abierto.

Suelta el material sin editar en una carpeta, chatea con Claude Code y obtén `final.mp4` de vuelta. Funciona para cualquier tipo de contenido — bustos parlantes, montajes, tutoriales, viajes, entrevistas — sin ajustes predefinidos ni menús.

## Qué hace

- **Elimina muletillas** (`umm`, `uh`, inicios falsos) y espacios muertos entre tomas
- **Aplica gradación de color automática** a cada segmento (cálido cinematográfico, golpe neutro o cualquier cadena ffmpeg personalizada)
- **Desvanecimientos de audio de 30ms** en cada corte para que nunca se oiga un chasquido
- **Incrusta subtítulos** a tu estilo — por defecto fragmentos de 2 palabras en MAYÚSCULAS, totalmente personalizable
- **Genera superposiciones de animación** a través de [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/) o PIL — generadas en subagentes paralelos, uno por animación
- **Autoevalúa el renderizado de salida** en cada límite de corte antes de mostrarte algo
- **Persiste la memoria de la sesión** en `project.md` para que la sesión de la próxima semana continúe donde la dejaste

## Instrucciones de configuración

Pega en Claude Code, Codex, Hermes, Openclaw o cualquier agente con acceso a shell:

```text
Configura https://github.com/browser-use/video-use para mí.

Lee install.md primero para instalar este repositorio, conectar ffmpeg, registrar la habilidad con el agente que estés ejecutando y configurar la clave API de ElevenLabs — pídeme que la pegue cuando la necesites. Luego lee SKILL.md para el uso diario, y siempre lee helpers/ porque ahí es donde están los scripts de edición. Después de la instalación, no transcribas nada por tu cuenta — solo dime que está listo y espera a que yo suelte el material en una carpeta.
```

El agente se encarga del clonado, las dependencias, el registro de la habilidad y te solicita una vez tu clave API de ElevenLabs (obtén una en [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)).

Luego apunta tu agente a una carpeta con tomas sin editar:

```bash
cd /ruta/a/tus/videos
claude    # o codex, hermes, etc.
```

Para edición continua desde tu propio VPS o Telegram, ejecuta el agente a través de [Browser Use Box](https://browser-use.com/bux). [Mira la demo de 15 segundos](https://www.tiktok.com/@browser_use/video/7639824093721758989).

Y en la sesión:

> edita esto en un video de lanzamiento

Hace un inventario de las fuentes, propone una estrategia, espera tu aprobación y luego produce `edit/final.mp4` junto a tus fuentes. Todas las salidas se guardan en `<directorio_de_videos>/edit/` — el directorio de la habilidad se mantiene limpio.

## Instalación manual

Si prefieres hacerlo a mano:

```bash
# 1. Clonar y crear enlace simbólico en el directorio de habilidades de tu agente
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Instalar dependencias
cd ~/Developer/video-use
uv sync                         # o: pip install -e .
brew install ffmpeg             # necesario
brew install yt-dlp             # opcional, para descargar fuentes online

# 3. Agregar tu clave API de ElevenLabs
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## Cómo funciona

El LLM nunca ve el video. Lo **lee** — a través de dos capas que juntas le dan todo lo que necesita para cortar con precisión a nivel de palabra.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composición de timeline_view — tira de película + pista de altavoz + forma de onda + etiquetas de palabras + candidatos a corte por brecha de silencio" width="100%">
</p>

**Capa 1 — Transcripción de audio (siempre cargada).** Una llamada de ElevenLabs Scribe por fuente proporciona marcas de tiempo a nivel de palabra, diarización de hablantes y eventos de audio (`(risa)`, `(aplausos)`, `(suspiro)`). Todas las tomas se empaquetan en un solo archivo de ~12KB `takes_packed.md` — la vista de lectura principal del LLM.

```
## C0103  (duración: 43.0s, 8 frases)
  [002.52-005.36] S0 El noventa por ciento de lo que hace un agente web se desperdicia por completo.
  [006.08-006.74] S0 Nosotros arreglamos esto.
```

**Capa 2 — Composición visual (bajo demanda).** `timeline_view` produce un PNG con tira de película + forma de onda + etiquetas de palabras para cualquier rango de tiempo. Se llama solo en puntos de decisión — pausas ambiguas, comparaciones de nuevas tomas, verificaciones de cordura en puntos de corte.

> Enfoque ingenuo: 30.000 fotogramas × 1.500 tokens = **45M tokens de ruido**.
> Video Use: **12KB de texto + un puñado de PNGs**.

Mismo concepto que browser-use al darle a un LLM un DOM estructurado en lugar de una captura de pantalla — pero para video.

## Flujo de trabajo

```
Transcribir ──> Empaquetar ──> Razonamiento del LLM ──> EDL ──> Renderizar ──> Autoevaluación
                                                              │
                                                              └─ ¿problema? arreglar + re-renderizar (máx. 3)
```

El bucle de autoevaluación ejecuta `timeline_view` en la _salida renderizada_ en cada límite de corte — detecta saltos visuales, chasquidos de audio, subtítulos ocultos. Solo ves la previsualización después de que pase.

## Principios de diseño

1. **Texto + visuales bajo demanda.** Sin volcado de fotogramas. La transcripción es la superficie.
2. **El audio es primario, los visuales lo siguen.** Los cortes provienen de los límites del habla y los espacios de silencio.
3. **Preguntar → confirmar → ejecutar → autoevaluar → persistir.** Nunca tocar el corte sin la aprobación de la estrategia.
4. **Cero suposiciones sobre el tipo de contenido.** Mirar, preguntar, luego editar.
5. **12 reglas estrictas, libertad artística en otros aspectos.** La corrección de producción es innegociable. El gusto no lo es.

Consulta [`SKILL.md`](./SKILL.md) para conocer las reglas completas de producción y el arte de la edición.

## FAQ

### ¿Qué es video-use?

video-use es una herramienta de código abierto que permite editar vídeos usando agentes de IA como Claude Code. Automatiza tareas de edición comunes como cortar muletillas, corrección de color y añadir subtítulos.

### ¿Cómo funciona video-use sin que el LLM vea el vídeo?

El LLM lee el vídeo a través de dos capas: una transcripción de audio con marcas de tiempo a nivel de palabra y diarización de hablantes, y composiciones visuales bajo demanda (película + forma de onda + etiquetas de palabras en PNG) para puntos de decisión. Este enfoque minimiza el uso de tokens mientras proporciona capacidades de edición precisas.

### ¿Qué tipos de vídeos puedo editar con video-use?

video-use está diseñado para funcionar con cualquier tipo de contenido, incluidos bustos parlantes, montajes, tutoriales, vlogs de viajes y entrevistas. Se adapta a tu metraje sin necesidad de preajustes ni menús.

### ¿Cuáles son las características principales de video-use?

Las características clave incluyen cortar muletillas y espacios muertos, corrección de color automática, fundidos de audio de 30 ms, incrustar subtítulos personalizables, generar superposiciones de animación, autoevaluar la salida renderizada y persistir la memoria de sesión.

### ¿Necesito una clave de API de ElevenLabs para usar video-use?

Sí, se requiere una clave de API de ElevenLabs para la transcripción de audio y la diarización de hablantes, que son cruciales para la funcionalidad de la herramienta. Se te pedirá que la proporciones durante el proceso de configuración.

### ¿Puedo instalar video-use manualmente en lugar de usar el mensaje de configuración?

Sí, puedes realizar una instalación manual clonando el repositorio, creando un enlace simbólico en el directorio de habilidades de tu agente, instalando dependencias como FFmpeg y configurando tu clave de API de ElevenLabs en el archivo .env.
