NanoSkill
Enviar tu skill

Habilidad de agente de edición de video

porbrowser-use9Kestrellas de GitHubGitHub

Edita videos con IA usando Código Claude, automatizando tareas como cortar muletillas, corrección de color y grabado de subtítulos. Optimiza tu flujo de trabajo de producción de video y obtén un MP4 final pulido.

videoEscaneo de seguridad aprobado
Vista previa del resultado

Demo completa

Vea un video de entrevista pulido en un clip para redes sociales con ritmo mejorado, subtítulos y audio mejorado.

Primeros pasos

Ejecuta tu primera tarea

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Paso 1:Instalar

    Añade la habilidad a tu agente.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Paso 2:Sube tu video

    Sube un video de entrevista, tutorial o producto y describe las ediciones deseadas.

  3. the demo of Video Editing Agent Skill
    03

    Paso 3:Revisa la salida

    Recibe la versión editada y verifica subtítulos, transiciones y ritmo.

Comando de instalación

$ npx skills add https://github.com/browser-use/video-use

Acerca de

uso-de-video presenta un enfoque innovador para la edición de video, aprovechando agentes de IA como Código Claude para automatizar tareas tediosas y que consumen tiempo. Esta herramienta de código abierto permite a los usuarios simplemente soltar material sin editar en una carpeta, interactuar con un agente de IA y recibir una salida pulida de `final.mp4`. Está diseñada para optimizar el proceso de edición de video para varios tipos de contenido, desde cabezas parlantes hasta montajes, manejando inteligentemente cortes, corrección de color y grabado de subtítulos.

El sistema funciona leyendo el contenido de video a través de transcripciones de audio detalladas y composiciones visuales bajo demanda, en lugar de procesar cada fotograma. Este método proporciona a la IA una precisión a nivel de límite de palabra para la edición, al tiempo que reduce significativamente la sobrecarga computacional. Las capacidades clave incluyen eliminar automáticamente muletillas y espacios muertos, aplicar correcciones de color inteligentes, asegurar transiciones de audio perfectas y grabar subtítulos personalizables directamente en el video.

Más allá de la automatización, uso-de-video incorpora una sólida canalización de autoevaluación. Después del procesamiento inicial, la IA revisa la salida renderizada en cada límite de corte para detectar y corregir imperfecciones como saltos visuales o chasquidos de audio. Esto garantiza que el video final cumpla con altos estándares de producción antes de presentarse al usuario. La herramienta también mantiene la memoria de sesión, permitiendo a los usuarios retomar las sesiones de edición exactamente donde las dejaron, mejorando la eficiencia y consistencia del flujo de trabajo.

Funciones clave

Qué la hace potente

  • Eliminación automática de muletillas

    Corta automáticamente muletillas como 'umm', 'uh', arranques falsos y espacios muertos entre tomas para un audio más limpio.

  • Corrección de color inteligente

    Corrige automáticamente el color de cada segmento de video, ofreciendo opciones como cinemático cálido, impacto neutral o cadenas FFmpeg personalizadas para una calidad visual consistente.

  • Fundidos de audio perfectos

    Aplica fundidos de audio de 30 ms en cada corte para eliminar chasquidos y garantizar transiciones suaves entre segmentos.

  • Incrustación de subtítulos personalizable

    Incrusta subtítulos directamente en tu video con un estilo personalizable, con fragmentos en MAYÚSCULAS de 2 palabras por defecto, mejorando la accesibilidad y el compromiso.

  • Autoevaluación con IA

    El sistema autoevalúa la salida renderizada en cada límite de corte, detectando saltos visuales, chasquidos de audio y subtítulos ocultos antes de mostrarte la vista previa.

Casos de uso

Cuándo usarla

  • Producción de videos profesionales de busto parlante

    Refina rápidamente el metraje de busto parlante eliminando pausas y muletillas, garantizando una presentación concisa y atractiva.

  • Creación de montajes de video dinámicos

    Ensambla montajes sin esfuerzo con cortes automatizados, corrección de color y superposiciones de animación para un aspecto pulido y profesional.

  • Optimización de la producción de videos tutoriales

    Acelera la creación de videos tutoriales automatizando tareas de edición repetitivas, permitiendo a los creadores centrarse en el contenido.

SKILL.md

video-use

Presentamos video-use — edita videos con Claude Code. 100% código abierto.

Suelta el material sin editar en una carpeta, chatea con Claude Code y obtén final.mp4 de vuelta. Funciona para cualquier tipo de contenido — bustos parlantes, montajes, tutoriales, viajes, entrevistas — sin ajustes predefinidos ni menús.

Qué hace

  • Elimina muletillas (umm, uh, inicios falsos) y espacios muertos entre tomas
  • Aplica gradación de color automática a cada segmento (cálido cinematográfico, golpe neutro o cualquier cadena ffmpeg personalizada)
  • Desvanecimientos de audio de 30ms en cada corte para que nunca se oiga un chasquido
  • Incrusta subtítulos a tu estilo — por defecto fragmentos de 2 palabras en MAYÚSCULAS, totalmente personalizable
  • Genera superposiciones de animación a través de HyperFrames, Remotion, Manim o PIL — generadas en subagentes paralelos, uno por animación
  • Autoevalúa el renderizado de salida en cada límite de corte antes de mostrarte algo
  • Persiste la memoria de la sesión en project.md para que la sesión de la próxima semana continúe donde la dejaste

Instrucciones de configuración

Pega en Claude Code, Codex, Hermes, Openclaw o cualquier agente con acceso a shell:

Configura https://github.com/browser-use/video-use para mí.

Lee install.md primero para instalar este repositorio, conectar ffmpeg, registrar la habilidad con el agente que estés ejecutando y configurar la clave API de ElevenLabs — pídeme que la pegue cuando la necesites. Luego lee SKILL.md para el uso diario, y siempre lee helpers/ porque ahí es donde están los scripts de edición. Después de la instalación, no transcribas nada por tu cuenta — solo dime que está listo y espera a que yo suelte el material en una carpeta.

El agente se encarga del clonado, las dependencias, el registro de la habilidad y te solicita una vez tu clave API de ElevenLabs (obtén una en elevenlabs.io/app/settings/api-keys).

Luego apunta tu agente a una carpeta con tomas sin editar:

cd /ruta/a/tus/videos
claude    # o codex, hermes, etc.

Para edición continua desde tu propio VPS o Telegram, ejecuta el agente a través de Browser Use Box. Mira la demo de 15 segundos.

Y en la sesión:

edita esto en un video de lanzamiento

Hace un inventario de las fuentes, propone una estrategia, espera tu aprobación y luego produce edit/final.mp4 junto a tus fuentes. Todas las salidas se guardan en <directorio_de_videos>/edit/ — el directorio de la habilidad se mantiene limpio.

Instalación manual

Si prefieres hacerlo a mano:

# 1. Clonar y crear enlace simbólico en el directorio de habilidades de tu agente
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Instalar dependencias
cd ~/Developer/video-use
uv sync                         # o: pip install -e .
brew install ffmpeg             # necesario
brew install yt-dlp             # opcional, para descargar fuentes online

# 3. Agregar tu clave API de ElevenLabs
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Cómo funciona

El LLM nunca ve el video. Lo lee — a través de dos capas que juntas le dan todo lo que necesita para cortar con precisión a nivel de palabra.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="composición de timeline_view — tira de película + pista de altavoz + forma de onda + etiquetas de palabras + candidatos a corte por brecha de silencio" width="100%"> </p>

Capa 1 — Transcripción de audio (siempre cargada). Una llamada de ElevenLabs Scribe por fuente proporciona marcas de tiempo a nivel de palabra, diarización de hablantes y eventos de audio ((risa), (aplausos), (suspiro)). Todas las tomas se empaquetan en un solo archivo de ~12KB takes_packed.md — la vista de lectura principal del LLM.

## C0103  (duración: 43.0s, 8 frases)
  [002.52-005.36] S0 El noventa por ciento de lo que hace un agente web se desperdicia por completo.
  [006.08-006.74] S0 Nosotros arreglamos esto.

Capa 2 — Composición visual (bajo demanda). timeline_view produce un PNG con tira de película + forma de onda + etiquetas de palabras para cualquier rango de tiempo. Se llama solo en puntos de decisión — pausas ambiguas, comparaciones de nuevas tomas, verificaciones de cordura en puntos de corte.

Enfoque ingenuo: 30.000 fotogramas × 1.500 tokens = 45M tokens de ruido. Video Use: 12KB de texto + un puñado de PNGs.

Mismo concepto que browser-use al darle a un LLM un DOM estructurado en lugar de una captura de pantalla — pero para video.

Flujo de trabajo

Transcribir ──> Empaquetar ──> Razonamiento del LLM ──> EDL ──> Renderizar ──> Autoevaluación
                                                              │
                                                              └─ ¿problema? arreglar + re-renderizar (máx. 3)

El bucle de autoevaluación ejecuta timeline_view en la salida renderizada en cada límite de corte — detecta saltos visuales, chasquidos de audio, subtítulos ocultos. Solo ves la previsualización después de que pase.

Principios de diseño

  1. Texto + visuales bajo demanda. Sin volcado de fotogramas. La transcripción es la superficie.
  2. El audio es primario, los visuales lo siguen. Los cortes provienen de los límites del habla y los espacios de silencio.
  3. Preguntar → confirmar → ejecutar → autoevaluar → persistir. Nunca tocar el corte sin la aprobación de la estrategia.
  4. Cero suposiciones sobre el tipo de contenido. Mirar, preguntar, luego editar.
  5. 12 reglas estrictas, libertad artística en otros aspectos. La corrección de producción es innegociable. El gusto no lo es.

Consulta SKILL.md para conocer las reglas completas de producción y el arte de la edición.

FAQ