# 비디오 편집 에이전트 스킬

> Claude Code를 활용하여 AI로 비디오를 편집하고, 필러 단어 제거, 색보정, 자막 굽기 등의 작업을 자동화하세요. 비디오 제작 워크플로우를 간소화하고 세련된 최종 MP4를 얻으세요.

- Canonical: https://nanoskill.ai/ko/skills/video-editing
- Markdown: https://nanoskill.ai/ko/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: ko
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

video-use는 Claude Code와 같은 AI 에이전트를 활용하여 지루하고 시간이 많이 소요되는 작업을 자동화하는 혁신적인 비디오 편집 방식을 제공합니다. 이 오픈소스 도구를 사용하면 사용자는 원본 영상을 폴더에 넣고 AI 에이전트와 상호작용하여 완성된 \`final.mp4\` 출력물을 받을 수 있습니다. 이 도구는 컷, 색보정, 자막 굽기를 지능적으로 처리하여 토킹 헤드부터 몽타주까지 다양한 콘텐츠 유형의 비디오 편집 과정을 간소화하도록 설계되었습니다.

이 시스템은 모든 프레임을 처리하는 대신 상세한 오디오 트랜스크립트와 온디맨드 비주얼 합성을 통해 비디오 콘텐츠를 읽어 작동합니다. 이 방법은 AI에게 편집을 위한 단어 경계 정밀도를 제공하면서 계산 오버헤드를 크게 줄여줍니다. 주요 기능으로는 필러 단어와 무음 구간 자동 제거, 지능적인 색보정 적용, 매끄러운 오디오 전환 보장, 사용자 지정 가능한 자막을 비디오에 직접 굽는 것이 포함됩니다.

자동화 외에도 video-use는 강력한 자체 평가 파이프라인을 통합합니다. 초기 처리 후, AI는 렌더링된 출력을 각 컷 경계에서 검토하여 시각적 점프나 오디오 팝과 같은 결함을 감지하고 수정합니다. 이렇게 하면 최종 비디오가 사용자에게 제공되기 전에 높은 제작 표준을 충족하도록 보장됩니다. 또한 이 도구는 세션 메모리를 유지하여 사용자가 중단한 편집 세션을 정확히 이어서 작업할 수 있게 해주므로 워크플로우 효율성과 일관성을 향상시킵니다.

## Key features

- **자동 추임새 제거**: 더 깨끗한 오디오를 위해 '음', '어' 같은 추임새, 잘못된 시작, 테이크 사이의 빈 공간을 자동으로 제거합니다.
- **지능형 색상 보정**: 모든 비디오 세그먼트에 자동 색상 보정을 적용하여, 따뜻한 시네마틱, 중립적 펀치 또는 사용자 정의 FFmpeg 체인과 같은 옵션으로 일관된 시각적 품질을 제공합니다.
- **자연스러운 오디오 페이드**: 모든 컷에 30ms 오디오 페이드를 적용하여 잡음을 제거하고 세그먼트 간 부드러운 전환을 보장합니다.
- **사용자 지정 가능한 자막 굽기**: 기본적으로 두 단어씩 대문자로 표시되는 사용자 지정 스타일로 비디오에 직접 자막을 구워 접근성과 몰입도를 향상시킵니다.
- **AI 기반 자체 평가**: 시스템은 모든 컷 경계에서 렌더링된 출력을 자체 평가하여, 미리보기를 보여주기 전에 시각적 점프, 오디오 팝, 숨겨진 자막을 포착합니다.

## Use cases

- **전문적인 토킹 헤드 비디오 제작**: 일시 정지와 추임새를 제거하여 토킹 헤드 푸티지를 신속하게 다듬어 간결하고 매력적인 프레젠테이션을 보장합니다.
- **역동적인 비디오 몽타주 제작**: 자동 컷, 색상 보정, 애니메이션 오버레이로 몽타주를 손쉽게 조립하여 세련되고 전문적인 느낌을 연출합니다.
- **튜토리얼 비디오 제작 간소화**: 반복적인 편집 작업을 자동화하여 튜토리얼 비디오 제작 속도를 높여 제작자가 콘텐츠에 집중할 수 있도록 합니다.

## Result preview

인터뷰 비디오가 향상된 페이싱, 자막, 강화된 오디오와 함께 소셜 미디어 클립으로 다듬어지는 것을 확인하세요.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### 1단계：설치

에이전트에 스킬을 추가하세요.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### 2단계：비디오 업로드

인터뷰, 튜토리얼 또는 제품 비디오를 업로드하고 원하는 편집 내용을 설명하세요.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### 3단계：결과물 검토

편집된 버전을 받고 자막, 전환, 페이싱을 확인하세요.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# 비디오 유즈

**비디오 유즈**를 소개합니다 — 클로드 코드로 영상을 편집하세요. 100% 오픈 소스입니다.

원본 영상을 폴더에 넣고, 클로드 코드와 대화하면 `final.mp4`를 받을 수 있습니다. 토크 헤드, 몽타주, 튜토리얼, 여행, 인터뷰 등 모든 콘텐츠에 대해 사전 설정이나 메뉴 없이 작동합니다.

## 기능

- **필러 단어**(`음`, `어`, 말더듬)와 테이크 간의 무성 공간을 잘라냅니다
- **모든 세그먼트에 자동 컬러 그레이딩**을 적용합니다 (따뜻한 시네마틱, 중립적 강렬함, 또는 사용자 지정 ffmpeg 체인)
- **30ms 오디오 페이드**를 모든 컷에 적용하여 팝 소리가 전혀 나지 않습니다
- **자막을 굽기** — 기본적으로 2단어 대문자 청크로 제공되며, 완전히 사용자 지정 가능
- **애니메이션 오버레이를 생성**합니다 — [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/), PIL을 통해 — 애니메이션별로 하나씩, 병렬 하위 에이전트에서 생성됩니다
- **렌더링된 출력을 자체 평가**하여 모든 컷 경계에서 확인한 후에만 결과를 보여줍니다
- **세션 메모리를 유지**하여 `project.md`에 저장하므로 다음 세션에서 중단한 부분부터 다시 시작할 수 있습니다

## 설정 프롬프트

클로드 코드, 코덱스, 헤르메스, 오픈클로 또는 셸 접근 권한이 있는 에이전트에 붙여넣으세요:

```text
Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
```

에이전트가 클론, 종속성, 스킬 등록을 처리하고 일레븐랩스 API 키를 입력하라는 메시지를 한 번 표시합니다. (키는 [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)에서 받을 수 있습니다).

그런 다음 에이전트에게 원본 테이크가 있는 폴더를 지정하세요:

```bash
cd /path/to/your/videos
claude    # or codex, hermes, etc.
```

자체 VPS 또는 텔레그램에서 상시 편집하려면 [Browser Use Box](https://browser-use.com/bux)를 통해 에이전트를 실행하세요. [15초 데모 보기](https://www.tiktok.com/@browser_use/video/7639824093721758989).

그리고 세션에서:

> 이것들을 런칭 비디오로 편집해줘

소스를 인벤토리하고 전략을 제안한 뒤 사용자의 승인을 기다린 다음 소스 옆에 `edit/final.mp4`를 생성합니다. 모든 출력은 `<videos_dir>/edit/`에 저장되며 — 스킬 디렉토리는 깨끗하게 유지됩니다.

## 수동 설치

수동으로 설정하려는 경우:

```bash
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## 작동 방식

LLM은 비디오를 시청하지 않습니다. 단어 경계 정밀도로 편집하는 데 필요한 모든 것을 제공하는 두 개의 레이어를 통해 비디오를 **읽습니다**.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%">
</p>

**레이어 1 — 오디오 트랜스크립트 (항상 로드됨).** 소스당 한 번의 일레븐랩스 Scribe 호출로 단어 수준의 타임스탬프, 화자 분리, 오디오 이벤트 (`(웃음)`, `(박수)`, `(한숨)`)를 제공합니다. 모든 테이크가 약 12KB의 단일 `takes_packed.md`로 압축되어 LLM의 기본 읽기 뷰가 됩니다.

```
## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.
```

**레이어 2 — 비주얼 합성 (온디맨드).** `timeline_view`는 모든 시간 범위에 대해 필름스트립 + 파형 + 단어 레이블 PNG를 생성합니다. 모호한 일시 정지, 재촬영 비교, 편집 지점 확인 등 의사 결정 지점에서만 호출됩니다.

> 단순한 접근 방식: 30,000프레임 × 1,500토큰 = **4,500만 개의 노이즈 토큰**.
> 비디오 유즈: **12KB 텍스트 + 소수의 PNG**.

browser-use가 스크린샷 대신 구조화된 DOM을 LLM에 제공하는 것과 동일한 아이디어이지만, 비디오를 위한 것입니다.

## 파이프라인

```
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)
```

자체 평가 루프는 모든 컷 경계에서 _렌더링된 출력_에 대해 `timeline_view`를 실행하여 시각적 점프, 오디오 팝, 숨겨진 자막을 잡아냅니다. 통과한 후에만 미리보기를 볼 수 있습니다.

## 설계 원칙

1. **텍스트 + 온디맨드 비주얼.** 프레임 덤핑이 없습니다. 트랜스크립트가 표면입니다.
2. **오디오가 주가 되고 비주얼이 따릅니다.** 음성 경계와 무음 간격에서 컷이 발생합니다.
3. **질문 → 확인 → 실행 → 자체 평가 → 유지.** 전략 승인 없이 컷을 절대 건드리지 않습니다.
4. **콘텐츠 유형에 대한 가정 없음.** 보고, 묻고, 편집합니다.
5. **12가지 엄격한 규칙, 그 외에는 예술적 자유.** 제작 정확성은 타협할 수 없습니다. 취향은 아닙니다.

전체 제작 규칙과 편집 기술은 [`SKILL.md`](./SKILL.md)를 참조하세요.

## FAQ

### 비디오유즈란 무엇인가요?

비디오유즈는 Claude Code와 같은 AI 에이전트를 사용하여 동영상을 편집할 수 있는 오픈소스 도구입니다. 추임새 제거, 색상 보정, 자막 추가와 같은 일반적인 편집 작업을 자동화합니다.

### LLM이 비디오를 보지 않고도 비디오유즈는 어떻게 작동하나요?

LLM은 두 가지 계층을 통해 비디오를 읽습니다: 단어 수준 타임스탬프와 화자 분리가 적용된 오디오 대본, 그리고 의사 결정 지점을 위한 주문형 시각적 합성물(필름스트립 + 파형 + 단어 레이블 PNG). 이 접근 방식은 정확한 편집 기능을 제공하면서 토큰 사용량을 최소화합니다.

### 비디오유즈로 어떤 유형의 동영상을 편집할 수 있나요?

비디오유즈는 토킹 헤드, 몽타주, 튜토리얼, 여행 블로그, 인터뷰 등 모든 콘텐츠 유형에 작동하도록 설계되었습니다. 프리셋이나 메뉴 없이도 푸티지에 적응합니다.

### 비디오유즈의 주요 기능은 무엇인가요?

주요 기능으로는 추임새와 무음 구간 제거, 자동 색상 보정, 30ms 오디오 페이드, 사용자 지정 가능한 자막 굽기, 애니메이션 오버레이 생성, 렌더링된 출력 자체 평가, 세션 메모리 유지 등이 있습니다.

### 비디오유즈를 사용하려면 ElevenLabs API 키가 필요한가요?

네, 오디오 전사 및 화자 분리에 ElevenLabs API 키가 필요하며, 이는 도구 기능의 핵심입니다. 설정 과정에서 입력하라는 메시지가 표시됩니다.

### 설정 프롬프트 대신 수동으로 비디오유즈를 설치할 수 있나요?

네, 저장소를 복제하고, 에이전트의 스킬 디렉토리에 심볼릭 링크를 걸고, FFmpeg와 같은 종속성을 설치하고, .env 파일에서 ElevenLabs API 키를 구성하여 수동 설치를 수행할 수 있습니다.
