NanoSkill
스킬 제출

비디오 편집 에이전트 스킬

제작browser-use9KGitHub 스타GitHub

Claude Code를 활용하여 AI로 비디오를 편집하고, 필러 단어 제거, 색보정, 자막 굽기 등의 작업을 자동화하세요. 비디오 제작 워크플로우를 간소화하고 세련된 최종 MP4를 얻으세요.

비디오보안 검사 통과
결과 미리보기

전체 데모

인터뷰 비디오가 향상된 페이싱, 자막, 강화된 오디오와 함께 소셜 미디어 클립으로 다듬어지는 것을 확인하세요.

시작하기

첫 작업 실행

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    1단계:설치

    에이전트에 스킬을 추가하세요.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    2단계:비디오 업로드

    인터뷰, 튜토리얼 또는 제품 비디오를 업로드하고 원하는 편집 내용을 설명하세요.

  3. the demo of Video Editing Agent Skill
    03

    3단계:결과물 검토

    편집된 버전을 받고 자막, 전환, 페이싱을 확인하세요.

설치 명령

$ npx skills add https://github.com/browser-use/video-use

소개

video-use는 Claude Code와 같은 AI 에이전트를 활용하여 지루하고 시간이 많이 소요되는 작업을 자동화하는 혁신적인 비디오 편집 방식을 제공합니다. 이 오픈소스 도구를 사용하면 사용자는 원본 영상을 폴더에 넣고 AI 에이전트와 상호작용하여 완성된 `final.mp4` 출력물을 받을 수 있습니다. 이 도구는 컷, 색보정, 자막 굽기를 지능적으로 처리하여 토킹 헤드부터 몽타주까지 다양한 콘텐츠 유형의 비디오 편집 과정을 간소화하도록 설계되었습니다.

이 시스템은 모든 프레임을 처리하는 대신 상세한 오디오 트랜스크립트와 온디맨드 비주얼 합성을 통해 비디오 콘텐츠를 읽어 작동합니다. 이 방법은 AI에게 편집을 위한 단어 경계 정밀도를 제공하면서 계산 오버헤드를 크게 줄여줍니다. 주요 기능으로는 필러 단어와 무음 구간 자동 제거, 지능적인 색보정 적용, 매끄러운 오디오 전환 보장, 사용자 지정 가능한 자막을 비디오에 직접 굽는 것이 포함됩니다.

자동화 외에도 video-use는 강력한 자체 평가 파이프라인을 통합합니다. 초기 처리 후, AI는 렌더링된 출력을 각 컷 경계에서 검토하여 시각적 점프나 오디오 팝과 같은 결함을 감지하고 수정합니다. 이렇게 하면 최종 비디오가 사용자에게 제공되기 전에 높은 제작 표준을 충족하도록 보장됩니다. 또한 이 도구는 세션 메모리를 유지하여 사용자가 중단한 편집 세션을 정확히 이어서 작업할 수 있게 해주므로 워크플로우 효율성과 일관성을 향상시킵니다.

핵심 기능

강력한 이유

  • 자동 추임새 제거

    더 깨끗한 오디오를 위해 '음', '어' 같은 추임새, 잘못된 시작, 테이크 사이의 빈 공간을 자동으로 제거합니다.

  • 지능형 색상 보정

    모든 비디오 세그먼트에 자동 색상 보정을 적용하여, 따뜻한 시네마틱, 중립적 펀치 또는 사용자 정의 FFmpeg 체인과 같은 옵션으로 일관된 시각적 품질을 제공합니다.

  • 자연스러운 오디오 페이드

    모든 컷에 30ms 오디오 페이드를 적용하여 잡음을 제거하고 세그먼트 간 부드러운 전환을 보장합니다.

  • 사용자 지정 가능한 자막 굽기

    기본적으로 두 단어씩 대문자로 표시되는 사용자 지정 스타일로 비디오에 직접 자막을 구워 접근성과 몰입도를 향상시킵니다.

  • AI 기반 자체 평가

    시스템은 모든 컷 경계에서 렌더링된 출력을 자체 평가하여, 미리보기를 보여주기 전에 시각적 점프, 오디오 팝, 숨겨진 자막을 포착합니다.

사용 사례

언제 사용하면 좋은가

  • 전문적인 토킹 헤드 비디오 제작

    일시 정지와 추임새를 제거하여 토킹 헤드 푸티지를 신속하게 다듬어 간결하고 매력적인 프레젠테이션을 보장합니다.

  • 역동적인 비디오 몽타주 제작

    자동 컷, 색상 보정, 애니메이션 오버레이로 몽타주를 손쉽게 조립하여 세련되고 전문적인 느낌을 연출합니다.

  • 튜토리얼 비디오 제작 간소화

    반복적인 편집 작업을 자동화하여 튜토리얼 비디오 제작 속도를 높여 제작자가 콘텐츠에 집중할 수 있도록 합니다.

SKILL.md

비디오 유즈

비디오 유즈를 소개합니다 — 클로드 코드로 영상을 편집하세요. 100% 오픈 소스입니다.

원본 영상을 폴더에 넣고, 클로드 코드와 대화하면 final.mp4를 받을 수 있습니다. 토크 헤드, 몽타주, 튜토리얼, 여행, 인터뷰 등 모든 콘텐츠에 대해 사전 설정이나 메뉴 없이 작동합니다.

기능

  • 필러 단어(, , 말더듬)와 테이크 간의 무성 공간을 잘라냅니다
  • 모든 세그먼트에 자동 컬러 그레이딩을 적용합니다 (따뜻한 시네마틱, 중립적 강렬함, 또는 사용자 지정 ffmpeg 체인)
  • 30ms 오디오 페이드를 모든 컷에 적용하여 팝 소리가 전혀 나지 않습니다
  • 자막을 굽기 — 기본적으로 2단어 대문자 청크로 제공되며, 완전히 사용자 지정 가능
  • 애니메이션 오버레이를 생성합니다 — HyperFrames, Remotion, Manim, PIL을 통해 — 애니메이션별로 하나씩, 병렬 하위 에이전트에서 생성됩니다
  • 렌더링된 출력을 자체 평가하여 모든 컷 경계에서 확인한 후에만 결과를 보여줍니다
  • 세션 메모리를 유지하여 project.md에 저장하므로 다음 세션에서 중단한 부분부터 다시 시작할 수 있습니다

설정 프롬프트

클로드 코드, 코덱스, 헤르메스, 오픈클로 또는 셸 접근 권한이 있는 에이전트에 붙여넣으세요:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

에이전트가 클론, 종속성, 스킬 등록을 처리하고 일레븐랩스 API 키를 입력하라는 메시지를 한 번 표시합니다. (키는 elevenlabs.io/app/settings/api-keys에서 받을 수 있습니다).

그런 다음 에이전트에게 원본 테이크가 있는 폴더를 지정하세요:

cd /path/to/your/videos
claude    # or codex, hermes, etc.

자체 VPS 또는 텔레그램에서 상시 편집하려면 Browser Use Box를 통해 에이전트를 실행하세요. 15초 데모 보기.

그리고 세션에서:

이것들을 런칭 비디오로 편집해줘

소스를 인벤토리하고 전략을 제안한 뒤 사용자의 승인을 기다린 다음 소스 옆에 edit/final.mp4를 생성합니다. 모든 출력은 <videos_dir>/edit/에 저장되며 — 스킬 디렉토리는 깨끗하게 유지됩니다.

수동 설치

수동으로 설정하려는 경우:

# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

작동 방식

LLM은 비디오를 시청하지 않습니다. 단어 경계 정밀도로 편집하는 데 필요한 모든 것을 제공하는 두 개의 레이어를 통해 비디오를 읽습니다.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>

레이어 1 — 오디오 트랜스크립트 (항상 로드됨). 소스당 한 번의 일레븐랩스 Scribe 호출로 단어 수준의 타임스탬프, 화자 분리, 오디오 이벤트 ((웃음), (박수), (한숨))를 제공합니다. 모든 테이크가 약 12KB의 단일 takes_packed.md로 압축되어 LLM의 기본 읽기 뷰가 됩니다.

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

레이어 2 — 비주얼 합성 (온디맨드). timeline_view는 모든 시간 범위에 대해 필름스트립 + 파형 + 단어 레이블 PNG를 생성합니다. 모호한 일시 정지, 재촬영 비교, 편집 지점 확인 등 의사 결정 지점에서만 호출됩니다.

단순한 접근 방식: 30,000프레임 × 1,500토큰 = 4,500만 개의 노이즈 토큰. 비디오 유즈: 12KB 텍스트 + 소수의 PNG.

browser-use가 스크린샷 대신 구조화된 DOM을 LLM에 제공하는 것과 동일한 아이디어이지만, 비디오를 위한 것입니다.

파이프라인

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

자체 평가 루프는 모든 컷 경계에서 _렌더링된 출력_에 대해 timeline_view를 실행하여 시각적 점프, 오디오 팝, 숨겨진 자막을 잡아냅니다. 통과한 후에만 미리보기를 볼 수 있습니다.

설계 원칙

  1. 텍스트 + 온디맨드 비주얼. 프레임 덤핑이 없습니다. 트랜스크립트가 표면입니다.
  2. 오디오가 주가 되고 비주얼이 따릅니다. 음성 경계와 무음 간격에서 컷이 발생합니다.
  3. 질문 → 확인 → 실행 → 자체 평가 → 유지. 전략 승인 없이 컷을 절대 건드리지 않습니다.
  4. 콘텐츠 유형에 대한 가정 없음. 보고, 묻고, 편집합니다.
  5. 12가지 엄격한 규칙, 그 외에는 예술적 자유. 제작 정확성은 타협할 수 없습니다. 취향은 아닙니다.

전체 제작 규칙과 편집 기술은 SKILL.md를 참조하세요.

FAQ