비디오 유즈
비디오 유즈를 소개합니다 — 클로드 코드로 영상을 편집하세요. 100% 오픈 소스입니다.
원본 영상을 폴더에 넣고, 클로드 코드와 대화하면 final.mp4를 받을 수 있습니다. 토크 헤드, 몽타주, 튜토리얼, 여행, 인터뷰 등 모든 콘텐츠에 대해 사전 설정이나 메뉴 없이 작동합니다.
기능
- 필러 단어(
음,어, 말더듬)와 테이크 간의 무성 공간을 잘라냅니다 - 모든 세그먼트에 자동 컬러 그레이딩을 적용합니다 (따뜻한 시네마틱, 중립적 강렬함, 또는 사용자 지정 ffmpeg 체인)
- 30ms 오디오 페이드를 모든 컷에 적용하여 팝 소리가 전혀 나지 않습니다
- 자막을 굽기 — 기본적으로 2단어 대문자 청크로 제공되며, 완전히 사용자 지정 가능
- 애니메이션 오버레이를 생성합니다 — HyperFrames, Remotion, Manim, PIL을 통해 — 애니메이션별로 하나씩, 병렬 하위 에이전트에서 생성됩니다
- 렌더링된 출력을 자체 평가하여 모든 컷 경계에서 확인한 후에만 결과를 보여줍니다
- 세션 메모리를 유지하여
project.md에 저장하므로 다음 세션에서 중단한 부분부터 다시 시작할 수 있습니다
설정 프롬프트
클로드 코드, 코덱스, 헤르메스, 오픈클로 또는 셸 접근 권한이 있는 에이전트에 붙여넣으세요:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
에이전트가 클론, 종속성, 스킬 등록을 처리하고 일레븐랩스 API 키를 입력하라는 메시지를 한 번 표시합니다. (키는 elevenlabs.io/app/settings/api-keys에서 받을 수 있습니다).
그런 다음 에이전트에게 원본 테이크가 있는 폴더를 지정하세요:
cd /path/to/your/videos
claude # or codex, hermes, etc.
자체 VPS 또는 텔레그램에서 상시 편집하려면 Browser Use Box를 통해 에이전트를 실행하세요. 15초 데모 보기.
그리고 세션에서:
이것들을 런칭 비디오로 편집해줘
소스를 인벤토리하고 전략을 제안한 뒤 사용자의 승인을 기다린 다음 소스 옆에 edit/final.mp4를 생성합니다. 모든 출력은 <videos_dir>/edit/에 저장되며 — 스킬 디렉토리는 깨끗하게 유지됩니다.
수동 설치
수동으로 설정하려는 경우:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
작동 방식
LLM은 비디오를 시청하지 않습니다. 단어 경계 정밀도로 편집하는 데 필요한 모든 것을 제공하는 두 개의 레이어를 통해 비디오를 읽습니다.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>레이어 1 — 오디오 트랜스크립트 (항상 로드됨). 소스당 한 번의 일레븐랩스 Scribe 호출로 단어 수준의 타임스탬프, 화자 분리, 오디오 이벤트 ((웃음), (박수), (한숨))를 제공합니다. 모든 테이크가 약 12KB의 단일 takes_packed.md로 압축되어 LLM의 기본 읽기 뷰가 됩니다.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
레이어 2 — 비주얼 합성 (온디맨드). timeline_view는 모든 시간 범위에 대해 필름스트립 + 파형 + 단어 레이블 PNG를 생성합니다. 모호한 일시 정지, 재촬영 비교, 편집 지점 확인 등 의사 결정 지점에서만 호출됩니다.
단순한 접근 방식: 30,000프레임 × 1,500토큰 = 4,500만 개의 노이즈 토큰. 비디오 유즈: 12KB 텍스트 + 소수의 PNG.
browser-use가 스크린샷 대신 구조화된 DOM을 LLM에 제공하는 것과 동일한 아이디어이지만, 비디오를 위한 것입니다.
파이프라인
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
자체 평가 루프는 모든 컷 경계에서 _렌더링된 출력_에 대해 timeline_view를 실행하여 시각적 점프, 오디오 팝, 숨겨진 자막을 잡아냅니다. 통과한 후에만 미리보기를 볼 수 있습니다.
설계 원칙
- 텍스트 + 온디맨드 비주얼. 프레임 덤핑이 없습니다. 트랜스크립트가 표면입니다.
- 오디오가 주가 되고 비주얼이 따릅니다. 음성 경계와 무음 간격에서 컷이 발생합니다.
- 질문 → 확인 → 실행 → 자체 평가 → 유지. 전략 승인 없이 컷을 절대 건드리지 않습니다.
- 콘텐츠 유형에 대한 가정 없음. 보고, 묻고, 편집합니다.
- 12가지 엄격한 규칙, 그 외에는 예술적 자유. 제작 정확성은 타협할 수 없습니다. 취향은 아닙니다.
전체 제작 규칙과 편집 기술은 SKILL.md를 참조하세요.


