video-use
Przedstawiamy video-use — edytuj wideo za pomocą Claude Code. W 100% open source.
Wrzuć surowy materiał do folderu, porozmawiaj z Claude Code, odbierz final.mp4. Działa dla dowolnej treści — mówiące głowy, montaże, samouczki, podróże, wywiady — bez ustawień i menu.
Co robi
- Wycina słowa-wypełniacze (
umm,uh, falstarty) i martwe przestrzenie między ujęciami - Automatycznie koryguje kolorystykę każdego segmentu (ciepłe kinowe, neutralne uderzenie lub dowolny niestandardowy łańcuch ffmpeg)
- 30-milisekundowe zanikanie dźwięku przy każdym cięciu, więc nigdy nie usłyszysz trzasku
- Wypala napisy w twoim stylu — domyślnie 2-wyrazowe WIELKIE LITERY, w pełni konfigurowalne
- Generuje nakładki animacji za pomocą HyperFrames, Remotion, Manim lub PIL — uruchamiane w równoległych pod-agentach, jeden na animację
- Samodzielnie ocenia wyrenderowany wynik na każdym granicy cięcia przed pokazaniem czegokolwiek
- Przechowuje pamięć sesji w
project.md, więc sesja w przyszłym tygodniu zaczyna tam, gdzie skończyłeś
Monit konfiguracyjny
Wklej do Claude Code, Codex, Hermes, Openclaw lub dowolnego agenta z dostępem do powłoki:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agent obsługuje klonowanie, zależności, rejestrację umiejętności i pyta cię raz o klucz API ElevenLabs (weź go z elevenlabs.io/app/settings/api-keys).
Następnie skieruj swojego agenta na folder z surowymi ujęciami:
cd /path/to/your/videos
claude # or codex, hermes, etc.
Dla ciągłej edycji z własnego VPS lub Telegramu, uruchom agenta przez Browser Use Box. Obejrzyj 15-sekundowe demo.
A w sesji:
edytuj te na film promocyjny
Sporządza inwentarz źródeł, proponuje strategię, czeka na twoją zgodę, a następnie tworzy edit/final.mp4 obok twoich źródeł. Wszystkie wyniki znajdują się w <videos_dir>/edit/ — katalog umiejętności pozostaje czysty.
Instalacja ręczna
Jeśli wolisz zrobić to ręcznie:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Jak to działa
LLM nigdy nie ogląda wideo. Czyta je — przez dwie warstwy, które razem dają mu wszystko, czego potrzebuje, by ciąć z precyzją granicy słów.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="kompozyt timeline_view — pasek filmu + ścieżka mówcy + przebieg fali + etykiety słów + kandydaci do cięcia z przerwami ciszy" width="100%"> </p>Warstwa 1 — Transkrypcja audio (zawsze załadowana). Jedno wywołanie ElevenLabs Scribe na źródło daje znaczniki czasu na poziomie słów, diarizację mówców i zdarzenia audio ((śmiech), (oklaski), (westchnienie)). Wszystkie ujęcia pakowane są do pojedynczego ~12KB takes_packed.md — głównego widoku czytania LLM.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Warstwa 2 — Kompozyt wizualny (na żądanie). timeline_view tworzy PNG z paskiem filmu + przebiegiem fali + etykietami słów dla dowolnego zakresu czasu. Wywoływany tylko w punktach decyzyjnych — niejednoznaczne pauzy, porównania powtórek, sprawdzenia poprawności punktów cięcia.
Naiwne podejście: 30 000 klatek × 1 500 tokenów = 45M tokenów szumu. Video Use: 12KB tekstu + garść PNG.
Ta sama idea, co browser-use dające LLM ustrukturyzowany DOM zamiast zrzutu ekranu — ale dla wideo.
Potok
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Pętla samooceny uruchamia timeline_view na wyrenderowanym wyjściu na każdej granicy cięcia — wyłapuje wizualne skoki, trzaski audio, ukryte napisy. Podgląd widzisz dopiero po przejściu.
Zasady projektowania
- Tekst + wizualizacje na żądanie. Żadnego zrzucania klatek. Transkrypcja jest warstwą powierzchniową.
- Dźwięk jest podstawowy, wizualizacje podążają. Cięcia wynikają z granic mowy i przerw ciszy.
- Zapytaj → potwierdź → wykonaj → oceń → zapisz. Nigdy nie dotykaj cięcia bez zatwierdzenia strategii.
- Zero założeń co do rodzaju treści. Obejrzyj, zapytaj, potem edytuj.
- 12 twardych zasad, artystyczna swoboda gdzie indziej. Poprawność produkcyjna jest niepodważalna. Smak już nie.
Zobacz SKILL.md dla pełnych zasad produkcyjnych i rzemiosła edycji.


