video-use
Wir stellen vor: video-use — Bearbeiten von Videos mit Claude Code. 100 % Open Source.
Lege das Rohmaterial in einen Ordner, chatte mit Claude Code und erhalte final.mp4 zurück. Funktioniert für jede Art von Inhalt — Talking Heads, Montagen, Tutorials, Reisevideos, Interviews — ohne Voreinstellungen oder Menüs.
Was es macht
- Entfernt Füllwörter (
ähm,äh, Fehlstarts) und Leerlauf zwischen Takes - Automatische Farbkorrektur für jedes Segment (warmes Cinematic, neutraler Punch oder jede benutzerdefinierte ffmpeg-Kette)
- 30 ms Audio-Überblendungen an jedem Schnitt, damit kein Knacken zu hören ist
- Brennt Untertitel in deinem Stil — standardmäßig 2-Wort-GROSSBUCHSTABEN-Blöcke, vollständig anpassbar
- Generiert Animations-Overlays über HyperFrames, Remotion, Manim oder PIL — gestartet in parallelen Unteragenten, eine pro Animation
- Bewertet die gerenderte Ausgabe selbst an jeder Schnittstelle, bevor dir etwas angezeigt wird
- Speichert den Sitzungsverlauf in
project.md, sodass die nächste Sitzung dort weitermacht, wo du aufgehört hast
Einrichtungs-Prompt
Füge dies in Claude Code, Codex, Hermes, Openclaw oder einen beliebigen Agenten mit Shell-Zugriff ein:
Richte https://github.com/browser-use/video-use für mich ein.
Lies zuerst install.md, um dieses Repo zu installieren, ffmpeg zu konfigurieren, die Fähigkeit bei dem Agenten zu registrieren, unter dem du läufst, und den ElevenLabs-API-Schlüssel einzurichten — bitte mich, ihn einzufügen, wenn du ihn benötigst. Dann lies SKILL.md für die tägliche Nutzung und lies immer helpers/, denn dort befinden sich die Bearbeitungsskripte. Nach der Installation transkribiere nichts von selbst — sag mir einfach, dass es bereit ist, und warte, bis ich Material in einen Ordner lege.
Der Agent übernimmt das Klonen, die Abhängigkeiten, die Registrierung der Fähigkeit und fordert dich einmal zur Eingabe deines ElevenLabs-API-Schlüssels auf (hol dir einen unter elevenlabs.io/app/settings/api-keys).
Dann zeige deinem Agenten einen Ordner mit Rohaufnahmen:
cd /pfad/zu/deinen/videos
claude # oder codex, hermes usw.
Für jederzeit verfügbare Bearbeitung von deinem eigenen VPS oder Telegram, führe den Agenten über Browser Use Box aus. Sieh dir die 15-Sekunden-Demo an.
Und in der Sitzung:
bearbeite diese zu einem Launch-Video
Es inventarisiert die Quellen, schlägt eine Strategie vor, wartet auf deine Bestätigung und produziert dann edit/final.mp4 neben deinen Quellen. Alle Ausgaben landen in <videos_dir>/edit/ — das Fähigkeitsverzeichnis bleibt sauber.
Manuelle Installation
Wenn du es lieber von Hand machen möchtest:
# 1. Klonen und in das Fähigkeiten-Verzeichnis deines Agenten verlinken
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Abhängigkeiten installieren
cd ~/Developer/video-use
uv sync # oder: pip install -e .
brew install ffmpeg # erforderlich
brew install yt-dlp # optional, zum Herunterladen von Online-Quellen
# 3. Füge deinen ElevenLabs-API-Schlüssel hinzu
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Wie es funktioniert
Das LLM schaut sich das Video nie an. Es liest es — durch zwei Schichten, die zusammen alles liefern, was es braucht, um mit wortgenauer Präzision zu schneiden.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view-Komposit — Filmstreifen + Sprecherspur + Wellenform + Wortbeschriftungen + Stille-Lücke-Schnittkandidaten" width="100%"> </p>Schicht 1 — Audiotranskript (immer geladen). Ein ElevenLabs Scribe-Aufruf pro Quelle liefert Zeitstempel auf Wortebene, Sprecherdiarisierung und Audioereignisse ((Lachen), (Applaus), (Seufzen)). Alle Takes werden in einer einzigen ~12KB großen takes_packed.md zusammengepackt — die primäre Leseansicht des LLM.
## C0103 (Dauer: 43,0s, 8 Phrasen)
[002.52-005.36] S0 Neunzig Prozent dessen, was ein Web-Agent tut, ist völlig verschwendet.
[006.08-006.74] S0 Wir haben das behoben.
Schicht 2 — Visuelles Komposit (bei Bedarf). timeline_view erzeugt ein PNG mit Filmstreifen + Wellenform + Wortbeschriftungen für einen beliebigen Zeitbereich. Wird nur an Entscheidungspunkten aufgerufen — bei mehrdeutigen Pausen, Wiederholungsvergleichen, Plausibilitätsprüfungen der Schnittpunkte.
Naiver Ansatz: 30.000 Bilder × 1.500 Tokens = 45M Tokens Rauschen. Video Use: 12KB Text + eine Handvoll PNGs.
Dasselbe Prinzip wie bei browser-use, das einem LLM ein strukturiertes DOM anstelle eines Screenshots gibt — aber für Video.
Pipeline
Transkribieren ──> Packen ──> LLM überlegt ──> EDL ──> Rendern ──> Selbstbewertung
│
└─ Problem? Beheben + erneut rendern (max. 3)
Die Selbstbewertungsschleife führt timeline_view auf der gerenderten Ausgabe an jeder Schnittstelle aus — erkennt visuelle Sprünge, Audioknackser, versteckte Untertitel. Du siehst die Vorschau erst, nachdem sie bestanden wurde.
Designprinzipien
- Text + bedarfsgesteuerte Visualisierungen. Kein Bild-Dumping. Das Transkript ist die Oberfläche.
- Audio ist primär, Visualisierungen folgen. Schnitte kommen von Sprachgrenzen und Stillelücken.
- Fragen → Bestätigen → Ausführen → Selbstbewerten → Speichern. Niemals den Schnitt ohne Strategiebestätigung durchführen.
- Keine Annahmen über den Inhaltstyp. Anschauen, fragen, dann bearbeiten.
- 12 harte Regeln, künstlerische Freiheit anderswo. Produktionskorrektheit ist nicht verhandelbar. Geschmack schon.
Siehe SKILL.md für die vollständigen Produktionsregeln und die Bearbeitungshandwerk.


