# Videobearbeitungsagent-Skill

> Bearbeiten Sie Videos mithilfe von KI mit Claude Code, automatisieren Sie Aufgaben wie das Entfernen von Füllwörtern, Farbkorrektur und das Einbrennen von Untertiteln. Optimieren Sie Ihren Videoproduktions-Workflow und erhalten Sie ein perfekt bearbeitetes endgültiges MP4.

- Canonical: https://nanoskill.ai/de/skills/video-editing
- Markdown: https://nanoskill.ai/de/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: de
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

Video-Nutzung stellt einen innovativen Ansatz zur Videobearbeitung vor, bei dem KI-Agenten wie Claude Code genutzt werden, um langwierige und zeitaufwändige Aufgaben zu automatisieren. Dieses Open-Source-Tool ermöglicht es Benutzern, einfach Rohmaterial in einen Ordner zu legen, mit einem KI-Agenten zu interagieren und eine perfekt bearbeitete \`final.mp4\`-Ausgabe zu erhalten. Es wurde entwickelt, um den Videobearbeitungsprozess für verschiedene Inhaltstypen zu optimieren, von Talking Heads bis hin zu Montagen, indem es Schnitte, Farbkorrektur und das Einbrennen von Untertiteln intelligent handhabt.

Das System funktioniert, indem es Videoinhalte durch detaillierte Audiotranskripte und bei Bedarf erstellte visuelle Kompositionen liest, anstatt jedes Bild zu verarbeiten. Diese Methode bietet der KI eine wortgenaue Präzision für die Bearbeitung, während der Rechenaufwand erheblich reduziert wird. Zu den Hauptfunktionen gehören das automatische Entfernen von Füllwörtern und Leerzeiten, die Anwendung intelligenter Farbkorrekturen, die Gewährleistung nahtloser Audioübergänge und das direkte Einbrennen anpassbarer Untertitel in das Video.

Über die Automatisierung hinaus integriert Video-Nutzung eine robuste Selbstbewertungs-Pipeline. Nach der ersten Verarbeitung überprüft die KI die gerenderte Ausgabe an jeder Schnittgrenze, um Unvollkommenheiten wie visuelle Sprünge oder Audioknackser zu erkennen und zu korrigieren. Dadurch wird sichergestellt, dass das endgültige Video hohen Produktionsstandards entspricht, bevor es dem Benutzer präsentiert wird. Das Tool behält außerdem den Sitzungsspeicher bei, sodass Benutzer Bearbeitungssitzungen genau dort fortsetzen können, wo sie aufgehört haben, was die Effizienz und Konsistenz des Workflows verbessert.

## Key features

- **Automatische Entfernung von Füllwörtern**: Entfernt automatisch Füllwörter wie 'ähm', 'äh', Fehlstarts und tote Pausen zwischen Takes für saubereren Ton.
- **Intelligente Farbkorrektur**: Führt eine automatische Farbkorrektur für jedes Videosegment durch, mit Optionen wie warmem Kinolook, neutralem Punch oder benutzerdefinierten FFmpeg-Ketten für gleichbleibende visuelle Qualität.
- **Nahtlose Audio-Fades**: Wendet 30-ms-Audio-Fades an jedem Schnitt an, um Knackser zu vermeiden und sanfte Übergänge zwischen den Segmenten zu gewährleisten.
- **Anpassbares Einbrennen von Untertiteln**: Brennt Untertitel direkt in Ihr Video ein, in einem anpassbaren Stil, standardmäßig in 2-Wort-GROSSBUCHSTABEN-Blöcken, was die Zugänglichkeit und das Engagement verbessert.
- **KI-gestützte Selbstbewertung**: Das System bewertet den gerenderten Output an jeder Schnittkante selbst und erkennt visuelle Sprünge, Audio-Knackser und versteckte Untertitel, bevor es Ihnen die Vorschau zeigt.

## Use cases

- **Produktion professioneller Talking-Head-Videos**: Verfeinern Sie Talking-Head-Aufnahmen schnell, indem Sie Pausen und Füllwörter entfernen und so eine prägnante und ansprechende Präsentation sicherstellen.
- **Erstellung dynamischer Video-Montagen**: Stellen Sie mühelos Montagen mit automatischen Schnitten, Farbkorrektur und Animations-Overlays für einen polierten, professionellen Look zusammen.
- **Rationalisierung der Tutorial-Videoproduktion**: Beschleunigen Sie die Erstellung von Tutorial-Videos durch die Automatisierung wiederkehrender Bearbeitungsaufgaben, sodass sich Kreative auf den Inhalt konzentrieren können.

## Result preview

Sehen Sie ein Interviewvideo, das zu einem Social-Media-Clip mit verbessertem Tempo, Untertiteln und verbessertem Audio veredelt wurde.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### Schritt 1：Installieren

Fügen Sie den Skill Ihrem Agenten hinzu.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### Schritt 2：Laden Sie Ihr Video hoch

Laden Sie ein Interview-, Tutorial- oder Produktvideo hoch und beschreiben Sie die gewünschten Bearbeitungen.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### Schritt 3：Ausgabe überprüfen

Erhalten Sie die bearbeitete Version und überprüfen Sie Untertitel, Übergänge und Tempo.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# video-use

Wir stellen vor: **video-use** — Bearbeiten von Videos mit Claude Code. 100 % Open Source.

Lege das Rohmaterial in einen Ordner, chatte mit Claude Code und erhalte `final.mp4` zurück. Funktioniert für jede Art von Inhalt — Talking Heads, Montagen, Tutorials, Reisevideos, Interviews — ohne Voreinstellungen oder Menüs.

## Was es macht

- **Entfernt Füllwörter** (`ähm`, `äh`, Fehlstarts) und Leerlauf zwischen Takes
- **Automatische Farbkorrektur** für jedes Segment (warmes Cinematic, neutraler Punch oder jede benutzerdefinierte ffmpeg-Kette)
- **30 ms Audio-Überblendungen** an jedem Schnitt, damit kein Knacken zu hören ist
- **Brennt Untertitel** in deinem Stil — standardmäßig 2-Wort-GROSSBUCHSTABEN-Blöcke, vollständig anpassbar
- **Generiert Animations-Overlays** über [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/) oder PIL — gestartet in parallelen Unteragenten, eine pro Animation
- **Bewertet die gerenderte Ausgabe selbst** an jeder Schnittstelle, bevor dir etwas angezeigt wird
- **Speichert den Sitzungsverlauf** in `project.md`, sodass die nächste Sitzung dort weitermacht, wo du aufgehört hast

## Einrichtungs-Prompt

Füge dies in Claude Code, Codex, Hermes, Openclaw oder einen beliebigen Agenten mit Shell-Zugriff ein:

```text
Richte https://github.com/browser-use/video-use für mich ein.

Lies zuerst install.md, um dieses Repo zu installieren, ffmpeg zu konfigurieren, die Fähigkeit bei dem Agenten zu registrieren, unter dem du läufst, und den ElevenLabs-API-Schlüssel einzurichten — bitte mich, ihn einzufügen, wenn du ihn benötigst. Dann lies SKILL.md für die tägliche Nutzung und lies immer helpers/, denn dort befinden sich die Bearbeitungsskripte. Nach der Installation transkribiere nichts von selbst — sag mir einfach, dass es bereit ist, und warte, bis ich Material in einen Ordner lege.
```

Der Agent übernimmt das Klonen, die Abhängigkeiten, die Registrierung der Fähigkeit und fordert dich einmal zur Eingabe deines ElevenLabs-API-Schlüssels auf (hol dir einen unter [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)).

Dann zeige deinem Agenten einen Ordner mit Rohaufnahmen:

```bash
cd /pfad/zu/deinen/videos
claude    # oder codex, hermes usw.
```

Für jederzeit verfügbare Bearbeitung von deinem eigenen VPS oder Telegram, führe den Agenten über [Browser Use Box](https://browser-use.com/bux) aus. [Sieh dir die 15-Sekunden-Demo an](https://www.tiktok.com/@browser_use/video/7639824093721758989).

Und in der Sitzung:

> bearbeite diese zu einem Launch-Video

Es inventarisiert die Quellen, schlägt eine Strategie vor, wartet auf deine Bestätigung und produziert dann `edit/final.mp4` neben deinen Quellen. Alle Ausgaben landen in `<videos_dir>/edit/` — das Fähigkeitsverzeichnis bleibt sauber.

## Manuelle Installation

Wenn du es lieber von Hand machen möchtest:

```bash
# 1. Klonen und in das Fähigkeiten-Verzeichnis deines Agenten verlinken
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Abhängigkeiten installieren
cd ~/Developer/video-use
uv sync                         # oder: pip install -e .
brew install ffmpeg             # erforderlich
brew install yt-dlp             # optional, zum Herunterladen von Online-Quellen

# 3. Füge deinen ElevenLabs-API-Schlüssel hinzu
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## Wie es funktioniert

Das LLM schaut sich das Video nie an. Es **liest** es — durch zwei Schichten, die zusammen alles liefern, was es braucht, um mit wortgenauer Präzision zu schneiden.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view-Komposit — Filmstreifen + Sprecherspur + Wellenform + Wortbeschriftungen + Stille-Lücke-Schnittkandidaten" width="100%">
</p>

**Schicht 1 — Audiotranskript (immer geladen).** Ein ElevenLabs Scribe-Aufruf pro Quelle liefert Zeitstempel auf Wortebene, Sprecherdiarisierung und Audioereignisse (`(Lachen)`, `(Applaus)`, `(Seufzen)`). Alle Takes werden in einer einzigen ~12KB großen `takes_packed.md` zusammengepackt — die primäre Leseansicht des LLM.

```
## C0103  (Dauer: 43,0s, 8 Phrasen)
  [002.52-005.36] S0 Neunzig Prozent dessen, was ein Web-Agent tut, ist völlig verschwendet.
  [006.08-006.74] S0 Wir haben das behoben.
```

**Schicht 2 — Visuelles Komposit (bei Bedarf).** `timeline_view` erzeugt ein PNG mit Filmstreifen + Wellenform + Wortbeschriftungen für einen beliebigen Zeitbereich. Wird nur an Entscheidungspunkten aufgerufen — bei mehrdeutigen Pausen, Wiederholungsvergleichen, Plausibilitätsprüfungen der Schnittpunkte.

> Naiver Ansatz: 30.000 Bilder × 1.500 Tokens = **45M Tokens Rauschen**.
> Video Use: **12KB Text + eine Handvoll PNGs**.

Dasselbe Prinzip wie bei browser-use, das einem LLM ein strukturiertes DOM anstelle eines Screenshots gibt — aber für Video.

## Pipeline

```
Transkribieren ──> Packen ──> LLM überlegt ──> EDL ──> Rendern ──> Selbstbewertung
                                                              │
                                                              └─ Problem? Beheben + erneut rendern (max. 3)
```

Die Selbstbewertungsschleife führt `timeline_view` auf der _gerenderten Ausgabe_ an jeder Schnittstelle aus — erkennt visuelle Sprünge, Audioknackser, versteckte Untertitel. Du siehst die Vorschau erst, nachdem sie bestanden wurde.

## Designprinzipien

1. **Text + bedarfsgesteuerte Visualisierungen.** Kein Bild-Dumping. Das Transkript ist die Oberfläche.
2. **Audio ist primär, Visualisierungen folgen.** Schnitte kommen von Sprachgrenzen und Stillelücken.
3. **Fragen → Bestätigen → Ausführen → Selbstbewerten → Speichern.** Niemals den Schnitt ohne Strategiebestätigung durchführen.
4. **Keine Annahmen über den Inhaltstyp.** Anschauen, fragen, dann bearbeiten.
5. **12 harte Regeln, künstlerische Freiheit anderswo.** Produktionskorrektheit ist nicht verhandelbar. Geschmack schon.

Siehe [`SKILL.md`](./SKILL.md) für die vollständigen Produktionsregeln und die Bearbeitungshandwerk.

## FAQ

### Was ist video-use?

video-use ist ein Open-Source-Tool, mit dem Sie Videos mithilfe von KI-Agenten wie Claude Code bearbeiten können. Es automatisiert häufige Bearbeitungsaufgaben wie das Entfernen von Füllwörtern, die Farbkorrektur und das Hinzufügen von Untertiteln.

### Wie funktioniert video-use, ohne dass das LLM das Video ansieht?

Das LLM erfasst das Video auf zwei Ebenen: ein Audio-Transkript mit Zeitstempeln auf Wortebene und Sprecherdiarisierung sowie bei Bedarf visuelle Zusammensetzungen (Filmstreifen + Wellenform + Wortbeschriftungen als PNGs) für Entscheidungspunkte. Dieser Ansatz minimiert den Token-Verbrauch und ermöglicht gleichzeitig präzise Bearbeitungsmöglichkeiten.

### Welche Arten von Videos kann ich mit video-use bearbeiten?

video-use ist so konzipiert, dass es mit beliebigen Inhaltstypen funktioniert, darunter Talking-Head-Videos, Montagen, Tutorials, Reise-Vlogs und Interviews. Es passt sich an Ihr Footage an, ohne Voreinstellungen oder Menüs zu benötigen.

### Was sind die Kernfunktionen von video-use?

Zu den Kernfunktionen gehören das Entfernen von Füllwörtern und toten Pausen, automatische Farbkorrektur, 30-ms-Audio-Fades, das Einbrennen anpassbarer Untertitel, das Erstellen von Animations-Overlays, die Selbstbewertung des gerenderten Outputs und das Speichern des Sitzungsverlaufs.

### Benötige ich einen ElevenLabs-API-Schlüssel, um video-use zu nutzen?

Ja, für die Audiotranskription und Sprecherdiarisierung wird ein ElevenLabs-API-Schlüssel benötigt, die für die Funktionalität des Tools entscheidend sind. Während des Einrichtungsprozesses werden Sie aufgefordert, diesen anzugeben.

### Kann ich video-use manuell installieren, anstatt das Setup-Prompt zu verwenden?

Ja, Sie können eine manuelle Installation durchführen, indem Sie das Repository klonen, es in das Skills-Verzeichnis Ihres Agenten verlinken, Abhängigkeiten wie FFmpeg installieren und Ihren ElevenLabs-API-Schlüssel in der .env-Datei konfigurieren.
