NanoSkill
Skill einreichen

Videobearbeitungsagent-Skill

vonbrowser-use9KGitHub-SterneGitHub

Bearbeiten Sie Videos mithilfe von KI mit Claude Code, automatisieren Sie Aufgaben wie das Entfernen von Füllwörtern, Farbkorrektur und das Einbrennen von Untertiteln. Optimieren Sie Ihren Videoproduktions-Workflow und erhalten Sie ein perfekt bearbeitetes endgültiges MP4.

VideoSicherheitsprüfung bestanden
Ergebnisvorschau

Vollständige Demo

Sehen Sie ein Interviewvideo, das zu einem Social-Media-Clip mit verbessertem Tempo, Untertiteln und verbessertem Audio veredelt wurde.

Loslegen

Erste Aufgabe ausführen

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Schritt 1:Installieren

    Fügen Sie den Skill Ihrem Agenten hinzu.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Schritt 2:Laden Sie Ihr Video hoch

    Laden Sie ein Interview-, Tutorial- oder Produktvideo hoch und beschreiben Sie die gewünschten Bearbeitungen.

  3. the demo of Video Editing Agent Skill
    03

    Schritt 3:Ausgabe überprüfen

    Erhalten Sie die bearbeitete Version und überprüfen Sie Untertitel, Übergänge und Tempo.

Installationsbefehl

$ npx skills add https://github.com/browser-use/video-use

Überblick

Video-Nutzung stellt einen innovativen Ansatz zur Videobearbeitung vor, bei dem KI-Agenten wie Claude Code genutzt werden, um langwierige und zeitaufwändige Aufgaben zu automatisieren. Dieses Open-Source-Tool ermöglicht es Benutzern, einfach Rohmaterial in einen Ordner zu legen, mit einem KI-Agenten zu interagieren und eine perfekt bearbeitete `final.mp4`-Ausgabe zu erhalten. Es wurde entwickelt, um den Videobearbeitungsprozess für verschiedene Inhaltstypen zu optimieren, von Talking Heads bis hin zu Montagen, indem es Schnitte, Farbkorrektur und das Einbrennen von Untertiteln intelligent handhabt.

Das System funktioniert, indem es Videoinhalte durch detaillierte Audiotranskripte und bei Bedarf erstellte visuelle Kompositionen liest, anstatt jedes Bild zu verarbeiten. Diese Methode bietet der KI eine wortgenaue Präzision für die Bearbeitung, während der Rechenaufwand erheblich reduziert wird. Zu den Hauptfunktionen gehören das automatische Entfernen von Füllwörtern und Leerzeiten, die Anwendung intelligenter Farbkorrekturen, die Gewährleistung nahtloser Audioübergänge und das direkte Einbrennen anpassbarer Untertitel in das Video.

Über die Automatisierung hinaus integriert Video-Nutzung eine robuste Selbstbewertungs-Pipeline. Nach der ersten Verarbeitung überprüft die KI die gerenderte Ausgabe an jeder Schnittgrenze, um Unvollkommenheiten wie visuelle Sprünge oder Audioknackser zu erkennen und zu korrigieren. Dadurch wird sichergestellt, dass das endgültige Video hohen Produktionsstandards entspricht, bevor es dem Benutzer präsentiert wird. Das Tool behält außerdem den Sitzungsspeicher bei, sodass Benutzer Bearbeitungssitzungen genau dort fortsetzen können, wo sie aufgehört haben, was die Effizienz und Konsistenz des Workflows verbessert.

Wichtige Funktionen

Was ihn stark macht

  • Automatische Entfernung von Füllwörtern

    Entfernt automatisch Füllwörter wie 'ähm', 'äh', Fehlstarts und tote Pausen zwischen Takes für saubereren Ton.

  • Intelligente Farbkorrektur

    Führt eine automatische Farbkorrektur für jedes Videosegment durch, mit Optionen wie warmem Kinolook, neutralem Punch oder benutzerdefinierten FFmpeg-Ketten für gleichbleibende visuelle Qualität.

  • Nahtlose Audio-Fades

    Wendet 30-ms-Audio-Fades an jedem Schnitt an, um Knackser zu vermeiden und sanfte Übergänge zwischen den Segmenten zu gewährleisten.

  • Anpassbares Einbrennen von Untertiteln

    Brennt Untertitel direkt in Ihr Video ein, in einem anpassbaren Stil, standardmäßig in 2-Wort-GROSSBUCHSTABEN-Blöcken, was die Zugänglichkeit und das Engagement verbessert.

  • KI-gestützte Selbstbewertung

    Das System bewertet den gerenderten Output an jeder Schnittkante selbst und erkennt visuelle Sprünge, Audio-Knackser und versteckte Untertitel, bevor es Ihnen die Vorschau zeigt.

Anwendungsfälle

Wann du ihn einsetzen solltest

  • Produktion professioneller Talking-Head-Videos

    Verfeinern Sie Talking-Head-Aufnahmen schnell, indem Sie Pausen und Füllwörter entfernen und so eine prägnante und ansprechende Präsentation sicherstellen.

  • Erstellung dynamischer Video-Montagen

    Stellen Sie mühelos Montagen mit automatischen Schnitten, Farbkorrektur und Animations-Overlays für einen polierten, professionellen Look zusammen.

  • Rationalisierung der Tutorial-Videoproduktion

    Beschleunigen Sie die Erstellung von Tutorial-Videos durch die Automatisierung wiederkehrender Bearbeitungsaufgaben, sodass sich Kreative auf den Inhalt konzentrieren können.

SKILL.md

video-use

Wir stellen vor: video-use — Bearbeiten von Videos mit Claude Code. 100 % Open Source.

Lege das Rohmaterial in einen Ordner, chatte mit Claude Code und erhalte final.mp4 zurück. Funktioniert für jede Art von Inhalt — Talking Heads, Montagen, Tutorials, Reisevideos, Interviews — ohne Voreinstellungen oder Menüs.

Was es macht

  • Entfernt Füllwörter (ähm, äh, Fehlstarts) und Leerlauf zwischen Takes
  • Automatische Farbkorrektur für jedes Segment (warmes Cinematic, neutraler Punch oder jede benutzerdefinierte ffmpeg-Kette)
  • 30 ms Audio-Überblendungen an jedem Schnitt, damit kein Knacken zu hören ist
  • Brennt Untertitel in deinem Stil — standardmäßig 2-Wort-GROSSBUCHSTABEN-Blöcke, vollständig anpassbar
  • Generiert Animations-Overlays über HyperFrames, Remotion, Manim oder PIL — gestartet in parallelen Unteragenten, eine pro Animation
  • Bewertet die gerenderte Ausgabe selbst an jeder Schnittstelle, bevor dir etwas angezeigt wird
  • Speichert den Sitzungsverlauf in project.md, sodass die nächste Sitzung dort weitermacht, wo du aufgehört hast

Einrichtungs-Prompt

Füge dies in Claude Code, Codex, Hermes, Openclaw oder einen beliebigen Agenten mit Shell-Zugriff ein:

Richte https://github.com/browser-use/video-use für mich ein.

Lies zuerst install.md, um dieses Repo zu installieren, ffmpeg zu konfigurieren, die Fähigkeit bei dem Agenten zu registrieren, unter dem du läufst, und den ElevenLabs-API-Schlüssel einzurichten — bitte mich, ihn einzufügen, wenn du ihn benötigst. Dann lies SKILL.md für die tägliche Nutzung und lies immer helpers/, denn dort befinden sich die Bearbeitungsskripte. Nach der Installation transkribiere nichts von selbst — sag mir einfach, dass es bereit ist, und warte, bis ich Material in einen Ordner lege.

Der Agent übernimmt das Klonen, die Abhängigkeiten, die Registrierung der Fähigkeit und fordert dich einmal zur Eingabe deines ElevenLabs-API-Schlüssels auf (hol dir einen unter elevenlabs.io/app/settings/api-keys).

Dann zeige deinem Agenten einen Ordner mit Rohaufnahmen:

cd /pfad/zu/deinen/videos
claude    # oder codex, hermes usw.

Für jederzeit verfügbare Bearbeitung von deinem eigenen VPS oder Telegram, führe den Agenten über Browser Use Box aus. Sieh dir die 15-Sekunden-Demo an.

Und in der Sitzung:

bearbeite diese zu einem Launch-Video

Es inventarisiert die Quellen, schlägt eine Strategie vor, wartet auf deine Bestätigung und produziert dann edit/final.mp4 neben deinen Quellen. Alle Ausgaben landen in <videos_dir>/edit/ — das Fähigkeitsverzeichnis bleibt sauber.

Manuelle Installation

Wenn du es lieber von Hand machen möchtest:

# 1. Klonen und in das Fähigkeiten-Verzeichnis deines Agenten verlinken
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Abhängigkeiten installieren
cd ~/Developer/video-use
uv sync                         # oder: pip install -e .
brew install ffmpeg             # erforderlich
brew install yt-dlp             # optional, zum Herunterladen von Online-Quellen

# 3. Füge deinen ElevenLabs-API-Schlüssel hinzu
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Wie es funktioniert

Das LLM schaut sich das Video nie an. Es liest es — durch zwei Schichten, die zusammen alles liefern, was es braucht, um mit wortgenauer Präzision zu schneiden.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view-Komposit — Filmstreifen + Sprecherspur + Wellenform + Wortbeschriftungen + Stille-Lücke-Schnittkandidaten" width="100%"> </p>

Schicht 1 — Audiotranskript (immer geladen). Ein ElevenLabs Scribe-Aufruf pro Quelle liefert Zeitstempel auf Wortebene, Sprecherdiarisierung und Audioereignisse ((Lachen), (Applaus), (Seufzen)). Alle Takes werden in einer einzigen ~12KB großen takes_packed.md zusammengepackt — die primäre Leseansicht des LLM.

## C0103  (Dauer: 43,0s, 8 Phrasen)
  [002.52-005.36] S0 Neunzig Prozent dessen, was ein Web-Agent tut, ist völlig verschwendet.
  [006.08-006.74] S0 Wir haben das behoben.

Schicht 2 — Visuelles Komposit (bei Bedarf). timeline_view erzeugt ein PNG mit Filmstreifen + Wellenform + Wortbeschriftungen für einen beliebigen Zeitbereich. Wird nur an Entscheidungspunkten aufgerufen — bei mehrdeutigen Pausen, Wiederholungsvergleichen, Plausibilitätsprüfungen der Schnittpunkte.

Naiver Ansatz: 30.000 Bilder × 1.500 Tokens = 45M Tokens Rauschen. Video Use: 12KB Text + eine Handvoll PNGs.

Dasselbe Prinzip wie bei browser-use, das einem LLM ein strukturiertes DOM anstelle eines Screenshots gibt — aber für Video.

Pipeline

Transkribieren ──> Packen ──> LLM überlegt ──> EDL ──> Rendern ──> Selbstbewertung
                                                              │
                                                              └─ Problem? Beheben + erneut rendern (max. 3)

Die Selbstbewertungsschleife führt timeline_view auf der gerenderten Ausgabe an jeder Schnittstelle aus — erkennt visuelle Sprünge, Audioknackser, versteckte Untertitel. Du siehst die Vorschau erst, nachdem sie bestanden wurde.

Designprinzipien

  1. Text + bedarfsgesteuerte Visualisierungen. Kein Bild-Dumping. Das Transkript ist die Oberfläche.
  2. Audio ist primär, Visualisierungen folgen. Schnitte kommen von Sprachgrenzen und Stillelücken.
  3. Fragen → Bestätigen → Ausführen → Selbstbewerten → Speichern. Niemals den Schnitt ohne Strategiebestätigung durchführen.
  4. Keine Annahmen über den Inhaltstyp. Anschauen, fragen, dann bearbeiten.
  5. 12 harte Regeln, künstlerische Freiheit anderswo. Produktionskorrektheit ist nicht verhandelbar. Geschmack schon.

Siehe SKILL.md für die vollständigen Produktionsregeln und die Bearbeitungshandwerk.

FAQ