NanoSkill
Dodaj swoją umiejętność

Umiejętność Agenta Edycji Wideo

przezbrowser-use9Kgwiazdki GitHubGitHub

Edytuj filmy za pomocą AI z Claude Code, automatyzując zadania takie jak wycinanie zbędnych słów, korekcję kolorów i wypalanie napisów. Usprawnij swój proces produkcji wideo i uzyskaj dopracowane finalne MP4.

wideoSkan bezpieczeństwa zakończony pomyślnie
Podgląd wyniku

Pełne demo

Zobacz, jak wideo z wywiadem zostaje dopracowane do klipu na media społecznościowe z lepszym tempem, napisami i ulepszonym dźwiękiem.

Start

Uruchom pierwsze zadanie

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Krok 1:Instaluj

    Dodaj umiejętność do swojego agenta.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Krok 2:Prześlij swoje wideo

    Prześlij wywiad, samouczek lub wideo produktowe i opisz pożądane zmiany.

  3. the demo of Video Editing Agent Skill
    03

    Krok 3:Przejrzyj wynik

    Odbierz zmontowaną wersję i sprawdź napisy, przejścia i tempo.

Komenda instalacji

$ npx skills add https://github.com/browser-use/video-use

O umiejętności

video-use wprowadza innowacyjne podejście do edycji wideo, wykorzystując agentów AI, takich jak Claude Code, do automatyzacji żmudnych i czasochłonnych zadań. To narzędzie open-source pozwala użytkownikom po prostu wrzucić surowy materiał do folderu, porozmawiać z agentem AI i otrzymać dopracowane wyjście `final.mp4`. Zostało zaprojektowane, aby usprawnić proces edycji wideo dla różnych typów treści, od nagrań mówionych po montaże, inteligentnie obsługując cięcia, korekcję kolorów i wypalanie napisów.

System działa poprzez odczytywanie zawartości wideo za pomocą szczegółowych transkrypcji audio i kompozytów wizualnych na żądanie, zamiast przetwarzania każdej klatki. Ta metoda zapewnia AI precyzję na poziomie granic słów podczas edycji, jednocześnie znacznie redukując obciążenie obliczeniowe. Kluczowe możliwości obejmują automatyczne usuwanie zbędnych słów i martwych przestrzeni, stosowanie inteligentnej korekcji kolorów, zapewnienie płynnych przejść audio i wypalanie konfigurowalnych napisów bezpośrednio w wideo.

Poza automatyzacją, video-use zawiera solidny potok samooceny. Po wstępnym przetwarzaniu, AI przegląda wyrenderowane wyjście na każdym granicznym cięciu, aby wykryć i poprawić niedoskonałości, takie jak skoki wizualne czy trzaski audio. Zapewnia to, że końcowe wideo spełnia wysokie standardy produkcyjne, zanim zostanie przedstawione użytkownikowi. Narzędzie przechowuje również pamięć sesji, umożliwiając użytkownikom wznowienie sesji edycji dokładnie w miejscu, w którym przerwali, zwiększając wydajność i spójność pracy.

Kluczowe funkcje

Co czyni ją mocną

  • Automatyczne usuwanie wypełniaczy

    Automatycznie wycina wypełniacze, takie jak 'umm', 'uh', fałszywe starty i martwe przestrzenie między ujęciami, aby uzyskać czystszy dźwięk.

  • Inteligentna korekcja kolorów

    Automatycznie koryguje kolory każdego segmentu wideo, oferując opcje takie jak ciepły filmowy, neutralne wzmocnienie lub niestandardowe łańcuchy FFmpeg dla spójnej jakości wizualnej.

  • Płynne zanikanie dźwięku

    Stosuje 30-milisekundowe zanikanie dźwięku przy każdym cięciu, aby wyeliminować trzaski i zapewnić płynne przejścia między segmentami.

  • Konfigurowalne wypalanie napisów

    Wypala napisy bezpośrednio w filmie w konfigurowalnym stylu, domyślnie w 2-wyrazowych fragmentach pisanych WIELKIMI LITERAMI, zwiększając dostępność i zaangażowanie.

  • Samoocena oparta na AI

    System samodzielnie ocenia wyrenderowane wyjście na każdej granicy cięcia, wychwytując przeskoki wizualne, trzaski audio i ukryte napisy, zanim pokaże podgląd.

Przypadki użycia

Kiedy jej używać

  • Tworzenie profesjonalnych filmów typu talking head

    Szybko dopracuj materiał typu talking head, usuwając pauzy i wypełniacze, zapewniając zwięzłą i angażującą prezentację.

  • Tworzenie dynamicznych montaży wideo

    Bez wysiłku twórz montaże z automatycznymi cięciami, korekcją kolorów i nakładkami animowanymi, uzyskując dopracowany, profesjonalny wygląd.

  • Usprawnienie produkcji samouczków wideo

    Przyspiesz tworzenie samouczków wideo, automatyzując powtarzalne zadania edycyjne, pozwalając twórcom skupić się na treści.

SKILL.md

video-use

Przedstawiamy video-use — edytuj wideo za pomocą Claude Code. W 100% open source.

Wrzuć surowy materiał do folderu, porozmawiaj z Claude Code, odbierz final.mp4. Działa dla dowolnej treści — mówiące głowy, montaże, samouczki, podróże, wywiady — bez ustawień i menu.

Co robi

  • Wycina słowa-wypełniacze (umm, uh, falstarty) i martwe przestrzenie między ujęciami
  • Automatycznie koryguje kolorystykę każdego segmentu (ciepłe kinowe, neutralne uderzenie lub dowolny niestandardowy łańcuch ffmpeg)
  • 30-milisekundowe zanikanie dźwięku przy każdym cięciu, więc nigdy nie usłyszysz trzasku
  • Wypala napisy w twoim stylu — domyślnie 2-wyrazowe WIELKIE LITERY, w pełni konfigurowalne
  • Generuje nakładki animacji za pomocą HyperFrames, Remotion, Manim lub PIL — uruchamiane w równoległych pod-agentach, jeden na animację
  • Samodzielnie ocenia wyrenderowany wynik na każdym granicy cięcia przed pokazaniem czegokolwiek
  • Przechowuje pamięć sesji w project.md, więc sesja w przyszłym tygodniu zaczyna tam, gdzie skończyłeś

Monit konfiguracyjny

Wklej do Claude Code, Codex, Hermes, Openclaw lub dowolnego agenta z dostępem do powłoki:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Agent obsługuje klonowanie, zależności, rejestrację umiejętności i pyta cię raz o klucz API ElevenLabs (weź go z elevenlabs.io/app/settings/api-keys).

Następnie skieruj swojego agenta na folder z surowymi ujęciami:

cd /path/to/your/videos
claude    # or codex, hermes, etc.

Dla ciągłej edycji z własnego VPS lub Telegramu, uruchom agenta przez Browser Use Box. Obejrzyj 15-sekundowe demo.

A w sesji:

edytuj te na film promocyjny

Sporządza inwentarz źródeł, proponuje strategię, czeka na twoją zgodę, a następnie tworzy edit/final.mp4 obok twoich źródeł. Wszystkie wyniki znajdują się w <videos_dir>/edit/ — katalog umiejętności pozostaje czysty.

Instalacja ręczna

Jeśli wolisz zrobić to ręcznie:

# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Jak to działa

LLM nigdy nie ogląda wideo. Czyta je — przez dwie warstwy, które razem dają mu wszystko, czego potrzebuje, by ciąć z precyzją granicy słów.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="kompozyt timeline_view — pasek filmu + ścieżka mówcy + przebieg fali + etykiety słów + kandydaci do cięcia z przerwami ciszy" width="100%"> </p>

Warstwa 1 — Transkrypcja audio (zawsze załadowana). Jedno wywołanie ElevenLabs Scribe na źródło daje znaczniki czasu na poziomie słów, diarizację mówców i zdarzenia audio ((śmiech), (oklaski), (westchnienie)). Wszystkie ujęcia pakowane są do pojedynczego ~12KB takes_packed.md — głównego widoku czytania LLM.

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

Warstwa 2 — Kompozyt wizualny (na żądanie). timeline_view tworzy PNG z paskiem filmu + przebiegiem fali + etykietami słów dla dowolnego zakresu czasu. Wywoływany tylko w punktach decyzyjnych — niejednoznaczne pauzy, porównania powtórek, sprawdzenia poprawności punktów cięcia.

Naiwne podejście: 30 000 klatek × 1 500 tokenów = 45M tokenów szumu. Video Use: 12KB tekstu + garść PNG.

Ta sama idea, co browser-use dające LLM ustrukturyzowany DOM zamiast zrzutu ekranu — ale dla wideo.

Potok

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

Pętla samooceny uruchamia timeline_view na wyrenderowanym wyjściu na każdej granicy cięcia — wyłapuje wizualne skoki, trzaski audio, ukryte napisy. Podgląd widzisz dopiero po przejściu.

Zasady projektowania

  1. Tekst + wizualizacje na żądanie. Żadnego zrzucania klatek. Transkrypcja jest warstwą powierzchniową.
  2. Dźwięk jest podstawowy, wizualizacje podążają. Cięcia wynikają z granic mowy i przerw ciszy.
  3. Zapytaj → potwierdź → wykonaj → oceń → zapisz. Nigdy nie dotykaj cięcia bez zatwierdzenia strategii.
  4. Zero założeń co do rodzaju treści. Obejrzyj, zapytaj, potem edytuj.
  5. 12 twardych zasad, artystyczna swoboda gdzie indziej. Poprawność produkcyjna jest niepodważalna. Smak już nie.

Zobacz SKILL.md dla pełnych zasad produkcyjnych i rzemiosła edycji.

FAQ