# Umiejętność Agenta Edycji Wideo

> Edytuj filmy za pomocą AI z Claude Code, automatyzując zadania takie jak wycinanie zbędnych słów, korekcję kolorów i wypalanie napisów. Usprawnij swój proces produkcji wideo i uzyskaj dopracowane finalne MP4.

- Canonical: https://nanoskill.ai/pl/skills/video-editing
- Markdown: https://nanoskill.ai/pl/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: pl
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

video-use wprowadza innowacyjne podejście do edycji wideo, wykorzystując agentów AI, takich jak Claude Code, do automatyzacji żmudnych i czasochłonnych zadań. To narzędzie open-source pozwala użytkownikom po prostu wrzucić surowy materiał do folderu, porozmawiać z agentem AI i otrzymać dopracowane wyjście \`final.mp4\`. Zostało zaprojektowane, aby usprawnić proces edycji wideo dla różnych typów treści, od nagrań mówionych po montaże, inteligentnie obsługując cięcia, korekcję kolorów i wypalanie napisów.

System działa poprzez odczytywanie zawartości wideo za pomocą szczegółowych transkrypcji audio i kompozytów wizualnych na żądanie, zamiast przetwarzania każdej klatki. Ta metoda zapewnia AI precyzję na poziomie granic słów podczas edycji, jednocześnie znacznie redukując obciążenie obliczeniowe. Kluczowe możliwości obejmują automatyczne usuwanie zbędnych słów i martwych przestrzeni, stosowanie inteligentnej korekcji kolorów, zapewnienie płynnych przejść audio i wypalanie konfigurowalnych napisów bezpośrednio w wideo.

Poza automatyzacją, video-use zawiera solidny potok samooceny. Po wstępnym przetwarzaniu, AI przegląda wyrenderowane wyjście na każdym granicznym cięciu, aby wykryć i poprawić niedoskonałości, takie jak skoki wizualne czy trzaski audio. Zapewnia to, że końcowe wideo spełnia wysokie standardy produkcyjne, zanim zostanie przedstawione użytkownikowi. Narzędzie przechowuje również pamięć sesji, umożliwiając użytkownikom wznowienie sesji edycji dokładnie w miejscu, w którym przerwali, zwiększając wydajność i spójność pracy.

## Key features

- **Automatyczne usuwanie wypełniaczy**: Automatycznie wycina wypełniacze, takie jak 'umm', 'uh', fałszywe starty i martwe przestrzenie między ujęciami, aby uzyskać czystszy dźwięk.
- **Inteligentna korekcja kolorów**: Automatycznie koryguje kolory każdego segmentu wideo, oferując opcje takie jak ciepły filmowy, neutralne wzmocnienie lub niestandardowe łańcuchy FFmpeg dla spójnej jakości wizualnej.
- **Płynne zanikanie dźwięku**: Stosuje 30-milisekundowe zanikanie dźwięku przy każdym cięciu, aby wyeliminować trzaski i zapewnić płynne przejścia między segmentami.
- **Konfigurowalne wypalanie napisów**: Wypala napisy bezpośrednio w filmie w konfigurowalnym stylu, domyślnie w 2-wyrazowych fragmentach pisanych WIELKIMI LITERAMI, zwiększając dostępność i zaangażowanie.
- **Samoocena oparta na AI**: System samodzielnie ocenia wyrenderowane wyjście na każdej granicy cięcia, wychwytując przeskoki wizualne, trzaski audio i ukryte napisy, zanim pokaże podgląd.

## Use cases

- **Tworzenie profesjonalnych filmów typu talking head**: Szybko dopracuj materiał typu talking head, usuwając pauzy i wypełniacze, zapewniając zwięzłą i angażującą prezentację.
- **Tworzenie dynamicznych montaży wideo**: Bez wysiłku twórz montaże z automatycznymi cięciami, korekcją kolorów i nakładkami animowanymi, uzyskując dopracowany, profesjonalny wygląd.
- **Usprawnienie produkcji samouczków wideo**: Przyspiesz tworzenie samouczków wideo, automatyzując powtarzalne zadania edycyjne, pozwalając twórcom skupić się na treści.

## Result preview

Zobacz, jak wideo z wywiadem zostaje dopracowane do klipu na media społecznościowe z lepszym tempem, napisami i ulepszonym dźwiękiem.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### Krok 1：Instaluj

Dodaj umiejętność do swojego agenta.

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### Krok 2：Prześlij swoje wideo

Prześlij wywiad, samouczek lub wideo produktowe i opisz pożądane zmiany.

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### Krok 3：Przejrzyj wynik

Odbierz zmontowaną wersję i sprawdź napisy, przejścia i tempo.

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# video-use

Przedstawiamy **video-use** — edytuj wideo za pomocą Claude Code. W 100% open source.

Wrzuć surowy materiał do folderu, porozmawiaj z Claude Code, odbierz `final.mp4`. Działa dla dowolnej treści — mówiące głowy, montaże, samouczki, podróże, wywiady — bez ustawień i menu.

## Co robi

- **Wycina słowa-wypełniacze** (`umm`, `uh`, falstarty) i martwe przestrzenie między ujęciami
- **Automatycznie koryguje kolorystykę** każdego segmentu (ciepłe kinowe, neutralne uderzenie lub dowolny niestandardowy łańcuch ffmpeg)
- **30-milisekundowe zanikanie dźwięku** przy każdym cięciu, więc nigdy nie usłyszysz trzasku
- **Wypala napisy** w twoim stylu — domyślnie 2-wyrazowe WIELKIE LITERY, w pełni konfigurowalne
- **Generuje nakładki animacji** za pomocą [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/) lub PIL — uruchamiane w równoległych pod-agentach, jeden na animację
- **Samodzielnie ocenia wyrenderowany wynik** na każdym granicy cięcia przed pokazaniem czegokolwiek
- **Przechowuje pamięć sesji** w `project.md`, więc sesja w przyszłym tygodniu zaczyna tam, gdzie skończyłeś

## Monit konfiguracyjny

Wklej do Claude Code, Codex, Hermes, Openclaw lub dowolnego agenta z dostępem do powłoki:

```text
Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
```

Agent obsługuje klonowanie, zależności, rejestrację umiejętności i pyta cię raz o klucz API ElevenLabs (weź go z [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)).

Następnie skieruj swojego agenta na folder z surowymi ujęciami:

```bash
cd /path/to/your/videos
claude    # or codex, hermes, etc.
```

Dla ciągłej edycji z własnego VPS lub Telegramu, uruchom agenta przez [Browser Use Box](https://browser-use.com/bux). [Obejrzyj 15-sekundowe demo](https://www.tiktok.com/@browser_use/video/7639824093721758989).

A w sesji:

> edytuj te na film promocyjny

Sporządza inwentarz źródeł, proponuje strategię, czeka na twoją zgodę, a następnie tworzy `edit/final.mp4` obok twoich źródeł. Wszystkie wyniki znajdują się w `<videos_dir>/edit/` — katalog umiejętności pozostaje czysty.

## Instalacja ręczna

Jeśli wolisz zrobić to ręcznie:

```bash
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## Jak to działa

LLM nigdy nie ogląda wideo. **Czyta** je — przez dwie warstwy, które razem dają mu wszystko, czego potrzebuje, by ciąć z precyzją granicy słów.

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="kompozyt timeline_view — pasek filmu + ścieżka mówcy + przebieg fali + etykiety słów + kandydaci do cięcia z przerwami ciszy" width="100%">
</p>

**Warstwa 1 — Transkrypcja audio (zawsze załadowana).** Jedno wywołanie ElevenLabs Scribe na źródło daje znaczniki czasu na poziomie słów, diarizację mówców i zdarzenia audio (`(śmiech)`, `(oklaski)`, `(westchnienie)`). Wszystkie ujęcia pakowane są do pojedynczego ~12KB `takes_packed.md` — głównego widoku czytania LLM.

```
## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.
```

**Warstwa 2 — Kompozyt wizualny (na żądanie).** `timeline_view` tworzy PNG z paskiem filmu + przebiegiem fali + etykietami słów dla dowolnego zakresu czasu. Wywoływany tylko w punktach decyzyjnych — niejednoznaczne pauzy, porównania powtórek, sprawdzenia poprawności punktów cięcia.

> Naiwne podejście: 30 000 klatek × 1 500 tokenów = **45M tokenów szumu**.
> Video Use: **12KB tekstu + garść PNG**.

Ta sama idea, co browser-use dające LLM ustrukturyzowany DOM zamiast zrzutu ekranu — ale dla wideo.

## Potok

```
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)
```

Pętla samooceny uruchamia `timeline_view` na _wyrenderowanym wyjściu_ na każdej granicy cięcia — wyłapuje wizualne skoki, trzaski audio, ukryte napisy. Podgląd widzisz dopiero po przejściu.

## Zasady projektowania

1. **Tekst + wizualizacje na żądanie.** Żadnego zrzucania klatek. Transkrypcja jest warstwą powierzchniową.
2. **Dźwięk jest podstawowy, wizualizacje podążają.** Cięcia wynikają z granic mowy i przerw ciszy.
3. **Zapytaj → potwierdź → wykonaj → oceń → zapisz.** Nigdy nie dotykaj cięcia bez zatwierdzenia strategii.
4. **Zero założeń co do rodzaju treści.** Obejrzyj, zapytaj, potem edytuj.
5. **12 twardych zasad, artystyczna swoboda gdzie indziej.** Poprawność produkcyjna jest niepodważalna. Smak już nie.

Zobacz [`SKILL.md`](./SKILL.md) dla pełnych zasad produkcyjnych i rzemiosła edycji.

## FAQ

### Czym jest video-use?

video-use to narzędzie open-source, które umożliwia edycję wideo za pomocą agentów AI, takich jak Claude Code. Automatyzuje typowe zadania edycyjne, takie jak wycinanie wypełniaczy, korekcja kolorów i dodawanie napisów.

### Jak video-use działa bez oglądania wideo przez LLM?

LLM odczytuje wideo za pomocą dwóch warstw: transkrypcji audio ze znacznikami czasowymi na poziomie słów i diarizacji mówców, oraz generowanych na żądanie kompozytów wizualnych (taśma filmowa + przebieg fali + etykiety słów w formacie PNG) dla punktów decyzyjnych. Takie podejście minimalizuje zużycie tokenów, zapewniając jednocześnie precyzyjne możliwości edycji.

### Jakie typy wideo mogę edytować za pomocą video-use?

video-use zostało zaprojektowane do pracy z każdym typem treści, w tym filmami typu talking head, montażami, samouczkami, vlogami podróżniczymi i wywiadami. Dostosowuje się do Twojego materiału bez konieczności używania presetów czy menu.

### Jakie są główne funkcje video-use?

Kluczowe funkcje obejmują wycinanie wypełniaczy i martwych przestrzeni, automatyczną korekcję kolorów, 30-milisekundowe zanikanie dźwięku, wypalanie konfigurowalnych napisów, generowanie nakładek animowanych, samoocenę wyrenderowanego wyjścia oraz zapamiętywanie sesji.

### Czy potrzebuję klucza API ElevenLabs, aby korzystać z video-use?

Tak, klucz API ElevenLabs jest wymagany do transkrypcji audio i diarizacji mówców, które są kluczowe dla funkcjonalności narzędzia. Zostaniesz poproszony o jego podanie podczas procesu konfiguracji.

### Czy mogę ręcznie zainstalować video-use zamiast korzystać z monitu konfiguracji?

Tak, możesz przeprowadzić ręczną instalację, klonując repozytorium, tworząc dowiązanie symboliczne w katalogu umiejętności agenta, instalując zależności, takie jak FFmpeg, i konfigurując klucz API ElevenLabs w pliku .env.
