penggunaan-video
Memperkenalkan penggunaan-video — edit video dengan Kode Claude. 100% sumber terbuka.
Letakkan rekaman mentah dalam folder, obrolan dengan Kode Claude, dapatkan final.mp4 kembali. Bekerja untuk konten apa pun — pembicara di depan kamera, montase, tutorial, perjalanan, wawancara — tanpa prasetel atau menu.
Apa yang Dilakukannya
- Memotong kata pengisi (
umm,uh, start palsu) dan ruang kosong antara pengambilan - Pewarnaan otomatis setiap segmen (sinematik hangat, punch netral, atau rantai ffmpeg kustom apa saja)
- Fade audio 30ms di setiap potongan sehingga Anda tidak pernah mendengar letupan
- Membakar subtitel sesuai gaya Anda — potongan KAPITAL 2-kata secara default, sepenuhnya dapat disesuaikan
- Menghasilkan overlay animasi melalui HyperFrames, Remotion, Manim, atau PIL — dijalankan dalam sub-agen paralel, satu per animasi
- Mengevaluasi sendiri output yang dirender di setiap batas potongan sebelum menunjukkan apa pun kepada Anda
- Menyimpan memori sesi di
project.mdsehingga sesi minggu depan dapat melanjutkan dari tempat Anda berhenti
Perintah Persiapan
Tempelkan ke Kode Claude, Codex, Hermes, Openclaw, atau agen apa pun dengan akses shell:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agen menangani kloning, dependensi, pendaftaran skill, dan meminta Anda sekali untuk kunci API ElevenLabs (dapatkan di elevenlabs.io/app/settings/api-keys).
Kemudian arahkan agen Anda ke folder yang berisi rekaman mentah:
cd /path/to/your/videos
claude # or codex, hermes, etc.
Untuk pengeditan selalu aktif dari VPS atau Telegram Anda sendiri, jalankan agen melalui Browser Use Box. Tonton demo 15 detik.
Dan dalam sesi:
edit ini menjadi video peluncuran
Ini menginventarisasi sumber, mengusulkan strategi, menunggu persetujuan Anda, lalu menghasilkan edit/final.mp4 di samping sumber Anda. Semua output berada di <videos_dir>/edit/ — direktori skill tetap bersih.
Instalasi Manual
Jika Anda lebih suka melakukannya secara manual:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Cara Kerjanya
LLM tidak pernah menonton video. Ia membacanya — melalui dua lapisan yang bersama-sama memberikan semua yang dibutuhkan untuk memotong dengan presisi batas kata.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>Lapisan 1 — Transkrip audio (selalu dimuat). Satu panggilan ElevenLabs Scribe per sumber memberikan stempel waktu tingkat kata, diarisasi pembicara, dan peristiwa audio ((tawa), (tepuk tangan), (desah)). Semua pengambilan dikemas ke dalam satu file ~12KB takes_packed.md — tampilan bacaan utama LLM.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Lapisan 2 — Komposit visual (sesuai permintaan). timeline_view menghasilkan PNG filmstrip + bentuk gelombang + label kata untuk rentang waktu apa pun. Dipanggil hanya pada titik keputusan — jeda ambigu, perbandingan pengambilan ulang, pemeriksaan kewarasan titik potong.
Pendekatan naif: 30.000 frame × 1.500 token = 45M token noise. Penggunaan Video: 12KB teks + segenggam PNG.
Ide yang sama dengan penggunaan-browser memberikan DOM terstruktur kepada LLM alih-alih tangkapan layar — tetapi untuk video.
Pipa
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Loop evaluasi-diri menjalankan timeline_view pada output yang dirender di setiap batas potongan — mendeteksi lompatan visual, letupan audio, subtitel tersembunyi. Anda melihat pratinjau hanya setelah lulus.
Prinsip Desain
- Teks + visual sesuai permintaan. Tidak ada pembuangan frame. Transkrip adalah permukaan.
- Audio adalah utama, visual mengikuti. Potongan berasal dari batas bicara dan celah sunyi.
- Tanya → konfirmasi → eksekusi → evaluasi-diri → simpan. Jangan pernah menyentuh potongan tanpa persetujuan strategi.
- Tanpa asumsi tentang jenis konten. Lihat, tanya, lalu edit.
- 12 aturan keras, kebebasan artistik di tempat lain. Kebenaran produksi tidak bisa dinegosiasikan. Selera tidak.
Lihat SKILL.md untuk aturan produksi lengkap dan kerajinan pengeditan.


