video-use
video-use ile tanışın — videoları Claude Code ile düzenleyin. %100 açık kaynak.
Ham çekimleri bir klasöre bırakın, Claude Code ile sohbet edin, final.mp4'ü elde edin. Her tür içerik için çalışır — konuşma başlıkları, montajlar, eğitimler, seyahat, röportajlar — ön ayarlar veya menüler olmadan.
Ne yapar
- Dolgu kelimeleri (
ııı,eee, yanlış başlangıçlar) ve çekimler arasındaki boş alanları keser - Her bölümü otomatik renk düzeltir (sıcak sinematik, nötr vurgulu veya özel bir ffmpeg zinciri)
- Her kesimde 30ms ses geçişleri sayesinde asla bir tıklama duymazsınız
- Kendi tarzınızda altyazı yakar — varsayılan olarak 2 kelimelik BÜYÜK HARF parçaları, tamamen özelleştirilebilir
- HyperFrames, Remotion, Manim veya PIL aracılığıyla animasyon kaplamaları oluşturur — her animasyon için paralel alt ajanlarda çalıştırılır
- Her kesim sınırında işlenmiş çıktıyı kendi kendine değerlendirir ve size bir şey göstermeden önce
project.mddosyasında oturum belleğini saklar, böylece bir sonraki haftaki oturum kaldığınız yerden devam eder
Kurulum istemi
Claude Code, Codex, Hermes, Openclaw veya kabuk erişimi olan herhangi bir ajana yapıştırın:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Ajan, klonlama, bağımlılıklar, beceri kaydı işlemlerini halleder ve sizden bir kez ElevenLabs API anahtarınızı ister (bir anahtarı elevenlabs.io/app/settings/api-keys adresinden alın).
Ardından ajanınızı ham çekimlerin bulunduğu bir klasöre yönlendirin:
cd /path/to/your/videos
claude # or codex, hermes, etc.
Kendi VPS'inizden veya Telegram'dan sürekli düzenleme yapmak için ajanı Browser Use Box üzerinden çalıştırın. 15 saniyelik demoyu izleyin.
Ve oturum sırasında:
bunları bir lansman videosu haline getir
Kaynakları envanterler, bir strateji önerir, onayınızı bekler, ardından kaynaklarınızın yanında edit/final.mp4 dosyasını üretir. Tüm çıktılar <videos_dir>/edit/ dizininde yer alır — beceri dizini temiz kalır.
Manuel kurulum
Bunu elle yapmayı tercih ederseniz:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Nasıl çalışır
LLM videoyu asla izlemez. Onu okur — kelime sınırı hassasiyetiyle kesmek için ihtiyaç duyduğu her şeyi birlikte sağlayan iki katman aracılığıyla.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>Katman 1 — Ses transkripti (her zaman yüklü). Kaynak başına bir ElevenLabs Scribe çağrısı, kelime düzeyinde zaman damgaları, konuşmacı ayrımı ve ses olayları ((kahkaha), (alkış), (iç çekme)) sağlar. Tüm çekimler, yaklaşık 12KB'lık tek bir takes_packed.md dosyasına paketlenir — LLM'nin birincil okuma görünümüdür.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Katman 2 — Görsel kompozit (isteğe bağlı). timeline_view, herhangi bir zaman aralığı için bir film şeridi + dalga formu + kelime etiketleri PNG'si üretir. Yalnızca karar noktalarında — belirsiz duraklamalar, yeniden çekim karşılaştırmaları, kesim noktası doğruluk kontrolleri — çağrılır.
Naif yaklaşım: 30.000 kare × 1.500 token = 45M token gürültü. Video Kullan: 12KB metin + bir avuç PNG.
Tarayıcı kullanımının LLM'ye bir ekran görüntüsü yerine yapılandırılmış bir DOM vermesiyle aynı fikir — ancak video için.
İşlem Hattı
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Kendi kendine değerlendirme döngüsü, her kesim sınırında işlenmiş çıktı üzerinde timeline_view'i çalıştırır — görsel sıçramaları, ses patlamalarını, gizli altyazıları yakalar. Önizlemeyi yalnızca geçtikten sonra görürsünüz.
Tasarım ilkeleri
- Metin + isteğe bağlı görseller. Kare dökümü yok. Transkript yüzeydir.
- Ses önceliklidir, görseller onu takip eder. Kesimler konuşma sınırlarından ve sessizlik boşluklarından gelir.
- Sor → onayla → yürüt → kendi kendine değerlendir → sakla. Strateji onayı olmadan kesime asla dokunmayın.
- İçerik türü hakkında sıfır varsayım. Bak, sor, sonra düzenle.
- 12 katı kural, diğer yerlerde sanatsal özgürlük. Prodüksiyon doğruluğu tartışılmaz. Estetik öyle değil.
Tam prodüksiyon kuralları ve düzenleme sanatı için SKILL.md dosyasına bakın.


