видео-использование
Представляем видео-использование — редактируйте видео с Клод Код. 100% открытый исходный код.
Забросьте сырые видеоматериалы в папку, пообщайтесь с Клод Код, получите обратно final.mp4. Работает с любым контентом — говорящие головы, монтаж, туториалы, путешествия, интервью — без пресетов и меню.
Что он делает
- Вырезает слова-паразиты (
umm,uh, фальшстарты) и пустое пространство между дублями - Автоматическая цветокоррекция каждого сегмента (теплый кинематографичный, нейтральный удар, или любая пользовательская цепочка эфэфмпег)
- 30-миллисекундные затухания звука на каждом разрезе, чтобы вы никогда не слышали щелчка
- Вжигает субтитры в вашем стиле — по умолчанию кусками из 2 слов ПРОПИСНЫМИ БУКВАМИ, полностью настраивается
- Генерирует анимационные наложения через ХайперФреймс, Ремоушн, Маним, или ПИЛ — запускается в параллельных субагентах, по одному на анимацию
- Самостоятельно оценивает рендеренный результат на каждой границе разреза перед тем, как показать вам что-либо
- Сохраняет память сессии в
project.md, чтобы сессия на следующей неделе продолжила с того места, где вы остановились
Промпт настройки
Вставьте в Клод Код, Codex, Hermes, Openclaw или любого агента с доступом к командной оболочке:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Агент выполняет клонирование, установку зависимостей, регистрацию навыка и запрашивает один раз ваш API-ключ ЭлевенЛабс (получите его на elevenlabs.io/app/settings/api-keys).
Затем укажите вашему агенту папку с сырыми дублями:
cd /path/to/your/videos
claude # or codex, hermes, etc.
Для непрерывного редактирования с вашего собственного VPS или Telegram запускайте агента через Браузер Юз Бокс. Посмотрите 15-секундную демонстрацию.
А в сессии:
отредактируй это в стартовое видео
Он инвентаризирует исходники, предлагает стратегию, ждет вашего ОК, затем создает edit/final.mp4 рядом с исходными материалами. Все результаты сохраняются в <videos_dir>/edit/ — папка навыка остается чистой.
Ручная установка
Если вы предпочитаете сделать это вручную:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Как это работает
LLM никогда не смотрит видео. Он его читает — через два слоя, которые вместе дают ему всё необходимое для монтажа с точностью до границ слов.
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>Слой 1 — Аудио транскрипт (всегда загружен). Один вызов ЭлевенЛабс Скрайб на каждый источник дает таймстемпы на уровне слов, диаризацию спикеров и аудио-события ((laughter), (applause), (sigh)). Все дубли упаковываются в один ~12KB takes_packed.md — основной материал для чтения LLM.
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Слой 2 — Визуальная композиция (по требованию). timeline_view создает PNG с кинопленкой + волновая форма + текстовые метки для любого временного диапазона. Вызывается только в ключевых точках — неоднозначные паузы, сравнение дублей, проверка точек разрезов.
Наивный подход: 30 000 кадров × 1 500 токенов = 45M токенов шума. Видео-использование: 12KB текст + несколько PNG.
Та же идея, что и браузер-использование, дающая LLM структурированный DOM вместо скриншота — но для видео.
Пайплайн
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Цикл самооценки запускает timeline_view на рендеренном результате на каждой границе разреза — отлавливает визуальные скачки, звуковые щелчки, скрытые субтитры. Вы видите превью только после успешного прохождения.
Принципы проектирования
- Текст + визуальные элементы по требованию. Никакого сброса кадров. Транскрипт — это интерфейс.
- Аудио первично, визуализация следует. Резы идут от границ речи и пауз.
- Спросить → подтвердить → выполнить → самооценка → сохранить. Никогда не трогать монтаж без утверждения стратегии.
- Ноль предположений о типе контента. Посмотри, спроси, а потом редактируй.
- 12 жестких правил, художественная свобода в остальном. Корректность продукции не подлежит обсуждению. Вкус — подлежит.
Смотрите SKILL.md для полных производственных правил и мастерства редактирования.


