NanoSkill
Добавить навык

Навык агента по видеомонтажу

отbrowser-use9Kзвезды GitHubGitHub

Редактируйте видео с помощью ИИ и Клод Код, автоматизируя такие задачи, как вырезание слов-паразитов, цветокоррекция и вшивание субтитров. Оптимизируйте рабочий процесс видеопроизводства и получайте отполированный конечный MP4-файл.

видеоПроверка безопасности пройдена
Превью результата

Полное демо

Посмотрите, как интервью превращается в ролик для социальных сетей с улучшенным темпом, субтитрами и улучшенным звуком.

Начало работы

Запустите первую задачу

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    Шаг 1:Установка

    Добавьте навык вашему агенту.

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    Шаг 2:Загрузите ваше видео

    Загрузите интервью, обучающее или продуктовое видео и опишите желаемые правки.

  3. the demo of Video Editing Agent Skill
    03

    Шаг 3:Проверьте результат

    Получите отредактированную версию и проверьте субтитры, переходы и темп.

Команда установки

$ npx skills add https://github.com/browser-use/video-use

Описание

видео-использование представляет инновационный подход к редактированию видео, используя ИИ-агентов, таких как Клод Код, для автоматизации утомительных и трудоёмких задач. Этот инструмент с открытым исходным кодом позволяет пользователям просто поместить исходный материал в папку, взаимодействовать с ИИ-агентом и получить отполированный результат `final.mp4`. Он разработан для оптимизации процесса редактирования видео для различных типов контента, от говорящих голов до монтажей, интеллектуально обрабатывая обрезку, цветокоррекцию и вшивание субтитров.

Система работает, считывая видеоконтент через детальные аудиотранскрипты и визуальные композиты по запросу, а не обрабатывая каждый кадр. Этот метод обеспечивает ИИ точность на границах слов для редактирования, значительно снижая вычислительные затраты. Ключевые возможности включают автоматическое удаление слов-паразитов и пустых промежутков, применение интеллектуальной цветокоррекции, обеспечение плавных аудиопереходов и вшивание настраиваемых субтитров непосредственно в видео.

Помимо автоматизации, видео-использование включает надёжный конвейер самооценки. После первоначальной обработки ИИ проверяет отрендеренный результат на каждой границе обрезки, чтобы обнаружить и исправить недостатки, такие как визуальные скачки или аудиощелчки. Это гарантирует, что финальное видео соответствует высоким производственным стандартам, прежде чем оно будет представлено пользователю. Инструмент также сохраняет память сессии, позволяя пользователям возобновлять сеансы редактирования ровно с того места, где они остановились, повышая эффективность и согласованность рабочего процесса.

Ключевые функции

Почему это мощно

  • Автоматическое удаление слов-паразитов

    Автоматически вырезает слова-паразиты, такие как «ммм», «э-э», фальстарты и пустоты между дублями для более чистого аудио.

  • Интеллектуальная цветокоррекция

    Автоматически выполняет цветокоррекцию каждого видеосегмента, предлагая такие варианты, как тёплый кинематографический, нейтральный удар или пользовательские цепочки FFmpeg для постоянного визуального качества.

  • Плавные аудиозатухания

    Применяет 30-миллисекундные аудиозатухания на каждом разрезе, чтобы устранить щелчки и обеспечить плавные переходы между сегментами.

  • Настраиваемое вжигание субтитров

    Вжигает субтитры прямо в ваше видео в настраиваемом стиле, по умолчанию блоками из 2 слов в ВЕРХНЕМ РЕГИСТРЕ, улучшая доступность и вовлечённость.

  • Самооценка на основе ИИ

    Система самооценивает отрендеренный результат на каждой границе разреза, выявляя визуальные скачки, аудиощелчки и скрытые субтитры перед показом предварительного просмотра.

Сценарии

Когда использовать

  • Создание профессиональных видео с говорящей головой

    Быстро улучшайте видеоматериал с говорящей головой, удаляя паузы и слова-паразиты, обеспечивая лаконичную и увлекательную презентацию.

  • Создание динамичных видеомонтажей

    Легко собирайте монтажи с автоматическими разрезами, цветокоррекцией и анимационными наложениями для безупречного, профессионального вида.

  • Упрощение производства видео-уроков

    Ускорьте создание видео-уроков, автоматизируя повторяющиеся задачи редактирования, позволяя создателям сосредоточиться на контенте.

SKILL.md

видео-использование

Представляем видео-использование — редактируйте видео с Клод Код. 100% открытый исходный код.

Забросьте сырые видеоматериалы в папку, пообщайтесь с Клод Код, получите обратно final.mp4. Работает с любым контентом — говорящие головы, монтаж, туториалы, путешествия, интервью — без пресетов и меню.

Что он делает

  • Вырезает слова-паразиты (umm, uh, фальшстарты) и пустое пространство между дублями
  • Автоматическая цветокоррекция каждого сегмента (теплый кинематографичный, нейтральный удар, или любая пользовательская цепочка эфэфмпег)
  • 30-миллисекундные затухания звука на каждом разрезе, чтобы вы никогда не слышали щелчка
  • Вжигает субтитры в вашем стиле — по умолчанию кусками из 2 слов ПРОПИСНЫМИ БУКВАМИ, полностью настраивается
  • Генерирует анимационные наложения через ХайперФреймс, Ремоушн, Маним, или ПИЛ — запускается в параллельных субагентах, по одному на анимацию
  • Самостоятельно оценивает рендеренный результат на каждой границе разреза перед тем, как показать вам что-либо
  • Сохраняет память сессии в project.md, чтобы сессия на следующей неделе продолжила с того места, где вы остановились

Промпт настройки

Вставьте в Клод Код, Codex, Hermes, Openclaw или любого агента с доступом к командной оболочке:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Агент выполняет клонирование, установку зависимостей, регистрацию навыка и запрашивает один раз ваш API-ключ ЭлевенЛабс (получите его на elevenlabs.io/app/settings/api-keys).

Затем укажите вашему агенту папку с сырыми дублями:

cd /path/to/your/videos
claude    # or codex, hermes, etc.

Для непрерывного редактирования с вашего собственного VPS или Telegram запускайте агента через Браузер Юз Бокс. Посмотрите 15-секундную демонстрацию.

А в сессии:

отредактируй это в стартовое видео

Он инвентаризирует исходники, предлагает стратегию, ждет вашего ОК, затем создает edit/final.mp4 рядом с исходными материалами. Все результаты сохраняются в <videos_dir>/edit/ — папка навыка остается чистой.

Ручная установка

Если вы предпочитаете сделать это вручную:

# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Как это работает

LLM никогда не смотрит видео. Он его читает — через два слоя, которые вместе дают ему всё необходимое для монтажа с точностью до границ слов.

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>

Слой 1 — Аудио транскрипт (всегда загружен). Один вызов ЭлевенЛабс Скрайб на каждый источник дает таймстемпы на уровне слов, диаризацию спикеров и аудио-события ((laughter), (applause), (sigh)). Все дубли упаковываются в один ~12KB takes_packed.md — основной материал для чтения LLM.

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

Слой 2 — Визуальная композиция (по требованию). timeline_view создает PNG с кинопленкой + волновая форма + текстовые метки для любого временного диапазона. Вызывается только в ключевых точках — неоднозначные паузы, сравнение дублей, проверка точек разрезов.

Наивный подход: 30 000 кадров × 1 500 токенов = 45M токенов шума. Видео-использование: 12KB текст + несколько PNG.

Та же идея, что и браузер-использование, дающая LLM структурированный DOM вместо скриншота — но для видео.

Пайплайн

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

Цикл самооценки запускает timeline_view на рендеренном результате на каждой границе разреза — отлавливает визуальные скачки, звуковые щелчки, скрытые субтитры. Вы видите превью только после успешного прохождения.

Принципы проектирования

  1. Текст + визуальные элементы по требованию. Никакого сброса кадров. Транскрипт — это интерфейс.
  2. Аудио первично, визуализация следует. Резы идут от границ речи и пауз.
  3. Спросить → подтвердить → выполнить → самооценка → сохранить. Никогда не трогать монтаж без утверждения стратегии.
  4. Ноль предположений о типе контента. Посмотри, спроси, а потом редактируй.
  5. 12 жестких правил, художественная свобода в остальном. Корректность продукции не подлежит обсуждению. Вкус — подлежит.

Смотрите SKILL.md для полных производственных правил и мастерства редактирования.

FAQ