NanoSkill
スキルを投稿

ビデオ編集エージェントスキル

作成者browser-use9KGitHub スターGitHub

Claude Code を使って AI で動画を編集し、フィラーワードのカット、カラーグレーディング、字幕の焼き付けなどの作業を自動化します。動画制作ワークフローを効率化し、洗練された最終 MP4 を入手しましょう。

動画セキュリティスキャン済み
結果プレビュー

完全デモ

ペース配分、字幕、強化されたオーディオが改善されたソーシャル メディア クリップに仕上がったインタビュー動画をご覧ください。

はじめる

最初のタスクを実行

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    ステップ 1:インストール

    スキルをエージェントに追加します。

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    ステップ 2:動画をアップロード

    インタビュー、チュートリアル、または製品動画をアップロードし、希望する編集内容を説明してください。

  3. the demo of Video Editing Agent Skill
    03

    ステップ 3:出力を確認

    編集されたバージョンを受け取り、字幕、トランジション、ペース配分を確認します。

インストールコマンド

$ npx skills add https://github.com/browser-use/video-use

概要

video-use は、Claude Code のような AI エージェントを活用して面倒で時間のかかる作業を自動化する、革新的な動画編集アプローチを導入します。このオープンソース ツールを使用すると、素材をフォルダにドロップし、AI エージェントと対話するだけで、洗練された `final.mp4` 出力を得ることができます。カット、カラーグレーディング、字幕焼き付けをインテリジェントに処理することで、トーキング ヘッドからモンタージュまで、さまざまなコンテンツ タイプの動画編集プロセスを効率化するように設計されています。

このシステムは、すべてのフレームを処理するのではなく、詳細な音声トランスクリプトとオンデマンドのビジュアル複合体を通じて動画コンテンツを読み取ることで動作します。この方法により、AI は単語境界の精度で編集を行える一方、計算オーバーヘッドを大幅に削減できます。主な機能には、フィラーワードと無音部分の自動削除、インテリジェントなカラーグレードの適用、シームレスなオーディオ遷移の確保、カスタマイズ可能な字幕の動画への直接焼き付けが含まれます。

自動化に加えて、video-use には堅牢な自己評価パイプラインが組み込まれています。初期処理後、AI は各カット境界でレンダリング出力を確認し、映像の飛びやオーディオのポップノイズなどの不完全な部分を検出して修正します。これにより、最終的な動画がユーザーに提示される前に高い制作基準を満たすことが保証されます。このツールはセッション メモリーも維持するため、ユーザーは中断した編集セッションを正確に再開でき、ワークフローの効率と一貫性が向上します。

主な機能

強力な理由

  • フィラーワードの自動削除

    「あー」「えー」などのフィラーワード、言い直し、テイク間の無音部分を自動的にカットし、クリアな音声を実現します。

  • インテリジェントカラーグレーディング

    すべての動画セグメントを自動カラーグレーディングし、ウォームシネマティック、ニュートラルパンチ、カスタムFFmpegチェーンなどのオプションで、一貫した映像品質を提供します。

  • シームレスなオーディオフェード

    すべてのカットに30ミリ秒のオーディオフェードを適用し、ポップノイズを排除してセグメント間のスムーズなトランジションを実現します。

  • カスタマイズ可能な字幕焼き込み

    字幕をカスタマイズ可能なスタイルで動画に直接焼き込みます。デフォルトでは2単語の大文字チャンクで表示され、アクセシビリティとエンゲージメントを高めます。

  • AIによる自己評価

    システムがレンダリング出力をすべてのカット境界で自己評価し、プレビュー表示前に映像の飛び、音声のポップ、隠れた字幕を検出します。

ユースケース

使うべきタイミング

  • プロフェッショナルなトーキングヘッド動画の制作

    間やフィラーワードを削除してトーキングヘッドの映像をすばやく洗練させ、簡潔で魅力的なプレゼンテーションを実現します。

  • ダイナミックな動画モンタージュの作成

    自動カット、カラーグレーディング、アニメーションオーバーレイでモンタージュを手軽に組み立て、洗練されたプロフェッショナルな仕上がりを実現します。

  • チュートリアル動画制作の効率化

    繰り返しの編集作業を自動化することでチュートリアル動画の作成を加速し、クリエイターがコンテンツに集中できるようにします。

SKILL.md

ビデオユース

ビデオユースの紹介 — クロードコードで動画編集。100%オープンソース。

生の映像をフォルダにドロップし、クロードコードとチャットすれば、final.mp4が返ってきます。トーキングヘッド、モンタージュ、チュートリアル、旅行、インタビューなど、あらゆるコンテンツに対応 — プリセットやメニュー不要。

機能

  • フィラー言葉うーんあの、言い直し)とテイク間の無駄なスペースをカット
  • 各セグメントに自動カラーグレーディング(暖かいシネマ風、ニュートラルパンチ、または任意のカスタムffmpegチェーン)
  • カットごとに30msのオーディオフェードでパチ音を防止
  • あなたのスタイルで字幕を焼き付け — デフォルトは2単語の大文字チャンク、完全カスタマイズ可能
  • HyperFramesRemotionManim、またはPILを介してアニメーションオーバーレイを生成 — アニメーションごとに並列サブエージェントで生成
  • 表示前に全カット境界でレンダリング出力を自己評価
  • project.mdセッションメモリを永続化し、次回のセッションが中断箇所から再開

セットアッププロンプト

クロードコード、Codex、Hermes、Openclaw、またはシェルアクセス可能なエージェントに貼り付け:

私のためにhttps://github.com/browser-use/video-useをセットアップしてください。

まずinstall.mdを読み、このリポジトリをインストールし、ffmpegを設定し、使用中のエージェントにスキルを登録し、ElevenLabs APIキーを設定します。必要になったら、私に貼り付けるよう促してください。次に、日常的な使用のためにSKILL.mdを読み、編集スクリプトが存在するhelpers/も常に読んでください。インストール後は、単独で文字起こしをしないでください。準備ができたら通知し、フォルダに映像がドロップされるのを待ってください。

エージェントはクローン、依存関係、スキル登録を処理し、ElevenLabs APIキーを一度だけ要求します(elevenlabs.io/app/settings/api-keysで取得)。

次に、生のテイクが入ったフォルダをエージェントに指定:

cd /path/to/your/videos
claude    # またはcodex、hermesなど

自身のVPSやTelegramから常時編集するには、Browser Use Box経由でエージェントを実行。15秒のデモを見る

そしてセッション内で:

これらをローンチビデオに編集して

ソースを一覧化し、戦略を提案、OKを待った後、ソースの隣にedit/final.mp4を生成。全出力は<動画ディレクトリ>/edit/に保存 — スキルディレクトリはクリーンに保たれる。

手動インストール

手動で行いたい場合:

# 1. クローンしてエージェントのスキルディレクトリにシンボリックリンク
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # クロードコード用
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex用

# 2. 依存関係をインストール
cd ~/Developer/video-use
uv sync                         # または: pip install -e .
brew install ffmpeg             # 必須
brew install yt-dlp             # オプション、オンラインソースのダウンロード用

# 3. ElevenLabs APIキーを追加
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

仕組み

LLMは動画を決して見ません。読みます — 単語境界の精度でカットするために必要なすべてを提供する2つのレイヤーを介して。

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view合成 — フィルムストリップ + 話者トラック + 波形 + 単語ラベル + 無音区間カット候補" width="100%"> </p>

レイヤー1 — 音声トランスクリプト(常時ロード)。 ソースごとに1回のElevenLabs Scribe呼び出しで、単語レベルのタイムスタンプ、話者ダイアライゼーション、およびオーディオイベント((笑い)(拍手)(ため息))が得られます。全テイクは約12KBのtakes_packed.mdにパック — LLMの主要な読み取りビュー。

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Webエージェントが行うことの90%は完全に無駄です。
  [006.08-006.74] S0 これを修正しました。

レイヤー2 — ビジュアル合成(オンデマンド)。 timeline_viewは任意の時間範囲のフィルムストリップ + 波形 + 単語ラベルPNGを生成。決定ポイント — あいまいな間、リテイク比較、カットポイントの健全性チェック — でのみ呼び出されます。

ナイーブなアプローチ:30,000フレーム × 1,500トークン = 45Mトークンのノイズ。 ビデオユース:12KBのテキスト + 少数のPNG

ブラウザユースがLLMにスクリーンショットではなく構造化DOMを提供するのと同じ考え方 — ただし動画用。

パイプライン

文字起こし ──> パック ──> LLM推論 ──> EDL ──> レンダリング ──> 自己評価
                                                              │
                                                              └─ 問題?修正 + 再レンダリング(最大3回)

自己評価ループはすべてのカット境界で_レンダリング出力_に対してtimeline_viewを実行 — 視覚的な跳躍、オーディオポップ、隠れた字幕をキャッチ。合格後にのみプレビューが表示されます。

設計原則

  1. テキスト + オンデマンドビジュアル。 フレームダンプなし。トランスクリプトが表面。
  2. 音声が主、ビジュアルが従。 カットは音声境界と無音区間から。
  3. 質問 → 確認 → 実行 → 自己評価 → 永続化。 戦略承認なしにカットに触れない。
  4. コンテンツタイプへの仮定ゼロ。 見て、尋ねて、編集。
  5. 12の厳格なルール、それ以外は芸術的自由。 制作的正確性は交渉不可。センスはそうではない。

完全な制作ルールと編集技術についてはSKILL.mdを参照。

FAQ