# ビデオ編集エージェントスキル

> Claude Code を使って AI で動画を編集し、フィラーワードのカット、カラーグレーディング、字幕の焼き付けなどの作業を自動化します。動画制作ワークフローを効率化し、洗練された最終 MP4 を入手しましょう。

- Canonical: https://nanoskill.ai/ja/skills/video-editing
- Markdown: https://nanoskill.ai/ja/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: ja
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

video-use は、Claude Code のような AI エージェントを活用して面倒で時間のかかる作業を自動化する、革新的な動画編集アプローチを導入します。このオープンソース ツールを使用すると、素材をフォルダにドロップし、AI エージェントと対話するだけで、洗練された \`final.mp4\` 出力を得ることができます。カット、カラーグレーディング、字幕焼き付けをインテリジェントに処理することで、トーキング ヘッドからモンタージュまで、さまざまなコンテンツ タイプの動画編集プロセスを効率化するように設計されています。

このシステムは、すべてのフレームを処理するのではなく、詳細な音声トランスクリプトとオンデマンドのビジュアル複合体を通じて動画コンテンツを読み取ることで動作します。この方法により、AI は単語境界の精度で編集を行える一方、計算オーバーヘッドを大幅に削減できます。主な機能には、フィラーワードと無音部分の自動削除、インテリジェントなカラーグレードの適用、シームレスなオーディオ遷移の確保、カスタマイズ可能な字幕の動画への直接焼き付けが含まれます。

自動化に加えて、video-use には堅牢な自己評価パイプラインが組み込まれています。初期処理後、AI は各カット境界でレンダリング出力を確認し、映像の飛びやオーディオのポップノイズなどの不完全な部分を検出して修正します。これにより、最終的な動画がユーザーに提示される前に高い制作基準を満たすことが保証されます。このツールはセッション メモリーも維持するため、ユーザーは中断した編集セッションを正確に再開でき、ワークフローの効率と一貫性が向上します。

## Key features

- **フィラーワードの自動削除**: 「あー」「えー」などのフィラーワード、言い直し、テイク間の無音部分を自動的にカットし、クリアな音声を実現します。
- **インテリジェントカラーグレーディング**: すべての動画セグメントを自動カラーグレーディングし、ウォームシネマティック、ニュートラルパンチ、カスタムFFmpegチェーンなどのオプションで、一貫した映像品質を提供します。
- **シームレスなオーディオフェード**: すべてのカットに30ミリ秒のオーディオフェードを適用し、ポップノイズを排除してセグメント間のスムーズなトランジションを実現します。
- **カスタマイズ可能な字幕焼き込み**: 字幕をカスタマイズ可能なスタイルで動画に直接焼き込みます。デフォルトでは2単語の大文字チャンクで表示され、アクセシビリティとエンゲージメントを高めます。
- **AIによる自己評価**: システムがレンダリング出力をすべてのカット境界で自己評価し、プレビュー表示前に映像の飛び、音声のポップ、隠れた字幕を検出します。

## Use cases

- **プロフェッショナルなトーキングヘッド動画の制作**: 間やフィラーワードを削除してトーキングヘッドの映像をすばやく洗練させ、簡潔で魅力的なプレゼンテーションを実現します。
- **ダイナミックな動画モンタージュの作成**: 自動カット、カラーグレーディング、アニメーションオーバーレイでモンタージュを手軽に組み立て、洗練されたプロフェッショナルな仕上がりを実現します。
- **チュートリアル動画制作の効率化**: 繰り返しの編集作業を自動化することでチュートリアル動画の作成を加速し、クリエイターがコンテンツに集中できるようにします。

## Result preview

ペース配分、字幕、強化されたオーディオが改善されたソーシャル メディア クリップに仕上がったインタビュー動画をご覧ください。

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### ステップ 1：インストール

スキルをエージェントに追加します。

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### ステップ 2：動画をアップロード

インタビュー、チュートリアル、または製品動画をアップロードし、希望する編集内容を説明してください。

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### ステップ 3：出力を確認

編集されたバージョンを受け取り、字幕、トランジション、ペース配分を確認します。

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# ビデオユース

**ビデオユース**の紹介 — クロードコードで動画編集。100%オープンソース。

生の映像をフォルダにドロップし、クロードコードとチャットすれば、`final.mp4`が返ってきます。トーキングヘッド、モンタージュ、チュートリアル、旅行、インタビューなど、あらゆるコンテンツに対応 — プリセットやメニュー不要。

## 機能

- **フィラー言葉**（`うーん`、`あの`、言い直し）とテイク間の無駄なスペースをカット
- 各セグメントに**自動カラーグレーディング**（暖かいシネマ風、ニュートラルパンチ、または任意のカスタムffmpegチェーン）
- カットごとに**30msのオーディオフェード**でパチ音を防止
- あなたのスタイルで**字幕を焼き付け** — デフォルトは2単語の大文字チャンク、完全カスタマイズ可能
- [HyperFrames](https://github.com/heygen-com/hyperframes)、[Remotion](https://www.remotion.dev/)、[Manim](https://www.manim.community/)、またはPILを介して**アニメーションオーバーレイを生成** — アニメーションごとに並列サブエージェントで生成
- 表示前に全カット境界で**レンダリング出力を自己評価**
- `project.md`に**セッションメモリを永続化**し、次回のセッションが中断箇所から再開

## セットアッププロンプト

クロードコード、Codex、Hermes、Openclaw、またはシェルアクセス可能なエージェントに貼り付け：

```text
私のためにhttps://github.com/browser-use/video-useをセットアップしてください。

まずinstall.mdを読み、このリポジトリをインストールし、ffmpegを設定し、使用中のエージェントにスキルを登録し、ElevenLabs APIキーを設定します。必要になったら、私に貼り付けるよう促してください。次に、日常的な使用のためにSKILL.mdを読み、編集スクリプトが存在するhelpers/も常に読んでください。インストール後は、単独で文字起こしをしないでください。準備ができたら通知し、フォルダに映像がドロップされるのを待ってください。
```

エージェントはクローン、依存関係、スキル登録を処理し、ElevenLabs APIキーを一度だけ要求します（[elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys)で取得）。

次に、生のテイクが入ったフォルダをエージェントに指定：

```bash
cd /path/to/your/videos
claude    # またはcodex、hermesなど
```

自身のVPSやTelegramから常時編集するには、[Browser Use Box](https://browser-use.com/bux)経由でエージェントを実行。[15秒のデモを見る](https://www.tiktok.com/@browser_use/video/7639824093721758989)。

そしてセッション内で：

> これらをローンチビデオに編集して

ソースを一覧化し、戦略を提案、OKを待った後、ソースの隣に`edit/final.mp4`を生成。全出力は`<動画ディレクトリ>/edit/`に保存 — スキルディレクトリはクリーンに保たれる。

## 手動インストール

手動で行いたい場合：

```bash
# 1. クローンしてエージェントのスキルディレクトリにシンボリックリンク
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # クロードコード用
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex用

# 2. 依存関係をインストール
cd ~/Developer/video-use
uv sync                         # または: pip install -e .
brew install ffmpeg             # 必須
brew install yt-dlp             # オプション、オンラインソースのダウンロード用

# 3. ElevenLabs APIキーを追加
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## 仕組み

LLMは動画を決して見ません。**読みます** — 単語境界の精度でカットするために必要なすべてを提供する2つのレイヤーを介して。

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view合成 — フィルムストリップ + 話者トラック + 波形 + 単語ラベル + 無音区間カット候補" width="100%">
</p>

**レイヤー1 — 音声トランスクリプト（常時ロード）。** ソースごとに1回のElevenLabs Scribe呼び出しで、単語レベルのタイムスタンプ、話者ダイアライゼーション、およびオーディオイベント（`(笑い)`、`(拍手)`、`(ため息)`）が得られます。全テイクは約12KBの`takes_packed.md`にパック — LLMの主要な読み取りビュー。

```
## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Webエージェントが行うことの90%は完全に無駄です。
  [006.08-006.74] S0 これを修正しました。
```

**レイヤー2 — ビジュアル合成（オンデマンド）。** `timeline_view`は任意の時間範囲のフィルムストリップ + 波形 + 単語ラベルPNGを生成。決定ポイント — あいまいな間、リテイク比較、カットポイントの健全性チェック — でのみ呼び出されます。

> ナイーブなアプローチ：30,000フレーム × 1,500トークン = **45Mトークンのノイズ**。
> ビデオユース：**12KBのテキスト + 少数のPNG**。

ブラウザユースがLLMにスクリーンショットではなく構造化DOMを提供するのと同じ考え方 — ただし動画用。

## パイプライン

```
文字起こし ──> パック ──> LLM推論 ──> EDL ──> レンダリング ──> 自己評価
                                                              │
                                                              └─ 問題？修正 + 再レンダリング（最大3回）
```

自己評価ループはすべてのカット境界で_レンダリング出力_に対して`timeline_view`を実行 — 視覚的な跳躍、オーディオポップ、隠れた字幕をキャッチ。合格後にのみプレビューが表示されます。

## 設計原則

1. **テキスト + オンデマンドビジュアル。** フレームダンプなし。トランスクリプトが表面。
2. **音声が主、ビジュアルが従。** カットは音声境界と無音区間から。
3. **質問 → 確認 → 実行 → 自己評価 → 永続化。** 戦略承認なしにカットに触れない。
4. **コンテンツタイプへの仮定ゼロ。** 見て、尋ねて、編集。
5. **12の厳格なルール、それ以外は芸術的自由。** 制作的正確性は交渉不可。センスはそうではない。

完全な制作ルールと編集技術については[`SKILL.md`](./SKILL.md)を参照。

## FAQ

### video-useとは何ですか？

video-useは、Claude CodeのようなAIエージェントを使って動画編集を可能にするオープンソースツールです。フィラーワードのカット、カラーグレーディング、字幕追加などの一般的な編集作業を自動化します。

### video-useは、LLMが動画を視聴せずにどのように動作しますか？

LLMは2つの層を通じて動画を読み取ります：単語レベルのタイムスタンプと話者識別を含む音声トランスクリプト、および判断ポイントのためのオンデマンドの視覚的合成（フィルムストリップ＋波形＋単語ラベルPNG）。このアプローチにより、トークン使用量を最小限に抑えつつ、正確な編集機能を提供します。

### video-useで編集できる動画の種類は何ですか？

video-useは、トーキングヘッド、モンタージュ、チュートリアル、旅行ビデオブログ、インタビューなど、あらゆるコンテンツタイプで動作するように設計されています。プリセットやメニューを必要とせず、映像に適応します。

### video-useの主な機能は何ですか？

主な機能には、フィラーワードと無音部分のカット、自動カラーグレーディング、30ミリ秒のオーディオフェード、カスタマイズ可能な字幕の焼き込み、アニメーションオーバーレイの生成、レンダリング出力の自己評価、セッションメモリの保存が含まれます。

### video-useを使用するには、ElevenLabs APIキーが必要ですか？

はい、ツールの機能に不可欠な音声トランスクリプションと話者識別のために、ElevenLabs APIキーが必要です。セットアッププロセス中に入力を求められます。

### セットアッププロンプトを使用せずに、video-useを手動でインストールできますか？

はい、リポジトリをクローンし、エージェントのスキルディレクトリにシンボリックリンクを作成し、FFmpegなどの依存関係をインストールし、.envファイルにElevenLabs APIキーを設定することで、手動インストールを実行できます。
