# ทักษะเอเจนต์ตัดต่อวิดีโอ

> ตัดต่อวิดีโอด้วย AI โดยใช้ Claude Code ให้งานอัตโนมัติ เช่น ตัดคำพูดติดขัด ปรับสี และเบิร์นคำบรรยาย ทำให้กระบวนการผลิตวิดีโอของคุณคล่องตัวขึ้นและได้ไฟล์ MP4 ที่สวยงาม

- Canonical: https://nanoskill.ai/th/skills/video-editing
- Markdown: https://nanoskill.ai/th/skills/video-editing.md
- Author: browser-use
- Published: 2026-06-09T05:30:00.000Z
- Updated: 2026-07-17T03:29:25.412Z
- Language: th
- Source type: github
- Popularity signal: 8913

## Sources

- https://github.com/browser-use/video-use

## Install

```shell
npx skills add https://github.com/browser-use/video-use
```

## About

video-use นำเสนอแนวทางที่สร้างสรรค์ในการตัดต่อวิดีโอ โดยใช้เอเจนต์ AI เช่น Claude Code เพื่อทำงานที่น่าเบื่อและใช้เวลานานโดยอัตโนมัติ เครื่องมือโอเพนซอร์สนี้ช่วยให้ผู้ใช้เพียงแค่วางฟุตเทจดิบลงในโฟลเดอร์ โต้ตอบกับเอเจนต์ AI และรับผลลัพธ์ \`final.mp4\` ที่สวยงาม มันถูกออกแบบมาเพื่อให้กระบวนการตัดต่อวิดีโอคล่องตัวสำหรับเนื้อหาหลายประเภท ตั้งแต่วิดีโอพูดหน้ากล้องไปจนถึงมอนทาจ โดยจัดการการตัด การปรับสี และการเบิร์นคำบรรยายอย่างชาญฉลาด

ระบบทำงานโดยการอ่านเนื้อหาวิดีโอผ่านบทถอดเสียงที่มีรายละเอียดและภาพรวมที่สร้างขึ้นตามต้องการ แทนที่จะประมวลผลทุกเฟรม วิธีการนี้ให้ความแม่นยำระดับขอบเขตคำสำหรับการตัดต่อแก่ AI ในขณะที่ลดภาระการคำนวณลงอย่างมาก ความสามารถหลักรวมถึงการลบคำพูดติดขัดและพื้นที่ว่างโดยอัตโนมัติ การปรับสีอย่างชาญฉลาด การทำให้การเปลี่ยนผ่านเสียงราบรื่น และการเบิร์นคำบรรยายที่ปรับแต่งได้ลงในวิดีโอโดยตรง

นอกเหนือจากการทำงานอัตโนมัติแล้ว video-use ยังมีไปป์ไลน์การประเมินตนเองที่แข็งแกร่ง หลังจากการประมวลผลเบื้องต้น AI จะตรวจสอบผลลัพธ์ที่เรนเดอร์แล้วที่แต่ละขอบเขตการตัดเพื่อตรวจจับและแก้ไขความไม่สมบูรณ์ เช่น ภาพกระโดดหรือเสียงแตก สิ่งนี้ทำให้แน่ใจว่าวิดีโอสุดท้ายมีมาตรฐานการผลิตสูงก่อนที่จะนำเสนอแก่ผู้ใช้ เครื่องมือนี้ยังรักษาหน่วยความจำเซสชัน ทำให้ผู้ใช้สามารถกลับมาตัดต่อต่อจากจุดที่ค้างไว้ได้อย่างแม่นยำ เพิ่มประสิทธิภาพและความสม่ำเสมอของเวิร์กโฟลว์

## Key features

- **การลบคำที่ไร้สาระอัตโนมัติ**: ตัดคำที่ไร้สาระโดยอัตโนมัติเช่น 'อืม' 'เอ่อ' การเริ่มต้นผิด และพื้นที่ว่างระหว่างเทคเพื่อให้เสียงที่สะอาดขึ้น
- **การปรับแต่งสีอัจฉริยะ**: ปรับแต่งสีอัตโนมัติทุกเซกเมนต์วิดีโอ มีตัวเลือกเช่น อบอุ่นแบบภาพยนตร์, เป็นกลาง, หรือห่วงโซ่ เอฟเอฟเอ็มเพก แบบกำหนดเอง เพื่อคุณภาพภาพที่สม่ำเสมอ
- **การเฟดเสียงที่ไร้รอยต่อ**: ใช้การเฟดเสียง 30 มิลลิวินาทีที่ทุกการตัดเพื่อขจัดเสียงป็อปและทำให้การเปลี่ยนระหว่างเซกเมนต์ราบรื่น
- **การเบิร์นคำบรรยายที่ปรับแต่งได้**: เบิร์นคำบรรยายลงในวิดีโอของคุณโดยตรงในสไตล์ที่ปรับแต่งได้ โดยค่าเริ่มต้นเป็นกลุ่มคำสองคำเป็นตัวพิมพ์ใหญ่ ซึ่งเพิ่มการเข้าถึงและการมีส่วนร่วม
- **การประเมินตนเองด้วยเอไอ**: ระบบประเมินผลลัพธ์ที่เรนเดอร์ด้วยตนเองที่ทุกขอบเขตการตัด จับการกระโดดของภาพ ป๊อปของเสียง และคำบรรยายที่ซ่อนก่อนที่จะแสดงตัวอย่างให้คุณ

## Use cases

- **การผลิตวิดีโอพูดคนเดียวระดับมืออาชีพ**: ปรับแต่งฟุตเทจพูดคนเดียวได้อย่างรวดเร็วโดยลบการหยุดและคำที่ไร้สาระ ทำให้การนำเสนอสั้นและน่าสนใจ
- **การสร้างภาพตัดต่อวิดีโอแบบไดนามิก**: ประกอบภาพตัดต่อได้อย่างง่ายดายด้วยการตัดอัตโนมัติ การปรับแต่งสี และโอเวอร์เลย์แอนิเมชัน เพื่อรูปลักษณ์ที่ประณีตและเป็นมืออาชีพ
- **การปรับปรุงการผลิตวิดีโอสอนให้คล่องตัว**: เร่งการสร้างวิดีโอสอนด้วยการทำให้งานแก้ไขที่ซ้ำซากเป็นอัตโนมัติ ช่วยให้ผู้สร้างมุ่งเน้นที่เนื้อหา

## Result preview

ดูวิดีโอสัมภาษณ์ที่ถูกปรับแต่งเป็นคลิปโซเชียลมีเดียที่มีจังหวะที่ดีขึ้น คำบรรยาย และเสียงที่ปรับปรุงแล้ว

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-2.png)

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-3.png)

## Result walkthrough

### ขั้นตอนที่ 1：ติดตั้ง

เพิ่มทักษะให้กับเอเจนต์ของคุณ

![a simple demonstration of the first step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-1.jpg)

### ขั้นตอนที่ 2：อัปโหลดวิดีโอของคุณ

อัปโหลดวิดีโอสัมภาษณ์ บทสอน หรือผลิตภัณฑ์ และอธิบายการตัดต่อที่ต้องการ

![a simple demonstration of the second step in using Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-step-2.jpg)

### ขั้นตอนที่ 3：ตรวจสอบผลลัพธ์

รับเวอร์ชันที่ตัดต่อแล้วและตรวจสอบคำบรรยาย การเปลี่ยนผ่าน และจังหวะ

![the demo of Video Editing Agent Skill](https://file.nanoskill.ai/video-editing-demo-1.png)

## Skill definition

# video-use

แนะนำ **video-use** — ตัดต่อวิดีโอด้วย Claude Code  โอเพ่นซอร์ส 100%

เพียงวางฟุตเทจดิบในโฟลเดอร์ คุยกับ Claude Code แล้วคุณจะได้ `final.mp4` กลับมา ใช้ได้กับทุกเนื้อหา — วิดีโอพูดหน้ากล้อง, มอนทาจ, บทเรียน, ท่องเที่ยว, สัมภาษณ์ — โดยไม่ต้องใช้พรีเซ็ตหรือเมนู

## ความสามารถ

- **ตัดคำพูดติดขัด** (`อืมม`, `เอ่อ`, การเริ่มพูดผิด) และช่วงเงียบระหว่างเทค
- **ปรับสีอัตโนมัติ** ทุกเซกเมนต์ (โทนอบอุ่นแบบภาพยนตร์, สีสว่างเป็นกลาง, หรือใช้ ffmpeg chain ตามที่กำหนดเอง)
- **เสียงเฟดเข้า-ออก 30ms** ทุกจุดตัด คุณจะไม่ได้ยินเสียงป๊อป
- **ฝังซับไตเติ้ล** ในสไตล์ของคุณ — ค่าเริ่มต้นเป็นกลุ่มคำ 2 คำตัวพิมพ์ใหญ่ ปรับแต่งได้เต็มที่
- **สร้างภาพซ้อนแอนิเมชัน** ผ่าน [HyperFrames](https://github.com/heygen-com/hyperframes), [Remotion](https://www.remotion.dev/), [Manim](https://www.manim.community/) หรือ PIL — ทำงานด้วย sub-agent แบบขนาน หนึ่งตัวต่อหนึ่งแอนิเมชัน
- **ประเมินผลลัพธ์เอง** ที่ทุกขอบเขตการตัดก่อนแสดงให้คุณดู
- **บันทึกความจำเซสชัน** ใน `project.md` ให้เซสชันสัปดาห์หน้าต่อจากที่ค้างไว้

## พรอมต์ตั้งค่า

วางลงใน Claude Code, Codex, Hermes, Openclaw หรือเอเจ้นท์ใดก็ได้ที่เข้าถึงเชลล์ได้:

```text
ตั้งค่า https://github.com/browser-use/video-use ให้ฉัน

อ่าน install.md ก่อนเพื่อติดตั้ง repo นี้ ตั้งค่า ffmpeg ลงทะเบียนสกิลกับเอเจ้นท์ที่คุณใช้งานอยู่ และตั้งค่า ElevenLabs API key — ขอให้ฉันวางให้เมื่อจำเป็น จากนั้นอ่าน SKILL.md สำหรับการใช้งานประจำวัน และให้อ่าน helpers/ เพราะสคริปต์ตัดต่ออยู่ที่นั่น หลังจากติดตั้งเสร็จ อย่าแปลงเสียงเป็นข้อความเอง — แค่บอกฉันว่าพร้อมแล้วรอฉันวางฟุตเทจลงโฟลเดอร์
```

เอเจ้นท์จะจัดการการโคลน, dependencies, การลงทะเบียนสกิล และถามคุณครั้งหนึ่งเพื่อขอ ElevenLabs API key (รับได้ที่ [elevenlabs.io/app/settings/api-keys](https://elevenlabs.io/app/settings/api-keys))

จากนั้นชี้เอเจ้นท์ของคุณไปยังโฟลเดอร์เทคดิบ:

```bash
cd /path/to/your/videos
claude    # หรือ codex, hermes, ฯลฯ
```

สำหรับการตัดต่อที่พร้อมตลอดเวลาจาก VPS หรือ Telegram ของคุณเอง รันเอเจ้นท์ผ่าน [Browser Use Box](https://browser-use.com/bux) [ดูเดโม 15 วินาที](https://www.tiktok.com/@browser_use/video/7639824093721758989)

และในเซสชัน:

> ตัดต่อพวกนี้เป็นวิดีโอเปิดตัว

มันจะสำรวจแหล่งที่มา เสนอกลยุทธ์ รอการยืนยันจากคุณ แล้วผลิต `edit/final.mp4` ไว้ข้างแหล่งที่มาของคุณ ผลลัพธ์ทั้งหมดอยู่ใน `<videos_dir>/edit/` — ไดเรกทอรีสกิลจะยังคงสะอาด

## การติดตั้งด้วยตัวเอง

หากคุณอยากทำเอง:

```bash
# 1. โคลนและสร้าง symlink ไปยังไดเรกทอรีสกิลของเอเจ้นท์
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. ติดตั้ง dependencies
cd ~/Developer/video-use
uv sync                         # หรือ: pip install -e .
brew install ffmpeg             # จำเป็น
brew install yt-dlp             # ไม่จำเป็น, สำหรับดาวน์โหลดแหล่งที่มาออนไลน์

# 3. เพิ่ม ElevenLabs API key ของคุณ
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...
```

## วิธีการทำงาน

LLM ไม่เคยดูวิดีโอ แต่มัน **อ่าน** มัน — ผ่านสองเลเยอร์ที่รวมกันแล้วให้ทุกอย่างที่จำเป็นในการตัดด้วยความแม่นยำระดับขอบเขตคำ

<p align="center">
  <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%">
</p>

**เลเยอร์ 1 — ทรานสคริปต์เสียง (โหลดตลอดเวลา)** หนึ่งการเรียก ElevenLabs Scribe ต่อแหล่งที่มา ให้การประทับเวลาระดับคำ การแยกผู้พูด และเหตุการณ์เสียง (`(หัวเราะ)`, `(ปรบมือ)`, `(ถอนหายใจ)`). ทุกเทคถูกบรรจุลงใน `takes_packed.md` ขนาดประมาณ 12KB — มุมมองการอ่านหลักของ LLM

```
## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 เก้าสิบเปอร์เซ็นต์ของสิ่งที่เว็บเอเจ้นท์ทำนั้นเสียเปล่าโดยสิ้นเชิง
  [006.08-006.74] S0 เราแก้ไขเรื่องนี้แล้ว
```

**เลเยอร์ 2 — ภาพคอมโพสิต (เมื่อเรียกใช้)** `timeline_view` สร้างภาพ PNG แบบฟิล์มสตริป + รูปคลื่น + ป้ายคำสำหรับช่วงเวลาใด ๆ ถูกเรียกใช้เฉพาะที่จุดตัดสินใจ — การหยุดที่คลุมเครือ, การเปรียบเทียบการถ่ายทำใหม่, การตรวจสอบจุดตัด

> วิธีที่ไร้ประสิทธิภาพ: 30,000 เฟรม × 1,500 โทเค็น = **45 ล้านโทเค็นของสัญญาณรบกวน**
> Video Use: **ข้อความ 12KB + ภาพ PNG สองสามภาพ**

แนวคิดเดียวกับที่ browser-use ให้ LLM เห็น DOM ที่มีโครงสร้างแทนภาพหน้าจอ — แต่สำหรับวิดีโอ

## กระบวนการ

```
ถอดเสียง ──> แพ็ค ──> LLM คิด ──> EDL ──> เรนเดอร์ ──> ประเมินตนเอง
                                                              │
                                                              └─ ปัญหา? แก้ไข + เรนเดอร์ใหม่ (สูงสุด 3 ครั้ง)
```

วงจรประเมินตนเองรัน `timeline_view` บน _ผลลัพธ์ที่เรนเดอร์แล้ว_ ที่ทุกขอบเขตการตัด — ตรวจจับการกระโดดของภาพ, เสียงป๊อป, ซับไตเติ้ลที่ซ่อนอยู่ คุณจะเห็นตัวอย่างหลังจากผ่านการตรวจสอบแล้วเท่านั้น

## หลักการออกแบบ

1. **ข้อความ + ภาพตามต้องการ** ไม่มีการดัมพ์เฟรม ทรานสคริปต์คือพื้นผิว
2. **เสียงเป็นหลัก ภาพตามมา** การตัดมาจากขอบเขตคำพูดและช่องว่างเงียบ
3. **ถาม → ยืนยัน → ดำเนินการ → ประเมินตนเอง → บันทึก** ห้ามแตะจุดตัดโดยไม่ได้รับการอนุมัติกลยุทธ์
4. **ไม่มีการสันนิษฐานเกี่ยวกับประเภทเนื้อหา** ดู ถาม แล้วตัดต่อ
5. **กฎตายตัว 12 ข้อ อิสระทางศิลปะนอกนั้น** ความถูกต้องในการผลิตห้ามต่อรอง แต่รสนิยมต่อรองได้

ดู [`SKILL.md`](./SKILL.md) สำหรับกฎการผลิตฉบับเต็มและเทคนิคการตัดต่อ

## FAQ

### วิดีโอ-ยูส คืออะไร?

วิดีโอ-ยูส เป็นเครื่องมือโอเพนซอร์สที่ให้คุณสามารถแก้ไขวิดีโอโดยใช้เอเย่นต์เอไอ อย่างเช่น โคล้ด โค้ด โดยอัตโนมัติ มันทำงานแก้ไขทั่วไป เช่น การตัดคำที่ไร้สาระ การปรับแต่งสี และการเพิ่มคำบรรยาย

### วิดีโอ-ยูสทำงานอย่างไรโดยที่แอลแอลเอ็มไม่ต้องดูวิดีโอ?

แอลแอลเอ็มอ่านวิดีโอผ่านสองชั้น: ทรานสคริปต์เสียงที่มีการประทับเวลาระดับคำและการแยกแยะผู้พูด และภาพรวมที่มองเห็นตามต้องการ (แถบฟิล์ม + รูปคลื่น + ป้ายกำกับคำ PNG) สำหรับจุดตัดสินใจ วิธีการนี้ลดการใช้โทเค็นในขณะที่ให้ความสามารถในการแก้ไขที่แม่นยำ

### ฉันสามารถแก้ไขวิดีโอประเภทใดได้บ้างด้วยวิดีโอ-ยูส?

วิดีโอ-ยูสถูกออกแบบมาเพื่อทำงานกับเนื้อหาทุกประเภท รวมถึงวิดีโอพูดคนเดียว ภาพตัดต่อ การสอน วล็อกท่องเที่ยว และการสัมภาษณ์ มันปรับตัวเข้ากับฟุตเทจของคุณโดยไม่ต้องใช้พรีเซ็ตหรือเมนู

### คุณสมบัติหลักของวิดีโอ-ยูสคืออะไร?

คุณสมบัติหลักรวมถึงการตัดคำที่ไร้สาระและพื้นที่ว่าง การปรับแต่งสีอัตโนมัติ การเฟดเสียง 30 มิลลิวินาที การเบิร์นคำบรรยายที่ปรับแต่งได้ การสร้างโอเวอร์เลย์แอนิเมชัน การประเมินผลลัพธ์ที่เรนเดอร์ด้วยตนเอง และการเก็บข้อมูลเซสชัน

### ฉันต้องใช้คีย์เอพีไอของอีเลฟเว่นแล็บส์เพื่อใช้วิดีโอ-ยูสหรือไม่?

ใช่ จำเป็นต้องใช้คีย์เอพีไอของอีเลฟเว่นแล็บส์สำหรับการถอดเสียงและการแยกแยะผู้พูด ซึ่งสำคัญต่อการทำงานของเครื่องมือ คุณจะได้รับการแจ้งให้ระบุในระหว่างขั้นตอนการตั้งค่า

### ฉันสามารถติดตั้งวิดีโอ-ยูสด้วยตนเองแทนการใช้ข้อความแจ้งตั้งค่าได้หรือไม่?

ใช่ คุณสามารถทำการติดตั้งด้วยตนเองโดยการโคลนคลังเก็บข้อมูล สร้างลิงก์สัญลักษณ์ไปยังไดเรกทอรีทักษะของเอเย่นต์ของคุณ ติดตั้งส่วนประกอบที่จำเป็นเช่น เอฟเอฟเอ็มเพก และกำหนดค่าคีย์เอพีไอของอีเลฟเว่นแล็บส์ในไฟล์ .env
