NanoSkill
ส่งสกิลของคุณ

ทักษะเอเจนต์ตัดต่อวิดีโอ

โดยbrowser-use9Kดาว GitHubGitHub

ตัดต่อวิดีโอด้วย AI โดยใช้ Claude Code ให้งานอัตโนมัติ เช่น ตัดคำพูดติดขัด ปรับสี และเบิร์นคำบรรยาย ทำให้กระบวนการผลิตวิดีโอของคุณคล่องตัวขึ้นและได้ไฟล์ MP4 ที่สวยงาม

วิดีโอผ่านการสแกนความปลอดภัย
พรีวิวผลลัพธ์

เดโมเต็ม

ดูวิดีโอสัมภาษณ์ที่ถูกปรับแต่งเป็นคลิปโซเชียลมีเดียที่มีจังหวะที่ดีขึ้น คำบรรยาย และเสียงที่ปรับปรุงแล้ว

เริ่มต้น

รันงานแรกของคุณ

  1. a simple demonstration of the first step in using Video Editing Agent Skill
    01

    ขั้นตอนที่ 1:ติดตั้ง

    เพิ่มทักษะให้กับเอเจนต์ของคุณ

  2. a simple demonstration of the second step in using Video Editing Agent Skill
    02

    ขั้นตอนที่ 2:อัปโหลดวิดีโอของคุณ

    อัปโหลดวิดีโอสัมภาษณ์ บทสอน หรือผลิตภัณฑ์ และอธิบายการตัดต่อที่ต้องการ

  3. the demo of Video Editing Agent Skill
    03

    ขั้นตอนที่ 3:ตรวจสอบผลลัพธ์

    รับเวอร์ชันที่ตัดต่อแล้วและตรวจสอบคำบรรยาย การเปลี่ยนผ่าน และจังหวะ

คำสั่งติดตั้ง

$ npx skills add https://github.com/browser-use/video-use

เกี่ยวกับ

video-use นำเสนอแนวทางที่สร้างสรรค์ในการตัดต่อวิดีโอ โดยใช้เอเจนต์ AI เช่น Claude Code เพื่อทำงานที่น่าเบื่อและใช้เวลานานโดยอัตโนมัติ เครื่องมือโอเพนซอร์สนี้ช่วยให้ผู้ใช้เพียงแค่วางฟุตเทจดิบลงในโฟลเดอร์ โต้ตอบกับเอเจนต์ AI และรับผลลัพธ์ `final.mp4` ที่สวยงาม มันถูกออกแบบมาเพื่อให้กระบวนการตัดต่อวิดีโอคล่องตัวสำหรับเนื้อหาหลายประเภท ตั้งแต่วิดีโอพูดหน้ากล้องไปจนถึงมอนทาจ โดยจัดการการตัด การปรับสี และการเบิร์นคำบรรยายอย่างชาญฉลาด

ระบบทำงานโดยการอ่านเนื้อหาวิดีโอผ่านบทถอดเสียงที่มีรายละเอียดและภาพรวมที่สร้างขึ้นตามต้องการ แทนที่จะประมวลผลทุกเฟรม วิธีการนี้ให้ความแม่นยำระดับขอบเขตคำสำหรับการตัดต่อแก่ AI ในขณะที่ลดภาระการคำนวณลงอย่างมาก ความสามารถหลักรวมถึงการลบคำพูดติดขัดและพื้นที่ว่างโดยอัตโนมัติ การปรับสีอย่างชาญฉลาด การทำให้การเปลี่ยนผ่านเสียงราบรื่น และการเบิร์นคำบรรยายที่ปรับแต่งได้ลงในวิดีโอโดยตรง

นอกเหนือจากการทำงานอัตโนมัติแล้ว video-use ยังมีไปป์ไลน์การประเมินตนเองที่แข็งแกร่ง หลังจากการประมวลผลเบื้องต้น AI จะตรวจสอบผลลัพธ์ที่เรนเดอร์แล้วที่แต่ละขอบเขตการตัดเพื่อตรวจจับและแก้ไขความไม่สมบูรณ์ เช่น ภาพกระโดดหรือเสียงแตก สิ่งนี้ทำให้แน่ใจว่าวิดีโอสุดท้ายมีมาตรฐานการผลิตสูงก่อนที่จะนำเสนอแก่ผู้ใช้ เครื่องมือนี้ยังรักษาหน่วยความจำเซสชัน ทำให้ผู้ใช้สามารถกลับมาตัดต่อต่อจากจุดที่ค้างไว้ได้อย่างแม่นยำ เพิ่มประสิทธิภาพและความสม่ำเสมอของเวิร์กโฟลว์

ฟีเจอร์สำคัญ

สิ่งที่ทำให้ทรงพลัง

  • การลบคำที่ไร้สาระอัตโนมัติ

    ตัดคำที่ไร้สาระโดยอัตโนมัติเช่น 'อืม' 'เอ่อ' การเริ่มต้นผิด และพื้นที่ว่างระหว่างเทคเพื่อให้เสียงที่สะอาดขึ้น

  • การปรับแต่งสีอัจฉริยะ

    ปรับแต่งสีอัตโนมัติทุกเซกเมนต์วิดีโอ มีตัวเลือกเช่น อบอุ่นแบบภาพยนตร์, เป็นกลาง, หรือห่วงโซ่ เอฟเอฟเอ็มเพก แบบกำหนดเอง เพื่อคุณภาพภาพที่สม่ำเสมอ

  • การเฟดเสียงที่ไร้รอยต่อ

    ใช้การเฟดเสียง 30 มิลลิวินาทีที่ทุกการตัดเพื่อขจัดเสียงป็อปและทำให้การเปลี่ยนระหว่างเซกเมนต์ราบรื่น

  • การเบิร์นคำบรรยายที่ปรับแต่งได้

    เบิร์นคำบรรยายลงในวิดีโอของคุณโดยตรงในสไตล์ที่ปรับแต่งได้ โดยค่าเริ่มต้นเป็นกลุ่มคำสองคำเป็นตัวพิมพ์ใหญ่ ซึ่งเพิ่มการเข้าถึงและการมีส่วนร่วม

  • การประเมินตนเองด้วยเอไอ

    ระบบประเมินผลลัพธ์ที่เรนเดอร์ด้วยตนเองที่ทุกขอบเขตการตัด จับการกระโดดของภาพ ป๊อปของเสียง และคำบรรยายที่ซ่อนก่อนที่จะแสดงตัวอย่างให้คุณ

กรณีใช้งาน

ควรใช้เมื่อใด

  • การผลิตวิดีโอพูดคนเดียวระดับมืออาชีพ

    ปรับแต่งฟุตเทจพูดคนเดียวได้อย่างรวดเร็วโดยลบการหยุดและคำที่ไร้สาระ ทำให้การนำเสนอสั้นและน่าสนใจ

  • การสร้างภาพตัดต่อวิดีโอแบบไดนามิก

    ประกอบภาพตัดต่อได้อย่างง่ายดายด้วยการตัดอัตโนมัติ การปรับแต่งสี และโอเวอร์เลย์แอนิเมชัน เพื่อรูปลักษณ์ที่ประณีตและเป็นมืออาชีพ

  • การปรับปรุงการผลิตวิดีโอสอนให้คล่องตัว

    เร่งการสร้างวิดีโอสอนด้วยการทำให้งานแก้ไขที่ซ้ำซากเป็นอัตโนมัติ ช่วยให้ผู้สร้างมุ่งเน้นที่เนื้อหา

SKILL.md

video-use

แนะนำ video-use — ตัดต่อวิดีโอด้วย Claude Code โอเพ่นซอร์ส 100%

เพียงวางฟุตเทจดิบในโฟลเดอร์ คุยกับ Claude Code แล้วคุณจะได้ final.mp4 กลับมา ใช้ได้กับทุกเนื้อหา — วิดีโอพูดหน้ากล้อง, มอนทาจ, บทเรียน, ท่องเที่ยว, สัมภาษณ์ — โดยไม่ต้องใช้พรีเซ็ตหรือเมนู

ความสามารถ

  • ตัดคำพูดติดขัด (อืมม, เอ่อ, การเริ่มพูดผิด) และช่วงเงียบระหว่างเทค
  • ปรับสีอัตโนมัติ ทุกเซกเมนต์ (โทนอบอุ่นแบบภาพยนตร์, สีสว่างเป็นกลาง, หรือใช้ ffmpeg chain ตามที่กำหนดเอง)
  • เสียงเฟดเข้า-ออก 30ms ทุกจุดตัด คุณจะไม่ได้ยินเสียงป๊อป
  • ฝังซับไตเติ้ล ในสไตล์ของคุณ — ค่าเริ่มต้นเป็นกลุ่มคำ 2 คำตัวพิมพ์ใหญ่ ปรับแต่งได้เต็มที่
  • สร้างภาพซ้อนแอนิเมชัน ผ่าน HyperFrames, Remotion, Manim หรือ PIL — ทำงานด้วย sub-agent แบบขนาน หนึ่งตัวต่อหนึ่งแอนิเมชัน
  • ประเมินผลลัพธ์เอง ที่ทุกขอบเขตการตัดก่อนแสดงให้คุณดู
  • บันทึกความจำเซสชัน ใน project.md ให้เซสชันสัปดาห์หน้าต่อจากที่ค้างไว้

พรอมต์ตั้งค่า

วางลงใน Claude Code, Codex, Hermes, Openclaw หรือเอเจ้นท์ใดก็ได้ที่เข้าถึงเชลล์ได้:

ตั้งค่า https://github.com/browser-use/video-use ให้ฉัน

อ่าน install.md ก่อนเพื่อติดตั้ง repo นี้ ตั้งค่า ffmpeg ลงทะเบียนสกิลกับเอเจ้นท์ที่คุณใช้งานอยู่ และตั้งค่า ElevenLabs API key — ขอให้ฉันวางให้เมื่อจำเป็น จากนั้นอ่าน SKILL.md สำหรับการใช้งานประจำวัน และให้อ่าน helpers/ เพราะสคริปต์ตัดต่ออยู่ที่นั่น หลังจากติดตั้งเสร็จ อย่าแปลงเสียงเป็นข้อความเอง — แค่บอกฉันว่าพร้อมแล้วรอฉันวางฟุตเทจลงโฟลเดอร์

เอเจ้นท์จะจัดการการโคลน, dependencies, การลงทะเบียนสกิล และถามคุณครั้งหนึ่งเพื่อขอ ElevenLabs API key (รับได้ที่ elevenlabs.io/app/settings/api-keys)

จากนั้นชี้เอเจ้นท์ของคุณไปยังโฟลเดอร์เทคดิบ:

cd /path/to/your/videos
claude    # หรือ codex, hermes, ฯลฯ

สำหรับการตัดต่อที่พร้อมตลอดเวลาจาก VPS หรือ Telegram ของคุณเอง รันเอเจ้นท์ผ่าน Browser Use Box ดูเดโม 15 วินาที

และในเซสชัน:

ตัดต่อพวกนี้เป็นวิดีโอเปิดตัว

มันจะสำรวจแหล่งที่มา เสนอกลยุทธ์ รอการยืนยันจากคุณ แล้วผลิต edit/final.mp4 ไว้ข้างแหล่งที่มาของคุณ ผลลัพธ์ทั้งหมดอยู่ใน <videos_dir>/edit/ — ไดเรกทอรีสกิลจะยังคงสะอาด

การติดตั้งด้วยตัวเอง

หากคุณอยากทำเอง:

# 1. โคลนและสร้าง symlink ไปยังไดเรกทอรีสกิลของเอเจ้นท์
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. ติดตั้ง dependencies
cd ~/Developer/video-use
uv sync                         # หรือ: pip install -e .
brew install ffmpeg             # จำเป็น
brew install yt-dlp             # ไม่จำเป็น, สำหรับดาวน์โหลดแหล่งที่มาออนไลน์

# 3. เพิ่ม ElevenLabs API key ของคุณ
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

วิธีการทำงาน

LLM ไม่เคยดูวิดีโอ แต่มัน อ่าน มัน — ผ่านสองเลเยอร์ที่รวมกันแล้วให้ทุกอย่างที่จำเป็นในการตัดด้วยความแม่นยำระดับขอบเขตคำ

<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>

เลเยอร์ 1 — ทรานสคริปต์เสียง (โหลดตลอดเวลา) หนึ่งการเรียก ElevenLabs Scribe ต่อแหล่งที่มา ให้การประทับเวลาระดับคำ การแยกผู้พูด และเหตุการณ์เสียง ((หัวเราะ), (ปรบมือ), (ถอนหายใจ)). ทุกเทคถูกบรรจุลงใน takes_packed.md ขนาดประมาณ 12KB — มุมมองการอ่านหลักของ LLM

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 เก้าสิบเปอร์เซ็นต์ของสิ่งที่เว็บเอเจ้นท์ทำนั้นเสียเปล่าโดยสิ้นเชิง
  [006.08-006.74] S0 เราแก้ไขเรื่องนี้แล้ว

เลเยอร์ 2 — ภาพคอมโพสิต (เมื่อเรียกใช้) timeline_view สร้างภาพ PNG แบบฟิล์มสตริป + รูปคลื่น + ป้ายคำสำหรับช่วงเวลาใด ๆ ถูกเรียกใช้เฉพาะที่จุดตัดสินใจ — การหยุดที่คลุมเครือ, การเปรียบเทียบการถ่ายทำใหม่, การตรวจสอบจุดตัด

วิธีที่ไร้ประสิทธิภาพ: 30,000 เฟรม × 1,500 โทเค็น = 45 ล้านโทเค็นของสัญญาณรบกวน Video Use: ข้อความ 12KB + ภาพ PNG สองสามภาพ

แนวคิดเดียวกับที่ browser-use ให้ LLM เห็น DOM ที่มีโครงสร้างแทนภาพหน้าจอ — แต่สำหรับวิดีโอ

กระบวนการ

ถอดเสียง ──> แพ็ค ──> LLM คิด ──> EDL ──> เรนเดอร์ ──> ประเมินตนเอง
                                                              │
                                                              └─ ปัญหา? แก้ไข + เรนเดอร์ใหม่ (สูงสุด 3 ครั้ง)

วงจรประเมินตนเองรัน timeline_view บน ผลลัพธ์ที่เรนเดอร์แล้ว ที่ทุกขอบเขตการตัด — ตรวจจับการกระโดดของภาพ, เสียงป๊อป, ซับไตเติ้ลที่ซ่อนอยู่ คุณจะเห็นตัวอย่างหลังจากผ่านการตรวจสอบแล้วเท่านั้น

หลักการออกแบบ

  1. ข้อความ + ภาพตามต้องการ ไม่มีการดัมพ์เฟรม ทรานสคริปต์คือพื้นผิว
  2. เสียงเป็นหลัก ภาพตามมา การตัดมาจากขอบเขตคำพูดและช่องว่างเงียบ
  3. ถาม → ยืนยัน → ดำเนินการ → ประเมินตนเอง → บันทึก ห้ามแตะจุดตัดโดยไม่ได้รับการอนุมัติกลยุทธ์
  4. ไม่มีการสันนิษฐานเกี่ยวกับประเภทเนื้อหา ดู ถาม แล้วตัดต่อ
  5. กฎตายตัว 12 ข้อ อิสระทางศิลปะนอกนั้น ความถูกต้องในการผลิตห้ามต่อรอง แต่รสนิยมต่อรองได้

ดู SKILL.md สำหรับกฎการผลิตฉบับเต็มและเทคนิคการตัดต่อ

FAQ