video-use
แนะนำ video-use — ตัดต่อวิดีโอด้วย Claude Code โอเพ่นซอร์ส 100%
เพียงวางฟุตเทจดิบในโฟลเดอร์ คุยกับ Claude Code แล้วคุณจะได้ final.mp4 กลับมา ใช้ได้กับทุกเนื้อหา — วิดีโอพูดหน้ากล้อง, มอนทาจ, บทเรียน, ท่องเที่ยว, สัมภาษณ์ — โดยไม่ต้องใช้พรีเซ็ตหรือเมนู
ความสามารถ
- ตัดคำพูดติดขัด (
อืมม,เอ่อ, การเริ่มพูดผิด) และช่วงเงียบระหว่างเทค - ปรับสีอัตโนมัติ ทุกเซกเมนต์ (โทนอบอุ่นแบบภาพยนตร์, สีสว่างเป็นกลาง, หรือใช้ ffmpeg chain ตามที่กำหนดเอง)
- เสียงเฟดเข้า-ออก 30ms ทุกจุดตัด คุณจะไม่ได้ยินเสียงป๊อป
- ฝังซับไตเติ้ล ในสไตล์ของคุณ — ค่าเริ่มต้นเป็นกลุ่มคำ 2 คำตัวพิมพ์ใหญ่ ปรับแต่งได้เต็มที่
- สร้างภาพซ้อนแอนิเมชัน ผ่าน HyperFrames, Remotion, Manim หรือ PIL — ทำงานด้วย sub-agent แบบขนาน หนึ่งตัวต่อหนึ่งแอนิเมชัน
- ประเมินผลลัพธ์เอง ที่ทุกขอบเขตการตัดก่อนแสดงให้คุณดู
- บันทึกความจำเซสชัน ใน
project.mdให้เซสชันสัปดาห์หน้าต่อจากที่ค้างไว้
พรอมต์ตั้งค่า
วางลงใน Claude Code, Codex, Hermes, Openclaw หรือเอเจ้นท์ใดก็ได้ที่เข้าถึงเชลล์ได้:
ตั้งค่า https://github.com/browser-use/video-use ให้ฉัน
อ่าน install.md ก่อนเพื่อติดตั้ง repo นี้ ตั้งค่า ffmpeg ลงทะเบียนสกิลกับเอเจ้นท์ที่คุณใช้งานอยู่ และตั้งค่า ElevenLabs API key — ขอให้ฉันวางให้เมื่อจำเป็น จากนั้นอ่าน SKILL.md สำหรับการใช้งานประจำวัน และให้อ่าน helpers/ เพราะสคริปต์ตัดต่ออยู่ที่นั่น หลังจากติดตั้งเสร็จ อย่าแปลงเสียงเป็นข้อความเอง — แค่บอกฉันว่าพร้อมแล้วรอฉันวางฟุตเทจลงโฟลเดอร์
เอเจ้นท์จะจัดการการโคลน, dependencies, การลงทะเบียนสกิล และถามคุณครั้งหนึ่งเพื่อขอ ElevenLabs API key (รับได้ที่ elevenlabs.io/app/settings/api-keys)
จากนั้นชี้เอเจ้นท์ของคุณไปยังโฟลเดอร์เทคดิบ:
cd /path/to/your/videos
claude # หรือ codex, hermes, ฯลฯ
สำหรับการตัดต่อที่พร้อมตลอดเวลาจาก VPS หรือ Telegram ของคุณเอง รันเอเจ้นท์ผ่าน Browser Use Box ดูเดโม 15 วินาที
และในเซสชัน:
ตัดต่อพวกนี้เป็นวิดีโอเปิดตัว
มันจะสำรวจแหล่งที่มา เสนอกลยุทธ์ รอการยืนยันจากคุณ แล้วผลิต edit/final.mp4 ไว้ข้างแหล่งที่มาของคุณ ผลลัพธ์ทั้งหมดอยู่ใน <videos_dir>/edit/ — ไดเรกทอรีสกิลจะยังคงสะอาด
การติดตั้งด้วยตัวเอง
หากคุณอยากทำเอง:
# 1. โคลนและสร้าง symlink ไปยังไดเรกทอรีสกิลของเอเจ้นท์
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. ติดตั้ง dependencies
cd ~/Developer/video-use
uv sync # หรือ: pip install -e .
brew install ffmpeg # จำเป็น
brew install yt-dlp # ไม่จำเป็น, สำหรับดาวน์โหลดแหล่งที่มาออนไลน์
# 3. เพิ่ม ElevenLabs API key ของคุณ
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
วิธีการทำงาน
LLM ไม่เคยดูวิดีโอ แต่มัน อ่าน มัน — ผ่านสองเลเยอร์ที่รวมกันแล้วให้ทุกอย่างที่จำเป็นในการตัดด้วยความแม่นยำระดับขอบเขตคำ
<p align="center"> <img src="https://file.nanoskill.ai/timeline-view.svg" alt="timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates" width="100%"> </p>เลเยอร์ 1 — ทรานสคริปต์เสียง (โหลดตลอดเวลา) หนึ่งการเรียก ElevenLabs Scribe ต่อแหล่งที่มา ให้การประทับเวลาระดับคำ การแยกผู้พูด และเหตุการณ์เสียง ((หัวเราะ), (ปรบมือ), (ถอนหายใจ)). ทุกเทคถูกบรรจุลงใน takes_packed.md ขนาดประมาณ 12KB — มุมมองการอ่านหลักของ LLM
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 เก้าสิบเปอร์เซ็นต์ของสิ่งที่เว็บเอเจ้นท์ทำนั้นเสียเปล่าโดยสิ้นเชิง
[006.08-006.74] S0 เราแก้ไขเรื่องนี้แล้ว
เลเยอร์ 2 — ภาพคอมโพสิต (เมื่อเรียกใช้) timeline_view สร้างภาพ PNG แบบฟิล์มสตริป + รูปคลื่น + ป้ายคำสำหรับช่วงเวลาใด ๆ ถูกเรียกใช้เฉพาะที่จุดตัดสินใจ — การหยุดที่คลุมเครือ, การเปรียบเทียบการถ่ายทำใหม่, การตรวจสอบจุดตัด
วิธีที่ไร้ประสิทธิภาพ: 30,000 เฟรม × 1,500 โทเค็น = 45 ล้านโทเค็นของสัญญาณรบกวน Video Use: ข้อความ 12KB + ภาพ PNG สองสามภาพ
แนวคิดเดียวกับที่ browser-use ให้ LLM เห็น DOM ที่มีโครงสร้างแทนภาพหน้าจอ — แต่สำหรับวิดีโอ
กระบวนการ
ถอดเสียง ──> แพ็ค ──> LLM คิด ──> EDL ──> เรนเดอร์ ──> ประเมินตนเอง
│
└─ ปัญหา? แก้ไข + เรนเดอร์ใหม่ (สูงสุด 3 ครั้ง)
วงจรประเมินตนเองรัน timeline_view บน ผลลัพธ์ที่เรนเดอร์แล้ว ที่ทุกขอบเขตการตัด — ตรวจจับการกระโดดของภาพ, เสียงป๊อป, ซับไตเติ้ลที่ซ่อนอยู่ คุณจะเห็นตัวอย่างหลังจากผ่านการตรวจสอบแล้วเท่านั้น
หลักการออกแบบ
- ข้อความ + ภาพตามต้องการ ไม่มีการดัมพ์เฟรม ทรานสคริปต์คือพื้นผิว
- เสียงเป็นหลัก ภาพตามมา การตัดมาจากขอบเขตคำพูดและช่องว่างเงียบ
- ถาม → ยืนยัน → ดำเนินการ → ประเมินตนเอง → บันทึก ห้ามแตะจุดตัดโดยไม่ได้รับการอนุมัติกลยุทธ์
- ไม่มีการสันนิษฐานเกี่ยวกับประเภทเนื้อหา ดู ถาม แล้วตัดต่อ
- กฎตายตัว 12 ข้อ อิสระทางศิลปะนอกนั้น ความถูกต้องในการผลิตห้ามต่อรอง แต่รสนิยมต่อรองได้
ดู SKILL.md สำหรับกฎการผลิตฉบับเต็มและเทคนิคการตัดต่อ


