# Keahlian Agen Transkrip YouTube

> Unduh transkrip video YouTube, terjemahan teks, dan gambar sampul berdasarkan URL atau ID video. Mendukung berbagai bahasa, terjemahan, pembagian bab, dan identifikasi pembicara untuk meningkatkan aksesibilitas konten. Mulai gratis dalam hitungan detik.

- Canonical: https://nanoskill.ai/id/skills/youtube-transcript
- Markdown: https://nanoskill.ai/id/skills/youtube-transcript.md
- Author: JimLiu
- Published: 2026-06-03T05:58:31.787Z
- Updated: 2026-07-15T13:36:15.347Z
- Language: id
- Source type: github
- Popularity signal: 1040

## Sources

- https://github.com/JimLiu/baoyu-skills

## Install

```shell
npx skills add https://github.com/JimLiu/baoyu-skills/tree/main/skills/baoyu-youtube-transcript
```

## About

Keahlian Pengunduh Transkrip YouTube menyediakan solusi tangguh untuk mengekstrak informasi lengkap dari video YouTube. Keahlian ini memungkinkan pengguna mengunduh transkrip YouTube lengkap, terjemahan teks, dan bahkan gambar sampul dengan mudah hanya dengan memberikan URL atau ID video. Ini dirancang untuk kreator konten, peneliti, dan siapa pun yang perlu mengonversi konten lisan menjadi teks, menawarkan fitur seperti dukungan multi-bahasa, kemampuan penerjemahan, dan opsi penataan lanjutan.

Dengan memanfaatkan akses langsung ke API InnerTube YouTube dan fallback cerdas ke \`yt-dlp\`, keahlian ini memastikan pengambilan data yang andal dan efisien tanpa memerlukan kunci API pribadi. Ini menawarkan format keluaran yang fleksibel, termasuk Markdown untuk analisis terperinci dengan stempel waktu dan penanda bab, serta SRT untuk integrasi subtitle standar. Selain itu, mendukung segmentasi bab dari deskripsi video dan menyediakan alur kerja untuk identifikasi pembicara bertenaga AI, menghasilkan teks yang sangat terorganisir dan diatribusikan.

Dengan caching cerdas, keahlian ini meminimalkan permintaan jaringan yang berlebihan, membuat operasi selanjutnya pada video yang sama menjadi sangat cepat. Baik Anda perlu menganalisis konten video, membuat subtitle yang dapat diakses, menerjemahkan materi untuk audiens global, atau sekadar mengekstrak metadata dan thumbnail video, keahlian ini menyederhanakan proses, menyediakan alat yang kuat untuk manajemen konten YouTube.

## Key features

- **Akses YouTube Langsung**: Mengakses InnerTube API YouTube secara langsung untuk pengambilan transkrip cepat, secara otomatis beralih ke \`yt-dlp\` jika API langsung diblokir, memastikan akses yang andal tanpa kunci API.
- **Dukungan Multi-bahasa & Terjemahan**: Tentukan bahasa pilihan untuk transkrip dan terjemahkan ke dalam bahasa target, membuat konten dapat diakses oleh audiens global.
- **Segmentasi Bab & Identifikasi Pembicara**: Secara otomatis menyegmentasi transkrip berdasarkan bab video dan mendukung pemrosesan lanjutan AI untuk identifikasi pembicara, menyediakan teks yang terstruktur dan teratribusi.
- **Format Keluaran Fleksibel**: Menghasilkan transkrip dalam format Markdown dengan cap waktu atau file subtitle SRT, cocok untuk berbagai penggunaan dari analisis konten hingga pemutar video.
- **Caching Cerdas untuk Efisiensi**: Menyimpan cache data video mentah, metadata, dan transkrip tersegmentasi, memungkinkan pemformatan ulang cepat dan mengurangi panggilan jaringan pada permintaan berikutnya untuk video yang sama.

## Use cases

- **Hasilkan Transkrip YouTube untuk Analisis Konten**: Pembuat konten dan peneliti dapat dengan cepat memperoleh transkrip YouTube lengkap, termasuk cap waktu dan penanda bab, untuk menganalisis konten video, mengekstrak informasi penting, atau menggunakan kembali konten lisan menjadi artikel teks.
- **Buat File Subtitle untuk Aksesibilitas**: Editor video dan spesialis aksesibilitas dapat menghasilkan file subtitle SRT dari video YouTube, memastikan konten dapat diakses oleh audiens tuna rungu atau mereka yang lebih suka mengonsumsi konten tanpa suara.
- **Terjemahkan Konten Video untuk Jangkauan Global**: Pemasar dan pendidik dapat menerjemahkan transkrip YouTube ke berbagai bahasa, memperluas jangkauan konten video mereka ke penutur non-asli dan meningkatkan keterlibatan global.
- **Ekstrak Metadata dan Gambar Sampul**: Pengguna dapat dengan mudah mengekstrak metadata video dan gambar sampul berkualitas tinggi, berguna untuk katalogisasi, promosi media sosial, atau membuat aset visual terkait konten video.

## Result preview

Jelajahi laporan analisis video profesional yang didukung oleh Keahlian ini.

![A presentation cover slide featuring a TED Talk analysis titled 'This Is How Kids Should Be Learning with AI'. The slide uses a bold red background with large white headline text centered prominently across the page. Beneath the title, the speaker and event are identified as 'Priya Lakhani | TEDNext 2025', accompanied by the subtitle 'TED Talk Analysis & Knowledge Report'. The lower portion of the slide contains a thumbnail image from the TED presentation showing the speaker on stage alongside the text 'AI Isn't a Shortcut to Learning'. A teal horizontal accent bar runs along the bottom edge, creating visual contrast. The overall design resembles a professional report or presentation cover summarizing key insights from a TED Talk about artificial intelligence and education.](https://file.nanoskill.ai/youtube-transcript-outcome1.png)

![A report page titled '\[ Executive Summary \]' from a TED Talk analysis on artificial intelligence and education. The page summarizes key arguments presented by education entrepreneur Priya Lakhani at TEDNext 2025, discussing the impact of AI in classrooms, the risks of students using AI to avoid learning, and the importance of productive struggle in effective education. Several paragraphs explain how neuroscience-informed AI systems can support deeper learning when designed to challenge rather than replace student effort. A section titled 'Key Statistics at a Glance' highlights major findings using four large color-coded statistic cards. The statistics include 20% of UK students leaving secondary school without adequate reading and writing skills, 74% of teachers considering leaving the profession within three years due to workload, one in five students using AI to complete all homework assignments, and over 40 billion data points collected on how children learn. The layout uses a clean report style with a red section header, structured text blocks, and colorful infographic-style data highlights to emphasize key educational challenges and opportunities.](https://file.nanoskill.ai/youtube-transcript-outcome2.png)

![A report page titled '\[ The Four Pillars of Learning \]' that presents four evidence-based learning principles supported by cognitive science and educational research. The page is organized into four color-coded sections: Retrieval Practice, Spacing, Generation, and Reflection. Each section includes a concise explanation of the learning principle and a highlighted 'Classroom Applications' box containing practical implementation examples. Retrieval Practice emphasizes recalling information from memory through activities such as flashcards, self-testing, and closed-book quizzes. Spacing focuses on distributing learning over time using spaced repetition and interleaved study sessions. Generation encourages learners to produce answers themselves through prediction, fill-in-the-blank exercises, and open-ended questioning. Reflection highlights structured self-assessment and feedback processes that help students evaluate progress, identify learning goals, and address knowledge gaps. The page uses a clean educational report layout with colored headers, explanatory text, and application callout boxes to summarize effective learning strategies for classrooms and AI-supported education.](https://file.nanoskill.ai/youtube-transcript-outcome3.png)

![A report page from a TED Talk analysis featuring two major sections: 'Neuroscience: The London Taxi Study' and 'AI in Education: Well-Designed vs. Poorly Used.' The first section explains a neuroscience study of London black cab drivers who memorize thousands of city streets to pass 'The Knowledge' exam. It describes how brain scans revealed that experienced drivers developed a larger hippocampus, demonstrating that sustained mental effort and navigation challenges can physically strengthen the brain. A highlighted key insight box emphasizes that mental effort is essential for durable learning, expertise development, and human creativity rather than being a flaw in the learning process. The second section presents a side-by-side comparison of educational AI usage. The left panel, labeled 'AI Well-Designed,' lists benefits such as identifying learning patterns, predicting forgetting, encouraging answer generation, providing targeted feedback, personalizing instruction, supporting teachers, and reducing workload. The right panel, labeled 'AI Poorly Used,' outlines risks including students using AI to complete all work, avoiding genuine learning, replacing thinking with shortcuts, creating false confidence, confusing fluency with understanding, and reducing productive struggle. The layout uses contrasting green and red comparison panels, educational report styling, and structured visual hierarchy to highlight the difference between AI that supports learning and AI that undermines it.](https://file.nanoskill.ai/youtube-transcript-outcome4.png)

## Result walkthrough

### Instal

Tambahkan Keahlian Agen Transkrip YouTube ke agen AI Anda.

![A screenshot showing the installation process of the 'baoyu-youtube-transcript' AI agent skill from a GitHub repository using an NPX command. At the top, a blue command banner displays the installation command for adding the skill from the GitHub repository. Below, a conversational interface explains the installation workflow, including handling an interactive installation prompt, detecting that the process did not complete automatically, rerunning the command with a '-y' flag to bypass prompts, and explicitly targeting the Hermes Agent environment. The log then describes creating a symbolic link from the agent skills directory to the Hermes skills directory so the skill can be recognized by the Hermes Agent. A final confirmation states that the 'baoyu-youtube-transcript' skill was successfully installed, linked, and is available for use through a skill invocation command. The interface uses a clean chat-style layout with gray response panels, dark blue command highlighting, and monospaced code snippets for file paths and terminal commands.](https://file.nanoskill.ai/youtube-transcript-install.png)

### Berikan Konten

Bagikan tautan YouTube dan tentukan format keluaran yang Anda inginkan.

![A screenshot showing a prompt and response workflow for a YouTube transcript analysis skill. The top section contains a dark blue prompt panel describing an AI-powered content research and knowledge extraction system designed to analyze YouTube videos and transform them into structured knowledge assets. The prompt outlines requirements such as extracting complete transcripts, metadata, chapter structures, timestamps, speaker distinctions, key topics, major insights, statistics, examples, and actionable takeaways. It also lists supported output formats including executive summaries, study notes, blog articles, social media content, newsletter drafts, and research reports. Additional instructions emphasize transcript quality evaluation, improved readability, information hierarchy, redundancy removal, and generating a polished final deliverable. The requested output is a visually engaging PDF report with chapter navigation, highlighted takeaways, and presentation-ready layouts. Beneath the prompt, a gray response panel shows the AI acknowledging that the skill has been loaded successfully but explaining that a YouTube URL is still required before transcript extraction and report generation can begin. The interface uses a clean chat-style layout with large rounded panels, white text on a dark blue background, and structured instructional formatting.](https://file.nanoskill.ai/youtube-transcript-task.png)

### Ekstrak Wawasan

Hasilkan transkrip terstruktur, ringkasan, poin-poin utama, dan konten yang dapat digunakan kembali.

![A presentation cover slide for a TED Talk analysis and knowledge report. The slide features a bold red background with a teal accent bar running along the bottom edge. Centered at the top is the large white title 'This Is How Kids Should Be Learning with AI.' Below the title, the speaker attribution reads 'Priya Lakhani | TEDNext 2025,' followed by the subtitle 'TED Talk Analysis & Knowledge Report' in italicized white text. In the center of the slide is a thumbnail image from the TED Talk showing Priya Lakhani on stage. The thumbnail includes the prominent message 'AI Isn't a Shortcut to Learning' alongside the TED logo. The overall design resembles a professional research report cover, using strong typography, high contrast colors, and a clean layout to introduce an educational analysis focused on artificial intelligence, learning science, and the future of education.](https://file.nanoskill.ai/youtube-transcript-outcome.png)

## Skill definition

# Transkrip YouTube

Mengunduh transkrip (subtitle/teks) dari video YouTube. Bekerja dengan transkrip yang dibuat secara manual maupun otomatis. Tidak memerlukan kunci API atau browser — menggunakan API InnerTube YouTube secara langsung dan secara otomatis beralih ke `yt-dlp` ketika YouTube memblokir jalur API langsung.

Mengambil metadata video dan gambar sampul pada proses pertama, menyimpan data mentah untuk pemformatan ulang yang cepat.

## Direktori Skrip

Skrip berada di subdirektori `scripts/`. `{baseDir}` = jalur direktori SKILL.md ini. Tentukan runtime `${BUN_X}`: jika `bun` terpasang → `bun`; jika `npx` tersedia → `npx -y bun`; selain itu sarankan untuk memasang bun. Ganti `{baseDir}` dan `${BUN_X}` dengan nilai sebenarnya.

| Skrip | Tujuan |
|--------|---------|
| `scripts/main.ts` | CLI pengunduhan transkrip |

## Penggunaan

```bash
# Default: markdown dengan stempel waktu (Bahasa Inggris)
${BUN_X} {baseDir}/scripts/main.ts <youtube-url-or-id>

# Tentukan bahasa (urutan prioritas)
${BUN_X} {baseDir}/scripts/main.ts <url> --languages zh,en,ja

# Tanpa stempel waktu
${BUN_X} {baseDir}/scripts/main.ts <url> --no-timestamps

# Dengan segmentasi bab
${BUN_X} {baseDir}/scripts/main.ts <url> --chapters

# Dengan identifikasi pembicara (memerlukan pasca-pemrosesan AI)
${BUN_X} {baseDir}/scripts/main.ts <url> --speakers

# Berkas subtitle SRT
${BUN_X} {baseDir}/scripts/main.ts <url> --format srt

# Terjemahkan transkrip
${BUN_X} {baseDir}/scripts/main.ts <url> --translate zh-Hans

# Tampilkan daftar transkrip yang tersedia
${BUN_X} {baseDir}/scripts/main.ts <url> --list

# Paksa pengambilan ulang (abaikan cache)
${BUN_X} {baseDir}/scripts/main.ts <url> --refresh
```

## Opsi

| Opsi | Deskripsi | Default |
|--------|-------------|---------|
| `<url-or-id>` | URL YouTube atau ID video (dapat lebih dari satu) | Diperlukan |
| `--languages <codes>` | Kode bahasa, dipisahkan koma, dalam urutan prioritas | `en` |
| `--format <fmt>` | Format keluaran: `text`, `srt` | `text` |
| `--translate <code>` | Terjemahkan ke kode bahasa yang ditentukan | |
| `--list` | Tampilkan transkrip yang tersedia alih-alih mengunduh | |
| `--timestamps` | Sertakan stempel waktu `[JJ:MM:DD → JJ:MM:DD]` per paragraf | aktif |
| `--no-timestamps` | Nonaktifkan stempel waktu | |
| `--chapters` | Segmentasi bab dari deskripsi video | |
| `--speakers` | Transkrip mentah dengan metadata untuk identifikasi pembicara | |
| `--exclude-generated` | Lewati transkrip yang dibuat otomatis | |
| `--exclude-manually-created` | Lewati transkrip yang dibuat manual | |
| `--refresh` | Paksa pengambilan ulang, abaikan data cache | |
| `-o, --output <path>` | Simpan ke jalur berkas tertentu | dibuat otomatis |
| `--output-dir <dir>` | Direktori keluaran dasar | `youtube-transcript` |

## Variabel Lingkungan Opsional

| Variabel | Deskripsi |
|----------|-------------|
| `YOUTUBE_TRANSCRIPT_COOKIES_FROM_BROWSER` | Diteruskan ke `yt-dlp --cookies-from-browser` saat fallback, misal `chrome`, `safari`, `firefox`, atau `chrome:Profile 1` |

## Format Masukan

Menerima salah satu dari berikut sebagai masukan video:
- URL lengkap: `https://www.youtube.com/watch?v=dQw4w9WgXcQ`
- URL pendek: `https://youtu.be/dQw4w9WgXcQ`
- URL sematan: `https://www.youtube.com/embed/dQw4w9WgXcQ`
- URL Shorts: `https://www.youtube.com/shorts/dQw4w9WgXcQ`
- ID Video: `dQw4w9WgXcQ`

## Format Keluaran

| Format | Ekstensi | Deskripsi |
|--------|-----------|-------------|
| `text` | `.md` | Markdown dengan frontmatter (termasuk `description`), judul, ringkasan, opsional TOC/sampul/stempel waktu/bab/pembicara |
| `srt` | `.srt` | Format subtitle SubRip untuk pemutar video |

## Direktori Keluaran

```
youtube-transcript/
├── .index.json                          # Pemetaan ID Video → jalur direktori (untuk pencarian cache)
└── {channel-slug}/{title-full-slug}/
    ├── meta.json                        # Metadata video (judul, saluran, deskripsi, durasi, bab, dll.)
    ├── transcript-raw.json              # Potongan transkrip mentah dari API YouTube (di-cache)
    ├── transcript-sentences.json        # Transkrip tersegmentasi kalimat (dipisah berdasarkan tanda baca, digabung antar potongan)
    ├── imgs/
    │   └── cover.jpg                    # Gambar mini video
    ├── transcript.md                    # Transkrip markdown (dibuat dari kalimat)
    └── transcript.srt                   # Subtitle SRT (dibuat dari potongan mentah, jika --format srt)
```

- `{channel-slug}`: Nama saluran dalam kebab-case
- `{title-full-slug}`: Judul video lengkap dalam kebab-case

Mode `--list` hanya menampilkan ke stdout (tidak menyimpan berkas).

## Cache

Pada pengambilan pertama, skrip menyimpan:
- `meta.json` — metadata video, bab, jalur gambar sampul, info bahasa
- `transcript-raw.json` — potongan transkrip mentah dari API YouTube (`{ text, start, duration }[]`)
- `transcript-sentences.json` — transkrip tersegmentasi kalimat (`{ text, start: "JJ:mm:dd", end: "JJ:mm:dd" }[]`), dipisah berdasarkan tanda baca akhir kalimat (`.?!…。？！` dll.), stempel waktu dialokasikan secara proporsional berdasarkan panjang karakter, penggabungan teks sadar CJK
- `imgs/cover.jpg` — gambar mini video

Proses selanjutnya untuk video yang sama menggunakan data cache (tanpa panggilan jaringan). Gunakan `--refresh` untuk memaksa pengambilan ulang. Jika bahasa berbeda diminta, cache otomatis diperbarui.

Ketika YouTube memberikan respons anti-bot / diblokir pada jalur InnerTube langsung, skrip mencoba lagi dengan identitas klien alternatif lalu beralih ke `yt-dlp` jika tersedia. Jika fallback diperlukan tetapi `yt-dlp` tidak tersedia, agen harus memutuskan cara agar `yt-dlp` tersedia dan melanjutkan, daripada menyerahkan keputusan instalasi kepada pengguna.

Keluaran SRT (`--format srt`) dibuat dari `transcript-raw.json`. Keluaran teks/markdown menggunakan `transcript-sentences.json` untuk batasan kalimat alami.

## Alur Kerja

Ketika pengguna memberikan URL YouTube dan menginginkan transkrip:

1. Jalankan dengan `--list` terlebih dahulu jika pengguna belum menentukan bahasa, untuk menampilkan opsi yang tersedia
2. **Selalu kutip URL dengan tanda kutip tunggal** saat menjalankan skrip — zsh memperlakukan `?` sebagai wildcard glob, sehingga URL YouTube tanpa kutipan menyebabkan "no matches found": gunakan `'https://www.youtube.com/watch?v=ID'`
3. Default: jalankan dengan `--chapters --speakers` untuk keluaran terkaya (bab + identifikasi pembicara)
3. Skrip otomatis menyimpan data cache + berkas keluaran dan mencetak jalur berkas
4. Untuk mode `--speakers`: setelah skrip menyimpan berkas mentah, ikuti alur kerja identifikasi pembicara di bawah ini untuk pasca-pemrosesan dengan label pembicara

Ketika pengguna hanya menginginkan gambar sampul atau metadata, menjalankan skrip dengan opsi apa pun juga akan menyimpan `meta.json` dan `imgs/cover.jpg`.

Ketika memformat ulang video yang sama (misalnya, pertama teks lalu SRT), data cache digunakan kembali — tidak perlu pengambilan ulang.

## Alur Kerja Bab & Pembicara

### Bab (`--chapters`)

Skrip mengurai stempel waktu bab dari deskripsi video (misalnya, `0:00 Pendahuluan`), membagi transkrip berdasarkan batas bab, mengelompokkan potongan menjadi paragraf yang mudah dibaca, dan menyimpannya sebagai `.md` dengan Daftar Isi. Tidak diperlukan pemrosesan lebih lanjut.

Jika tidak ada stempel waktu bab dalam deskripsi, transkrip ditampilkan sebagai paragraf yang dikelompokkan tanpa judul bab.

### Identifikasi Pembicara (`--speakers`)

Identifikasi pembicara memerlukan pemrosesan AI. Skrip menghasilkan berkas `.md` mentah yang berisi:
- Frontmatter YAML dengan metadata video (judul, saluran, tanggal, sampul, deskripsi, bahasa)
- Deskripsi video (untuk ekstraksi nama pembicara)
- Daftar bab dari deskripsi (jika tersedia)
- Transkrip mentah dalam format SRT (stempel waktu awal/akhir yang telah dihitung sebelumnya, hemat token)

Setelah skrip menyimpan berkas mentah, jalankan sub-agen (gunakan model yang lebih murah seperti Sonnet untuk efisiensi biaya) untuk memproses identifikasi pembicara:

1. Baca berkas `.md` yang disimpan
2. Baca templat prompt di `{baseDir}/prompts/speaker-transcript.md`
3. Proses transkrip mentah mengikuti prompt:
   - Identifikasi pembicara menggunakan metadata video (judul → tamu, saluran → host, deskripsi → nama)
   - Deteksi giliran pembicara dari alur percakapan, pola tanya jawab, dan petunjuk kontekstual
   - Bagi menjadi bab (gunakan bab deskripsi jika tersedia, selain itu buat dari pergeseran topik)
   - Format dengan label `**Nama Pembicara:**`, pengelompokan paragraf (2-4 kalimat), dan stempel waktu `[JJ:MM:DD → JJ:MM:DD]`
4. Tumpang tindih berkas `.md` dengan transkrip yang telah diproses (pertahankan frontmatter YAML)

Ketika `--speakers` digunakan, `--chapters` otomatis berlaku — keluaran yang diproses selalu menyertakan segmentasi bab.

## Kasus Kesalahan

| Kesalahan | Arti |
|-------|---------|
| Transkrip dinonaktifkan | Video tidak memiliki teks sama sekali |
| Transkrip tidak ditemukan | Bahasa yang diminta tidak tersedia |
| Video tidak tersedia | Video dihapus, pribadi, atau dibatasi wilayah |
| IP diblokir | Terlalu banyak permintaan, coba lagi nanti |
| Dibatasi usia | Video memerlukan login untuk verifikasi usia |
| bot terdeteksi | Skrip mencoba ulang dengan klien alternatif lalu `yt-dlp`; jika alat fallback tidak ada, agen harus menyelesaikannya sendiri, selain itu jika masih gagal coba `YOUTUBE_TRANSCRIPT_COOKIES_FROM_BROWSER=safari` (atau browser Anda) |

## FAQ

### Apa itu Skill Pengunduh Transkrip YouTube?

Skill Pengunduh Transkrip YouTube adalah alat yang memungkinkan Anda mengunduh transkrip, subtitle, dan gambar sampul dari video YouTube hanya dengan menggunakan URL atau ID video. Skill ini mendukung berbagai fitur seperti pengambilan multi-bahasa, terjemahan, segmentasi bab, dan identifikasi pembicara.

### Bagaimana skill ini mendapatkan transkrip YouTube tanpa kunci API?

Skill ini secara langsung menggunakan InnerTube API YouTube untuk mengambil transkrip. Jika akses langsung diblokir, skill ini secara otomatis beralih ke \`yt-dlp\` untuk memastikan pengambilan transkrip yang andal tanpa memerlukan kunci API terpisah.

### Bisakah saya mendapatkan transkrip dalam bahasa selain bahasa Inggris?

Ya, Anda dapat menentukan daftar kode bahasa yang dipisahkan koma menggunakan opsi \`--languages\`. Skill ini akan mencoba mengambil transkrip sesuai urutan prioritas yang ditentukan. Anda juga dapat menerjemahkan transkrip ke bahasa lain menggunakan opsi \`--translate\`.

### Apakah skill ini mendukung identifikasi pembicara dan segmentasi bab?

Ya, skill ini mendukung segmentasi bab dari deskripsi video menggunakan opsi \`--chapters\`. Untuk identifikasi pembicara, Anda dapat menggunakan opsi \`--speakers\`, yang menghasilkan file mentah untuk pemrosesan lanjutan AI guna memberi label pembicara.

### Format keluaran apa yang tersedia untuk transkrip YouTube?

Anda dapat mengeluarkan transkrip dalam format Markdown (\`.md\`), yang mencakup cap waktu, bab, dan data pembicara opsional, atau sebagai file subtitle SRT (\`.srt\`), yang kompatibel dengan sebagian besar pemutar video.

### Apakah ada mekanisme caching, dan bagaimana cara kerjanya?

Ya, skill ini menyimpan cache metadata video, data transkrip mentah, dan kalimat yang tersegmentasi. Eksekusi berikutnya untuk video yang sama akan menggunakan data cache ini, mempercepat pemrosesan. Anda dapat memaksa pengambilan ulang dengan opsi \`--refresh\`.
