# YouTube-Transkript-Agenten-Skill

> Laden Sie YouTube-Videotranskripte, Untertitel und Titelbilder per URL oder Video-ID herunter. Unterstützt mehrere Sprachen, Übersetzung, Kapitel und Sprecheridentifikation, um die Barrierefreiheit von Inhalten zu verbessern. Starten Sie kostenlos in Sekunden.

- Canonical: https://nanoskill.ai/de/skills/youtube-transcript
- Markdown: https://nanoskill.ai/de/skills/youtube-transcript.md
- Author: JimLiu
- Published: 2026-06-03T05:58:31.787Z
- Updated: 2026-07-15T13:36:15.347Z
- Language: de
- Source type: github
- Popularity signal: 1040

## Sources

- https://github.com/JimLiu/baoyu-skills

## Install

```shell
npx skills add https://github.com/JimLiu/baoyu-skills/tree/main/skills/baoyu-youtube-transcript
```

## About

Der YouTube-Transkript-Downloader-Skill bietet eine robuste Lösung zum Extrahieren umfassender Informationen aus YouTube-Videos. Dieser Skill ermöglicht es Benutzern, mühelos vollständige YouTube-Transkripte, Untertitel und sogar Titelbilder herunterzuladen, indem sie einfach eine Video-URL oder -ID angeben. Er ist für Content-Ersteller, Forscher und alle gedacht, die gesprochene Inhalte in Text umwandeln müssen, und bietet Funktionen wie Mehrsprachunterstützung, Übersetzungsfähigkeiten und erweiterte Strukturierungsoptionen.

Durch den direkten Zugriff auf die YouTube InnerTube API und einen intelligenten Fallback auf \`yt-dlp\` gewährleistet der Skill eine zuverlässige und effiziente Datenabfrage ohne persönliche API-Schlüssel. Er bietet flexible Ausgabeformate, darunter Markdown für detaillierte Analysen mit Zeitstempeln und Kapitelmarkierungen, sowie SRT für die standardmäßige Untertitelintegration. Darüber hinaus unterstützt er die Kapitelsegmentierung aus Videobeschreibungen und bietet einen Workflow für KI-gestützte Sprecheridentifikation, die hochgradig organisierten und zugeordneten Text liefert.

Durch intelligentes Caching minimiert der Skill redundante Netzwerkanfragen, sodass nachfolgende Operationen auf demselben Video außergewöhnlich schnell sind. Egal, ob Sie Videoinhalte analysieren, barrierefreie Untertitel erstellen, Material für ein globales Publikum übersetzen oder einfach Videometadaten und Thumbnails extrahieren möchten – dieser Skill optimiert den Prozess und bietet ein leistungsstarkes Werkzeug für das YouTube-Content-Management.

## Key features

- **Direkter YouTube-Zugriff**: Greift direkt auf die InnerTube-API von YouTube zu, um Transkripte schnell abzurufen, und greift automatisch auf \`yt-dlp\` zurück, wenn die direkte API blockiert ist, um einen zuverlässigen Zugriff ohne API-Schlüssel zu gewährleisten.
- **Mehrsprachige Unterstützung & Übersetzung**: Geben Sie bevorzugte Sprachen für Transkripte an und übersetzen Sie sie in eine Zielsprache, um Inhalte einem globalen Publikum zugänglich zu machen.
- **Kapitelsegmentierung & Sprechererkennung**: Segmentiert Transkripte automatisch nach Videokapiteln und unterstützt die KI-Nachbearbeitung zur Sprechererkennung, um strukturierten und zugeordneten Text bereitzustellen.
- **Flexible Ausgabeformate**: Erzeugt Transkripte in Markdown mit Zeitstempeln oder SRT-Untertiteldateien, geeignet für verschiedene Anwendungen von der Inhaltsanalyse bis zu Videoplayern.
- **Intelligentes Caching für Effizienz**: Speichert rohe Videodaten, Metadaten und segmentierte Transkripte im Cache, was eine schnelle Neuformatierung ermöglicht und Netzwerkaufrufe bei nachfolgenden Anfragen für dasselbe Video reduziert.

## Use cases

- **YouTube-Transkripte für die Inhaltsanalyse generieren**: Inhaltsersteller und Forscher können schnell vollständige YouTube-Transkripte einschließlich Zeitstempeln und Kapitelmarkierungen erhalten, um Videoinhalte zu analysieren, Schlüsselinformationen zu extrahieren oder gesprochene Inhalte in Textartikel umzuwandeln.
- **Untertiteldateien für Barrierefreiheit erstellen**: Videoeditoren und Barrierefreiheitsspezialisten können SRT-Untertiteldateien aus YouTube-Videos generieren und so sicherstellen, dass Inhalte für hörgeschädigte Zuschauer oder Personen, die Inhalte lieber ohne Ton konsumieren, zugänglich sind.
- **Videoinhalte für globale Reichweite übersetzen**: Marketingfachleute und Pädagogen können YouTube-Transkripte in mehrere Sprachen übersetzen, um die Reichweite ihrer Videoinhalte auf Nicht-Muttersprachler auszudehnen und das globale Engagement zu verbessern.
- **Metadaten und Coverbilder extrahieren**: Benutzer können problemlos Videometadaten und hochwertige Coverbilder extrahieren, nützlich für Katalogisierung, Social-Media-Werbung oder die Erstellung visueller Assets im Zusammenhang mit dem Videoinhalt.

## Result preview

Entdecken Sie einen professionellen Videoanalysebericht, der von diesem Skill unterstützt wird.

![A presentation cover slide featuring a TED Talk analysis titled 'This Is How Kids Should Be Learning with AI'. The slide uses a bold red background with large white headline text centered prominently across the page. Beneath the title, the speaker and event are identified as 'Priya Lakhani | TEDNext 2025', accompanied by the subtitle 'TED Talk Analysis & Knowledge Report'. The lower portion of the slide contains a thumbnail image from the TED presentation showing the speaker on stage alongside the text 'AI Isn't a Shortcut to Learning'. A teal horizontal accent bar runs along the bottom edge, creating visual contrast. The overall design resembles a professional report or presentation cover summarizing key insights from a TED Talk about artificial intelligence and education.](https://file.nanoskill.ai/youtube-transcript-outcome1.png)

![A report page titled '\[ Executive Summary \]' from a TED Talk analysis on artificial intelligence and education. The page summarizes key arguments presented by education entrepreneur Priya Lakhani at TEDNext 2025, discussing the impact of AI in classrooms, the risks of students using AI to avoid learning, and the importance of productive struggle in effective education. Several paragraphs explain how neuroscience-informed AI systems can support deeper learning when designed to challenge rather than replace student effort. A section titled 'Key Statistics at a Glance' highlights major findings using four large color-coded statistic cards. The statistics include 20% of UK students leaving secondary school without adequate reading and writing skills, 74% of teachers considering leaving the profession within three years due to workload, one in five students using AI to complete all homework assignments, and over 40 billion data points collected on how children learn. The layout uses a clean report style with a red section header, structured text blocks, and colorful infographic-style data highlights to emphasize key educational challenges and opportunities.](https://file.nanoskill.ai/youtube-transcript-outcome2.png)

![A report page titled '\[ The Four Pillars of Learning \]' that presents four evidence-based learning principles supported by cognitive science and educational research. The page is organized into four color-coded sections: Retrieval Practice, Spacing, Generation, and Reflection. Each section includes a concise explanation of the learning principle and a highlighted 'Classroom Applications' box containing practical implementation examples. Retrieval Practice emphasizes recalling information from memory through activities such as flashcards, self-testing, and closed-book quizzes. Spacing focuses on distributing learning over time using spaced repetition and interleaved study sessions. Generation encourages learners to produce answers themselves through prediction, fill-in-the-blank exercises, and open-ended questioning. Reflection highlights structured self-assessment and feedback processes that help students evaluate progress, identify learning goals, and address knowledge gaps. The page uses a clean educational report layout with colored headers, explanatory text, and application callout boxes to summarize effective learning strategies for classrooms and AI-supported education.](https://file.nanoskill.ai/youtube-transcript-outcome3.png)

![A report page from a TED Talk analysis featuring two major sections: 'Neuroscience: The London Taxi Study' and 'AI in Education: Well-Designed vs. Poorly Used.' The first section explains a neuroscience study of London black cab drivers who memorize thousands of city streets to pass 'The Knowledge' exam. It describes how brain scans revealed that experienced drivers developed a larger hippocampus, demonstrating that sustained mental effort and navigation challenges can physically strengthen the brain. A highlighted key insight box emphasizes that mental effort is essential for durable learning, expertise development, and human creativity rather than being a flaw in the learning process. The second section presents a side-by-side comparison of educational AI usage. The left panel, labeled 'AI Well-Designed,' lists benefits such as identifying learning patterns, predicting forgetting, encouraging answer generation, providing targeted feedback, personalizing instruction, supporting teachers, and reducing workload. The right panel, labeled 'AI Poorly Used,' outlines risks including students using AI to complete all work, avoiding genuine learning, replacing thinking with shortcuts, creating false confidence, confusing fluency with understanding, and reducing productive struggle. The layout uses contrasting green and red comparison panels, educational report styling, and structured visual hierarchy to highlight the difference between AI that supports learning and AI that undermines it.](https://file.nanoskill.ai/youtube-transcript-outcome4.png)

## Result walkthrough

### Installieren

Fügen Sie den YouTube-Transkript-Agenten-Skill zu Ihrem KI-Agenten hinzu.

![A screenshot showing the installation process of the 'baoyu-youtube-transcript' AI agent skill from a GitHub repository using an NPX command. At the top, a blue command banner displays the installation command for adding the skill from the GitHub repository. Below, a conversational interface explains the installation workflow, including handling an interactive installation prompt, detecting that the process did not complete automatically, rerunning the command with a '-y' flag to bypass prompts, and explicitly targeting the Hermes Agent environment. The log then describes creating a symbolic link from the agent skills directory to the Hermes skills directory so the skill can be recognized by the Hermes Agent. A final confirmation states that the 'baoyu-youtube-transcript' skill was successfully installed, linked, and is available for use through a skill invocation command. The interface uses a clean chat-style layout with gray response panels, dark blue command highlighting, and monospaced code snippets for file paths and terminal commands.](https://file.nanoskill.ai/youtube-transcript-install.png)

### Inhalt bereitstellen

Geben Sie einen YouTube-Link an und geben Sie Ihr gewünschtes Ausgabeformat an.

![A screenshot showing a prompt and response workflow for a YouTube transcript analysis skill. The top section contains a dark blue prompt panel describing an AI-powered content research and knowledge extraction system designed to analyze YouTube videos and transform them into structured knowledge assets. The prompt outlines requirements such as extracting complete transcripts, metadata, chapter structures, timestamps, speaker distinctions, key topics, major insights, statistics, examples, and actionable takeaways. It also lists supported output formats including executive summaries, study notes, blog articles, social media content, newsletter drafts, and research reports. Additional instructions emphasize transcript quality evaluation, improved readability, information hierarchy, redundancy removal, and generating a polished final deliverable. The requested output is a visually engaging PDF report with chapter navigation, highlighted takeaways, and presentation-ready layouts. Beneath the prompt, a gray response panel shows the AI acknowledging that the skill has been loaded successfully but explaining that a YouTube URL is still required before transcript extraction and report generation can begin. The interface uses a clean chat-style layout with large rounded panels, white text on a dark blue background, and structured instructional formatting.](https://file.nanoskill.ai/youtube-transcript-task.png)

### Erkenntnisse extrahieren

Erstellen Sie strukturierte Transkripte, Zusammenfassungen, Kernpunkte und wiederverwendbare Inhalte.

![A presentation cover slide for a TED Talk analysis and knowledge report. The slide features a bold red background with a teal accent bar running along the bottom edge. Centered at the top is the large white title 'This Is How Kids Should Be Learning with AI.' Below the title, the speaker attribution reads 'Priya Lakhani | TEDNext 2025,' followed by the subtitle 'TED Talk Analysis & Knowledge Report' in italicized white text. In the center of the slide is a thumbnail image from the TED Talk showing Priya Lakhani on stage. The thumbnail includes the prominent message 'AI Isn't a Shortcut to Learning' alongside the TED logo. The overall design resembles a professional research report cover, using strong typography, high contrast colors, and a clean layout to introduce an educational analysis focused on artificial intelligence, learning science, and the future of education.](https://file.nanoskill.ai/youtube-transcript-outcome.png)

## Skill definition

# YouTube-Transkript

Lädt Transkripte (Untertitel) von YouTube-Videos herunter. Funktioniert mit manuell erstellten und automatisch generierten Transkripten. Kein API-Schlüssel oder Browser erforderlich – verwendet direkt die InnerTube-API von YouTube und greift automatisch auf `yt-dlp` zurück, wenn YouTube den direkten API-Pfad blockiert.

Ruft beim ersten Durchlauf Videometadaten und Coverbild ab, speichert Rohdaten für schnelle Umformatierung zwischen.

## Skriptverzeichnis

Skripte im Unterverzeichnis `scripts/`. `{baseDir}` = Verzeichnispfad dieser SKILL.md. Ersetze `${BUN_X}`-Laufzeitumgebung: wenn `bun` installiert → `bun`; wenn `npx` verfügbar → `npx -y bun`; andernfalls schlage die Installation von bun vor. Ersetze `{baseDir}` und `${BUN_X}` durch tatsächliche Werte.

| Skript | Zweck |
|--------|------|
| `scripts/main.ts` | CLI zum Herunterladen von Transkripten |

## Verwendung

```bash
# Standard: Markdown mit Zeitstempeln (Englisch)
${BUN_X} {baseDir}/scripts/main.ts <youtube-url-oder-id>

# Sprachen angeben (Prioritätsreihenfolge)
${BUN_X} {baseDir}/scripts/main.ts <url> --languages zh,en,ja

# Ohne Zeitstempel
${BUN_X} {baseDir}/scripts/main.ts <url> --no-timestamps

# Mit Kapitelsegmentierung
${BUN_X} {baseDir}/scripts/main.ts <url> --chapters

# Mit Sprecheridentifikation (erfordert KI-Nachbearbeitung)
${BUN_X} {baseDir}/scripts/main.ts <url> --speakers

# SRT-Untertiteldatei
${BUN_X} {baseDir}/scripts/main.ts <url> --format srt

# Transkript übersetzen
${BUN_X} {baseDir}/scripts/main.ts <url> --translate zh-Hans

# Verfügbare Transkripte auflisten
${BUN_X} {baseDir}/scripts/main.ts <url> --list

# Erneuten Abruf erzwingen (Cache ignorieren)
${BUN_X} {baseDir}/scripts/main.ts <url> --refresh
```

## Optionen

| Option | Beschreibung | Standard |
|--------|-------------|---------|
| `<url-oder-id>` | YouTube-URL oder Video-ID (mehrere erlaubt) | Erforderlich |
| `--languages <codes>` | Sprachcodes, durch Kommas getrennt, in Prioritätsreihenfolge | `en` |
| `--format <fmt>` | Ausgabeformat: `text`, `srt` | `text` |
| `--translate <code>` | In angegebenen Sprachcode übersetzen | |
| `--list` | Verfügbare Transkripte anzeigen, statt abzurufen | |
| `--timestamps` | `[HH:MM:SS → HH:MM:SS]`-Zeitstempel pro Absatz einfügen | ein |
| `--no-timestamps` | Zeitstempel deaktivieren | |
| `--chapters` | Kapitelsegmentierung aus der Videobeschreibung | |
| `--speakers` | Rohtranskript mit Metadaten zur Sprecheridentifikation | |
| `--exclude-generated` | Automatisch generierte Transkripte überspringen | |
| `--exclude-manually-created` | Manuell erstellte Transkripte überspringen | |
| `--refresh` | Erneuten Abruf erzwingen, zwischengespeicherte Daten ignorieren | |
| `-o, --output <pfad>` | In bestimmten Dateipfad speichern | automatisch generiert |
| `--output-dir <verz>` | Basis-Ausgabeverzeichnis | `youtube-transcript` |

## Optionale Umgebungsvariablen

| Variable | Beschreibung |
|----------|-------------|
| `YOUTUBE_TRANSCRIPT_COOKIES_FROM_BROWSER` | Wird beim Fallback an `yt-dlp --cookies-from-browser` übergeben, z.B. `chrome`, `safari`, `firefox` oder `chrome:Profile 1` |

## Eingabeformate

Akzeptiert eine der folgenden als Videoeingabe:
- Vollständige URL: `https://www.youtube.com/watch?v=dQw4w9WgXcQ`
- Kurze URL: `https://youtu.be/dQw4w9WgXcQ`
- Einbettungs-URL: `https://www.youtube.com/embed/dQw4w9WgXcQ`
- Shorts-URL: `https://www.youtube.com/shorts/dQw4w9WgXcQ`
- Video-ID: `dQw4w9WgXcQ`

## Ausgabeformate

| Format | Erweiterung | Beschreibung |
|--------|-------------|-------------|
| `text` | `.md` | Markdown mit Frontmatter (inkl. `description`), Titelüberschrift, Zusammenfassung, optionales Inhaltsverzeichnis/Cover/Zeitstempel/Kapitel/Sprecher |
| `srt` | `.srt` | SubRip-Untertitelformat für Videoplayer |

## Ausgabeverzeichnis

```
youtube-transcript/
├── .index.json                          # Zuordnung Video-ID → Verzeichnispfad (für Cache-Suche)
└── {channel-slug}/{title-full-slug}/
    ├── meta.json                        # Videometadaten (Titel, Kanal, Beschreibung, Dauer, Kapitel, etc.)
    ├── transcript-raw.json              # Rohtranskript-Snippets von der YouTube-API (gecached)
    ├── transcript-sentences.json        # Satzsegmentiertes Transkript (durch Interpunktion getrennt, über Snippets hinweg zusammengeführt)
    ├── imgs/
    │   └── cover.jpg                    # Videothumbnail
    ├── transcript.md                    # Markdown-Transkript (aus Sätzen generiert)
    └── transcript.srt                   # SRT-Untertitel (aus Rohsnippets generiert, wenn --format srt)
```

- `{channel-slug}`: Kanalname in kebab-case
- `{title-full-slug}`: Voller Videotitel in kebab-case

Der `--list`-Modus gibt nur auf stdout aus (keine Datei gespeichert).

## Caching

Beim ersten Abruf speichert das Skript:
- `meta.json` – Videometadaten, Kapitel, Coverbildpfad, Sprachinfo
- `transcript-raw.json` – Rohtranskript-Snippets von der YouTube-API (`{ text, start, duration }[]`)
- `transcript-sentences.json` – Satzsegmentiertes Transkript (`{ text, start: "HH:mm:ss", end: "HH:mm:ss" }[]`), aufgeteilt durch satzbeendende Interpunktion (`.?!…。？！` etc.), Zeitstempel proportional zur Zeichenlänge zugewiesen, CJK-bewusste Textzusammenführung
- `imgs/cover.jpg` – Videothumbnail

Nachfolgende Durchläufe für dasselbe Video verwenden zwischengespeicherte Daten (keine Netzwerkaufrufe). Verwende `--refresh` zum erneuten Abrufen. Wird eine andere Sprache angefordert, wird der Cache automatisch aktualisiert.

Wenn YouTube Anti-Bot-/Blockierungsantworten auf dem direkten InnerTube-Pfad zurückgibt, wiederholt das Skript mit alternativen Client-Identitäten und greift dann auf `yt-dlp` zurück, falls verfügbar. Falls ein Fallback erforderlich ist, aber `yt-dlp` nicht verfügbar ist, sollte der Agent selbst entscheiden, wie er `yt-dlp` verfügbar macht und fortfährt, anstatt die Installationsentscheidung dem Benutzer zu überlassen.

Die SRT-Ausgabe (`--format srt`) wird aus `transcript-raw.json` generiert. Die Text-/Markdown-Ausgabe verwendet `transcript-sentences.json` für natürliche Satzgrenzen.

## Workflow

Wenn der Benutzer eine YouTube-URL bereitstellt und das Transkript möchte:

1. Starte zuerst mit `--list`, wenn der Benutzer keine Sprache angegeben hat, um die verfügbaren Optionen anzuzeigen.
2. **Setze die URL immer in einfache Anführungszeichen**, wenn das Skript ausgeführt wird – zsh behandelt `?` als Glob-Platzhalter, daher verursacht eine nicht in Anführungszeichen gesetzte YouTube-URL den Fehler "keine Treffer gefunden": verwende `'https://www.youtube.com/watch?v=ID'`
3. Standard: Führe mit `--chapters --speakers` aus, um die reichhaltigste Ausgabe zu erhalten (Kapitel + Sprecheridentifikation)
3. Das Skript speichert automatisch die zwischengespeicherten Daten + Ausgabedatei und gibt den Dateipfad aus.
4. Für den `--speakers`-Modus: Nachdem das Skript die Rohdatei gespeichert hat, folge dem untenstehenden Workflow zur Sprecheridentifikation, um mit Sprecherbezeichnungen nachzubearbeiten.

Wenn der Benutzer nur ein Coverbild oder Metadaten möchte, wird das Ausführen des Skripts mit einer beliebigen Option auch `meta.json` und `imgs/cover.jpg` cachen.

Beim Umformatieren desselben Videos (z.B. zuerst Text, dann SRT) werden die zwischengespeicherten Daten wiederverwendet – kein erneuter Abruf erforderlich.

## Kapitel- & Sprecher-Workflow

### Kapitel (`--chapters`)

Das Skript parst Kapitelzeitstempel aus der Videobeschreibung (z.B. `0:00 Einleitung`), segmentiert das Transkript an Kapitelgrenzen, gruppiert Snippets in lesbare Absätze und speichert es als `.md` mit einem Inhaltsverzeichnis. Keine weitere Verarbeitung erforderlich.

Wenn in der Beschreibung keine Kapitelzeitstempel vorhanden sind, wird das Transkript als gruppierte Absätze ohne Kapitelüberschriften ausgegeben.

### Sprecheridentifikation (`--speakers`)

Die Sprecheridentifikation erfordert KI-Verarbeitung. Das Skript gibt eine rohe `.md`-Datei aus, die Folgendes enthält:
- YAML-Frontmatter mit Videometadaten (Titel, Kanal, Datum, Cover, Beschreibung, Sprache)
- Videobeschreibung (zur Extraktion von Sprechernamen)
- Kapitelliste aus der Beschreibung (falls verfügbar)
- Rohtranskript im SRT-Format (vorberechnete Start-/Endzeitstempel, token-effizient)

Nachdem das Skript die Rohdatei gespeichert hat, starte einen Sub-Agenten (verwende ein kostengünstigeres Modell wie Sonnet für Kosteneffizienz), um die Sprecheridentifikation zu verarbeiten:

1. Lies die gespeicherte `.md`-Datei
2. Lies die Prompt-Vorlage unter `{baseDir}/prompts/speaker-transcript.md`
3. Verarbeite das Rohtranskript gemäß dem Prompt:
   - Identifiziere Sprecher anhand von Videometadaten (Titel → Gast, Kanal → Gastgeber, Beschreibung → Namen)
   - Erkenne Sprecherwechsel aus Gesprächsfluss, Frage-Antwort-Mustern und kontextuellen Hinweisen
   - Unterteile in Kapitel (verwende Beschreibungskapitel, falls vorhanden, andernfalls erstelle aus Themenwechseln)
   - Formatiere mit `**Sprechername:**`-Bezeichnungen, Absatzgruppierung (2-4 Sätze) und `[HH:MM:SS → HH:MM:SS]`-Zeitstempeln
4. Überschreibe die `.md`-Datei mit dem verarbeiteten Transkript (behalte das YAML-Frontmatter bei)

Wenn `--speakers` verwendet wird, ist `--chapters` impliziert – die verarbeitete Ausgabe enthält immer eine Kapitelsegmentierung.

## Fehlerfälle

| Fehler | Bedeutung |
|-------|----------|
| Transkripte deaktiviert | Video hat überhaupt keine Untertitel |
| Kein Transkript gefunden | Angeforderte Sprache nicht verfügbar |
| Video nicht verfügbar | Video gelöscht, privat oder regionsgesperrt |
| IP blockiert | Zu viele Anfragen, versuche es später erneut |
| Altersbeschränkt | Video erfordert Anmeldung zur Altersüberprüfung |
| Bot erkannt | Das Skript wiederholt mit alternativen Clients und dann `yt-dlp`; falls Fallback-Tooling fehlt, sollte der Agent dies selbst beheben, andernfalls, wenn es immer noch fehlschlägt, versuche `YOUTUBE_TRANSCRIPT_COOKIES_FROM_BROWSER=safari` (oder deinen Browser) |

## FAQ

### Was ist die YouTube-Transcript-Downloader-Funktion?

Die YouTube-Transcript-Downloader-Funktion ist ein Werkzeug, mit dem Sie Transkripte, Untertitel und Coverbilder von YouTube-Videos herunterladen können, indem Sie lediglich die URL oder die Video-ID verwenden. Sie unterstützt verschiedene Funktionen wie mehrsprachige Abfrage, Übersetzung, Kapitelsegmentierung und Sprechererkennung.

### Wie erhält diese Funktion YouTube-Transkripte ohne einen API-Schlüssel?

Die Funktion verwendet direkt die InnerTube-API von YouTube, um Transkripte abzurufen. Wenn der direkte Zugriff blockiert wird, greift sie automatisch auf \`yt-dlp\` zurück, um eine zuverlässige Transkriptabfrage ohne separaten API-Schlüssel zu gewährleisten.

### Kann ich Transkripte in anderen Sprachen als Englisch erhalten?

Ja, Sie können eine durch Kommas getrennte Liste von Sprachcodes mit der Option \`--languages\` angeben. Die Funktion versucht, Transkripte in der angegebenen Prioritätsreihenfolge abzurufen. Sie können das Transkript auch mit der Option \`--translate\` in eine andere Sprache übersetzen.

### Unterstützt es Sprechererkennung und Kapitelsegmentierung?

Ja, die Funktion unterstützt die Kapitelsegmentierung aus den Videobeschreibungen mit der Option \`--chapters\`. Für die Sprechererkennung können Sie die Option \`--speakers\` verwenden, die eine Rohdatei für die KI-Nachbearbeitung zur Kennzeichnung der Sprecher ausgibt.

### Welche Ausgabeformate sind für das YouTube-Transkript verfügbar?

Sie können das Transkript im Markdown-Format (\`.md\`) ausgeben, das Zeitstempel, Kapitel und optionale Sprecherdaten enthält, oder als SRT-Untertiteldatei (\`.srt\`), die mit den meisten Videoplayern kompatibel ist.

### Gibt es einen Caching-Mechanismus und wie funktioniert er?

Ja, die Funktion speichert Videometadaten, rohe Transkriptdaten und segmentierte Sätze im Cache. Nachfolgende Durchläufe für dasselbe Video verwenden diese zwischengespeicherten Daten, was die Verarbeitung beschleunigt. Mit der Option \`--refresh\` können Sie ein erneutes Abrufen erzwingen.
