# Umiejętność agenta transkryptów YouTube

> Pobieraj transkrypty, napisy i obrazy okładek filmów z YouTube po adresie URL lub identyfikatorze wideo. Obsługuje wiele języków, tłumaczenie, rozdziały i identyfikację mówcy, aby zwiększyć dostępność treści. Zacznij za darmo w kilka sekund.

- Canonical: https://nanoskill.ai/pl/skills/youtube-transcript
- Markdown: https://nanoskill.ai/pl/skills/youtube-transcript.md
- Author: JimLiu
- Published: 2026-06-03T05:58:31.787Z
- Updated: 2026-07-15T13:36:15.347Z
- Language: pl
- Source type: github
- Popularity signal: 1040

## Sources

- https://github.com/JimLiu/baoyu-skills

## Install

```shell
npx skills add https://github.com/JimLiu/baoyu-skills/tree/main/skills/baoyu-youtube-transcript
```

## About

Umiejętność pobierania transkryptów YouTube zapewnia solidne rozwiązanie do wydobywania wyczerpujących informacji z filmów na YouTube. Ta umiejętność umożliwia użytkownikom łatwe pobieranie pełnych transkryptów, napisów, a nawet obrazów okładek, podając jedynie adres URL lub identyfikator wideo. Została zaprojektowana dla twórców treści, badaczy i wszystkich, którzy potrzebują przekształcić mowę na tekst, oferując funkcje takie jak obsługa wielu języków, możliwości tłumaczenia i zaawansowane opcje strukturyzacji.

Wykorzystując bezpośredni dostęp do wewnętrznego API YouTube (InnerTube) i sprytne przełączanie na \`yt-dlp\` w razie potrzeby, umiejętność zapewnia niezawodne i wydajne pobieranie danych bez konieczności posiadania osobistych kluczy API. Oferuje elastyczne formaty wyjściowe, w tym Markdown do szczegółowej analizy ze znacznikami czasu i wskaźnikami rozdziałów, oraz SRT do standardowej integracji napisów. Dodatkowo obsługuje segmentację rozdziałów z opisów wideo i zapewnia przepływ pracy do identyfikacji mówców opartej na sztucznej inteligencji, dostarczając wysoce uporządkowany i przypisany tekst.

Dzięki inteligentnemu buforowaniu umiejętność minimalizuje zbędne żądania sieciowe, sprawiając, że kolejne operacje na tym samym filmie są wyjątkowo szybkie. Niezależnie od tego, czy chcesz analizować treść wideo, tworzyć dostępne napisy, tłumaczyć materiały dla globalnej publiczności, czy po prostu wydobywać metadane wideo i miniatury, ta umiejętność usprawnia proces, zapewniając potężne narzędzie do zarządzania treściami z YouTube.

## Key features

- **Bezpośredni dostęp do YouTube**: Korzysta bezpośrednio z wewnętrznego interfejsu API YouTube w celu szybkiego pobierania transkrypcji, automatycznie przełączając się na \`yt-dlp\`, jeśli bezpośredni interfejs API jest zablokowany, zapewniając niezawodny dostęp bez kluczy API.
- **Wsparcie wielojęzyczne i tłumaczenie**: Określ preferowane języki transkrypcji i przetłumacz je na wybrany język docelowy, udostępniając treści globalnej publiczności.
- **Segmentacja na rozdziały i identyfikacja mówców**: Automatycznie dzieli transkrypcje według rozdziałów wideo i obsługuje późniejsze przetwarzanie przez SI w celu identyfikacji mówców, dostarczając uporządkowany tekst z przypisaniem.
- **Elastyczne formaty wyjściowe**: Generuje transkrypcje w formacie Markdown ze znacznikami czasu lub pliki napisów SRT, odpowiednie do różnych zastosowań, od analizy treści po odtwarzacze wideo.
- **Inteligentne buforowanie dla wydajności**: Buforuje surowe dane wideo, metadane i podzielone transkrypcje, umożliwiając szybkie ponowne formatowanie i zmniejszając liczbę wywołań sieciowych przy kolejnych żądaniach dla tego samego filmu.

## Use cases

- **Generuj transkrypcje YouTube do analizy treści**: Twórcy treści i badacze mogą szybko uzyskać pełne transkrypcje YouTube, w tym znaczniki czasu i znaczniki rozdziałów, aby analizować treści wideo, wyodrębniać kluczowe informacje lub przekształcać treści mówione w artykuły tekstowe.
- **Twórz pliki napisów dla dostępności**: Montażyści wideo i specjaliści ds. dostępności mogą generować pliki napisów SRT z filmów YouTube, zapewniając dostępność treści dla osób niesłyszących lub tych, którzy wolą odbierać treści bez dźwięku.
- **Tłumacz treści wideo dla globalnego zasięgu**: Marketerzy i edukatorzy mogą tłumaczyć transkrypcje YouTube na wiele języków, rozszerzając zasięg swoich treści wideo na osoby niebędące rodzimymi użytkownikami i zwiększając globalne zaangażowanie.
- **Wyodrębnij metadane i obrazy okładek**: Użytkownicy mogą łatwo wyodrębnić metadane wideo i obrazy okładek w wysokiej jakości, przydatne do katalogowania, promocji w mediach społecznościowych lub tworzenia zasobów wizualnych związanych z treścią wideo.

## Result preview

Przejrzyj profesjonalny raport z analizy wideo stworzony dzięki tej umiejętności.

![A presentation cover slide featuring a TED Talk analysis titled 'This Is How Kids Should Be Learning with AI'. The slide uses a bold red background with large white headline text centered prominently across the page. Beneath the title, the speaker and event are identified as 'Priya Lakhani | TEDNext 2025', accompanied by the subtitle 'TED Talk Analysis & Knowledge Report'. The lower portion of the slide contains a thumbnail image from the TED presentation showing the speaker on stage alongside the text 'AI Isn't a Shortcut to Learning'. A teal horizontal accent bar runs along the bottom edge, creating visual contrast. The overall design resembles a professional report or presentation cover summarizing key insights from a TED Talk about artificial intelligence and education.](https://file.nanoskill.ai/youtube-transcript-outcome1.png)

![A report page titled '\[ Executive Summary \]' from a TED Talk analysis on artificial intelligence and education. The page summarizes key arguments presented by education entrepreneur Priya Lakhani at TEDNext 2025, discussing the impact of AI in classrooms, the risks of students using AI to avoid learning, and the importance of productive struggle in effective education. Several paragraphs explain how neuroscience-informed AI systems can support deeper learning when designed to challenge rather than replace student effort. A section titled 'Key Statistics at a Glance' highlights major findings using four large color-coded statistic cards. The statistics include 20% of UK students leaving secondary school without adequate reading and writing skills, 74% of teachers considering leaving the profession within three years due to workload, one in five students using AI to complete all homework assignments, and over 40 billion data points collected on how children learn. The layout uses a clean report style with a red section header, structured text blocks, and colorful infographic-style data highlights to emphasize key educational challenges and opportunities.](https://file.nanoskill.ai/youtube-transcript-outcome2.png)

![A report page titled '\[ The Four Pillars of Learning \]' that presents four evidence-based learning principles supported by cognitive science and educational research. The page is organized into four color-coded sections: Retrieval Practice, Spacing, Generation, and Reflection. Each section includes a concise explanation of the learning principle and a highlighted 'Classroom Applications' box containing practical implementation examples. Retrieval Practice emphasizes recalling information from memory through activities such as flashcards, self-testing, and closed-book quizzes. Spacing focuses on distributing learning over time using spaced repetition and interleaved study sessions. Generation encourages learners to produce answers themselves through prediction, fill-in-the-blank exercises, and open-ended questioning. Reflection highlights structured self-assessment and feedback processes that help students evaluate progress, identify learning goals, and address knowledge gaps. The page uses a clean educational report layout with colored headers, explanatory text, and application callout boxes to summarize effective learning strategies for classrooms and AI-supported education.](https://file.nanoskill.ai/youtube-transcript-outcome3.png)

![A report page from a TED Talk analysis featuring two major sections: 'Neuroscience: The London Taxi Study' and 'AI in Education: Well-Designed vs. Poorly Used.' The first section explains a neuroscience study of London black cab drivers who memorize thousands of city streets to pass 'The Knowledge' exam. It describes how brain scans revealed that experienced drivers developed a larger hippocampus, demonstrating that sustained mental effort and navigation challenges can physically strengthen the brain. A highlighted key insight box emphasizes that mental effort is essential for durable learning, expertise development, and human creativity rather than being a flaw in the learning process. The second section presents a side-by-side comparison of educational AI usage. The left panel, labeled 'AI Well-Designed,' lists benefits such as identifying learning patterns, predicting forgetting, encouraging answer generation, providing targeted feedback, personalizing instruction, supporting teachers, and reducing workload. The right panel, labeled 'AI Poorly Used,' outlines risks including students using AI to complete all work, avoiding genuine learning, replacing thinking with shortcuts, creating false confidence, confusing fluency with understanding, and reducing productive struggle. The layout uses contrasting green and red comparison panels, educational report styling, and structured visual hierarchy to highlight the difference between AI that supports learning and AI that undermines it.](https://file.nanoskill.ai/youtube-transcript-outcome4.png)

## Result walkthrough

### Zainstaluj

Dodaj umiejętność agenta transkryptów YouTube do swojego agenta AI.

![A screenshot showing the installation process of the 'baoyu-youtube-transcript' AI agent skill from a GitHub repository using an NPX command. At the top, a blue command banner displays the installation command for adding the skill from the GitHub repository. Below, a conversational interface explains the installation workflow, including handling an interactive installation prompt, detecting that the process did not complete automatically, rerunning the command with a '-y' flag to bypass prompts, and explicitly targeting the Hermes Agent environment. The log then describes creating a symbolic link from the agent skills directory to the Hermes skills directory so the skill can be recognized by the Hermes Agent. A final confirmation states that the 'baoyu-youtube-transcript' skill was successfully installed, linked, and is available for use through a skill invocation command. The interface uses a clean chat-style layout with gray response panels, dark blue command highlighting, and monospaced code snippets for file paths and terminal commands.](https://file.nanoskill.ai/youtube-transcript-install.png)

### Podaj zawartość

Udostępnij link do YouTube i określ żądany format wyjściowy.

![A screenshot showing a prompt and response workflow for a YouTube transcript analysis skill. The top section contains a dark blue prompt panel describing an AI-powered content research and knowledge extraction system designed to analyze YouTube videos and transform them into structured knowledge assets. The prompt outlines requirements such as extracting complete transcripts, metadata, chapter structures, timestamps, speaker distinctions, key topics, major insights, statistics, examples, and actionable takeaways. It also lists supported output formats including executive summaries, study notes, blog articles, social media content, newsletter drafts, and research reports. Additional instructions emphasize transcript quality evaluation, improved readability, information hierarchy, redundancy removal, and generating a polished final deliverable. The requested output is a visually engaging PDF report with chapter navigation, highlighted takeaways, and presentation-ready layouts. Beneath the prompt, a gray response panel shows the AI acknowledging that the skill has been loaded successfully but explaining that a YouTube URL is still required before transcript extraction and report generation can begin. The interface uses a clean chat-style layout with large rounded panels, white text on a dark blue background, and structured instructional formatting.](https://file.nanoskill.ai/youtube-transcript-task.png)

### Wyciągnij wnioski

Generuj uporządkowane transkrypty, streszczenia, kluczowe wnioski i treści do ponownego wykorzystania.

![A presentation cover slide for a TED Talk analysis and knowledge report. The slide features a bold red background with a teal accent bar running along the bottom edge. Centered at the top is the large white title 'This Is How Kids Should Be Learning with AI.' Below the title, the speaker attribution reads 'Priya Lakhani | TEDNext 2025,' followed by the subtitle 'TED Talk Analysis & Knowledge Report' in italicized white text. In the center of the slide is a thumbnail image from the TED Talk showing Priya Lakhani on stage. The thumbnail includes the prominent message 'AI Isn't a Shortcut to Learning' alongside the TED logo. The overall design resembles a professional research report cover, using strong typography, high contrast colors, and a clean layout to introduce an educational analysis focused on artificial intelligence, learning science, and the future of education.](https://file.nanoskill.ai/youtube-transcript-outcome.png)

## Skill definition

# Transkrypcja YouTube

Pobiera transkrypcje (napisy/podpisy) z filmów YouTube. Działa zarówno z ręcznie tworzonymi, jak i automatycznie generowanymi transkrypcjami. Nie wymaga klucza API ani przeglądarki — korzysta bezpośrednio z API InnerTube YouTube i automatycznie przełącza się na `yt-dlp`, gdy YouTube blokuje bezpośrednią ścieżkę API.

Przy pierwszym uruchomieniu pobiera metadane wideo i obraz okładki, przechowuje surowe dane w pamięci podręcznej w celu szybkiego ponownego formatowania.

## Katalog skryptów

Skrypty w podkatalogu `scripts/`. `{baseDir}` = ścieżka katalogu tego SKILL.md. Ustal środowisko wykonawcze `${BUN_X}`: jeśli zainstalowano `bun` → `bun`; jeśli dostępny jest `npx` → `npx -y bun`; w przeciwnym razie zasugeruj instalację bun. Zastąp `{baseDir}` i `${BUN_X}` rzeczywistymi wartościami.

| Skrypt | Przeznaczenie |
|--------|---------------|
| `scripts/main.ts` | CLI do pobierania transkrypcji |

## Użycie

```bash
# Domyślnie: markdown z znacznikami czasu (angielski)
${BUN_X} {baseDir}/scripts/main.ts <youtube-url-or-id>

# Określ języki (kolejność priorytetów)
${BUN_X} {baseDir}/scripts/main.ts <url> --languages zh,en,ja

# Bez znaczników czasu
${BUN_X} {baseDir}/scripts/main.ts <url> --no-timestamps

# Z segmentacją rozdziałów
${BUN_X} {baseDir}/scripts/main.ts <url> --chapters

# Z identyfikacją mówców (wymaga obróbki AI)
${BUN_X} {baseDir}/scripts/main.ts <url> --speakers

# Plik napisów SRT
${BUN_X} {baseDir}/scripts/main.ts <url> --format srt

# Przetłumacz transkrypcję
${BUN_X} {baseDir}/scripts/main.ts <url> --translate zh-Hans

# Lista dostępnych transkrypcji
${BUN_X} {baseDir}/scripts/main.ts <url> --list

# Wymuś ponowne pobranie (ignoruj pamięć podręczną)
${BUN_X} {baseDir}/scripts/main.ts <url> --refresh
```

## Opcje

| Opcja | Opis | Domyślnie |
|--------|------|-----------|
| `<url-or-id>` | Adres URL YouTube lub identyfikator wideo (dozwolone wiele) | Wymagane |
| `--languages <codes>` | Kody językowe, oddzielone przecinkami, w kolejności priorytetów | `en` |
| `--format <fmt>` | Format wyjściowy: `text`, `srt` | `text` |
| `--translate <code>` | Przetłumacz na podany kod języka | |
| `--list` | Wyświetl dostępne transkrypcje zamiast pobierać | |
| `--timestamps` | Dołącz znaczniki czasu `[HH:MM:SS → HH:MM:SS]` dla każdego akapitu | włączone |
| `--no-timestamps` | Wyłącz znaczniki czasu | |
| `--chapters` | Segmentacja rozdziałów na podstawie opisu wideo | |
| `--speakers` | Surowa transkrypcja z metadanymi do identyfikacji mówców | |
| `--exclude-generated` | Pomiń automatycznie generowane transkrypcje | |
| `--exclude-manually-created` | Pomiń ręcznie tworzone transkrypcje | |
| `--refresh` | Wymuś ponowne pobranie, ignoruj dane z pamięci podręcznej | |
| `-o, --output <path>` | Zapisz do określonej ścieżki pliku | automatycznie generowana |
| `--output-dir <dir>` | Podstawowy katalog wyjściowy | `youtube-transcript` |

## Opcjonalne zmienne środowiskowe

| Zmienna | Opis |
|----------|------|
| `YOUTUBE_TRANSCRIPT_COOKIES_FROM_BROWSER` | Przekazywane do `yt-dlp --cookies-from-browser` podczas przełączania, np. `chrome`, `safari`, `firefox` lub `chrome:Profile 1` |

## Formaty wejściowe

Akceptuje dowolne z poniższych jako wejście wideo:
- Pełny URL: `https://www.youtube.com/watch?v=dQw4w9WgXcQ`
- Krótki URL: `https://youtu.be/dQw4w9WgXcQ`
- URL osadzenia: `https://www.youtube.com/embed/dQw4w9WgXcQ`
- URL Shorts: `https://www.youtube.com/shorts/dQw4w9WgXcQ`
- ID wideo: `dQw4w9WgXcQ`

## Formaty wyjściowe

| Format | Rozszerzenie | Opis |
|--------|---------------|------|
| `text` | `.md` | Markdown z frontmatter (zawiera `description`), nagłówek tytułu, podsumowanie, opcjonalny spis treści/okładka/znaczniki czasu/rozdziały/mówcy |
| `srt` | `.srt` | Format napisów SubRip dla odtwarzaczy wideo |

## Katalog wyjściowy

```
youtube-transcript/
├── .index.json                          # Mapowanie identyfikatora wideo → ścieżka katalogu (do wyszukiwania w pamięci podręcznej)
└── {channel-slug}/{title-full-slug}/
    ├── meta.json                        # Metadane wideo (tytuł, kanał, opis, czas trwania, rozdziały itp.)
    ├── transcript-raw.json              # Surowe fragmenty transkrypcji z API YouTube (buforowane)
    ├── transcript-sentences.json        # Transkrypcja podzielona na zdania (podział według interpunkcji, scalanie między fragmentami)
    ├── imgs/
    │   └── cover.jpg                    # Miniatura wideo
    ├── transcript.md                    # Transkrypcja w formacie Markdown (wygenerowana z zdań)
    └── transcript.srt                   # Napisy SRT (wygenerowane z surowych fragmentów, jeśli użyto --format srt)
```

- `{channel-slug}`: Nazwa kanału w formacie kebab-case
- `{title-full-slug}`: Pełny tytuł wideo w formacie kebab-case

Tryb `--list` wyprowadza tylko na stdout (nie zapisuje pliku).

## Buforowanie

Przy pierwszym pobraniu skrypt zapisuje:
- `meta.json` — metadane wideo, rozdziały, ścieżka do obrazu okładki, informacje o języku
- `transcript-raw.json` — surowe fragmenty transkrypcji z API YouTube (`{ text, start, duration }[]`)
- `transcript-sentences.json` — transkrypcja podzielona na zdania (`{ text, start: "HH:mm:ss", end: "HH:mm:ss" }[]`), podzielona według znaków kończących zdanie (`.?!…。？！` itp.), znaczniki czasu proporcjonalnie przydzielone według długości znaków, scalanie tekstu z uwzględnieniem CJK
- `imgs/cover.jpg` — miniatura wideo

Kolejne uruchomienia dla tego samego wideo korzystają z danych z pamięci podręcznej (bez wywołań sieciowych). Użyj `--refresh`, aby wymusić ponowne pobranie. W przypadku żądania innego języka, pamięć podręczna jest automatycznie odświeżana.

Gdy YouTube zwraca odpowiedzi anty-botowe / zablokowane na bezpośredniej ścieżce InnerTube, skrypt ponawia próby z alternatywnymi tożsamościami klienta, a następnie przełącza się na `yt-dlp`, jeśli jest dostępny. Jeśli konieczne jest użycie narzędzia zapasowego, ale `yt-dlp` jest niedostępny, agent powinien zdecydować, jak udostępnić `yt-dlp` i kontynuować, zamiast zmuszać użytkownika do podjęcia decyzji o instalacji.

Dane wyjściowe SRT (`--format srt`) są generowane z `transcript-raw.json`. Wyjście tekstowe/markdown używa `transcript-sentences.json` dla naturalnych granic zdań.

## Przepływ pracy

Gdy użytkownik poda adres URL YouTube i chce uzyskać transkrypcję:
1. Uruchom z `--list` najpierw, jeśli użytkownik nie określił języka, aby pokazać dostępne opcje
2. **Zawsze umieszczaj adres URL w pojedynczych cudzysłowach** podczas uruchamiania skryptu — zsh traktuje `?` jako symbol wieloznaczny glob, więc niecytowany adres URL YouTube powoduje "nie znaleziono dopasowań": użyj `'https://www.youtube.com/watch?v=ID'`
3. Domyślnie: uruchom z `--chapters --speakers`, aby uzyskać najbogatsze wyniki (rozdziały + identyfikacja mówców)
3. Skrypt automatycznie zapisuje dane z pamięci podręcznej + plik wyjściowy i drukuje ścieżkę pliku
4. Dla trybu `--speakers`: po zapisaniu surowego pliku przez skrypt, postępuj zgodnie z poniższym przepływem pracy identyfikacji mówców, aby przeprowadzić obróbkę końcową z etykietami mówców

Gdy użytkownik chce tylko obrazu okładki lub metadanych, uruchomienie skryptu z dowolną opcją spowoduje również zapisanie w pamięci podręcznej `meta.json` i `imgs/cover.jpg`.

Podczas ponownego formatowania tego samego wideo (np. najpierw tekst, potem SRT), dane z pamięci podręcznej są ponownie wykorzystywane — nie ma potrzeby ponownego pobierania.

## Przepływ pracy rozdziałów i mówców

### Rozdziały (`--chapters`)
Skrypt analizuje znaczniki czasu rozdziałów z opisu wideo (np. `0:00 Wprowadzenie`), dzieli transkrypcję według granic rozdziałów, grupuje fragmenty w czytelne akapity i zapisuje jako `.md` z spisem treści. Nie jest wymagane dalsze przetwarzanie.

Jeśli w opisie nie ma znaczników czasu rozdziałów, transkrypcja jest wyprowadzana jako zgrupowane akapity bez nagłówków rozdziałów.

### Identyfikacja mówców (`--speakers`)
Identyfikacja mówców wymaga przetwarzania AI. Skrypt generuje surowy plik `.md` zawierający:
- YAML frontmatter z metadanymi wideo (tytuł, kanał, data, okładka, opis, język)
- Opis wideo (do ekstrakcji nazw mówców)
- Lista rozdziałów z opisu (jeśli dostępna)
- Surowa transkrypcja w formacie SRT (wstępnie obliczone znaczniki czasu początku/końca, oszczędne tokenowo)

Po zapisaniu surowego pliku przez skrypt, uruchom pod-agenta (użyj tańszego modelu, np. Sonnet, dla oszczędności kosztów), aby przeprowadzić identyfikację mówców:

1. Odczytaj zapisany plik `.md`
2. Odczytaj szablon promptu z `{baseDir}/prompts/speaker-transcript.md`
3. Przetwórz surową transkrypcję zgodnie z promptem:
   - Zidentyfikuj mówców, korzystając z metadanych wideo (tytuł → gość, kanał → gospodarz, opis → nazwiska)
   - Wykryj zmiany mówców na podstawie przepływu rozmowy, wzorców pytanie-odpowiedź i wskazówek kontekstowych
   - Podziel na rozdziały (użyj rozdziałów z opisu, jeśli są dostępne, w przeciwnym razie utwórz na podstawie zmian tematów)
   - Formatuj z etykietami `**Imię mówcy:**`, grupowaniem akapitów (2-4 zdania) i znacznikami czasu `[HH:MM:SS → HH:MM:SS]`
4. Nadpisz plik `.md` przetworzoną transkrypcją (zachowaj YAML frontmatter)

Gdy używana jest opcja `--speakers`, `--chapters` jest implikowane — przetworzone dane wyjściowe zawsze zawierają segmentację rozdziałów.

## Przypadki błędów

| Błąd | Znaczenie |
|-------|-----------|
| Transkrypcje wyłączone | Wideo nie ma wcale napisów |
| Nie znaleziono transkrypcji | Żądany język nie jest dostępny |
| Wideo niedostępne | Wideo usunięte, prywatne lub zablokowane regionalnie |
| IP zablokowane | Zbyt wiele żądań, spróbuj ponownie później |
| Ograniczenie wiekowe | Wideo wymaga logowania w celu weryfikacji wieku |
| Wykryto bota | Skrypt ponawia próby z alternatywnymi klientami, a następnie `yt-dlp`; jeśli brakuje narzędzi zapasowych, agent powinien sam to rozwiązać, w przeciwnym razie jeśli nadal nie działa, spróbuj `YOUTUBE_TRANSCRIPT_COOKIES_FROM_BROWSER=safari` (lub swojej przeglądarki) |

## FAQ

### Czym jest umiejętność pobierania transkrypcji YouTube?

Umiejętność pobierania transkrypcji YouTube to narzędzie umożliwiające pobieranie transkrypcji, napisów i obrazów okładek z filmów YouTube przy użyciu samego adresu URL lub identyfikatora wideo. Obsługuje różne funkcje, takie jak pobieranie wielojęzyczne, tłumaczenie, segmentację na rozdziały i identyfikację mówców.

### W jaki sposób ta umiejętność pobiera transkrypcje z YouTube bez klucza API?

Umiejętność bezpośrednio korzysta z wewnętrznego interfejsu API YouTube, aby pobierać transkrypcje. Jeśli bezpośredni dostęp jest zablokowany, automatycznie przełącza się na \`yt-dlp\`, aby zapewnić niezawodne pobieranie transkrypcji bez konieczności posiadania oddzielnego klucza API.

### Czy mogę uzyskać transkrypcje w językach innych niż angielski?

Tak, możesz określić listę kodów języków oddzielonych przecinkami za pomocą opcji \`--languages\`. Umiejętność podejmie próbę pobrania transkrypcji w określonej kolejności priorytetów. Możesz także przetłumaczyć transkrypcję na inny język za pomocą opcji \`--translate\`.

### Czy obsługuje identyfikację mówców i segmentację na rozdziały?

Tak, umiejętność obsługuje segmentację na rozdziały z opisów filmów za pomocą opcji \`--chapters\`. Do identyfikacji mówców możesz użyć opcji \`--speakers\`, która generuje surowy plik do późniejszego przetwarzania przez SI w celu oznaczenia mówców.

### Jakie formaty wyjściowe są dostępne dla transkrypcji YouTube?

Możesz wygenerować transkrypcję w formacie Markdown (\`.md\`), który zawiera znaczniki czasu, rozdziały i opcjonalne dane mówców, lub jako plik napisów SRT (\`.srt\`), który jest kompatybilny z większością odtwarzaczy wideo.

### Czy istnieje mechanizm buforowania i jak działa?

Tak, umiejętność buforuje metadane wideo, surowe dane transkrypcji i podzielone zdania. Kolejne uruchomienia dla tego samego filmu wykorzystają te dane z pamięci podręcznej, przyspieszając przetwarzanie. Możesz wymusić ponowne pobranie za pomocą opcji \`--refresh\`.
