Video & Audio Text Extraction
Extracts text from videos and audio files across platforms like YouTube, Bilibili, TikTok, Instagram, Twitter/X, Facebook, and Vim
An MCP server that provides text extraction capabilities from various video platforms and audio files using OpenAI's Whisper for high-quality speech recognition. Built by Seazhang, it supports downloading and transcribing content from YouTube, Bilibili, TikTok, Instagram, Twitter/X, Facebook, Vimeo, and other platforms supported by yt-dlp, offering four main tools: video download, audio extraction, video-to-text transcription, and audio file transcription. The server handles multi-language recognition, supports various audio formats, and includes configurable Whisper model sizes for balancing speed versus accuracy, making it valuable for content analysis, accessibility improvements, meeting transcription, and extracting insights from video content across diverse platforms.
Source
Repository: https://github.com/sealingp/mcp-video-extraction
Maintain Video & Audio Text Extraction?
Let people know it's listed here — add the badge (live metrics, light/dark aware) or a plain link to your README or docs.
[Video & Audio Text Extraction on getagentictools](https://getagentictools.com/mcp/sealingp-mcp-video-extraction?ref=badge)