{"data":{"slug":"abus-aikorea-voice-pro","name":"voice-pro","tagline":"Gradio WebUI for TTS and voice cloning with audio processing capabilities","github_url":"https://github.com/abus-aikorea/voice-pro","owner":"abus-aikorea","repo":"voice-pro","owner_avatar_url":"https://avatars.githubusercontent.com/u/161691694?v=4","primary_language":"Python","stars":11348,"forks":1663,"topics":["audiobook","faster-whisper","gradio","karaoke","podcasts","speech-recognition","speech-synthesis","speech-to-text","subtitles","text-to-speech","transcription","translator","tts","voice-cloning","voice-conversion","webui","whisper","whisperx","yt-dlp"],"archived":false,"github_pushed_at":"2026-07-13T01:28:10+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/abus-aikorea-voice-pro","markdown_url":"https://www.graphcanon.com/tools/abus-aikorea-voice-pro.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/abus-aikorea-voice-pro","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=abus-aikorea-voice-pro","description":"Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audio processing, YouTube download, Demucs vocal isolation, and multilingual translation.","homepage_url":"https://www.wctokyoseoul.com","license":"GPL-3.0","open_issues":56,"watchers":69,"ai_summary":"This repository hosts Voice-Pro, a Gradio web interface that consolidates multiple text-to-speech (TTS) engines, zero-shot voice cloning models, and advanced audio processing tools like Whisper for speech recognition, YouTube content downloading via yt-dlp, and Demucs for vocal isolation. It supports functionalities such as audiobook creation, podcast editing, multilingual translation, and transcription.","readme_excerpt":"## 💻 System Requirements\n- **OS:** Windows 10/11 (64-bit), Linux, Mac (Apple Silicon)\n- **GPU:** NVIDIA GPU with a recent driver (>= 570 recommended; RTX 50-series supported). CUDA Toolkit installation is NOT required.\n- **VRAM:** 4GB+ (8GB+ preferred)\n- **RAM:** 4GB+\n- **Storage:** 20GB+ free space\n- **Internet:** Required\n\n---\n\n## 📀 Installation\n\nInstall Voice-Pro with ease using **configure.bat** and **start.bat** (use configure.sh and start.sh on Mac/Linux).\n\n---\n\n### 2. Install & Run\n1. 🚀 **configure.bat** (optional)\n   - Sets up git and ffmpeg system-wide (CUDA Toolkit / Visual Studio are no longer needed)\n   - Requires administrator rights; run once\n   - No admin rights? Skip it — **start.bat** downloads a portable ffmpeg automatically\n2. 🚀 **start.bat**\n   - Launches Voice-Pro WebUI\n   - First run downloads uv + Python 3.12 and installs all dependencies from the lockfile (minutes, not hours), then downloads AI models (~10GB — this is the slow part)\n   - GPU/CPU is auto-detected; override with the `GPU_CHOICE` environment variable (`G`=NVIDIA, `C`=CPU) or by deleting `installer_files\\gpu_choice.txt`\n   - Retry after deleting **installer_files** if issues arise\n\n---\n\n### Cost Calculation Details\n- **[Maestra](https://maestra.ai/)**: Premium Plan ($158/month, 1200 credits). 60-min video: 60 credits (subtitles) + 60 credits (translation) + 60 credits (dubbing) = 180 credits. Cost = (180/1200) * $158 = $23.70.[](https://maestra.ai/pricing)\n- **[Kapwing](https://www.kapwing.com)**: Pro plan (\\~$24/month, limited minutes). Estimated $0.50\\~$0.67/min for subtitles+translation+dubbing (based on per-minute pricing trends). 60-min cost: $30\\~$40. Exact pricing requires confirmation.\n- **[VEED.IO](https://www.veed.io)**: Pro plan (\\~$24/month). Subtitles+translation estimated at $0.40\\~$0.60/min. No TTS, so partial processing. 60-min cost: $24\\~$36. Confirm at [veed.io](https://veed.io).\n- **[HappyScribe](https://happyscribe.com)**: Pay-as-you-go (\\~$0.20/min transcription, $0.20/min translation, $0.20/min dubbing). 60-min cost: $36\\~$48 (assuming combined services). Confirm at [happyscribe.com](https://happyscribe.com).\n- **[Sonix](https://sonix.ai)**: Standard plan (\\~$10/hour transcription, additional for translation/dubbing). Estimated $0.50\\~$0.67/min total. 60-min cost: $30\\~$40. Confirm at [sonix.ai](https://sonix.ai).\n- **[Descript](https://descript.com)**: Creator plan (\\~$24/month, limited hours). Estimated $0.60\\~$0.80/min for subtitles+translation+dubbing. 60-min cost: $36\\~$48. Confirm at [descript.com](https://descript.com).\n- **[AppTek](https://apptek.ai)**: Custom pricing for enterprise. No public per-minute rates. Contact [apptek.ai](https://apptek.ai) for quotes.\n- **[Transkriptor](https://transkriptor.com)**: Pay-as-you-go ($0.05\\~$0.10/min transcription, similar for translation). No TTS, so partial processing. 60-min cost: $12\\~$18. Confirm at [transkriptor.com](https://transkriptor.com).","github_created_at":"2024-07-29T10:02:31+00:00","created_at":"2026-07-11T12:04:58.807856+00:00","updated_at":"2026-07-29T06:00:36.394942+00:00","categories":[{"slug":"speech-audio","name":"Speech & Audio","url":"https://www.graphcanon.com/categories/speech-audio","markdown_url":"https://www.graphcanon.com/categories/speech-audio.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/speech-audio"}],"tags":[{"slug":"audiobook","name":"audiobook"},{"slug":"faster-whisper","name":"faster-whisper"},{"slug":"gradio","name":"gradio"},{"slug":"karaoke","name":"karaoke"},{"slug":"podcasts","name":"podcasts"},{"slug":"speech-recognition","name":"speech-recognition"},{"slug":"speech-synthesis","name":"speech-synthesis"},{"slug":"speech-to-text","name":"speech-to-text"}],"trust":{"provenance":{"is_fork":false,"github_id":835174033,"owner_type":"User","methodology":"github_public_v1","parent_repo":null,"near_duplicate_slugs":[]},"computed_at":"2026-07-29T06:00:35.701Z","maintenance":{"label":"Active","score":82,"methodology":"github_public_v1","releases_90d":1,"days_since_push":16,"last_release_at":"2026-07-13T00:18:37Z"},"security_summary":{"status":"no_lockfile","scanner":null,"low_count":0,"high_count":0,"last_scan_at":"2026-07-11T12:05:07.515Z","medium_count":0,"scan_profile":"none","critical_count":0}},"capability_facts":{"scan":{"source":"repo_scan","observed_at":"2026-07-29T06:00:36.113Z"},"languages":{"value":["python"],"source":"github.language+pyproject.toml","observed_at":"2026-07-29T06:00:36.113Z"},"license_spdx":{"value":"GPL-3.0","source":"github.license","observed_at":"2026-07-29T06:00:36.113Z"}},"decision_facts":{"hosting":null,"pricing":null,"requirements":null,"constraints":null,"when_to_use":["For multilingual audiobook creation with integrated translation capabilities","When robust podcast editing requiring speech-to-text transcription is essential"],"when_not_to_use":["For users prioritizing a fully offline experience due to the need for internet access during model download and use","If only basic speech synthesis without advanced voice cloning or audio processing is required, as Voice-Pro supports more complex workflows"],"source":"enrich:decision_facts","observed_at":"2026-07-17T10:18:54.445Z"},"constraint_facets":null,"decision_summary":[{"label":"Adopt for","value":"Voice-Pro utilizes Gradio WebUI to offer TTS engines, zero-shot voice cloning, audio processing tools, with YouTube downloading and vocal isolation features."}]}}