{"data":{"node":{"slug":"kan-bayashi-parallelwavegan","name":"ParallelWaveGAN","tagline":"Unofficial Parallel WaveGAN (+ MelGAN & Multi-band MelGAN & HiFi-GAN & StyleMelGAN) with Pytorch","github_url":"https://github.com/kan-bayashi/ParallelWaveGAN","owner":"kan-bayashi","repo":"ParallelWaveGAN","owner_avatar_url":"https://avatars.githubusercontent.com/u/22779813?v=4","primary_language":"Jupyter Notebook","stars":1646,"forks":352,"topics":["hifigan","melgan","neural-vocoder","parallel-wavenet","pytorch","realtime","speech-synthesis","style-melgan","text-to-speech","tts","vocoder","wavenet"],"archived":false,"github_pushed_at":"2024-04-22T02:36:29+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/kan-bayashi-parallelwavegan","markdown_url":"https://www.graphcanon.com/tools/kan-bayashi-parallelwavegan.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/kan-bayashi-parallelwavegan","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=kan-bayashi-parallelwavegan"},"categories":[{"slug":"inference-serving","name":"Inference & Serving","url":"https://www.graphcanon.com/categories/inference-serving","markdown_url":"https://www.graphcanon.com/categories/inference-serving.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/inference-serving"},{"slug":"speech-audio","name":"Speech & Audio","url":"https://www.graphcanon.com/categories/speech-audio","markdown_url":"https://www.graphcanon.com/categories/speech-audio.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/speech-audio"}],"tags":[{"slug":"hifigan","name":"hifigan"},{"slug":"melgan","name":"melgan"},{"slug":"neural-vocoder","name":"neural-vocoder"},{"slug":"parallel-wavenet","name":"parallel-wavenet"},{"slug":"pytorch","name":"pytorch"},{"slug":"realtime","name":"realtime"},{"slug":"speech-synthesis","name":"speech-synthesis"},{"slug":"style-melgan","name":"style-melgan"}],"edges":[],"neighbours":[{"slug":"rvc-boss-gpt-sovits","name":"GPT-SoVITS","tagline":"Voice Cloning and Text-to-Speech with Minimal Voice Data","github_url":"https://github.com/RVC-Boss/GPT-SoVITS","owner":"RVC-Boss","repo":"GPT-SoVITS","owner_avatar_url":"https://avatars.githubusercontent.com/u/129054828?v=4","primary_language":"Python","stars":60178,"forks":6553,"topics":["text-to-speech","tts","vits","voice-clone","voice-cloneai","voice-cloning"],"archived":false,"github_pushed_at":"2026-07-22T08:21:07+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/rvc-boss-gpt-sovits","markdown_url":"https://www.graphcanon.com/tools/rvc-boss-gpt-sovits.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/rvc-boss-gpt-sovits","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=rvc-boss-gpt-sovits","shared_categories":["speech-audio"]},{"slug":"speechbrain-speechbrain","name":"speechbrain","tagline":"A PyTorch-based Speech Toolkit","github_url":"https://github.com/speechbrain/speechbrain","owner":"speechbrain","repo":"speechbrain","owner_avatar_url":"https://avatars.githubusercontent.com/u/54749030?v=4","primary_language":"Python","stars":11725,"forks":1712,"topics":["asr","audio","audio-processing","deep-learning","huggingface","language-model","pytorch","speaker-diarization","speaker-recognition","speaker-verification","speech-enhancement","speech-processing","speech-recognition","speech-separation","speech-to-text","speech-toolkit","speechrecognition","spoken-language-understanding","transformers","voice-recognition"],"archived":false,"github_pushed_at":"2026-06-15T11:24:25+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/speechbrain-speechbrain","markdown_url":"https://www.graphcanon.com/tools/speechbrain-speechbrain.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/speechbrain-speechbrain","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=speechbrain-speechbrain","shared_categories":["speech-audio"]},{"slug":"abus-aikorea-voice-pro","name":"voice-pro","tagline":"Gradio WebUI for TTS and voice cloning with audio processing capabilities","github_url":"https://github.com/abus-aikorea/voice-pro","owner":"abus-aikorea","repo":"voice-pro","owner_avatar_url":"https://avatars.githubusercontent.com/u/161691694?v=4","primary_language":"Python","stars":11348,"forks":1663,"topics":["audiobook","faster-whisper","gradio","karaoke","podcasts","speech-recognition","speech-synthesis","speech-to-text","subtitles","text-to-speech","transcription","translator","tts","voice-cloning","voice-conversion","webui","whisper","whisperx","yt-dlp"],"archived":false,"github_pushed_at":"2026-07-13T01:28:10+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/abus-aikorea-voice-pro","markdown_url":"https://www.graphcanon.com/tools/abus-aikorea-voice-pro.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/abus-aikorea-voice-pro","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=abus-aikorea-voice-pro","shared_categories":["speech-audio"]},{"slug":"aigc-audio-audiogpt","name":"AudioGPT","tagline":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","github_url":"https://github.com/AIGC-Audio/AudioGPT","owner":"AIGC-Audio","repo":"AudioGPT","owner_avatar_url":"https://avatars.githubusercontent.com/u/128504843?v=4","primary_language":"Python","stars":10172,"forks":850,"topics":["audio","gpt","music","sound","speech","talking-head"],"archived":false,"github_pushed_at":"2024-07-06T21:35:18+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/aigc-audio-audiogpt","markdown_url":"https://www.graphcanon.com/tools/aigc-audio-audiogpt.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/aigc-audio-audiogpt","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=aigc-audio-audiogpt","shared_categories":["speech-audio"]},{"slug":"jaywalnut310-vits","name":"vits","tagline":"VITS: Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","github_url":"https://github.com/jaywalnut310/vits","owner":"jaywalnut310","repo":"vits","owner_avatar_url":"https://avatars.githubusercontent.com/u/20279210?v=4","primary_language":"Python","stars":7889,"forks":1384,"topics":["deep-learning","pytorch","speech-synthesis","text-to-speech","tts"],"archived":false,"github_pushed_at":"2023-12-06T01:29:50+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/jaywalnut310-vits","markdown_url":"https://www.graphcanon.com/tools/jaywalnut310-vits.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/jaywalnut310-vits","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=jaywalnut310-vits","shared_categories":["speech-audio"]},{"slug":"yl4579-styletts2","name":"StyleTTS2","tagline":"StyleTTS 2 advances human-like text-to-speech using style diffusion and adversarial training.","github_url":"https://github.com/yl4579/StyleTTS2","owner":"yl4579","repo":"StyleTTS2","owner_avatar_url":"https://avatars.githubusercontent.com/u/71044569?v=4","primary_language":"Python","stars":6322,"forks":694,"topics":["adversarial-training","deep-learning","diffusion-models","gan","latent-diffusion","latent-diffusion-models","pytorch","speaker-adaptation","speech-synthesis","text-to-speech","tts","wavlm"],"archived":false,"github_pushed_at":"2024-08-10T00:48:18+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/yl4579-styletts2","markdown_url":"https://www.graphcanon.com/tools/yl4579-styletts2.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/yl4579-styletts2","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=yl4579-styletts2","shared_categories":["speech-audio"]},{"slug":"snakers4-silero-models","name":"silero-models","tagline":"Silero Models provide simple access to pre-trained text-to-speech models","github_url":"https://github.com/snakers4/silero-models","owner":"snakers4","repo":"silero-models","owner_avatar_url":"https://avatars.githubusercontent.com/u/12515440?v=4","primary_language":"Jupyter Notebook","stars":6030,"forks":369,"topics":["armenian","azerbaijani","belarus","colab","georgian","kazakh","kyrgyz","pretrained-models","pytorch","russian","speech","speech-synthesis","speech-to-text","tajik","text-to-speech","torch-hub","tts","tts-models","ukrainian","uzbek"],"archived":false,"github_pushed_at":"2026-06-04T05:33:28+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/snakers4-silero-models","markdown_url":"https://www.graphcanon.com/tools/snakers4-silero-models.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/snakers4-silero-models","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=snakers4-silero-models","shared_categories":["speech-audio"]},{"slug":"moonintheriver-diffsinger","name":"DiffSinger","tagline":"Singing Voice Synthesis via Shallow Diffusion Mechanism","github_url":"https://github.com/MoonInTheRiver/DiffSinger","owner":"MoonInTheRiver","repo":"DiffSinger","owner_avatar_url":"https://avatars.githubusercontent.com/u/32165188?v=4","primary_language":"Python","stars":4834,"forks":826,"topics":["aaai2022","diffusion-model","diffusion-speedup","midi","singing-synthesis","singing-voice","singing-voice-database","singing-voice-synthesis","speech-synthesis","text-to-speech","tts"],"archived":false,"github_pushed_at":"2026-07-24T07:22:44+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/moonintheriver-diffsinger","markdown_url":"https://www.graphcanon.com/tools/moonintheriver-diffsinger.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/moonintheriver-diffsinger","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=moonintheriver-diffsinger","shared_categories":["speech-audio"]},{"slug":"sanchit-gandhi-whisper-jax","name":"whisper-jax","tagline":"JAX implementation of OpenAI's Whisper model for up to 70x speed-up on TPU.","github_url":"https://github.com/sanchit-gandhi/whisper-jax","owner":"sanchit-gandhi","repo":"whisper-jax","owner_avatar_url":"https://avatars.githubusercontent.com/u/93869735?v=4","primary_language":"Jupyter Notebook","stars":4684,"forks":411,"topics":["deep-learning","jax","speech-recognition","speech-to-text","whisper"],"archived":false,"github_pushed_at":"2024-04-03T12:12:52+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/sanchit-gandhi-whisper-jax","markdown_url":"https://www.graphcanon.com/tools/sanchit-gandhi-whisper-jax.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/sanchit-gandhi-whisper-jax","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=sanchit-gandhi-whisper-jax","shared_categories":["speech-audio","inference-serving"]},{"slug":"metavoiceio-metavoice-src","name":"metavoice-src","tagline":"Foundational model for human-like, expressive TTS","github_url":"https://github.com/metavoiceio/metavoice-src","owner":"metavoiceio","repo":"metavoice-src","owner_avatar_url":"https://avatars.githubusercontent.com/u/107063843?v=4","primary_language":"Python","stars":4203,"forks":693,"topics":["ai","deep-learning","pytorch","speech","speech-synthesis","text-to-speech","tts","voice-clone","zero-shot-tts"],"archived":false,"github_pushed_at":"2024-07-30T22:13:01+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/metavoiceio-metavoice-src","markdown_url":"https://www.graphcanon.com/tools/metavoiceio-metavoice-src.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/metavoiceio-metavoice-src","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=metavoiceio-metavoice-src","shared_categories":["speech-audio"]},{"slug":"jik876-hifi-gan","name":"hifi-gan","tagline":"Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","github_url":"https://github.com/jik876/hifi-gan","owner":"jik876","repo":"hifi-gan","owner_avatar_url":"https://avatars.githubusercontent.com/u/65878508?v=4","primary_language":"Python","stars":2363,"forks":555,"topics":["deep-learning","gan","hifi-gan","pytorch","speech-synthesis","text-to-speech","tts","vocoder"],"archived":false,"github_pushed_at":"2024-07-27T20:56:30+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/jik876-hifi-gan","markdown_url":"https://www.graphcanon.com/tools/jik876-hifi-gan.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/jik876-hifi-gan","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=jik876-hifi-gan","shared_categories":["speech-audio"]},{"slug":"lifeiteng-vall-e","name":"vall-e","tagline":"PyTorch implementation of VALL-E for Zero-Shot Text-To-Speech","github_url":"https://github.com/lifeiteng/vall-e","owner":"lifeiteng","repo":"vall-e","owner_avatar_url":"https://avatars.githubusercontent.com/u/3107839?v=4","primary_language":"Python","stars":2209,"forks":330,"topics":["chatgpt","in-context-learning","large-language-models","text-to-speech","tts","vall-e","valle"],"archived":false,"github_pushed_at":"2025-09-10T16:08:02+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/lifeiteng-vall-e","markdown_url":"https://www.graphcanon.com/tools/lifeiteng-vall-e.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/lifeiteng-vall-e","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=lifeiteng-vall-e","shared_categories":["speech-audio"]}]}}