{"data":{"node":{"slug":"huggingface-speech-to-speech","name":"speech-to-speech","tagline":"Build local voice agents with open-source models","github_url":"https://github.com/huggingface/speech-to-speech","owner":"huggingface","repo":"speech-to-speech","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"Python","stars":8219,"forks":1025,"topics":["ai","assistant","language-model","machine-learning","python","speech","speech-synthesis","speech-to-text","speech-translation"],"archived":false,"github_pushed_at":"2026-07-30T11:35:50+00:00","maintenance_label":"Very active","url":"https://www.graphcanon.com/tools/huggingface-speech-to-speech","markdown_url":"https://www.graphcanon.com/tools/huggingface-speech-to-speech.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-speech-to-speech","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-speech-to-speech"},"categories":[{"slug":"speech-audio","name":"Speech & Audio","url":"https://www.graphcanon.com/categories/speech-audio","markdown_url":"https://www.graphcanon.com/categories/speech-audio.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/speech-audio"}],"tags":[{"slug":"ai","name":"ai"},{"slug":"assistant","name":"assistant"},{"slug":"language-model","name":"language-model"},{"slug":"machine-learning","name":"machine-learning"},{"slug":"python","name":"python"},{"slug":"speech","name":"speech"},{"slug":"speech-synthesis","name":"speech-synthesis"},{"slug":"speech-to-text","name":"speech-to-text"}],"edges":[],"neighbours":[{"slug":"nari-labs-dia","name":"dia","tagline":"A TTS model for generating ultra-realistic dialogue","github_url":"https://github.com/nari-labs/dia","owner":"nari-labs","repo":"dia","owner_avatar_url":"https://avatars.githubusercontent.com/u/208232306?v=4","primary_language":"Python","stars":19361,"forks":1688,"topics":["ai","open-weight","text-to-speech"],"archived":false,"github_pushed_at":"2025-11-19T21:11:55+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/nari-labs-dia","markdown_url":"https://www.graphcanon.com/tools/nari-labs-dia.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/nari-labs-dia","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=nari-labs-dia","shared_categories":["speech-audio"]},{"slug":"emcie-co-parlant","name":"parlant","tagline":"Build reliable customer-facing AI agents with Parlant: an interaction control harness optimized for controlled, consistent, and predictable LLM interactions.","github_url":"https://github.com/emcie-co/parlant","owner":"emcie-co","repo":"parlant","owner_avatar_url":"https://avatars.githubusercontent.com/u/160175171?v=4","primary_language":"Python","stars":18253,"forks":1551,"topics":["ai-agents","ai-alignment","customer-service","customer-success","gemini","genai","hacktoberfest","llama3","llm","openai","python"],"archived":false,"github_pushed_at":"2026-07-12T19:40:55+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/emcie-co-parlant","markdown_url":"https://www.graphcanon.com/tools/emcie-co-parlant.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/emcie-co-parlant","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=emcie-co-parlant","shared_categories":[]},{"slug":"alphacep-vosk-api","name":"vosk-api","tagline":"Offline speech recognition API","github_url":"https://github.com/alphacep/vosk-api","owner":"alphacep","repo":"vosk-api","owner_avatar_url":"https://avatars.githubusercontent.com/u/26358566?v=4","primary_language":"Jupyter Notebook","stars":15013,"forks":1740,"topics":["android","asr","deep-learning","deep-neural-networks","deepspeech","google-speech-to-text","ios","kaldi","offline","privacy","python","raspberry-pi","speaker-identification","speaker-verification","speech-recognition","speech-to-text","speech-to-text-android","stt","voice-recognition","vosk"],"archived":false,"github_pushed_at":"2026-07-02T20:03:34+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/alphacep-vosk-api","markdown_url":"https://www.graphcanon.com/tools/alphacep-vosk-api.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/alphacep-vosk-api","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=alphacep-vosk-api","shared_categories":["speech-audio"]},{"slug":"open-llm-vtuber-open-llm-vtuber","name":"Open-LLM-VTuber","tagline":"Voice interaction with LLMs and Live2D visuals","github_url":"https://github.com/Open-LLM-VTuber/Open-LLM-VTuber","owner":"Open-LLM-VTuber","repo":"Open-LLM-VTuber","owner_avatar_url":"https://avatars.githubusercontent.com/u/193920693?v=4","primary_language":"Python","stars":13224,"forks":1563,"topics":["ai","ai-companion","ai-vtuber","ai-waifu","chatbots","live2d","live2d-web","llm","neuro-sama","ollama"],"archived":false,"github_pushed_at":"2026-05-15T07:18:04+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/open-llm-vtuber-open-llm-vtuber","markdown_url":"https://www.graphcanon.com/tools/open-llm-vtuber-open-llm-vtuber.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/open-llm-vtuber-open-llm-vtuber","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=open-llm-vtuber-open-llm-vtuber","shared_categories":["speech-audio"]},{"slug":"abus-aikorea-voice-pro","name":"voice-pro","tagline":"Gradio WebUI for TTS and voice cloning with audio processing capabilities","github_url":"https://github.com/abus-aikorea/voice-pro","owner":"abus-aikorea","repo":"voice-pro","owner_avatar_url":"https://avatars.githubusercontent.com/u/161691694?v=4","primary_language":"Python","stars":11348,"forks":1663,"topics":["audiobook","faster-whisper","gradio","karaoke","podcasts","speech-recognition","speech-synthesis","speech-to-text","subtitles","text-to-speech","transcription","translator","tts","voice-cloning","voice-conversion","webui","whisper","whisperx","yt-dlp"],"archived":false,"github_pushed_at":"2026-07-13T01:28:10+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/abus-aikorea-voice-pro","markdown_url":"https://www.graphcanon.com/tools/abus-aikorea-voice-pro.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/abus-aikorea-voice-pro","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=abus-aikorea-voice-pro","shared_categories":["speech-audio"]},{"slug":"aigc-audio-audiogpt","name":"AudioGPT","tagline":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","github_url":"https://github.com/AIGC-Audio/AudioGPT","owner":"AIGC-Audio","repo":"AudioGPT","owner_avatar_url":"https://avatars.githubusercontent.com/u/128504843?v=4","primary_language":"Python","stars":10172,"forks":850,"topics":["audio","gpt","music","sound","speech","talking-head"],"archived":false,"github_pushed_at":"2024-07-06T21:35:18+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/aigc-audio-audiogpt","markdown_url":"https://www.graphcanon.com/tools/aigc-audio-audiogpt.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/aigc-audio-audiogpt","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=aigc-audio-audiogpt","shared_categories":["speech-audio"]},{"slug":"debpalash-omnivoice-studio","name":"OmniVoice-Studio","tagline":"The open-source ElevenLabs alternative for local voice cloning and related tasks","github_url":"https://github.com/debpalash/OmniVoice-Studio","owner":"debpalash","repo":"OmniVoice-Studio","owner_avatar_url":"https://avatars.githubusercontent.com/u/4178343?v=4","primary_language":"Python","stars":9209,"forks":1494,"topics":["asr","audiobook","dubbing","dubbing-ai","elevenlabs","local-ai","omnivoice","omnivoice-studio","self-hosted","speech-recognition","speech-to-text","text-to-speech","transcription","tts","video-editing","voice-ai","voice-cloning","voice-generation"],"archived":false,"github_pushed_at":"2026-07-28T19:51:31+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/debpalash-omnivoice-studio","markdown_url":"https://www.graphcanon.com/tools/debpalash-omnivoice-studio.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/debpalash-omnivoice-studio","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=debpalash-omnivoice-studio","shared_categories":["speech-audio"]},{"slug":"snakers4-silero-models","name":"silero-models","tagline":"Silero Models provide simple access to pre-trained text-to-speech models","github_url":"https://github.com/snakers4/silero-models","owner":"snakers4","repo":"silero-models","owner_avatar_url":"https://avatars.githubusercontent.com/u/12515440?v=4","primary_language":"Jupyter Notebook","stars":6030,"forks":369,"topics":["armenian","azerbaijani","belarus","colab","georgian","kazakh","kyrgyz","pretrained-models","pytorch","russian","speech","speech-synthesis","speech-to-text","tajik","text-to-speech","torch-hub","tts","tts-models","ukrainian","uzbek"],"archived":false,"github_pushed_at":"2026-06-04T05:33:28+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/snakers4-silero-models","markdown_url":"https://www.graphcanon.com/tools/snakers4-silero-models.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/snakers4-silero-models","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=snakers4-silero-models","shared_categories":["speech-audio"]},{"slug":"metavoiceio-metavoice-src","name":"metavoice-src","tagline":"Foundational model for human-like, expressive TTS","github_url":"https://github.com/metavoiceio/metavoice-src","owner":"metavoiceio","repo":"metavoice-src","owner_avatar_url":"https://avatars.githubusercontent.com/u/107063843?v=4","primary_language":"Python","stars":4203,"forks":693,"topics":["ai","deep-learning","pytorch","speech","speech-synthesis","text-to-speech","tts","voice-clone","zero-shot-tts"],"archived":false,"github_pushed_at":"2024-07-30T22:13:01+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/metavoiceio-metavoice-src","markdown_url":"https://www.graphcanon.com/tools/metavoiceio-metavoice-src.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/metavoiceio-metavoice-src","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=metavoiceio-metavoice-src","shared_categories":["speech-audio"]},{"slug":"rsxdalv-tts-webui","name":"TTS-WebUI","tagline":"A comprehensive WebUI for multiple TTS systems","github_url":"https://github.com/rsxdalv/TTS-WebUI","owner":"rsxdalv","repo":"TTS-WebUI","owner_avatar_url":"https://avatars.githubusercontent.com/u/6757283?v=4","primary_language":"TypeScript","stars":3216,"forks":326,"topics":["ace-step","ai","audio-generation","cosyvoice","generative-ai","generator","gradio","music","musicgen","openai-api","openvoice","rvc","styletts2","text-to-speech","tortoise-tts","tts","vocos"],"archived":false,"github_pushed_at":"2026-07-27T13:23:40+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/rsxdalv-tts-webui","markdown_url":"https://www.graphcanon.com/tools/rsxdalv-tts-webui.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/rsxdalv-tts-webui","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=rsxdalv-tts-webui","shared_categories":["speech-audio"]},{"slug":"fluidinference-fluidaudio","name":"FluidAudio","tagline":"CoreML audio models for text-to-speech, speech-to-text, voice activity detection and speaker diarization in Swift.","github_url":"https://github.com/FluidInference/FluidAudio","owner":"FluidInference","repo":"FluidAudio","owner_avatar_url":"https://avatars.githubusercontent.com/u/216957621?v=4","primary_language":"Swift","stars":2554,"forks":360,"topics":["ane","asr","audio","automatic-speech-recognition","avfoundation","coreml","ios","macos","nvidia","parakeet","real-time","speaker-diarization","speaker-embedding","speaker-identification","speaker-recognition","speech-to-text","swift","vad","voice-activity-detection"],"archived":false,"github_pushed_at":"2026-07-26T00:49:55+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/fluidinference-fluidaudio","markdown_url":"https://www.graphcanon.com/tools/fluidinference-fluidaudio.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/fluidinference-fluidaudio","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=fluidinference-fluidaudio","shared_categories":["speech-audio"]},{"slug":"travisvn-openai-edge-tts","name":"openai-edge-tts","tagline":"Free text-to-speech API for edge computing","github_url":"https://github.com/travisvn/openai-edge-tts","owner":"travisvn","repo":"openai-edge-tts","owner_avatar_url":"https://avatars.githubusercontent.com/u/2686415?v=4","primary_language":"Python","stars":2007,"forks":304,"topics":["ai","azure","chatgpt","claude","edge-tts","elevenlabs","gpt","llm","llm-webui","llms","local-llm","ollama","ollama-webui","open-webui","openai","self-hosted","speech","text-to-speech","tts"],"archived":false,"github_pushed_at":"2025-07-01T23:56:27+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/travisvn-openai-edge-tts","markdown_url":"https://www.graphcanon.com/tools/travisvn-openai-edge-tts.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/travisvn-openai-edge-tts","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=travisvn-openai-edge-tts","shared_categories":["speech-audio"]}]}}