{"data":{"node":{"slug":"data-prep-kit-data-prep-kit","name":"data-prep-kit","tagline":"Open source project for data preparation for GenAI applications","github_url":"https://github.com/data-prep-kit/data-prep-kit","owner":"data-prep-kit","repo":"data-prep-kit","owner_avatar_url":"https://avatars.githubusercontent.com/u/202559084?v=4","primary_language":"HTML","stars":952,"forks":253,"topics":["code-quality","data","data-prep","data-preparation","data-preprocessing","data-preprocessing-pipelines","datacuration","datarecipes","deduplication","finetuning","large-language-models","large-scale-data-processing","llm","llmapps","malware","python","ray","spark"],"archived":false,"github_pushed_at":"2026-07-14T16:29:06+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/data-prep-kit-data-prep-kit","markdown_url":"https://www.graphcanon.com/tools/data-prep-kit-data-prep-kit.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/data-prep-kit-data-prep-kit","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=data-prep-kit-data-prep-kit"},"categories":[{"slug":"model-training","name":"Model Training","url":"https://www.graphcanon.com/categories/model-training","markdown_url":"https://www.graphcanon.com/categories/model-training.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/model-training"}],"tags":[{"slug":"code-quality","name":"code-quality"},{"slug":"data-prep","name":"data-prep"},{"slug":"data-preparation","name":"data-preparation"},{"slug":"data-preprocessing-pipelines","name":"data-preprocessing-pipelines"},{"slug":"deduplication","name":"deduplication"},{"slug":"finetuning","name":"finetuning"},{"slug":"large-language-models","name":"large language models"},{"slug":"llmapps","name":"llmapps"}],"edges":[],"neighbours":[{"slug":"sinaptik-ai-pandas-ai","name":"pandas-ai","tagline":"Chat with your database or your datalake using LLMs and RAG.","github_url":"https://github.com/sinaptik-ai/pandas-ai","owner":"sinaptik-ai","repo":"pandas-ai","owner_avatar_url":"https://avatars.githubusercontent.com/u/154438448?v=4","primary_language":"Python","stars":23746,"forks":2342,"topics":["ai","csv","data","data-analysis","data-science","data-visualization","database","datalake","gpt-4","llm","pandas","sql","text-to-sql"],"archived":false,"github_pushed_at":"2025-10-28T10:02:13+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/sinaptik-ai-pandas-ai","markdown_url":"https://www.graphcanon.com/tools/sinaptik-ai-pandas-ai.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/sinaptik-ai-pandas-ai","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=sinaptik-ai-pandas-ai","shared_categories":[]},{"slug":"huggingface-datasets","name":"datasets","tagline":"Largest hub of ready-to-use datasets for AI models","github_url":"https://github.com/huggingface/datasets","owner":"huggingface","repo":"datasets","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"Python","stars":21791,"forks":3322,"topics":["ai","artificial-intelligence","computer-vision","dataset-hub","datasets","deep-learning","huggingface","llm","machine-learning","natural-language-processing","nlp","numpy","pandas","pytorch","speech","tensorflow"],"archived":false,"github_pushed_at":"2026-07-30T11:23:49+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/huggingface-datasets","markdown_url":"https://www.graphcanon.com/tools/huggingface-datasets.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-datasets","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-datasets","shared_categories":[]},{"slug":"datajuicer-data-juicer","name":"data-juicer","tagline":"Data processing for and with foundation models","github_url":"https://github.com/datajuicer/data-juicer","owner":"datajuicer","repo":"data-juicer","owner_avatar_url":"https://avatars.githubusercontent.com/u/223222708?v=4","primary_language":"Python","stars":6897,"forks":404,"topics":["data","data-analysis","data-pipeline","data-processing","data-science","data-visualization","foundation-models","instruction-tuning","large-language-models","llm","llms","multi-modal","pre-training","synthetic-data"],"archived":false,"github_pushed_at":"2026-08-13T09:19:31+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/datajuicer-data-juicer","markdown_url":"https://www.graphcanon.com/tools/datajuicer-data-juicer.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/datajuicer-data-juicer","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=datajuicer-data-juicer","shared_categories":["model-training"]},{"slug":"tensorchord-awesome-llmops","name":"Awesome-LLMOps","tagline":"An awesome & curated list of best LLMOps tools for developers","github_url":"https://github.com/tensorchord/Awesome-LLMOps","owner":"tensorchord","repo":"Awesome-LLMOps","owner_avatar_url":"https://avatars.githubusercontent.com/u/100543303?v=4","primary_language":"Shell","stars":5915,"forks":993,"topics":["ai-development-tools","awesome-list","llmops","mlops"],"archived":false,"github_pushed_at":"2026-05-21T09:12:50+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/tensorchord-awesome-llmops","markdown_url":"https://www.graphcanon.com/tools/tensorchord-awesome-llmops.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/tensorchord-awesome-llmops","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=tensorchord-awesome-llmops","shared_categories":["model-training"]},{"slug":"ucbepic-docetl","name":"docetl","tagline":"A system for agentic LLM-powered data processing and ETL","github_url":"https://github.com/ucbepic/docetl","owner":"ucbepic","repo":"docetl","owner_avatar_url":"https://avatars.githubusercontent.com/u/88680502?v=4","primary_language":"Python","stars":3961,"forks":421,"topics":["agents","data","data-pipelines","document-analysis","document-processing","elt","etl","llm","python","semantic-data","unstructured-data","unstructured-data-analysis","workflow"],"archived":false,"github_pushed_at":"2026-08-09T23:31:04+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/ucbepic-docetl","markdown_url":"https://www.graphcanon.com/tools/ucbepic-docetl.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/ucbepic-docetl","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=ucbepic-docetl","shared_categories":[]},{"slug":"zjh-819-llmdatahub","name":"LLMDataHub","tagline":"Curated Collection of Datasets for LLM Training","github_url":"https://github.com/Zjh-819/LLMDataHub","owner":"Zjh-819","repo":"LLMDataHub","owner_avatar_url":"https://avatars.githubusercontent.com/u/75557474?v=4","primary_language":null,"stars":3413,"forks":234,"topics":["chatbot","chatgpt","dataset","llm"],"archived":false,"github_pushed_at":"2023-11-28T09:41:28+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/zjh-819-llmdatahub","markdown_url":"https://www.graphcanon.com/tools/zjh-819-llmdatahub.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/zjh-819-llmdatahub","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=zjh-819-llmdatahub","shared_categories":["model-training"]},{"slug":"huggingface-datatrove","name":"datatrove","tagline":"Platform-agnostic customizable pipeline processing blocks for data processing and transformation.","github_url":"https://github.com/huggingface/datatrove","owner":"huggingface","repo":"datatrove","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"Python","stars":3250,"forks":288,"topics":[],"archived":false,"github_pushed_at":"2026-08-06T15:27:26+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/huggingface-datatrove","markdown_url":"https://www.graphcanon.com/tools/huggingface-datatrove.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-datatrove","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-datatrove","shared_categories":["model-training"]},{"slug":"genieincodebottle-generative-ai","name":"generative-ai","tagline":"Comprehensive resources on Generative AI including roadmaps, projects, and interview preparation","github_url":"https://github.com/genieincodebottle/generative-ai","owner":"genieincodebottle","repo":"generative-ai","owner_avatar_url":"https://avatars.githubusercontent.com/u/155415029?v=4","primary_language":"Jupyter Notebook","stars":2609,"forks":631,"topics":["agentic-ai","agentic-framework","claude","gemini","genai","genai-usecase","generative-ai","interview-questions","langchain","langgraph","large-language-model","llm-agent","llm-evaluation","mcp","model-context-protocol","multimodal","n8n","n8n-workflow","openai-api","retrieval-augmented-generation"],"archived":false,"github_pushed_at":"2026-08-24T06:24:56+00:00","maintenance_label":"Very active","url":"https://www.graphcanon.com/tools/genieincodebottle-generative-ai","markdown_url":"https://www.graphcanon.com/tools/genieincodebottle-generative-ai.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/genieincodebottle-generative-ai","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=genieincodebottle-generative-ai","shared_categories":[]},{"slug":"nvidia-nemo-curator","name":"Curator","tagline":"Scalable data pre-processing and curation toolkit for LLMs","github_url":"https://github.com/NVIDIA-NeMo/Curator","owner":"NVIDIA-NeMo","repo":"Curator","owner_avatar_url":"https://avatars.githubusercontent.com/u/213689629?v=4","primary_language":"Python","stars":1731,"forks":320,"topics":["data","data-curation","data-prep","data-preparation","data-processing","data-processing-pipelines","data-quality","datacuration","datarecipes","deduplication","fast-data-processing","fine-tuning","large-language-models","large-scale-data-processing","llm","llm-data-quality","llmapps","python","semantic-deduplication"],"archived":false,"github_pushed_at":"2026-08-21T20:19:34+00:00","maintenance_label":"Very active","url":"https://www.graphcanon.com/tools/nvidia-nemo-curator","markdown_url":"https://www.graphcanon.com/tools/nvidia-nemo-curator.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/nvidia-nemo-curator","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=nvidia-nemo-curator","shared_categories":["model-training"]},{"slug":"deepsense-ai-ragbits","name":"ragbits","tagline":"Building blocks for rapid development of GenAI applications","github_url":"https://github.com/deepsense-ai/ragbits","owner":"deepsense-ai","repo":"ragbits","owner_avatar_url":"https://avatars.githubusercontent.com/u/14294751?v=4","primary_language":"Python","stars":1668,"forks":143,"topics":["agents","document-search","evaluation","guardrails","llms","optimization","prompts","rag","vector-stores"],"archived":false,"github_pushed_at":"2026-05-18T07:51:25+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/deepsense-ai-ragbits","markdown_url":"https://www.graphcanon.com/tools/deepsense-ai-ragbits.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/deepsense-ai-ragbits","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=deepsense-ai-ragbits","shared_categories":[]},{"slug":"benman1-generative-ai-with-langchain","name":"generative_ai_with_langchain","tagline":"Build production-ready LLM applications and advanced agents using Python, LangChain, and LangGraph","github_url":"https://github.com/benman1/generative_ai_with_langchain","owner":"benman1","repo":"generative_ai_with_langchain","owner_avatar_url":"https://avatars.githubusercontent.com/u/10786684?v=4","primary_language":"Jupyter Notebook","stars":1400,"forks":582,"topics":["agent","chatgpt","claude","claude-3-5-sonnet","deepseek","deepseek-r1","gpt","gpt-4o","huggingface","langchain","langgraph","llamacpp","llms","ollama","openai"],"archived":false,"github_pushed_at":"2026-08-05T12:50:30+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/benman1-generative-ai-with-langchain","markdown_url":"https://www.graphcanon.com/tools/benman1-generative-ai-with-langchain.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/benman1-generative-ai-with-langchain","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=benman1-generative-ai-with-langchain","shared_categories":[]},{"slug":"datadreamer-dev-datadreamer","name":"DataDreamer","tagline":"Prompt. Generate Synthetic Data. Train & Align Models.","github_url":"https://github.com/datadreamer-dev/DataDreamer","owner":"datadreamer-dev","repo":"DataDreamer","owner_avatar_url":"https://avatars.githubusercontent.com/u/154913957?v=4","primary_language":"Python","stars":1117,"forks":58,"topics":["alignment","deep-learning","fine-tuning","gpt","instruction-tuning","llm","llmops","llms","machine-learning","natural-language-processing","nlp","nlp-library","openai","python","pytorch","synthetic-data","synthetic-dataset-generation","transformers"],"archived":false,"github_pushed_at":"2025-02-02T21:23:50+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/datadreamer-dev-datadreamer","markdown_url":"https://www.graphcanon.com/tools/datadreamer-dev-datadreamer.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/datadreamer-dev-datadreamer","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=datadreamer-dev-datadreamer","shared_categories":["model-training"]}]}}