{"data":{"node":{"slug":"nvidia-nemo-curator","name":"Curator","tagline":"Scalable data pre-processing and curation toolkit for LLMs","github_url":"https://github.com/NVIDIA-NeMo/Curator","owner":"NVIDIA-NeMo","repo":"Curator","owner_avatar_url":"https://avatars.githubusercontent.com/u/213689629?v=4","primary_language":"Python","stars":1731,"forks":320,"topics":["data","data-curation","data-prep","data-preparation","data-processing","data-processing-pipelines","data-quality","datacuration","datarecipes","deduplication","fast-data-processing","fine-tuning","large-language-models","large-scale-data-processing","llm","llm-data-quality","llmapps","python","semantic-deduplication"],"archived":false,"github_pushed_at":"2026-08-21T20:19:34+00:00","maintenance_label":"Very active","stars_delta_30d":50,"url":"https://www.graphcanon.com/tools/nvidia-nemo-curator","markdown_url":"https://www.graphcanon.com/tools/nvidia-nemo-curator.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/nvidia-nemo-curator","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=nvidia-nemo-curator"},"categories":[{"slug":"data-retrieval","name":"Data & Retrieval","url":"https://www.graphcanon.com/categories/data-retrieval","markdown_url":"https://www.graphcanon.com/categories/data-retrieval.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/data-retrieval"},{"slug":"model-training","name":"Model Training","url":"https://www.graphcanon.com/categories/model-training","markdown_url":"https://www.graphcanon.com/categories/model-training.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/model-training"}],"tags":[{"slug":"curation-toolkit","name":"curation toolkit"},{"slug":"data-pre-processing","name":"data pre-processing"},{"slug":"deduplication","name":"deduplication"},{"slug":"llms","name":"llms"},{"slug":"preparation-pipelines","name":"preparation pipelines"},{"slug":"quality-checks","name":"quality checks"},{"slug":"scalable-data-processing","name":"scalable data processing"}],"edges":[],"neighbours":[{"slug":"nirdiamant-rag-techniques","name":"RAG_Techniques","tagline":"Showcases advanced techniques for Retrieval-Augmented Generation (RAG) systems with detailed notebook tutorials.","github_url":"https://github.com/NirDiamant/RAG_Techniques","owner":"NirDiamant","repo":"RAG_Techniques","owner_avatar_url":"https://avatars.githubusercontent.com/u/28316913?v=4","primary_language":"Jupyter Notebook","stars":29076,"forks":3540,"topics":["agentic-rag","ai","embeddings","generative-ai","gpt","langchain","llama-index","llm","llms","machine-learning","nlp","openai","python","rag","retrieval-augmented-generation","semantic-search","tutorials","vector-database"],"archived":false,"github_pushed_at":"2026-08-15T00:52:05+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/nirdiamant-rag-techniques","markdown_url":"https://www.graphcanon.com/tools/nirdiamant-rag-techniques.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/nirdiamant-rag-techniques","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=nirdiamant-rag-techniques","shared_categories":["model-training","data-retrieval"]},{"slug":"shishirpatil-gorilla","name":"gorilla","tagline":"Training and Evaluating LLMs for Function Calls (Tool Calls)","github_url":"https://github.com/ShishirPatil/gorilla","owner":"ShishirPatil","repo":"gorilla","owner_avatar_url":"https://avatars.githubusercontent.com/u/30296397?v=4","primary_language":"Python","stars":12988,"forks":1397,"topics":["api","api-documentation","chatgpt","claude-api","gpt-4-api","llm","openai-api","openai-functions"],"archived":false,"github_pushed_at":"2026-04-13T03:19:45+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/shishirpatil-gorilla","markdown_url":"https://www.graphcanon.com/tools/shishirpatil-gorilla.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/shishirpatil-gorilla","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=shishirpatil-gorilla","shared_categories":["model-training"]},{"slug":"wangrongsheng-awesome-llm-resources","name":"awesome-LLM-resources","tagline":"Summary of the world's best LLM resources.","github_url":"https://github.com/WangRongsheng/awesome-LLM-resources","owner":"WangRongsheng","repo":"awesome-LLM-resources","owner_avatar_url":"https://avatars.githubusercontent.com/u/55651568?v=4","primary_language":null,"stars":8845,"forks":950,"topics":["awesome-list","book","course","large-language-models","llama","llm","mistral","openai","qwen","rag","retrieval-augmented-generation","webui"],"archived":false,"github_pushed_at":"2026-08-14T15:54:28+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/wangrongsheng-awesome-llm-resources","markdown_url":"https://www.graphcanon.com/tools/wangrongsheng-awesome-llm-resources.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/wangrongsheng-awesome-llm-resources","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=wangrongsheng-awesome-llm-resources","shared_categories":["model-training"]},{"slug":"luhengshiwo-llmforeverybody","name":"LLMForEverybody","tagline":"LLM knowledge sharing for everyone, essential reading before big model interviews","github_url":"https://github.com/luhengshiwo/LLMForEverybody","owner":"luhengshiwo","repo":"LLMForEverybody","owner_avatar_url":"https://avatars.githubusercontent.com/u/13251733?v=4","primary_language":"Jupyter Notebook","stars":7167,"forks":662,"topics":["agent","interview-practice","interview-questions","learnllm","llm","rag"],"archived":false,"github_pushed_at":"2026-08-17T02:41:01+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/luhengshiwo-llmforeverybody","markdown_url":"https://www.graphcanon.com/tools/luhengshiwo-llmforeverybody.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/luhengshiwo-llmforeverybody","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=luhengshiwo-llmforeverybody","shared_categories":["model-training"]},{"slug":"datajuicer-data-juicer","name":"data-juicer","tagline":"Data processing for and with foundation models","github_url":"https://github.com/datajuicer/data-juicer","owner":"datajuicer","repo":"data-juicer","owner_avatar_url":"https://avatars.githubusercontent.com/u/223222708?v=4","primary_language":"Python","stars":6897,"forks":404,"topics":["data","data-analysis","data-pipeline","data-processing","data-science","data-visualization","foundation-models","instruction-tuning","large-language-models","llm","llms","multi-modal","pre-training","synthetic-data"],"archived":false,"github_pushed_at":"2026-08-13T09:19:31+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/datajuicer-data-juicer","markdown_url":"https://www.graphcanon.com/tools/datajuicer-data-juicer.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/datajuicer-data-juicer","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=datajuicer-data-juicer","shared_categories":["model-training","data-retrieval"]},{"slug":"ucbepic-docetl","name":"docetl","tagline":"A system for agentic LLM-powered data processing and ETL","github_url":"https://github.com/ucbepic/docetl","owner":"ucbepic","repo":"docetl","owner_avatar_url":"https://avatars.githubusercontent.com/u/88680502?v=4","primary_language":"Python","stars":3961,"forks":421,"topics":["agents","data","data-pipelines","document-analysis","document-processing","elt","etl","llm","python","semantic-data","unstructured-data","unstructured-data-analysis","workflow"],"archived":false,"github_pushed_at":"2026-08-09T23:31:04+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/ucbepic-docetl","markdown_url":"https://www.graphcanon.com/tools/ucbepic-docetl.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/ucbepic-docetl","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=ucbepic-docetl","shared_categories":["data-retrieval"]},{"slug":"huggingface-datatrove","name":"datatrove","tagline":"Platform-agnostic customizable pipeline processing blocks for data processing and transformation.","github_url":"https://github.com/huggingface/datatrove","owner":"huggingface","repo":"datatrove","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"Python","stars":3250,"forks":288,"topics":[],"archived":false,"github_pushed_at":"2026-08-06T15:27:26+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/huggingface-datatrove","markdown_url":"https://www.graphcanon.com/tools/huggingface-datatrove.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-datatrove","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-datatrove","shared_categories":["model-training","data-retrieval"]},{"slug":"huangowen-awesome-llm-compression","name":"Awesome-LLM-Compression","tagline":"Awesome LLM compression research papers and tools to accelerate LLM training and inference.","github_url":"https://github.com/HuangOwen/Awesome-LLM-Compression","owner":"HuangOwen","repo":"Awesome-LLM-Compression","owner_avatar_url":"https://avatars.githubusercontent.com/u/24937399?v=4","primary_language":null,"stars":1859,"forks":129,"topics":[],"archived":false,"github_pushed_at":"2026-06-30T15:26:46+00:00","maintenance_label":"Steady","url":"https://www.graphcanon.com/tools/huangowen-awesome-llm-compression","markdown_url":"https://www.graphcanon.com/tools/huangowen-awesome-llm-compression.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huangowen-awesome-llm-compression","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huangowen-awesome-llm-compression","shared_categories":[]},{"slug":"ray-project-llm-applications","name":"llm-applications","tagline":"Comprehensive guide to building RAG-based LLM applications for production","github_url":"https://github.com/ray-project/llm-applications","owner":"ray-project","repo":"llm-applications","owner_avatar_url":"https://avatars.githubusercontent.com/u/22125274?v=4","primary_language":"Jupyter Notebook","stars":1855,"forks":256,"topics":["anyscale","fine-tuning","llama2","llms","machine-learning","openai","ray","serving"],"archived":false,"github_pushed_at":"2026-08-15T00:14:04+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/ray-project-llm-applications","markdown_url":"https://www.graphcanon.com/tools/ray-project-llm-applications.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/ray-project-llm-applications","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=ray-project-llm-applications","shared_categories":[]},{"slug":"bespokelabsai-curator","name":"curator","tagline":"Synthetic data curation for post-training and structured data extraction","github_url":"https://github.com/bespokelabsai/curator","owner":"bespokelabsai","repo":"curator","owner_avatar_url":"https://avatars.githubusercontent.com/u/167806754?v=4","primary_language":"Python","stars":1718,"forks":146,"topics":["agents","deep-learning","fine-tuning","instruction-tuning","llm","machine-learning","natural-language-processing","prompt","python","synthetic-data","synthetic-dataset-generation"],"archived":false,"github_pushed_at":"2026-08-07T07:54:05+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/bespokelabsai-curator","markdown_url":"https://www.graphcanon.com/tools/bespokelabsai-curator.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/bespokelabsai-curator","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=bespokelabsai-curator","shared_categories":["model-training"]},{"slug":"benman1-generative-ai-with-langchain","name":"generative_ai_with_langchain","tagline":"Build production-ready LLM applications and advanced agents using Python, LangChain, and LangGraph","github_url":"https://github.com/benman1/generative_ai_with_langchain","owner":"benman1","repo":"generative_ai_with_langchain","owner_avatar_url":"https://avatars.githubusercontent.com/u/10786684?v=4","primary_language":"Jupyter Notebook","stars":1400,"forks":582,"topics":["agent","chatgpt","claude","claude-3-5-sonnet","deepseek","deepseek-r1","gpt","gpt-4o","huggingface","langchain","langgraph","llamacpp","llms","ollama","openai"],"archived":false,"github_pushed_at":"2026-08-05T12:50:30+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/benman1-generative-ai-with-langchain","markdown_url":"https://www.graphcanon.com/tools/benman1-generative-ai-with-langchain.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/benman1-generative-ai-with-langchain","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=benman1-generative-ai-with-langchain","shared_categories":[]},{"slug":"georgian-io-llm-finetuning-toolkit","name":"LLM-Finetuning-Toolkit","tagline":"Toolkit for fine-tuning and testing open-source large language models","github_url":"https://github.com/georgian-io/LLM-Finetuning-Toolkit","owner":"georgian-io","repo":"LLM-Finetuning-Toolkit","owner_avatar_url":"https://avatars.githubusercontent.com/u/10764713?v=4","primary_language":"Python","stars":870,"forks":107,"topics":["ablation-study","classification","falcon","fine-tuning","finetuning","flan-t5","large-language-models","llama2","llm-test","lora","mistral-7b","nlp","nlp-machine-learning","qlora","redpajama","summarization","unit-testing","zephyr"],"archived":false,"github_pushed_at":"2026-05-04T16:33:40+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/georgian-io-llm-finetuning-toolkit","markdown_url":"https://www.graphcanon.com/tools/georgian-io-llm-finetuning-toolkit.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/georgian-io-llm-finetuning-toolkit","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=georgian-io-llm-finetuning-toolkit","shared_categories":["model-training"]}]}}