{"data":{"node":{"slug":"bespokelabsai-curator","name":"curator","tagline":"Synthetic data curation for post-training and structured data extraction","github_url":"https://github.com/bespokelabsai/curator","owner":"bespokelabsai","repo":"curator","owner_avatar_url":"https://avatars.githubusercontent.com/u/167806754?v=4","primary_language":"Python","stars":1718,"forks":146,"topics":["agents","deep-learning","fine-tuning","instruction-tuning","llm","machine-learning","natural-language-processing","prompt","python","synthetic-data","synthetic-dataset-generation"],"archived":false,"github_pushed_at":"2026-08-07T07:54:05+00:00","maintenance_label":"Active","stars_delta_30d":15,"url":"https://www.graphcanon.com/tools/bespokelabsai-curator","markdown_url":"https://www.graphcanon.com/tools/bespokelabsai-curator.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/bespokelabsai-curator","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=bespokelabsai-curator"},"categories":[{"slug":"developer-tools","name":"Developer Tools","url":"https://www.graphcanon.com/categories/developer-tools","markdown_url":"https://www.graphcanon.com/categories/developer-tools.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/developer-tools"},{"slug":"model-training","name":"Model Training","url":"https://www.graphcanon.com/categories/model-training","markdown_url":"https://www.graphcanon.com/categories/model-training.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/model-training"}],"tags":[{"slug":"agents","name":"agents"},{"slug":"deep-learning","name":"deep-learning"},{"slug":"fine-tuning","name":"fine-tuning"},{"slug":"instruction-tuning","name":"instruction-tuning"},{"slug":"llm","name":"llm"},{"slug":"machine-learning","name":"machine-learning"},{"slug":"natural-language-processing","name":"natural-language-processing"},{"slug":"prompt","name":"prompt"}],"edges":[],"neighbours":[{"slug":"nirdiamant-rag-techniques","name":"RAG_Techniques","tagline":"Showcases advanced techniques for Retrieval-Augmented Generation (RAG) systems with detailed notebook tutorials.","github_url":"https://github.com/NirDiamant/RAG_Techniques","owner":"NirDiamant","repo":"RAG_Techniques","owner_avatar_url":"https://avatars.githubusercontent.com/u/28316913?v=4","primary_language":"Jupyter Notebook","stars":29076,"forks":3540,"topics":["agentic-rag","ai","embeddings","generative-ai","gpt","langchain","llama-index","llm","llms","machine-learning","nlp","openai","python","rag","retrieval-augmented-generation","semantic-search","tutorials","vector-database"],"archived":false,"github_pushed_at":"2026-08-15T00:52:05+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/nirdiamant-rag-techniques","markdown_url":"https://www.graphcanon.com/tools/nirdiamant-rag-techniques.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/nirdiamant-rag-techniques","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=nirdiamant-rag-techniques","shared_categories":["model-training"]},{"slug":"huggingface-datasets","name":"datasets","tagline":"Largest hub of ready-to-use datasets for AI models","github_url":"https://github.com/huggingface/datasets","owner":"huggingface","repo":"datasets","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"Python","stars":21791,"forks":3322,"topics":["ai","artificial-intelligence","computer-vision","dataset-hub","datasets","deep-learning","huggingface","llm","machine-learning","natural-language-processing","nlp","numpy","pandas","pytorch","speech","tensorflow"],"archived":false,"github_pushed_at":"2026-07-30T11:23:49+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/huggingface-datasets","markdown_url":"https://www.graphcanon.com/tools/huggingface-datasets.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-datasets","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-datasets","shared_categories":[]},{"slug":"unstructured-io-unstructured","name":"unstructured","tagline":"Convert documents to structured data effortlessly","github_url":"https://github.com/Unstructured-IO/unstructured","owner":"Unstructured-IO","repo":"unstructured","owner_avatar_url":"https://avatars.githubusercontent.com/u/108372208?v=4","primary_language":"HTML","stars":15238,"forks":1284,"topics":["data-pipelines","deep-learning","document-image-analysis","document-image-processing","document-parser","document-parsing","docx","donut","information-retrieval","langchain","llm","machine-learning","ml","natural-language-processing","nlp","ocr","pdf","pdf-to-json","pdf-to-text","preprocessing"],"archived":false,"github_pushed_at":"2026-07-31T20:54:17+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/unstructured-io-unstructured","markdown_url":"https://www.graphcanon.com/tools/unstructured-io-unstructured.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/unstructured-io-unstructured","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=unstructured-io-unstructured","shared_categories":["model-training"]},{"slug":"data-privacy-stack-presidio","name":"presidio","tagline":"A framework for detecting and anonymizing sensitive data","github_url":"https://github.com/data-privacy-stack/presidio","owner":"data-privacy-stack","repo":"presidio","owner_avatar_url":"https://avatars.githubusercontent.com/u/275623515?v=4","primary_language":"Python","stars":10395,"forks":1237,"topics":["anonymization","data-anonymization","data-masking","data-obfuscation","data-privacy","data-redaction","de-identification","guardrails","image-redactor","named-entity-recognition","nlp","personally-identifiable-information","phi","pii","pii-detection","privacy","python","sensitive-data","spacy","transformers"],"archived":false,"github_pushed_at":"2026-08-08T21:25:09+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/data-privacy-stack-presidio","markdown_url":"https://www.graphcanon.com/tools/data-privacy-stack-presidio.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/data-privacy-stack-presidio","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=data-privacy-stack-presidio","shared_categories":[]},{"slug":"zipstack-unstract","name":"unstract","tagline":"LLM-Driven Extraction of Unstructured Data for API Deployments and ETL Pipeline Workflows","github_url":"https://github.com/Zipstack/unstract","owner":"Zipstack","repo":"unstract","owner_avatar_url":"https://avatars.githubusercontent.com/u/89070934?v=4","primary_language":"Python","stars":6932,"forks":663,"topics":["ai-agents","data-engineering","document-ai","generative-ai","idp","json-extraction","llm","mcp-server","ocr","pdf-extraction","prompt-engineering","structured-output"],"archived":false,"github_pushed_at":"2026-07-27T22:23:41+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/zipstack-unstract","markdown_url":"https://www.graphcanon.com/tools/zipstack-unstract.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/zipstack-unstract","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=zipstack-unstract","shared_categories":[]},{"slug":"datajuicer-data-juicer","name":"data-juicer","tagline":"Data processing for and with foundation models","github_url":"https://github.com/datajuicer/data-juicer","owner":"datajuicer","repo":"data-juicer","owner_avatar_url":"https://avatars.githubusercontent.com/u/223222708?v=4","primary_language":"Python","stars":6897,"forks":404,"topics":["data","data-analysis","data-pipeline","data-processing","data-science","data-visualization","foundation-models","instruction-tuning","large-language-models","llm","llms","multi-modal","pre-training","synthetic-data"],"archived":false,"github_pushed_at":"2026-08-13T09:19:31+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/datajuicer-data-juicer","markdown_url":"https://www.graphcanon.com/tools/datajuicer-data-juicer.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/datajuicer-data-juicer","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=datajuicer-data-juicer","shared_categories":["model-training"]},{"slug":"ucbepic-docetl","name":"docetl","tagline":"A system for agentic LLM-powered data processing and ETL","github_url":"https://github.com/ucbepic/docetl","owner":"ucbepic","repo":"docetl","owner_avatar_url":"https://avatars.githubusercontent.com/u/88680502?v=4","primary_language":"Python","stars":3961,"forks":421,"topics":["agents","data","data-pipelines","document-analysis","document-processing","elt","etl","llm","python","semantic-data","unstructured-data","unstructured-data-analysis","workflow"],"archived":false,"github_pushed_at":"2026-08-09T23:31:04+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/ucbepic-docetl","markdown_url":"https://www.graphcanon.com/tools/ucbepic-docetl.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/ucbepic-docetl","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=ucbepic-docetl","shared_categories":[]},{"slug":"huggingface-datatrove","name":"datatrove","tagline":"Platform-agnostic customizable pipeline processing blocks for data processing and transformation.","github_url":"https://github.com/huggingface/datatrove","owner":"huggingface","repo":"datatrove","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"Python","stars":3250,"forks":288,"topics":[],"archived":false,"github_pushed_at":"2026-08-06T15:27:26+00:00","maintenance_label":"Active","url":"https://www.graphcanon.com/tools/huggingface-datatrove","markdown_url":"https://www.graphcanon.com/tools/huggingface-datatrove.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-datatrove","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-datatrove","shared_categories":["model-training"]},{"slug":"genieincodebottle-generative-ai","name":"generative-ai","tagline":"Comprehensive resources on Generative AI including roadmaps, projects, and interview preparation","github_url":"https://github.com/genieincodebottle/generative-ai","owner":"genieincodebottle","repo":"generative-ai","owner_avatar_url":"https://avatars.githubusercontent.com/u/155415029?v=4","primary_language":"Jupyter Notebook","stars":2609,"forks":631,"topics":["agentic-ai","agentic-framework","claude","gemini","genai","genai-usecase","generative-ai","interview-questions","langchain","langgraph","large-language-model","llm-agent","llm-evaluation","mcp","model-context-protocol","multimodal","n8n","n8n-workflow","openai-api","retrieval-augmented-generation"],"archived":false,"github_pushed_at":"2026-08-24T06:24:56+00:00","maintenance_label":"Very active","url":"https://www.graphcanon.com/tools/genieincodebottle-generative-ai","markdown_url":"https://www.graphcanon.com/tools/genieincodebottle-generative-ai.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/genieincodebottle-generative-ai","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=genieincodebottle-generative-ai","shared_categories":[]},{"slug":"nvidia-nemo-curator","name":"Curator","tagline":"Scalable data pre-processing and curation toolkit for LLMs","github_url":"https://github.com/NVIDIA-NeMo/Curator","owner":"NVIDIA-NeMo","repo":"Curator","owner_avatar_url":"https://avatars.githubusercontent.com/u/213689629?v=4","primary_language":"Python","stars":1731,"forks":320,"topics":["data","data-curation","data-prep","data-preparation","data-processing","data-processing-pipelines","data-quality","datacuration","datarecipes","deduplication","fast-data-processing","fine-tuning","large-language-models","large-scale-data-processing","llm","llm-data-quality","llmapps","python","semantic-deduplication"],"archived":false,"github_pushed_at":"2026-08-21T20:19:34+00:00","maintenance_label":"Very active","url":"https://www.graphcanon.com/tools/nvidia-nemo-curator","markdown_url":"https://www.graphcanon.com/tools/nvidia-nemo-curator.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/nvidia-nemo-curator","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=nvidia-nemo-curator","shared_categories":["model-training"]},{"slug":"huggingface-aisheets","name":"aisheets","tagline":"Build, enrich, and transform datasets using AI models with no code","github_url":"https://github.com/huggingface/aisheets","owner":"huggingface","repo":"aisheets","owner_avatar_url":"https://avatars.githubusercontent.com/u/25720743?v=4","primary_language":"TypeScript","stars":1638,"forks":140,"topics":["ai","llm-evaluation","llms","nocode","oss","synthetic-data"],"archived":false,"github_pushed_at":"2026-05-26T10:33:23+00:00","maintenance_label":"Slowing","url":"https://www.graphcanon.com/tools/huggingface-aisheets","markdown_url":"https://www.graphcanon.com/tools/huggingface-aisheets.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/huggingface-aisheets","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=huggingface-aisheets","shared_categories":[]},{"slug":"datadreamer-dev-datadreamer","name":"DataDreamer","tagline":"Prompt. Generate Synthetic Data. Train & Align Models.","github_url":"https://github.com/datadreamer-dev/DataDreamer","owner":"datadreamer-dev","repo":"DataDreamer","owner_avatar_url":"https://avatars.githubusercontent.com/u/154913957?v=4","primary_language":"Python","stars":1117,"forks":58,"topics":["alignment","deep-learning","fine-tuning","gpt","instruction-tuning","llm","llmops","llms","machine-learning","natural-language-processing","nlp","nlp-library","openai","python","pytorch","synthetic-data","synthetic-dataset-generation","transformers"],"archived":false,"github_pushed_at":"2025-02-02T21:23:50+00:00","maintenance_label":"Dormant","url":"https://www.graphcanon.com/tools/datadreamer-dev-datadreamer","markdown_url":"https://www.graphcanon.com/tools/datadreamer-dev-datadreamer.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/datadreamer-dev-datadreamer","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=datadreamer-dev-datadreamer","shared_categories":["model-training"]}]}}