{"data":{"slug":"paddlepaddle-paddleocr","name":"PaddleOCR","tagline":"A powerful, lightweight OCR toolkit to convert images and PDFs into structured data","github_url":"https://github.com/PaddlePaddle/PaddleOCR","owner":"PaddlePaddle","repo":"PaddleOCR","owner_avatar_url":"https://avatars.githubusercontent.com/u/23534030?v=4","primary_language":"Python","stars":87808,"forks":11187,"topics":["ai4science","chineseocr","document-parsing","document-translation","kie","ocr","paddleocr-vl","pdf-extractor-rag","pdf-parser","pdf2markdown","pp-ocr","pp-structure","rag"],"archived":false,"github_pushed_at":"2026-07-22T11:59:34+00:00","maintenance_label":"Active","stars_delta_30d":2062,"url":"https://www.graphcanon.com/tools/paddlepaddle-paddleocr","markdown_url":"https://www.graphcanon.com/tools/paddlepaddle-paddleocr.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/paddlepaddle-paddleocr","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=paddlepaddle-paddleocr","description":"Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.","homepage_url":"https://www.paddleocr.com","license":"Apache-2.0","open_issues":230,"watchers":553,"ai_summary":"PaddleOCR is an open-source toolkit for optical character recognition that supports over 100 languages, making it easy to extract text from images or PDF documents. It includes multiple series such as PP-OCR and PaddleOCR-VL with detailed documentation for local deployment.","readme_excerpt":"### Step 2: Local Deployment\nFor local usage, please refer to the following documentation based on your needs:\n\n- **PP-OCR Series**: See [PP-OCR Documentation](https://www.paddleocr.ai/latest/en/version3.x/pipeline_usage/OCR.html)\n- **PaddleOCR-VL Series**: See [PaddleOCR-VL Documentation](https://www.paddleocr.ai/latest/en/version3.x/pipeline_usage/PaddleOCR-VL.html)\n- **PP-StructureV3**: See [PP-StructureV3 Documentation](https://www.paddleocr.ai/latest/en/version3.x/pipeline_usage/PP-StructureV3.html)\n- **More Capabilities**: See [More Capabilities Documentation](https://www.paddleocr.ai/latest/en/version3.x/pipeline_usage/pipeline_overview.html)\n\n---\n\n## 📄 License\nThis project is released under the [Apache 2.0 license](LICENSE).","github_created_at":"2020-05-08T10:38:16+00:00","created_at":"2026-07-07T17:36:07.081902+00:00","updated_at":"2026-08-18T00:02:18.149502+00:00","categories":[{"slug":"computer-vision","name":"Computer Vision","url":"https://www.graphcanon.com/categories/computer-vision","markdown_url":"https://www.graphcanon.com/categories/computer-vision.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/computer-vision"}],"tags":[{"slug":"ai4science","name":"ai4science"},{"slug":"chineseocr","name":"chineseocr"},{"slug":"document-parsing","name":"document-parsing"},{"slug":"document-translation","name":"document-translation"},{"slug":"kie","name":"kie"},{"slug":"ocr","name":"ocr"},{"slug":"pdf-extractor-rag","name":"pdf-extractor-rag"},{"slug":"pdf-parser","name":"pdf-parser"}],"trust":{"provenance":{"is_fork":false,"github_id":262296122,"owner_type":"Organization","methodology":"github_public_v1","parent_repo":null,"near_duplicate_slugs":[]},"computed_at":"2026-08-18T00:02:17.376Z","maintenance":{"label":"Active","score":82,"methodology":"github_public_v1","releases_90d":2,"days_since_push":26,"last_release_at":"2026-06-11T12:09:14Z","stars_delta_30d":2062,"open_issues_delta_30d":12},"security_summary":{"status":"ok","scanner":"osv@v1","low_count":0,"high_count":0,"last_scan_at":"2026-07-11T11:06:53.136Z","medium_count":0,"scan_profile":"deps","critical_count":0}},"capability_facts":{"scan":{"source":"repo_scan","observed_at":"2026-08-18T00:02:17.805Z"},"has_cli":{"value":true,"source":"pyproject.toml:[project.scripts]","observed_at":"2026-08-18T00:02:17.805Z"},"languages":{"value":["python"],"source":"github.language+pyproject.toml","observed_at":"2026-08-18T00:02:17.805Z"},"license_spdx":{"value":"Apache-2.0","source":"github.license","observed_at":"2026-08-18T00:02:17.805Z"}},"decision_facts":{"hosting":null,"pricing":{"model":"freemium","summary":"PaddleOCR is available under the Apache-2.0 license, making it free to use for academic and commercial purposes without cost beyond any running infrastructure costs."},"requirements":{"notes":["Requires Python for local deployment","Supports over 100 languages, enabling multilingual OCR capabilities."],"min_ram_gb":4,"requires_docker":false},"constraints":{"min_ram_gb":4,"pricing_model":"freemium","requires_docker":false},"when_to_use":["For projects requiring optical character recognition with multilingual support, especially involving Chinese documents.","When you need detailed documentation and local deployment options, including the PP-OCR series or the more advanced PaddleOCR-VL for document parsing and translation.","If your project involves AI4Science applications where extracting text from images and PDFs might contribute to scientific data processing."],"when_not_to_use":["When you require a solution that focuses exclusively on Western languages, as PaddleOCR's strength lies in comprehensive multilingual support, including strong capabilities for Chinese.","In scenarios where ease of setup is paramount but detailed control over the OCR pipeline and customization options are less critical since PaddleOCR requires configuration via multiple documentation."],"source":"enrich:decision_facts","observed_at":"2026-07-11T11:54:41.517Z"},"constraint_facets":{"min_ram_gb":4,"pricing_model":"freemium","requires_docker":false},"decision_summary":[{"label":"Pricing","value":"freemium - PaddleOCR is available under the Apache-2.0 license, making it free to use for academic and commercial purposes without cost beyond any running infrastructure costs."},{"label":"Requirements","value":"Min 4 GB RAM; Requires Python for local deployment; Supports over 100 languages, enabling multilingual OCR capabilities."},{"label":"Adopt for","value":"PaddleOCR is a powerful, lightweight OCR toolkit that offers support for over 100 languages and multiple series like PP-OCR and PaddleOCR-VL."}]}}