{"data":{"slug":"shibing624-text2vec","name":"text2vec","tagline":"文本向量表征工具，支持多种语义理解和相似度计算模型","github_url":"https://github.com/shibing624/text2vec","owner":"shibing624","repo":"text2vec","owner_avatar_url":"https://avatars.githubusercontent.com/u/10249622?v=4","primary_language":"Python","stars":4976,"forks":428,"topics":["embeddings","nlp","sentence-embeddings","similarity","text-similarity","text2vec","word2vec"],"archived":false,"github_pushed_at":"2026-02-14T14:59:10+00:00","maintenance_label":"Slowing","stars_delta_30d":2,"url":"https://www.graphcanon.com/tools/shibing624-text2vec","markdown_url":"https://www.graphcanon.com/tools/shibing624-text2vec.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/shibing624-text2vec","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=shibing624-text2vec","description":"text2vec, text to vector. 文本向量表征工具，把文本转化为向量矩阵，实现了Word2Vec、RankBM25、Sentence-BERT、CoSENT等文本表征、文本相似度计算模型，开箱即用。","homepage_url":"https://pypi.org/project/text2vec/","license":"Apache-2.0","open_issues":7,"watchers":31,"ai_summary":"text2vec 是一个用于将文本转化为向量矩阵的工具，它实现了包括 Word2Vec、RankBM25、Sentence-BERT 和 CoSENT 在内的多种文本表示和相似度计算模型。","readme_excerpt":"## Install\n```shell\npip install torch # conda install pytorch\npip install -U text2vec\n```\n\nor\n\n```shell\npip install torch # conda install pytorch\npip install -r requirements.txt\n\ngit clone https://github.com/shibing624/text2vec.git\ncd text2vec\npip install --no-deps .\n```\n\n---\n\n## License\n\n\n授权协议为 [The Apache License 2.0](LICENSE)，可免费用做商业用途。请在产品说明中附加text2vec的链接和授权协议。","github_created_at":"2019-11-12T03:27:57+00:00","created_at":"2026-07-11T11:28:48.505791+00:00","updated_at":"2026-08-22T06:00:50.978802+00:00","categories":[{"slug":"data-retrieval","name":"Data & Retrieval","url":"https://www.graphcanon.com/categories/data-retrieval","markdown_url":"https://www.graphcanon.com/categories/data-retrieval.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/data-retrieval"},{"slug":"model-training","name":"Model Training","url":"https://www.graphcanon.com/categories/model-training","markdown_url":"https://www.graphcanon.com/categories/model-training.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/model-training"}],"tags":[{"slug":"embeddings","name":"embeddings"},{"slug":"nlp","name":"nlp"},{"slug":"sentence-embeddings","name":"sentence-embeddings"},{"slug":"similarity","name":"similarity"},{"slug":"text-similarity","name":"text-similarity"},{"slug":"word2vec","name":"word2vec"}],"trust":{"provenance":{"is_fork":false,"github_id":221121871,"owner_type":"User","methodology":"github_public_v1","parent_repo":null,"near_duplicate_slugs":[]},"computed_at":"2026-08-22T06:00:50.203Z","maintenance":{"label":"Slowing","score":36,"methodology":"github_public_v1","releases_90d":0,"days_since_push":188,"last_release_at":"2023-09-20T03:14:07Z","stars_delta_30d":2,"open_issues_delta_30d":0},"security_summary":{"status":"no_lockfile","scanner":null,"low_count":0,"high_count":0,"last_scan_at":"2026-07-11T11:28:49.673Z","medium_count":0,"scan_profile":"none","critical_count":0}},"capability_facts":{"scan":{"source":"repo_scan","observed_at":"2026-08-22T06:00:50.639Z"},"languages":{"value":["python"],"source":"github.language","observed_at":"2026-08-22T06:00:50.639Z"},"license_spdx":{"value":"Apache-2.0","source":"github.license","observed_at":"2026-08-22T06:00:50.639Z"}},"decision_facts":{"hosting":null,"pricing":{"model":"freemium","summary":"Free under Apache-2.0 license for open-source use; potential premium support available."},"requirements":{"min_ram_gb":4,"requires_docker":false},"constraints":{"min_ram_gb":4,"pricing_model":"freemium","requires_docker":false},"when_to_use":["- When you need to leverage multiple text representation techniques in one library to find the best fit for your specific use case.","- For tasks requiring high-precision semantic similarity calculations, specifically ifSentence-BERT or CoSENT's methodologies are optimal for your dataset.","- If you want a straightforward setup without deep diving into individual model installations and configurations."],"when_not_to_use":["- When specific optimizations required by an application would be better served by direct implementation of Word2Vec instead of relying on text2vec’s integrated version.","- For applications that require real-time performance with minimal latency, as text2vec's comprehensive approach might introduce overheads compared to more lightweight alternatives."],"source":"enrich:decision_facts","observed_at":"2026-07-12T12:41:27.513Z"},"constraint_facets":{"min_ram_gb":4,"pricing_model":"freemium","requires_docker":false},"decision_summary":[{"label":"Pricing","value":"freemium - Free under Apache-2.0 license for open-source use; potential premium support available."},{"label":"Requirements","value":"Min 4 GB RAM"},{"label":"Adopt for","value":"text2vec is a Python-based tool designed for converting textual data into vector matrices using various models such as Word2Vec, RankBM25, Sentence-BERT, and CoSENT."}]}}