GraphCanon updated 2w · GitHub synced 2w
Decision brief
chinese-llm-benchmark (ReLE评测) 是一个专门用于评估中文大规模语言模型的工具,它可以全面评测涵盖商用和开源的大规模语言模型,并提供详细排行榜及超过200万条缺陷数据。它的主要特点是多维度评估能力和丰富的领域覆盖范围。
Good fit when
- 当需要对多种中文字句生成、理解能力进行综合评价时使用;
- 适用于希望了解自己使用的商用或开源大模型在特定领域(如教育、法律等)表现的人群。
Avoid when
- 当评估对象仅限于英文或其他非中文的语言模型时不应使用此工具;
- 如果您的主要关注点是多语种支持或模型在特定国际化场景中的性能表现。
Observed Jul 11, 2026 · Source: enrich:decision_facts
Verify the decision
Maintenance and security
Full trust report- Maintenance
- Very active (2d since push)
- As of 2w
- Provenance
- Not a fork · Personal account
- As of 2w
- Security (OSV)
- No lockfile
- As of 1mo
Public GitHub metadata and optional OSV scans. Signals, not a guarantee. Trust methodology.
Install
git clone https://github.com/jeinlee1991/chinese-llm-benchmarkSimilar tools
Same-category neighbours. No typed graph edges are catalogued for this tool yet.
Evidence and technical details
Sourced facts, taxonomy, compatibility claims, README excerpt, and machine-readable endpoints.
Overview
提供多维度的中文AI大模型评估,涵盖各类商用和开源的大规模语言模型,并提供详细的排行榜与超过200万条缺陷数据。
Capability facts
No sourced capability facts yet. Facts appear after ingest scans repo manifests (Dockerfile, package.json, MCP configs).
Categories
Compatibility
Sourced claims from the README excerpt - not unsourced marketing copy.
Source: README excerpt (regex_v1, Aug 7, 2026)
- 目前已囊括395个大模型,覆盖chatgpt、gpt-5.6、谷歌gemini-3.1-pro、Claude-5、grok-4.5、文心ERNIE-X1.1、ERNIE-5.1、qwen3.7-max、qSource link
Tags
README
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新)
- ReLE (Really Reliable Live Evaluation for LLM),原名CLiB
- 目前已囊括395个大模型,覆盖chatgpt、gpt-5.6、谷歌gemini-3.1-pro、Claude-5、grok-4.5、文心ERNIE-X1.1、ERNIE-5.1、qwen3.7-max、qwen3.7-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及hy3、step3.7-flash、kimi-k3、ernie4.5、MiniMax-M3、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.2、MiMo-V2、LongCat、gemma4、mistral等开源大模型。
- 支持多维度能力评测,包括教育、医疗与心理健康、金融、法律与行政公务、推理与数学计算、语言与指令遵从、agent与工具调用等7个领域,以及细分的~300个维度(比如牙科、高中语文…)。详见我们的技术报告ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs 媒体报道(机器之心):全球304个中文大模型实测:没有“全能王者”,ReLE凭70%降本方案破解评估困局
- 不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
- 为您的私有大模型提供免费评测服务,联系我们(非线智能 ReLE benchmark团队):加微信
目录
- 🔄最近更新
- ⚓GitHub热门大模型评测项目
- 📝大模型基本信息
- 📊排行榜
- 0、多模态排行榜
- 1、综合能力排行榜
- 1.1 推理类模型排行榜
- 1.2 商用大模型排行榜(含开源模型的付费API)
- 1.3 开源大模型排行榜
- 2、教育排行榜
- 2.1 小学学科 | 2.2 初中学科 | 2.3 中考TODO
- 2.4 高中学科 | 2.5 高考 | 2.6 高等教育TODO
- 2.7 考研TODO | 2.8 教师资格TODO
- 3、医疗与心理健康排行榜
- 3.1 医师 | 3.2 护理 | 3.3 药师
- 3.4 医技 | 3.5 医学基础知识 | 3.6 医学考研
- 3.7 心理健康
- 4、金融排行榜
- 4.1 财务 | 4.2 银行 | 4.3 保险
- 4.4 证券 | 4.5 其他金融资格考试 | 4.6 金融基础知识
- 4.7 金融应用
- 5、法律与行政公务排行榜
- 5.1 律师资格考试
- 5.2 公务员考试
- 6、推理与数学计算排行榜
- 6.1 演绎推理 | 6.2 常识推理 | 6.3 符号推理BBH
- 6.4 算术能力 | 6.5 表格问答 | 6.6 表格总结
- 6.7 高中奥数 | 6.8 初中奥数TODO | 6.9 小学奥数
- 6.10 地图推理TODO | 6.11 空间推理TODO | 6.12 数独
- 6.13 金额大小写转换TODO | 6.14 日期计算TODO
- 7、语言与指令遵从排行榜
- 7.1 成语理解 | 7.2 情感分析 | 7.3 文本蕴含
- 7.4 文本分类 | 7.5 信息抽取 | 7.6 阅读理解
- 7.7 代词理解 | 7.8 诗词匹配 | 7.9 中文指令遵从
- 7.10 汉字字形 | 7.11 汉语拼音TODO | 7.12 找错别字TODO
- 7.13 句子理解TODO | 7.14 标点符号TODO | 7.15 汉字繁简转换TODO
- 7.16 语种识别TODO
- 8、agent与工具调用排行榜
- 8.1 TAU
- 8.2 BFCL-V3
- 9、coding排行榜
- 9.1 livecodebench
- 9.2 Terminal-Bench-2.0
- 10、整合LMArena和AA分数
- 🌐各项能力评分
- 为什么做榜单?
- 大模型选型及评测交流群
- Cite Us
最近评测更新
- [2026/8/4] v5.10.17版本
- 新增大模型:qwen3.8-max
- 删除陈旧的模型:Baichuan4-Turbo、Llama-4-Scout-17B-16E-Instruct、GLM-4-9B-0414、 Qwen3-32B、Qwen3-14B、Qwen3-8B、Qwen3-4B、o4-mini、DeepSeek-R1-0528、ERNIE-4.5-Turbo-32K、 ERNIE-X1-Turbo-32K、claude-4-sonnet、claude-4-sonnet-thinking、gemini-2.5-flash、 gemini-2.5-pro、hunyuan-t1-20250711、qwen-turbo-2025-07-15、qwen3-235b-a22b-instruct-2507、qwen3-235b-a22b-thinking-2507、 Qwen3-4B-nothink、Qwen
For agents
This page has a .md twin and JSON over the API.