AgentIndex icon
AgentIndex
工具分类热门最新对比
提交工具
工具分类热门最新对比
首页/
RAG / Knowledge Base/
chinese-llm-benchmark
chinese-llm-benchmark logo

chinese-llm-benchmark

活跃·★ 6.3k·更新于 2026-07-12
★ 时下流行★ 必备神器

ReLE评测(原名CLiB)是一个持续更新的中文AI大模型能力评测项目,已覆盖337个商用及开源大模型。它提供多维度能力评测和综合排行榜,并包含超200万的大模型缺陷库,以帮助社区研究和改进模型。

chinese-llm-benchmark 当前归类于 RAG / Knowledge Base,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 广泛覆盖337+个商用及开源中文大模型。、对比和选择特定应用场景下表现最佳的大模型。 这类能力。同时它也具备一定社区热度,当前 GitHub Stars 为 6.3k。

#大模型评测#中文大模型
© 2026 AgentIndex.app|由十年 iOS 开发者构建。
QYSGitHub请作者喝咖啡 ☕

按分类浏览

代码助手工作流自动化RAG / 知识库多智能体浏览器自动化大模型基础设施开发者工具可观测性

与 Anthropic, OpenAI 或 Microsoft 无关。

#AI基准测试
#模型排名
#缺陷分析
↗ 访问官网★ GitHub
01

功能特性

01广泛覆盖337+个商用及开源中文大模型。
02支持教育、医疗等7大领域及约300个细分维度的多维度能力评测。
03提供全面细致的各类能力排行榜。
04拥有超200万的大模型缺陷库,便于研究分析和改进大模型。
05为私有大模型提供免费评测服务和定制化选型支持。
02

为什么选择它

+广泛覆盖337+个商用及开源中文大模型。
+对比和选择特定应用场景下表现最佳的大模型。
+覆盖 6 个兼容环境或平台,更适合需要跨端部署的团队。
+最近一次更新时间为 2026-07-12,说明项目仍在持续维护。
03

权衡点

!当前页面没有提供明确的安装命令,落地前可能还需要回到官方文档确认部署步骤。
!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04

兼容性

OpenAI (GPT series)
支持
已通过文档验证
Google (Gemini series)
支持
已通过文档验证
Anthropic (Claude series)
支持
已通过文档验证
Baidu (ERNIE series)
支持
已通过文档验证
Alibaba (Qwen series)
支持
已通过文档验证
DeepSeek
支持
已通过文档验证
05

使用场景

↳对比和选择特定应用场景下表现最佳的大模型。
↳发现并改进大语言模型的能力缺陷。
↳对私有或定制化大模型进行基准测试,以优化性能和成本。
06

同类对比

≈chinese-llm-benchmark 属于 RAG / Knowledge Base 分类,适合与 mindsdb 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“对比和选择特定应用场景下表现最佳的大模型。”,那么这类场景会比泛用型工具对比更有参考价值。
≈chinese-llm-benchmark 的许可信息和社区热度都应该与同类项目一起看。
07

同类工具

mindsdb logo
mindsdb★ 39.5k
MindsDB 使得人类、AI、代理和应用程序能够从大规模数据源中获取高度准确的答案。
vs →
Brave Search MCP logo
Brave Search MCP★ 88.6k
此仓库是模型上下文协议(MCP)参考实现的集合,展示了如何为大型语言模型提供安全、受控的工具和数据源访问。
vs →
Claude Flow logo
Claude Flow★ 65.2k
Claude Flow是一个企业级AI编排平台,专为Claude Code提供生产就绪的多智能体AI编排,支持部署54+专业智能体,具备自学习能力、容错共识和企业级安全。
vs →

相关搜索

chinese-llm-benchmark 替代工具最佳 RAG / Knowledge Base 工具 2026开源 RAG / Knowledge Basechinese-llm-benchmark 教程chinese-llm-benchmark 对比LLM EvaluationChinese LLMsAI Benchmark

评论

登录后发表评论
  • ?
    usr_seed_06472026年5月22日

    The reliable agent design scales well from prototype to production — 5、minimax-m2、deepseek-v3. Good documentation, reduces onboarding time.

  • ?
    usr_seed_02552026年5月3日

    The clean approach to agent memory is more reliable than alternatives — rele评测:中文ai大模型能力评测(持续更新):目前已囊括335个大模型,覆盖chatgpt、gpt-5. Would recommend for clean use cases.

  • ?
    usr_seed_06312026年3月29日

    The robust agent design scales well from prototype to production. Runs fine on Python 3.11.

  • ?
    usr_seed_08032026年3月14日

    The solid approach to agent memory is more reliable than alternatives. The maintainers are responsive to issues.

本页内容
01功能特性02为什么选择它03权衡点04兼容性05使用场景06同类对比
CopilotKit logo
CopilotKit★ 36.2k
CopilotKit 是一个开源开发工具包,旨在帮助您在Web应用程序中构建和部署深度集成的AI助手和智能体,提供快速集成、框架无关性和生产就绪的UI。
vs →
awesome-n8n-templates logo
awesome-n8n-templates★ 24.0k
该仓库收集了来自互联网的n8n自动化模板,旨在简化各类任务和工作流程的自动化。
vs →
dagster logo
dagster★ 15.9k
Dagster 是面向 MLOps 时代的数据编排器,旨在开发和维护模型、数据集和报告等数据资产。
vs →
genai-toolbox logo
genai-toolbox★ 16.0k
MCP 数据库工具箱是一个开源的数据库MCP服务器,旨在通过处理连接池、认证等复杂性,帮助开发者更轻松、更快、更安全地开发工具。
vs →
mcp-chrome logo
mcp-chrome★ 12.2k
将您的Chrome浏览器变成智能助手,让AI掌控浏览器,实现强大的自动化功能。
vs →
查看全部替代品 →
07
同类工具
统计
GitHub Stars★ 6.3k
最后更新1周前
状态活跃
许可证—
分类RAG / 知识库
热度趋势 (30d)
+0.2k↑ 4.6%
链接
文档↗讨论↗问题↗版本↗

Deploy on DigitalOcean — Get $200 Free Credit

Ad