chinese-llm-benchmark
ReLE评测(原名CLiB)是一个持续更新的中文AI大模型能力评测项目,已覆盖337个商用及开源大模型。它提供多维度能力评测和综合排行榜,并包含超200万的大模型缺陷库,以帮助社区研究和改进模型。
chinese-llm-benchmark 当前归类于 RAG / Knowledge Base,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 广泛覆盖337+个商用及开源中文大模型。、对比和选择特定应用场景下表现最佳的大模型。 这类能力。同时它也具备一定社区热度,当前 GitHub Stars 为 6.3k。