AgentBench
活跃·★ 3.6k·Apache-2.0·更新于 2026-02-08
★ 时下流行★ 必备神器
AgentBench是一个综合性基准测试平台,旨在评估大型语言模型(LLM)在各种不同环境中的智能体表现,现已推出与AgentRL集成的函数调用版本。它为操作系统交互、数据库操作和网络购物等任务提供了容器化设置,实现了稳健且可复现的智能体评估。
AgentBench 当前归类于 Observability,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 对大型语言模型作为智能体在多样化环境中的表现进行全面评估。、系统地基准测试各种基于LLM的智能体的性能。 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 Apache-2.0。同时它也具备一定社区热度,当前 GitHub Stars 为 3.6k。
#LLM评估#智能体基准测试#函数调用#Docker#多任务学习
01
功能特性
01对大型语言模型作为智能体在多样化环境中的表现进行全面评估。
02集成函数调用功能,实现更高级的智能体交互。
03采用Docker Compose进行完全容器化部署,确保可复现性。
04支持多任务和多轮交互,提供真实的智能体评估。
05可扩展的框架,方便添加新的评估任务。
02
为什么选择它
+对大型语言模型作为智能体在多样化环境中的表现进行全面评估。
+系统地基准测试各种基于LLM的智能体的性能。
+覆盖 4 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 Apache-2.0 许可证,便于评估可维护性与采用成本。
03
权衡点
!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04
兼容性
Docker
原生支持
已通过文档验证
Python
原生支持
已通过文档验证
OpenAI API
支持
已通过文档验证
Large Language Models
支持
已通过文档验证
05
快速开始
1
$ pip install -r requirements.txt
06
使用场景
↳系统地基准测试各种基于LLM的智能体的性能。
↳开发和改进高级LLM智能体架构和策略。
↳进行关于智能体AI能力和局限性的学术研究。
07
同类对比
≈AgentBench 属于 Observability 分类,适合与 worldmonitor 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“系统地基准测试各种基于LLM的智能体的性能。”,那么这类场景会比泛用型工具对比更有参考价值。
≈AgentBench 采用 Apache-2.0 许可证,社区热度都应该与同类项目一起看。
08
同类工具
相关搜索
评论
登录后发表评论
暂无评论,来发表第一条吧