AgentIndex icon
AgentIndex
工具分类热门最新对比
提交工具
工具分类热门最新对比
首页/
Observability/
AgentBench
AgentBench logo

AgentBench

活跃·★ 3.6k·Apache-2.0·更新于 2026-02-08
★ 时下流行★ 必备神器

AgentBench是一个综合性基准测试平台,旨在评估大型语言模型(LLM)在各种不同环境中的智能体表现,现已推出与AgentRL集成的函数调用版本。它为操作系统交互、数据库操作和网络购物等任务提供了容器化设置,实现了稳健且可复现的智能体评估。

AgentBench 当前归类于 Observability,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 对大型语言模型作为智能体在多样化环境中的表现进行全面评估。、系统地基准测试各种基于LLM的智能体的性能。 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 Apache-2.0。同时它也具备一定社区热度,当前 GitHub Stars 为 3.6k。

#LLM评估#智能体基准测试#函数调用#Docker#多任务学习
$ 安装
$ pip install -r requirements.txt
↗ 访问官网★ GitHub
01

功能特性

01对大型语言模型作为智能体在多样化环境中的表现进行全面评估。
02集成函数调用功能,实现更高级的智能体交互。
03采用Docker Compose进行完全容器化部署,确保可复现性。
04支持多任务和多轮交互,提供真实的智能体评估。
05可扩展的框架,方便添加新的评估任务。
02

为什么选择它

+对大型语言模型作为智能体在多样化环境中的表现进行全面评估。
+系统地基准测试各种基于LLM的智能体的性能。
+覆盖 4 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 Apache-2.0 许可证,便于评估可维护性与采用成本。
03

权衡点

!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04

兼容性

Docker
原生支持
已通过文档验证
Python
原生支持
已通过文档验证
OpenAI API
支持
已通过文档验证
Large Language Models
支持
已通过文档验证
05

快速开始

1
$ pip install -r requirements.txt
06

使用场景

↳系统地基准测试各种基于LLM的智能体的性能。
↳开发和改进高级LLM智能体架构和策略。
↳进行关于智能体AI能力和局限性的学术研究。
07

同类对比

≈AgentBench 属于 Observability 分类,适合与 worldmonitor 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“系统地基准测试各种基于LLM的智能体的性能。”,那么这类场景会比泛用型工具对比更有参考价值。
≈AgentBench 采用 Apache-2.0 许可证,社区热度都应该与同类项目一起看。
08

同类工具

worldmonitor logo
worldmonitor★ 62.5k
World Monitor 是一个由AI驱动的实时全球情报仪表板,用于新闻聚合、地缘政治监测和基础设施追踪,提供统一的态势感知界面。
vs →
GitHub MCP Server logo
GitHub MCP Server★ 31.6k
GitHub MCP 服务器将AI工具直接连接到GitHub平台,使AI代理、助手和聊天机器人能够通过自然语言交互管理GitHub资源和自动化工作流。
vs →
chinese-llm-benchmark logo
chinese-llm-benchmark★ 6.3k
ReLE评测是一个持续更新的中文AI大模型能力评测项目,涵盖数百个主流大模型和多维度评测领域。
vs →
FinnewsHunter logo
FinnewsHunter★ 1.5k
FinnewsHunter是一个基于AgenticX框架的企业级金融新闻分析平台,通过多智能体协作、实时新闻流和深度量化分析,为量化交易提供决策级Alpha信号。
vs →
xLAM logo
xLAM★ 634
xLAM是一个研究大型行动模型(LAM)的仓库,通过聚合和统一不同环境的代理轨迹数据,优化代理训练的数据加载和训练流程。
vs →
QuantDinger logo
QuantDinger★ 9.8k
QuantDinger 是一个新一代AI量化交易平台,提供AI驱动的策略构建、回测和交易功能,以本地优先、隐私至上的方式运行。
vs →
minima logo
minima★ 1.1k
Minima 是一个开源的本地RAG(检索增强生成)容器解决方案,能够与ChatGPT、Anthropic Claude和自定义LLM集成。
vs →
QuantDinger logo
QuantDinger★ 9.8k
QuantDinger 是一个开源的AI交易操作系统,旨在将交易想法转化为Python策略,并涵盖回测、模拟交易、实盘执行及监控的全栈解决方案。
vs →
查看全部替代品 →

相关搜索

AgentBench 替代工具最佳 Observability 工具 2026开源 ObservabilityAgentBench 教程AgentBench 对比LLM EvaluationAgent BenchmarkingFunction Calling

评论

登录后发表评论

暂无评论,来发表第一条吧

本页内容
01功能特性02为什么选择它03权衡点04兼容性05快速开始06使用场景07同类对比08同类工具
统计
GitHub Stars★ 3.6k
最后更新5个月前
状态活跃
许可证Apache-2.0
分类可观测性
热度趋势 (30d)
+0.1k↑ 4.3%
链接
文档↗讨论↗问题↗版本↗

Deploy on DigitalOcean — Get $200 Free Credit

Ad
© 2026 AgentIndex.app|由十年 iOS 开发者构建。
QYSGitHub请作者喝咖啡 ☕

按分类浏览

代码助手工作流自动化RAG / 知识库多智能体浏览器自动化大模型基础设施开发者工具可观测性

与 Anthropic, OpenAI 或 Microsoft 无关。