AgentBench
活跃·★ 3.8k·Apache-2.0·更新于 2026-02-08
★ 时下流行★ 必备神器
AgentBench是一个综合性基准测试平台,旨在评估大型语言模型(LLM)在各种不同环境中的智能体表现,现已推出与AgentRL集成的函数调用版本。它为操作系统交互、数据库操作和网络购物等任务提供了容器化设置,实现了稳健且可复现的智能体评估。
#LLM评估#智能体基准测试#函数调用#Docker#多任务学习
01
功能特性
01对大型语言模型作为智能体在多样化环境中的表现进行全面评估。
02集成函数调用功能,实现更高级的智能体交互。
03采用Docker Compose进行完全容器化部署,确保可复现性。
04支持多任务和多轮交互,提供真实的智能体评估。
05可扩展的框架,方便添加新的评估任务。
02
兼容性
Docker
原生支持
已通过文档验证
Python
原生支持
已通过文档验证
OpenAI API
支持
已通过文档验证
Large Language Models
支持
已通过文档验证
03
快速开始
1
$ pip install -r requirements.txt
04
使用场景
↳系统地基准测试各种基于LLM的智能体的性能。
↳开发和改进高级LLM智能体架构和策略。
↳进行关于智能体AI能力和局限性的学术研究。
05
同类工具
评论
登录后发表评论
暂无评论,来发表第一条吧