on-policy
活跃·★ 2.1k·MIT·更新于 2024-07-18
★ 时下流行★ 强化学习★ 多智能体AI
该存储库实现了MAPPO,一种PPO的多智能体变体,广泛应用于合作多智能体游戏和研究。它为星际争霸II、花火和谷歌足球等多种多智能体环境提供了健壮的实现,并附有详细的训练脚本和超参数指南。
on-policy 当前归类于 LLM Infra,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 MAPPO(多智能体PPO)的实现、合作多智能体强化学习的研究与实验 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 MIT。同时它也具备一定社区热度,当前 GitHub Stars 为 2.1k。
#多智能体强化学习#PPO#MAPPO#强化学习#PyTorch
01
功能特性
01MAPPO(多智能体PPO)的实现
02支持多样化的多智能体环境(如星际争霸II、花火)
03提供各种场景的即用型训练脚本
04详细的超参数指导和最新结果
05默认支持智能体间的共享策略
02
为什么选择它
+MAPPO(多智能体PPO)的实现
+合作多智能体强化学习的研究与实验
+覆盖 5 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 MIT 许可证,便于评估可维护性与采用成本。
03
权衡点
!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04
兼容性
StarCraftII (SMAC)
原生支持
已通过文档验证
Hanabi
原生支持
已通过文档验证
Multiagent Particle-World Environments (MPEs)
原生支持
已通过文档验证
Google Research Football (GRF)
原生支持
已通过文档验证
StarCraftII (SMAC) v2
原生支持
已通过文档验证
05
快速开始
1
$ pip install -e .
06
使用场景
↳合作多智能体强化学习的研究与实验
↳评估PPO在多智能体强化学习场景中的有效性
↳为星际争霸II和花火等流行多智能体游戏训练AI智能体
07
同类对比
≈on-policy 属于 LLM Infra 分类,适合与 MetaGPT 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“合作多智能体强化学习的研究与实验”,那么这类场景会比泛用型工具对比更有参考价值。
≈on-policy 采用 MIT 许可证,社区热度都应该与同类项目一起看。
08
同类工具
相关搜索
评论
登录后发表评论
暂无评论,来发表第一条吧