on-policy:该存储库实现了MAPPO,一种PPO的多智能体变体,广泛应用于合作多智能体游戏和研究。它为星际争霸II、花火和谷歌足球等多种多智能体环境提供了健壮的实现,并附有详细的训练脚本和超参数指南。;best-of-Agent-Harnesses:该存储库提供了一个精选的AI智能体线束、编排框架及技术列表,对于构建可靠的智能体系统至关重要。它旨在帮助开发者和研究人员了解快速发展的AI智能体基础设施,提供有关其设计、功能和实际应用的深入见解。
合作多智能体强化学习的研究与实验
发现并选择合适的AI智能体线束和编排框架。