AgentIndex icon
AgentIndex
工具分类热门最新对比
提交工具
工具分类热门最新对比
首页/
LLM Infra/
on-policy
on-policy logo

on-policy

活跃·★ 2.1k·MIT·更新于 2024-07-18
★ 时下流行★ 强化学习★ 多智能体AI

该存储库实现了MAPPO,一种PPO的多智能体变体,广泛应用于合作多智能体游戏和研究。它为星际争霸II、花火和谷歌足球等多种多智能体环境提供了健壮的实现,并附有详细的训练脚本和超参数指南。

on-policy 当前归类于 LLM Infra,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 MAPPO(多智能体PPO)的实现、合作多智能体强化学习的研究与实验 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 MIT。同时它也具备一定社区热度,当前 GitHub Stars 为 2.1k。

#多智能体强化学习#PPO#MAPPO#强化学习#PyTorch
$ 安装
$ pip install -e .
↗ 访问官网★ GitHub
01

功能特性

01MAPPO(多智能体PPO)的实现
02支持多样化的多智能体环境(如星际争霸II、花火)
03提供各种场景的即用型训练脚本
04详细的超参数指导和最新结果
05默认支持智能体间的共享策略
02

为什么选择它

+MAPPO(多智能体PPO)的实现
+合作多智能体强化学习的研究与实验
+覆盖 5 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 MIT 许可证,便于评估可维护性与采用成本。
03

权衡点

!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04

兼容性

StarCraftII (SMAC)
原生支持
已通过文档验证
Hanabi
原生支持
已通过文档验证
Multiagent Particle-World Environments (MPEs)
原生支持
已通过文档验证
Google Research Football (GRF)
原生支持
已通过文档验证
StarCraftII (SMAC) v2
原生支持
已通过文档验证
05

快速开始

1
$ pip install -e .
06

使用场景

↳合作多智能体强化学习的研究与实验
↳评估PPO在多智能体强化学习场景中的有效性
↳为星际争霸II和花火等流行多智能体游戏训练AI智能体
07

同类对比

≈on-policy 属于 LLM Infra 分类,适合与 MetaGPT 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“合作多智能体强化学习的研究与实验”,那么这类场景会比泛用型工具对比更有参考价值。
≈on-policy 采用 MIT 许可证,社区热度都应该与同类项目一起看。
08

同类工具

MetaGPT logo
MetaGPT★ 69.4k
MetaGPT是一个多智能体框架,为大型语言模型(LLMs)分配不同的角色,使其能够协作完成复杂任务。
vs →
cua logo
cua★ 20.2k
Cua是一个开源平台,用于构建、基准测试和部署能够操作任何计算机的智能体,并提供隔离的、可自托管的沙盒环境(Docker、QEMU、Apple Vz)。
vs →
rllm logo
rllm★ 5.7k
rLLM是一个通过强化学习对语言代理进行后训练的开源框架。
vs →
ir-sim logo
ir-sim★ 1.1k
IR-SIM是一个基于Python的轻量级开源机器人模拟器,专为导航、控制和强化学习设计,提供用户友好的框架以快速原型开发。
vs →
verl-agent logo
verl-agent★ 2.1k
verl-agent是veRL的扩展,专为通过强化学习训练大型语言模型(LLM)代理而设计,其独特的步进独立多轮回滚机制使其能高度可扩展地处理长周期多轮RL训练。
vs →
maro logo
maro★ 922
MARO(多智能体资源优化)平台是一个强化学习即服务(RaaS)实例,用于解决现实世界的资源优化问题。
vs →
skrl logo
skrl★ 1.1k
skrl是一个用Python编写的开源模块化强化学习库,支持PyTorch、JAX和NVIDIA Warp,并专注于模块化、可读性、简单性和算法实现的透明性。
vs →
virtualhome logo
virtualhome★ 623
VirtualHome是一个交互式平台,通过程序模拟复杂的家庭活动,并提供丰富的环境交互。
vs →
查看全部替代品 →

相关搜索

on-policy 替代工具最佳 LLM Infra 工具 2026开源 LLM Infraon-policy 教程on-policy 对比Multi-Agent Reinforcement LearningPPOMAPPO

评论

登录后发表评论

暂无评论,来发表第一条吧

本页内容
01功能特性02为什么选择它03权衡点04兼容性05快速开始06使用场景07同类对比08同类工具
统计
GitHub Stars★ 2.1k
最后更新2年前
状态活跃
许可证MIT
分类大模型基础设施
热度趋势 (30d)
+0k↑ 4.4%
链接
文档↗讨论↗问题↗版本↗

Deploy on DigitalOcean — Get $200 Free Credit

Ad
© 2026 AgentIndex.app|由十年 iOS 开发者构建。
QYSGitHub请作者喝咖啡 ☕

按分类浏览

代码助手工作流自动化RAG / 知识库多智能体浏览器自动化大模型基础设施开发者工具可观测性

与 Anthropic, OpenAI 或 Microsoft 无关。