FunASR
活跃·★ 20.3k·MIT·更新于 2026-09-10
★ 最受欢迎★ 语音处理★ 大模型基础设施
FunASR 是一个基础的端到端语音识别工具包。它提供工业级的语音识别能力,比 Whisper 快 170 倍,支持 50 多种语言,并集成了说话人分离、情感检测和流式识别等功能。
FunASR 当前归类于 Voice / Speech,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 极速识别 (比 Whisper 快 170 倍)、带说话人标签、时间戳和标点符号的会议转录 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 MIT。同时它也具备一定社区热度,当前 GitHub Stars 为 20.3k。
#asr#audio#中文#emotion-recognition#MCP 服务器#MCP 服务器#multilingual-asr#openai-compatible-api
01
功能特性
01极速识别 (比 Whisper 快 170 倍)
02支持 50 多种语言
03内置说话人分离
04情感检测
05流式语音识别及 vLLM 加速
02
为什么选择它
+极速识别 (比 Whisper 快 170 倍)
+带说话人标签、时间戳和标点符号的会议转录
+覆盖 4 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 MIT 许可证,便于评估可维护性与采用成本。
03
权衡点
!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04
兼容性
PyTorch
PyTorch
已通过文档验证
GPU
GPU (CUDA)
已通过文档验证
CPU
CPU
已通过文档验证
Docker
Docker
已通过文档验证
05
快速开始
1
$ pip install funasr
06
使用场景
↳带说话人标签、时间戳和标点符号的会议转录
↳部署为兼容 OpenAI 的 API 服务器
↳与 AI 智能体集成(如 Claude, LangChain, Dify, AutoGen)
07
同类对比
≈FunASR 属于 Voice / Speech 分类,适合与 OpenClaw 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“带说话人标签、时间戳和标点符号的会议转录”,那么这类场景会比泛用型工具对比更有参考价值。
≈FunASR 采用 MIT 许可证,社区热度都应该与同类项目一起看。
08
同类工具
相关搜索
评论
登录后发表评论
- ?usr_seed_05742026年5月3日
Language coverage beyond English is a meaningful differentiator.
- ?usr_seed_01012026年4月3日
Active development from Alibaba's speech research team, keeps improving.
- ?usr_seed_09922026年3月26日
170x realtime speech recognition across 50+ languages is genuinely industrial-grade.
- ?usr_seed_03612026年3月24日
Good for teams building speech-enabled AI applications that need production ASR.