kreuzberg
活跃·★ 8.7k·MIT·更新于 2026-07-20
★ 时下流行★ 必备神器
Kreuzberg 是一个高性能、多语言库,旨在从57种以上文件格式中提取文本和元数据,并提供全面的OCR功能。它基于Rust核心构建,以原生速度处理数据,内存高效,并能生成嵌入向量而无需GPU,使其在各种数据提取和处理任务中具有极高的通用性。
kreuzberg 当前归类于 Vision / Multimodal,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 可扩展架构,带有用于自定义后端和处理器的插件系统。、从各种文档类型中自动提取文本、元数据和结构化数据。 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 MIT。同时它也具备一定社区热度,当前 GitHub Stars 为 8.7k。
#文档处理#数据提取#光学字符识别#多语言#嵌入向量
01
功能特性
01可扩展架构,带有用于自定义后端和处理器的插件系统。
02多语言支持,为10多种编程语言提供原生绑定。
03全面支持8大类、57种以上文件格式,包括Office文档、PDF和图像。
04先进的OCR功能,支持多种后端和智能表格检测。
05基于Rust核心、SIMD优化和完全并行化带来的高性能。
02
为什么选择它
+可扩展架构,带有用于自定义后端和处理器的插件系统。
+从各种文档类型中自动提取文本、元数据和结构化数据。
+覆盖 12 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 MIT 许可证,便于评估可维护性与采用成本。
03
权衡点
!当前页面没有提供明确的安装命令,落地前可能还需要回到官方文档确认部署步骤。
!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04
兼容性
Rust
核心库
已通过文档验证
Python
语言绑定
已通过文档验证
Elixir
语言绑定
已通过文档验证
Node.js
语言绑定
已通过文档验证
WASM
WebAssembly 支持
已通过文档验证
Java
语言绑定
已通过文档验证
05
使用场景
↳从各种文档类型中自动提取文本、元数据和结构化数据。
↳构建智能文档处理管道,用于数据摄取和分析。
↳为非结构化和半结构化内容实现高效的搜索和检索系统。
06
同类对比
≈kreuzberg 属于 Vision / Multimodal 分类,适合与 ragflow 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“从各种文档类型中自动提取文本、元数据和结构化数据。”,那么这类场景会比泛用型工具对比更有参考价值。
≈kreuzberg 采用 MIT 许可证,社区热度都应该与同类项目一起看。
07
同类工具
相关搜索
评论
登录后发表评论
暂无评论,来发表第一条吧