PyScrappy
活跃·★ 200·MIT·更新于 2026-09-08
★ 时下流行★ 宝藏工具
PyScrappy是一个AI原生的网络爬虫工具包,旨在将网站转化为结构化的、LLM就绪的数据。它既可以作为独立的Python库使用,也可以作为MCP服务器暴露,使AI代理能够直接访问和处理网络信息。
PyScrappy 当前归类于 Browser Automation,更适合那些希望围绕具体工作流而不是单一功能点来选型的团队。从当前资料来看,它尤其强调 通用网页抓取,输出结构化的文本、链接、图片和表格。、赋能AI代理(如Claude、Ollama)获取并集成实时网页数据。 这类能力。如果你关心许可证与可二次使用性,当前页面记录的许可证是 MIT。同时它也具备一定社区热度,当前 GitHub Stars 为 200。
#网络爬虫#AI代理#LLM数据准备#Python库#MCP服务器#数据提取#浏览器自动化#API集成
01
功能特性
01通用网页抓取,输出结构化的文本、链接、图片和表格。
02LLM就绪的输出格式,支持Markdown、JSON和DataFrame。
03MCP服务器功能,将爬虫作为工具暴露给AI代理。
04可选的Playwright后端,用于动态网站的JavaScript渲染。
05支持代理和爬虫API服务以绕过网站封锁。
02
为什么选择它
+通用网页抓取,输出结构化的文本、链接、图片和表格。
+赋能AI代理(如Claude、Ollama)获取并集成实时网页数据。
+覆盖 6 个兼容环境或平台,更适合需要跨端部署的团队。
+提供公开仓库并标注 MIT 许可证,便于评估可维护性与采用成本。
03
权衡点
!同分类下还有 8 个相关工具可比较,最终选择更适合在同类对比后决定。
04
兼容性
Python
运行时
已通过文档验证
Playwright
JS渲染
已通过文档验证
Pandas
数据框
已通过文档验证
MCP (Model Context Protocol)
代理协议
已通过文档验证
AI Agents
集成
已通过文档验证
Scraping API Services
反爬虫服务
已通过文档验证
05
快速开始
1
$ pip install pyscrappy
06
使用场景
↳赋能AI代理(如Claude、Ollama)获取并集成实时网页数据。
↳将任意网页内容转换为干净、结构化的数据,供大型语言模型使用。
↳使用内置的专用爬虫(如维基百科、IMDB、亚马逊)从热门网站收集特定信息。
↳使用CSS选择器从任意URL进行自定义数据提取。
↳通过自定义插件扩展抓取能力,以支持新的数据源。
07
同类对比
≈PyScrappy 属于 Browser Automation 分类,适合与 CopilotKit 等同类工具一起比较,而不是单独判断。
≈如果你的核心需求更接近“赋能AI代理(如Claude、Ollama)获取并集成实时网页数据。”,那么这类场景会比泛用型工具对比更有参考价值。
≈PyScrappy 采用 MIT 许可证,社区热度都应该与同类项目一起看。
08
同类工具
相关搜索
评论
登录后发表评论
暂无评论,来发表第一条吧