抓取静态网页HTML内容并提取结构化信息,供AI分析与后续处理。
该工具声明功能较单一:通过 BeautifulSoup 抓取静态 HTML 供 MCP 客户端分析,材料中未见需要密钥或明确第三方远程端点。整体未发现明显高风险红旗,但作为会执行代码并进行网页抓取的第三方开源工具,仍需留意其本机执行与网络访问边界,以及仓库较新且采用度低带来的供应链不确定性。
材料明确标注无需密钥或环境变量,未见要求用户提供 API token、账号凭证或本地敏感认证信息,因此凭证泄露面较小。
虽然未声明固定远程端点,但“scrapes static HTML”意味着工具按功能需要发起网络请求获取网页内容;这属于该类工具的常规能力。材料未说明请求范围、目标限制或是否记录/转发抓取结果,因此应关注实际访问目标与数据外发边界。
系统检查项已标明会执行代码;作为 MCP server,它通常会在本机运行进程并处理抓取/解析逻辑。当前材料未显示超出声明功能的系统权限申请,也未见执行任意 shell 命令的明确描述,因此属常规注意级别而非高风险。
从描述看,主要访问对象应是用户指定的网页 HTML 内容;材料未说明需要额外读取/写入本地文件,也未声明广泛数据权限。由于 README 缺失,无法确认是否存在缓存、日志或临时文件写入,建议核实其默认数据落盘行为。
正面因素是有公开 GitHub 源码、可审计,较闭源方案风险低;但来源为 third_party_registry,许可证未声明,社区采用仅 0 star,维护状态未知,且缺少 README 细节,供应链可信度与持续维护性证据偏弱,需在使用前自行审阅代码与依赖。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"MCP Web Scraper" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请抓取这个网页的静态 HTML,提取标题、正文、作者和发布时间,并整理为 JSON:https://example.com/article
返回包含文章核心字段的结构化 JSON,便于后续分析或入库。
抓取该分类页中的商品名称、价格、链接和评分,输出为表格数据:https://example.com/shop
返回商品清单及关键字段,可直接用于比价、统计或数据清洗。
抓取这个页面的所有可见链接,按导航、正文和页脚分类,并给出链接文本与 URL:https://example.com
返回分类后的链接列表,帮助快速理解网站结构与信息入口。
通过 ScrapingBee 抓取网页并按选择器提取结构化数据,便于分析与自动化处理。
帮助用户礼貌抓取网页并提取链接、表格与结构化内容,支持受限异步爬取
提供网页抓取与文档检索能力,帮助快速收集网页信息并查询技术文档。
抓取网页并提取为 Markdown,便于模型读取、分析与后续自动化处理。
分析网页设计结构与页面元素,快速提取布局、导航和内容信息
抓取网页并提取干净正文、发现链接,支持最多10个网址批量获取