你在做网页数据抓取时,发现不同站点的页面结构差异很大:有的只是静态 HTML,有的要滚动、翻页、点击后才出数据。你不想一上来就选过重的方案,也不希望抓取流程经常失效,所以需要一组更稳、能按页面复杂度分层选型的方案。
如果你追求稳定优先,不要先看“能不能抓”,而要先看页面类型。纯静态 HTML 页面,reclaimergold-mcp-web-scraper 最省事;有翻页、滚动、截图或交互,tai-dt-selenium-mcp-server 更稳;想走礼貌抓取、提取链接表格等结构化内容,eitan3-scrapy-mcp 更合适;如果你已经在 Rube MCP 体系里,且希望把抓取流程托管出去,composiohq-composio-skills-scrapingbee-automation 和 composiohq-composio-skills-zenrows-automation 更适合批量化与自动化编排。
| 名称 | 类型 | 热度 | 点评 | |
|---|---|---|---|---|
| MCP Web Scraper | MCP | — | 适合静态网页 HTML 抓取与结构化信息提取;优点是目标清晰、流程轻;缺点是描述里只强调静态网页,不适合需要复杂浏览器交互的页面。 | |
| Selenium MCP Server | MCP | — | 适合需要翻页、滚动、截图或智能提取的动态页面;优点是覆盖真实浏览器操作场景更全面;缺点是相对更重,不适合所有简单静态抓取。 | |
| scrapy-mcp | MCP | — | 适合礼貌抓取网页并提取链接、表格与结构化内容;优点是定位明确,兼顾结构化提取与受限异步爬取;缺点是候选信息未强调浏览器级交互,对强前端动态页未必是首选。 | |
| scrapingbee-automation | SKILL | ★ 68k | 适合已在 Rube MCP 中编排网页抓取任务与数据流程;优点是便于自动化执行抓取流程;缺点是它是通过 Rube MCP 的 skill,更依赖既有自动化体系。 | |
| zenrows-automation | SKILL | ★ 68k | 适合希望通过 Rube MCP 自动化执行网页抓取与数据采集任务的场景;优点是面向网页抓取任务本身,便于批量流程化;缺点是同样属于 skill 方案,不如直接型 mcp 那样强调本地逐步调试。 |
适合静态网页 HTML 抓取与结构化信息提取;优点是目标清晰、流程轻;缺点是描述里只强调静态网页,不适合需要复杂浏览器交互的页面。
适合需要翻页、滚动、截图或智能提取的动态页面;优点是覆盖真实浏览器操作场景更全面;缺点是相对更重,不适合所有简单静态抓取。
适合礼貌抓取网页并提取链接、表格与结构化内容;优点是定位明确,兼顾结构化提取与受限异步爬取;缺点是候选信息未强调浏览器级交互,对强前端动态页未必是首选。
适合已在 Rube MCP 中编排网页抓取任务与数据流程;优点是便于自动化执行抓取流程;缺点是它是通过 Rube MCP 的 skill,更依赖既有自动化体系。
适合希望通过 Rube MCP 自动化执行网页抓取与数据采集任务的场景;优点是面向网页抓取任务本身,便于批量流程化;缺点是同样属于 skill 方案,不如直接型 mcp 那样强调本地逐步调试。
先按页面复杂度选。静态网页优先试 `reclaimergold-mcp-web-scraper`;如果目标页需要滚动、翻页、截图或浏览器交互,再上 `tai-dt-selenium-mcp-server`;如果你更关注礼貌抓取、链接和表格提取,可试 `eitan3-scrapy-mcp`;若你已经在 Rube MCP 工作流里,且要批量自动化,则看 `composiohq-composio-skills-scrapingbee-automation` 或 `composiohq-composio-skills-zenrows-automation`。
当页面内容本身就是静态 HTML 时,不必先用 `tai-dt-selenium-mcp-server`。浏览器自动化更适合需要真实页面操作的场景;如果只是抓取静态内容并提取结构化信息,`reclaimergold-mcp-web-scraper` 往往更直接,流程也更轻。
如果你要把抓取纳入 Rube MCP 的自动化流程,`composiohq-composio-skills-scrapingbee-automation` 和 `composiohq-composio-skills-zenrows-automation` 更顺手,因为它们本身就是通过 Rube MCP 自动执行抓取任务。若你更需要本地、可控、针对具体页面逐步调试,则 `eitan3-scrapy-mcp`、`reclaimergold-mcp-web-scraper`、`tai-dt-selenium-mcp-server` 更像直接可用的抓取工具。
最常见的坑是页面类型判断错误:把动态交互页当静态页抓,会觉得 `reclaimergold-mcp-web-scraper` 不稳;把简单静态页一律交给 `tai-dt-selenium-mcp-server`,又会让流程变重。另一个坑是目标并不是普通网页内容,而是更偏搜索结果或大范围结构化数据流程,这时直接选 `composiohq-composio-skills-scrapingbee-automation` 或 `composiohq-composio-skills-zenrows-automation` 往往更省心。