在 Claude Desktop 中用自然语言完成网页抓取、爬取、结构化提取与向量库同步。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"scrapedatshi-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请抓取这个产品页面,并提取标题、价格、规格和主要卖点,输出为结构化 JSON。
返回该页面的结构化字段结果,便于后续分析或入库。
请从这个网站开始爬取所有帮助中心页面,整理每页标题、URL 和正文摘要。
返回多页面抓取结果及整理后的内容列表。
把抓取到的文档内容做结构化提取后,同步到向量数据库,供后续 RAG 检索使用。
完成内容抽取与向量库同步,形成可检索的数据基础。
研究员或开发者可在 Claude Desktop 中用自然语言指定站点或页面,抓取并整理内容。适合为 RAG 知识库准备网页数据来源。
数据分析师可将网页内容提取为结构化字段,减少手动复制整理。适用于产品页、文档页或信息列表页的数据收集。
当团队需要把网页内容持续接入向量数据库时,可借助该工具完成抓取、提取与同步。这样能让后续检索或问答使用更新后的内容。
它是在 Claude Desktop 中使用的 MCP 工具,可通过自然语言执行网页抓取、站点爬取、结构化数据提取,以及向量数据库同步。描述中提到它基于 scrapedatshi 的 RAG pipeline API。
已知前置条件包括 Claude Desktop,以及 scrapedatshi RAG pipeline API。更具体的安装方法、配置步骤或密钥要求,见源码仓库。
从描述看,它不仅支持抓取和爬取,还强调用自然语言操作、结构化提取,以及与向量数据库同步。是否支持更多能力或特定集成方式,见源码仓库。
帮助你抓取与爬取网页、提取数据并同步到向量数据库。
提供网页抓取与批量采集能力,支持选择器提取、隐身模式和自动化处理。
抓取网页并提取链接与指定内容,支持静态解析和无头浏览器回退。
抓取网页并转为 Markdown,便于提问、摘要和提取关键信息。
帮助抓取网站内容、构建向量知识库并进行语义检索问答。
将网页链接按给定结构提取为经过校验的类型化 JSON 数据。