$ loading_
帮助你抓取与爬取网页、提取数据并同步到向量数据库。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"scrapedatshi-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
抓取这个文档网站的所有公开页面,提取正文内容并通过 scrapedatshi 的 RAG 流程同步到向量数据库,保留页面标题和来源链接。
返回抓取与入库结果,包括已处理页面及同步状态。
爬取这组网页链接,提取每页的正文文本与元数据,并输出可用于后续向量化的数据集。
得到结构化提取结果,包含文本内容与基础元数据。
使用一个嵌入模型提供商和目标向量数据库,对抓取到的网站内容执行提取并同步,展示所用提供商配置。
完成内容同步,并说明采用的嵌入与向量数据库提供商。
开发者或研究人员可用它批量抓取和爬取网页,将提取后的内容同步到向量数据库,作为检索增强生成的数据来源。
当团队需要把分散在网站中的公开信息转成可检索数据时,这个工具可负责提取内容并接入向量化流程。
如果项目使用不同的嵌入模型或向量数据库提供商,它可在同一抓取与同步流程中支持多种提供商选择。
它让 Claude 能执行网页抓取、爬取、数据提取,并通过 scrapedatshi 的 RAG 流程同步到向量数据库。
已知它支持多个嵌入提供商和向量数据库提供商,但给定素材未列出具体名单;详情见源码仓库。
给定信息没有说明具体安装步骤、运行时或密钥要求。若需配置细节,请见源码仓库。
在 Claude Desktop 中用自然语言完成网页抓取、爬取、结构化提取与向量库同步。
提供网页抓取与批量采集能力,支持选择器提取、隐身模式和自动化处理。
帮助抓取网站内容、构建向量知识库并进行语义检索问答。
抓取网页并提取链接与指定内容,支持静态解析和无头浏览器回退。
抓取网页并转为 Markdown,便于提问、摘要和提取关键信息。
抓取网页并转为 Markdown,便于采集内容与接入智能代理流程。