$ loading_
让纯文本大模型借助云端视觉能力理解图片与视频内容
复制安装指令,让 AI 自动完成配置 · 推荐新手
"vision-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请读取这张图片中的全部文字,并按段落整理输出;如果有表格,请尽量保留结构。
返回图片 OCR 结果,包含整理后的正文或表格文本。
请描述这张图片里有哪些主体、它们在做什么,并总结画面的关键信息。
返回对图片内容的结构化描述与总结。
请查看这个视频,概括主要内容,并列出可识别的关键画面信息与媒体基本信息。
返回视频内容摘要,以及可用的媒体信息说明。
开发者在使用仅支持文本的大模型时,可通过该 MCP 工具接入云端视觉模型,让模型理解图片内容并进行对话。适合需要多模态理解但当前模型本身不支持视觉的场景。
研究员、产品经理或办公人员可用它对截图、扫描件或图片执行 OCR,快速获取可复制的文本内容。对于需要把视觉内容转成文本处理的任务尤其有用。
当任务涉及视频概览、画面元素识别或 grounding 时,这个工具可帮助模型读取视频并返回相关视觉信息。适合做内容检查、素材理解或多媒体辅助分析。
它是一个 MCP 工具,用云端视觉模型为纯文本大模型补充看图看视频能力。已知能力包括视觉对话、OCR、grounding 和媒体信息工具。
根据描述,它支持图片和视频输入,并可让模型理解其中内容。更具体的格式支持范围见源码仓库。
描述中提到提供免费 GLM fallback,说明在部分场景下可使用 GLM 作为备用视觉能力。具体触发方式和限制见源码仓库。
让纯文本大模型接入视觉能力,解析本地或在线图片内容。
帮助用户识别图片内容、提取图片文字,并用自定义提示完成视觉分析。
让纯文本编码代理读取图片、视频和截图并返回结构化分析结果
让大模型通过文件、链接或Base64识别并描述图片内容的视觉工具
为纯文本大模型接入视觉理解能力,并支持多提供商自动回退。
通过 OpenRouter 连接视觉模型,完成图像描述、OCR、视觉问答与目标检测。