$ loading_
为纯文本大模型接入视觉理解能力,并支持多提供商自动回退。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"Vision MCP Server" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请通过 Vision MCP Server 分析这张应用截图,说明界面结构、关键按钮位置,以及用户下一步可能执行的操作。
返回基于图像内容的界面说明、重点元素识别和操作判断。
请使用 Vision MCP Server 查看这张图片,总结其中可见的主要对象、文字信息和场景含义。
输出图像中的对象、文字与场景摘要,供后续问答或处理使用。
通过 Vision MCP Server 处理这张图片;如果首选视觉提供商不可用,请自动切换到其他兼容提供商并继续完成分析。
在提供商异常时仍尽量完成图像分析,提高视觉请求的稳定性。
开发者在已有仅支持文本的大模型工作流中接入该 MCP 工具,让模型能够读取和分析图片内容,而无需改造整体对话逻辑。
当单一视觉服务不稳定或不可用时,团队可以利用自动回退机制把请求路由到其他提供商,减少任务中断。
产品经理或研究人员可让模型基于截图理解界面结构、识别可见元素,并辅助整理视觉反馈。
它是一个 MCP 服务器,用兼容 Z.AI 的视觉工具为纯文本大模型提供看图能力,并可在多个提供商之间路由请求。
支持。原始描述明确提到会在多个提供商之间进行路由,并在需要时自动回退,以提高可用性。
给定素材没有提供安装步骤、运行时或密钥要求。具体前置条件见源码仓库。
通过 OpenRouter 连接视觉模型,完成图像描述、OCR、视觉问答与目标检测。
通过单一图像分析工具识别截图、文本与界面稿内容,便于多模型视觉集成。
帮助用户截图并用视觉模型分析屏幕、窗口与图片内容。
让纯文本编码代理读取图片、视频和截图并返回结构化分析结果
帮助代理理解本地、网页或Base64图片内容并返回结构化分析结果
让纯文本大模型借助云端视觉能力理解图片与视频内容