$ loading_
通过 OpenRouter 连接视觉模型,完成图像描述、OCR、视觉问答与目标检测。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"Vision MCP Server" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请对这张截图执行 OCR,按原有段落顺序提取所有可见文字,并标出无法识别的部分。
返回按顺序整理的文字内容,并注明识别不清的位置。
查看这张图片并回答:图中主要物体是什么?它们大概位于哪里?请用要点列出。
输出基于图像内容的简明问答结果。
对这张图片做目标检测,列出识别到的对象类别及其大致位置。
返回对象清单与位置说明,可用于后续分析。
研究员、办公人员或开发者可用它对截图、扫描件或界面图片执行 OCR,提取文字用于检索、归档或后续处理。
当用户需要理解一张图片里的内容时,可通过视觉问答让模型直接回答图中有什么、发生了什么或关键元素在哪里。
开发者可在多模态流程中调用目标检测能力,识别图像中的对象类别与位置,作为自动分析的一部分。
这是一个 MCP 服务器,提供图像描述、OCR、视觉问答和目标检测等多模态视觉工具。它通过 OpenRouter 调用任意视觉模型来完成这些能力。
根据描述,它依赖 OpenRouter 与视觉模型,因此通常需要可用的 OpenRouter 配置。更具体的密钥、环境变量或运行要求见源码仓库。
它专门提供视觉相关能力,可直接处理图片并完成 OCR、图像理解、问答与目标检测。普通文本工具通常不覆盖这些图像分析功能。
让 AI 通过视觉模型分析图片视频、识别文字并比较视觉内容。
帮助用户截图并用视觉模型分析屏幕、窗口与图片内容。
让纯文本模型调用多模态 API,识别并描述图片内容。
通过图像识别生成文字描述,适合在应用中快速接入视觉理解能力。
通过单一图像分析工具识别截图、文本与界面稿内容,便于多模型视觉集成。
让大模型通过文件、链接或Base64识别并描述图片内容的视觉工具