$ loading_
让纯文本模型通过 read_image 工具读取图片并返回文字描述。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"image-vision-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请使用 read_image 工具读取这张截图,并用中文概括界面内容、主要文字和可能的操作入口。
返回截图的文字描述、界面结构和关键信息。
请读取本地路径中的图片文件,并描述画面中的主要对象、场景和可见细节。
输出对图片内容的自然语言描述。
请通过图片 URL 调用 read_image,判断图片里展示了什么,并提取可见文字。
返回图片含义与可见文字摘要。
当主模型本身不能直接看图时,可以借助这个 MCP 工具把图片交给视觉 API,再把文字结果带回主模型。适合需要“看懂图片但不切换模型”的工作流。
它支持本地路径、URL、data URL 和 base64 等多种图片输入形式,便于在不同应用中接入图片理解能力。
适合在自动化或编排场景中,先读取图片再让主模型基于描述继续推理、总结或生成后续动作。
它提供一个 read_image 工具,让纯文本模型也能通过视觉 API 获取图片的文字描述。返回结果会回到主模型中继续处理。
根据描述,它支持本地路径、URL、data URL 和 base64。
它会把图片转发到任意 OpenAI-compatible vision API,因此需要可用的兼容视觉接口。其余安装与运行细节见源码仓库。
让纯文本模型调用多模态 API,识别并描述图片内容。
让无视觉能力的智能体读取图片内容、OCR文字并提取结构化数据。
让纯文本大模型接入视觉能力,解析本地或在线图片内容。
为 AI 编码助手接入图像理解能力,识别截图并辅助开发分析。
让大模型通过文件、链接或Base64识别并描述图片内容的视觉工具
用多种视觉模型识别和分析图片,并回答相关问题的 MCP 工具