$ loading_
将截图识别结果转为描述或坐标,辅助界面自动化。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"visual-intelligence-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请查看这张截图,描述界面里有哪些关键元素和可见状态。
返回对截图界面的简要文字描述。
请分析当前屏幕截图,输出可用于自动化点击的结构化 JSON 坐标。
返回可机器读取的坐标数据。
请根据这张本地截图判断页面状态,并指出下一步可操作区域。
返回页面状态说明和可操作区域。
当自动化代理需要“看屏幕”时,可把本地截图发给该工具识别。它能帮助判断当前界面状态,并为后续操作提供依据。
适合需要点击、定位或标注界面元素的场景。工具可返回结构化 JSON 坐标,便于程序直接使用。
当你只想知道截图里有什么、页面展示了什么时,可让它输出描述性结果,减少人工查看成本。
它是一个 MCP 工具,通过 API relay 把“看屏幕/截图”的请求交给多模态模型处理。它能为 Codex/Claude Code 提供图像识别能力。
它可以返回截图的文字描述,也可以返回用于 UI 自动化的结构化 JSON 坐标。
适合分析本地截图、辅助界面自动化代理理解屏幕内容。更多信息见源码仓库。
让不具备视觉能力的模型识别截图与图片内容并返回结构化理解结果
通过图像理解能力分析截图、识别文字并比较视觉差异,辅助开发与办公判断。
让纯文本编码代理分析本地图片,并返回 Markdown 与结构化证据。
通过单一图像分析工具识别截图、文本与界面稿内容,便于多模型视觉集成。
帮助用户截图屏幕与网页,并进行界面对比和视觉回归测试。
用支持视觉的 AI 模型完成图像分析、OCR、场景描述与图片比对。