$ loading_
帮助用户截图并用视觉模型分析屏幕、窗口与图片内容。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"Vision MCP Server" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请截图当前屏幕,识别界面中的主要区域、按钮和可能的可用性问题,并给出优化建议。
返回界面结构说明、关键元素清单,以及可执行的体验优化建议。
请列出我当前打开的所有窗口,并按应用分类,说明每个窗口的大致内容。
输出窗口列表、所属应用,以及每个窗口内容的简要概述。
请分析这张图片,描述其中的对象、文字、布局和可能传达的信息。
生成图片内容摘要,包含视觉元素、文字信息和整体含义解读。
通过单一图像分析工具识别截图、文本与界面稿内容,便于多模型视觉集成。
让 AI 通过视觉模型分析图片视频、识别文字并比较视觉内容。
用本地 Ollama 模型实现截图解析、OCR 识别与视觉监控自动化。
抓取网页或本地应用截图,并用本地视觉模型自动分析界面内容与问题
用视觉大模型分析本地或远程图片并生成清晰文字描述。
帮助用户识别图片内容、提取图片文字,并用自定义提示完成视觉分析。