$ loading_
让大模型通过文件、链接或Base64识别并描述图片内容的视觉工具
复制安装指令,让 AI 自动完成配置 · 推荐新手
"llm-vision-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请读取这个本地图片路径并详细描述画面内容、界面元素和可见文字:/Users/demo/Desktop/screen.png
返回对截图内容的结构化描述,包括主要对象、布局和文字信息。
请分析这个图片链接中的内容,并判断它更像产品图、海报还是界面截图,同时说明依据:https://example.com/image.jpg
给出图片类型判断,并附上对视觉内容和判断依据的简要说明。
下面是一段Base64图片数据,请识别图片中的主要物体、场景和文字,并输出简洁摘要:<base64_image_data>
输出对Base64图片内容的简明识别结果,适合程序进一步处理。
用视觉大模型分析本地或远程图片并生成清晰文字描述。
让不具备视觉能力的 AI 客户端借助本地 Ollama 模型完成看图、OCR 与图像问答。
用多种视觉模型识别和分析图片,并回答相关问题的 MCP 工具
通过图像识别生成文字描述,适合在应用中快速接入视觉理解能力。
让纯文本模型调用多模态 API,识别并描述图片内容。
通过单一图像分析工具识别截图、文本与界面稿内容,便于多模型视觉集成。