$ loading_
通过本地 OCR 与云端视觉模型完成图片识别、文字提取和内容描述。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"dsh-vision" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请读取这张截图中的所有文字,并按原有段落顺序输出。
返回图片中的文字内容,尽量保持原始结构与顺序。
请描述这张图片的主要内容,包括场景、主体对象和可见文字。
返回一段清晰的视觉描述,概括图片中能看到的关键信息。
请从这张海报中提取标题、时间、地点和其他关键信息,并整理成列表。
返回结构化的信息列表,便于快速查看和后续整理。
办公人员或研究人员可用它从截图、海报或扫描图片中提取文字,减少手动录入。适合需要快速整理图像内文本信息的场景。
开发者可通过 MCP 调用该工具,对图片进行视觉描述与内容理解。适合需要把图像信息接入 AI 工作流的场景。
当用户需要从海报、界面截图或宣传图中快速抓取重点时,该工具可结合 OCR 与视觉模型提供文字和内容摘要。这样能更高效地处理图像资料。
它通过 MCP 提供图像理解能力,包括使用本地 OCR 提取图片文字,以及借助云端视觉语言模型生成视觉描述。
是的。给定描述明确提到它同时提供本地 OCR 和云端 VLM 能力,可用于文字提取与图像描述。
现有素材未说明具体安装步骤、依赖环境或密钥要求。相关细节见源码仓库。
将图片转换为结构化描述与 OCR 文本,帮助纯文本大模型理解图像内容。
为无视觉能力的编程模型自动解析图片并返回文字理解结果,辅助上下文编码。
用支持视觉的 AI 模型完成图像分析、OCR、场景描述与图片比对。
让纯文本大模型借助云端视觉能力理解图片与视频内容
让纯文本大模型接入视觉能力,解析本地或在线图片内容。
让大模型通过文件、链接或Base64识别并描述图片内容的视觉工具