在原来的 Agent 里直接看图
接入 MCP 后,Codex、Claude Code、Cursor 等客户端可以继续用原来的对话处理图片,不必换一套工具。
影瞳 Shadow Vision
当你把截图、票据或界面交给文本模型,却只能得到“我看不到图片”:影瞳把视觉能力接成 MCP 工具,让你继续在原来的 Agent 里识别、分析和重构。
01 / 结果
接入 MCP 后,Codex、Claude Code、Cursor 等客户端可以继续用原来的对话处理图片,不必换一套工具。
视觉后端可以换成 Ollama、OpenAI-compatible、Anthropic 或 Gemini,按任务、成本和效果选择。
使用 Ollama 时,图片和推理都留在自己的设备上,内部截图和私密资料不必经过云端。
本地文件、base64 数据和远程图片 URL 都可以作为输入,并带有远程请求的安全限制。
03 / 你可以让它做什么
你给 Agent 的不只是一张图片,而是可以继续处理、检查和生成的结构化结果。
vision_ocr把截图、票据、文档和表格里的文字提取出来,让 Agent 能继续搜索、整理和引用。
vision_inspect当你问“这张界面哪里有问题”时,先让 Agent 理解画面,再给出解释、检查或图表解读。
vision_annotate读懂圈选、箭头、下划线和荧光标记,把你指出的重点对应到画面中的对象。
vision_layout把界面拆成元素、位置、文字样式和关系,方便审查设计、定位问题或继续生成代码。
vision_reconstruct从一张参考截图生成 HTML、React 或 SVG 草稿,省去从空白页面开始搭建的第一步。
vision_compare把改前改后、连续帧或多张资料放在一起,让 Agent 找出变化、差异和前后关系。
04 / 按你的数据边界选择
本地、云端或兼容服务,都通过同一个 MCP 入口接入。
图片和推理留在本机,适合代码截图、内部文档等不想外传的内容。
已有 LM Studio、vLLM 或其他 OpenAI 协议服务时,改配置即可接入,不必换客户端。
需要更强的图像理解和推理时,可以直接换用 Claude 视觉模型。
处理更复杂的图像内容时,可以选择 Gemini 的多模态能力。
05 / 接入你正在用的 Agent
接好一次,Codex、Claude Code、Cursor 等客户端都能使用同一个视觉入口。
统一启动命令:uv run shadow-vision
02 / 使用场景
把报错截图、页面草图或设计稿交给 Agent,它可以先看懂,再检查、解释或生成代码。
从论文图表、扫描文档和表格中提取信息,减少截图、复制和人工核对的往返。
用本地 Ollama 处理敏感截图和内部资料,把数据边界留在自己的设备上。