影瞳 Shadow Vision

影瞳 Shadow Vision

已上线 v0.1.1

让只会读文字的 AI,也能看懂图片

当你把截图、票据或界面交给文本模型,却只能得到“我看不到图片”:影瞳把视觉能力接成 MCP 工具,让你继续在原来的 Agent 里识别、分析和重构。

01 / 结果

它怎么帮你

01

在原来的 Agent 里直接看图

接入 MCP 后,Codex、Claude Code、Cursor 等客户端可以继续用原来的对话处理图片,不必换一套工具。

02

不用被单一模型绑住

视觉后端可以换成 Ollama、OpenAI-compatible、Anthropic 或 Gemini,按任务、成本和效果选择。

03

敏感图片可以留在本机

使用 Ollama 时,图片和推理都留在自己的设备上,内部截图和私密资料不必经过云端。

04

图片从哪里来都能接上

本地文件、base64 数据和远程图片 URL 都可以作为输入,并带有远程请求的安全限制。

03 / 你可以让它做什么

从“看见”到“做事”

你给 Agent 的不只是一张图片,而是可以继续处理、检查和生成的结构化结果。

01
vision_ocr

把截图、票据、文档和表格里的文字提取出来,让 Agent 能继续搜索、整理和引用。

02
vision_inspect

当你问“这张界面哪里有问题”时,先让 Agent 理解画面,再给出解释、检查或图表解读。

03
vision_annotate

读懂圈选、箭头、下划线和荧光标记,把你指出的重点对应到画面中的对象。

04
vision_layout

把界面拆成元素、位置、文字样式和关系,方便审查设计、定位问题或继续生成代码。

05
vision_reconstruct

从一张参考截图生成 HTML、React 或 SVG 草稿,省去从空白页面开始搭建的第一步。

06
vision_compare

把改前改后、连续帧或多张资料放在一起,让 Agent 找出变化、差异和前后关系。

04 / 按你的数据边界选择

按你的数据边界选择视觉来源

本地、云端或兼容服务,都通过同一个 MCP 入口接入。

01

Ollama

图片和推理留在本机,适合代码截图、内部文档等不想外传的内容。

02

OpenAI Compatible

已有 LM Studio、vLLM 或其他 OpenAI 协议服务时,改配置即可接入,不必换客户端。

03

Anthropic

需要更强的图像理解和推理时,可以直接换用 Claude 视觉模型。

04

Gemini

处理更复杂的图像内容时,可以选择 Gemini 的多模态能力。

05 / 接入你正在用的 Agent

你的 Agent 不用换,先让它看见

接好一次,Codex、Claude Code、Cursor 等客户端都能使用同一个视觉入口。

统一启动命令:uv run shadow-vision

Codex
Claude Code
Cursor
VS Code Copilot
Windsurf
Claude Desktop
OpenCode

02 / 使用场景

使用场景

01

开发者

把报错截图、页面草图或设计稿交给 Agent,它可以先看懂,再检查、解释或生成代码。

02

研究和资料整理

从论文图表、扫描文档和表格中提取信息,减少截图、复制和人工核对的往返。

03

不想把图片交给云端

用本地 Ollama 处理敏感截图和内部资料,把数据边界留在自己的设备上。