dsh-vision-plugin
by rzhuzi
DeepSeek Harness 的视觉与图片理解插件
安装
dsh plugin --profile web add github:rzhuzi/dsh-vision-pluginGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
给 DeepSeek Harness(DSH)增加图片理解能力:把图片发送给兼容 OpenAI Chat Completions 多模态格式的视觉模型,再把识别结果注入当前会话,主模型即可继续基于图片内容回答。
已在完整 DSH 源码环境中完成集成、构建和实际运行测试。
功能
- 输入框右侧「识图」按钮,支持点选或拖拽图片
/shitu识别最近一张图片/shitu <图片路径>识别本地图片/shitu <问题>针对图片提问- 设置页配置接口地址、API Key、模型和超时
- 支持从兼容接口获取模型列表
目录
multimodal-vision/ Host 插件:识图命令、上传路由、视觉模型调用
vision-upload/ Client 插件:输入框「识图」按钮
ui-settings-plugins-卡片补丁/ 设置页识图配置卡片
安装
当前 DSH 仍处于预览阶段,部分客户端和设置页扩展点还需要集成补丁。
1. 放入源码
multimodal-vision/ → packages/multimodal/vision/
vision-upload/ → packages/client/vision-upload/
将:
ui-settings-plugins-卡片补丁/VisionCard.tsx
ui-settings-plugins-卡片补丁/vision-card-controller.ts
放到:
packages/client/ui-settings-plugins/src/client/
2. 设置命名空间
在:
packages/host/apiproxy/src/api-proxy.ts
的 WEB_SETTINGS_NAMESPACES 中加入:
'multimodal-vision'
3. 接入设置页
按:
ui-settings-plugins-卡片补丁/集成改动.md
修改 index.ts 和 locales.ts。
4. 接入 Web Bundle
在 packages/bundle/web-app/cordis.patch.yml 中加入:
- id: multimodal-vision
name: '@deepseek-ai/dsh-multimodal-vision'
config:
baseURL: !!js process.env.MMV_BASE_URL ?? 'https://api.openai.com/v1'
model: !!js process.env.MMV_MODEL ?? 'gpt-4o-mini'
- id: vision-upload
name: '@deepseek-ai/dsh-client-vision-upload'
在 packages/bundle/web-app/package.json 的 dependencies 中加入:
"@deepseek-ai/dsh-multimodal-vision": "workspace:^",
"@deepseek-ai/dsh-client-vision-upload": "workspace:^"
并在构建图加入:
tsconfig.host.json → { "path": "./packages/multimodal/vision" }
tsconfig.client.json → { "path": "./packages/client/vision-upload" }
5. 构建
pnpm install
pnpm run build:lib:host
pnpm run build:lib:client
然后重启:
pnpm dsh web
更完整的自动安装步骤见 INSTALL.md。
使用
- 打开 设置 → 插件 → 识图
- 填写接口地址、API Key 和模型
- 点击输入框右侧「识图」按钮选择图片
- 识别结果会自动进入当前会话
也可以直接使用:
/shitu
/shitu C:\path\image.png
/shitu 这张图里有什么?
配置
baseURL:接口地址,默认https://api.openai.com/v1model:视觉模型timeoutMs:请求超时apiKey:设置页或MMV_API_KEY环境变量
已知限制
- 当前拖拽需要拖到「识图」按钮上
- 原生输入区发图仍会走 DSH 自己的图片流程
- 识图结果目前以文本形式返回,不回填原图
- 某些兼容接口不支持
GET /models,此时模型名称需要手填
License
MIT
原始 README: https://github.com/rzhuzi/dsh-vision-plugin/blob/main/README.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。