dsh-plugin-multimodal
by shinjiyu
在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。
Advertise image paste on text-only DeepSeek routes, describe attachments with a vision sidecar, and leave native vision models untouched.
安装
dsh plugin --profile web add github:shinjiyu/dsh-plugin-multimodalGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
DeepSeek Harness 官方线路是纯文本。Web 里贴图会被拒:当前模型不支持图片。
这个插件补的是贴图准入,不是视觉工具箱。
- 主模型本身收图(Claude / GPT / 自建视觉网关)→ 原样把图交给模型,不转文字
- 主模型是纯文本(官方 DeepSeek)→ GUI 先收下图,sidecar 转成文字再发给主模型
see_image给磁盘上的截图用
官方 PI adapter 已经会做第 1 步,不会做第 2 步:不支持就 UNSUPPORTED_CONTENT。Anionex 的 dsh-vision-toolkit 是另一条路:给 agent 一堆 vision_* 工具,要模型自己去调。本插件让粘贴不被拒。
对应需求:Discussions #588 · 介绍帖:Show and tell #1709
安装
dsh plugin --profile web add github:shinjiyu/dsh-plugin-multimodal
本地路径:
dsh plugin --profile web add D:\tempWorkspace\dsh-plugin-multimodal
然后重启 dsh web。旧会话的工具表不会更新。
GitHub topic:dsh-plugin
配置
环境变量(不要把 key 写进仓库):
| 变量 | 作用 |
|---|---|
DSH_VISION_BASE_URL |
视觉接口,例如 https://api.example/v1 |
DSH_VISION_API_KEY |
该接口的 key |
DSH_VISION_MODEL |
必须是真能看图的模型,例如 glm-4.5v |
DSH_VISION_PROMPT |
可选。默认 OCR + 描述界面 |
没设 DSH_VISION_* 时回退 OPENAI_BASE_URL / OPENAI_API_KEY。GLM-5.2-FP8 这类文本模型不能当 sidecar。
也可以在 profile 的 cordis.patch.yml 里写:
- id: dsh-plugin-multimodal
name: dsh-plugin-multimodal
inject: [llm, tools, attachments, systemPrompt]
config:
model: glm-4.5v
apiKeyEnv: DSH_VISION_API_KEY
30 秒验收
- 主模型仍用官方纯文本(或 PocketCity 文本模型)
- 配好一个真能看图的 sidecar
- 在 Web 里粘贴一张报错截图,问「红字说了什么」
- 过关:不再弹「当前模型不支持图片」,主模型能引用图上的字
磁盘文件:让它调 see_image。
不要做
- 不要改
runtime/或官方 DeepSeek adapter - 不要把 sidecar 指到
deepseek-v4-flash/ 其它纯文本模型 - 不要把它宣传成「视觉工具箱」——那是 toolkit 的词
社区
微信群:deepseek harness 讨论群(2群)
扫码进群,用来分享和讨论插件。不是官方群。

微信群码大约 7 天过期(本张到 2026-08-23)。过期后把新码覆盖 docs/community/wechat-group-2.jpg 即可。
宣发稿(Discussions / V2EX / 群公告)在 docs/PROMO.md。
License
MIT
原始 README: https://github.com/shinjiyu/dsh-plugin-multimodal/blob/main/README.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。