dsh-image-subagent
by yuqingsh
让纯文本主模型(如 deepseek-v4-pro)也能接收图片附件:图片进入会话后投影为携带完整 attachmentId 的显式文本占位符,由主模型委托视觉子代理读取。
安装
dsh plugin --profile web add github:yuqingsh/dsh-image-subagentGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
让纯文本主模型(如 deepseek-v4-pro)也能接收图片附件:图片进入会话后投影为携带完整 attachmentId 的显式文本占位符,由主模型委托视觉子代理读取。
版本与 dsh 的对应关系:
v0.1.x—— dsh0.1.0-rc.x(rc.6 时代,通过"补报 image 能力"放行门禁);v0.2.0—— dsh≥ 0.1.1-rc.2(0.1.1 适配版,通过"抹除模态声明"放行门禁,详见下文"适配策略")。
适配策略(v0.2.0 为什么这样改)
0.1.1 的图片准入门禁只拒绝显式声明 inputModalities 且不含 image 的路由,声明省略(undefined)视为负能力直接放行;同时官方适配器对纯文本路由已有原生占位投影(只含 sha256 前 8 位摘要)。因此本版把旧版的"补报 image 能力"改为"抹除纯文本路由的 inputModalities 声明":
- 门禁:
undefined→ 放行,贴图不再被拒绝; - 适配器:仍按纯文本路由处理 → 本插件在主循环路径投影为富占位(完整 id + 委托提示),漏网路径由官方原生占位兜底——不存在把图片当真发给纯文本端点的失败模式;
read_image工具门禁:主模型路由undefined→ 仍拒绝(主模型不能自己读图,委托流保持不变);- 视觉路由(如
deepseek-v4-flash-vision-exp)完全不受影响:声明含 image,插件旁路,原生直读。
安装
# 本地 checkout(推荐,方便跟进改动)
dsh plugin --profile web add ./dsh-image-subagent
# 或按 git 标签
dsh plugin --profile web add github:yuqingsh/dsh-image-subagent#v0.2.0
需要 pnpm(brew install pnpm)。安装后重启 dsh web 并刷新页面。
用 Prompt 安装
把下面这段发给你的 DSH 会话,让 Agent 代装:
请安装 dsh-image-subagent 插件:在 /Users/kane/Documents/OpenCode 下运行
dsh plugin --profile web add ./dsh-image-subagent。完成后重启 dsh web 进程,刷新浏览器页面。
使用
前置条件
- 预设里有一个视觉子代理(如
subagent_observer),其模型声明 image 输入(如deepseek-v4-flash-vision-exp或 MiniMax-M3); - 该子代理的工具集包含
read_image; - 贴图进入会话后,主模型会收到富占位文本(含
id=sha256:<64位hex>),委托时把占位符里给出的附件对象路径传给子代理。
日常使用
贴图并附上问题 → 门禁放行 → 主模型收到富占位符(含完整 id=sha256:… 和附件对象路径)→ 委托 subagent_observer 用 read_image 读该路径 → 返回像素级描述 → 主模型作答。
附件对象路径规则:~/.dsh/attachments/v1/objects/<id 前 2 位 hex>/<64 位 hex>。
验证安装
curl -s -X POST http://127.0.0.1:3080/image-subagent/status \
-H 'content-type: application/json' \
-d '{"type":"client-request","rpcId":"s1","method":"status","payload":{}}'
预期(v0.2.0):bridged 为 "(omitted — paste gate passes)",real 为 ["text"](路由真实声明)。旧版 v0.1.x 的预期是 bridged 含 "image"。
License
MIT
原始 README: https://github.com/yuqingsh/dsh-image-subagent/blob/main/README.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。