dsh-image-to-path
by cesaryike
让 DSH 纯文本模型对话也能拖图/贴图:图片自动保存到会话工作区,以文件路径交给模型。
Lets DSH text-only chats accept dragged/pasted images: images are saved to the session workspace and handed to the model as file paths.
安装
dsh plugin --profile web add github:cesaryike/dsh-image-to-pathGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
让 DSH 纯文本模型对话也能拖图/贴图:图片自动保存到会话工作区,以文件路径交给模型。
Let DSH text-only-model conversations accept images: saved to the session workspace and handed to the model as a file path.
解决什么问题
DSH WebUI 把拖入的图片作为 base64 附件发送,纯文本模型会直接拒绝——无论装没装视觉工具,只要当前对话是纯文本模型,图片就发不出去。本插件接管拖放/粘贴,把图片保存到当前会话工作区,以路径文本插入输入框,模型拿到路径后可交给任何工具(包括视觉工具)处理。
- 多模态模型不受影响:自动检测当前模型能力,支持图片的模型走原生附件通道,只有纯文本模型才走路径方案;
- 没有视觉工具也能用:发送的只是路径文本;提示会如实告知当前环境能否看图;
- 不产生重复拷贝:内容寻址去重,同一张图只落一份;工作区已有的图直接原位引用。
安装
# 本地开发(先 pnpm install 装全 peer 依赖)
dsh plugin --profile web add /path/to/dsh-image-to-path
# 从 GitHub(仓库已提交 lib/,免构建授权)
dsh plugin --profile web add github:cesaryike/dsh-image-to-path
# 或 tarball
pnpm pack && dsh plugin --profile web add ./dsh-image-to-path-0.1.0.tgz
安装后重启 Web Profile 生效。
使用
拖入或粘贴图片即可:图片保存到工作区的 dsh-image-to-path-uploads/ 目录,输入框出现文件名芯片,发送时模型收到完整路径。该目录可随时手动清理,不影响插件。
配置
| 字段 | 默认 | 说明 |
|---|---|---|
subdir |
dsh-image-to-path-uploads |
保存子目录 |
maxImageBytes |
10485760 |
单图上限(10 MiB) |
interceptUnknownModels |
false |
未声明能力的模型是否按纯文本拦截(内置适配器均声明,一般无需改动)。注意:即使开启,provider 未注册或能力查询失败时仍按放行处理(fail-open),并在宿主日志记录警告 |
按行 id image-to-path 在 profile 的 cordis.patch.yml 中覆盖。
工作原理
拖图/贴图 → 当前模型支持图片?→ 是:原生附件通道(体验不变)
→ 否(纯文本):上传 → 魔数校验 → SHA-256 去重 → 原子写入工作区
→ 引用芯片插入输入框 → 发送时序列化为路径文本 → 模型/视觉工具
安全
仅接受图片魔数、服务端命名、原子写、10 MiB 上限、同源校验;无任何远程请求。
许可
贡献者
- cesaryike:作者——产品定义、功能方向、文档与发布;
- DeepSeek AI(DSH agent):核心工程实现与修复(见提交历史)。
原始 README: https://github.com/cesaryike/dsh-image-to-path/blob/main/README.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。