vision-route
by 314857493
注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。
Registers a `deepseek-vision` provider route: the Web GUI accepts pasted images and transcribes them to text via the free Zhipu GLM vision API before delegating to the DeepSeek adapter.
安装
dsh plugin --profile web add github:314857493/dsh-vision#path:/packages/vision-routeGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
给 DeepSeek Harness(DSH)注册一个自动识图包装路由:声明图像输入(inputModalities: ['text','image']),
粘贴到 Web GUI 的图片在请求流里被免费的智谱 GLM 视觉模型(glm-4v-flash 降级链)转译成文字,再委派给真正的
目标适配器。默认是 deepseek-official → deepseek-vision,也可包裹火山方舟等自定义 provider。
完整说明见仓库根目录的 README。
安装(发布后)
dsh plugin --profile web add dsh-vision-proxy-route
或在 profile 的 cordis.patch.yml 中追加:
- insert:
- id: dsh-vision-proxy-route
name: dsh-vision-proxy-route
前提
- DSH
0.1.0-rc.5/rc.6/rc.7(依赖ctx.llm.registerAdapter/registration(provider).adapter/resolveModel.inputModalities/ctx.attachments.readImage这些插件缝) - 智谱 GLM 免费 key:环境变量
GLM_API_KEY或ZHIPU_API_KEY(Windows 也可setx GLM_API_KEY "id.secret",插件自动读注册表)
使用
模型选择器切到「DeepSeek + 自动识图」,直接粘贴图片/截图并附带问题即可。后续可用“这张图” “上一张”“第一张”或“两张图对比”等方式追问;路由会在有限的最近用户轮次内选择对应 attachment, 带上本次问题重新分析,并按顺序编号后注入当前消息。弱指代只关联紧邻图片,无关的“登录页面” 或“这个问题”不会触发旧图重传。主模型不需要 DSH 内部绝对路径,用户也无需重复上传图片。
视觉描述会被标成不可信观察数据;图片里的命令或提示词只作为可见文字,不会成为下游模型指令。 临时网络、Key 或限流错误不会进入缓存,恢复后同一问题可以直接重试。
转译失败会替换为 [图片转译失败: ...] 文本,对话不卡死。
自定义 provider
目标 provider 须先在 DSH 中配置并可正常完成纯文本请求。然后为本插件设置:
- insert:
- id: dsh-vision-proxy-route-ark
name: dsh-vision-proxy-route
config:
targetProvider: volcengine-ark
provider: volcengine-ark-vision
displayName: 火山方舟 + 自动识图
| config | 默认值 | 说明 |
|---|---|---|
targetProvider |
deepseek-official |
真正处理转译后文字请求的 provider |
provider |
deepseek-vision |
新包装路由的 ID,必须与目标不同 |
displayName |
DeepSeek + 自动识图 |
模型选择器显示名称;自定义目标时默认使用 <targetProvider> + 自动识图 |
包装路由会在模型枚举、模型解析、重试策略和流请求阶段把自身 provider 映射回 targetProvider,
因此可委派给 dsh-llm-pi-ai 这类同时服务多个 provider 的适配器。
原始 README: https://github.com/314857493/dsh-vision/blob/main/packages/vision-route/README.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。