dsh-vision-bridge
by doebkblcya
DSH Web GUI 动态视觉桥接插件:粘贴的图片按需调用百炼视觉模型(qwen3-vl-flash / qwen-vl-ocr)识别
Dynamic vision bridge plugin for the DSH Web GUI: pasted images are recognized on demand via Bailian vision models (qwen3-vl-flash / qwen-vl-ocr)
安装
dsh plugin --profile web add github:doebkblcya/dsh-vision-bridgeGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
English | 中文
为 DSH (DeepSeek Harness) Web GUI 提供图片识别能力的 cordis 原生插件:聊天界面支持粘贴图片,由主模型(DeepSeek)按需决定调用哪个视觉模型——视觉问答用 qwen3-vl-flash,纯文字提取(OCR)用 qwen-vl-ocr,统一走阿里百炼 OpenAI 兼容接口。
功能特性
- GUI 放行图片:注册
deepseek-vision包装路由,声明inputModalities: ['text', 'image'],聊天框可粘贴图片。 - 动态识图(零预转译):粘贴图片后不预先盲转译内容,而是把图片块替换为提示文字(含 sha256 附件标识),由 DeepSeek 根据用户问题与上下文现写 prompt 调用识图工具——零额外调用、零信息预判。
- 两个识图工具:
describe_image(image, prompt)—— 视觉问答(qwen3-vl-flash),prompt 由主模型每次按需编写。extract_text(image)—— OCR(qwen-vl-ocr),按阅读顺序原样提取图中文字。
- 三种图片入参:
http(s)URL / 本地文件路径 / 会话粘贴的附件标识(sha256:…)。 - 健壮性:MIME 嗅探(PNG/JPEG/GIF/WebP)、20MB 上限、401/403 明确提示、超时与空返回保护。
能力一览
| 能力 | 状态 |
|---|---|
| GUI 支持粘贴图片 | ✅ |
describe_image 视觉问答(qwen3-vl-flash) |
✅ |
extract_text OCR(qwen-vl-ocr) |
✅ |
| prompt 由主模型每次现写(无固定模板) | ✅ |
| URL / 本地路径 / sha256 附件三种入参 | ✅ |
| MIME 嗅探 + 大小限制 + 明确报错 | ✅ |
工作原理
插件是单文件 cordis 原生插件:把官方 deepseek-official 适配器包装成 deepseek-vision 路由,工具实现里直连百炼接口。
flowchart LR
U[用户粘贴图片] --> G[GUI 放行<br/>inputModalities text+image]
G --> W[deepseek-vision 路由<br/>包装 deepseek-official]
W --> H[hintBlocks: 图片块 →<br/>含 sha256 标识的提示文字]
H --> M[主模型 DeepSeek<br/>看到提示]
M -->|视觉问答| D[describe_image<br/>qwen3-vl-flash]
M -->|提取文字| E[extract_text<br/>qwen-vl-ocr]
D --> B[百炼 compatible-mode<br/>/chat/completions]
E --> B
B --> R[文字结果回填对话]
设计要点:识图调用的 prompt 完全由 DeepSeek 决定,每次根据用户问题和对话上下文现写——同一张发票,问「金额」和问「税号」时传给视觉模型的问题不同,信息量最大化、调用次数最小化。
安装
把插件文件放到 DSH Web profile 的插件目录:
cp vision-bridge.js ~/.dsh/profiles/web/plugins/
插件依赖 llm 与 tools 服务,且需要官方 llm-deepseek(deepseek-official 适配器)已加载——插件会包装它注册 deepseek-vision 路由。
在 ~/.dsh/.env 中配置阿里百炼 API Key(二选一):
DASHSCOPE_API_KEY=sk-xxxx
# 或
VISION_API_KEY=sk-xxxx
Key 可在阿里云百炼控制台获取。
开发
无需构建——插件是单个纯 JS 文件,改完重启 Web 服务即可。模型名写在文件顶部常量中(VISION_MODEL / OCR_MODEL),换成其他百炼模型(如 qwen-vl-max、qwen3-vl-plus)后重启生效。
注意事项
- 附件必须在会话中发送过才能被读取(插件按 sha256 在 DSH 附件存储中查找)。
- 该插件只解决「看图」——主模型 DeepSeek 本身不支持图片输入,DSH 内置的
read_image工具单独无法使用。
License
MIT
原始 README: https://github.com/doebkblcya/dsh-vision-bridge/blob/main/README.zh-CN.md ↗
同类插件
查看全部 →
agent-vision-toolkit
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

api-relay-audit
从 DeepSeek Harness 对 AI API 中转站和 LLM 代理运行本地安全审计,生成 Markdown 报告,覆盖提示词注入、模型替换信号、工具调用改写、错误泄漏、流完整性和按 profile 启用的 Web3 风险。

OpenStory
✨ OpenStory 现已支持 DeepSeek Harness 插件! 现在可以通过 dsh-openstory 将 OpenStory 多智能体推演接入 DeepSeek Harness,让 agent 直接启动模拟、查看角色、下达指令并逐回合推进故事。查看 DSH 插件配置与使用指南。

phi
pi的编码代理 ∞ 提供者、子代理、hashline编辑和权限门

anysearch-dsh
DeepSeek Harness(DSH)的 AnySearch 网络搜索提供方与高级搜索工具。

codex-switch
Codex Switch 是一个 macOS 工具,一键配置 Codex 的自定义 API,同时保留官方 OpenAI 登录。保存后 Codex 的模型选择器里只会出现你选的那个 provider 的模型。也支持 Claude Code 的官方 / 自定义 API 切换。Codex Switch is a lightweight helper for configuring multiple coding-agent API routes. For Codex, it keeps Official OpenAI and a custom API provider configured in parallel, registers the custom model in Codex's mod