dsh-vision-bridge

by doebkblcya

0 模型与账号接入github未核验到 manifest收录于 08-17

DSH Web GUI 动态视觉桥接插件:粘贴的图片按需调用百炼视觉模型(qwen3-vl-flash / qwen-vl-ocr)识别

Dynamic vision bridge plugin for the DSH Web GUI: pasted images are recognized on demand via Bailian vision models (qwen3-vl-flash / qwen-vl-ocr)

安装

dsh plugin --profile web add github:doebkblcya/dsh-vision-bridge

GitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试

安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗

安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。

README

目录

English | 中文

为 DSH (DeepSeek Harness) Web GUI 提供图片识别能力的 cordis 原生插件:聊天界面支持粘贴图片,由主模型(DeepSeek)按需决定调用哪个视觉模型——视觉问答用 qwen3-vl-flash,纯文字提取(OCR)用 qwen-vl-ocr,统一走阿里百炼 OpenAI 兼容接口。

功能特性

  • GUI 放行图片:注册 deepseek-vision 包装路由,声明 inputModalities: ['text', 'image'],聊天框可粘贴图片。
  • 动态识图(零预转译):粘贴图片后不预先盲转译内容,而是把图片块替换为提示文字(含 sha256 附件标识),由 DeepSeek 根据用户问题与上下文现写 prompt 调用识图工具——零额外调用、零信息预判。
  • 两个识图工具:
    • describe_image(image, prompt) —— 视觉问答(qwen3-vl-flash),prompt 由主模型每次按需编写。
    • extract_text(image) —— OCR(qwen-vl-ocr),按阅读顺序原样提取图中文字。
  • 三种图片入参:http(s) URL / 本地文件路径 / 会话粘贴的附件标识(sha256:…)。
  • 健壮性:MIME 嗅探(PNG/JPEG/GIF/WebP)、20MB 上限、401/403 明确提示、超时与空返回保护。

能力一览

能力 状态
GUI 支持粘贴图片 ✅
describe_image 视觉问答(qwen3-vl-flash) ✅
extract_text OCR(qwen-vl-ocr) ✅
prompt 由主模型每次现写(无固定模板) ✅
URL / 本地路径 / sha256 附件三种入参 ✅
MIME 嗅探 + 大小限制 + 明确报错 ✅

工作原理

插件是单文件 cordis 原生插件:把官方 deepseek-official 适配器包装成 deepseek-vision 路由,工具实现里直连百炼接口。

flowchart LR
  U[用户粘贴图片] --> G[GUI 放行<br/>inputModalities text+image]
  G --> W[deepseek-vision 路由<br/>包装 deepseek-official]
  W --> H[hintBlocks: 图片块 →<br/>含 sha256 标识的提示文字]
  H --> M[主模型 DeepSeek<br/>看到提示]
  M -->|视觉问答| D[describe_image<br/>qwen3-vl-flash]
  M -->|提取文字| E[extract_text<br/>qwen-vl-ocr]
  D --> B[百炼 compatible-mode<br/>/chat/completions]
  E --> B
  B --> R[文字结果回填对话]

设计要点:识图调用的 prompt 完全由 DeepSeek 决定,每次根据用户问题和对话上下文现写——同一张发票,问「金额」和问「税号」时传给视觉模型的问题不同,信息量最大化、调用次数最小化。

安装

把插件文件放到 DSH Web profile 的插件目录:

cp vision-bridge.js ~/.dsh/profiles/web/plugins/

插件依赖 llm 与 tools 服务,且需要官方 llm-deepseek(deepseek-official 适配器)已加载——插件会包装它注册 deepseek-vision 路由。

在 ~/.dsh/.env 中配置阿里百炼 API Key(二选一):

DASHSCOPE_API_KEY=sk-xxxx
# 或
VISION_API_KEY=sk-xxxx

Key 可在阿里云百炼控制台获取。

开发

无需构建——插件是单个纯 JS 文件,改完重启 Web 服务即可。模型名写在文件顶部常量中(VISION_MODEL / OCR_MODEL),换成其他百炼模型(如 qwen-vl-max、qwen3-vl-plus)后重启生效。

注意事项

  • 附件必须在会话中发送过才能被读取(插件按 sha256 在 DSH 附件存储中查找)。
  • 该插件只解决「看图」——主模型 DeepSeek 本身不支持图片输入,DSH 内置的 read_image 工具单独无法使用。

License

MIT

原始 README: https://github.com/doebkblcya/dsh-vision-bridge/blob/main/README.zh-CN.md ↗

同类插件

查看全部 →
模型与账号接入Anionex

agent-vision-toolkit

为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

查看详情
928github+08-16
模型与账号接入toby-bridges

api-relay-audit

从 DeepSeek Harness 对 AI API 中转站和 LLM 代理运行本地安全审计,生成 Markdown 报告,覆盖提示词注入、模型替换信号、工具调用改写、错误泄漏、流完整性和按 profile 启用的 Web3 风险。

查看详情
791github+08-21
模型与账号接入ZJU-LLMs

OpenStory

✨ OpenStory 现已支持 DeepSeek Harness 插件! 现在可以通过 dsh-openstory 将 OpenStory 多智能体推演接入 DeepSeek Harness,让 agent 直接启动模拟、查看角色、下达指令并逐回合推进故事。查看 DSH 插件配置与使用指南。

查看详情
377github+08-17
模型与账号接入pulseaiclub

phi

pi的编码代理 ∞ 提供者、子代理、hashline编辑和权限门

查看详情
89github+08-16
模型与账号接入anysearch-team

anysearch-dsh

DeepSeek Harness(DSH)的 AnySearch 网络搜索提供方与高级搜索工具。

查看详情
79github+08-17
模型与账号接入kuangre123

codex-switch

Codex Switch 是一个 macOS 工具,一键配置 Codex 的自定义 API,同时保留官方 OpenAI 登录。保存后 Codex 的模型选择器里只会出现你选的那个 provider 的模型。也支持 Claude Code 的官方 / 自定义 API 切换。Codex Switch is a lightweight helper for configuring multiple coding-agent API routes. For Codex, it keeps Official OpenAI and a custom API provider configured in parallel, registers the custom model in Codex's mod

查看详情
67github+08-16