dsh-vision-plugin

by rzhuzi

0 视觉与多模态github收录于 08-23

DeepSeek Harness 的视觉与图片理解插件

安装

dsh plugin --profile web add github:rzhuzi/dsh-vision-plugin

GitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试

安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗

安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。

README

目录

给 DeepSeek Harness(DSH)增加图片理解能力:把图片发送给兼容 OpenAI Chat Completions 多模态格式的视觉模型,再把识别结果注入当前会话,主模型即可继续基于图片内容回答。

已在完整 DSH 源码环境中完成集成、构建和实际运行测试。

功能

  • 输入框右侧「识图」按钮,支持点选或拖拽图片
  • /shitu 识别最近一张图片
  • /shitu <图片路径> 识别本地图片
  • /shitu <问题> 针对图片提问
  • 设置页配置接口地址、API Key、模型和超时
  • 支持从兼容接口获取模型列表

目录

multimodal-vision/            Host 插件:识图命令、上传路由、视觉模型调用
vision-upload/                Client 插件:输入框「识图」按钮
ui-settings-plugins-卡片补丁/ 设置页识图配置卡片

安装

当前 DSH 仍处于预览阶段,部分客户端和设置页扩展点还需要集成补丁。

1. 放入源码

multimodal-vision/ → packages/multimodal/vision/
vision-upload/ → packages/client/vision-upload/

将:

ui-settings-plugins-卡片补丁/VisionCard.tsx
ui-settings-plugins-卡片补丁/vision-card-controller.ts

放到:

packages/client/ui-settings-plugins/src/client/

2. 设置命名空间

在:

packages/host/apiproxy/src/api-proxy.ts

的 WEB_SETTINGS_NAMESPACES 中加入:

'multimodal-vision'

3. 接入设置页

按:

ui-settings-plugins-卡片补丁/集成改动.md

修改 index.ts 和 locales.ts。

4. 接入 Web Bundle

在 packages/bundle/web-app/cordis.patch.yml 中加入:

- id: multimodal-vision
  name: '@deepseek-ai/dsh-multimodal-vision'
  config:
    baseURL: !!js process.env.MMV_BASE_URL ?? 'https://api.openai.com/v1'
    model: !!js process.env.MMV_MODEL ?? 'gpt-4o-mini'

- id: vision-upload
  name: '@deepseek-ai/dsh-client-vision-upload'

在 packages/bundle/web-app/package.json 的 dependencies 中加入:

"@deepseek-ai/dsh-multimodal-vision": "workspace:^",
"@deepseek-ai/dsh-client-vision-upload": "workspace:^"

并在构建图加入:

tsconfig.host.json   → { "path": "./packages/multimodal/vision" }
tsconfig.client.json → { "path": "./packages/client/vision-upload" }

5. 构建

pnpm install
pnpm run build:lib:host
pnpm run build:lib:client

然后重启:

pnpm dsh web

更完整的自动安装步骤见 INSTALL.md。

使用

  1. 打开 设置 → 插件 → 识图
  2. 填写接口地址、API Key 和模型
  3. 点击输入框右侧「识图」按钮选择图片
  4. 识别结果会自动进入当前会话

也可以直接使用:

/shitu
/shitu C:\path\image.png
/shitu 这张图里有什么?

配置

  • baseURL:接口地址,默认 https://api.openai.com/v1
  • model:视觉模型
  • timeoutMs:请求超时
  • apiKey:设置页或 MMV_API_KEY 环境变量

已知限制

  • 当前拖拽需要拖到「识图」按钮上
  • 原生输入区发图仍会走 DSH 自己的图片流程
  • 识图结果目前以文本形式返回,不回填原图
  • 某些兼容接口不支持 GET /models,此时模型名称需要手填

License

MIT

原始 README: https://github.com/rzhuzi/dsh-vision-plugin/blob/main/README.md ↗