dsh-vision-api-localorweb
by TIPSONG
接入本地识图模型 API —— 给你的 DSH 助手装上一双「本地眼睛」。 用 LM Studio / vLLM / Ollama 里的多模态模型来识图,数据不出本机。
Connect a local vision-model API — give your DSH assistant a pair of local eyes. Use multimodal models in LM Studio / vLLM / Ollama for image recognition; data never leaves your machine.
安装
dsh plugin --profile web add github:TIPSONG/dsh-vision-api-localorwebGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
✨ 为什么需要它
DSH 助手默认不「看」图片。这个插件把你本地已有的识图模型(比如 LM Studio 里跑着的 Gemma 4E)接进来:
- 🔌 一行接入:填个 OpenAI 兼容接口地址 + 模型名,即可启用
- 🔒 数据不出本机:图片只发给你自己的模型,不经过任何云端
- ⚙️ 留空即关闭:接口地址留空 = 不启用识图,零副作用
- 🎛 图形化配置:设置界面里直接填,不用碰配置文件
🚀 快速开始
dsh plugin --profile web add "github:TIPSONG/dsh-vision-api-localorweb#main"
本插件声明了
dsh.bundle.patch,dsh plugin add会自动挂进 profile 层栈,无需手写 insert 行。装完重启 web 生效。
重启后打开 设置 → 可接入识图模型 API:
| 字段 | 填什么 | 示例 |
|---|---|---|
| 接口地址 | OpenAI 兼容 base URL | http://localhost:1234/v1 |
| 模型名 | 本地加载的模型 ID | gemma-4-e4b |
| API Key | 本地服务留空即可 | (空) |
点保存,然后对助手说「看看这张图」——助手会调用 local_vision 把图片交给你本地的模型。
🧭 工作原理
📦 能力面
| Tools | 说明 |
|---|---|
local_vision |
读取本地图片 → 交给 OpenAI 兼容识图接口 → 返回文字描述;接口留空时返回「未配置」提示 |
| UI | 说明 |
|---|---|
| 设置 → 可接入识图模型 API | 三个输入框(接口地址 / 模型名 / API Key),留空接口地址即禁用识图 |
🔧 配置字段
| 字段 | 说明 |
|---|---|
baseUrl |
OpenAI 兼容接口的 base URL(http://host:port/v1)。留空 = 禁用识图 |
model |
模型 ID(LM Studio 里加载的名字,如 gemma-4-e4b) |
apiKey |
可选鉴权头;留空则不发送 |
📄 安装说明
git 源(推荐,一行):
dsh plugin --profile web add "github:TIPSONG/dsh-vision-api-localorweb#main"
本地目录:
git clone https://github.com/TIPSONG/dsh-vision-api-localorweb.git
cd dsh-vision-api-localorweb
npm install
npm run build # 产出 lib/index.js + lib/client.js
dsh plugin --profile web add .
本插件声明
dsh.bundle.patch(组合层)+dsh.client(platform: web)+exports["./client"](浏览器设置页),main提供 Node 工具半。安装后重启 web 生效。
🛠 开发
npm install
npm run build # 重新构建 lib/
| 文件 | 说明 |
|---|---|
src/index.ts |
Node 半:settings namespace + local_vision 工具 |
src/client.ts |
浏览器半:设置页 |
scripts/build.mjs |
esbuild 构建脚本(ESM host + __ModuleLoader__ client bundle) |
🔌 支持的模型
任何 OpenAI 兼容 /v1/chat/completions 接口且支持图片输入的多模态模型:
- LM Studio(Gemma、Qwen-VL、LLaVA 等)
- Ollama(
http://localhost:11434/v1) - vLLM / llama.cpp server
📄 License
原始 README: https://github.com/TIPSONG/dsh-vision-api-localorweb/blob/main/README.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。