dsh-tool-vision

by wanshichenguang

0 模型与账号接入github 检测到 manifest package.json#dsh 社区精选 收录于 08-16

DSH plugin: image_describe (识图) tool over the DashScope OpenAI-compatible vision API (qwen3.7-flash). Bring your own DASHSCOPE_API_KEY.

安装

dsh plugin --profile web add github:wanshichenguang/dsh-tool-vision

GitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试

安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗

安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。

README

目录

English | 中文

一个 DeepSeek Harness 插件:面向模型的 image_describe(识图) 工具。它读取本地图片文件,让 DashScope OpenAI 兼容接口(qwen3.7-flash)描述图片内容或回答针对性问题。

所有 Agent 预设(模式)都能用:bundle 补丁把工具插到宿主层,每个会话的工具目录里都能看到它。

安装

dsh plugin --profile web add dsh-tool-vision

重启 dsh web(或在插件市场里一键安装)。工具以 image_describe 出现在模型的工具目录中。

粘贴桥(Paste bridge)

在 Web 界面上,当会话模型为纯文本模型(依据提供方元数据确认)时,把图片粘贴或拖进输入框再发送:浏览器端会把每张草稿图片上传到插件的宿主路由、释放草稿,并把 [image: <path>] 文本追加到提示词后再发送——请求不携带图片块,不会触发宿主的图片准入拦截,模型随后可用 image_describe 读取该文件。视觉模型或无法确认的模型保持原生行为(图片内联原样发送)。

上传的图片副本存放在 DSH 数据目录($DSH_HOME/media,默认 ~/.dsh/media),命名规则与宿主自带的图片转路径一致。

发送后消息里的图片会在原用户消息区域中回显为图片:一个会话节点匹配用户消息中的 [image: <path>] 标记,在界面中隐藏该传输标记,并把宿主路由提供的图片副本渲染出来。会话事件中的路径文本保持不变,文本模型仍可读取图片路径。

API 密钥

插件不携带任何密钥。在启动 DSH 的环境里设置:

DASHSCOPE_API_KEY=sk-xxxx

也可以在 cordis.patch.yml 里按行配置:

- id: tool-vision
  name: 'dsh-tool-vision'
  config:
    apiKey: sk-xxxx

没有密钥时工具照常注册,调用时以 VISION_NO_API_KEY 失败并提示修复方式。

工具

工具 参数 行为
image_describe path(字符串)、prompt(字符串,可选) 解析图片(绝对路径,或相对工作区路径),以 base64 data URL 加提示词发送到 POST {baseUrl}/chat/completions,返回助手文本。省略 prompt 时使用 defaultPrompt(完整内容描述)。

配置

键 默认值 含义
baseUrl https://dashscope.aliyuncs.com/compatible-mode/v1 DashScope OpenAI 兼容端点。
apiKey 环境变量 DASHSCOPE_API_KEY DashScope API 密钥;显式配置值优先于环境变量。
model qwen3.7-flash 视觉模型 id。
defaultPrompt 请详细描述这张图片的内容:画面主体、关键细节、文字信息(如有)、布局与结构。 调用省略 prompt 时使用的指令。
timeoutMs 120000 协作式工具调用超时预算(ms)。
maxImageBytes 20971520 单张图片的字节上限。
maxOutputChars 65536 返回描述文本的上限。

安全

  • 包内不含任何凭据;密钥只存在于你的环境或配置里。
  • HTTP 客户端设置 redirect: 'error':已配置的端点接收凭据,重定向会使调用失败,而不是把密钥或图片转发到其他源。
  • 图片字节只发送到已配置的端点。

已知限制与暂缓工作

  • 单一提供方、单一请求形态 —— 工具只面向 DashScope OpenAI 兼容端点;提供方选择 seam 推迟到第二个视觉后端需要同一 schema 时。
  • 没有视觉专属的权限策略 —— 工具执行时不请求 ctx.approval;需要确认的部署须自行添加 tools/pre-execute 策略。

许可证

MIT

原始 README: https://github.com/wanshichenguang/dsh-tool-vision/blob/main/README.zh.md ↗

同类插件

查看全部 →
模型与账号接入Anionex

agent-vision-toolkit

为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

查看详情
928github+08-16
模型与账号接入toby-bridges

api-relay-audit

从 DeepSeek Harness 对 AI API 中转站和 LLM 代理运行本地安全审计,生成 Markdown 报告,覆盖提示词注入、模型替换信号、工具调用改写、错误泄漏、流完整性和按 profile 启用的 Web3 风险。

查看详情
791github+08-21
模型与账号接入ZJU-LLMs

OpenStory

✨ OpenStory 现已支持 DeepSeek Harness 插件! 现在可以通过 dsh-openstory 将 OpenStory 多智能体推演接入 DeepSeek Harness,让 agent 直接启动模拟、查看角色、下达指令并逐回合推进故事。查看 DSH 插件配置与使用指南。

查看详情
377github+08-17
模型与账号接入pulseaiclub

phi

pi的编码代理 ∞ 提供者、子代理、hashline编辑和权限门

查看详情
89github+08-16
模型与账号接入anysearch-team

anysearch-dsh

DeepSeek Harness(DSH)的 AnySearch 网络搜索提供方与高级搜索工具。

查看详情
79github+08-17
模型与账号接入kuangre123

codex-switch

Codex Switch 是一个 macOS 工具,一键配置 Codex 的自定义 API,同时保留官方 OpenAI 登录。保存后 Codex 的模型选择器里只会出现你选的那个 provider 的模型。也支持 Claude Code 的官方 / 自定义 API 切换。Codex Switch is a lightweight helper for configuring multiple coding-agent API routes. For Codex, it keeps Official OpenAI and a custom API provider configured in parallel, registers the custom model in Codex's mod

查看详情
67github+08-16