视觉与多模态

视觉、截图、图像理解与生成 · 共 168 个

让 agent 看得见:截图理解、图像生成、多模态输入。图片在 DSH 中以内容寻址引用进入会话日志,而不是把 base64 塞进上下文。选型看支持的模式(理解还是生成)与格式范围。 持久图片附件 →

视觉与多模态ysr666

dsh-vision-router

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

查看详情
37github+08-14
视觉与多模态Flyvhidbwo

dsh-vision-proxy

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。

查看详情
6npm+08-14
视觉与多模态ximengxiaolan

dsh-vision-bridge

输入框贴图自动识别:由 OpenAI 兼容视觉模型转成文字描述后,再交给纯文本 DeepSeek 模型处理。

查看详情
1github+08-14
视觉与多模态linenxi-ctrl

dsh-vision

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

查看详情
9github+08-14
视觉与多模态Einskyle

dsh-llm-vision-bridge

DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。

查看详情
1npm+08-14
视觉与多模态Anionex

dsh-vision-toolkit

让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

查看详情
308npm+08-13
视觉与多模态liustack

modlens

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

查看详情
1208npm+08-14
视觉与多模态54xkeee

dsh-vision

纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

查看详情
1github+08-16
视觉与多模态54xkeee

dsh-youreyes

纯文本 DeepSeek 的识图工具包:模型可主动调用的 `vision` 工具、deepseek/opencode-go 包装适配器(v4 flash/pro)、反重力额度(默认,flash/pro)/ 任意 OpenAI 兼容 VLM / Gemini / 本地 Ollama 通道、证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

查看详情
1github+08-16
视觉与多模态akqwpeter-prog

dsh-media-skills

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

查看详情
github+08-16
视觉与多模态BaihaWhite

mcp-ds-ocr

视觉模型 OCR 插件(OpenAI / Anthropic 双协议):配置 API 格式 / API URL / API Key / Model Name (设置 → 插件 → 插件配置 的可折叠卡片),支持 获取模型列表 与 测试连接 按钮; ocr recognize 工具对传入图片自动识别;结果 百分比坐标化 并以 对角线两点方框…

查看详情
0github+08-16
视觉与多模态ConsoleSun

Gemini-Eyes

接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

查看详情
github+08-16
视觉与多模态corrinehu

dsh-chat-imagine

通过已配置的 OpenAI 兼容生图模型或本机 MiniMax CLI,在 DeepSeek Harness 对话中生成并展示图片。

查看详情
github+08-16
视觉与多模态Elohia

dsh-plugin-image-input

图片转文字输入插件:粘贴/拖拽图片自动转为结构化文字描述发送,给纯文本 LLM 提供图片输入接管(OpenAI 兼容视觉 API)。

查看详情
github+08-16
视觉与多模态Elohia

dsh-plugin-mm-vision

通感编码器(Synesthesia Encoder):调用视觉模型把图片翻译成紧凑的结构化空间文字(画布/元素/百分比坐标),让纯文本 LLM 获得像素级看图能力(`mm_vision` 工具)。

查看详情
github+08-16
视觉与多模态FuzzySoul

dsh-free-vision

免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。

查看详情
github+08-16
视觉与多模态gloryxpnv

dsh-tool-vision

本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。

查看详情
github+08-16
视觉与多模态good-boy4069

dsh-vision-guard

纯文本路由的透明图片护栏:贴图不再 400 卡死会话,附带 vision_analyze 工具(OCR/PDF/docx/pptx/视频)。

查看详情
github+08-16
视觉与多模态haitang1

dsh-image-bridge

让文本模型(如 DeepSeek)也能正常发送图片:图片落盘到工作区,消息转成仅模型可见的路径文本,由模型调用视觉/MCP 工具识别。

查看详情
0github+08-16
视觉与多模态haiziyao

dsh-vision-mix

组合已配置的文本与视觉模型,提供 Mix 路由、跨轮图片追问、Agent 截图分析、会话记录以及图片生成与编辑。

查看详情
2github+08-16
视觉与多模态Isanti2016

dsh-quicksight

DeepSeek Harness 双层图片识别插件 :为纯文本模型补上识图能力, 本地图片识别 + 模型识别双通道 。

查看详情
0github+08-16
视觉与多模态jing-hy

picturereader

DSH插件:纯文本模型像素转文字图像读取。image_scan/image_ocr/image_sample工具+图像读取技能(34图像训练方法)。纯本地,可选PaddleOCR。

查看详情
2github+08-16
视觉与多模态jyh20030112

dsh-visual-plugin

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

查看详情
9github+08-16
视觉与多模态kaixinbaba

dsh-vision-recognizer

视觉模型路由:把附加图片经可配置模型(15+ OpenAI 兼容与 Anthropic 供应商)转译为文字,对话仍由 DeepSeek 作答。

查看详情
0github+08-16
视觉与多模态LeemanCheung

dsh-image-gen

GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。

查看详情
0github+08-16
视觉与多模态linktao159357

dsh-plugin-local-vision

DeepSeek Harness 本地视觉插件:通过 LM Studio 的 OpenAI 兼容端点调用 本地视觉模型 (默认 qwen3-vl-8b-instruct-abliterated-v2.0 )描述图片/截图。

查看详情
0github+08-16
视觉与多模态lsjspl

dsh-plugin-grok2api-media-tool

让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。

查看详情
github+08-16
视觉与多模态MC5lan

dsh-multimodal

给 DeepSeek 安装一双眼睛和一支画笔:会话里直接贴截图/图片,GLM 视觉模型先精确转写图片内容(报错信息、代码、界面逐字保留),然后 DeepSeek 继续处理你的问题——同一轮完成,全程无感;需要配图时,DeepSeek 自动调用文生图后端出图并显示在会话中。

查看详情
5github+08-16
视觉与多模态MicroHEROX

dsh-koboldcpp-hands

给在线模型装上本地双手:koboldcpp_run 与 koboldcpp_vision 工具把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地 KoboldCpp(llama.cpp)服务器,并按需拉起与管理服务器生命周期。

查看详情
github+08-16
视觉与多模态MicroHEROX

dsh-unsloth-hands

把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地运行的 Unsloth Desktop(Unsloth Studio)服务器:unsloth_run 与 unsloth_vision 两个工具,纯 HTTP 客户端,不拉起也不持有任何进程。

查看详情
github+08-16
视觉与多模态NagasakiSoyo-ui

dsh-llm-deepseek-vision

视觉增强的 DeepSeek 适配器:由视觉模型把图片描述成文字,纯文本 DeepSeek 模型再基于描述推理。

查看详情
github+08-16
视觉与多模态niuniuaba

dsh-subagent-vision

让纯文本 DeepSeek 代理在同一会话内读图:委派给视觉子代理,发送时自动把图片转为文件路径。

查看详情
github+08-16
视觉与多模态niyongsheng

free-vision-skill

基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。

查看详情
github+08-16
视觉与多模态qing9835

dsh-eyes

DSH 视觉模型插件:为无视觉能力的文本模型提供图片识别。粘贴/拖入/导入的图片自动交给 OpenAI 兼容视觉模型识别为文字并发送进对话,支持多轮复核(vision_ask)、多提供商配置。

查看详情
1github+08-16
视觉与多模态Seryta

dsh-image-bridge

DSH(DeepSeek Harness)插件:把用户在 Web GUI 里附加到消息中的图片,用视觉模型 (默认智谱 GLM-4V-Flash,免费)转成文字描述后注入对话,让 DeepSeek 这类纯文本 模型也能"看见"图片。

查看详情
github+08-16
视觉与多模态shinjiyu

dsh-plugin-multimodal

在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。

查看详情
3github+08-16
视觉与多模态ShiXiangYu2

dsh-siliconflow-vision

DSH 插件:通过硅基流动(SiliconFlow)视觉大模型识别/分析图片 —— dsh-plugin

查看详情
0github+08-16
视觉与多模态siegfly

dsh-deepseek-vision

视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。

查看详情
github+08-16
视觉与多模态sparkmio

dsh-sfversion

SF视觉桥——给纯文本模型的 DeepSeek Harness 装上眼睛。

查看详情
3github+08-16
视觉与多模态TIPSONG

dsh-vision-api-localorweb

接入本地识图模型 API —— 给你的 DSH 助手装上一双「本地眼睛」。 用 LM Studio / vLLM / Ollama 里的多模态模型来识图,数据不出本机。

查看详情
0github+08-16
视觉与多模态wulusai2333

mimo-vision

`describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。

查看详情
github+08-16
视觉与多模态xiaoshihou514

dsh-vision

极简的原生视觉能力增强,支持免费的智谱模型或本地千问视觉模型。

查看详情
github+08-16
视觉与多模态xiaozhe7772222

dsh-draw-router

DeepSeek Harness 统一生图路由:自动识别任意 OpenAI 兼容端点的绘图模型(商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等),提供 Agent 工具与 REST API。

查看详情
github+08-16
视觉与多模态Yts1919

dsh-vision-complete

给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

查看详情
31github+08-16
视觉与多模态zhouwumu2-lab

dsh-vision-fix

给纯文本的 DeepSeek 加上眼睛。Vision for text-only DeepSeek.

查看详情
github+08-16
视觉与多模态342949145

dsh-vision-bridge

DSH 识图桥接插件:让 DeepSeek 等纯文本模型会话也能发送图片,图片自动经视觉模型识图转文字(识图桥接,read_image 工具兼容)

查看详情
1github+08-16
视觉与多模态hige6

imgpost

图邮 (imgpost):让你的 DSH 能发图给你 —— 本地图片、网页图片、AI 生图,一键发进对话里。

查看详情
1github+08-16
视觉与多模态kanchengw

dsh-mindseye

让 DeepSeek 原生看图 —— intent-routed vision for DeepSeek Harness

查看详情
1github+08-16
视觉与多模态littlewrite

dsh-local-ocr

DeepSeek Harness本地OCR插件,由macOS Vision和Windows Media OCR驱动。

查看详情
0github+08-16
视觉与多模态mario03690

dsh-imagegen

DeepSeek Harness 图像生成与视觉效果插件 — 免费试用,无需密钥,无需注册。

查看详情
0github+08-16
视觉与多模态maxwell-feng

dsh-tesseract-ocr

DeepSeek Harness (dsh) 插件,让纯文本模型接受附加图像:每张图像都使用 Tesseract OCR 本地识别,仅将识别出的文本发送到…

查看详情
2github+08-16
视觉与多模态maxwell-feng

dsh-windows-ocr

DeepSeek Harness (dsh) 插件,让纯文本模型接受附加图像:每张图像都使用内置的 Windows OCR 引擎(Windows.Media.Ocr)本地识别…

查看详情
6github+08-16
视觉与多模态soli0x4ea

dsh-tool-describe-image

本地视觉工具 — 给 DeepSeek Harness 的主模型「借一双眼睛」:传入图片路径,调用本地 LM Studio 视觉模型( qwen3vl4b ),返回图片的文字描述,主模型据此理解图片。

查看详情
0github+08-16
视觉与多模态soli0x4ea

dsh-tool-generate-image

本地绘图工具 — 给 DeepSeek Harness 的主模型一支「画笔」:把文字描述增强为提示词(正面 + 负面),调用本地 Draw Things (Stable Diffusion WebUI 兼容 HTTP 服务),生成图片并保存,返回文件路径。

查看详情
0github+08-16
视觉与多模态windyslime

DeepSee

为 DeepSeek 官方 API 提供可插拔的视觉处理层,让 DeepSeek 获得多模态能力: 一次 ask with image() 调用,完成"视觉模型看图 → DeepSeek 推理回答"。

查看详情
1github+08-16
视觉与多模态xiaoyaoPanPan

dsh-photo-pick

dsh-photo-pick 从连拍里选出更好的那几张。DeepSeek Harness(dsh)插件:用视觉给近似照片打分并推荐。 中文 · English · Issues

查看详情
0github+08-16
视觉与多模态AnnanRen

dsh-vision-resident

常驻视觉子代理插件:自动转译粘贴的图片,提供 describe_image 工具,以及按会话隔离的对话记忆、状态胶囊和详情页(DeepSeek Harness)。

查看详情
0github+08-17
视觉与多模态Github-CJX

dsh-tool-imagegen

DSH Desktop 对话内联生图插件** — 模型在对话中自动调用 `generate_image` 工具,图片直接内联显示在对话框里,无需外部面板、无需手动切换。

查看详情
0github+08-17
视觉与多模态GXX182

dsh-vision-bridge

DeepSeek Harness 插件:把会话图片桥接到可插拔的视觉 API,同时保持 DeepSeek 为主模型

查看详情
2github+08-17
视觉与多模态jiawood2006

doc-ocr

Local OCR for PDFs/scans/images using macOS Vision. 本地OCR文档识别。

查看详情
0github+08-17
视觉与多模态nexsjournal

dsh-imagegen-plugin

给 DeepSeek Harness(DSH)加上第三方生图/改图能力的插件:对话召唤 + 设置卡片,支持 OpenAI 兼容 / 阿里百炼 / Replicate / fal.ai

查看详情
1github+08-17
视觉与多模态zemul

dsh-generate-image

DeepSeek Harness 插件:通过本机 OpenAI Codex CLI 生成与编辑图片。

查看详情
1github+08-17
视觉与多模态Cheng-cheng9669

dsh-deepseek-vision

复用 DeepSeek 网页端内置视觉模式:deepseek_vision 工具驱动本地 deepseek-vision-cli 浏览器自动化(手动登录辅助、开启深度思考、自动关浏览器),以文本返回图片描述

查看详情
github+08-17
视觉与多模态dickpy

dsh-imagegen

DeepSeek Harness (DSH) Web GUI 的 AI 生图插件。它通过宿主进程安全地代理 OpenAI 兼容的图像生成接口,为 DSH 提供文生图、图生图编辑、生成历史和一体化设置页。

查看详情
github+08-17
视觉与多模态Hyp6666

dsh-open-eyes

纯文本 DeepSeek 路线的视觉桥:经可配置的 OpenAI Responses、Chat Completions 或 Anthropic Messages 端点分析附件与本地图片,图像路线保持原生

查看详情
github+08-17
视觉与多模态ld-1101

dsh-vision-plugin

给 DeepSeek Harness(DSH)装上"眼睛": 纯文本模型(如 deepseek-v4-flash)也能处理图片 ——发图后自动用视觉模型生成描述,文本模型基于描述回答;描述不足时自动生成更具体的提示词重新解析。配置全程 GUI 可视化、保存即生效。

查看详情
github+08-17
视觉与多模态moon09300731

dsh-vision-tools

DeepSeek Harness(DSH)视觉能力全家桶 —— 让 DeepSeek 纯文本模型"看得见"。

查看详情
github+08-17
视觉与多模态s3yf1337

dsh-easyvision

给纯文本模型视觉能力:describe_image 工具把图片委派给 dsh 模型列表中的视觉模型,跑在 harness 自带的 LLM 运行时上

查看详情
github+08-17
视觉与多模态TaurusWood

dsh-plugin-appshot

macOS 全局快捷键「一键截图 当前窗口 」,自动作为图片上下文挂入 DeepSeek Harness (DSH) 的 Composer —— 把当前工作窗口零摩擦交给 Agent。

查看详情
github+08-17
视觉与多模态xsoc1

dsh-image-vision

给纯文本的 DeepSeek 加上眼睛: 聊天里传图 + 识图 ,一个插件搞定。

查看详情
github+08-17
视觉与多模态dsh-external

dsh-ads

DSH Web UI 广告层:2005 中文站风格侧栏广告/信息流/角落弹窗 + 关闭叉热区远小于视觉(素材全虚构整活插件)

查看详情
github+08-17
视觉与多模态dsh-external

dsh-browser-panel

WebUI 内嵌完整有头浏览器视图:模型实时操控真实浏览器,用户可见每一步(Codex 式体验,0 视觉依赖)

查看详情
github+08-17
视觉与多模态dsh-external

dsh-design

DSH Web/UI 设计 Agent Bundle:Create/Recreate/Refine、视觉验证与 hash 绑定交付

查看详情
github+08-17
视觉与多模态dsh-external

dsh-vision

view_image 工具桥接任意 OpenAI 兼容 VLM

查看详情
github+08-17
视觉与多模态dsh-external

dsh-vision-toolkit

agent-vision-toolkit 的 DeepSeek Harness 原生集成:图片问答

查看详情
github+08-17
视觉与多模态dsh-external

dsh-visualize

对话内生成式 UI:模型把交互式 HTML 卡片直接画进会话流(visualize 工具 + 配套 skill + 沙箱渲染卡)

查看详情
github+08-17
视觉与多模态dsh-external

dsh-web-workflow-visualizer

Web GUI 的 Workflow 可视化 + 图工程插件:多 agent 动态工作流白板化编辑与脚本生成

查看详情
github+08-17
视觉与多模态dsh-external

Qwen-MM-Plugins

Qwen-MM 多模态 Cordis 插件独立发布目录(packages/qwen/qwen-mm)

查看详情
github+08-17
视觉与多模态131CDA1

dsh-scrape-webpage

抓取任意 http/https 网页,提取标题、描述、正文、标题结构与链接,输出字符/词数、阅读时长、语言等统计与高频关键词;支持下载内容图片到会话工作区供视觉分析,并通过 scrape.imageAnalyzer 服务分发给已注册的识图分析器。

查看详情
5github+08-21
视觉与多模态1HelloMan1

dsh-vision-fallback

将聊天图片交给固定的 OpenAI 兼容视觉模型,把事实性观察交给当前主模型,并在事件回放、上下文压缩和重启时复用会话内观察。

查看详情
1github+08-21
视觉与多模态314857493

vision-route

注册 `deepseek-vision` 路由:Web GUI 直接粘贴图片,由免费智谱 GLM 视觉模型转译为文字后,再交给 DeepSeek 适配器作答。

查看详情
1github+08-21
视觉与多模态314857493

vision-tool

给 DeepSeek Harness 的纯文本模型补上免费识图:`vision` 工具直连智谱 GLM 视觉 API 描述/OCR 图片文件(glm-4v-flash 降级链),无需任何外部 CLI。

查看详情
1github+08-21
视觉与多模态AtropinolTT

dsh-guide-dog

基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。

查看详情
4github+08-21
视觉与多模态DamonKoy

dsh-tool-describe-image

describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。

查看详情
4github+08-21
视觉与多模态Junkrat9527

dsh-autovision

纯文本 dsh 模型的识图插件:粘贴图片自动由你配置的多模态模型转成文字——透明孪生路由、模型可自主调用识图工具、无内置密钥与中转。

查看详情
github+08-21
视觉与多模态MJorgin

dsh-media-skills

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

查看详情
11github+08-21
视觉与多模态NormanFxxkingRockwell

dsh-auto-vision

为纯文本 DeepSeek Harness 主模型搭视觉桥:自动从已配置模型中挑选多模态模型,通过 vision 工具把图片描述以纯文本返回。

查看详情
1github+08-21
视觉与多模态Okkay712

DSH-dseyes

为纯文本 DeepSeek 提供原生图片上传体验:在 Web GUI 粘贴/拖入图片即以缩略图附件进入会话,发送前由 host 用免费智谱 GLM-4V-Flash 视觉 API(glm-4v-flash 降级链)读取并替换为文字描述,DeepSeek 据此回答,原图保留在聊天历史中。

查看详情
github+08-21
视觉与多模态Renji004

dsh-omni-vision

为纯文本模型装上本地眼睛:eyes_render 在 Web 界面画布上绘制文字/图形/Mermaid,eyes_paste 接收用户粘贴的图片,eyes_ocr 用 Windows 自带 OCR 离线读文字,eyes_analyze 把像素解析成结构化数据,全程无需视觉模型。

查看详情
github+08-21
视觉与多模态ankye

tool-vision

屏幕截图与外部视觉识别:take_screenshot、list_windows、analyze_image、view_image 四个工具,可配置 GPT 视觉通道(gpt-5.5 / gpt-5.6-sol / gpt-5.6-terra),API Key 经凭据服务存储,带设置卡片;view_image 在 Web 对话中显示截图,模型上下文只保留文字。

查看详情
github+08-21
视觉与多模态ankye

use-browser

通用浏览器自动化:browser_open、browser_click、browser_type、browser_extract、browser_screenshot、browser_eval 六个工具,@e 元素引用,Playwright 无头与 CDP(连接本机 Chrome)双后端。

查看详情
github+08-21
视觉与多模态br1nosense

dsh-vision-solution

为 DSH 纯文本模型补充视觉能力:识图技能(图片理解/OCR/文档解析,竞速池→自定义通道→本地)+ 幂等宿主补丁,让图片消息能送达模型侧。

查看详情
0github+08-21
视觉与多模态dami9527

dsh-image-pathify

让纯文本模型也能处理聊天贴图,提供原生视觉体验,支持批量看图,走内置 OpenAI 兼容识图工具 analyze_image;具备视觉能力的模型不受影响。

查看详情
github+08-21
视觉与多模态hawkhai

wechat-ocr

DSH 的本地微信 OCR 工具:`wechat_ocr_recognize` 针对本地图片路径返回识别文本和引擎的结构化结果。

查看详情
0github+08-21
视觉与多模态hawkhai

win11-oneocr

DSH 的本地 Windows 11 OneOCR 工具:`oneocr_recognize` 返回 OCR 文本,以及包含行/词多边形、置信度、旋转角度和手写体样式的结构化结果。

查看详情
0github+08-21
视觉与多模态paicat1

dsh-screenshot

DeepSeek Harness (dsh) 的独立截图工具。浏览器快捷键一键截图,并提供面向智能体的截图加读取能力,让智能体能看到并分析任意屏幕区域。

查看详情
1github+08-21
视觉与多模态poiuyjie

dsh-vision-opencode

给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。

查看详情
10github+08-21
视觉与多模态sunxin-ai

dsh-design-qa

给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。

查看详情
github+08-21
视觉与多模态wang-bool

visual-review

在 DSH Web 聊天界面内联渲染粘贴/上传的图片,并让纯文本模型“看见”图片:visual_review 工具优先调用任意 OpenAI 兼容多模态 API,未配置时回退本机 Qwen3-VL。

查看详情
2github+08-21
视觉与多模态Tencent

dsh-plugin-browserskill

BrowserSkill 的 DeepSeek Harness 浏览器自动化桥接插件,通过原生浏览器工具控制可见的 Chrome 和 Edge Agent Window,支持可访问性与 VOM 页面观察、截图、隔离的多会话控制和 Web UI 实时观察浮层。

查看详情
github+08-21
视觉与多模态jiaererw

dsh-plugin-chrome

每个 DSH 会话一个可见的 Chrome 窗口:16 个 chrome_* 工具(打开/状态/关闭/导航/标签/快照/截图/点击/坐标点击/填写/输入/按键/悬停/滚动/执行脚本/等待),Web GUI 的 Chrome 标签页提供实时画面流(静止页截图心跳兜底)、标签页管理、窗口控制与截图历史。

查看详情
github+08-23
视觉与多模态tiankundai

dsh-vision-lmstudio

DSH(DeepSeek Harness)Web GUI 的本地 LM Studio 视觉识别插件——用本地视觉模型识别、描述并 OCR 本地图片或剪贴板截图

查看详情
github+08-23
视觉与多模态favio8

dsh-plugin-deepeye

让纯文本模型获得"眼睛":图片描述、OCR 文字提取、视觉问答、UI 布局分析、剪贴板截图分析,以及 粘贴图片自动翻译 (在纯文本模型会话里直接粘贴图片也能发)。

查看详情
4github+08-23
视觉与多模态huanlinoto

dsh-plugin-aigc-canvas

DSH 插件:一个节点-连线式的 AIGC 画布。向模型暴露文生图 / 文生视频 / 首尾帧生视频 / 多参考生视频 / 音频生成五类工具,生成的图片 / 视频 / 音频以及提示词都作为画布元素(uuid 寻址)存在,生成完成后自动按多对一(promise + 所有参考元素 → 输出)在画布上连线。

查看详情
github+08-23
视觉与多模态libinyam

dsh-vision-provider

面向 OpenAI 兼容视觉模型的纯配置 DeepSeek Harness bundle

查看详情
4github+08-23
视觉与多模态omdsh-dev

dsh-ernie-image

DSH 百度 ERNIE-Image-Turbo 文生图插件:宿主端注册图像生成工具(图片落盘 + 注册为会话附件,agent 可继续读图),浏览器端提供插件配置卡(密钥用户自填、测试连接、默认参数)与「✨ 文生图」生成画廊面板(prompt → 变体 → 预览/下载/同 seed 复现/换 seed 出变体 → 插入会话)。

查看详情
github+08-23
视觉与多模态pangyiming

dsh-screenshot-diff

DSH plugin: pixel-diff two screenshots into diff.png + triptych (pixelmatch) — 像

查看详情
1github+08-23
视觉与多模态pixlunalab

dsh-plugin-pixluna

将 PixLuna 的图片获取能力移植为 DeepSeek Harness(DSH)Cordis 插件。插件不再注册聊天命令,而是注册模型可调用的工具;原命令选项均转换为具名工具参数。

查看详情
github+08-23
视觉与多模态sjscy05

deepseek-harness-vision-plugin

一个用于 DeepSeek Harness 的 scratch 插件:让纯文本的 DeepSeek 主模型通过 视觉子模型 阅读图片。代理调用 vision read 工具,插件把图片和问题转发给配置好的视觉 API,再把视觉模型的回答以文本形式返回。

查看详情
github+08-23
视觉与多模态wangyang10

image-vision

让没有视觉能力的模型(如 DeepSeek 等纯文本模型)也能"看图":自动调用 OpenAI 兼容的识图模型 API(OpenRouter、SiliconFlow、智谱、Kimi、通义千问、 本地 Ollama 等),完成图片描述、问答、OCR 等任务。

查看详情
github+08-23
视觉与多模态william-jin-cmu

dsh-vision

给纯文本的 DeepSeek 加上眼睛。Vision for text-only DeepSeek.

查看详情
github+08-23
视觉与多模态yytbit

dsh-plugin-vision-toolkit

DeepSeek Harness 视觉工具箱——给纯文本 agent 装上眼睛

查看详情
1github+08-23
视觉与多模态zerohackz

openflowframes

OpenFlowFrames — Windows 视频插帧工具

查看详情
4github+08-23
视觉与多模态zhuxinai

sidesight

SideSight 同时支持 DeepSeek Harness 两条原生扩展路径:最简安装的文件系统技能与可配置插件包,两条路径都不启动服务

查看详情
github+08-23
视觉与多模态121103qwq

dsh-vision-sidecar

DeepSeek Harness 的托管免费视觉边车,带持久会话证据

查看详情
5github+08-23
视觉与多模态237229953-create

dsh-vision

⚠️ 依赖提示:本插件需要搭配 uiopt 项目一起使用。 视觉模型的图形化配置界面(视觉模型下拉、输出上限、模式、超时)由 uiopt 的"额外插件 → 可配置插件"标签页承载;未安装 uiopt 时,只能通过 settings.yaml 手动配置,且无法在界面中切换视觉模型。

查看详情
github+08-23
视觉与多模态arnoldkevin

prismrelay-mcp

PrismRelay 让纯文本 agent(含 DeepSeek 工作流)经本地 stdio MCP server 检视真实图像像素,agent 保持主力

查看详情
github+08-23
视觉与多模态cesaryike

dsh-image-to-path

让 DSH 纯文本模型对话也能拖图/贴图:图片自动保存到会话工作区,以文件路径交给模型。

查看详情
github+08-23
视觉与多模态hawkongz

doubao-vision-dsh

doubao-vision-dsh 让没有视觉能力的模型通过桌面豆包"看见"聊天图片 —— DeepSeek Harness 宿主插件(CDP 桥接)

查看详情
github+08-23
视觉与多模态huashenglian

dsh-her-eyes

DeepSeek Harness(dsh)的视觉语言模型分析插件:analyze image 工具由主/备 OpenAI 兼容视觉端点支撑

查看详情
github+08-23
视觉与多模态isekai-mfu

dsh-mimo-vision-hint

零依赖的 DSH 提示插件:在模型系统提示中注册一节,指示 agent 把图像识别任务派给相应工具

查看详情
2github+08-23
视觉与多模态junhongchashui

dsh-vision-relay

零修改、零切换的 DeepSeek Harness 视觉能力插件 —— 让纯文本模型(如 DeepSeek-V4-Flash)直接"看见"聊天里的图片:粘贴即读、无需切换模型、不修改任何核心代码。

查看详情
github+08-23
视觉与多模态kevoyuan

dsh-mac-vision

面向 DeepSeek Harness 的 macOS 原生视觉插件 。它通过 Apple Vision 为纯文本模型提供本地图片、剪贴板、屏幕和应用窗口的 OCR 与视觉检测能力。

查看详情
github+08-23
视觉与多模态lakeofsky347

dsh-vision

dsh-vision — 识图路由插件(Vision Bridge for DeepSeek Harness)

查看详情
github+08-23
视觉与多模态oil-oil

dsh-vision

DeepSeek Harness 插件:有视觉能力的模型继续原生收图;所选主模型是纯文本时,插件另请视觉模型分析

查看详情
github+08-23
视觉与多模态qizhen2021

dsh-plugin-vision

给纯文本模型一双"眼睛"。注册一个 see 工具:对任意图片输出 纯文本 的三通道分析——

查看详情
0github+08-23
视觉与多模态rrrosmontis

dsh-qwen-mm

Qwen-MM-Plugins 集成 bundle——多模态 MCP 工具(视觉、OCR、ASR、搜索)

查看详情
2github+08-23
视觉与多模态rzhuzi

dsh-vision-plugin

DeepSeek Harness 的视觉与图片理解插件

查看详情
0github+08-23
视觉与多模态sala003

dsh-tool-describe-image

让 DeepSeek 看懂图片的 DSH 插件 —— 通过阿里云百炼(DashScope)qwen-vl 视觉模型,把图片转成文字描述,纯文本模型也能"看见"图片。

查看详情
github+08-23
视觉与多模态sjakdhasdh

dsh-vision

给 DeepSeek Harness 里 没有原生识图能力的模型 (如 deepseek-v4-flash)加上识图工具。 Give image-recognition ability to DeepSeek Harness models without native vision (e.g. deepseek-v4-flash).

查看详情
github+08-23
视觉与多模态sorwcyra

ds-vision-plugin

把图片粘贴进 DeepSeek Harness:四模型视觉竞速、OCR 与自动结果

查看详情
4github+08-23
视觉与多模态tdf1995

dsh-plugin-vision

为 DeepSeek Harness 中的纯文本大模型提供视觉能力 ——通过 Gemini / GLM 免费视觉 API 完成图像描述、OCR 与视觉问答。 Vision for text-only LLMs inside DeepSeek Harness (DSH) — describe images, OCR, and answer visual…

查看详情
github+08-23
视觉与多模态wudifive

dsh-plugin-vision

让 DeepSeek Harness( dsh )拥有 识图 和 生图 能力的可插拔插件,两个工具:

查看详情
github+08-23
视觉与多模态wuwangmao

dsh-qwen-multimodal

一个 DSH bundle 经 Qwen API 给纯文本主模型(如 DeepSeek)三项多模态能力:视觉、语音转文字与文生图

查看详情
github+08-23
视觉与多模态xcodebuild

dsh-plugin-read-image-free

dsh web 插件:让模型理解图片内容 —— 使用 bigmodel.cn 提供的免费 vision 模型(GLM-4.1V-Thinking-Flash)进行 OCR、画面描述、图内文字翻译等,对不支持图片输入的模型同样可用。

查看详情
github+08-23
视觉与多模态xieweikang123

dsh-vision-bridge

给纯文本的 DeepSeek「装上眼睛」—— 粘贴图片,自动识别成文字,再交给模型理解。

查看详情
github+08-23
视觉与多模态yanxinwang-ml

dsh-plugin-vision-tool

给纯文本 DeepSeek Harness 模型图像识别:Cordis 宿主插件注册 analyze image 工具,把识别路由到专用视觉模型

查看详情
github+08-23
视觉与多模态ycp424c

dsh-luna-vision-bridge

dsh-luna-vision-bridge 是一个纯 Host 侧的 DSH LLM adapter。它注册新的 luna-vision-bridge provider,让原生 DSH 输入框可以继续使用粘贴图片、拖放、缩略图、删除、Enter 和发送按钮;图片进入 DSH 原生 attachment store 后,由 Codex Luna…

查看详情
github+08-23
视觉与多模态yuuz12

dsh-vision-helper

DeepSeek Harness Vision Helper/DeepSeek Harness 视觉辅助方案

查看详情
2github+08-23
视觉与多模态zcxie777

dsh-image-reader

给纯文本 DeepSeek Harness agent 直接读图的能力:一个面向模型的 read image 工具,按需询问任意 OpenAI 兼容视觉端点

查看详情
github+08-23
视觉与多模态zhuiyueya

dsh-visionary

在图片抵达 LLM 前透明地转成 OCR 文本 + 视觉模型描述——让 DeepSeek API 终于能「看见」聊天图片

查看详情
github+08-23
视觉与多模态crazy222123

dsh-ocr-plugin

给 DeepSeek Harness 加"眼睛"的本地 OCR 插件: 让纯文本模型 真正看到图片内容 ——截图、发票、表格、扫描件、多栏文档,全部本地识别,不依赖任何云 OCR。

查看详情
github+08-23
视觉与多模态pixlunalab

dsh-pixluna

将 PixLuna 的图片获取能力移植为 DeepSeek Harness(DSH)Cordis 插件。插件不再注册聊天命令,而是注册模型可调用的工具;原命令选项均转换为具名工具参数。

查看详情
github+08-23
视觉与多模态yuqingsh

dsh-image-subagent

让纯文本主模型(如 deepseek-v4-pro)也能接收图片附件:图片进入会话后投影为携带完整 attachmentId 的显式文本占位符,由主模型委托视觉子代理读取。

查看详情
5github+08-23
视觉与多模态junelearn

dsh-image2-draw

DeepSeek Harness 里没法直接生图?本插件经暴露 OpenAI Images 兼容 API 的第三方中转加上 Image2 生成,配好即用

查看详情
github+08-23
视觉与多模态kbpoyo

dsh-image-bridge

DSH(DeepSeek Harness)Web 插件:为 不支持原生图片输入 的纯文本模型提供图片桥接能力,让纯文本模型也能"看图"。

查看详情
github+08-23
视觉与多模态dundunhan

dsh-video-lens

DeepSeek Harness 的视频理解——给纯文本 agent 装上视频的眼与耳

查看详情
github+08-23
视觉与多模态jypjypjypjyp

dsh-vqa-agent

DSH 插件:vqa_ask 双模型视觉问答 —— 主模型提问 → 视觉模型看图回答,UI 实时展示 QA 过程,支持多模态视觉模型选择

查看详情
2github+08-23
视觉与多模态edison-land

deepseek-harness-vision-plugin

DeepSeek Harness 与 OpenAI 兼容网关的视觉输入与自动路由插件

查看详情
1github+08-23
视觉与多模态xytt2n2btc

dsh-aux-vision

DeepSeek Harness 辅助视觉插件:任意纯文本主模型 + 任意视觉模型(默认 opencode-go/mimo-v2.5)

查看详情
4github+08-23
视觉与多模态aidenwu0209

dsh-paddleocr-skills

DeepSeek Harness 的 PaddleOCR 技能:原生工具与 GUI 配置

查看详情
4github+08-23
视觉与多模态ethanweave

glm4v-vision-mcp

GLM-4.6V 图像理解 MCP:识图/OCR/图表解析,原生接入 DeepSeek Harness(dsh-mcp-client),也兼容 Codex/Cline 等

查看详情
2github+08-23
视觉与多模态tiefeiyu

dsh-see-image

DeepSeek Harness 的 see_image 视觉工具插件——经任意 OpenAI 兼容视觉模型描述图片

查看详情
2github+08-23
视觉与多模态jotarozaku-jpg

deepseek-harness-vscode-extension

非官方的源码级 VS Code DeepSeek Harness 客户端,经 ACP 通信

查看详情
1github+08-23
视觉与多模态mindcarver

dsh-codex-canvas

DeepSeek Harness 插件:经 Codex CLI(gpt-image-2)的 image_gen 工具

查看详情
0github+08-23
视觉与多模态richardcoder849

flomo-dsh-plugin

仿 flomo 便签 + 知识图谱 的 DeepSeek Harness (DSH) 动态 Cordis 插件 / flomo-style memo plugin with knowledge graph

查看详情
0github+08-23
视觉与多模态egnmosk

dsh-browser-bridge

DeepSeek Harness 插件 + 浏览器扩展桥:browser_* agent 工具(导航、点击、输入、截图等)

查看详情
2github+08-23
视觉与多模态hel10o

dsh-vision-paste

DSH 插件:把图片粘贴进聊天即变成模型可用的文件路径

查看详情
0github+08-23
视觉与多模态chenxinj08-lgtm

deepseek-harness-desktop

DeepSeek Harness 桌面客户端 —— 内置官方 dsh 运行时与本地文件/视觉/记忆插件,数据全本地、无遥测;macOS / Windows 双平台

查看详情
1github+08-23
视觉与多模态bald0wang

dsh-imggenerate

DeepSeek Harness 插件:image_generate 工具(阿里 MaaS qwen-image-3.0 与火山 doubao-seedream)

查看详情
4github+08-23
视觉与多模态chenhaolove89

dsh-ccswitch-import-lite

DeepSeek Harness 插件(精简版):从 CCSWITCH 批量导入模型供应商,不含视觉描述

查看详情
2github+08-23
视觉与多模态mochgolf

dsh-deepseek-vision-router

DeepSeek Harness 的透明图像预处理路由

查看详情
2github+08-23
视觉与多模态gemone

dsh-chrome

DeepSeek Harness 插件:面向模型的 Chrome DevTools Protocol(CDP)工具——导航、执行、截图等

查看详情
2github+08-23
视觉与多模态me9rez

dsh-vlm-bridge

DSH bundle 插件:vision_analyze 工具让纯文本 LLM 也能看图

查看详情
1github+08-23
视觉与多模态motongv

dsh-vision-adapter

DeepSeek Harness 的视觉适配插件:经 Kimi 视觉模型为 DSH 补盲(上游英文描述已损坏)

查看详情
1github+08-23
视觉与多模态pptt121212

dsh-yali-image-generator

dsh-yali-image-generator 是一个可独立安装的 DeepSeek Harness Bundle,为 Agent 提供 generate image 图像生成工具,并通过 Yali AI 异步图像网关调用模型。

查看详情
1github+08-23
视觉与多模态jasonjin2006

dsh-vision-plugin

个人 DeepSeek Harness 视觉插件

查看详情
0github+08-23
视觉与多模态nbhby

dsh-vision

给纯文本 LLM 视觉:DeepSeek Harness(DSH)持久化、一键安装的插件

查看详情
0github+08-23