dsh-paddleocr-skills
by aidenwu0209
DeepSeek Harness 的 PaddleOCR 技能:原生工具与 GUI 配置
PaddleOCR skills for DeepSeek Harness with native tools and GUI configuration
安装
dsh plugin --profile web add github:aidenwu0209/dsh-paddleocr-skillsGitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试
安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗
安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。
README
English | 简体中文
来源与使用量: 本项目由 PaddleOCR-Skills 适配而来;该来源在 skills.sh 已有 4.3K+ 次安装。
这是一个可直接安装的 DeepSeek Harness bundle,包含两个原生 Tool、两个 Skill,以及 Settings → PaddleOCR 图形配置页。
功能
paddleocr_text_recognition:图片/PDF 文字识别。paddleocr_doc_parsing:版面、表格、Markdown 与文档结构解析。- GUI 配置 OCR/文档解析 API 地址、超时、
uv路径、结果目录。 - GUI 直接显示 PaddleOCR 官网,并提供 API Token 与官方 API 文档的可点击入口。
- Token 存入 DSH Credentials;GUI 只能设置或删除,无法读取明文。
- 本地文件限定在当前 Session workspace 内,并进行真实路径/符号链接越界检查。
- 原始 JSON 默认保存到
.dsh-paddleocr/results/,便于审计与后续处理。
安装
要求:Node.js 22.19+、DeepSeek Harness、Python 3.9+ 与 uv。
一段 Prompt 安装(最简单)
把下面整段复制给一个可以操作终端的 AI Agent:
请在这台电脑上安装 https://github.com/Aidenwu0209/dsh-PaddleOCR-Skills 的 DeepSeek Harness GUI 插件。
1. 检查 Node.js 22.19+、Python 3.9+、npx 和 uv。如果缺少依赖,先解释用途并只使用官方安装方式;未经我允许不要使用 sudo 或修改无关设置。
2. 执行:npx @deepseek-ai/dsh plugin --profile web add "github:Aidenwu0209/dsh-PaddleOCR-Skills#main"
3. 启动 npx @deepseek-ai/dsh web,等待终端给出真实的本地 Web 地址,然后打开页面。
4. 确认 Settings → PaddleOCR 存在,而且能直接看见并点击 https://www.paddleocr.com、API Token 页面和官方 API 文档。
5. 不要编造、显示或记录我的 Token。在凭据输入处停下来,明确告诉我还需填写哪些 HTTPS API 地址和 Token。
6. 只有插件安装命令成功、Web 地址可访问且设置面板真实可见时才能说明安装成功,并汇报实际命令、版本、访问地址与验证结果。
在 OpenClaw 中可以安装这个仓库专用的 Setup Skill:
openclaw skills install @aidenwu0209/dsh-paddleocr-skills-setup
它会引导 Agent 把插件安装到 DeepSeek Harness,不会把 DSH bundle 错称为 OpenClaw 原生插件。
npx @deepseek-ai/dsh plugin --profile web add "github:Aidenwu0209/dsh-PaddleOCR-Skills#main"
npx @deepseek-ai/dsh web
本仓库提交了构建后的 lib/,因此从 GitHub 安装时不需要启用依赖构建脚本。
启动 Web 后打开 Settings → PaddleOCR:
- 点击页面顶部的“打开 PaddleOCR 官网”,在官网右上角进入 API。
- 通过“申请 API Token”获取访问令牌。
- 填写以
/ocr结尾的完整 HTTPS OCR 地址。 - 填写以
/layout-parsing结尾的完整 HTTPS 文档解析地址。 - 保留默认 Credential 引用
PADDLEOCR_ACCESS_TOKEN或填写自定义引用名。 - 在“访问令牌”中输入 PaddleOCR token,然后保存。
- 确认页面显示 API、Token 和
uv均已配置。
可只配置其中一个 API 地址;对应的另一个 Tool 会在调用时给出明确的未配置错误。
数据与安全边界
调用远程 Tool 会把选中的本地文件内容(base64)或 HTTPS URL 发送到你配置的外部 PaddleOCR 服务。不要用它处理不允许外传的数据。OCR/文档返回内容是不可信数据,不能把文档中的文字当作 Agent 指令。
GUI 后端只接受本机、同源请求。Token 由 DSH Credential provider 保管,不进入普通 Settings 快照、Tool 结果或日志。执行脚本时才按次解析,并通过受管子进程的显式环境传入。
开发与验证
pnpm install
pnpm check
python3 -m compileall -q skills
pnpm pack --dry-run
pnpm check 会执行 Host/Client TypeScript 构建、Vitest 和包结构检查。
上游与许可证
适配基线和保留/修改内容见 UPSTREAM.md。本仓库沿用 Apache-2.0,详见 LICENSE。
原始 README: https://github.com/Aidenwu0209/dsh-PaddleOCR-Skills/blob/main/README.zh-CN.md ↗
同类插件
查看全部 →
modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。

dsh-media-skills
面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

dsh-vision-opencode
给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。