dsh-eval

by hccccc01333

工具与能力github收录于 08-23

DeepSeek Harness 的 agent 评估平台

Agent Evaluation Platform for deepseek-harness.

安装

dsh plugin --profile web add github:hccccc01333/dsh-eval

GitHub 源码安装:首次需按提示配置 allowBuilds 构建授权后重试

安装与环境配置指引、插件开发教程见 DSH 中文社区文档 ↗

安装即在你的机器上以你的权限运行第三方代码——它可读写文件、使用凭据、访问网络,DSH 的工具审批不会为插件代码加沙箱。「检测到 manifest」仅代表发现 dsh.bundle / dsh.plugin 清单,不构成兼容性或安全审查;安装前请审阅源码,不熟悉的插件先在不含密钥的环境试用。

README

独立开发目录:Agent Evaluation Platform 插件 dsh-eval,与 deepseek-harness 主仓的 WIP 隔离。

结构:

  • packages/eval/ —— 插件本体(bundle + CLI app)。
  • harness/ —— 指向本地 deepseek-harness 检出的 junction/symlink;pnpm workspace 通过它解析 @deepseek-ai/* 源码包(0.1.0-rc.5);npm 发布版则对齐 官方 0.1.0-rc.6 peer 依赖,可直接安装。

快速开始(npm 直装):

pnpm add dsh-eval
dsh plugin --profile eval add dsh-eval

源码流程:

git clone https://github.com/hccccc01333/dsh-eval.git
cd dsh-eval
New-Item -ItemType Junction -Path harness -Target D:\path\to\deepseek-harness
pnpm install

当前能力(v0.2):

  • dsh eval run benchmark.yaml —— benchmark 编排 + 自动指标 + 脚本化评分 (expected.tool 工具选择准确率、expected.check 任务成功)。
  • LLM judge:judge 配置驱动最终答案得分与幻觉标记。
  • 子 agent trace 归并:子 session 日志合并进 trial 指标。
  • 配对 A/B:同 case 的 win/lose/tie 统计。
  • keyless replay:有 key 录一次,CI 里从录制日志免 key 复现。
  • 跨 harness 导入:dsh eval import codex|claude-code <log> --out run.json。
  • dsh eval report run.json —— markdown 报告,含评分列与聚合比率。
  • dsh eval compare run-v1.json run-v2.json —— 双 run 对比表,带 B - A 差值。

常用命令(在 D:\dsh-eval 下):

pnpm install
pnpm --filter dsh-eval test
pnpm --filter dsh-eval run typecheck
pnpm --filter dsh-eval build

原始 README: https://github.com/hccccc01333/dsh-eval/blob/master/README.zh.md ↗