DeepSeek Harness Hub
← 返回列表

zhuzichen362/dsh-call-shrink

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

把 N 次 LLM 调用压成 1 次 —— DeepSeek HarnessDSH的极致调用压缩插件。

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/29 · 已提供中文文档
综合分
28.7
GitHub 分
28.7
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add zhuzichen362/dsh-call-shrink
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-client-runtime@deepseek-ai/dsh-client-ui-slots
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-call-shrink

把 N 次 LLM 调用压成 1 次 —— DeepSeek Harness(DSH)的极致调用压缩插件。

Listed on dsh-plugin.org · GitHub

一句话:在不改变对话结果的前提下,把「去重、缓存、批量归并」做到调用数维度的极限,直接砍掉冗余 API 调用 —— 省 token、省预算、省时间。

它解决了什么

在 DSH 这类「一个模型回合会同步发起多路独立子任务」的代理环境里,每一次 llm/stream 都是一次真实上游调用。并发会话、平行子代理、标题生成、重复工具流,都会产生大量内容相近甚至完全相同的请求。call-shrink 在 Stream 层拦截这些请求,用三层压缩把它们归并到最少的上游调用:

1. 缓存(Cache) — 相同指纹的请求直接回放,24 小时 TTL、4096 条、落盘持久化。
2. 去重(Dedup) — 飞行中的同指纹请求共享同一个上游结果。
3. 批量归并(Batch-Merge) — 10 秒窗口内把 N 个独立请求拼成 1 次上游调用(条数无上限、不按字符拆批)。

外加两个「极端化」细节:

- 标题生成短路:purpose === 'title' 直接返回空,0 次上游调用。
- 提示词注入:向系统提示词挂入一条 API 经济性约束,让模型自己也会把可并行的工具调用一次发全。

特性

| 特性 | 说明 |
| --- | --- |
| ⚡ 极致归并 | 窗口 10s · 条数无上限 · 不拆批 · 单次输出上限 1 亿 token |
| 🧬 稳定指纹 | 规范化序列化(剔除 sessionId/signal/id/tool_call_id/source),跨会话命中相同工具流 |
| 🎯 协议化合并 | [[TASK n]] / [[ANSWER n]] 分隔 + JSON 应答;解析失败自动降级 STRICT MODE 重试 1 次 |
| 🛡 失败熔断 | 连续 2 次合并失败自动退化为单发,10 秒后复位 |
| 📊 实时面板 | 会话头「调用压缩」开关:今日用量/预算、单发+合并均摊、去重、缓存命中、省下的调用数 |
| 🧾 用量持久化 | 每日预算 500,跨重启记录每日与每会话用量 |
| 🔌 一键开关/重置 | host.call RPC:state / session-stats / set-enabled / reset |

工作原理

ctx.on('llm/stream')
│
┌───────────────────┼───────────────────┐
▼                   ▼                   ▼
title 短路          缓存命中(回放)       指纹去重(飞行中)
(0 次上游)          (0 次上游)           (0 次上游)
│
▼
剩余请求进入 10 秒归并窗口
│
▼
N 个请求 → 拼成 1 个上游流(任务分隔协议)
│
┌────────────┴────────────┐
▼                         ▼
解析成功                   解析失败
按 [[ANSWER n]] 拆回        STRICT 重试 → 仍失败
N 路原始流              逐个降级为单独调用
└────────────┬────────────┘
▼
全部写入 24h 回放缓存 + 用量统计

合并协议:一次上游调用中,每个待答任务用 [[TASK n START]]…[[TASK n END]] 包住完整对话,模型需在每个 [[ANSWER n START]]…[[ANSWER n END]] 之间输出恰好一个 JSON —— {"kind":"text","text":"…"} 或 {"kind":"tool_calls","tool_calls":[…]} —— 再按序拆回 N 路原始流。

安装(标准 DSH 插件包 · 推荐)

call-shrink 同时打包成符合 DSH Plugin 规范 的标准插件(package.json 声明 dsh.bundle,由 profile boot 自动应用),可被 DSH 内置插件市场 / dsh.market 目录收录:

dsh plugin --profile web add dsh-call-shrink

或未发布 npm 前,从本仓库直接安装:

dsh plugin --profile web add https://github.com/zhuzichen362/dsh-call-shrink

重启 dsh web(桌面端请先把内置 dsh 更新到 0.1.0-rc.6 及以上),会话头会出现「调用压缩」状态点;服务端拦截逻辑在 index.cjs(内部加载 src/host.js),浏览器端在 client.js。

安装(动态 Cordis 插件 · 源码注入)

call-shrink 的原始形态是 DSH 的动态 Cordis 插件(code.host + code.client),源码即 src/host.js 与 src/client.js。

在 DSH 中让代理执行:
- code.host ← src/host.js 全文
- code.client ← src/client.js 全文
- 名称 / 用途(可选附带)

主机侧声明了 inject: ['timer'],并读取 llm、fs、systemPrompt、harness 等服务;服务缺失时安全降级、不影响运行。

调参(src/host.js 顶部「调参区」)

| 参数 | 默认 | 说明 |
| --- | --- | --- |
| CACHE_TTL_MS | 86400000 | 回放缓存有效期(24 小时) |
| MAX_ENTRIES | 4096 | 缓存条数上限 |
| BATCH_WINDOW_MS | 10000 | 归并收集窗口 |
| MAX_BATCH | Infinity | 单次合并条数上限 |
| MERGE_COOLDOWN_MS | 10000 | 合并连续失败后的熔断时长 |
| MERGE_MAX_CHARS | Infinity | 不再按字符拆批 |
| MERGED_MAX_TOKENS | 100000000 | 单次合并输出上限 |
| DAILY_BUDGET | 500 | 每日预算看板阈值 |

面板指标

- 今日 api/budget:是否超预算(绿 / 黄 / 红)。
- 本对话:steps、API 次数(单发 apiSingle + 合并 apiMerged)、省 steps-api、去重 dedup、缓存命中 cacheHit、参与合并 merged。
- 全局:requests / upstream / dedup / cacheHit / batches(batched) / fallbacks / cacheEntries / restored。

注意

- 批量归并改变了「并发独立请求各自一次调用」的形态,聚合上游输出依赖模型遵守协议;解析失败会自动降级,不会丢答案。
- 上游调用按 1/N 均摊计入参与合并的各会话。
- 缓存与用量写入工作目录的 .dsh-shrink-cache.json / .dsh-shrink-usage.json,已列入 .gitignore。

License

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群