🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

d3vmeh/dsh-context-budget

DeepSeek Harnessspec-screened扫描:低风险在 GitHub 查看 ↗
未验证

一个 DeepSeek Harness 插件,可将本地模型的上下文保持在你的 GPU 能够良好处理的规模。

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/31 · 已提供中文文档

DeepSeek Harness 插件:将本地模型的上下文保持在你的 GPU 能良好处理的规模(实测预填充速度、硬性上限、提前压缩)

综合分
27.8
GitHub 分
27.8
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add d3vmeh/dsh-context-budget
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · other
装得上吗
本站尚未做安装检查
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
活跃:最近一次提交在 26 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery@deepseek-ai/dsh-compaction
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh-context-budget

一个 DeepSeek Harness 插件,可将本地模型的上下文保持在你的 GPU 能够良好处理的规模。

当对话达到模型声明上下文窗口的固定比例时,dsh 会对其进行压缩。在本地硬件上,声明的窗口并不太实用。例如,一个宣称支持 256K 的 27B 模型,在上下文较小时可能以每秒 300 个 token 的速度读取提示,而超过 100K 后则降至每秒 70 个 token。因此,对话早期一个回合可能几秒钟就开始,但同一会话后期则可能耗时半小时。此外,GPU 可能在窗口填满之前就挂起。此插件会测量上下文变得多么昂贵,并在到达该点之前提前警告或压缩。

它检查什么

在每个 agent 步骤之前,对每个受保护的 provider 路由:

| 检查项 | 设置 | 触发条件 |
|---|---|---|
| 硬上限 | hardCeilingTokens | 上下文大于此 token 数 |
| 观测到的缓慢 | maxTtftMs | 此上下文上最后一次回复在首个 token 之前耗时超过此值 |
| 预测的缓慢 | maxColdPrefillMs | 上下文大小除以测得的 prefill 速率超过此值(即如果服务器的提示缓存丢失,需要等待的时间) |

任何已配置的检查都可能被触发。如果某项检查未设置,则跳过。prefill 速率在每次模型请求时根据到首个 chunk 的时间以及服务器报告的未缓存提示 token 数来测量。

安装

dsh plugin --profile web add dsh-context-budget

然后在 ~/.dsh/profiles/web/cordis.patch.yml 中:

- id: context-budget
config:
providers:
llamacpp:
hardCeilingTokens: 110000    # optional
maxTtftMs: 180000            # optional, 3 minutes
maxColdPrefillMs: 600000     # optional, 10 minutes
retainTokens: 24000          # kept verbatim when compacting (default 16000)
action: warn                 # warn (default) or compact

provider 键是你的 dsh 设置中的路由名称。每个 provider 条目至少需要一项检查。安装插件后,重启 dsh web 并打开一个新会话。

使用 dsh --profile web --dump-config 检查组合后的配置。

当某项检查触发时它会做什么

- warn:向 dsh 终端打印一行,说明检查项和当前值,以及现在压缩的预估代价:

context-budget: llamacpp session=d1e4be82 predicted: cold prefill 37.2 min > 10.0 min (152340 tokens, rate 68 tok/s, compacting now ~41.2 min)

- compact:打印同一行,然后请求 dsh 的压缩引擎对除最近 retainTokens 之外的所有内容进行摘要,并在工具调用边界处截断。结果也会打印出来(compacted N items (~T tokens) 或 compaction failed: ...; continuing)。该步骤始终继续。
压缩本身在本地运行时成本很高(摘要提示和重写后的上下文都需要冷预填充),这正是 compacting now 估算所显示的内容,因此使用较低的上限和较大的 retainTokens 通常比多次小型压缩的总体成本更低。

/context-budget

在会话中输入它以查看当前值:

context-budget (llamacpp / qwen3.8-long)
context: 152340 tokens   ceiling 110000   [TRIP]
last ttft: 41 s   limit 180 s
measured rate: 68 tok/s (3 samples)
3 min ago   8400 tok in 37 s   cold
12 min ago   2100 tok in 8 s   warm
41 min ago   12800 tok in 55 s   cold
predicted cold: 37.3 min   limit 10.0 min   [TRIP]
compact now: ~41.2 min   (retain 24000)
action: warn

每个样本行显示测量时间、服务器必须读取的未缓存 token 数量、等待第一个 token 的时间,以及服务器是部分从其提示缓存中应答(warm)还是全部重新读取(cold)。warm 样本的计时看起来很漂亮;这个列表让这一点变得可见。

说明

- 适用于 dsh 流式传输的任何提供方,因为没有任何东西直接与模型服务器通信。测量数据来自 dsh 自身的使用报告和挂钟计时。
- 该插件与 dsh 的 compaction-basic 并行运行,后者保留自己的阈值。在那里为每个模型设置 thresholdRatio 可以给你一个静态上限,无需插件。该插件增加了测量检查和成本估算。
- 压缩摘要请求不会被测量,并且一旦上下文被重写,观察到的慢回复就会被遗忘,因此一次压缩不会触发另一次压缩。
- 如果会话的 agent 预设没有压缩引擎,compact 的行为等同于 warn(每个会话记录一次)。
- 日志行仅在检查触发时打印;保持在限制以下的会话不会打印任何内容。

许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群