← 返回列表
未验证
一个 DeepSeek Harness 插件,可将本地模型的上下文保持在你的 GPU 能够良好处理的规模。
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/31 · 已提供中文文档
DeepSeek Harness 插件:将本地模型的上下文保持在你的 GPU 能良好处理的规模(实测预填充速度、硬性上限、提前压缩)
综合分
27.8
GitHub 分
27.8
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add d3vmeh/dsh-context-budget该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
- 是什么
- dsh 原生插件 · other
- 装得上吗
- 本站尚未做安装检查
- 安全吗
- 本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
- 还在维护吗
- 活跃:最近一次提交在 26 天前
档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →
数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery@deepseek-ai/dsh-compaction用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
由 DeepSeek 最新模型翻译生成dsh-context-budget 一个 DeepSeek Harness 插件,可将本地模型的上下文保持在你的 GPU 能够良好处理的规模。 当对话达到模型声明上下文窗口的固定比例时,dsh 会对其进行压缩。在本地硬件上,声明的窗口并不太实用。例如,一个宣称支持 256K 的 27B 模型,在上下文较小时可能以每秒 300 个 token 的速度读取提示,而超过 100K 后则降至每秒 70 个 token。因此,对话早期一个回合可能几秒钟就开始,但同一会话后期则可能耗时半小时。此外,GPU 可能在窗口填满之前就挂起。此插件会测量上下文变得多么昂贵,并在到达该点之前提前警告或压缩。 它检查什么 在每个 agent 步骤之前,对每个受保护的 provider 路由: | 检查项 | 设置 | 触发条件 | |---|---|---| | 硬上限 | hardCeilingTokens | 上下文大于此 token 数 | | 观测到的缓慢 | maxTtftMs | 此上下文上最后一次回复在首个 token 之前耗时超过此值 | | 预测的缓慢 | maxColdPrefillMs | 上下文大小除以测得的 prefill 速率超过此值(即如果服务器的提示缓存丢失,需要等待的时间) | 任何已配置的检查都可能被触发。如果某项检查未设置,则跳过。prefill 速率在每次模型请求时根据到首个 chunk 的时间以及服务器报告的未缓存提示 token 数来测量。 安装 dsh plugin --profile web add dsh-context-budget 然后在 ~/.dsh/profiles/web/cordis.patch.yml 中: - id: context-budget config: providers: llamacpp: hardCeilingTokens: 110000 # optional maxTtftMs: 180000 # optional, 3 minutes maxColdPrefillMs: 600000 # optional, 10 minutes retainTokens: 24000 # kept verbatim when compacting (default 16000) action: warn # warn (default) or compact provider 键是你的 dsh 设置中的路由名称。每个 provider 条目至少需要一项检查。安装插件后,重启 dsh web 并打开一个新会话。 使用 dsh --profile web --dump-config 检查组合后的配置。 当某项检查触发时它会做什么 - warn:向 dsh 终端打印一行,说明检查项和当前值,以及现在压缩的预估代价: context-budget: llamacpp session=d1e4be82 predicted: cold prefill 37.2 min > 10.0 min (152340 tokens, rate 68 tok/s, compacting now ~41.2 min) - compact:打印同一行,然后请求 dsh 的压缩引擎对除最近 retainTokens 之外的所有内容进行摘要,并在工具调用边界处截断。结果也会打印出来(compacted N items (~T tokens) 或 compaction failed: ...; continuing)。该步骤始终继续。 压缩本身在本地运行时成本很高(摘要提示和重写后的上下文都需要冷预填充),这正是 compacting now 估算所显示的内容,因此使用较低的上限和较大的 retainTokens 通常比多次小型压缩的总体成本更低。 /context-budget 在会话中输入它以查看当前值: context-budget (llamacpp / qwen3.8-long) context: 152340 tokens ceiling 110000 [TRIP] last ttft: 41 s limit 180 s measured rate: 68 tok/s (3 samples) 3 min ago 8400 tok in 37 s cold 12 min ago 2100 tok in 8 s warm 41 min ago 12800 tok in 55 s cold predicted cold: 37.3 min limit 10.0 min [TRIP] compact now: ~41.2 min (retain 24000) action: warn 每个样本行显示测量时间、服务器必须读取的未缓存 token 数量、等待第一个 token 的时间,以及服务器是部分从其提示缓存中应答(warm)还是全部重新读取(cold)。warm 样本的计时看起来很漂亮;这个列表让这一点变得可见。 说明 - 适用于 dsh 流式传输的任何提供方,因为没有任何东西直接与模型服务器通信。测量数据来自 dsh 自身的使用报告和挂钟计时。 - 该插件与 dsh 的 compaction-basic 并行运行,后者保留自己的阈值。在那里为每个模型设置 thresholdRatio 可以给你一个静态上限,无需插件。该插件增加了测量检查和成本估算。 - 压缩摘要请求不会被测量,并且一旦上下文被重写,观察到的慢回复就会被遗忘,因此一次压缩不会触发另一次压缩。 - 如果会话的 agent 预设没有压缩引擎,compact 的行为等同于 warn(每个会话记录一次)。 - 日志行仅在检查触发时打印;保持在限制以下的会话不会打印任何内容。 许可证 MIT