DeepSeek Harness Hub
← 返回列表

lazybot114514/dsh-token-budget

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

给每次 AI 对话装一根 Token 保险丝。

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/1 · 已提供中文文档

给每次 AI 对话装一根 Token 保险丝:为每条用户消息设置独立总预算,统一约束输入、缓存、思考与回答。A per-conversation total-token safety fuse for DeepSeek Harness, with a whale slider and automatic reset on the next user message.

综合分
29.6
GitHub 分
29.6
用户评分
★ Stars
2
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add lazybot114514/dsh-token-budget
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/19(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery@deepseek-ai/cordis@deepseek-ai/dsh-agent@deepseek-ai/dsh-client-runtime@deepseek-ai/dsh-client-ui-conversation@deepseek-ai/dsh-client-ui-slots@deepseek-ai/dsh-llm@deepseek-ai/dsh-session@deepseek-ai/dsh-settings@deepseek-ai/dsh-token-meter
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-token-budget

给每次 AI 对话装一根 Token 保险丝。

在 DeepSeek Harness Web 输入框下方设定本次对话的总 Token 预算。每条用户消息都会获得一份独立预算;输入、缓存读写、模型思考和最终回答共同使用这份额度,达到上限后插件会停止继续请求或收紧本次生成长度。下一条用户消息自动重新计算。

新会话开始页会直接显示预算卡,发送第一条消息前即可调整额度;创建会话后继续显示实时用量与剩余额度。

单次对话 Token 总预算

它控制什么

本次对话总用量
= 每次模型请求的未缓存输入
+ 缓存读取
+ 缓存写入
+ 推理与最终回答

预算单位始终是“一条用户消息开始,到这次回答结束”,不是整个聊天历史,也不是某一个内部执行步骤。一次回答内部如果发生多次标准模型请求或重试,它们产生的 Token 都计入同一份预算。

例如设置 8,000 Token:

输入及缓存占用  1,500
模型思考占用    4,000
回答最多剩余    2,500
合计最多约为    8,000

若预计输入已经吃完预算,插件会在网络请求前停止;否则它会把模型的生成上限收紧到剩余额度。失败请求只要返回 usage 也会计入,流式 usage 与最终 message usage 不会重复统计。

安装

前置条件:Node.js ≥ 22.18、DeepSeek Harness CLI,并确保 pnpm 已加入 PATH。

直接从 GitHub 安装:

dsh plugin --profile web add github:Zyc20010326/dsh-token-budget
dsh web

也可以下载仓库 dist/ 中的预构建安装包,然后运行:

dsh plugin --profile web add ./dsh-token-budget-0.2.1.tgz
dsh web

从源码安装和验证:

git clone https://github.com/Zyc20010326/dsh-token-budget.git
cd dsh-token-budget
npm install
npm test
dsh plugin --profile web add .
dsh web

配置

用户界面只有一个选择:本次对话最多允许使用多少 Token。

Cordis 全局默认值仍可配置:

- id: token-budget
name: dsh-token-budget
config:
enabled: true
maxTokens: 8192
minimumRequestTokens: 256
safetyMarginTokens: 512

- maxTokens:每条用户消息的默认总预算。
- minimumRequestTokens:剩余额度低于该值时,不再发起一个几乎无法完成的模型请求。
- safetyMarginTokens:为输入估算误差保留的安全余量。

Web 滑杆范围为 512–131072。调整后的值立即作用于当前回答尚未发出的请求,并作为当前会话中后续用户消息的默认预算。它只保存在当前 DSH 进程内;重启后恢复 Cordis 默认值。

v0.2.1

预算卡现在直接显示在新会话开始页,第一条消息发送前即可设定额度;进入会话后,卡片继续显示实时用量与剩余额度。

从 v0.1.1 升级

v0.2.0 删除了 metric 和 scope。旧配置中的这两个字段应移除;插件现在固定使用“当前用户消息的总 Token 预算”,不再提供输出预算或整场会话预算模式。

精度边界

DeepSeek 服务端通常在请求完成后才返回精确输入 usage。插件在发送前使用 Harness Token Meter 估算输入,并额外扣除安全余量;完成后再用服务端 usage 校正已用量。

因此,本插件提供的是保守的单次对话总预算控制,不是数学意义上绝不偏差的计费硬上限。默认安全余量会降低超支概率,也可能让回答略早停止。若需要供应商账单层面的绝对财务上限,请同时配置 API 网关或账户额度。

覆盖范围

- 覆盖同一 DSH 进程内、经过标准对话 Agent 请求边界的调用。
- 一条用户消息内部的标准多次请求和重试会共同消耗本次预算。
- 独立进程、绕过标准对话边界的直接 LLM 调用,以及标题生成等辅助调用不在这份预算内。
- 子 Agent 是否计入父对话取决于 Harness 是否让其请求共享父 turn;独立 Agent 默认不会自动共享总账。

MIT License。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群