DeepSeek Harness Hub
← 返回列表

LLM 限流器Asong6824/dsh-llm-rate-limit

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

为 API 请求限速排队,自动冷却避免 429 报错

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/20 · 已提供中文文档

# 用于 LLM API 速率限制、并发控制、FIFO 排队、令牌预算和自适应 429 冷却的 DeepSeek Harness 插件

综合分
28
GitHub 分
28
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Asong6824/dsh-llm-rate-limit
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery@deepseek-ai/cordis@deepseek-ai/dsh-brand@deepseek-ai/dsh-invariants@deepseek-ai/dsh-llm@deepseek-ai/dsh-session@deepseek-ai/dsh-timeout
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-llm-rate-limit

npm
downloads
CI
license

用于 DeepSeek Harness(DSH)的 LLM API 主动限流插件,在请求到达提供方之前平滑流量。它为 DeepSeek API、火山方舟及其他 DSH 提供方提供独立的 RPM、可选 Token 预算、并发控制、有界 FIFO 队列和自适应冷却。

当并行 Agent、Subagent、重试或后台请求导致 HTTP 429、提供方限流或突发流量时,可以使用本插件。

从 npm 安装

安装最新版到 Web profile:

dsh plugin --profile web add dsh-llm-rate-limit
dsh web

生产环境可以固定版本:

dsh plugin --profile web add dsh-llm-rate-limit@0.1.1

Headless profile 需要单独安装:

dsh plugin --profile headless add dsh-llm-rate-limit

也可以从 GitHub 安装:

dsh plugin --profile web add github:Asong6824/dsh-llm-rate-limit#v0.1.1

Bundle 默认保护 deepseek-official:每分钟 30 次请求、突发 1、并发 2,并启用有界队列。

功能

- 每个提供方独立的 RPM Token Bucket 和可配置突发容量。
- 可选的每分钟估算 Token 预算,并根据实际用量校正。
- 并发限制、有界 FIFO 队列、超时与取消。
- 根据提供方错误码、HTTP 状态和 Retry-After 自适应冷却。
- 可拒绝辅助请求,避免后台流量阻塞主要任务。
- 记录准入等待与开始事件,便于分析 DSH Session。
- 卸载时等待活动请求并妥善处理排队请求。
- 每次 dsh-llm-retry 重试都会重新准入;本插件自身不执行重试。

配置 DeepSeek 和方舟

在 $DSH_HOME/profiles//cordis.patch.yml 中覆盖完整的 llm-rate-limit 配置:

- id: llm-rate-limit
config:
providers:
deepseek-official:
requests: { perMinute: 30, burst: 1 }
maxConcurrentRequests: 2
queue: { maxSize: 100, maxWaitMs: 300000, auxiliary: reject }
cooldown:
codes: [RATE_LIMIT, SERVER]
statuses: [429, 529]
initialDelayMs: 500
maxDelayMs: 60000
maxProviderDelayMs: 3600000
jitterRatio: 0.1
volcengine-ark-coding:
requests: { perMinute: 30, burst: 1 }
maxConcurrentRequests: 2
queue: { maxSize: 100, maxWaitMs: 300000, auxiliary: reject }

提供方键必须与 GenerateOptions.provider 完全一致。可选 Token 限流配置为:

tokens:
perMinute: 1000000
burst: 200000
estimatedOutputTokens: 8192
imageTokens: 1024

tokens.burst 必须容纳一个完整请求估算。不需要本地 Token 上限时省略 tokens,RPM 和并发控制仍然生效。

工作原理

每次调用提供方前,插件会预留请求容量、估算 Token 容量和并发槽位。容量不足的请求按 FIFO 顺序等待。提供方返回限流错误后,所有相关请求共享冷却时间;成功响应会用实际 Token 用量校正估算。状态仅存在于当前进程,DSH 重启后重置。

插件不提供分布式配额、自动重试或提供方故障转移。

兼容性与链接

- 需要 DeepSeek Harness 0.1.0-rc.8 及以上版本和 Node.js 22.19 及以上版本。
- npm 包
- GitHub Releases
- DSH 插件 Topic
- 机器可读摘要

开发

pnpm install
pnpm run check

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群