🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

siruignaw-sys/dsh-tool-bandit-search

DeepSeek Harnessspec-screened扫描:低风险在 GitHub 查看 ↗
未验证

一个 DeepSeek Harness 插件,它将标准的 websearch 工具替换为一个 search…

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/23 · 已提供中文文档

一个 DeepSeek Harness 插件,它通过上下文多臂老虎机来学习使用哪种搜索策略,从而取代标准的 web_search 工具,而不是依赖单一的硬编码方法。

综合分
27.6
GitHub 分
27.6
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add siruignaw-sys/dsh-tool-bandit-search
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · tool
装得上吗
本站尚未做安装检查
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 34 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/23(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-tools@deepseek-ai/cordis
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh-tool-bandit-search

一个 DeepSeek Harness 插件,它将标准的 web_search 工具替换为一个 search 工具,该工具通过上下文多臂老虎机(contextual multi-armed bandit)学习使用哪种搜索策略,而不是依赖单一的硬编码方法。

为什么

每次网络搜索都存在权衡:快速、狭窄的查询能让你迅速得到答案,但更宽泛、多角度的查询能带来更好的覆盖范围,代价是延迟。硬编码单一策略意味着要么总是为简单问题付出过高代价,要么总是在复杂问题上表现不佳。这个插件让工具能够从真实使用中发现哪种策略往往更有回报——并随着条件变化持续适应。

工作原理

search 工具有两种内部策略(“臂”):

- quick —— 单个搜索查询,最多返回 5 条结果。快速,适合简单的事实性查询。
- thorough —— 三个查询变体(原始查询加上两个重新表述的角度)并行运行并合并/去重,最多返回 10 条结果。较慢,更适合开放式或多视角的问题。

在每次调用时,插件使用 Thompson 采样来选择一个臂:每个臂都有一个 Beta(α, β) 分布,表示其估计的奖励,插件从两个分布中采样,采样值更高的那个臂会被使用。这自然地平衡了探索(偶尔尝试证明较少的臂)与利用(偏向迄今为止表现更好的臂)。

调用之后,会从两个组成部分计算出一个 [0, 1] 范围内的连续奖励,两者权重相等:

- 质量 —— 返回了多少条结果,相对于该臂自身的最大值(因此 5 条中的 5 条“quick”结果与 10 条中的 10 条“thorough”结果得分相同——没有任何一个臂会因为自身的结果上限而在结构上占优)。
- 速度 —— 调用完成的速度,根据现实的搜索延迟进行校准。

该奖励会更新所选臂的 Beta 分布(α += reward,β += 1 − reward),因此老虎机的信念在每次调用后都会略微变化——没有单独的训练阶段,也无需手动调参。

模型永远不会直接看到这两个臂。它只是调用 search(query);插件在内部决定运行哪种策略。

示例输出

[bandit-search] arm=quick reward=1.000 durationMs=4393 resultCount=5 stats={"quick":{"alpha":2,"beta":1},"thorough":{"alpha":1,"beta":1}}
[bandit-search] arm=thorough reward=0.854 durationMs=8481 resultCount=10 stats={"quick":{"alpha":2,"beta":1},"thorough":{"alpha":1.85,"beta":1.15}}
[bandit-search] arm=quick reward=0.000 durationMs=5777 resultCount=0 stats={"quick":{"alpha":2,"beta":2},"thorough":{"alpha":1.85,"beta":1.15}}

每一行日志都显示选择了哪个臂、它获得的奖励,以及两个臂当前的 Beta 参数——你可以随着它积累证据,实时观察老虎机的置信度变化。

安装

dsh plugin --profile web add github:siruignaw-sys/dsh-tool-bandit-search
对于针对克隆/编辑后的副本进行本地开发,请改用:

dsh plugin --profile web add link:/absolute/path/to/dsh-tool-bandit-search

无论采用哪种方式,安装后都要重启 Web UI(重新运行 pnpm dsh web / dsh web,而不只是新建一个聊天)——捆绑包安装只会在下次启动时生效,并且该插件用于引导模型优先使用 search 而非内置 web_search 工具的系统提示指令,只对在此之后启动的会话生效。

要求

运行在 dsh 原生 ctx.web 搜索服务之上——除了你的 dsh 配置文件已配置的搜索提供方(例如 dsh-web-search-deepseek)之外,无需单独的 API 密钥。

已知限制

- Bandit 状态存储在内存中,每次重启都会重置。通过 ctx.storage(dsh 已经暴露了它)来持久化是顺理成章的下一步。
- 奖励是一种启发式指标,而非对实际答案质量的衡量——它捕捉的是结果数量和延迟,而不是结果是否相关或正确。更强的版本可能会根据模型最终答案是否实际使用了返回的来源来评分奖励。
- 模型仍然可以在每轮中发起多次 search 调用,即使 thorough 已经在内部进行扩展——该插件优化的是每次调用的策略,而不是模型自身的多次调用行为。
- 基于 dsh 的开发者预览版构建并测试;在稳定版本发布之前,插件/工具 API 可能会发生变化。

许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群