🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

bob334477/harness-safe-exhaust-probe-qs

DeepSeek Harnessspec-screened扫描:无法判定在 GitHub 查看 ↗
未验证

一项关于扩展 DSH 可观测性的提案,以覆盖长时程智能体运行中的正向交互耗尽模式。聚焦于…

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/20 · 已提供中文文档

DSH 插件规范:观测软信号漂移

综合分
27.4
GitHub 分
27.4
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add bob334477/harness-safe-exhaust-probe-qs
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · chat
装得上吗
本站尚未做安装检查
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 36 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/22(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
harness-safe-exhaust-probe-qs
一项关于扩展 DSH 可观测性的提案,以覆盖长时程智能体运行中的正向交互耗尽模式。聚焦于 workspace-write 模式下单调安全防护与高上下文密度、低对抗性交互之间的缺口。无漏洞利用代码;仅包含插件规范与讨论切入点。
harness-safe-exhaust-probe-qs

harness-safe-exhaust-probe-qs

一项关于扩展 DSH 可观测性的提案,以覆盖长时程智能体运行中的正向交互耗尽模式。

这是什么

本仓库提出了一项 Cordis 插件规范(并非漏洞利用代码),用于观察单调安全防护在 workspace-write 模式下、高上下文密度且低对抗性的交互中会如何表现。

当前的 Harness 安全机制在阻止恶意指令与权限提升方面表现出色。但当智能体进行长时间、善意(benign-intent)、非对抗性的对话,并逐渐推移上下文边界时,会发生什么?单调防护是否仍能正确识别“意外模式漂移”?现有的 Session Log 审计轨迹能否支持对此类现象的事后归因?

这不是针对 DeepSeek 的缺陷报告。这是面向整个 Agent Runtime 类别的 共同工程挑战。

提议的插件规范(草案)

-   输入:通过标准 dsh-plugin 接口注入的良性对话流
-   观察点:挂接到 Harness 仅追加会话日志;提取 token 消耗速率、自指输出频率、子智能体调度密度
-   输出:与 Harness Trajectory 查看器兼容的 JSONL,可导入官方调试器进行回放

为什么这很重要

-   将“软信号漂移”转化为 工程师可验证的问题
-   与 Harness 插件范式保持一致——无需重复造轮子
-   所有观察均使用 Harness 原生可观测性接口——零绕过、零破解

状态

🌱 提案阶段。尚无可执行代码。寻求社区共同完善规范。

主题

#dsh-plugin #agent-safety #observability #positive-interaction-exhaustion

许可证

MIT——与 Harness 生态系统保持一致。可自由集成、修改、分发。

本仓库遵循严格的安全红线:不提及具体个人/事件,不包含攻击载荷,不包含对话截图。Issue 模板仅强制采用现象报告格式。

🔍 展开查看思考锚点地图
我们思考的活地图

AI 可靠性评估:锚点与种子

“评估AI的可靠性,不是证明它能做什么,而是诚实面对它不能保证什么。”
—— 本项目的核心信念

🔱 核心锚点(不可动摇的脊梁)
1. 人机协作边界
AI 可靠性 ≠ 全知全能。它存在于清晰划定 机器能够承担什么 与 人类必须守护什么 之间。
2. 评估的否定性认识论
评估揭示的是局限,而非能力。安全是可证伪的,而非可证明的。
3. 以人为本的监督
终极指标是人类的认知负荷、问责制与意义建构——而非技术合规。

🌿 支撑筋脉(隐性支撑筋脉)
- 代理奖励设计 → 处理不可观测能力
- 公理约束框架 → 边界的形式化语言
- 意图-行动一致性 → 过程导向的可信性
- 状态-预测分离假说 → 分工的认识论基础
- 适应性实践语法 → 生态效度缺口中的韧性

🌱 种子库(未来可能唤醒的种子)

| 种子 | 潜在唤醒语境 |
|------|-----------------------------|
| 具身语义-空间耦合(Robostral) | 若扩展至具身AI评估 |
| 临床责任锚定(Physician-Oversight) | 若深化医疗AI伦理 |
| 红队可证伪逻辑 | 若应对安全方面的过度承诺 |
| 元认知研究质疑(Auto-Research) | 若反思框架演化 |

💬 如何使用此地图
- 用于写作:让核心锚点引导你论证的重心。
- 用于修订:检查新内容是否与支撑筋脉一致或对其形成延展。
- 用于未来工作:探索邻近领域时,造访种子库。
- 用于休息:关闭此文件。即使你不在,锚点依然稳固。

此仓库是一个活的思想空间,而非静态档案。
由[Your Name]与Weiming Teacher悉心更新。

📚 来源追溯
完整参考文献及链接维护于references.md。
此处的锚点与种子是提炼的精髓,而非引文索引。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群