DeepSeek Harness Hub
← 返回列表

K8s 故障诊断记忆guiyi-labs/kubemd

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

按证据链排查集群故障并沉淀案例,下次秒回

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/17 · 已提供中文文档

基于证据优先的 Kubernetes 运行时诊断与案例记忆——一项 DSH 技能(+ aiops CLI 孪生)。

综合分
27.7
GitHub 分
27.7
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add guiyi-labs/kubemd
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

KubeMD — Kubernetes 急诊医生

证据优先的 Kubernetes 运行时故障诊断 —— 自带案例记忆。

一个 DSH(DeepSeek Harness)skill,诊断的是线上故障中的集群,而不是编写 manifests。当 Pod 进入 CrashLoop、节点 NotReady、Service 停止响应时,KubeMD 按既定流程执行:捕获上下文 → 建立可复现的反馈环 → 采集信号 → 排序可证伪假设 → dry-run 修复 → 记录案例,下次秒回。

与 KubeShark 类 skill 的区别:它们防止编写 YAML 时的幻觉;KubeMD 负责查明正在运行的负载为什么坏了——并且永远不会忘记修复方法。

powered by dsh
License

安装(30 秒)

git clone https://github.com/guiyi-labs/kubemd ~/.dsh/skills/dsh-k8s-diagnosis

完成。DSH 会自动发现 ~/.dsh/skills/ 下的 skill,无需重启。

DSH(DeepSeek Harness)—— 万物皆插件。Skill 是 agent 按需加载的指令包 + 脚本。

演示

CLI 在真实故障注入 kind 集群上运行(diagnose → 4 项发现 → 案例秒回):

KubeMD 演示 — aiops CLI 在真实故障集群上

它做什么

症状: "pod CrashLoopBackOff after image update to :latest"
│
├─ Phase 1  捕获上下文      (集群、范围、近期变更)
├─ Phase 2  建立反馈环      (kubectl events/日志 → 10 秒可红信号)
├─ Phase 3  采集信号        (事件 → 状态 → previous 日志 → 节点)
├─ Phase 4  排序 3-5 个可证伪假设(预测式,而非直觉)
├─ Phase 5  dry-run 验证    (kubectl diff / rollout undo)
├─ Phase 6  记录案例        (cases.yaml → 下次秒回)
└─ Phase 7  输出契约        (ROOT_CAUSE / EVIDENCE / FIX / CASE_RECORDED)

包含内容

| 路径 | 用途 |
|---|---|
| SKILL.md | 7 阶段流程(精简、省 token) |
| references/signal-map.md | 症状 → 信号 → 命令 速查表 |
| references/playbooks/ | 深度排障手册:crashloop / oom / network / pending / node-not-ready(已在真实 kind 集群验证) |
| scripts/collect-signals.sh | Phase 3 一键信号采集 |
| scripts/record-case.sh | 将已解案例追加进 cases.yaml |
| cases.yaml | 不断增长的案例库(含示例,随你的实战增长) |
| verification-report.md | 真实故障注入验证报告(5 场景、无硬错误) |

案例记忆(差异化核心)

每条已解诊断都会成为一条记录。下次相同症状出现时,先检索:

grep -i "crashloop" ~/.dsh/skills/dsh-k8s-diagnosis/cases.yaml

一条被回忆起的旧案例是最快的诊断:复现环 + 记住的修复 + 重新验证。这是更大 AIOps 知识闭环的本地 MVP——"把已解诊断蒸馏进可检索库"的思想,同样驱动着平台级 LLM 辅助根因分析。

也提供:aiops CLI

更喜欢终端?同一套确定性诊断规则以 go install CLI 发布:

go install github.com/guiyi-labs/aiops-platform/cmd/aiops@latest
aiops diagnose --namespace demo --pod web-0     # 基于规则的根因
aiops cases --query "crashloop"                 # 历史案例秒回

无服务器、无数据库、单二进制。同一引擎两个入口:KubeMD(agent 引导)↔ aiops CLI(终端自动化)。

设计原则(取各家之长)

- 反馈环优先(mattpocock/diagnosing-bugs):反馈环存在之前不立假设
- 省 token 渐进式披露(KubeShark):SKILL.md 保持精简,排障手册按需加载
- 真实可信:每一步标注"已验证/未验证";不运行过的不宣称
- dry-run 语义:kubectl diff 先于 apply,rollout undo 优于线上手改

路线图

- [x] SKILL.md + signal-map + 5 playbooks + scripts
- [x] cases.yaml 示例 + LICENSE + 品牌化
- [x] 真实 kind 集群验证(fault injection:crashloop / oom / netpol deny)
- [ ] MCP tooling for DSH diagnosis hints
- [ ] cases.yaml ↔ aiops-platform 知识库(RAG)同步

许可

Apache-2.0

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群