← 返回列表
未验证
按证据链排查集群故障并沉淀案例,下次秒回
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/17 · 已提供中文文档
基于证据优先的 Kubernetes 运行时诊断与案例记忆——一项 DSH 技能(+ aiops CLI 孪生)。
综合分
27.7
GitHub 分
27.7
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add guiyi-labs/kubemd该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
KubeMD — Kubernetes 急诊医生 证据优先的 Kubernetes 运行时故障诊断 —— 自带案例记忆。 一个 DSH(DeepSeek Harness)skill,诊断的是线上故障中的集群,而不是编写 manifests。当 Pod 进入 CrashLoop、节点 NotReady、Service 停止响应时,KubeMD 按既定流程执行:捕获上下文 → 建立可复现的反馈环 → 采集信号 → 排序可证伪假设 → dry-run 修复 → 记录案例,下次秒回。 与 KubeShark 类 skill 的区别:它们防止编写 YAML 时的幻觉;KubeMD 负责查明正在运行的负载为什么坏了——并且永远不会忘记修复方法。 powered by dsh License 安装(30 秒) git clone https://github.com/guiyi-labs/kubemd ~/.dsh/skills/dsh-k8s-diagnosis 完成。DSH 会自动发现 ~/.dsh/skills/ 下的 skill,无需重启。 DSH(DeepSeek Harness)—— 万物皆插件。Skill 是 agent 按需加载的指令包 + 脚本。 演示 CLI 在真实故障注入 kind 集群上运行(diagnose → 4 项发现 → 案例秒回): KubeMD 演示 — aiops CLI 在真实故障集群上 它做什么 症状: "pod CrashLoopBackOff after image update to :latest" │ ├─ Phase 1 捕获上下文 (集群、范围、近期变更) ├─ Phase 2 建立反馈环 (kubectl events/日志 → 10 秒可红信号) ├─ Phase 3 采集信号 (事件 → 状态 → previous 日志 → 节点) ├─ Phase 4 排序 3-5 个可证伪假设(预测式,而非直觉) ├─ Phase 5 dry-run 验证 (kubectl diff / rollout undo) ├─ Phase 6 记录案例 (cases.yaml → 下次秒回) └─ Phase 7 输出契约 (ROOT_CAUSE / EVIDENCE / FIX / CASE_RECORDED) 包含内容 | 路径 | 用途 | |---|---| | SKILL.md | 7 阶段流程(精简、省 token) | | references/signal-map.md | 症状 → 信号 → 命令 速查表 | | references/playbooks/ | 深度排障手册:crashloop / oom / network / pending / node-not-ready(已在真实 kind 集群验证) | | scripts/collect-signals.sh | Phase 3 一键信号采集 | | scripts/record-case.sh | 将已解案例追加进 cases.yaml | | cases.yaml | 不断增长的案例库(含示例,随你的实战增长) | | verification-report.md | 真实故障注入验证报告(5 场景、无硬错误) | 案例记忆(差异化核心) 每条已解诊断都会成为一条记录。下次相同症状出现时,先检索: grep -i "crashloop" ~/.dsh/skills/dsh-k8s-diagnosis/cases.yaml 一条被回忆起的旧案例是最快的诊断:复现环 + 记住的修复 + 重新验证。这是更大 AIOps 知识闭环的本地 MVP——"把已解诊断蒸馏进可检索库"的思想,同样驱动着平台级 LLM 辅助根因分析。 也提供:aiops CLI 更喜欢终端?同一套确定性诊断规则以 go install CLI 发布: go install github.com/guiyi-labs/aiops-platform/cmd/aiops@latest aiops diagnose --namespace demo --pod web-0 # 基于规则的根因 aiops cases --query "crashloop" # 历史案例秒回 无服务器、无数据库、单二进制。同一引擎两个入口:KubeMD(agent 引导)↔ aiops CLI(终端自动化)。 设计原则(取各家之长) - 反馈环优先(mattpocock/diagnosing-bugs):反馈环存在之前不立假设 - 省 token 渐进式披露(KubeShark):SKILL.md 保持精简,排障手册按需加载 - 真实可信:每一步标注"已验证/未验证";不运行过的不宣称 - dry-run 语义:kubectl diff 先于 apply,rollout undo 优于线上手改 路线图 - [x] SKILL.md + signal-map + 5 playbooks + scripts - [x] cases.yaml 示例 + LICENSE + 品牌化 - [x] 真实 kind 集群验证(fault injection:crashloop / oom / netpol deny) - [ ] MCP tooling for DSH diagnosis hints - [ ] cases.yaml ↔ aiops-platform 知识库(RAG)同步 许可 Apache-2.0
扫码进群