← 返回列表
需源码安装
超棒的安全代理工具集 Awesome
暂不能直接安装(需源码编译或环境不满足):仓库缺少 package.json,无法用 dsh 插件安装命令安装。 · 最近上游提交 2026/9/4 · 已提供中文文档
用于渗透测试、代码审计、模糊测试、漏洞发现和逆向工程的AI代理——测试框架、沙箱、安全MCP服务器、基准测试和评估。
综合分
42.6
GitHub 分
42.6
用户评分
—
★ Stars
21
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Ed-Marcavage/awesome-security-agent-harnesses仓库缺少 package.json,无法用 dsh 插件安装命令安装,改用 GitHub 源安装
数据截至 2026/9/17(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查需源码安装
以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。
✗npm 包awesome-security-agent-harnesses(未发布到 npm,仅可源码安装)
✓Node 引擎未声明 engines.node
✓dsh CLI 依赖未声明 dsh 版本约束
✗入口文件缺少入口声明
仓库缺少 package.json,无法用 dsh 插件安装命令安装
验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/17 23:38:50
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
超棒的安全代理工具集 Awesome 用于渗透测试、代码审计、模糊测试、漏洞发现和逆向工程的 AI 代理——工具集、沙箱、安全 MCP 服务器、基准测试和评估。 在提交拉取请求之前,请阅读贡献指南。 目录 - 什么是安全代理工具集 - 代码审计工具集 - 渗透测试代理 - 模糊测试与漏洞发现 - DARPA AIxCC 网络推理系统 - 代理工具与集成 - 代理沙箱 - 基准测试与评估 - 阅读材料 什么是安全代理工具集 安全代理工具集是包裹在模型周围的一切:它运行的沙箱、它可以调用的分析工具、编码方法论的提示词和技能,以及你用来检查它的评估。大部分工程工作都在这里,而不是在模型中——或者正如 Cloudflare 在将其扩展到自己的整个机群后所说的那样,工具集才是持久的部分。 代理擅长产生看似合理的发现,却不擅长分辨哪些是真实的。代理会修改源代码以使其自己的漏洞利用生效,然后报告它刚刚制造出的 bug。因此,重要的指标不是召回率——在不已经知道代码库中每个 bug 的情况下,没人能测量召回率——而是有多少未确认的发现到达了人类面前:Cloudflare 的流水线将 20,799 个原始候选项缩减到 12,057 个通过验证的候选项,然后又将其中的 5,442 个作为重复项折叠掉。一个能够复现崩溃、重放输入或重新运行静态分析器的工具集,正是你在人类看到之前剔除坏结果的方式。 标记为 SKILL.md 的条目是技能包而非可运行的代理工具集:以 Agent Skills 形式编码的方法论,由 Claude Code 等通用编码代理执行。它们位于与其功能匹配的章节中。 代码审计工具集 针对源代码运行编码代理的工具集:发现、分类、验证和修补。 - Anthropic Defending Code Reference Harness - 使用 Claude 进行自主漏洞发现和修复的参考实现,包含用于威胁建模、扫描、分类和修补的技能。 - audit - 基于 Claude Code SDK 构建的八阶段发现代理,结合了许多窄范围的代理、它们之间刻意的分歧,以及一个明确的可达性门控。 - Capital One VulnHunter - 代理式安全工具,直接将主动的、攻击者优先的分析应用于源代码。 - Clearwing - 自主源代码猎手,对文件进行排序,分派专家代理,并将 sanitizer 崩溃视为基准真相,另设独立的网络渗透测试模式。 - Cloudflare Security Audit - 六阶段审计技能:并行狩猎代理从不同角度攻击代码库,独立代理尝试反驳每项发现,新代理根据源代码验证符合 schema 的 findings.json。SKILL.md。 - Google Mantis - 模块化、技术栈无关的安全审查技能工具包,供编码代理发现、复现和修补漏洞,配备 gVisor 沙箱化复现器和明确的误报过滤规则。 - Krait - 面向 Solidity 的 Claude Code 审计方法论,包含 101 条启发式规则、26 个分析模块和 8 道 kill gate,尝试反驳每项发现,在 50 场 Code4rena 竞赛上盲测,v8 基线精确率达 100%。 - Open Kritt - 自托管编排器,运行代理以发现和验证漏洞、导出规范化发现并评定严重性等级,漏洞赏金支付记入其 Blockian 研究员身份。 - OpenAI Codex Security - 使用 Codex 发现、验证和修复安全漏洞的 CLI 和 TypeScript SDK。 - OpenHack - 多代理扫描器,运行侦察、专家狩猎、独立验证以及沙箱和浏览器验证,仅使用开源模型。 - RAPTOR - 自主研究框架,对代码库或二进制文件串联静态分析、二进制分析、漏洞验证、漏洞利用生成和补丁编写。SKILL.md。 - Trail of Bits Skills - 用于安全研究、漏洞检测和审计工作流的技能,提炼自该公司的审计实践。SKILL.md。 - Vercel Labs Deepsec - 使用编码代理在代码库中查找漏洞的安全测试框架。 - Visa Vulnerability Agentic Harness - 用于自主漏洞发现、修复和验证的代理式 SAST 流水线,输出 Markdown 和 SARIF 报告。 渗透测试代理 攻击运行中应用程序和基础设施的代理:侦察、利用和影响证明。 - AIDA - 模型无关的渗透测试代理,在既定范围内进行推理,在隔离容器中执行,并在会话之间保持持久评估状态。 - AWE - 研究框架,将轻量级编排层与记忆增强、针对特定漏洞的智能体流水线配对,并在 XBOW 基准上进行评估。 - BlacksmithAI - 多智能体渗透测试框架,在预装标准安全工具的 Docker 镜像内,引导目标从侦察到后渗透,可通过 Web UI 或 CLI 驱动。 - BugTraceAI - 用于授权 Web 应用安全测试的多智能体平台,具备独立验证、证据捕获和报告功能。 - CAI - Alias Robotics 用于构建网络安全智能体的框架,提供用于攻击性测试的工具和工作流原语。 - CyberStrike - 攻击性安全测试框架,通过签名攻击技能、内置工具和 MCP 集成协调自主智能体,并映射到 MITRE ATT&CK 和 OWASP WSTG。 - hackingBuddyGPT - 维也纳工业大学的研究框架,用于以大约 50 行代码编写 LLM 渗透测试智能体,并随附可复用的 Linux 权限提升基准和开放获取评估。 - HPTSA - Teams of LLM Agents can Exploit Zero-Day Vulnerabilities 背后的研究实现,使用监督智能体协调漏洞专用子智能体。 - Nebula - 渗透测试助手,可自动化侦察、笔记记录和工具编排。 - NeuroSploit - Rust 框架,可将 URL、代码仓库或主机转化为自主交战,仅选择与攻击面匹配的专家智能体,并跨模型验证发现。 - PentAGI - 完全自主的多智能体渗透测试系统,具备 Docker 隔离、规划与监督、持久记忆和 Web 控制平面。 - Pentest Copilot - 端到端驱动 Kali 攻击机的智能体,可按需安装工具、操作 Burp 和真实浏览器,并生成并行子智能体。 - Pentest Swarm AI - Go 框架,通过共享信息素黑板协调侦察、分类、利用和报告智能体,根据发现权重而非固定流水线顺序唤醒每个智能体。 - PentestAgent - 黑盒测试框架,具备自主和多智能体模式、攻击剧本、Kali 执行以及持久会话。 - PentestCode - OpenCode 的硬分叉,为攻击性安全而重建,在共享的作战状态上协调一名首席策略师和并行的专家子代理,并跨关系图进行攻击路径搜索以及持久化会话。 - PentestGPT - 由大型语言模型驱动的自动化渗透测试代理框架。 - RedAmon - 端到端平台,在 Neo4j 攻击图上串联侦察、利用和后利用,然后对发现进行分诊、修补代码并提交拉取请求。 - reverse-skill - 安全技能路由器,通过工具引导和证据追踪,引导编码代理完成可重复的逆向工程和渗透测试工作流。最近一篇 Tessl 评测 给其主要路由器打出 75/100 分(质量 92%),但没有影响评估,且安全扫描未通过。SKILL.md。 - Shannon - 面向 Web 应用和 API 的 AI 渗透测试工具,可分析源代码、识别攻击向量并执行真实漏洞利用以证明发现。 - Strix - 开源 AI 渗透测试代理,可发现并帮助修复应用漏洞。 - Transilience Community Tools - 二十六项技能和三项工具集成,覆盖从侦察到报告的渗透测试生命周期,并在维护者的 CTF 基准上公布了 104/104 的结果。SKILL.md。 模糊测试与漏洞发现 使用模型发现崩溃并生成补丁的工具框架。 - ChatAFL - 基于 AFLNet 构建的协议模糊测试器,会提示模型生成机器可读的语法、更丰富的种子消息,并在覆盖率停滞时生成新输入,发表于 NDSS 2024,并打包为 ProfuzzBench 工件。 - FirmAgent - 来自清华大学 VUL337 组的混合 IoT 固件流水线,将设备感知的 API 模糊测试器与 LLM 污点分析代理配对,把到达汇聚点的发现转化为概念验证漏洞利用,发表于 NDSS 2026。 - Fuzz4All - 通用模糊测试器,使用模型作为其输入生成和变异引擎,并通过自动提示步骤针对每个目标调整提示,使一个工具覆盖多种输入语言,来自 ICSE 2024 论文。 - OSS-Fuzz-Gen - Google 的框架,用于使用 LLM 跨 C/C++、Java 和 Python 生成和基准测试模糊测试目标。 - PromptFuzz - 模糊测试驱动生成器,在覆盖率引导的循环中变异提示词,以探索复杂的 API 相互关系,在其测试的库上报告了 40.12% 的分支覆盖率,是 OSS-Fuzz 的 1.61 倍,并确认了 33 个安全漏洞,其中包括三个 CVE。 DARPA AIxCC 网络推理系统 DARPA 网络挑战赛的七个决赛系统,每个系统都旨在自主发现并修补真实开源代码中的漏洞,并且每个系统都作为竞赛快照发布。 - ARTIPHISHELL - Shellphish 的网络推理系统,随其组件、流水线、服务和完整部署栈一同发布。 - Atlantis - Team Atlanta 的网络推理系统,赢得了最终竞赛。 - BugBuster - Team 42-b3yond-6ug 的网络推理系统,保留了运行它所需的核心组件和部署配置。 - Buttercup - Trail of Bits 的第二名网络推理系统,将 OSS-Fuzz 模糊测试活动与多智能体修补器配对。 - FuzzingBrain - Team all_you_need_is_a_fuzzing_brain 的系统,将覆盖率引导的模糊测试与智能体配对,这些智能体能够推理可疑点、构建漏洞证明,并动态验证每一个发现。 - Lacrosse - SIFT 的多智能体网络推理系统,结合模糊测试和符号推理来发现并修补 C 和 Java 中的漏洞。 - Robo Duck - Theori 的第三名网络推理系统,作为完整的决赛提交作品发布。 智能体工具与集成 暴露给他人智能体的安全能力:MCP 服务器、反汇编器插件以及广泛的技能库。这些提供测试框架所调用的工具和方法论;它们本身并不拥有智能体循环。 - Anthropic-Cybersecurity-Skills - 社区技能库,涵盖 29 个安全领域的 800 多项技能,映射到 MITRE ATT&CK 和 NIST CSF;尽管名称如此,但与 Anthropic 无关。SKILL.md。 - Binary Ninja Headless MCP - 无头 Binary Ninja MCP 服务器,向智能体暴露 180 种分析工具。 - Burp Suite MCP - PortSwigger 自己的 MCP 服务器,将智能体连接到 Burp Suite 的代理、扫描器和重放器。 - Claude Code CyberSecurity Skills - 十九项技能,涵盖进攻性安全、防御性操作、逆向工程、威胁狩猎和 SOC 自动化。SKILL.md。 - DAILA - 与反编译器无关的插件,用于在你的反编译器内使用 AI 辅助。 - Gepetto - IDA 插件,通过查询语言模型来解释和重命名反编译后的函数。 - HexStrike AI - MCP 服务器,为智能体提供大量用于侦察、扫描和利用的进攻性安全工具集。 - IDA Pro MCP - MCP 服务器,向编码智能体暴露 IDA Pro 的反编译、交叉引用和类型推断能力。 - LLM4Decompile - 用于将二进制代码反编译为可读 C 代码的开放模型和流水线。 - ReVa - Ghidra 扩展,提供用于智能体驱动逆向工程的 MCP 服务器。 智能体沙箱 用于运行智能体生成的代码和不可信目标的隔离环境。 - E2B - 专为运行智能体生成的代码而构建的沙箱化云环境。 - Firecracker - AWS 的最小 microVM 监视器,是运行不可信代码的常见硬件隔离原语。 - gVisor - Google 的应用内核,通过拦截系统调用来沙箱化不可信工作负载,而无需完整虚拟机。 - Microsandbox - 本地优先的 microVM 运行时,用于执行不可信的智能体代码。 - Sandbox Runtime - Anthropic 的轻量级工具,用于对智能体强制执行文件系统和网络限制。 基准测试与评估 用于衡量测试框架是否真正有效的任务集和基准真值。 - ADR - Uber 的智能体检测与响应系统,包含一个覆盖 133 个 MCP 服务器的 300 多个智能体攻击任务基准。 - AIRTBench - Dreadnode 的基准,用于衡量自主 AI 红队能力。 - ARVO - 可复现开源漏洞图谱,用作补丁智能体的基准真值。 - CVE-GENIE - 波士顿大学的多智能体框架,可从 CVE 条目重建易受攻击的环境并生成可验证的漏洞利用,复现了 841 个 CVE 中的 428 个,这些 CVE 于 2024-2025 年发布,平均每个成本 2.77 美元。 - Cybench - 用于在 40 个专业 CTF 任务上评估语言模型智能体的框架。 - CyberGym - Berkeley 的大规模基准,用于在真实世界漏洞复现上评估智能体。 - HackSynth - 自主渗透测试智能体,随附两套 CTF 基准集,包含来自 PicoCTF 和 OverTheWire 的 200 个挑战。 - Linux 权限提升基准 - 来自 hackingBuddyGPT 团队的可复现本地权限提升场景,在其已发布的智能体评估中用作基准真值。 - NYU CTF Bench - 用于 NYU CTF 基准的 D-CIPHER 和基线智能体。 阅读材料 塑造了这些测试框架构建方式的写作。与工具相同的标准:看结果,不看观点。 - 2026 年的 AI 渗透测试智能体 - 对 39 个开源渗透测试智能体在六种架构模式下的实地调查,将八个基准汇总为一个发现:智能体在给定描述的情况下能解决 87% 的一天期 CVE,但在真实场景中仅能解决 13%,且多智能体设计以 4.3 倍的优势胜过单体设计。该文论证了 star 数并非质量信号,而经过同行评审的基准才是。 - Anthropic:新兴多智能体系统中的模式与问题 - Anthropic 关于智能体之间协调失败和群体行为的研究,其中包括一项漏洞发现实验:一个协调的群体在 15 个开源项目中发现了 266 个漏洞,而独立并行智能体仅发现 21 个。 - Booz Allen:网络武器指数 - 对 18 个美国和中国模型作为自主攻击者针对生产级企业网络运行的基准测试,经网络遥测验证,发现目前只有一个模型能完成完整的杀伤链,而大多数模型将在六个月内做到。 - Cloudflare:构建你自己的漏洞测试框架 - Cloudflare 如何在六周内将一项单一的审计技能发展成覆盖 128 个代码库的集群扫描器:在 SQLite 中外部化状态以实现可恢复性,每个智能体占用不超过其上下文窗口的 25%,一个模型负责搜寻,另一个不同的模型负责评判,并为去重配备专门的智能体。报告称单次技能运行仅能发现重复运行约一半的漏洞。 - Cloudflare:防御前沿网络模型 - Cloudflare 针对模型发现、串联并证明漏洞的速度快于团队修补速度这一世界的防御架构:在签名规则之前进行 ML 攻击评分、正向安全的 API 模式验证,以及一旦漏洞落地后作为关键层的遏制。这是测试框架文章的蓝队对应篇。 - Cloudflare:Project Glasswing,Mythos 向我们展示了什么 - Cloudflare 将前沿安全模型指向自家五十多个代码仓库后所看到的情况,以及推动其走向 harness 的四条经验:严格限定每个任务的范围,让第二个 agent 刻意与第一个产生分歧,将“这是否有 bug”和“攻击者能否触达它”分开询问,以及先发散再去重。文中指出,单个 agent 会话在压缩机制开始丢弃发现之前,大约只能覆盖一个 10 万行仓库的千分之一。 - Google Chrome:每次更新都更强大 - Chrome 如何将 agent 部署到发现、分诊、修复和发布各环节,在两个里程碑中修复了 1,072 个安全漏洞,并发现了一个存活了 13 年的沙箱逃逸漏洞。 - OpenAI:防御工厂 - OpenAI 的参考架构,用于持续进行清点、发现、动态验证、归属和已验证修复的闭环,并附有冲刺数据:37% 的发现被去重,运行时验证后误报率为 0.81%,100% 的补丁由 Codex 生成,0.53% 被回滚。 - Ramp:0 人工修复 100 个漏洞 - Ramp 的检测器、对抗管理器、验证器和修复器流水线,在一周内发现并修复了约 100 个潜在问题,其中管理器 agent 拒绝了 40% 被人类确认为误报的提案。 - Shopify:River,自主漏洞修复 - Shopify 的 Slack 原生修复 agent,在采取行动前会针对仓库 head、PR 状态和跟踪器重新验证补丁,在最初 11 天内将依赖漏洞积压减少了约 70%。 - 迈向网络安全超级智能:什么是最好的网络安全 Harness? - 在 33 个网络安全挑战上对五种 agent 脚手架进行基准测试,发现没有单一 harness 能胜出;一种结合结构多样化脚手架的黑板架构覆盖了 57.6% 的问题,而最佳单一脚手架为 45.5%。 - 将 LLM 记忆转化为程序分析 - 将长期漏洞研究重新表述为 Datalog 问题,使模型负责模糊的事实提取,而数据库负责确定性推理,并在前提变化时自动使结论失效,将上下文缩减了 38 倍,并在对抗性记忆基准上优于全上下文提示。
扫码进群