关键词 :Agent Skills、SKILL.md、工具调用校验、Skill 检测、开源、CI 集成、Agent 评测
适用读者:正在做 Agent / 智能体平台、Skill 技能市场、MCP 工具生态的开发者与架构师。
一、为什么需要 Skill 检测?
随着 Agent 从"玩具"走向"生产系统",Skill(技能 / 工具) 已经成为智能体的最小能力单元。但社区里 Skills 质量参差不齐:
- 有的
SKILL.md描述残缺,参数 schema 不合法; - 有的表面声明"只读",实际偷偷执行危险 shell;
- 有的"有不如无"------接入后 Agent 效果反而下降;
- 有的在异常输入下直接崩溃、越权调用。
所以,一个成熟的 Skill 体系,不能只有"注册 + 调用",还要有"解析 + 检测 + 调试"。本文整理了一批可直接拿来用的开源项目,帮你把 Skills 的开发、入库校验、自动化测评、CI 集成一条龙跑通。
二、全景分类速览
| 分类 | 代表项目 | 用途 |
|---|---|---|
| 通用 Agent 框架(自带 Skills) | LangChain / AutoGPT / OpenAgents | 二次开发检测能力 |
| 专门的 Skill/Tool 管理与检测 | ToolAI-Validator / SkillHub / Agent-Skill-Tester | 校验、注册、自动化测试 |
| 国产 Agent(带 Skill 体系) | Dify / FlowiseAI | 可视化编排 + 平台底座 |
| 安全 & 质量扫描 | SkillSpector / skill-scanner / SkillTester / SkillBenchmark / OpenSkillEval | 静态/动态审计 |
| Agent 通用评测框架 | AgentEvalKit / CheckAgent / Inspect-AI / open-agent-eval | 扩展用于 skills 评估 |
| 模糊 / 混沌测试 | ToolFuzz | 异常输入鲁棒性 |
| 国产安全扫描 | 腾讯朱雀 A.I.G | 可视化审计 |
三、通用 Agent 框架(自带 Skills 体系,可二次开发检测能力)
3.1 LangChain(Python)
- GitHub :https://github.com/langchain-ai/langchain
- Skills 概念 :
Tools/Toolkit就是 skills,支持自定义工具集。 - 可扩展检测点 :
- 工具参数 schema 校验(基于 Pydantic)
- 工具输入输出格式检测
- 工具调用安全检测、超时检测、权限检测
- 适合:快速开发自定义 skills,并写检测脚本校验 skill 入参、返回值、异常场景。
3.2 AutoGPT
- GitHub :https://github.com/Significant-Grave/AutoGPT
- 核心 :Agent + Skill Registry(技能注册中心),内置 skill 加载、发现、调用,带 skill 元数据描述文件。
- 可扩展:增加 skill 静态检测(schema、描述完整性)、运行时检测(调用成功率、错误率)。
3.3 OpenAgents
- GitHub :https://github.com/openagentsinc/openagents
- 定位 :专门面向 Agent 技能市场,skill 用
yaml/json定义,支持技能注册、版本管理。 - 自带基础校验:参数、依赖、权限声明校验,适合做 skills 管理 + 检测底座。
四、专门的 Skill / Tool 管理与检测开源项目
4.1 ToolAI-Validator(工具 schema 校验)
- 针对 LLM Agent 工具(skill)的 schema 合法性检测。
- 用途:检测 skill 的 function-call json schema 是否合法、参数是否缺失、描述是否完整、枚举是否合规。
- 同类 :
json-schema-validator可做底层检测,很多 Agent 项目基于它做 skill 检测。
4.2 SkillHub(Agent Skill Registry)
- GitHub :https://github.com/agent-hub-ai/skillhub
- 定位:Agent 技能仓库,yaml 定义 skill,支持注册、版本、元信息。
- 内置静态检查:skill 定义完整性、输入输出 schema 校验。
- 缺失:运行时检测,需要自己补充调用测试用例。
4.3 Agent-Skill-Tester(测试 Agent 技能)
- GitHub :https://github.com/ai-agents-community/agent-skill-tester
- 功能 :
- 加载 skill 定义(yaml/json)
- 批量输入测试用例,自动化调用 skill
- 检测返回格式、异常捕获、超时、权限越界
- 输出检测报告:通过 / 失败、覆盖率
- 非常贴合本文主题:开发整理 skills + 自动化检测。
五、国产开源 Agent(带 Skill 体系)
5.1 Dify(重点推荐)
- GitHub :GitHub - langgenius/dify: Build Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack. · GitHub
- 能力 :
- 可视化技能(工具)编排,支持自定义工具、API 工具、代码工具
- 工具参数 schema 校验、工具调用日志
- 可二次开发:新增「技能检测模块」------静态检测 yaml/schema + 运行时自动化测试用例
- 优势:自带 WebUI,可直接做 skills 管理平台,再嵌入检测逻辑。
5.2 FlowiseAI
- GitHub :https://github.com/FlowiseAI/Flowise
- 低代码 Agent 编排,自定义 Tools,可写扩展节点实现 skill 检测。
六、如果你要自研一套 Skills 检测服务(参考架构)
Skills 检测模块
├─ 静态检测(解析 skill 定义文件 yaml/json)
│ ├─ 元数据完整性检测:name / desc / version / auth / deps
│ ├─ JSON-Schema 合法性校验:入参、出参
│ └─ 安全静态扫描:危险函数、敏感参数
└─ 运行时检测
├─ 自动化测试用例驱动调用 skill
├─ 检测:返回格式、超时、异常、错误码
├─ 指标:成功率、响应时间
└─ 输出检测报告
落地建议:静态层用
json-schema-validator+ AST 扫描;运行时层用 pytest 驱动 + LLM-judge。
七、选型建议(第一部分)
| 你的目标 | 推荐方案 |
|---|---|
| 快速搭建可用平台 | Dify 二次开发,增加 skill 检测模块 |
| 轻量:skills 开发 + 自动化检测 | agent-skill-tester + LangChain |
| 做技能注册仓库 | SkillHub |
八、补充:Agent-Skill 检查评估开源项目
以下按 安全扫描类 / 技能专项评测 / Agent 通用测试 / 模糊混沌测试 四大类补充,全部开源,适合做 skills 开发、入库前校验、自动化测评、CI 集成。
8.1 专门针对 Agent-Skill 的安全 & 质量扫描(重点)
1. SkillSpector(NVIDIA)⭐
- GitHub :https://github.com/NVIDIA/SkillSpector
- 定位:NVIDIA 官方 Agent Skill 安全审计流水线,用于技能发布前扫描。
- 能力 :扫描 git 仓库、zip、目录、
SKILL.md、MCP 工具;静态 AST 分析 + LLM 语义审计 ;覆盖提示注入、数据泄露、权限越权、供应链风险、恶意代码,共 68 条漏洞规则;输出 SARIF / JSON / Markdown 报告,可嵌入 CI;也可作为 Agent 内部 skill,实现"Agent 扫描 Skill"。 - 适合:技能仓库准入检测、安全门禁。
2. skill-scanner
- GitHub :GitHub - syedabbast/skill-scanner: Static security scanner for SKILL.md files and AI agent skill packages. 25+ detection rules across 5 categories. Zero dependencies, CI/CD ready. · GitHub
- 零依赖、Python、CI 友好;专门解析
SKILL.md、skill 包。 - 25+ 静态规则:提示注入风险、危险 shell 调用、权限缺失、描述缺陷、schema 错误。
- 只做静态扫描,轻量,适合流水线快速门禁。
3. SkillTester(北大)
- GitHub :https://github.com/skilltester-ai/skilltester
- 同时评估 Skill 功能效用分数 + 安全分数。
- 对照实验:跑"有 skill / 无 skill"两组,判断 skill 是否真的带来增益,防止负向技能。
- 内置安全探测用例集;输出三级安全标签;可批量评测一批 skills 库。
4. SkillBenchmark
- GitHub :https://github.com/TiesPetersen/SkillBenchmark
- 核心:评估一个 Skill 到底有没有提升 Agent 效果。
- 同一任务跑两组(不带 skill / 注入 skill),LLM 盲打分,统计置信区间。
- 指标:质量提升幅度、token 开销、稳定性;专门筛掉"无效甚至降质的 skill"。
5. OpenSkillEval(复旦)
- 论文开源框架,面向批量社区 skills 自动化审计。
- 自动生成真实任务,批量跑不同 skill,对比效果。
- 评估维度:schema 完整性、任务成功率、鲁棒性、副作用。
- 适合:技能市场批量质量过滤。
8.2 Agent 通用评测框架(可扩展用于 skills / tools 评估)
1. AgentEvalKit
- GitHub :GitHub - agentkitai/agenteval: Testing and evaluation framework for AI agents · GitHub
- yaml 编写测试用例,原生支持 tool-call 校验:调用工具名称、参数 schema、调用轨迹校验。
- 11 种打分器:JSON-schema、正则、LLM-judge、时延、成本统计;支持多次运行统计回归。
- SQLite 存储评估历史,适合持续回归测试 skill 变更后的退化。
2. CheckAgent(pytest 插件)⭐
- GitHub :https://github.com/checkagent/checkagent
- pytest 原生,CI 友好;LangChain / OpenAI Agents SDK / CrewAI 全部兼容。
- 分层测试 :skill/tool 单元 mock 测试 → 集成测试 → LLM 评判;内置 101 项安全探测。
- 可直接对自定义 skill 写 pytest 用例,提交代码自动校验 skill 是否可用。
3. Inspect-AI(UK AI 安全研究院)
- GitHub :https://github.com/UK-AI-Safety-Institute/inspect-ai
- 工业级 Agent 评估框架,支持自定义 evaluator。
- 可封装评估 task,批量调用不同 skills,校验工具调用轨迹、输出、安全边界。
- 适合:高可信 Agent + Skills 的评估底座。
4. open-agent-eval
- GitHub :GitHub - yiyangzhang-ai/open-agent-eval: Lightweight open-source toolkit for evaluating tool-calling AI agents on safety, correctness, and reliability · GitHub
- 标准化工具调用 Agent 评测套件,预定义购物、旅行、安全任务集。
- 评估维度:工具选择正确性、参数正确性、越界行为、提示注入抗性。
- 协议无关,任何 Agent 接入即可,可用来批量测你的 skills 集合。
8.3 模糊测试 & 混沌测试(给 skill/tool 构造异常输入,测鲁棒性)
1. ToolFuzz
- GitHub :https://github.com/eth-sri/ToolFuzz
- LLM Agent 工具(skill)模糊测试框架。
- LLM 自动生成畸形、边界、恶意输入,轰炸你的 skill/tool。
- 发现:崩溃、异常返回、错误输出、越权调用;适合 skill 上线前鲁棒性测试。
8.4 国产相关
1. A.I.G(腾讯朱雀实验室)
- 能力:MCP/Skill 安全扫描智能体,读取 skill 代码 / 配置,对比声明功能与实际行为,检测后门、幽灵指令、高危调用。
- 有 web 界面,适合做可视化审计平台。
九、选型快速参考表
| 你的目标 | 首选项目 |
|---|---|
| CI 流水线快速门禁,静态扫描 skill 安全 | skill-scanner |
| 深度安全审计(静态 + LLM 语义) | SkillSpector (NVIDIA) |
| 判断 Skill 是否真的有用,会不会越用越差 | SkillTester / SkillBenchmark |
| 开发自定义 skill,写单元 + 集成测试,pytest 体系 | CheckAgent |
| 批量评测一批 skills 库,做技能市场质量过滤 | OpenSkillEval、SkillTester |
| 测 skill 异常输入、边界、崩溃,模糊测试 | ToolFuzz |
| yaml 编排测试用例,回归 skill 版本迭代退化 | AgentEvalKit |
十、分层评估能力参考(自研 skills 平台可照搬)
| 层级 | 检测内容 | 参考项目 |
|---|---|---|
| 静态层 | yaml/SKILL.md 解析;schema 校验;元数据完整性;静态安全规则扫描 | SkillSpector / skill-scanner |
| 单元层 | 单 skill 入参出参、异常入参、超时、mock 测试 | CheckAgent (pytest) |
| 效用评估层 | 对照实验,有 skill vs 无 skill,计算增益 | SkillTester / SkillBenchmark |
| 动态安全层 | fuzz 畸形输入、提示注入探测、权限越界探测 | ToolFuzz |
| 集成层 | Agent 调用 skill 完整轨迹评估,工具调用序列正确性 | AgentEvalKit、Inspect-AI |
十一、总结 & 福利
本文把 Agent Skills 的"开发 → 解析 → 检测 → 调试"全链路开源项目做了一次集中盘点。无论你是想:
- 在 Dify 上二次开发技能检测模块;
- 用 agent-skill-tester + LangChain 做轻量自动化检测;
- 还是基于 SkillSpector / CheckAgent 搭一套 CI 安全门禁;
都能从上面找到可直接复用的轮子。