Agent Skills 检验评测开源skills

关键词 :Agent Skills、SKILL.md、工具调用校验、Skill 检测、开源、CI 集成、Agent 评测

适用读者:正在做 Agent / 智能体平台、Skill 技能市场、MCP 工具生态的开发者与架构师。


一、为什么需要 Skill 检测?

随着 Agent 从"玩具"走向"生产系统",Skill(技能 / 工具) 已经成为智能体的最小能力单元。但社区里 Skills 质量参差不齐:

  • 有的 SKILL.md 描述残缺,参数 schema 不合法;
  • 有的表面声明"只读",实际偷偷执行危险 shell;
  • 有的"有不如无"------接入后 Agent 效果反而下降;
  • 有的在异常输入下直接崩溃、越权调用。

所以,一个成熟的 Skill 体系,不能只有"注册 + 调用",还要有"解析 + 检测 + 调试"。本文整理了一批可直接拿来用的开源项目,帮你把 Skills 的开发、入库校验、自动化测评、CI 集成一条龙跑通。


二、全景分类速览

分类 代表项目 用途
通用 Agent 框架(自带 Skills) LangChain / AutoGPT / OpenAgents 二次开发检测能力
专门的 Skill/Tool 管理与检测 ToolAI-Validator / SkillHub / Agent-Skill-Tester 校验、注册、自动化测试
国产 Agent(带 Skill 体系) Dify / FlowiseAI 可视化编排 + 平台底座
安全 & 质量扫描 SkillSpector / skill-scanner / SkillTester / SkillBenchmark / OpenSkillEval 静态/动态审计
Agent 通用评测框架 AgentEvalKit / CheckAgent / Inspect-AI / open-agent-eval 扩展用于 skills 评估
模糊 / 混沌测试 ToolFuzz 异常输入鲁棒性
国产安全扫描 腾讯朱雀 A.I.G 可视化审计

三、通用 Agent 框架(自带 Skills 体系,可二次开发检测能力)

3.1 LangChain(Python)

  • GitHubhttps://github.com/langchain-ai/langchain
  • Skills 概念Tools / Toolkit 就是 skills,支持自定义工具集。
  • 可扩展检测点
    • 工具参数 schema 校验(基于 Pydantic)
    • 工具输入输出格式检测
    • 工具调用安全检测、超时检测、权限检测
  • 适合:快速开发自定义 skills,并写检测脚本校验 skill 入参、返回值、异常场景。

3.2 AutoGPT

  • GitHubhttps://github.com/Significant-Grave/AutoGPT
  • 核心 :Agent + Skill Registry(技能注册中心),内置 skill 加载、发现、调用,带 skill 元数据描述文件。
  • 可扩展:增加 skill 静态检测(schema、描述完整性)、运行时检测(调用成功率、错误率)。

3.3 OpenAgents

  • GitHubhttps://github.com/openagentsinc/openagents
  • 定位 :专门面向 Agent 技能市场,skill 用 yaml/json 定义,支持技能注册、版本管理。
  • 自带基础校验:参数、依赖、权限声明校验,适合做 skills 管理 + 检测底座。

四、专门的 Skill / Tool 管理与检测开源项目

4.1 ToolAI-Validator(工具 schema 校验)

  • 针对 LLM Agent 工具(skill)的 schema 合法性检测
  • 用途:检测 skill 的 function-call json schema 是否合法、参数是否缺失、描述是否完整、枚举是否合规。
  • 同类json-schema-validator 可做底层检测,很多 Agent 项目基于它做 skill 检测。

4.2 SkillHub(Agent Skill Registry)

  • GitHubhttps://github.com/agent-hub-ai/skillhub
  • 定位:Agent 技能仓库,yaml 定义 skill,支持注册、版本、元信息。
  • 内置静态检查:skill 定义完整性、输入输出 schema 校验。
  • 缺失:运行时检测,需要自己补充调用测试用例。

4.3 Agent-Skill-Tester(测试 Agent 技能)

  • GitHubhttps://github.com/ai-agents-community/agent-skill-tester
  • 功能
    • 加载 skill 定义(yaml/json)
    • 批量输入测试用例,自动化调用 skill
    • 检测返回格式、异常捕获、超时、权限越界
    • 输出检测报告:通过 / 失败、覆盖率
  • 非常贴合本文主题:开发整理 skills + 自动化检测。

五、国产开源 Agent(带 Skill 体系)

5.1 Dify(重点推荐)

5.2 FlowiseAI


六、如果你要自研一套 Skills 检测服务(参考架构)

复制代码
Skills 检测模块
├─ 静态检测(解析 skill 定义文件 yaml/json)
│   ├─ 元数据完整性检测:name / desc / version / auth / deps
│   ├─ JSON-Schema 合法性校验:入参、出参
│   └─ 安全静态扫描:危险函数、敏感参数
└─ 运行时检测
    ├─ 自动化测试用例驱动调用 skill
    ├─ 检测:返回格式、超时、异常、错误码
    ├─ 指标:成功率、响应时间
    └─ 输出检测报告

落地建议:静态层用 json-schema-validator + AST 扫描;运行时层用 pytest 驱动 + LLM-judge。


七、选型建议(第一部分)

你的目标 推荐方案
快速搭建可用平台 Dify 二次开发,增加 skill 检测模块
轻量:skills 开发 + 自动化检测 agent-skill-tester + LangChain
做技能注册仓库 SkillHub

八、补充:Agent-Skill 检查评估开源项目

以下按 安全扫描类 / 技能专项评测 / Agent 通用测试 / 模糊混沌测试 四大类补充,全部开源,适合做 skills 开发、入库前校验、自动化测评、CI 集成。

8.1 专门针对 Agent-Skill 的安全 & 质量扫描(重点)

1. SkillSpector(NVIDIA)⭐

  • GitHubhttps://github.com/NVIDIA/SkillSpector
  • 定位:NVIDIA 官方 Agent Skill 安全审计流水线,用于技能发布前扫描。
  • 能力 :扫描 git 仓库、zip、目录、SKILL.md、MCP 工具;静态 AST 分析 + LLM 语义审计 ;覆盖提示注入、数据泄露、权限越权、供应链风险、恶意代码,共 68 条漏洞规则;输出 SARIF / JSON / Markdown 报告,可嵌入 CI;也可作为 Agent 内部 skill,实现"Agent 扫描 Skill"。
  • 适合:技能仓库准入检测、安全门禁。

2. skill-scanner

3. SkillTester(北大)

  • GitHubhttps://github.com/skilltester-ai/skilltester
  • 同时评估 Skill 功能效用分数 + 安全分数
  • 对照实验:跑"有 skill / 无 skill"两组,判断 skill 是否真的带来增益,防止负向技能。
  • 内置安全探测用例集;输出三级安全标签;可批量评测一批 skills 库。

4. SkillBenchmark

  • GitHubhttps://github.com/TiesPetersen/SkillBenchmark
  • 核心:评估一个 Skill 到底有没有提升 Agent 效果。
  • 同一任务跑两组(不带 skill / 注入 skill),LLM 盲打分,统计置信区间。
  • 指标:质量提升幅度、token 开销、稳定性;专门筛掉"无效甚至降质的 skill"。

5. OpenSkillEval(复旦)

  • 论文开源框架,面向批量社区 skills 自动化审计。
  • 自动生成真实任务,批量跑不同 skill,对比效果。
  • 评估维度:schema 完整性、任务成功率、鲁棒性、副作用。
  • 适合:技能市场批量质量过滤。

8.2 Agent 通用评测框架(可扩展用于 skills / tools 评估)

1. AgentEvalKit

2. CheckAgent(pytest 插件)⭐

  • GitHubhttps://github.com/checkagent/checkagent
  • pytest 原生,CI 友好;LangChain / OpenAI Agents SDK / CrewAI 全部兼容。
  • 分层测试 :skill/tool 单元 mock 测试 → 集成测试 → LLM 评判;内置 101 项安全探测
  • 可直接对自定义 skill 写 pytest 用例,提交代码自动校验 skill 是否可用。

3. Inspect-AI(UK AI 安全研究院)

  • GitHubhttps://github.com/UK-AI-Safety-Institute/inspect-ai
  • 工业级 Agent 评估框架,支持自定义 evaluator。
  • 可封装评估 task,批量调用不同 skills,校验工具调用轨迹、输出、安全边界。
  • 适合:高可信 Agent + Skills 的评估底座。

4. open-agent-eval

8.3 模糊测试 & 混沌测试(给 skill/tool 构造异常输入,测鲁棒性)

1. ToolFuzz

  • GitHubhttps://github.com/eth-sri/ToolFuzz
  • LLM Agent 工具(skill)模糊测试框架。
  • LLM 自动生成畸形、边界、恶意输入,轰炸你的 skill/tool。
  • 发现:崩溃、异常返回、错误输出、越权调用;适合 skill 上线前鲁棒性测试。

8.4 国产相关

1. A.I.G(腾讯朱雀实验室)

  • 能力:MCP/Skill 安全扫描智能体,读取 skill 代码 / 配置,对比声明功能与实际行为,检测后门、幽灵指令、高危调用。
  • 有 web 界面,适合做可视化审计平台。

九、选型快速参考表

你的目标 首选项目
CI 流水线快速门禁,静态扫描 skill 安全 skill-scanner
深度安全审计(静态 + LLM 语义) SkillSpector (NVIDIA)
判断 Skill 是否真的有用,会不会越用越差 SkillTester / SkillBenchmark
开发自定义 skill,写单元 + 集成测试,pytest 体系 CheckAgent
批量评测一批 skills 库,做技能市场质量过滤 OpenSkillEval、SkillTester
测 skill 异常输入、边界、崩溃,模糊测试 ToolFuzz
yaml 编排测试用例,回归 skill 版本迭代退化 AgentEvalKit

十、分层评估能力参考(自研 skills 平台可照搬)

层级 检测内容 参考项目
静态层 yaml/SKILL.md 解析;schema 校验;元数据完整性;静态安全规则扫描 SkillSpector / skill-scanner
单元层 单 skill 入参出参、异常入参、超时、mock 测试 CheckAgent (pytest)
效用评估层 对照实验,有 skill vs 无 skill,计算增益 SkillTester / SkillBenchmark
动态安全层 fuzz 畸形输入、提示注入探测、权限越界探测 ToolFuzz
集成层 Agent 调用 skill 完整轨迹评估,工具调用序列正确性 AgentEvalKit、Inspect-AI

十一、总结 & 福利

本文把 Agent Skills 的"开发 → 解析 → 检测 → 调试"全链路开源项目做了一次集中盘点。无论你是想:

  • Dify 上二次开发技能检测模块;
  • agent-skill-tester + LangChain 做轻量自动化检测;
  • 还是基于 SkillSpector / CheckAgent 搭一套 CI 安全门禁;

都能从上面找到可直接复用的轮子。

相关推荐
zlinear数据采集卡2 小时前
ZLinear DABM-D223 通信协议与软件开发全解析:从 USB CDC 到 DDS 波形输出
arm开发·嵌入式硬件·fpga开发·开源
microrain2 小时前
从监控孤岛到视联一体:SagooIoT视频监控中心的设计实践
物联网·golang·开源·sagooiot
tedcloud1232 小时前
Impeccable 部署指南:开源前端设计工具 Linux 环境搭建实践
linux·运维·服务器·前端·人工智能·开源
yunwei375 小时前
eBPF 教程:精准隔离已建立的 TCP 连接
linux·安全·开源
zyplayer-doc5 小时前
同一份制度别复制到多个知识库:用zyplayer-doc引用文档解决重复维护
javascript·人工智能·智能手机·开源·ocr
sinovoip6 小时前
香蕉派BPI-M7S开源单板计算机采用瑞芯微RK3588s芯片设计,与树莓派产品尺寸一样
人工智能·开源·业界资讯
凌云拓界6 小时前
NodeVerdict | 性能门禁:把追踪数据变成 CI 规则
ci/cd·信息可视化·开源·node.js·bug·数据可视化·安全架构
Flynt9 小时前
Agent跑完就失忆?Cloudflare这个开源项目给它装了块硬盘
typescript·开源
404NotFOund9 小时前
小白本地部署微调耍起
机器学习·开源