SKill测评:谁才是真正的Skill之王?

背景

2026年,Skill 的热度不减,已成为 AI 辅助编程领域的标配。在日常研发中,无论是沉淀个人经验,还是将团队的优秀范本标准化,将知识"蒸馏"为 Skill 已是大家的常规操作。但随之而来的问题是:一个 Skill 的"好坏",究竟由谁定义?评判它的标准又是什么?

带着这个困惑,我近期翻阅了大量技术资料,也一直在寻找一套可量化的评测体系。巧合的是,阿里近期开源了一款名为 Skill-Up 的测评工具------它专门面向 Agent Skill 开发者,支持在 Claude Code、Codex、Qoder CLI 等真实 Agent Engine 环境中验证 Skill 的功能正确性,并可将失败用例转化为精准的修复指引,同时支持本地与 CI 环境的持续回归。

于是,就有了下面这次实践。

Skill-up是什么

skill-up 是一个面向 Agent Skill 的命令行评测工具。

具体目录结构如下

php 复制代码
my-skill/
  SKILL.md              # 你的 Skill 定义
  evals/                # 评测目录
    eval.yaml           # 评测入口配置
    cases/              # 用例目录
      basic-test.yaml   # 一个评测用例
      edge-case.yaml    # 另一个评测用例
    fixtures/           # 测试资源(可选)
      repos/            # 仓库模板
      scripts/          # 评估脚本

安装方式

使用 Skill-upper,也是推荐的方式

ruby 复制代码
# Codex,全局安装
npx skills add https://github.com/alibaba/skill-up/tree/main/skills/skill-upper -g -a codex -y

也可以使用命令行安装,那你将可以使用纯命令运行,也很爽

ruby 复制代码
curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bash

关键命令

python 复制代码
# 运行所有用例
skill-up run ./evals/eval.yaml

# 只运行匹配的用例
skill-up run ./evals/eval.yaml --include-case-name "basic-*"

# 排除特定用例
skill-up run ./evals/eval.yaml --exclude-case-name "*-old" --exclude-case-name "*-deprecated"

# 指定 Engine 和模型
skill-up run ./evals/eval.yaml --engine codex --model openai/gpt-4

# 临时覆盖用例并行数
skill-up run ./evals/eval.yaml --parallelism 4

# 启用基线对比
skill-up run ./evals/eval.yaml --baseline

# 生成多种格式报告
skill-up run ./evals/eval.yaml --format json --format html --format junit

# 连续运行 3 轮,产物分别写入 iteration-1/ 到 iteration-3/
skill-up run ./evals/eval.yaml --iteration 3

# 自动检测模式(直接消费 Anthropic evals.json)
skill-up run --auto
skill-up run --auto --engine codex
skill-up run ./my-skill/ --auto

如此代表安装成功

通过codex也能唤起

创建并运行第一组评测

Demo测评的报告结果

相关推荐
烬羽1 小时前
AI Coding 全流程实战:从需求到上线,我用 AI 开发了一个 NPM 包
前端·react.js·ai编程
Lambert2812 小时前
MCP 史上最大升级:握手没了、会话没了,Java 生态的六个坑
ai编程·mcp
不一样的少年_2 小时前
图解 AI Agent ②:模型到底是怎么读取文件的?
人工智能·agent·ai编程
threerocks2 小时前
《The AI-Native SDLC Playbook》万字拆解
算法·aigc·ai编程
Lambert2813 小时前
一个 @McpTool 注解,让 Claude 和 Cursor 直接调用你的 Spring 服务
ai编程
全栈弄潮儿4 小时前
用 AI 做代码优化:哪些建议值得采纳
aigc·openai·ai编程
薛定猫AI5 小时前
【技术干货】Claude Code多模型代理与反馈闭环:Python实现可验证的AI编程工作流
开发语言·python·ai编程
必须会一定会5 小时前
AI 编程隐私保护清单:API Key、代码上传、Agent 权限与 Git 历史排查
人工智能·git·ai编程
plainGeekDev5 小时前
外层六构件:把 Loop 放大成系统
ai编程·claude