SKill测评:谁才是真正的Skill之王?

背景

2026年,Skill 的热度不减,已成为 AI 辅助编程领域的标配。在日常研发中,无论是沉淀个人经验,还是将团队的优秀范本标准化,将知识"蒸馏"为 Skill 已是大家的常规操作。但随之而来的问题是:一个 Skill 的"好坏",究竟由谁定义?评判它的标准又是什么?

带着这个困惑,我近期翻阅了大量技术资料,也一直在寻找一套可量化的评测体系。巧合的是,阿里近期开源了一款名为 Skill-Up 的测评工具------它专门面向 Agent Skill 开发者,支持在 Claude Code、Codex、Qoder CLI 等真实 Agent Engine 环境中验证 Skill 的功能正确性,并可将失败用例转化为精准的修复指引,同时支持本地与 CI 环境的持续回归。

于是,就有了下面这次实践。

Skill-up是什么

skill-up 是一个面向 Agent Skill 的命令行评测工具。

具体目录结构如下

php 复制代码
my-skill/
  SKILL.md              # 你的 Skill 定义
  evals/                # 评测目录
    eval.yaml           # 评测入口配置
    cases/              # 用例目录
      basic-test.yaml   # 一个评测用例
      edge-case.yaml    # 另一个评测用例
    fixtures/           # 测试资源(可选)
      repos/            # 仓库模板
      scripts/          # 评估脚本

安装方式

使用 Skill-upper,也是推荐的方式

ruby 复制代码
# Codex,全局安装
npx skills add https://github.com/alibaba/skill-up/tree/main/skills/skill-upper -g -a codex -y

也可以使用命令行安装,那你将可以使用纯命令运行,也很爽

ruby 复制代码
curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bash

关键命令

python 复制代码
# 运行所有用例
skill-up run ./evals/eval.yaml

# 只运行匹配的用例
skill-up run ./evals/eval.yaml --include-case-name "basic-*"

# 排除特定用例
skill-up run ./evals/eval.yaml --exclude-case-name "*-old" --exclude-case-name "*-deprecated"

# 指定 Engine 和模型
skill-up run ./evals/eval.yaml --engine codex --model openai/gpt-4

# 临时覆盖用例并行数
skill-up run ./evals/eval.yaml --parallelism 4

# 启用基线对比
skill-up run ./evals/eval.yaml --baseline

# 生成多种格式报告
skill-up run ./evals/eval.yaml --format json --format html --format junit

# 连续运行 3 轮,产物分别写入 iteration-1/ 到 iteration-3/
skill-up run ./evals/eval.yaml --iteration 3

# 自动检测模式(直接消费 Anthropic evals.json)
skill-up run --auto
skill-up run --auto --engine codex
skill-up run ./my-skill/ --auto

如此代表安装成功

通过codex也能唤起

创建并运行第一组评测

Demo测评的报告结果

相关推荐
znnnk2 分钟前
【AI应用】从 Prompt 到 Skill:AI 到底“会什么”?
ai·prompt·ai编程·ai应用·skill
小小猪的春天11 分钟前
MCP 半小时跑通和敢上生产之间,隔着这 5 个坑
java·ai编程
不会喷火的小火龙22 分钟前
我让 GPT-6 做了一池锦鲤
经验分享·ai编程·vibecoding
舒灿44 分钟前
全网都在测鹈鹕,我用 DeepSeek-V4.1-Flash 跑了50+小时、超5000MTokens消耗的真实开发任务
chatgpt·ai编程·deepseek
必须会一定会1 小时前
LiTwin 任务004:JSON Schema、OpenAPI、TypeScript、Java DTO 质量门禁实现
人工智能·程序人生·ai编程
人才瘾大1 小时前
大模型四层推理缓存体系深度拆解:KV Cache、Prefix Cache、Prompt Cache与Semantic Cache
人工智能·prompt·ai编程
在世修行2 小时前
干货:三合一架构:GUI/HTTP/引擎如何共用一条任务队列
系统架构·ai编程·任务队列·trae work
郑州光合科技余经理4 小时前
本地生活系统:多业务订单字段怎么分账本导出
java·开发语言·前端·数据库·uni-app·php·ai编程
怕浪猫10 小时前
FDE 如何正确解决现场项目工程性的问题
前端·后端·ai编程
Goboy12 小时前
多模态大模型已经能识别和描述视频,为什么仍然缺乏可靠的时序感知能力?
aigc·ai编程