一、明确问题:仓库体检是否必须绑定 Codex
真正要回答的问题是:没有 Codex 时,能否调用同一套可审计的扫描程序,得到仓库地图、测试缺口和验证记录?本次验证对象是 Agent Capability Benchmark Lite v0.1.0,不是模型质量。
证据分三层。已实际运行验证 :fixture、自动测试、Schema 校验和离线报告。来自项目文档 :需要 Node.js 20+,默认离线、无遥测、无 API Key。尚未验证 :Qwen Code 与 Kimi CLI 的真实 Skill 发现;当前仅识别到 Codex,并测试了 unknown 分支。
二、实测过程:先绕开 Agent,验证工具本体
我先运行项目要求的验证与演示命令:
bash
make -C products/agent-capability-benchmark verify
make -C products/agent-capability-benchmark demo
fixture 共扫描 3 个文件,其中源码文件 1 个、测试文件 1 个,主语言是 JavaScript,识别到 node:test。源码/测试比为 1,缺口列表为空;npm test 退出码为 0,1 条测试通过。重点发现为 0 条,能力分为 97。
97 分不是模型得分:基线 100,fixture 非 Git 仓库、缺少历史证据而扣 3 分。0 条发现也不等于没有风险。
三、没有 Codex 时怎样运行
最稳妥的入口是直接调用 Node.js CLI,把报告放到被测仓库之外:
bash
node products/agent-capability-benchmark/bin/agent-benchmark.js \
/path/to/your-repo --output /tmp/agent-report
如果目标 Agent 支持 Skills,可把整个目录装到该运行时官方文档规定的用户 Skills 目录。通用安装示例是:
bash
products/agent-capability-benchmark/scripts/install.sh ~/.agents/skills
直接执行 CLI 的离线扫描链路已经验证;Agent 能否自动发现 SKILL.md,要以当前版本的官方文档和本机实测为准。CLI 可独立运行,不代表 Agent 集成已经验证。
四、实际输出应该怎样解释
报告包含仓库地图、发现、测试缺口、验证记录、能力分和 HTML。candidate.patch 为 not_generated,不能描述成"已经修复"。它不是完整安全审计。
五、能力边界与免费 Benchmark
免费使用不需要模型 API Key:准备 Node.js 20+,执行 CLI,再打开 /tmp/agent-report/executive-summary.html。建议先读发现、测试缺口和验证记录,最后看分数。
当前已验证确定性扫描、测试白名单、脱敏输出和报告结构;不同 Agent 的 Skill 发现与模型质量仍需分别验证。本文不涉及登录、账号共享、VPN、代理或地区限制绕过。
📌 本文是《Agent工程能力评测实战》系列第 1 篇,当前为待审核草稿。
👉 下一篇:《Qwen Code实测:同一套Skill能否跨Agent运行》,继续拆解"文件可迁移"和"运行时已验证"的区别。
💬 你更希望仓库体检先给风险清单,还是先给测试缺口?评论区聊聊。