
这几天安全圈有个结果挺有意思:
一家叫 AISLE 的公司,用自己的 AI 系统扫 curl,找出了 6 个 CVE。
而在此之前:
| 系统 | 结果 |
|---|---|
| Anthropic Mythos | 报告"找不到更多" |
| OpenAI Codex Security | 空列表 |
| AISLE | 6 个 CVE |
curl 作者 Daniel Stenberg 的公开对比只有一行,但很有分量:
Mythos: 0,AISLE: 29 份报告
他认可了这些发现的合法性,并已纳入 curl 8.22.0 版本。
看到这里你可能觉得:小公司干翻了两大巨头。
但我想先请你注意那个"29"。
一、29 份报告,6 个 CVE
这两个数字放在一起,意味着另一件事:
有 23 份报告不是有效漏洞。
换算一下,噪音率大约 79%。
这不是黑 AISLE------恰恰相反,能在 curl 这种被全世界审计了二十多年的代码库里挖出 6 个真漏洞,已经相当能打。curl 是安全研究者的经典靶场,好挖的早被挖光了。
我想说的是另一件事:在自动化安全扫描这件事上,"找到了什么"和"提交了多少"是两个必须一起看的数字。
只报前者,容易得出过于乐观的结论。
而且这些 CVE 全部是低危等级:
- use-after-free
- 密钥固定(key pinning)绕过
- CA 存储的连接重用问题
- Cookie 安全属性绕过
都是真问题,值得修。但离"AI 发现了致命 0day"这种叙事,还有距离。
二、真正的看点:不是模型之争
这件事最值得琢磨的,是 AISLE 自己的定性。
他们强调这是 "系统与模型"的差别,不是"模型能力"的差别。
原话大意是:专业化的 AI 系统,可以在真实零日发现上与前沿实验室的系统竞争甚至胜出。
翻译成人话:赢的不是更聪明的大脑,是更懂行的流程。
这个判断如果成立,对整个行业的启发比这 6 个 CVE 本身大得多:
| 通用大模型的思路 | 专用系统的思路 |
|---|---|
| 模型越强,发现越多 | 模型够用即可,编排和验证才是关键 |
| 一次性扫描,看输出 | 多轮假设、构造验证、自动排除误报 |
| 依赖模型的"直觉" | 依赖工程化的搜索策略 |
安全审计的本质不是"读懂代码",而是在巨大的状态空间里搜索异常路径。这更像一个系统工程问题,而不是一个模型问题。
同样的模型,配上不同的搜索策略和验证机制,结果可以差到 0 和 6。
三、但有个信息缺口必须说
这里我要泼一点冷水,也是我读这类报道的习惯:
AISLE 没有披露方法细节。
文章里没有:
- 具体的扫描流程和算法
- 分析耗时
- 计算成本
- 误报率的官方口径(79% 是我用 29 和 6 反推的)
- 扫描的代码规模
这些恰恰是判断"这套方法有多强"的关键。
我不是质疑结果的真实性------curl 作者已经确认并修复了,这是最硬的背书。
我质疑的是可复现性。在没有方法披露的情况下,"专用系统胜过通用模型"这个结论,目前只有一个样本支撑。
一次成功可能是方法优越,也可能是恰好换了个角度、恰好碰到了别人没覆盖的路径。要证明是前者,需要更多次、更多目标上的复现。
四、对我们意味着什么
抛开谁赢谁输,这件事给做工程的人两点实际启发:
第一,别指望"扔进去就出结果"。
如果 79% 的报告是噪音,那接收方的核心工作其实是筛。任何自动化安全工具落地时,你都得先想清楚:谁来看这些报告?误报的成本谁承担?
curl 项目能受益,很大程度是因为 Daniel Stenberg 有能力快速判断真伪。换一个没有这种判断力的团队,29 份报告可能直接把人淹了。
第二,"专用打败通用"这个模式值得关注。
如果这个结论在更多场景被验证,那意味着:与其等下一代通用模型,不如把现有模型装进一个更懂业务的流程里。
对大多数团队来说,后者的可操作性高得多。
最后
我的总结是三句话:
- 6 个 CVE 是真的,curl 作者已确认并修复,这个成绩含金量不低
- 29 份报告也是真的,任何自动化方案落地都要算上筛选成本
- "系统 > 模型"是个好假设,但目前只有一个样本,值得关注,不值得当定论
在安全这个领域,谨慎一点总没错。
免责声明:本文基于公开报道整理,我未独立验证任何技术细节,79% 的噪音率是根据公开数字反推而非官方口径。文中判断为个人观点,可能有误。涉及安全测试请务必在授权范围内进行。大家听听就好。