AI挖出6个curl漏洞 但另外23份是噪音

这几天安全圈有个结果挺有意思:

一家叫 AISLE 的公司,用自己的 AI 系统扫 curl,找出了 6 个 CVE。

而在此之前:

系统 结果
Anthropic Mythos 报告"找不到更多"
OpenAI Codex Security 空列表
AISLE 6 个 CVE

curl 作者 Daniel Stenberg 的公开对比只有一行,但很有分量:

Mythos: 0,AISLE: 29 份报告

他认可了这些发现的合法性,并已纳入 curl 8.22.0 版本。

看到这里你可能觉得:小公司干翻了两大巨头。

但我想先请你注意那个"29"。

一、29 份报告,6 个 CVE

这两个数字放在一起,意味着另一件事:

有 23 份报告不是有效漏洞。

换算一下,噪音率大约 79%。

这不是黑 AISLE------恰恰相反,能在 curl 这种被全世界审计了二十多年的代码库里挖出 6 个真漏洞,已经相当能打。curl 是安全研究者的经典靶场,好挖的早被挖光了。

我想说的是另一件事:在自动化安全扫描这件事上,"找到了什么"和"提交了多少"是两个必须一起看的数字。

只报前者,容易得出过于乐观的结论。

而且这些 CVE 全部是低危等级:

  • use-after-free
  • 密钥固定(key pinning)绕过
  • CA 存储的连接重用问题
  • Cookie 安全属性绕过

都是真问题,值得修。但离"AI 发现了致命 0day"这种叙事,还有距离。

二、真正的看点:不是模型之争

这件事最值得琢磨的,是 AISLE 自己的定性。

他们强调这是 "系统与模型"的差别,不是"模型能力"的差别。

原话大意是:专业化的 AI 系统,可以在真实零日发现上与前沿实验室的系统竞争甚至胜出。

翻译成人话:赢的不是更聪明的大脑,是更懂行的流程。

这个判断如果成立,对整个行业的启发比这 6 个 CVE 本身大得多:

通用大模型的思路 专用系统的思路
模型越强,发现越多 模型够用即可,编排和验证才是关键
一次性扫描,看输出 多轮假设、构造验证、自动排除误报
依赖模型的"直觉" 依赖工程化的搜索策略

安全审计的本质不是"读懂代码",而是在巨大的状态空间里搜索异常路径。这更像一个系统工程问题,而不是一个模型问题。

同样的模型,配上不同的搜索策略和验证机制,结果可以差到 0 和 6。

三、但有个信息缺口必须说

这里我要泼一点冷水,也是我读这类报道的习惯:

AISLE 没有披露方法细节。

文章里没有:

  • 具体的扫描流程和算法
  • 分析耗时
  • 计算成本
  • 误报率的官方口径(79% 是我用 29 和 6 反推的)
  • 扫描的代码规模

这些恰恰是判断"这套方法有多强"的关键。

我不是质疑结果的真实性------curl 作者已经确认并修复了,这是最硬的背书。

我质疑的是可复现性。在没有方法披露的情况下,"专用系统胜过通用模型"这个结论,目前只有一个样本支撑。

一次成功可能是方法优越,也可能是恰好换了个角度、恰好碰到了别人没覆盖的路径。要证明是前者,需要更多次、更多目标上的复现。

四、对我们意味着什么

抛开谁赢谁输,这件事给做工程的人两点实际启发:

第一,别指望"扔进去就出结果"。

如果 79% 的报告是噪音,那接收方的核心工作其实是筛。任何自动化安全工具落地时,你都得先想清楚:谁来看这些报告?误报的成本谁承担?

curl 项目能受益,很大程度是因为 Daniel Stenberg 有能力快速判断真伪。换一个没有这种判断力的团队,29 份报告可能直接把人淹了。

第二,"专用打败通用"这个模式值得关注。

如果这个结论在更多场景被验证,那意味着:与其等下一代通用模型,不如把现有模型装进一个更懂业务的流程里。

对大多数团队来说,后者的可操作性高得多。

最后

我的总结是三句话:

  1. 6 个 CVE 是真的,curl 作者已确认并修复,这个成绩含金量不低
  2. 29 份报告也是真的,任何自动化方案落地都要算上筛选成本
  3. "系统 > 模型"是个好假设,但目前只有一个样本,值得关注,不值得当定论

在安全这个领域,谨慎一点总没错。


免责声明:本文基于公开报道整理,我未独立验证任何技术细节,79% 的噪音率是根据公开数字反推而非官方口径。文中判断为个人观点,可能有误。涉及安全测试请务必在授权范围内进行。大家听听就好。

相关推荐
Csvn9 小时前
第 28 章 案例四 多智能体协作系统
人工智能·aigc·agent
IT_陈寒9 小时前
Java中equals方法比了个寂寞?原来这才是正确的重写姿势
前端·人工智能·后端
吴佳浩9 小时前
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系
人工智能·agent·ai编程
火山引擎开发者社区9 小时前
火山引擎云数据库 TiDB 版公测开启,MySQL 架构升级的一站式选择
人工智能
代码方舟9 小时前
Java数据工程:利用天远全网运营商三要素优化线上实名认证合规体验
java·人工智能
Csvn9 小时前
第 27 章 案例三 自动化工作流 Agent
人工智能·aigc·agent
知几蜗牛9 小时前
AI眼镜把记忆放上云,怎样证明云端也看不见?
人工智能
知几蜗牛9 小时前
训练数据越多越好吗?用LeRobot讲清数据质量与版本化
人工智能
知几蜗牛9 小时前
PR合并慢,别再只看平均时长:GitHub把等待拆成了三段
人工智能
知几蜗牛9 小时前
AI账单失控前,团队真正缺的不是更便宜的模型
人工智能