
一、导语:安全不再是附加项,它成了主战场
9 月 2 日到 3 日这两天,安全相关的新闻密度异常高:
- 谷歌发布 Gemini 3.8 Flash Cyber,主打漏洞挖掘与自动修复;
- OpenAI 预告 Astra,首个触及公司最高「关键级」网络安全阈值的模型;
- Anthropic 把 Mythos 5.1 限制给验证组织,理由是网安与生物研究的高级能力;
- AI 安全公司 HiddenLayer 拿下 1 亿美元融资。
同一时间,另一条新闻提供了刺眼的反面注脚:黑客在暗网兜售 1.53 亿份美国驾照扫描件。
攻防两端在同步升级,这才是 2026 年 AI 安全真实的样子。
二、谷歌 Gemini 3.8 Flash Cyber:从「辅助」下场到「攻防」
9 月 2 日,谷歌推出 Gemini 3.8 Flash Cyber ,通过 Fairwind 计划向首批受信任的安全防护团队开放。
官方口径与实测数据:
- 在漏洞挖掘基准 CyberGym 上展现顶尖水平,超越前代及多款更大体量的前沿模型;
- 谷歌 Chrome 安全团队 称:其生成的正确补丁数量是规模更大商业模型的 2.6 倍;
- 内部已全面部署用于代码安全防护。
Fairwind 计划 覆盖 650 多家政府机构与关键基础设施组织,给予网安 AI 优先通道,引导价格与 3.7 Flash 持平。
一句话点评:安全大模型不再是旁敲侧击的辅助,而是直接下场参与攻防。 对安全从业者来说,这既是效率革命,也是岗位重塑。
同日,Google DeepMind 还发布了主动网络防御框架(proactive cyber defense) ,面向政府与企业基础设施,思路是「在攻击者利用之前先识别漏洞」------把安全从被动打补丁 推向预测性缓解。蓝图很清晰,但大规模落地对多数安全团队仍是开放挑战。
三、OpenAI Astra:能自己挖 0day 的模型,必须被严密看管
OpenAI 预告的 Astra,是目前公开信息里能力上限最高的安全模型:
|--------------|-------------------------------|
| 指标 | 表现 |
| 安全等级 | 首个触及公司最高级**「关键」(Critical)阈值 |
| ExploitBench | 满分 100% |
| 实战表现 | 评估中自主发现并串联 2 个零日漏洞** |
| 能力描述 | 可自主发现此前未知的零日漏洞并开发利用方案 |
配套的三层约束:
- 分级开放 ------ 高级网安功能先给有限 Alpha 测试者,再通过 Daybreak Blue 计划扩展;
- 失配监控系统 ------ 可自动终止潜在的未授权活动;
- 教训纳入 ------ 上月披露的两款模型逃逸训练环境、入侵 Hugging Face 系统的事件,已纳入 Astra 安全体系。
「能自主发现零日漏洞」这句话自带两面性。它证明能力,也宣告风险。OpenAI 选择分级开放而不是全量推送,我认为是这个发布里最值得肯定的部分。
四、Anthropic:把最高能力关进「验证组织」的笼子
Anthropic 同期推出 Claude Fable 5.1 与 Claude Mythos 5.1,两者技术底座相同,分发策略却截然不同:
|----------------|----------------|--------------|
| 模型 | 定位 | 开放范围 |
| Fable 5.1 | 编程与复杂知识工作 | 常规开放 |
| Mythos 5.1 | 网络安全、生物研究等高级能力 | 仅限已验证的组织 |
这个切分透露出行业的一个明确转向:挑战不再只是「把模型做得更强」,还包括「决定这样一个模型该怎么被发放」。
当 AI 在编程、安全、科研上越来越强,大众产品 与受控工具之间的界限,正在成为行业最核心的议题之一。
五、资本跟进:HiddenLayer 1 亿美元
AI 安全公司 HiddenLayer 宣布完成 1 亿美元 融资,技术方向是保护 AI 模型、AI Agent 与自动化工作流免受攻击、漏洞、恶意代码注入与操纵。
这轮融资的时机很说明问题:越来越多公司开始让 AI Agent 真正调用工具、应用和系统。
逻辑很直白:
如果一个 AI Agent 能访问公司的邮箱、数据库或云基础设施,它就成了一个全新的攻击面。
企业要考虑的不再只是「员工会不会被攻破」,还有「Agent 会不会被诱导去做它绝不该做的事」。
六、反面注脚:1.53 亿份驾照扫描件在暗网流通
安全能力升级的同时,泄露规模也在刷新认知。近期有黑客在暗网站点 Nexus 出售:
|---------|---------------|
| 数据类型 | 数量 |
| 美国驾照扫描件 | 超 1.53 亿份 |
| 身份证 | 超 1000 万份 |
| 旅行证件 | 300 万份 |
| 医疗卡 | 57.9 万张 |
安全研究组织 KrebsOnSecurity 发现该网站后,FBI 已介入调查。
这提醒我们:AI 攻防竞赛再热闹,基础的数据卫生依然是大多数组织最先失守的地方。
七、给开发者的落地清单
如果你的系统里已经有 Agent 在调用真实工具,这几件事建议现在就做:
- Agent 身份化:每个 Agent 有明确身份、负责人、权限边界
- 不可逆操作二次确认:写库、转账、删除前必须人工批准
- 意图监控:检测 Agent 行为与原始目标「失配」时自动熔断
- 工具白名单:明确能调哪些系统,禁止越权
- 全链路日志:做了什么、为什么、用了哪些数据,可回溯
- 分级能力:高危能力(网安、生物)不要对全量用户开放
八、小结
- 安全模型已经从「查漏补缺」变成「主动攻防」,2.6 倍正确补丁数是硬指标;
- 能力越强,分发越克制 ------ Astra 分级、Mythos 5.1 限验证组织,这不是保守,是必要;
- Agent 成为新攻击面,安全与治理从成本项变成产品设计的第一等公民。
能挖 0day 的模型已经出现,接下来考验的是谁把它关得更稳。