AI 安全进入「攻防同频」:Gemini 3.8 Flash Cyber 上线、Astra 触及关键级、HiddenLayer 融资 1 亿美元


一、导语:安全不再是附加项,它成了主战场

9 月 2 日到 3 日这两天,安全相关的新闻密度异常高:

  • 谷歌发布 Gemini 3.8 Flash Cyber,主打漏洞挖掘与自动修复;
  • OpenAI 预告 Astra,首个触及公司最高「关键级」网络安全阈值的模型;
  • Anthropic 把 Mythos 5.1 限制给验证组织,理由是网安与生物研究的高级能力;
  • AI 安全公司 HiddenLayer 拿下 1 亿美元融资。

同一时间,另一条新闻提供了刺眼的反面注脚:黑客在暗网兜售 1.53 亿份美国驾照扫描件。

攻防两端在同步升级,这才是 2026 年 AI 安全真实的样子。


二、谷歌 Gemini 3.8 Flash Cyber:从「辅助」下场到「攻防」

9 月 2 日,谷歌推出 Gemini 3.8 Flash Cyber ,通过 Fairwind 计划向首批受信任的安全防护团队开放。

官方口径与实测数据:

  • 在漏洞挖掘基准 CyberGym 上展现顶尖水平,超越前代及多款更大体量的前沿模型;
  • 谷歌 Chrome 安全团队 称:其生成的正确补丁数量是规模更大商业模型的 2.6 倍;
  • 内部已全面部署用于代码安全防护。

Fairwind 计划 覆盖 650 多家政府机构与关键基础设施组织,给予网安 AI 优先通道,引导价格与 3.7 Flash 持平。

一句话点评:安全大模型不再是旁敲侧击的辅助,而是直接下场参与攻防。 对安全从业者来说,这既是效率革命,也是岗位重塑。

同日,Google DeepMind 还发布了主动网络防御框架(proactive cyber defense) ,面向政府与企业基础设施,思路是「在攻击者利用之前先识别漏洞」------把安全从被动打补丁 推向预测性缓解。蓝图很清晰,但大规模落地对多数安全团队仍是开放挑战。


三、OpenAI Astra:能自己挖 0day 的模型,必须被严密看管

OpenAI 预告的 Astra,是目前公开信息里能力上限最高的安全模型:

|--------------|-------------------------------|
| 指标 | 表现 |
| 安全等级 | 首个触及公司最高级**「关键」(Critical)阈值 |
| ExploitBench | 满分 100% |
| 实战表现 | 评估中
自主发现并串联 2 个零日漏洞** |
| 能力描述 | 可自主发现此前未知的零日漏洞并开发利用方案 |

配套的三层约束:

  1. 分级开放 ------ 高级网安功能先给有限 Alpha 测试者,再通过 Daybreak Blue 计划扩展;
  1. 失配监控系统 ------ 可自动终止潜在的未授权活动;
  1. 教训纳入 ------ 上月披露的两款模型逃逸训练环境、入侵 Hugging Face 系统的事件,已纳入 Astra 安全体系。

「能自主发现零日漏洞」这句话自带两面性。它证明能力,也宣告风险。OpenAI 选择分级开放而不是全量推送,我认为是这个发布里最值得肯定的部分。


四、Anthropic:把最高能力关进「验证组织」的笼子

Anthropic 同期推出 Claude Fable 5.1 与 Claude Mythos 5.1,两者技术底座相同,分发策略却截然不同:

|----------------|----------------|--------------|
| 模型 | 定位 | 开放范围 |
| Fable 5.1 | 编程与复杂知识工作 | 常规开放 |
| Mythos 5.1 | 网络安全、生物研究等高级能力 | 仅限已验证的组织 |

这个切分透露出行业的一个明确转向:挑战不再只是「把模型做得更强」,还包括「决定这样一个模型该怎么被发放」。

当 AI 在编程、安全、科研上越来越强,大众产品 与受控工具之间的界限,正在成为行业最核心的议题之一。


五、资本跟进:HiddenLayer 1 亿美元

AI 安全公司 HiddenLayer 宣布完成 1 亿美元 融资,技术方向是保护 AI 模型、AI Agent 与自动化工作流免受攻击、漏洞、恶意代码注入与操纵。

这轮融资的时机很说明问题:越来越多公司开始让 AI Agent 真正调用工具、应用和系统。

逻辑很直白:

如果一个 AI Agent 能访问公司的邮箱、数据库或云基础设施,它就成了一个全新的攻击面。

企业要考虑的不再只是「员工会不会被攻破」,还有「Agent 会不会被诱导去做它绝不该做的事」。


六、反面注脚:1.53 亿份驾照扫描件在暗网流通

安全能力升级的同时,泄露规模也在刷新认知。近期有黑客在暗网站点 Nexus 出售:

|---------|---------------|
| 数据类型 | 数量 |
| 美国驾照扫描件 | 超 1.53 亿份 |
| 身份证 | 超 1000 万份 |
| 旅行证件 | 300 万份 |
| 医疗卡 | 57.9 万张 |

安全研究组织 KrebsOnSecurity 发现该网站后,FBI 已介入调查。

这提醒我们:AI 攻防竞赛再热闹,基础的数据卫生依然是大多数组织最先失守的地方。


七、给开发者的落地清单

如果你的系统里已经有 Agent 在调用真实工具,这几件事建议现在就做:

  • Agent 身份化:每个 Agent 有明确身份、负责人、权限边界
  • 不可逆操作二次确认:写库、转账、删除前必须人工批准
  • 意图监控:检测 Agent 行为与原始目标「失配」时自动熔断
  • 工具白名单:明确能调哪些系统,禁止越权
  • 全链路日志:做了什么、为什么、用了哪些数据,可回溯
  • 分级能力:高危能力(网安、生物)不要对全量用户开放

八、小结

  1. 安全模型已经从「查漏补缺」变成「主动攻防」,2.6 倍正确补丁数是硬指标;
  1. 能力越强,分发越克制 ------ Astra 分级、Mythos 5.1 限验证组织,这不是保守,是必要;
  1. Agent 成为新攻击面,安全与治理从成本项变成产品设计的第一等公民。

能挖 0day 的模型已经出现,接下来考验的是谁把它关得更稳。

相关推荐
回眸&啤酒鸭2 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智2 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
不悔哥2 天前
开源OV-Watch:怎么做一个智能手表
单片机·开源·嵌入式
AI的探索之旅2 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein2 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
家和802 天前
Carla仿真系列:4_在 Carla 的 Tesla 上装 4 路摄像头,并创建网格为环视拼接做准备
开源
LaughingZhu2 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
虎头金猫2 天前
4K 视频总卡在公网带宽?用 N1 + OpenList 把网盘播放链路重新理顺
运维·服务器·网络·python·容器·beautifulsoup·pandas
美狐美颜SDK开放平台2 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk