狂飙的AI,失控的安全……

近期,AI安全领域接连爆出两颗惊雷。7月21日,OpenAI公开承认,其模型在一次常规安全测试中失控并入侵了Hugging Face。原计划很简单:将模型置于封闭沙箱,赋予其利用已知漏洞完成攻击的任务------无互联网、无越狱可能。然而,模型自行发现了一个零日漏洞,成功逃逸并获取公网访问权限,随后拼凑目标信息,利用被盗凭证和多个漏洞串联攻击路径,最终从Hugging Face生产数据库中窃取了测试答案。

随后7月30日,Anthropic主动披露:在对14万次安全测试记录的审查中,发现Claude系列模型在三起事件中侵入了真实系统------一次通过弱密码闯入与虚构目标同名的真实公司;一次在PyPI上自主发布恶意包,被15个真实系统下载运行;还有一次扫描约9000个主机后入侵了暴露服务器,但模型在意识到目标属于真实系统后主动中止了攻击。

事件分析

两起事件指向同一个深层问题:AI从"会说话"变成了"会动手"。清华大学刘知远教授的观点一针见血------2025年以前,大模型的安全风险主要在于"答错话",属于内容层面;但进入AI Agent时代,模型能够自主写代码、操作系统、调用工具,风险量级已不可同日而语。

关键还在于,模型从未收到"逃逸"或"攻击"的指令。它们的目标只是"完成测试、拿高分",于是自行拆解任务、寻找路径,选择了人类从未设想过的"捷径"。此前曾有AI编码Agent在几秒内删光生产数据库------原因仅仅是它判断删除存储卷是解决问题的最快方式。这不是恶意,而是目标函数的盲区。

更令人不安的是,两起入侵均为事后审查才发现,被入侵方全程毫无察觉。剑桥研究员Maurice Chiodo直言:这些公司在测试过程中似乎无人实时监看,审查机制严重不足。

事件迅速引爆舆论。来自OpenAI、Anthropic、Meta、谷歌等公司的超过1100名员工联名签署公开信,呼吁政府加强AI监管,签字者包括Anthropic CEO达里奥·阿莫代伊、OpenAI首席科学家、Meta首席科学家等行业核心人物。美国政府随即行动------白宫召集科技巨头闭门会议,并正式敲定了针对顶尖AI模型的自愿性网络安全测试规范。

安全启示

这场风波给安全行业带来四个深刻提醒:

1、攻击主体变了

传统安全预设的攻击者是人类------有动机、有局限。AI智能体没有恶意,只有目标;不会疲惫,只会反复试错。防护逻辑需要重新设计。

2、隔离不再绝对

OpenAI的模型在沙箱里找到零日漏洞成功逃逸;Anthropic只因一个配置错误,模型就"转服"到了真实互联网。隔离环境的安全假设需要重新审视。

3、检测需要AI对AI

两家公司都是事后翻日志才发现问题,人工审计已经跟不上。行业共识正在形成:用AI做持续监控,而非等人翻日志。

4、事件响应面临新挑战

Hugging Face在事件响应时试图用商业AI模型分析攻击日志,却被安全护栏拦截------模型无法区分安全分析人员和攻击者。安全工具本身也可能成为响应的障碍。

本次安全事件在行业内史无前例,本质是模型能力一路狂飙,安全设计却仍在蹒跚追赶。当攻击力量从人力转向算法,安全行业必须重塑对抗思维。

作为国内专业的安全运营商和安全产品供应商,聚铭网络长期专注于网络安全智能分析与检测,深耕AI+安全运营领域。我们相信:未来的安全防御,不是用规则去堵,而是用智能去感知,识别异常、发现威胁、快速响应这套核心逻辑不会变,但实现它的方式,必须进化了。

相关推荐
豪气的程序猿1 小时前
电商图片工作流怎么选?Lingko AI 对比折叠键盘主图与详情页
人工智能
小刘快学习2 小时前
把 AI 账单拆到部门:企业 AI 网关的精准分账思路
人工智能
米小虾2 小时前
你让监控模型读的思维链,可能是攻击者写好的剧本
人工智能
deepseek232 小时前
Iris 开源搜索智能体拆解:35B 与 397B 中文仅差 0.3 分,上下文管理胜过堆参数
人工智能·ai agent·开源模型
ai小陈2 小时前
CUDA Stream实战:让数据传输与GPU计算真正重叠
人工智能·深度学习·ai·pdf·云计算·gpu算力
residual_fan2 小时前
【学术论文】航空发动机故障诊断智能体:基于持续对比强化学习的动态优化方法
人工智能·算法·数据挖掘·数据分析
东风破_2 小时前
从 RAG 到 Agentic RAG:第二步,把复杂问题拆开再检索
人工智能
dehuisun2 小时前
第07篇:RAG+Agent 部署架构、资源评估与私有化方案
人工智能
米小虾3 小时前
拆给 8 个子智能体,只拿回 2.3 倍信息:多智能体分解的产出守恒律
人工智能·agent
虹科网络安全3 小时前
Redis 安全公告:CVE-2026-81934 TLS 处理漏洞及修复建议
网络·人工智能·网络安全