狂飙的AI,失控的安全……

近期,AI安全领域接连爆出两颗惊雷。7月21日,OpenAI公开承认,其模型在一次常规安全测试中失控并入侵了Hugging Face。原计划很简单:将模型置于封闭沙箱,赋予其利用已知漏洞完成攻击的任务------无互联网、无越狱可能。然而,模型自行发现了一个零日漏洞,成功逃逸并获取公网访问权限,随后拼凑目标信息,利用被盗凭证和多个漏洞串联攻击路径,最终从Hugging Face生产数据库中窃取了测试答案。

随后7月30日,Anthropic主动披露:在对14万次安全测试记录的审查中,发现Claude系列模型在三起事件中侵入了真实系统------一次通过弱密码闯入与虚构目标同名的真实公司;一次在PyPI上自主发布恶意包,被15个真实系统下载运行;还有一次扫描约9000个主机后入侵了暴露服务器,但模型在意识到目标属于真实系统后主动中止了攻击。

事件分析

两起事件指向同一个深层问题:AI从"会说话"变成了"会动手"。清华大学刘知远教授的观点一针见血------2025年以前,大模型的安全风险主要在于"答错话",属于内容层面;但进入AI Agent时代,模型能够自主写代码、操作系统、调用工具,风险量级已不可同日而语。

关键还在于,模型从未收到"逃逸"或"攻击"的指令。它们的目标只是"完成测试、拿高分",于是自行拆解任务、寻找路径,选择了人类从未设想过的"捷径"。此前曾有AI编码Agent在几秒内删光生产数据库------原因仅仅是它判断删除存储卷是解决问题的最快方式。这不是恶意,而是目标函数的盲区。

更令人不安的是,两起入侵均为事后审查才发现,被入侵方全程毫无察觉。剑桥研究员Maurice Chiodo直言:这些公司在测试过程中似乎无人实时监看,审查机制严重不足。

事件迅速引爆舆论。来自OpenAI、Anthropic、Meta、谷歌等公司的超过1100名员工联名签署公开信,呼吁政府加强AI监管,签字者包括Anthropic CEO达里奥·阿莫代伊、OpenAI首席科学家、Meta首席科学家等行业核心人物。美国政府随即行动------白宫召集科技巨头闭门会议,并正式敲定了针对顶尖AI模型的自愿性网络安全测试规范。

安全启示

这场风波给安全行业带来四个深刻提醒:

1、攻击主体变了

传统安全预设的攻击者是人类------有动机、有局限。AI智能体没有恶意,只有目标;不会疲惫,只会反复试错。防护逻辑需要重新设计。

2、隔离不再绝对

OpenAI的模型在沙箱里找到零日漏洞成功逃逸;Anthropic只因一个配置错误,模型就"转服"到了真实互联网。隔离环境的安全假设需要重新审视。

3、检测需要AI对AI

两家公司都是事后翻日志才发现问题,人工审计已经跟不上。行业共识正在形成:用AI做持续监控,而非等人翻日志。

4、事件响应面临新挑战

Hugging Face在事件响应时试图用商业AI模型分析攻击日志,却被安全护栏拦截------模型无法区分安全分析人员和攻击者。安全工具本身也可能成为响应的障碍。

本次安全事件在行业内史无前例,本质是模型能力一路狂飙,安全设计却仍在蹒跚追赶。当攻击力量从人力转向算法,安全行业必须重塑对抗思维。

作为国内专业的安全运营商和安全产品供应商,聚铭网络长期专注于网络安全智能分析与检测,深耕AI+安全运营领域。我们相信:未来的安全防御,不是用规则去堵,而是用智能去感知,识别异常、发现威胁、快速响应这套核心逻辑不会变,但实现它的方式,必须进化了。

相关推荐
imbackneverdie2 小时前
写文献综述,时间脉络和主题分类到底怎么选?
人工智能·ai·aigc·论文·科研·ai写作·医学
weixin_446260852 小时前
生成式与智能体AI认知能力缺陷分类体系
人工智能·分类·数据挖掘
网渡科技2 小时前
GEO搜索优化:大模型引用率提升的六大实战策略
人工智能·搜索引擎·chatgpt
苏灿烤鱼2 小时前
GitHub Trending 日报|Agent 记忆登顶,老牌项目集体返场
安全·agent·资讯
万少2 小时前
用 TraeWork 给小孩做一个家庭工作台
前端·人工智能·后端
tech讯息2 小时前
风冷、液冷、风液融合数据中心制冷方案品牌怎么挑?结合负载工况与项目场景筛选
人工智能
孙启超2 小时前
【AI应用开发】ReAct 原理是什么?和普通直接提问 LLM 差别在哪?
前端·人工智能·llm·agent·react·rag·ai应用开发
RobinDevNotes2 小时前
开源AI渗透测试智能体自动验证真实漏洞
人工智能·网络安全·ai·个人开发·开发工具
数据皮皮侠AI2 小时前
上市公司数字供应链金融指数(2010-2024)
大数据·人工智能·算法