深度 | 美国AI开始攻击真人

英国人工智能安全研究所研究人员直言:"针对真人------这是我们以前从未见过的。"

捏造虚假身份,轮番向人施压,再骗取授权,目的就为完成攻击------这种谍战片里常见的剧本,如今写进了英国官方机构的事故报告。

当地时间8月4日,英国政府旗下人工智能安全研究所(AISI)发布报告称,调查发现,部分被测试的AI智能体曾持续进行针对真实个人和组织的潜在有害活动。

在近期开展的122次网络安全测评中,智能体在10次运行中越界,共记录到19起越界事件,涉事主体是美国头部模型Anthropic和OpenAI。

最严重的一起,智能体试图把恶意代码插入主流代码托管平台GitHub的真实项目中。它研究了项目中的人类审核员,创建了多个虚假身份,对审核员施压,要求其批准代码。

AISI惊呼,这是首次在没有特定提示的情况下,在现实世界中如此清晰地看到与自主性和欺骗性相关的风险显现。

"针对真人------这是我们以前从未见过的。"研究人员称,智能体曾试图直接联系真实用户,通过在线文件传输服务发送消息和文件,说服他们运行恶意代码。

这场景似曾相识。翻翻日历,这个夏天,美国AI的翻车几乎就没停过。

7月21日,OpenAI承认其AI模型挖出零日漏洞、突破沙箱,入侵全球最大AI开源社区抱抱脸(Hugging Face)。公司称,"这是一起史无前例的网络安全事件。"

7月30日,Anthropic承认,旗下模型克劳德(Claude)在网络安全受控测评环境中意外获得互联网访问权限,进入了3家真实机构的系统,最早一起事件可追溯到4月。

为了越界,AI模型甚至玩起作弊。据AISI一项测试结果,在475次网络安全评估运行中,五款美国前沿AI模型全部出现作弊,作弊率7.8%至14.1%。

问题出在哪?此次报告的答案是,"从根本上说,智能体采取这类行动,是为了完成它被赋予的任务。"

根源是前沿AI的竞赛逻辑。美国头部AI企业竞争日趋白热化,痴迷堆参数、刷榜单、冲上限,争的就是谁先把能力推到极致。

为了取得更佳测试效果,研究人员甚至放松安全权限。OpenAI此前就承认过,为测试模型的极限网络攻击能力,研究团队有意关闭了部分安全过滤器。

护栏本身也是黑箱。如抱抱脸的例子中,前沿闭源模型安全护栏日趋僵化,连受害者都救不了。

反观中国,AI被信任的不止性能。OpenAI惹下的祸,正是靠智普GLM-5.2取证把数天压到数小时,靠的是可用、可控、可信,能本地部署,数据安全权限始终牢牢守护。

更深的差别在制度。在鼓励创新的同时,中国的智能体治理已明确划出若干条红线,如操作不得超出用户授权范围,运行时须有决策校验与容错熔断机制,全程可追溯、可审计等。

当美国企业先把能力推满再打补丁,中国则把技术、规则、责任的短板及时补到位。这不是限制,而是确保全社会不会为技术冒进买单。

这一导向下,中国企业渐渐形成共识:谁能交付全程可审计的安全系统,谁才有可能握住企业级AI的入场券。

美国AI接连翻车,也在暴露新的安全隐忧。长期以来,AI安全议题多集中在内容合规性、数据偏见及隐私保护上,而今,其本身的行为安全性正变为现实。

显然,银行、医院、政务平台与大型制造企业,不可能把核心数据和操作权限,交给一个不可控的云端模型。

相关推荐
回眸&啤酒鸭3 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智3 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅3 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein3 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu3 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台3 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb3 天前
智能网联汽车安全能力框架
人工智能
龙亘川3 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI3 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai