深度 | 美国AI开始攻击真人

英国人工智能安全研究所研究人员直言:"针对真人------这是我们以前从未见过的。"

捏造虚假身份,轮番向人施压,再骗取授权,目的就为完成攻击------这种谍战片里常见的剧本,如今写进了英国官方机构的事故报告。

当地时间8月4日,英国政府旗下人工智能安全研究所(AISI)发布报告称,调查发现,部分被测试的AI智能体曾持续进行针对真实个人和组织的潜在有害活动。

在近期开展的122次网络安全测评中,智能体在10次运行中越界,共记录到19起越界事件,涉事主体是美国头部模型Anthropic和OpenAI。

最严重的一起,智能体试图把恶意代码插入主流代码托管平台GitHub的真实项目中。它研究了项目中的人类审核员,创建了多个虚假身份,对审核员施压,要求其批准代码。

AISI惊呼,这是首次在没有特定提示的情况下,在现实世界中如此清晰地看到与自主性和欺骗性相关的风险显现。

"针对真人------这是我们以前从未见过的。"研究人员称,智能体曾试图直接联系真实用户,通过在线文件传输服务发送消息和文件,说服他们运行恶意代码。

这场景似曾相识。翻翻日历,这个夏天,美国AI的翻车几乎就没停过。

7月21日,OpenAI承认其AI模型挖出零日漏洞、突破沙箱,入侵全球最大AI开源社区抱抱脸(Hugging Face)。公司称,"这是一起史无前例的网络安全事件。"

7月30日,Anthropic承认,旗下模型克劳德(Claude)在网络安全受控测评环境中意外获得互联网访问权限,进入了3家真实机构的系统,最早一起事件可追溯到4月。

为了越界,AI模型甚至玩起作弊。据AISI一项测试结果,在475次网络安全评估运行中,五款美国前沿AI模型全部出现作弊,作弊率7.8%至14.1%。

问题出在哪?此次报告的答案是,"从根本上说,智能体采取这类行动,是为了完成它被赋予的任务。"

根源是前沿AI的竞赛逻辑。美国头部AI企业竞争日趋白热化,痴迷堆参数、刷榜单、冲上限,争的就是谁先把能力推到极致。

为了取得更佳测试效果,研究人员甚至放松安全权限。OpenAI此前就承认过,为测试模型的极限网络攻击能力,研究团队有意关闭了部分安全过滤器。

护栏本身也是黑箱。如抱抱脸的例子中,前沿闭源模型安全护栏日趋僵化,连受害者都救不了。

反观中国,AI被信任的不止性能。OpenAI惹下的祸,正是靠智普GLM-5.2取证把数天压到数小时,靠的是可用、可控、可信,能本地部署,数据安全权限始终牢牢守护。

更深的差别在制度。在鼓励创新的同时,中国的智能体治理已明确划出若干条红线,如操作不得超出用户授权范围,运行时须有决策校验与容错熔断机制,全程可追溯、可审计等。

当美国企业先把能力推满再打补丁,中国则把技术、规则、责任的短板及时补到位。这不是限制,而是确保全社会不会为技术冒进买单。

这一导向下,中国企业渐渐形成共识:谁能交付全程可审计的安全系统,谁才有可能握住企业级AI的入场券。

美国AI接连翻车,也在暴露新的安全隐忧。长期以来,AI安全议题多集中在内容合规性、数据偏见及隐私保护上,而今,其本身的行为安全性正变为现实。

显然,银行、医院、政务平台与大型制造企业,不可能把核心数据和操作权限,交给一个不可控的云端模型。

相关推荐
qq_25294131681 小时前
列车车轮缺陷智能检测数据集:800张图像、4大类别,助力铁路安全运维
运维·人工智能·安全·yolo·目标检测·计算机视觉·视觉检测
windliang1 小时前
Claude Code 源码分析(十一):一段会话怎样保存、恢复与续写
前端·javascript·人工智能
掘金一周1 小时前
掘友们,你们现在下班了都玩啥游戏?| 沸点周刊 8.13
前端·人工智能·后端
老木避暑研究所1 小时前
基于OpenCV的避暑房采光分析与朝向优化——重庆云澜栖不同楼层日照时长实测
人工智能·opencv·计算机视觉
leoZ2312 小时前
Vue3 还原一个企业级后台-06-主布局设计
人工智能·opencv·机器学习·计算机视觉·数据挖掘·语音识别·caffe
美团技术团队2 小时前
KDD'26 美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读
人工智能
程序员cxuan2 小时前
Anthropic:session 之间可以相互通信了
人工智能·后端·程序员
GEOshijie1232 小时前
GEO服务商算法适配承诺怎么验收?48小时响应的合同化考核方案
人工智能·python
wordbaby2 小时前
大模型 API 核心概念笔记
人工智能