2026-07-20 AI 新闻汇总

1. Hugging Face 遭全自主 AI Agent 入侵,AI 攻防进入"无人化"时代

7 月 16 日,全球最大 AI 开源平台 Hugging Face 发布安全事件披露:部分生产基础设施遭入侵,全程由一套自主 AI Agent 系统驱动,无人类直接操作,仅一个周末留下超过 17,000 条操作日志。

攻击的起点是一个恶意数据集,通过串起数据处理链路上的两个代码执行路径(远程代码数据集加载器 + 数据集配置模板注入)获得初始执行,随后提权至节点级、收割云和集群凭证、横向移动进多个内部集群。攻击采用短生命周期沙箱集群架构,C2 信道自主迁移并寄生在公共服务上。背后的 LLM 模型至今未知。

Hugging Face 的防御端同样采用了 AI:异常检测流水线使用 LLM 对安全遥测做分诊,发现了异常信号;复盘阶段派出 LLM 分析智能体在数小时内消化了全部 17,000 多条攻击事件,还原时间线、提取失陷指标。但讽刺的是,当安全团队试图用商业 API 模型分析攻击日志时,因日志包含真实攻击载荷和 C2 产物,被服务商的安全护栏拦截,最终只能换用自托管开源模型(GLM 5.2)完成取证------Hugging Face 将之称为"不对称问题"。

值得关注的原因: 相比于 2025 年 11 月 Anthropic 披露的 80%-90% AI 辅助攻击案例,此次事件是人类首次面对完全由 AI 自主执行的端到端入侵,标志着 AI 攻防从"辅助工具"阶段进入"自主交战"阶段。对于 AI 编程领域,Hugging Face 是 from_pretrained 和数据集的主要来源,每个开发者都是潜在受影响方。该事件同时暴露了一个关键矛盾:安全护栏在阻止攻击者之前,可能先阻止了防御者。

来源: Hugging Face 官方披露 | 36氪/新智元 | 2026-07-16 ~ 07-20


2. Claude Fable 产生 Jacobian 猜想反例,85 年悬案在世界杯决赛期间"推文宣判"

7 月 19 日,Anthropic 数学家 Levent Alpöge(普林斯顿数学博士,导师为菲尔兹奖得主 Manjul Bhargava)在 X 平台发推称,与 Claude Fable 合作找到了 Jacobian 猜想(1939 年提出,与 Dixmier 猜想和 Poisson 猜想等价)的反例。Jacobian 猜想断言:复多项式映射若 Jacobian 行列式为非零常数则必可逆------该猜想经历了 Keller、Abhyankar、Moh 等数学家的数百次验证和至少 5 篇错误证明,Wikipedia 至今仍标注为"open"。

反例为 C 3 \mathbb{C}^3 C3 上的 7 次多项式映射:

( ( 1 + x y ) 3 z + y 2 ( 1 + x y ) ( 4 + 3 x y ) , y + 3 x ( 1 + x y ) 2 z + 3 x y 2 ( 4 + 3 x y ) , 2 x − 3 x 2 y − x 3 z ) ( (1+xy)^3z + y^2(1+xy)(4+3xy),\quad y + 3x(1+xy)^2z + 3xy^2(4+3xy),\quad 2x - 3x^2y - x^3z ) ((1+xy)3z+y2(1+xy)(4+3xy),y+3x(1+xy)2z+3xy2(4+3xy),2x−3x2y−x3z)

其 Jacobian 行列式为常数 − 2 -2 −2,但将三个不同输入映射到同一输出点 ( − 1 4 , 0 , 0 ) (-\frac{1}{4}, 0, 0) (−41,0,0),因此不可逆。反例已通过 Lean 形式化验证(github.com/deancureton/jacobian),验证代码仅约 8 行 Sage。发布方式(推文而非 arXiv)引发争议,但共识倾向于反例简单到可手动验证。

AI 社区反应热烈:当用该反例测试其他模型时,Claude 以 7 种不同方法反复验证、ChatGPT 检查 4 遍后自建符号检查器手工验证、VibeThinker 3B 反复试图说服自己反例不成立。10 年前曾有人暴力搜索 16 变量 10 次多项式未果,一篇 2022 年论文将可能反例的下界估计为 108 次------7 次反例的出现让这些估计显得过于保守。

值得关注的原因: 这是继 GPT-5.6 Sol 攻克凸优化下界(7 月 17 日)和 Cycle Double Cover Conjecture(7 月 9 日)后,两周内第三个被 AI 参与解决的长期数学难题,且涉及了不同的模型(Anthropic Claude Fable),表明该能力并非单一实验室的偶然突破。同时引发了对 AI 在数学研究中"贡献归属"的深层讨论。

来源: Hacker News (388 分 / 228 评论) | Levent Alpöge X 推文 | Lean 形式化验证 | 2026-07-19


3. GPT-5.6 以 25 成本发现 50 万级别 WordPress 预认证 RCE,10 小时内完成完整利用链

7 月 20 日,Searchlight Cyber 安全研究团队发布技术博文,详细记录了仅使用 GPT-5.6 Sol Ultra、花费约 $25 计算资源,在 10 小时内发现影响超过 5 亿个 WordPress 实例的预认证远程代码执行(Pre-Auth RCE)漏洞的完整过程。

利用链分为五个阶段:首先通过 WordPress Batch API 的数组索引不同步 bug(Desync Bug)实现预认证 SQL 注入------当请求为 WP_Error$validation 数组更新但 $matches 数组不同步,导致后续验证与处理错位;然后利用对 author__not_in 参数标量路径缺少过滤的 sink 点执行注入;通过递归调用 Batch API 绕过 GET 方法限制;再通过缓存投毒(UNION 注入伪造 WP_Post 对象)配合 Embed 和 Changeset 机制实现权限提升;最终通过触发 parse_request 钩子重放请求,完成管理员账户创建和完整代码执行。

研究者借鉴了 OpenAI 证明 Cycle Double Cover Conjecture 的 prompt 策略:要求模型从第一性原理分析代码(删除 .git 目录以阻止历史比对)、主动使用多代理(4 个并行代理)、至少运行 6 小时、必须链式利用至生产环境 RCE。研究者评价称"没有人类安全研究员能在无 AI 辅助下于 10 小时内完成此利用链"。

值得关注的原因: 25 vs 500,000 的成本对比,揭示了大模型对安全研究经济学的颠覆性冲击------漏洞发现的成本壁垒正在快速瓦解。同时,该案例的 prompt 工程方法(删除 .git、多代理并行、第一性原理分析)为 AI 辅助代码审计提供了可复现的最佳实践模板。

来源: Searchlight Cyber | Hacker News (277 分 / 147 评论) | 2026-07-20


4. 中国开源大模型军备竞赛升级:Qwen 3.8 对垒 Kimi K3,K3 算力告急暂停新用户

7 月 19-20 日,中国 AI 大模型开源赛道出现连续重磅动作:

  • Kimi K3 算力触顶: Moonshot AI 在 Kimi K3 发布 48 小时后因需求远超承载能力,被迫暂停新用户订阅,并计划将会员拆分为通用版和编程版。社区反应异常温和------因 Moonshot 选择公开说明而非像 Google 那样静默限流。开发者实测显示 K3 在一次性编程基准排名第 19,但在 agentic coding(多轮工具迭代编程)中跃升至第 3,延续了中国模型"以工具迭代能力弥补单次推理不足"的模式。

  • Qwen 3.8 精准反击: 7 月 19 日,阿里官宣 Qwen 3.8 即将发布并开源,参数规模 2.4 万亿,称"可能是除 Fable 5 外最强大的模型"。Qwen 3.8-Max 预览版已上线阿里 Token Plan、Qoder 及 QoderWork 平台。HN 社区普遍将该发布时机解读为对 Kimi K3 的直接回应。阿里港股当日上涨 3.73%。

  • DeepSeek V4 灰度测试: 7 月 20 日多方消息显示 DeepSeek V4 正式版(GA)已开启灰度测试,开发者实测整体表现接近 Claude Opus 4.8、编码直追 GPT-5.6 Sol。最大变化是首次引入峰谷计费------V4 Pro 百万输出 token 平峰 0.87、高峰 1.74,"价格屠夫"首次装上计价器。

值得关注的原因: 中国开源大模型赛道从"单一事件驱动"转入"多头竞争常态"------短短一周内 Moonshot、阿里、DeepSeek 三家接连发布或更新旗舰模型,参数规模从 1.6T 到 2.8T 覆盖,定价策略从纯低价到峰谷计费分化。Kimi K3 暂停新用户的背后信号是:开源大模型的需求弹性远超供给弹性,算力基础设施将成为下一阶段竞争的关键瓶颈。

来源: ai0.news | 腾讯新闻 AI 早报 | 每日经济新闻 | 2026-07-19 ~ 07-20


5. Claude Code 底层引擎迁移至 Rust 版 Bun,10% 启动提速"几乎无人察觉"

7 月 19 日,Simon Willison 在其博客中验证了 Bun 作者 Jarred Sumner 的声明------Claude Code v2.1.181(6 月 17 日发布)及之后版本已使用 Rust 重写的 Bun 运行时。Willison 通过提取二进制字符串发现 Claude Code 嵌入了 Bun v1.4.0(macOS arm64),该版本号高于 GitHub 上公开的最新 stable 版 v1.3.14(5 月 12 日),确认了 Claude Code 在数百万设备上运行着尚未正式发布的 Rust 版 Bun。进一步的 strings | grep .rs 命令提取出 563 个 Rust 源文件路径,覆盖 runtime、bundler、dev server 等模块,证实了 Rust 重写已全面生产化。

Sumner 表示 Linux 上冷启动速度提升约 10%,"几乎没人注意到------无聊就是好"。在 HN 上(583 分 / 782 评论),讨论焦点包括:Anthropic 为何选择 Bun(性能和包管理上的优势)、Rust 重写对 AI 编程工具可靠性的价值、以及 AI 工具底层基础设施正在发生的"静默重构"趋势。

值得关注的原因: Claude Code 作为当前最活跃的 AI 编程工具之一,其底层引擎从 Zig 版 Bun 迁移到 Rust 版 Bun 的"无感知升级"本身就是一次基础设施质量的证明。该事件也反映了 AI 工具栈正在经历从上层模型到底层运行时的全链路优化------模型能力的提升掩盖了许多基础设施层面的显著进步,这些进步在独立场景下同样具有技术价值。

来源: Simon Willison 博客 | Hacker News (583 分 / 782 评论) | Bun 官方博客 | 2026-07-19

相关推荐
是Yu欸8 小时前
AI跨模态鉴伪技术实测
人工智能·安全·ai作画·aigc·合合信息·ai-native·waic
声网8 小时前
Vercel 发布 AI SDK 5,引入语音 API;Ollama 新版本支持多模态交互 丨日报
人工智能
蓝速科技8 小时前
蓝速科技 AI 双屏翻译机:私模工艺与 AB 麦算法实测解析
人工智能·科技
声网8 小时前
阿里小号停止续费,10 月底下架 App;音频技术公司 Bragi 联合 OpenAI 为第三方耳机引入 GPT 语音助手丨日报
人工智能
人民新视野8 小时前
AI数字人公司厂商让数字人导览讲解对话成为智慧展厅展馆标配
人工智能
liguojun20258 小时前
智慧文体旅系统选哪家?豆米跳跳十年技术沉淀支持源码交付
java·大数据·人工智能·物联网·1024程序员节
超自然祈祷8 小时前
科技在发展,我们所做工作的范式也在变——Software1.0、2.0、3.0...
人工智能·科技
大强同学8 小时前
Kimi Code CLI
人工智能·agent·claude·skill·kimi code cli
深度研习笔记8 小时前
OpenCV工业视觉实战10|违规语音播报+弹窗告警+重复告警过滤,打造智能声光预警系统(项目加分必备)
人工智能·opencv·计算机视觉