一、AI Coding 动态
1. Anthropic 披露 Bun 百万行 Zig→Rust AI 迁移:11 天、约 16.5 万美元
Bun 作者 Jarred Sumner 借助 Claude Code 和新工具 Fable,将约 50 万行 Zig 代码迁移到 Rust,传统估算需 12 个月,实际仅用 11 天、消耗约 16.5 万美元 AI 算力。Anthropic 内部工程师的工作流已发生根本性变化:原型开发变快,验证成为主要瓶颈,代码审查和测试越来越多地交由 AI 模型完成。固定式长篇设计文档减少,设计变得持续且动态,"两个披萨团队"最多投入两名工程师。
值得关注的原因: 这是目前公开的最具说服力的"AI 重塑软件工程"案例之一。它不仅证明了跨语言大规模迁移的可行性,更揭示了工程师角色从"写代码"向"审代码、验逻辑"的结构性位移。
2. OpenAI 开源 Codex Security:Apache 2.0 代码漏洞扫描工具
OpenAI 将此前闭源的 Codex Security 插件拆分为独立项目,以 Apache 2.0 协议开源(github.com/openai/codex-security)。该工具基于 gpt-5.6-sol 模型做高推理强度扫描,能自动发现漏洞、沙箱验证、生成修复补丁,支持 SARIF/CSV/JSON 导出和 git commit 前置拦截。公开测试阶段扫描超 120 万次提交,在 OpenSSH、GnuTLS、PHP、Chromium 等项目中发现 792 个严重漏洞和 10,561 个高危漏洞。第三方对比测试显示,在 16.2 万行生产代码上真阳性率 74%(Snyk 28%,Semgrep 20%)。
值得关注的原因: 安全工具从"模式匹配"升级为"智能体推理",开源意味着安全团队可以批量接入 CI 流水线。AI 代码安全赛道正式进入"开源对抗闭源"阶段。
3. Humanlayer 评测 Claude Opus 5:SlopCodeBench 仅 24% 通过率,代码量暴增 5 倍
第三方评测机构 Humanlayer 使用 SlopCodeBench(UW Madison 发布的长程编码基准测试,逐步揭示需求而非一次性给出完整规格)对 Claude Opus 5、Opus 4.8 和 Sonnet 5 进行了 17 个检查点的测试。Opus 5 严格通过率 24%(4/17),优于其他两者的 6%,但代码量是 Opus 4.8 的 5 倍,且未能干净完成任何一个问题。约 51% 的代码是测试代码,生产代码差距实际约 1.8 倍。所有模型在复杂度累积后均出现缺陷级联。
值得关注的原因: 该测试揭示了一个关键问题------前沿模型在"多步迭代维护"场景下仍然脆弱。"无人值守"编码模式尚不可靠,代码审查和复杂度护栏仍是必需品。这对所有依赖 AI Agent 进行日常开发的团队都是一记警钟。
4. Kwaipilot 开源 KAT-Coder-V2.5-Dev:35B MoE 编码 Agent 模型
快手 KwaiKAT 团队开源 KAT-Coder-V2.5-Dev,采用 Mixture-of-Experts 架构,总参数 35B、活跃参数 3B,基于 Qwen3.6-35B-A3B,Apache 2.0 协议。模型在 10 万+ 可验证代码仓库环境中训练,包含五个专家域(SWE、WebCoding、Terminal、WebSearch、General)。SWE-bench Verified 得分 69.40,为同规模开源模型 SOTA。闭源旗舰版在 SWE-bench Pro 得 65.2、PinchBench 得 94.9。
值得关注的原因: 开源编码 Agent 的能力边界再次被推高。35B/3B-active 的 MoE 设计让中小团队能在本地 GPU 上运行接近闭源水平的编码 Agent,对 Cursor、Copilot 等闭源工具形成生态压力。
5. Kimi K3 全面开源:2.8 万亿参数,FrontendCodeArena 登顶
月之暗面于 7 月 27 日在 Hugging Face 正式发布 Kimi K3 完整模型权重和技术报告。总参数 2.8 万亿(MoE),活跃参数 104B,原生支持视觉理解,100 万 token 上下文窗口。采用自研 KDA 混合线性注意力机制和注意力残差技术。在前端编码评测 FrontendCodeArena 以 1679 分登顶,超过 Claude Fable 5、GPT-5.6 Sol 等闭源模型,系开源模型首次在该榜单超越闭源。同步开源 MoonEP、FlashKDA 和 AgentEnv 三项基础设施技术。
值得关注的原因: 这是全球首个开放全部权重的 3T 级模型。开源与闭源在前沿编码能力上的差距正在快速收窄,高盛预计 2026 下半年中国可能出现更多 2-5 万亿参数开源模型。
6. NVIDIA Agent Toolkit 扩展:集成 PhysicsNeMo 与 CUDA-X,打造自主 AI 工程师
NVIDIA 宣布扩展 Agent Toolkit,将架构重构的 PhysicsNeMo 库和更新的 CUDA-X 库作为智能体就绪工具纳入。PhysicsNeMo 提供 AI 物理技能(训练和部署可定制物理模型),CUDA-X 带来加速求解器(cuISS、cuDSS)和量子化学能力(cuEST)。Nemotron 3 Ultra 配合 ACE-RTL Agent 在开源模型中 RTL 编码能力领先。Cadence、Synopsys、西门子等 EDA 厂商已接入,多物理场性能提升达 20 倍。
值得关注的原因: AI Agent 正式进入芯片设计和物理工程领域。当 AI 不仅能写软件代码,还能做 RTL 设计、物理仿真和量子化学计算时,"AI 编码"的外延正在被重新定义。这也标志着具身智能和物理 AI 的基础设施层在快速成熟。
7. Anthropic Claude Mythos 发现 HAWK 后量子签名方案密码学弱点
Anthropic 的 Claude Mythos Preview 模型在 60 小时内发现后量子签名候选方案 HAWK 的数学结构中隐藏了两年的对称性缺陷,并将 7 轮 AES-128 缩减版攻击效率提升 200-800 倍(命名为"莫比乌斯桥"技术)。这两项结果对现实世界安全暂无直接威胁,但证明 AI 能发现人类专家反复审查未察觉的数学瑕疵。已开源演示代码(Apache 2.0)。
值得关注的原因: AI 辅助密码分析从"边缘设想"走向台前。随着 AI 深度介入安全研究,现有密码标准的审查方式和安全假设可能需要系统性重新评估。
二、具身智能动态
8. 顺德成立全国首个具身智能发展局,产业政策从"鼓励"走向"统筹"
7 月 28 日,佛山市顺德区具身智能发展局正式揭牌,系全国首个统筹具身智能全产业链的政府职能局。顺德为全国最大工业机器人生产基地,2025 年机器人产业产值近 400 亿元,集聚超百家企业。
值得关注的原因: 政府层面设立专门的具身智能职能部门,意味着这一领域已从"新兴产业"升级为"产业基础设施"级别的战略定位。政策资源的集中投入将加速产业链整合。
9. 比亚迪人形机器人 8 月亮相,工信部年底目标万台级落地
比亚迪官方证实其人形机器人产品将于 8 月在郑州"迪空间"首发亮相并入驻门店,负责迎宾讲解。工信部、国资委已启动实景实训专项行动,目标年底万台级落地。同期,总台首届智能机器人应用技能大展在北京启动,浙江、湖北、江苏发布实景实训标志性场景。
值得关注的原因: 比亚迪作为头部制造业企业切入人形机器人,标志着具身智能从"炫技"转向"进厂干活"。工信部万台级目标若实现,将是人形机器人首次进入工业级规模化部署。
10. 腾讯押注具身智能"大脑":Tairos 平台不做本体,适配周期缩短至数天
腾讯明确不造机器人本体,而是以 Tairos 平台提供算力、模型与开发工具,已发布三款具身基座模型,与宇树、智元等合作,适配周期缩短至数天。同期,智元自研 WITA-Omni Preview 以 85.21 分登顶具身全模态理解权威榜单 DailyOmni,采用"思考-说-动"原生端到端架构。
值得关注的原因: 腾讯选择"卖铲子"路线------做机器人行业的"安卓+高通",而非自己做整机。这与 NVIDIA 在物理 AI 领域的策略形成呼应。具身智能的产业分工正在快速清晰:本体厂商、大脑平台、数据飞轮各司其职。
11. 星炽动力具身智能机器人正式量产,年底目标千台级交付
7 月 27 日,星炽动力宣布旗下具身智能机器人进入全面量产阶段,首批量产产品已通过全链路质量验证。搭载自研 PULSE 架构,面向智慧家庭、社区、教育和商业服务多场景,预计年底前完成千台级交付。行业研究机构将 2026 年称为"具身智能量产元年"。
值得关注的原因: 从工程样机到量产交付是具身智能行业的关键跨越。星炽动力的全链路产能体系(核心零部件自研→整机装配→质量检测)为行业提供了从"模型能力"到"制造能力"的闭环样本。
附:其他值得关注的动态
|-----------------------------|-----------------------------------------------------------------|
| 事件 | 简述 |
| Amazon Nova 模型进入维护模式 | 高端 Nova 系列停止更新,新 Frontier Model Research 团队由 Pieter Abbeel 领导接棒 |
| Open Secure AI Alliance 成立 | 50 家公司联盟开源 AI 安全工具,NVIDIA 参与推动 |
| Microsoft MAI-Cyber-1-Flash | 安全专用模型在 CyberGym 得分 96%,成本为 GPT-5.4 方案的一半 |
| Claude 共享对话被搜索引擎索引 | Anthropic 修补缺失的 noindex 标签,共享对话曾可被 Google/Bing 检索 |
| ECC 2.1.0 发布 | 23.4 万星 Agent 框架新增浏览器计划画布、Kimi Code 目标和自托管 GPU 支持 |