AI 日报(2026年9月3日)

今日主题:美国司法部力挺AI训练合理使用;谷歌发布Gemini 3.8 Flash与网络安全模型

本期概览:今日 AI 领域迎来多项重磅政策与技术进展:美国司法部向法院提交声明,正式支持 OpenAI 等 AI 厂商在版权诉讼中的合理使用抗辩,强调维护美国在 AI 领域的领先地位;谷歌 DeepMind 正式推出面向智能体工作流的 Gemini 3.8 Flash 及专精漏洞挖掘的 3.8 Flash Cyber 模型。国内方面,阿里更新 2.4 万亿参数旗舰模型 Qwen3.8-Max,登顶权威前端编程榜单;燧原科技开启科创板 IPO 申购;腾讯 WorkBuddy 开放平台全面上线。在学术与技术层面,智能体过程评估盲区、长程状态追踪以及大模型数据清洗工程等研究成果相继涌现。

本期精选 27 条 · 国内 9 / 国际 18

模型发布

1. Google DeepMind 正式发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

Google DeepMind 宣布推出两款新模型:面向智能体任务、软件工程与多步推理的标准版 Gemini 3.8 Flash,以及专为漏洞挖掘与代码修复优化的 3.8 Flash Cyber。官方数据显示,3.8 Flash Cyber 在 CyberGym 基准测试上达到 86.2%,并在内部基准中对 20 种编程语言实现了超 70% 的漏洞发现成功率。新模型 API 定价保持每百万输入 Token 0.75 美元,现已接入 Google AI Studio 及 Gemini Enterprise。

2. 阿里更新旗舰模型 Qwen3.8-Max,前端编程能力位列 CodeArena 榜首

阿里宣布更新其总参数达 2.4 万亿的旗舰模型 Qwen3.8-Max,重点对编程(Coding)与专业办公(Cowork)进行了专项后训练优化。更新后模型在前端编程权威基准 CodeArena 中得分提升至 1691 分,超越 Claude Opus 5 登顶总榜第一。目前新版本已在千问 AI 平台上线 API 服务,并同步接入千问办公、Qoder 等应用。

3. 李飞飞旗下 World Labs 发布空间智能世界模型 Atlas

由李飞飞联合创办的 World Labs 正式发布空间智能多模态世界模型 Atlas,支持从少量图像中直接生成、重建和模拟 3D 物理世界场景。与将输入作为平面序列处理的传统视频模型不同,Atlas 原生锚定在 3D 空间结构中,并能够完全在仿真环境中为具身机器人生成训练数据。

算力硬件

1. 云端算力芯片厂商燧原科技开启科创板 IPO 申购,预计募资超 60 亿元

上海燧原科技股份有限公司正式开启科创板新股申购,发行价 142.18 元/股,预计募集资金 61.19 亿元用于新一代云端 AI 芯片研发。本次战略配售占总发行量的 20%,吸引了腾讯、小米、中兴通讯等产业链企业以及社保基金参与。招股书显示其 2026 年上半年营收达 11.20 亿元,同比增长 279.08%。

2. 行业调研:近四成企业在下一代 AI 加速卡评估中纳入非英伟达芯片

VentureBeat 针对 170 位 AI 基础架构负责人的最新调研显示,39.4% 的受访企业计划在未来 12 个月内评估非英伟达加速器(如 AWS Trainium、Google TPU、AMD Instinct 或自研 ASIC),高于考虑英伟达新一代架构的 25.3%。这表明尽管英伟达仍是主流生产环境默认选项,但企业正积极构建多元化算力备选方案以控制风险与成本。

产品应用

1. Google DeepMind 推出 Fairwind 计划,向政府与受信任机构开放前沿网络防御

Google DeepMind 宣布启动 Fairwind 计划,旨在为政府及受信任的关键合作伙伴提供先进的 AI 主动式网络安全防御能力。该计划基于其在网络安全大模型(如 Gemini 3.8 Flash Cyber)上的突破,旨在协助关键基础设施与机构实现高自动化的大规模漏洞排查与防御响应。

2. Anthropic 推出企业前沿防护方案 EFS,支持客户云端自主管控数据

Anthropic 宣布推出面向企业的 Enterprise Frontier Safeguards(EFS)解决方案,该方案将零数据保留(ZDR)隐私策略与模型滥用检测机制相结合。EFS 允许将交互数据直接存储在客户自主控制的云基础设施中,在满足严格数据合规要求的同时实现模型运行安全监控。

3. Anthropic 发布电商智能体落地指南,剖析架构与降低延迟方案

Anthropic 官方博客总结了 Shopify、Priceline 等零售与电商客户基于 Claude 构建购物智能体的工程实践。报告披露了多轮搜索、对比决策与下单链路的系统架构设计,并提供了针对高并发电商场景降低响应延迟与控制 Token 成本的评估调优方案。

4. Amazon Bedrock 澳大利亚区域支持跨区域推理访问 OpenAI GPT-5.6 系列模型

亚马逊云科技宣布,澳大利亚悉尼和墨尔本区域的开发者现可通过 Amazon Bedrock 的全局跨区域推理功能,直接调用 OpenAI GPT-5.6 Sol、Terra 和 Luna 模型。官方同时提供了 Prompt 缓存配置、基于 OpenID Connect 的 Codex 认证以及 Amazon CloudWatch 监控接入方案。

5. 腾讯 WorkBuddy 开放平台正式上线,打通硬件、行业应用与开发者生态

腾讯宣布 WorkBuddy 开放平台正式上线,面向智能硬件、行业应用与开发者开放统一的 Agent 底座能力。首批接入了包括影石、Rokid、科大讯飞等 8 家硬件厂商的 9 款联名设备,覆盖眼镜、耳机等多种形态,并同步接入金融、法律、医疗等 30 余个行业应用,实现跨终端上下文与任务记忆的无缝同步。

6. Anthropic 更新 Claude 生产环境系统提示词,严格限制输出歌词与版权文本

Anthropic 调整了 Claude 消费者端应用的系统提示词索引架构,并在最新版提示词中新增了严格的版权防范条款。指令明确要求 Claude 不得以任何形式(包括部分片段、旋律简谱或用户逐行输入诱导)复现受版权保护的歌词、诗歌及图书文章段落,进一步强化大模型版权合规边界。

研究论文

1. 蚂蚁集团大模型语料清洗宽表系统荣获 VLDB 工业最佳论文

蚂蚁集团在 VLDB 会议上发表基于逻辑宽表的大模型数据清洗系统成果并获工业最佳论文奖。该系统将 Web、代码、PDF 等生产语料划分为 4 张领域逻辑宽表,统一管理超过 35PB、3050 亿条记录,通过逻辑列与底层多物理表解耦的架构设计,将多特征语料管理与清洗流水线效率提升了 5.6 倍。

2. arXiv 论文:仅基于最终结果的 LLM 评估器会漏判 55% 的智能体隐性过程错误

研究论文《trajectory-judge》指出,生产环境中仅根据最终回复评判智能体表现的评估机制存在严重盲区。在精准注入单步故障的 400 条轨迹测试中,仅看结果的裁判模型能捕获 84% 的显性故障,但对过程错误但最终表面看似正常的隐性故障漏判率达 55%,且对正确轨迹产生 33% 误报;而基于分步评分规则的裁判模型能在零误报下达到 77% 的隐性故障召回率。

3. arXiv 论文 HyperWorld:超图状态序列化显著提升文本世界模型分布外规划性能

论文提出 HyperWorld 框架,系统探究了状态描述的序列化结构对文本世界模型的影响。实验表明,相比自然语言文本或二元三元组,以实体为中心的超边(Hyperedge)序列化能够为 0.5B-1.5B 的小规模模型带来显著的分布外泛化提升,并在下游贪心规划任务中取得了最高的执行成功率。

4. arXiv 论文验证大模型长程状态跟踪能力:196 步连续工具调用成功实现 MD5 运算

研究团队设计了无捷径可走的基准测试,要求大模型在 64 轮对话中通过 196 次相互依赖的工具调用逐步计算 MD5 哈希,并在上下文持续传递 32 位状态字。实验表明,单 Token 仅约 5.5B 激活参数的混合专家开源模型 gpt-oss-120b 在多数测试中成功保持了完整状态并输出正确哈希值,证实了小激活模型在严苛连续工具链中的状态跟踪潜力。

5. arXiv 论文提出 OpenAgentFlow:基于动作提交边界的异构多智能体安全治理框架

论文针对多智能体协同运行中的安全控制碎片化问题,提出了 OpenAgentFlow 架构。该框架在系统动作提交边界设立策略执行点,将 GUI、API 及工具调用统一抽象为标准化事件流进行前置拦截与审计,在 Android 平台 300 项基准测试中实现了 94% 的判定准确率与 95.3% 的攻击拦截率。

6. arXiv 论文:基于真实行为提取的用户画像显著改善个性化对齐与推理

ServiceNow 团队提出行为基础画像提取框架,直接从真实匿名社交行为数据中提取高保真用户画像,替代传统的刻板合成 Persona。实验表明,该方法在微调对齐与测试期多视角推理任务中均显著优于合成数据基线,为开发个性化大模型系统提供了更高质量的数据范式。

开源工具

1. 开源中国发布 Go 语言终端 AI 编程工具 MothX

开源中国在 Gitee 正式开源终端 AI 编码工具 MothX(原名 VibeCoding)。该项目采用约一万行 Go 代码实现,编译为单一二进制文件装完即用,核心优化了终端与大模型交互时的上下文调度与计费开销,主打更低使用成本的本地终端编码辅助体验。

行业动态

1. Palo Alto Networks 斥资 5 亿美元收购 IT 智能体初创公司 Console

网络安全巨头 Palo Alto Networks 宣布以 5 亿美元现金和股票收购成立两年的初创公司 Console。Console 专注于利用 AI 智能体自动化处理 IT 服务台与运维日常任务,此前曾获得 Thrive Capital 和 DST Global 的 2900 万美元投资。此项收购反映了传统网安巨头通过整合自主智能体技术加速 IT 与安全运维自动化的趋势。

安全报告显示,多款常见信息窃取木马(如 Vidar、LummaC2 等)正通过盗取用户本机的 Claude 会话 Cookie 进行重放攻击,无需触发登录页面的双因素认证(2FA)。由于受影响的多为企业 IT 难以直接集中监管的个人自费账号,攻击者可直接调用已有权限并消耗账户额度。Anthropic 已向受影响用户发出通告并强制重置登录凭据与退款。

3. AI 客服智能体初创 Wonderful 估值翻倍至 50 亿美元,Salesforce 首次参投

成立于 2025 年初的 AI 智能体平台 Wonderful 宣布完成新一轮融资,估值在不到半年内翻倍至 50 亿美元。本轮融资由 Insight Partners 领投,Salesforce 作为新投资方首次入局。公司主打面向非英语市场的多语言客服智能体,并通过工程团队现场部署模式已在超过 35 个国家落地。

4. 字节跳动 Seed 基础模型团队深度调整,集中预训练数据与强化学习条线

字节跳动大模型团队 Seed 进行一级架构调整,设立 Pretrain Data、Horizon RL、Product Posttrain-Work 与 Product Posttrain-Chat 四个一级部门。本轮调整将原先分散在文本、代码、视觉等多模态方向的预训练数据与强化学习团队统一归拢,旨在减少内部重叠并提升超大模型智能上限与办公、对话场景的落地效率。

5. AI 自动化代码审计引发漏洞报告潮,Linux 内核维护者加速清理陈旧驱动

Linux 稳定版内核维护者数据显示,Linux 7.x 系列各版本修复的 CVE 数量迅速攀升,预计 7.3 版本将超过 2000 个。这一激增主要由 AI 辅助代码扫描工具产生的大量低危 bug 报告所驱动;为减轻维护与排查负担,内核团队在 Linux 7.3 中开始直接移除久未使用的旧版驱动代码以降低维护成本。

政策观点

1. 美国司法部正式支持 OpenAI:大型语言模型训练复制作品属于合理使用

在《纽约时报》等多家出版机构与作者对 OpenAI 提起的版权侵权诉讼中,美国司法部向纽约联邦法院提交立场声明,明确支持 OpenAI 提出的"合理使用"抗辩。司法部指出,鼓励并维持美国在人工智能领域的全球领导地位是国家政策,敦促法官裁定为训练模型而复制受版权保护的内容不违反版权法。该表态为全美生成式 AI 训练数据的版权合规争议带来了风向标式的政府定调。

2. 纽约市宣布新规:公立学校八年级及以下学生禁止在课堂使用 AI

纽约市市长宣布一项为期一年的试点政策,在 2026-2027 学年期间禁止公立学校学前至八年级(涵盖约 60 万名学生)在课堂环境中使用 AI 工具。该政策旨在配合学校对数字设备的管控措施,规范未成年人基础阶段的学习习惯与认知发展。

3. 特朗普公开支持 AI 数据中心建设,警告抵制阻碍将削弱国家科技竞争力

美国总统特朗普在社交媒体公开发文反对美国本土对 AI 数据中心建设的抵制情绪,称拒绝建设数据中心将导致当地发展落后。他强调,任何延缓美国算力基础设施建设的阻碍都会直接让国际竞争对手在人工智能竞赛中占据优势。

4. 美国商务部长称数据中心"不消耗水资源"引发公众与环保争议

美国商务部长在公开采访中声称数据中心"根本不用水",并称耗水质疑是外界阻碍美国算力发展的言论。该表态与当前大规模数据中心高耗水冷却引发的选址地环保担忧形成鲜明对比,在业内引发广泛讨论。


本文由 AI225 AI 日报 自动聚合整理,共收录 27 条 AI 领域动态。内容基于公开信息进行 AI 摘要与归纳,可能存在疏漏或偏差,仅供参考。完整内容及相关来源请访问:

https://daily.ai225.com/daily/2026-09-03

相关推荐
AI 思录1 小时前
“人眼看着正常,AI执行却出事“:Prompt事故档案(一)
人工智能·安全·prompt·用户体验·ai伦理
Rauser Mack1 小时前
从交互困境到语音闭环:桌面AI全语音数字秘书架构解析
人工智能·架构·交互
智购科技无人售货机工厂1 小时前
2026自动售货机云端API设计规范:从RESTful到GraphQL的接口演进~YH
android·人工智能·驱动开发·单片机·云原生·pandas·设计规范
安托智造1 小时前
2026高端装备行业数智化交流会回顾:工业AI、虚拟孪生与3DE正向研发闭环如何落地
人工智能·plm·工业ai·3dexperience平台
doitnow20001 小时前
淘宝开店教程收费前要确认哪些项目?
大数据·人工智能
克里斯蒂亚诺更新1 小时前
图像识别的两种解决方案——使用深度学习
人工智能·深度学习
龙亘川1 小时前
免费开源丨统一决策分析系统 综合态势功能的实现机理与技术难度
人工智能·信息可视化·开源·智慧城市·#后台开发
TaoMetrix2 小时前
Microduck 爆火之后:TaoMetrix 如何帮助品牌抓住 AI 陪伴机器人新机会
人工智能·机器人
来让爷抱一个3 小时前
2026 结构化输出:把Schema写进SPEC,MonkeyCode 云端跑通
人工智能·机器学习