今日主题:OpenAI 正式发布 GPT-6 Astra,英伟达斥资 129 亿美元收购 Hugging Face
本期概览:今日 AI 领域迎来多项重磅事件。OpenAI 正式推出下一代旗舰模型 GPT-6 Astra,主打屏幕视觉操作与全自主智能体能力,并在多项高阶基准与安全测试中刷新纪录;英伟达宣布以 129.3 亿美元全资收购开源平台 Hugging Face,承诺保持硬件中立与开源生态开放。此外,Anthropic 签署 350 亿美元算力大单,多家主流 AI 服务发生罕见重叠宕机,端侧算力与多智能体技术也迎来密集落地。
本期精选 24 条 · 国内 6 / 国际 18
模型发布
1. OpenAI 正式发布 GPT-6 Astra:主打电脑操控与自主智能体能力
OpenAI 正式推出新一代旗舰大模型 GPT-6 Astra,在 FrontierMath、ARC-AGI-3 和 ExploitBench 等前沿基准测试中刷新纪录。该模型摆脱传统 API 适配,支持直接通过屏幕像素与键鼠交互完成跨软件复杂工作流,标准版 API 定价为每百万输入 Token 10 美元、输出 50 美元。
2. Google DeepMind 发布全球气象大模型 WeatherNext 3
Google DeepMind 推出新一代旗舰气象预报模型 WeatherNext 3,引入实时卫星数据与小时级刷新能力,在降水预测和空间分辨率上实现突破。该模型已全面接入 Google 搜索、Gemini、Google 地图及云平台。
3. Meta 发布 Muse Spark 1.3:主打极低成本与智能体基准性能
Meta 推出了 Muse Spark 1.3 模型,在多项智能体评测基准上取得提升,单任务成本降至 0.55 美元,显著低于同等性能梯队的竞争对手。此外 Meta 还为愿意共享提示词与输出用于后续模型训练的用户提供约 95% 的大幅使用折扣。
4. 基座模型研究所开源 K2 Horizon 家族:包含 6 种尺寸全能模型
基座模型研究所(IFM)发布开源模型家族 K2 Horizon,涵盖 0.9B 到 375B 规模的 6 个版本。官方评测显示其 0.9B、3.7B 和 7B 小尺寸模型在数学、推理、代码和智能体任务中均达到同量级前沿水平。
算力硬件
1. AI 数据中心开发商 Crusoe 以 300 亿美元估值完成 3 billion 美元新一轮融资
为 Meta、微软和 OpenAI 等巨头提供算力基础设施的 Crusoe 完成 30 亿美元融资,投后估值达 300 亿美元。本轮融资由 Atreides Management 与 Valor Equity Partners 联合领投,阿布扎比穆巴达拉投资公司旗下基金参投。
2. Anthropic 与 Lambda 达成 350 亿美元算力合作,租赁得州 350 兆瓦数据中心
Anthropic 与由英伟达支持的云算力提供商 Lambda 签署了总额达 350 亿美元的算力租赁协议。该设施位于得克萨斯州纽埃西斯县,规划电力容量约为 350 兆瓦,旨在为 Claude 系列模型扩张提供长期算力支撑。
3. 英伟达与微软联合推进本地 AI 体验,推出 RTX Spark Windows PC
在柏林 IFA 2026 展会上,英伟达宣布联手微软及其生态伙伴优化本地硬件的智能体部署与推理加速体验。首批采用 RTX Spark 架构的紧凑型 Windows AI PC 将于 10 月正式面向开发者与创作者发售。
4. 地平线征程智驾芯片累计量产出货突破 1500 万片
地平线宣布其征程系列智驾芯片出货量跨越 1500 万片大关,定点车型数量超 500 款。公司 2026 年上半年财报显示授权与技术服务收入已达 11.29 亿元,占比达 55%,标志着其商业模式正从纯芯片出货向技术授权与软硬一体协同转型。
产品应用
1. OpenAI 启动 10 亿美元 Daybreak 防御计划,保护关键基础设施网络安全
OpenAI 宣布推出 Daybreak for Frontline Defenders 全球倡议,承诺提供价值 10 亿美元的补贴访问、培训和技术支持。该计划旨在帮助一线安全人员利用前沿 AI 防御能力抵御针对关键公共服务和基础设施的网络威胁。
2. Abliteration.ai 将模型安全护栏移除技术商业化,提供去限制 API 访问
初创公司 Abliteration.ai 将去除模型拒绝有害请求特性的 Abliteration 技术转化为商业服务平台。该平台向开发者提供移除安全护栏后的 GLM-5.3 等开源权重模型托管与 API 接口调用,引发了关于开源模型安全管控的讨论。
3. Google 为 Gmail、Docs 和 Keep 引入 Live 实时语音交互功能
Google 宣布向旗下 Gmail、Google Docs 和 Keep 应用推出基于 AI 的 Live 语音模式。用户可通过类似 Gemini Live 的双向实时语音对话方式直接管理邮件、听写文档或记录便签灵感。
4. 微软 Copilot Studio 上线人工审批功能,为 AI 智能体工具调用设置安全开关
微软宣布在 Copilot Studio 中引入人工审批机制,允许开发者针对特定工具配置调用前审批开关。在执行发送邮件、关闭工单或处理支付等高风险操作时,AI 智能体将暂停并等待用户确认意图后再继续执行。
5. 美团技术团队公开本地生活 AI 数字人直播系统架构与实践
美团技术团队披露了数字人直播方案"美团智播"的技术细节,结合大模型与多模态驱动支持 1:1 真人复刻与 30 秒素材生成。实测数据显示,该方案在过去一年支撑本地生活数字人直播月日均 GTV 同比增长 82.12%。
研究论文
1. IJCAI 2026 收录 S²-VLA:基于自适应动态门控解决具身长程操控累积误差
华东师范大学与上海交通大学团队提出 S²-VLA 架构,通过引入轻量循环网络维护信念状态并配合三路自适应注意力,动态调整视觉、意图与动作特征权重。该方案仅用 2B 参数便在 LIBERO-Long 长程任务上达到 96.4% 成功率,优于多个 7B 级别模型。
2. arXiv 论文提出 EvalDetectBench:评估前沿大模型的"评测自知"能力
研究人员构建了名为 EvalDetectBench 的开源评测基准,用于量化前沿 LLM 是否能识别出自己正在接受基准测试并调整行为模式。该基准通过逐模型探针校准和生成器对齐程序,消除了现有方法中因模型提示词偏差引起的系统性误差。
3. arXiv 论文提出 PRO-Step:基于步骤级过程奖励优化 RAG 多跳推理
针对检索增强生成(RAG)在多跳推理中因前期错误检索导致误差放大的问题,研究人员提出了 PRO-Step 框架。该方法结合生成式过程奖励模型(PRM)与步骤级 DPO 优化,同时监督逻辑合理性与检索证据锚定,在多个问答基准上刷新了匹配得分。
4. arXiv 论文探索多跳问答证据充分性边界,显著降低模型幻觉答题率
针对多跳问答中部分证据误导模型作答的现象,研究人员提出证据充分性边界训练(ESBT)框架。该方法在证据不足时直接引导模型拒答,在证据链充足时触发回答,使 Qwen2.5-3B-Instruct 在无答案验证集上的错误作答率显著降低至 9.5%。
5. arXiv 论文提出 Hydration Proxy 架构:解耦会话状态与无状态 LLM API
针对无状态大模型 API 在企业级长会话中强加给客户端的状态管理负担,研究人员提出了 Hydration Proxy Pattern。该架构将持久化会话与推理引擎分离,在保障数据主权的同时优化了 KV 缓存命中与多阶段语义关联效率。
开源工具
1. Hugging Face 发布实践指南:百步 GRPO 微调大幅提升小模型结构化输出
Hugging Face 博客公布了一套低成本训练方案,仅使用 TRL 库和 100 步 GRPO(群组相对策略优化)即可在约 500 个样本上完成微调。实验证明该方法可使 350M 小模型在 IFStruct 结构化输出基准上的合规得分从 22.6% 提升至 29.7%。
2. 英伟达推出开源工具 PAIR:将闲置电脑串联为个人 AI 数据中心
英伟达发布了名为 Personal AI Router(PAIR)的开源软件工具,支持用户将局域网内的闲置电脑算力组合协同。该工具可与 Ollama、LM Studio 等本地推理生态对接,简化家庭与边缘端的模型协同部署。
行业动态
1. 英伟达宣布以 129.3 亿美元收购开源 AI 平台 Hugging Face
英伟达宣布已同意以约 129.3 亿美元全资收购全球最大开源 AI 社区 Hugging Face。黄仁勋表示收购后 Hugging Face 仍将作为独立开放平台运行,继续支持多加速器与多云环境,旨在借助英伟达基础设施扩大开放 AI 生态的规模。
2. ChatGPT、Claude、Grok 与 Gemini 发生罕见重叠服务故障
包括 OpenAI、Anthropic、xAI 与 Google 在内的多家头部 AI 云服务在周四上午出现大面积同时段访问异常与错误率飙升。尽管各家服务在数小时内陆续恢复,但外界推测故障可能与底层共享的算力或第三方服务商波动有关。
3. Mira Murati 创立的 Thinking Machines Lab 寻求以 400 亿美元估值融资 10 亿美元
由前 OpenAI CTO 米拉·穆拉蒂创办的 Thinking Machines Lab 正在洽谈至少 10 亿美元的新一轮融资,估值不低于 400 亿美元。现有投资方 Accel 计划领投,英伟达亦在洽谈参与本轮投资。
政策观点
1. Sam Altman 警告全球 AI 数据中心建设存在非理性扩张风险
OpenAI CEO 萨姆·奥尔特曼公开警告称当前全球新型云厂商的数据中心军备竞赛中存在"不可持续的愚蠢"现象,许多项目在缺乏充足客户订单的情况下盲目开工。他同时指出算力成本的快速下降可能导致当前的巨额基建投资面临贬值风险。
本文由 AI225 AI 日报 自动聚合整理,共收录 24 条 AI 领域动态。内容基于公开信息进行 AI 摘要与归纳,可能存在疏漏或偏差,仅供参考。完整内容及相关来源请访问: