🎬 视频版直达 :https://www.bilibili.com/video/av117363823352549/
💡 今日趋势速览:阿里Qwen 4未发布即传出惊艳测试输出,早期使用者称可竞争Opus 5.5,DeepSeek V4 Mini测试代码流出疑似更名V4 Flash并配百万上下文,蚂蚁百灵发布Ling-3.1-flash以560B参数激活仅25B并计划开源,国产模型正集体冲刺下一代旗舰。
🎯 今日要点
- 早期测试者称 Qwen 4 首批输出可与 Opus 5.5 竞争
- DeepSeek V4 Mini 测试代码流出,展示名疑为 V4 Flash
- OpenAI DevDay 2026 一次发布 20 多项更新
📋 今日内容汇总
🤖 AI动态
- 早期测试者称 Qwen 4 首批输出可与 Opus 5.5 竞争
- DeepSeek V4 Mini 测试代码流出,展示名疑为 V4 Flash
- OpenAI DevDay 2026 一次发布 20 多项更新
- 蚂蚁百灵发布 Ling-3.1-flash,560B 参数激活仅 25B
- DeepSeek 开源面向华为昇腾的整套基础设施组件
- Kimi K3 接入 Codex 企业通道,进入 OpenAI 结算体系
- OpenAI 发布 Decisions API,150 毫秒返回选择题结果
- OpenAI 披露并挫败一起协同模型蒸馏攻击行动
- OpenAI 统一 Sign in with ChatGPT,开放订阅额度
- BAAI 开源长时程智能体模型 AREX-2,参数量 27B
- SGLang 新增原生决策 API,现成模型免微调打分
- Fermion 开源语音识别模型 Phonon-2,仅 164MB
- IndexTeam 发布 Index-Translate 翻译模型家族
- Mercury Decide 上线 OpenRouter,早期访问免费
🦾 机器人具身智能
📌 模型排行榜
🤖 AI动态
1. 早期测试者称 Qwen 4 首批输出可与 Opus 5.5 竞争
Qwen 4 尚未正式发布,早期接触者已放出首批输出结果,并称测试版表现堪称惊艳:前端生成能力看起来强大得离谱,就目前所见已能在 Opus 5.5 与 Astra 级别上竞争,这个模型可能比预期更严肃。以上为个人观感,最终以官方发布为准。

2. DeepSeek V4 Mini 测试代码流出,展示名疑为 V4 Flash
DeepSeek Harness 仓库流出的测试代码露出小型模型 V4 Mini 的关键信息:模型 ID 为 deepseek-v4-mini,展示名却写作 DeepSeek-V4-Flash,上下文写死为 1,000,000,同列表还出现 deepseek-v4-pro,描述为 Preserved hidden detail。据此推测 DeepSeek 或将发布 V4 系列新模型,官方尚未正式公布。


3. OpenAI DevDay 2026 一次发布 20 多项更新
来源:原文 | 小互 AI 资讯 (Twitter)
本届 DevDay 集中发布 20 多项内容:Dots 是 ChatGPT 中的常驻智能体,配专属云电脑和浏览器,可连接 4000 多个应用,由 GPT-6 Astra 驱动;GPT-6.1 Sol 性能接近 Astra,价格约为其五分之一;Ultrafast 档位在 Codex 中最高提速 8 倍、API 中最高 6 倍,已在高级方案上线。以下是官方给出的 demo

4. 蚂蚁百灵发布 Ling-3.1-flash,560B 参数激活仅 25B
来源:原文 | AntLingAGI
蚂蚁百灵发布Ling-3.1-flash,总参数量约560B,每token激活参数约25B,上下文长度最高100万token,计划很快开源。评测方面,该模型在工作、编程与医疗领域表现出色:GDPVal-AA v2.1达1673 Elo,FrontierSWE达75.16,HealthBench Professional达65.35。


来源:原文 | TechMeme (Twitter)
DeepSeek开源一套专为华为昇腾定制的完整基础设施组件。这套清单包括TileLang、DeepGEMM、DeepEP等六个组件,与英伟达版本基本一一对应。其中DeepGEMM昇腾版完全兼容原版API,支持BF16、FP8等算子。此外华为团队深度参与,双方推进基于昇腾950的128卡超节点方案,相关GitHub仓库已全部开放。




6. Kimi K3 接入 Codex 企业通道,进入 OpenAI 结算体系
美国 AI 基础设施公司 Baseten 宣布与 OpenAI 达成合作,成为 OpenAI B2B 市场首批开源模型推理服务提供商之一。企业用户此后可通过 Codex 使用 Kimi K3 与 GLM 5.3 等开源模型,这意味着中国开源模型首次进入 OpenAI 企业采购与付费结算体系。其中 Kimi K3 由月之暗面开发。

7. OpenAI 发布 Decisions API,150 毫秒返回选择题结果
来源:原文 | 思维怪怪 (Tech) (Twitter)
OpenAI在DevDay开发者大会发布Decisions API:开发者写好问题与备选答案发送过去。它采用GPT-6家族最小的Luna模型,现限部分客户预览,几天内全面放开。得益于单次判断仅需150毫秒,客服工单分派、内容审核、智能体决定调用哪个工具等场景都可即时返回结果。以下是官方给出的 demo


来源:原文 | LinuxDo 前沿快讯
OpenAI发布官方博客,披露并挫败一起有组织的模型蒸馏攻击,相关集群涉及超1.5万用户。攻击活动最早出现于7月第一周,攻击者试图系统性提取受保护的模型推理过程。对此,OpenAI已部署缓解措施,并正加强对对抗性蒸馏的防御,避免推理内容被批量窃取。


🔗 https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign
9. OpenAI 统一 Sign in with ChatGPT,开放订阅额度
OpenAI 将第三方调用 ChatGPT 订阅额度的能力统一为"使用 ChatGPT 登录",并开始向更多商业产品开放,OpenCode、Pi 等工具此前已可使用。由此,用户可在超过16个合作伙伴产品中直接使用订阅额度,首批以编码智能体为主,包括 Devin、Warp、Kilo Code、Notion 等。


10. BAAI 开源长时程智能体模型 AREX-2,参数量 27B
BAAI 开源长时程智能体模型 AREX-2,采用 Apache 2.0 许可,基于 Qwen3.8 27B 构建。该模型还具备从执行反馈中学习的能力,在 BrowseComp、GAIA、HLE 三项基准中超越多个开源与闭源模型。其中 MLE 得分 81.8,领先 GPT-5.6 Sol 等闭源模型,适合跨多步骤持续执行的智能体任务。


11. SGLang 新增原生决策 API,现成模型免微调打分
SGLang新增原生决策API,Qwen3.8-27B这类现成模型不改权重、不重新微调。其原理是读取大模型的下一个token概率,开发者给出候选答案,模型直接返回各选项概率。演示中,Qwen3.8-27B根据实时游戏状态决策,每次不到100毫秒,击败了宝可梦火红的四大天和冠军。


12. Fermion 开源语音识别模型 Phonon-2,仅 164MB
Fermion 开源语音识别模型 Phonon-2,体积仅 164MB。普通轻薄笔记本转写 1 小时音频约 20 秒,模型采用极低位宽权重压缩。基准对比中,Phonon-2 词错率 5.21,优于体积更大的 Whisper large-v3-turbo 等主流模型。这意味着个人电脑无需高端显卡即可本地流畅运行,目前仅支持英文。


13. IndexTeam 发布 Index-Translate 翻译模型家族
IndexTeam 发布 Index-Translate,一个覆盖文本、语音、配音和长文档的多语言翻译模型家族,支持 150 种语言。其中 Index-Translate-9B 在 FLORES 上得分 0.8789,instTrans 上得分 0.8209,MEME 上得分 0.7387,展现出通用翻译、指令遵循和文化语境理解能力。以下是官方给出的 demo

14. Mercury Decide 上线 OpenRouter,早期访问免费
Inception 的决策模型 Mercury Decide 已在 OpenRouter 上线,早期访问阶段免费。这是一个决策模型:发送应用状态和带类型的问题,即可获得附带概率的带类型答案。Inception 报告称,在 JevBench v1.4 评测上,它是 OpenRouter 上最智能的决策模型。

🦾 机器人具身智能
15. 智元称上半年人形机器人出货超 8600 台居全球第一
来源:原文 | GoogleNews-人形机器人
智元机器人公布的数据显示,其人形机器人出货量已超过 8600 台,据 IDC 数据约占全球出货量的 35%,位居 2026 年上半年全球第一。公司称 AGIBOT 正在将具身 AI 带入日常运营,落地场景已从工厂车间扩展到主题公园和零售店,实现规模化制造并投入实际应用。

📌 模型排行榜
16. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜头部由Anthropic包揽:Claude Opus 5.5以58分登顶,Sonnet 5.5以56分居次席,Claude Fable 5.1与GPT-6 Astra、Gemini 4 Argon以53分并列第三。国产方面,MiMo-V2.6-Pro以46分位列第10,成功跻身前十。

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。