Qwen 4首测泄露!DeepSeek V4 mini展示名为flash?蚂蚁Ling-3.1-flash同步炸场 | 10月1日 AI日报

🎬 视频版直达 :https://www.bilibili.com/video/av117363823352549/

💡 今日趋势速览:阿里Qwen 4未发布即传出惊艳测试输出,早期使用者称可竞争Opus 5.5,DeepSeek V4 Mini测试代码流出疑似更名V4 Flash并配百万上下文,蚂蚁百灵发布Ling-3.1-flash以560B参数激活仅25B并计划开源,国产模型正集体冲刺下一代旗舰。

🎯 今日要点

  1. 早期测试者称 Qwen 4 首批输出可与 Opus 5.5 竞争
  2. DeepSeek V4 Mini 测试代码流出,展示名疑为 V4 Flash
  3. OpenAI DevDay 2026 一次发布 20 多项更新

📋 今日内容汇总

🤖 AI动态

  1. 早期测试者称 Qwen 4 首批输出可与 Opus 5.5 竞争
  2. DeepSeek V4 Mini 测试代码流出,展示名疑为 V4 Flash
  3. OpenAI DevDay 2026 一次发布 20 多项更新
  4. 蚂蚁百灵发布 Ling-3.1-flash,560B 参数激活仅 25B
  5. DeepSeek 开源面向华为昇腾的整套基础设施组件
  6. Kimi K3 接入 Codex 企业通道,进入 OpenAI 结算体系
  7. OpenAI 发布 Decisions API,150 毫秒返回选择题结果
  8. OpenAI 披露并挫败一起协同模型蒸馏攻击行动
  9. OpenAI 统一 Sign in with ChatGPT,开放订阅额度
  10. BAAI 开源长时程智能体模型 AREX-2,参数量 27B
  11. SGLang 新增原生决策 API,现成模型免微调打分
  12. Fermion 开源语音识别模型 Phonon-2,仅 164MB
  13. IndexTeam 发布 Index-Translate 翻译模型家族
  14. Mercury Decide 上线 OpenRouter,早期访问免费

🦾 机器人具身智能

  1. 智元称上半年人形机器人出货超 8600 台居全球第一

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. 早期测试者称 Qwen 4 首批输出可与 Opus 5.5 竞争

Qwen 4 尚未正式发布,早期接触者已放出首批输出结果,并称测试版表现堪称惊艳:前端生成能力看起来强大得离谱,就目前所见已能在 Opus 5.5 与 Astra 级别上竞争,这个模型可能比预期更严肃。以上为个人观感,最终以官方发布为准。

🔗 https://x.com/Mr_Salio/status/2105238432712659275


2. DeepSeek V4 Mini 测试代码流出,展示名疑为 V4 Flash

DeepSeek Harness 仓库流出的测试代码露出小型模型 V4 Mini 的关键信息:模型 ID 为 deepseek-v4-mini,展示名却写作 DeepSeek-V4-Flash,上下文写死为 1,000,000,同列表还出现 deepseek-v4-pro,描述为 Preserved hidden detail。据此推测 DeepSeek 或将发布 V4 系列新模型,官方尚未正式公布。

🔗 https://x.com/NFT_Chen/status/2105177645990199369


3. OpenAI DevDay 2026 一次发布 20 多项更新

来源:原文 | 小互 AI 资讯 (Twitter)

本届 DevDay 集中发布 20 多项内容:Dots 是 ChatGPT 中的常驻智能体,配专属云电脑和浏览器,可连接 4000 多个应用,由 GPT-6 Astra 驱动;GPT-6.1 Sol 性能接近 Astra,价格约为其五分之一;Ultrafast 档位在 Codex 中最高提速 8 倍、API 中最高 6 倍,已在高级方案上线。以下是官方给出的 demo

🔗 https://x.com/Priyannkaaaa/status/2105188394099941480


4. 蚂蚁百灵发布 Ling-3.1-flash,560B 参数激活仅 25B

来源:原文 | AntLingAGI

蚂蚁百灵发布Ling-3.1-flash,总参数量约560B,每token激活参数约25B,上下文长度最高100万token,计划很快开源。评测方面,该模型在工作、编程与医疗领域表现出色:GDPVal-AA v2.1达1673 Elo,FrontierSWE达75.16,HealthBench Professional达65.35。

🔗 https://x.com/AntLingAGI/status/2105335205741596911


5. DeepSeek 开源面向华为昇腾的整套基础设施组件

来源:原文 | TechMeme (Twitter)

DeepSeek开源一套专为华为昇腾定制的完整基础设施组件。这套清单包括TileLang、DeepGEMM、DeepEP等六个组件,与英伟达版本基本一一对应。其中DeepGEMM昇腾版完全兼容原版API,支持BF16、FP8等算子。此外华为团队深度参与,双方推进基于昇腾950的128卡超节点方案,相关GitHub仓库已全部开放。

🔗 https://x.com/MaxForAI/status/2105128392379322752


6. Kimi K3 接入 Codex 企业通道,进入 OpenAI 结算体系

来源:原文 | 华尔街见闻快讯

美国 AI 基础设施公司 Baseten 宣布与 OpenAI 达成合作,成为 OpenAI B2B 市场首批开源模型推理服务提供商之一。企业用户此后可通过 Codex 使用 Kimi K3 与 GLM 5.3 等开源模型,这意味着中国开源模型首次进入 OpenAI 企业采购与付费结算体系。其中 Kimi K3 由月之暗面开发。

🔗 https://www.ithome.com/1/008/864.htm


7. OpenAI 发布 Decisions API,150 毫秒返回选择题结果

来源:原文 | 思维怪怪 (Tech) (Twitter)

OpenAI在DevDay开发者大会发布Decisions API:开发者写好问题与备选答案发送过去。它采用GPT-6家族最小的Luna模型,现限部分客户预览,几天内全面放开。得益于单次判断仅需150毫秒,客服工单分派、内容审核、智能体决定调用哪个工具等场景都可即时返回结果。以下是官方给出的 demo

🔗 https://x.com/dotey/status/2105065658149208338


8. OpenAI 披露并挫败一起协同模型蒸馏攻击行动

来源:原文 | LinuxDo 前沿快讯

OpenAI发布官方博客,披露并挫败一起有组织的模型蒸馏攻击,相关集群涉及超1.5万用户。攻击活动最早出现于7月第一周,攻击者试图系统性提取受保护的模型推理过程。对此,OpenAI已部署缓解措施,并正加强对对抗性蒸馏的防御,避免推理内容被批量窃取。

🔗 https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign


9. OpenAI 统一 Sign in with ChatGPT,开放订阅额度

OpenAI 将第三方调用 ChatGPT 订阅额度的能力统一为"使用 ChatGPT 登录",并开始向更多商业产品开放,OpenCode、Pi 等工具此前已可使用。由此,用户可在超过16个合作伙伴产品中直接使用订阅额度,首批以编码智能体为主,包括 Devin、Warp、Kilo Code、Notion 等。

🔗 https://x.com/0xLogicrw/status/2105105182023684583


10. BAAI 开源长时程智能体模型 AREX-2,参数量 27B

BAAI 开源长时程智能体模型 AREX-2,采用 Apache 2.0 许可,基于 Qwen3.8 27B 构建。该模型还具备从执行反馈中学习的能力,在 BrowseComp、GAIA、HLE 三项基准中超越多个开源与闭源模型。其中 MLE 得分 81.8,领先 GPT-5.6 Sol 等闭源模型,适合跨多步骤持续执行的智能体任务。

🔗 https://x.com/AdinaYakup/status/2105259820190482834


11. SGLang 新增原生决策 API,现成模型免微调打分

SGLang新增原生决策API,Qwen3.8-27B这类现成模型不改权重、不重新微调。其原理是读取大模型的下一个token概率,开发者给出候选答案,模型直接返回各选项概率。演示中,Qwen3.8-27B根据实时游戏状态决策,每次不到100毫秒,击败了宝可梦火红的四大天和冠军。

🔗 https://x.com/0xLogicrw/status/2105243705972297970


12. Fermion 开源语音识别模型 Phonon-2,仅 164MB

Fermion 开源语音识别模型 Phonon-2,体积仅 164MB。普通轻薄笔记本转写 1 小时音频约 20 秒,模型采用极低位宽权重压缩。基准对比中,Phonon-2 词错率 5.21,优于体积更大的 Whisper large-v3-turbo 等主流模型。这意味着个人电脑无需高端显卡即可本地流畅运行,目前仅支持英文。

🔗 https://x.com/Gorden_Sun/status/2105291537555083564


13. IndexTeam 发布 Index-Translate 翻译模型家族

IndexTeam 发布 Index-Translate,一个覆盖文本、语音、配音和长文档的多语言翻译模型家族,支持 150 种语言。其中 Index-Translate-9B 在 FLORES 上得分 0.8789,instTrans 上得分 0.8209,MEME 上得分 0.7387,展现出通用翻译、指令遵循和文化语境理解能力。以下是官方给出的 demo

🔗 https://x.com/ModelScope2022/status/2105267464531750975


14. Mercury Decide 上线 OpenRouter,早期访问免费

Inception 的决策模型 Mercury Decide 已在 OpenRouter 上线,早期访问阶段免费。这是一个决策模型:发送应用状态和带类型的问题,即可获得附带概率的带类型答案。Inception 报告称,在 JevBench v1.4 评测上,它是 OpenRouter 上最智能的决策模型。

🔗 https://x.com/OpenRouter/status/2105374270243426760


🦾 机器人具身智能

15. 智元称上半年人形机器人出货超 8600 台居全球第一

来源:原文 | GoogleNews-人形机器人

智元机器人公布的数据显示,其人形机器人出货量已超过 8600 台,据 IDC 数据约占全球出货量的 35%,位居 2026 年上半年全球第一。公司称 AGIBOT 正在将具身 AI 带入日常运营,落地场景已从工厂车间扩展到主题公园和零售店,实现规模化制造并投入实际应用。

🔗 https://x.com/AGIBOTofficial/status/2105190332870590923


📌 模型排行榜

16. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜头部由Anthropic包揽:Claude Opus 5.5以58分登顶,Sonnet 5.5以56分居次席,Claude Fable 5.1与GPT-6 Astra、Gemini 4 Argon以53分并列第三。国产方面,MiMo-V2.6-Pro以46分位列第10,成功跻身前十。

🔗 https://artificialanalysis.ai/

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

相关推荐
Vex2une1 小时前
Windows 12 新功能展望:AI 深度融合、全新界面与下一代生产力体验
人工智能·windows·copilot·winui·新功能·ai pc
潘锦1 小时前
从 Pi 到 DSH:Agent Harness 如何从「可扩展」走向「自生长」
deepseek
知几蜗牛1 小时前
Python Responses API函数调用实战:工具白名单、参数校验与预算
人工智能
潘锦1 小时前
DeepSeek Harness 的 Cordis 插件架构
ai编程·deepseek
知几蜗牛1 小时前
Gemini 4 Argon的1M输出窗口与长程Agent工程边界
人工智能
猎头南楼1 小时前
空调/家电嵌入式软件架构设计与 AI 辅助开发实践
人工智能
知几蜗牛1 小时前
Java 17调用gpt-transcribe实现会议录音转写与术语提示
人工智能
海盗12341 小时前
AI 新闻日报 2026-10-02:Claude Code 开放 Mods、13 自由度直驱灵巧手同日双发、代码评审成新瓶颈
人工智能·机器人·aigc
nhdh1 小时前
模型三剑客:工具、函数调用与MCP协同之道
人工智能·springai·智能客服、知识库问答