🎬 视频版直达 :https://www.bilibili.com/video/av117413970450404/
💡 今日趋势速览:谷歌Gemini 4系列同日密集曝光,Gemini-4-Flash现身谷歌分词器代码仓库,Gemini Argon藏身Antigravity 2.0并提供最高900K上下文窗口,内部测试的代号Carbon模型被员工评价编程媲美Opus 5.5,AI Studio还惊现开发中的Ultra模式,谷歌或正憋大招重回竞争一线。
🎯 今日要点
- Gemini-4-Flash 被发现在谷歌分词器代码仓库中
- Gemini Argon 现身 Antigravity 2.0 Insiders
- 谷歌被曝在 Jetski 中测试代号 Carbon 的 Gemini 4 模型
📋 今日内容汇总
🤖 AI动态
- Gemini-4-Flash 被发现在谷歌分词器代码仓库中
- Gemini Argon 现身 Antigravity 2.0 Insiders
- 谷歌被曝在 Jetski 中测试代号 Carbon 的 Gemini 4 模型
- Google AI Studio 惊现开发中的全新 Ultra 模式
- Qwen 发布 Qwen-Image-2.1-Turbo,8 步去噪出图
- 微软发布 Microsoft-Decision-1 快速决策模型
- Claude Managed Agents 动态工作流开放公测
- TRL v1.15 发布,融合 LM head 默认开启
- Claude Code Projects 向全部 Pro 和 Max 用户开放
- 渗透测试工具 ARTEX 被用于攻击韩国银行后闭源
- 腾讯发布 5B 全模态解析模型,统一输出 JSON
- 开源桌面应用 ATOMIC 支持本地运行 Qwen 等模型
- Speridlabs 开源 Iris-3B:跳过 VAE 直接生成像素
- Codex Windows 版新增沙盒模式,基于微软 MXC
- Claude Design 将并入 Claude 网页版 Artifacts
- 豆包工作上线画布功能,接入 Seedream5.0Flash
- Decision 2.0 发布:六款开放决策模型,尺寸从 0.6B 到 27B
🦾 机器人具身智能
📌 模型排行榜
🤖 AI动态
1. Gemini-4-Flash 被发现在谷歌分词器代码仓库中
Gemini-4-Flash被发现在谷歌分词器代码仓库中。网友Qwinin据此推测,整个4.0系列可能会同时发布。这或许也解释了谷歌为何迟迟未推出Gemini-4-Argon。

2. Gemini Argon 现身 Antigravity 2.0 Insiders
有用户在Antigravity 2.0 Insiders版本中发现Gemini Argon的踪迹,官方尚未正式发布,也未确认相关消息。代码显示新分支仅为Argon生效,提供256K、512K、900K三档上下文窗口。此外文件体积新增约14.7万字节、新增263行,Argon字符串命中1处,并新增ChatModelMetadata消息,发布时间不明。



3. 谷歌被曝在 Jetski 中测试代号 Carbon 的 Gemini 4 模型
据 Business Insider 报道,谷歌已在 Jetski 中测试另一款名为 Carbon 的 Gemini 4 模型,一名员工称其在编程方面"感觉像 Opus 5.5"。Argon 尚未发布,谷歌内部已有更好的检查点,有观点认为这显示谷歌正克服内部障碍、重新具备竞争力。

4. Google AI Studio 惊现开发中的全新 Ultra 模式
开发中的全新Ultra模式现身Google AI Studio Build,有博主在测试中率先发现了这一入口。从界面看,该模式描述为以进阶技能与工具进行构建,与Plan、Build及安全审查模式并列显示,目前没有迹象表明需要Ultra订阅,新模式或为配合Gemini 4而来。


5. Qwen 发布 Qwen-Image-2.1-Turbo,8 步去噪出图
来源:原文 | ModelScope2022
阿里 Qwen 团队发布 Qwen-Image-2.1-Turbo,开放权重已上线。模型基于 Qwen-Image-2.1 的同一 7B 视觉生成架构,仅需 8 个去噪步骤即可生成与编辑图像,仍可从文本生成 2K 图像,支持自然语言持续编辑,可经 Diffusers 上手。

6. 微软发布 Microsoft-Decision-1 快速决策模型
来源:原文 | satyanadella
微软推出面向快速决策的新模型 Microsoft-Decision-1,已在 Microsoft Foundry 上线。官方称其在结构化决策任务上表现顶尖,延迟与输出质量均优于其他大语言模型和决策模型,并已在微软内部的事故响应、质量控制与科学发现等场景测试。以下是官方给出的 demo

7. Claude Managed Agents 动态工作流开放公测
来源:原文 | TestingCatalog (Twitter)
Anthropic 将 Claude Managed Agents 的动态工作流扩展为公开测试,提供新型多智能体编排:由一个主智能体编写计划并调度多智能体执行,面向最复杂的工作负载,用户可为不同任务配置自己的智能体组合。以下是官方给出的 demo

8. TRL v1.15 发布,融合 LM head 默认开启
TRL v1.15 发布,是其迄今最大的一次性能优化:融合 LM head 默认开启,峰值显存占用最多降低 82%,支持的序列长度延长 7 倍,DPO 单次可处理 token 从 1 万提升至 5.9 万,GRPO 从 2.9 万提升至 11.5 万。

9. Claude Code Projects 向全部 Pro 和 Max 用户开放
来源:原文 | Claude Devs (Twitter)
Claude Code Projects 的等候名单已向全部 Pro 和 Max 用户放行,官方同时为新用户准备了 4 分钟上手演示。该功能仍处于测试阶段,后续会随容量继续放更多用户进入。以下是官方给出的 demo

开源渗透测试工具ARTEX被用于攻击韩国银行,开发者Autumn-27于10月8日宣布闭源停更,GitHub仓库已下架。此次事件源于CrowdStrike调查发现,攻击者用ARTEX连接大模型自动执行渗透测试。开发者声明称与攻击无关,谴责非法使用。但原代码已被备份,v0.3.15仍可被获取使用。



腾讯在 Hugging Face 上发布一款 5B 参数的全模态解析模型,用一个模型即可将文档、图像、图表、几何图形、音频和视频统一转换为单一的结构化 JSON 输出。

12. 开源桌面应用 ATOMIC 支持本地运行 Qwen 等模型
来源:原文 | atomicagent_io
开源桌面应用 Atomic Agent Desktop 登陆 macOS、Windows 和 Linux,可在本地运行 Qwen、Gemma 等开放模型。上手门槛也低:安装向导会检测设备内存并推荐可流畅运行的模型,Fusion 功能可让云端模型规划任务。官方还提到,借助 TurboQuant 技术,本地模型上下文窗口扩大 4 倍,Atomic Fusion 编排云端与本地模型以降低成本。以下是官方给出的 demo


13. Speridlabs 开源 Iris-3B:跳过 VAE 直接生成像素
来源:原文 | Gorden_Sun
西班牙AI初创公司Speridlabs开源生图模型Iris-3B,从零预训练,跳过VAE直接生成每个像素,权重、代码和演示以Apache 2.0协议开放。此外,团队还将FLUX.2 Klein改为像素版本对比,结果未现预期提升,部分指标略有下降;Iris-3B在OneG基准得0.540,与Qwen-Image的0.539大致相当。以下是官方给出的 demo


14. Codex Windows 版新增沙盒模式,基于微软 MXC
OpenAI 为 Windows 上的 Codex 用户带来更新:新沙盒模式基于微软执行容器 MXC 构建,提供更快的设置、更强的网络管控和细粒度的文件访问控制,需要兼容的 Windows 11 设备。

15. Claude Design 将并入 Claude 网页版 Artifacts
Claude Design 将合并到 Claude 网页版的 Artifacts 功能中。此前它作为独立站点时,用户可以看到所有 system prompt 和前端核心源码;并入 Artifacts 后,已无法通过抓包查看 System Prompt。

16. 豆包工作上线画布功能,接入 Seedream5.0Flash
10月9日豆包官方宣布「豆包工作」双线更新,工作任务模式新增画布功能,接入图片模型Seedream5.0Flash。借助画布,用户可将素材、方案与成果铺在同一张无限画布上;同时豆包2.1Lite(0921新版)上线,主打更省额度、更快交付。


17. Decision 2.0 发布:六款开放决策模型,尺寸从 0.6B 到 27B
Decision 2.0 发布六款开放决策模型,参数规模覆盖 0.6B 到 27B。在 Jev Decision Index 0.3 榜单上,每一款都超越了同尺寸的开放模型竞品,旗舰 Vega 27B 得分 55.88。此外,相关模型已登上 Hugging Face 热门合集,合集同时收录 Vela 2.0。



🦾 机器人具身智能
18. 英伟达发布基于 GR00T 的机器人模型 Agile One S
英伟达刚刚在 Hugging Face 上发布了一款基于 GR00T 的机器人模型 Agile One S。据介绍,Agile One S 中的 SSD Pick 是一款面向 SSD 拾取场景的部署模型,随附 ONNX 计算图与 TensorRT 引擎,可直接部署使用。

📌 模型排行榜
19. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜头部由Anthropic领跑:Claude Opus 5.5(max with fallback)以58分登顶,Claude Sonnet 5.5以56分居次,Claude Fable 5.1达53分。开源/国产方面,MiMo-V2.6-Pro以46分位列第10,作为在榜国产代表可与Grok 4.7持平。

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。