💡 今日趋势速览:Qwen新模型以paloma代号现身Arena,前端编程表现被测出可比肩Opus 5,引发社区对其定位猜测。阿里Wan3.0视频生成大模型正式上线,单次可生成30秒视频并直接读取多种文档。字节豆包工作火速上线开放下载,主打办公场景。大厂正加速将前沿模型推向实际产品落地。
🎯 今日要点
📋 今日内容汇总
🤖 AI动态
- Qwen 新模型以 paloma 之名现身 Arena
- 阿里 Wan3.0 视频生成大模型正式上线
- 字节豆包工作火速上线并开放下载
- 阿里云上线 Kimi-K3:2.8 万亿参数与百万上下文
- LongCat-2.0 开源模型现支持 Go 语言
- 传闻 Google 即将发布 Gemini 4
- 腾讯混元开源视觉文档检索模型 EVIE
- 阿里达摩院肝癌 AI 可识别 1 厘米肿瘤
- 开发者获取 Marshmallow 与 Melon 输出结果
- API 流量揭示 marshmallow-ht 真实身份
- GPT-5.6 登陆 Kiro,开发性价比提升
- Qwen3.8-27B-NVFP4 推出裸权重版本
🔌 AI基础设施
🧪 芯片半导体
📌 模型排行榜
🤖 AI动态
1. Qwen 新模型以 paloma 之名现身 Arena
Qwen最新模型以paloma代号登陆Arena,测试者称其前端编程能力感觉可能与Opus 5不相上下。在此基础上,代号与实测表现引发社区对其正式定位的猜测,官方尚未确认模型身份与发布时间;社区猜测是Qwen 4模型。


阿里视频生成大模型 Wan3.0 正式上线,距 8 月 6 日公测仅 18 天。单次最长生成 30 秒视频,可直接读取 doc、xls、ppt、pdf、md 等文档生成内容;公测期间指令遵循、跨镜头一致性、音频质感与视频编辑持续优化,已进入短剧、广告与 MV 制作流程。以下是官方给出的 demo

字节新AI办公产品"豆包工作"已上线并开放官网下载,实测显示其更像是豆包切出的办公版,界面与豆包电脑版几乎一致其界面显示功能包括新工作任务、定时任务、技能·连接器·伙伴、手机遥控电脑、云盘等。


4. 阿里云上线 Kimi-K3:2.8 万亿参数与百万上下文
阿里云正式上线 Kimi-K3 ,其拥有 2.8 万亿参数和原生 100 万 token 上下文,面向仓库级工程、视觉创作与自主规划智能体打造,现已在 Model Studio 与 Qwen Cloud 提供百万 token 免费试用,供开发者体验长上下文能力。

LongCat-2.0 宣布现已在 opencode 平台支持 Go 语言,该模型为 1.6T 总参数、48B 激活规格,支持 100 万上下文并完全开源,开发者可用 Go 语言直接调用其能力构建智能体应用,官方邀请开发者试用并反馈构建成果。

消息人士称 Google 终于准备发布 Gemini 4:约两三天前其内部平台新增 120 多次 Gemini 4 提及,此前为零,不到 24 小时前产品侧又新增 6 次类似提及,相关信息开始扩散,暗示发布窗口临近。

腾讯混元发布 EVIE-Preview-4.5B 多语言视觉文档检索模型,采用 Apache 2.0 许可证开源,在 ViDoRe V3 与 ViDoRe V1+V2 两项基准上均排名第一,并在 V3 上击败更大的 8B 模型,可直接通过公开渠道获取使用。

阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发出肝癌诊断 AI 模型 DAMO LiON,通过 CT 影像识别微小肝脏癌变病灶,两个月真实世界前瞻临床试验中发现 15 例原本被遗漏的恶性肿瘤,绝大部分为 1 厘米左右病灶,论文登上国际顶级学术期刊。



9. 开发者获取 Marshmallow 与 Melon 输出结果
Anthropic目前正在测试两款新模型"claude-melon-eap"和"claude-marshmallow-eap",开发者已获取其输出结果。测试显示,这两款模型在3D相关任务中表现突出,建筑等空间布局质量出色,且大量使用思考token,多次触发上下文上限,疑似面向空间推理强化。


10. API 流量揭示 marshmallow-ht 真实身份
接上条新闻,Claude实际上线的是marshmallow-ht-eap而非此前流传版本在此基础上,8月21日00:45-00:57Z期间message.model出现57次回显,Claude Code 2.1.238以自定义模型返回,上下文窗口达百万且安全机制标记任务后回退更重要的是,该模型大概率非opus系列,或为sonnet和haiku



OpenAI宣布GPT-5.6模型家族登陆AWS开发智能体Kiro,包含Sol、Terra与Luna三款模型测试显示,在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro内完成任务成本降低约82%,由OpenAI与AWS合作优化


兼容 DGX-Spark 的热门模型 Qwen3.8-27B-NVFP4 现已推出裸权重版本,OrcaRouter 系列 FP8、GGUF、MLX、NVFP4 与 BF16 各版本在 Hugging Face 总下载量已突破 45 万,本次新增专为 NVIDIA Blackwell 优化的完整权重。


🔌 AI基础设施
小米在玄戒发布会推出 AI 本地主机,搭载新发布的 O3、O100 与 D100 三款自研芯片,支持 120B 与 3B 双模型部署及快慢系统切换,面向本地大模型推理场景,为个人用户提供不依赖云端的算力方案。

14. 英伟达 Groq 3 LPX 全面量产,配 Vera Rubin
英伟达宣布其推理加速器 Groq 3 LPX 进入全面量产,与 Vera Rubin NVL72 机架级系统搭配构成每座 AI 工厂的基础,为智能体应用提供更快 token 生成能力,通过七款芯片与五种专用机架的协同设计解锁更智能的用户体验。

🧪 芯片半导体
本届 Hot Chips 大会上,三星、美光、SK 海力士与英伟达密集披露 HBM 技术路线图:HBM 正从标准化商品走向定制化平台,三维垂直堆叠成为下一代架构的共同方向,散热与功耗约束已成为制约扩展的首要瓶颈,AI 算力需求推动存储架构演进。


📌 模型排行榜
16. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜前三:Claude Opus 5 (max) 63分领跑,Claude Fable 5 62分次席,智能体榜头部胶着,Claude Opus 5、GLM-5.3与Grok 4.6同以59分并列第一。国产强势,GLM-5.3智能体榜与榜首并列第一。


🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs
以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。