Qwen新模型paloma现身Arena、阿里Wan3.0视频模型上线、字节豆包工作开放下载 | 8月25日 AI日报

💡 今日趋势速览:Qwen新模型以paloma代号现身Arena,前端编程表现被测出可比肩Opus 5,引发社区对其定位猜测。阿里Wan3.0视频生成大模型正式上线,单次可生成30秒视频并直接读取多种文档。字节豆包工作火速上线开放下载,主打办公场景。大厂正加速将前沿模型推向实际产品落地。

🎯 今日要点

  1. Qwen 新模型以 paloma 之名现身 Arena
  2. 阿里 Wan3.0 视频生成大模型正式上线
  3. 字节豆包工作火速上线并开放下载

📋 今日内容汇总

🤖 AI动态

  1. Qwen 新模型以 paloma 之名现身 Arena
  2. 阿里 Wan3.0 视频生成大模型正式上线
  3. 字节豆包工作火速上线并开放下载
  4. 阿里云上线 Kimi-K3:2.8 万亿参数与百万上下文
  5. LongCat-2.0 开源模型现支持 Go 语言
  6. 传闻 Google 即将发布 Gemini 4
  7. 腾讯混元开源视觉文档检索模型 EVIE
  8. 阿里达摩院肝癌 AI 可识别 1 厘米肿瘤
  9. 开发者获取 Marshmallow 与 Melon 输出结果
  10. API 流量揭示 marshmallow-ht 真实身份
  11. GPT-5.6 登陆 Kiro,开发性价比提升
  12. Qwen3.8-27B-NVFP4 推出裸权重版本

🔌 AI基础设施

  1. 小米发布搭载三芯片的 AI 本地主机
  2. 英伟达 Groq 3 LPX 全面量产,配 Vera Rubin

🧪 芯片半导体

  1. Hot Chips:HBM 走向定制化与三维堆叠

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. Qwen 新模型以 paloma 之名现身 Arena

Qwen最新模型以paloma代号登陆Arena,测试者称其前端编程能力感觉可能与Opus 5不相上下。在此基础上,代号与实测表现引发社区对其正式定位的猜测,官方尚未确认模型身份与发布时间;社区猜测是Qwen 4模型。

🔗 https://x.com/White1637402/status/2091808931459043788


2. 阿里 Wan3.0 视频生成大模型正式上线

阿里视频生成大模型 Wan3.0 正式上线,距 8 月 6 日公测仅 18 天。单次最长生成 30 秒视频,可直接读取 doc、xls、ppt、pdf、md 等文档生成内容;公测期间指令遵循、跨镜头一致性、音频质感与视频编辑持续优化,已进入短剧、广告与 MV 制作流程。以下是官方给出的 demo

🔗 https://x.com/0xLogicrw/status/2091731435329839458


3. 字节豆包工作火速上线并开放下载

字节新AI办公产品"豆包工作"已上线并开放官网下载,实测显示其更像是豆包切出的办公版,界面与豆包电脑版几乎一致其界面显示功能包括新工作任务、定时任务、技能·连接器·伙伴、手机遥控电脑、云盘等。

🔗 https://x.com/0xLogicrw/status/2091830443347980605


4. 阿里云上线 Kimi-K3:2.8 万亿参数与百万上下文

阿里云正式上线 Kimi-K3 ,其拥有 2.8 万亿参数和原生 100 万 token 上下文,面向仓库级工程、视觉创作与自主规划智能体打造,现已在 Model Studio 与 Qwen Cloud 提供百万 token 免费试用,供开发者体验长上下文能力。

🔗 https://x.com/alibaba_cloud/status/2091731622034891062


5. LongCat-2.0 开源模型现支持 Go 语言

LongCat-2.0 宣布现已在 opencode 平台支持 Go 语言,该模型为 1.6T 总参数、48B 激活规格,支持 100 万上下文并完全开源,开发者可用 Go 语言直接调用其能力构建智能体应用,官方邀请开发者试用并反馈构建成果。

🔗 https://x.com/opencode/status/2091886759298654383


6. 传闻 Google 即将发布 Gemini 4

消息人士称 Google 终于准备发布 Gemini 4:约两三天前其内部平台新增 120 多次 Gemini 4 提及,此前为零,不到 24 小时前产品侧又新增 6 次类似提及,相关信息开始扩散,暗示发布窗口临近。

🔗 https://x.com/bedros_p/status/2091666760059793534


7. 腾讯混元开源视觉文档检索模型 EVIE

腾讯混元发布 EVIE-Preview-4.5B 多语言视觉文档检索模型,采用 Apache 2.0 许可证开源,在 ViDoRe V3 与 ViDoRe V1+V2 两项基准上均排名第一,并在 V3 上击败更大的 8B 模型,可直接通过公开渠道获取使用。

🔗 https://x.com/ModelScope2022/status/2091844761858576672


8. 阿里达摩院肝癌 AI 可识别 1 厘米肿瘤

阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发出肝癌诊断 AI 模型 DAMO LiON,通过 CT 影像识别微小肝脏癌变病灶,两个月真实世界前瞻临床试验中发现 15 例原本被遗漏的恶性肿瘤,绝大部分为 1 厘米左右病灶,论文登上国际顶级学术期刊。

🔗 https://www.ithome.com/0/993/478.htm


9. 开发者获取 Marshmallow 与 Melon 输出结果

Anthropic目前正在测试两款新模型"claude-melon-eap"和"claude-marshmallow-eap",开发者已获取其输出结果。测试显示,这两款模型在3D相关任务中表现突出,建筑等空间布局质量出色,且大量使用思考token,多次触发上下文上限,疑似面向空间推理强化。

🔗 https://x.com/Lentils80/status/2091704307863142812


10. API 流量揭示 marshmallow-ht 真实身份

接上条新闻,Claude实际上线的是marshmallow-ht-eap而非此前流传版本在此基础上,8月21日00:45-00:57Z期间message.model出现57次回显,Claude Code 2.1.238以自定义模型返回,上下文窗口达百万且安全机制标记任务后回退更重要的是,该模型大概率非opus系列,或为sonnet和haiku

🔗 https://x.com/chetaslua/status/2091754995767239094


11. GPT-5.6 登陆 Kiro,开发性价比提升

OpenAI宣布GPT-5.6模型家族登陆AWS开发智能体Kiro,包含Sol、Terra与Luna三款模型测试显示,在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro内完成任务成本降低约82%,由OpenAI与AWS合作优化

🔗 https://openai.com/index/gpt-5-6-in-kiro


12. Qwen3.8-27B-NVFP4 推出裸权重版本

兼容 DGX-Spark 的热门模型 Qwen3.8-27B-NVFP4 现已推出裸权重版本,OrcaRouter 系列 FP8、GGUF、MLX、NVFP4 与 BF16 各版本在 Hugging Face 总下载量已突破 45 万,本次新增专为 NVIDIA Blackwell 优化的完整权重。

🔗 https://x.com/TeksEdge/status/2091920293464056249


🔌 AI基础设施

13. 小米发布搭载三芯片的 AI 本地主机

小米在玄戒发布会推出 AI 本地主机,搭载新发布的 O3、O100 与 D100 三款自研芯片,支持 120B 与 3B 双模型部署及快慢系统切换,面向本地大模型推理场景,为个人用户提供不依赖云端的算力方案。

🔗 https://x.com/op7418/status/2091780906965242131


14. 英伟达 Groq 3 LPX 全面量产,配 Vera Rubin

英伟达宣布其推理加速器 Groq 3 LPX 进入全面量产,与 Vera Rubin NVL72 机架级系统搭配构成每座 AI 工厂的基础,为智能体应用提供更快 token 生成能力,通过七款芯片与五种专用机架的协同设计解锁更智能的用户体验。

🔗 https://x.com/nvidianewsroom/status/2091904293343252534


🧪 芯片半导体

15. Hot Chips:HBM 走向定制化与三维堆叠

本届 Hot Chips 大会上,三星、美光、SK 海力士与英伟达密集披露 HBM 技术路线图:HBM 正从标准化商品走向定制化平台,三维垂直堆叠成为下一代架构的共同方向,散热与功耗约束已成为制约扩展的首要瓶颈,AI 算力需求推动存储架构演进。

🔗 https://wallstreetcn.com/articles/3780136


📌 模型排行榜

16. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜前三:Claude Opus 5 (max) 63分领跑,Claude Fable 5 62分次席,智能体榜头部胶着,Claude Opus 5、GLM-5.3与Grok 4.6同以59分并列第一。国产强势,GLM-5.3智能体榜与榜首并列第一。

🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

相关推荐
AI日报派送佬21 小时前
2026年10月4日AI行业日报|AI智能体自主能力升级,模型落地与安全规范双向迭代
人工智能·智能体·ai安全·开源ai·ai日报·人工智能前沿·ai科研
AI日报派送佬2 天前
2026年10月2日AI行业日报|AI监管全面加码,算力基建革新,视觉推理技术突破
人工智能·ai智能体·大模型技术·ai日报·算力基建·ai科研·ai产业落地
AI日报派送佬2 天前
2026年10月3日AI行业日报|系统权限安全全面收紧,AI算力与模型工程化落地提速
人工智能·openai·英伟达·ai日报·智能体技术·ai安全管控·ai开源生态
半甜柠檬3 天前
llama.cpp 部署 Qwen3.8-27B:无独显轻薄本实测
大模型·qwen·量化·本地部署·llama.cpp
云卷云舒___________3 天前
Qwen 4首测泄露!DeepSeek V4 mini展示名为flash?蚂蚁Ling-3.1-flash同步炸场 | 10月1日 AI日报
人工智能·开源模型·deepseek·ai日报·qwen4·ling31flash·蚂蚁百灵
slacker-kian3 天前
BeeAI 实战:从简单对话到 Agent 的驯服之路
ai·llm·agent·qwen·beeai
浅安的邂逅5 天前
20929-OpenAI 一天踩三脚急刹:暂停前沿训练、叫停 Astra、披露越权访问澳政府网站
人工智能·大模型·ai编程·行业动态·ai日报
梅雅达编程笔记6 天前
开源模型的安全悖论——越开放,越危险?
llama·qwen·开源大模型·ai安全·模型越狱·权重投毒·大模型治理
浅安的邂逅8 天前
260926-OpenAI 急停最强模型训练:智能体借 DNS 漏洞联网,还泄露了 GitHub token
人工智能·chatgpt·开源·openai·ai日报
jianpeng的工程笔记14 天前
Qwen-Image-2.1 图像编辑拆解:从透明改字到多图合成
人工智能·qwen·图像生成·comfyui