Qwen新模型paloma现身Arena、阿里Wan3.0视频模型上线、字节豆包工作开放下载 | 8月25日 AI日报

💡 今日趋势速览:Qwen新模型以paloma代号现身Arena,前端编程表现被测出可比肩Opus 5,引发社区对其定位猜测。阿里Wan3.0视频生成大模型正式上线,单次可生成30秒视频并直接读取多种文档。字节豆包工作火速上线开放下载,主打办公场景。大厂正加速将前沿模型推向实际产品落地。

🎯 今日要点

  1. Qwen 新模型以 paloma 之名现身 Arena
  2. 阿里 Wan3.0 视频生成大模型正式上线
  3. 字节豆包工作火速上线并开放下载

📋 今日内容汇总

🤖 AI动态

  1. Qwen 新模型以 paloma 之名现身 Arena
  2. 阿里 Wan3.0 视频生成大模型正式上线
  3. 字节豆包工作火速上线并开放下载
  4. 阿里云上线 Kimi-K3:2.8 万亿参数与百万上下文
  5. LongCat-2.0 开源模型现支持 Go 语言
  6. 传闻 Google 即将发布 Gemini 4
  7. 腾讯混元开源视觉文档检索模型 EVIE
  8. 阿里达摩院肝癌 AI 可识别 1 厘米肿瘤
  9. 开发者获取 Marshmallow 与 Melon 输出结果
  10. API 流量揭示 marshmallow-ht 真实身份
  11. GPT-5.6 登陆 Kiro,开发性价比提升
  12. Qwen3.8-27B-NVFP4 推出裸权重版本

🔌 AI基础设施

  1. 小米发布搭载三芯片的 AI 本地主机
  2. 英伟达 Groq 3 LPX 全面量产,配 Vera Rubin

🧪 芯片半导体

  1. Hot Chips:HBM 走向定制化与三维堆叠

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. Qwen 新模型以 paloma 之名现身 Arena

Qwen最新模型以paloma代号登陆Arena,测试者称其前端编程能力感觉可能与Opus 5不相上下。在此基础上,代号与实测表现引发社区对其正式定位的猜测,官方尚未确认模型身份与发布时间;社区猜测是Qwen 4模型。

🔗 https://x.com/White1637402/status/2091808931459043788


2. 阿里 Wan3.0 视频生成大模型正式上线

阿里视频生成大模型 Wan3.0 正式上线,距 8 月 6 日公测仅 18 天。单次最长生成 30 秒视频,可直接读取 doc、xls、ppt、pdf、md 等文档生成内容;公测期间指令遵循、跨镜头一致性、音频质感与视频编辑持续优化,已进入短剧、广告与 MV 制作流程。以下是官方给出的 demo

🔗 https://x.com/0xLogicrw/status/2091731435329839458


3. 字节豆包工作火速上线并开放下载

字节新AI办公产品"豆包工作"已上线并开放官网下载,实测显示其更像是豆包切出的办公版,界面与豆包电脑版几乎一致其界面显示功能包括新工作任务、定时任务、技能·连接器·伙伴、手机遥控电脑、云盘等。

🔗 https://x.com/0xLogicrw/status/2091830443347980605


4. 阿里云上线 Kimi-K3:2.8 万亿参数与百万上下文

阿里云正式上线 Kimi-K3 ,其拥有 2.8 万亿参数和原生 100 万 token 上下文,面向仓库级工程、视觉创作与自主规划智能体打造,现已在 Model Studio 与 Qwen Cloud 提供百万 token 免费试用,供开发者体验长上下文能力。

🔗 https://x.com/alibaba_cloud/status/2091731622034891062


5. LongCat-2.0 开源模型现支持 Go 语言

LongCat-2.0 宣布现已在 opencode 平台支持 Go 语言,该模型为 1.6T 总参数、48B 激活规格,支持 100 万上下文并完全开源,开发者可用 Go 语言直接调用其能力构建智能体应用,官方邀请开发者试用并反馈构建成果。

🔗 https://x.com/opencode/status/2091886759298654383


6. 传闻 Google 即将发布 Gemini 4

消息人士称 Google 终于准备发布 Gemini 4:约两三天前其内部平台新增 120 多次 Gemini 4 提及,此前为零,不到 24 小时前产品侧又新增 6 次类似提及,相关信息开始扩散,暗示发布窗口临近。

🔗 https://x.com/bedros_p/status/2091666760059793534


7. 腾讯混元开源视觉文档检索模型 EVIE

腾讯混元发布 EVIE-Preview-4.5B 多语言视觉文档检索模型,采用 Apache 2.0 许可证开源,在 ViDoRe V3 与 ViDoRe V1+V2 两项基准上均排名第一,并在 V3 上击败更大的 8B 模型,可直接通过公开渠道获取使用。

🔗 https://x.com/ModelScope2022/status/2091844761858576672


8. 阿里达摩院肝癌 AI 可识别 1 厘米肿瘤

阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发出肝癌诊断 AI 模型 DAMO LiON,通过 CT 影像识别微小肝脏癌变病灶,两个月真实世界前瞻临床试验中发现 15 例原本被遗漏的恶性肿瘤,绝大部分为 1 厘米左右病灶,论文登上国际顶级学术期刊。

🔗 https://www.ithome.com/0/993/478.htm


9. 开发者获取 Marshmallow 与 Melon 输出结果

Anthropic目前正在测试两款新模型"claude-melon-eap"和"claude-marshmallow-eap",开发者已获取其输出结果。测试显示,这两款模型在3D相关任务中表现突出,建筑等空间布局质量出色,且大量使用思考token,多次触发上下文上限,疑似面向空间推理强化。

🔗 https://x.com/Lentils80/status/2091704307863142812


10. API 流量揭示 marshmallow-ht 真实身份

接上条新闻,Claude实际上线的是marshmallow-ht-eap而非此前流传版本在此基础上,8月21日00:45-00:57Z期间message.model出现57次回显,Claude Code 2.1.238以自定义模型返回,上下文窗口达百万且安全机制标记任务后回退更重要的是,该模型大概率非opus系列,或为sonnet和haiku

🔗 https://x.com/chetaslua/status/2091754995767239094


11. GPT-5.6 登陆 Kiro,开发性价比提升

OpenAI宣布GPT-5.6模型家族登陆AWS开发智能体Kiro,包含Sol、Terra与Luna三款模型测试显示,在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro内完成任务成本降低约82%,由OpenAI与AWS合作优化

🔗 https://openai.com/index/gpt-5-6-in-kiro


12. Qwen3.8-27B-NVFP4 推出裸权重版本

兼容 DGX-Spark 的热门模型 Qwen3.8-27B-NVFP4 现已推出裸权重版本,OrcaRouter 系列 FP8、GGUF、MLX、NVFP4 与 BF16 各版本在 Hugging Face 总下载量已突破 45 万,本次新增专为 NVIDIA Blackwell 优化的完整权重。

🔗 https://x.com/TeksEdge/status/2091920293464056249


🔌 AI基础设施

13. 小米发布搭载三芯片的 AI 本地主机

小米在玄戒发布会推出 AI 本地主机,搭载新发布的 O3、O100 与 D100 三款自研芯片,支持 120B 与 3B 双模型部署及快慢系统切换,面向本地大模型推理场景,为个人用户提供不依赖云端的算力方案。

🔗 https://x.com/op7418/status/2091780906965242131


14. 英伟达 Groq 3 LPX 全面量产,配 Vera Rubin

英伟达宣布其推理加速器 Groq 3 LPX 进入全面量产,与 Vera Rubin NVL72 机架级系统搭配构成每座 AI 工厂的基础,为智能体应用提供更快 token 生成能力,通过七款芯片与五种专用机架的协同设计解锁更智能的用户体验。

🔗 https://x.com/nvidianewsroom/status/2091904293343252534


🧪 芯片半导体

15. Hot Chips:HBM 走向定制化与三维堆叠

本届 Hot Chips 大会上,三星、美光、SK 海力士与英伟达密集披露 HBM 技术路线图:HBM 正从标准化商品走向定制化平台,三维垂直堆叠成为下一代架构的共同方向,散热与功耗约束已成为制约扩展的首要瓶颈,AI 算力需求推动存储架构演进。

🔗 https://wallstreetcn.com/articles/3780136


📌 模型排行榜

16. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜前三:Claude Opus 5 (max) 63分领跑,Claude Fable 5 62分次席,智能体榜头部胶着,Claude Opus 5、GLM-5.3与Grok 4.6同以59分并列第一。国产强势,GLM-5.3智能体榜与榜首并列第一。

🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

相关推荐
Rubin智造社4 小时前
字节AI生产力大整合:TRAE、扣子并入豆包,「豆包工作」登场,工作方式正在改写
agent·trae·ai生产力·豆包工作·扣子coze
啾啾Fun5 小时前
技术动态日报 · 2026年8月25日
cloudflare·ai-agent·技术日报·豆包工作
找方案2 天前
Seedance 2.5突破30秒视频生成,AI视频赛道进入工业化时代
大数据·人工智能·字节跳动·可灵·ai视频生成·seedance2.5·工业化时代
老大白菜6 天前
Qwen3.8-27B 本地推理 + DeepSeek Harness 配置
python·qwen·deepseek·harness
虎鲸不是鱼8 天前
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型
大模型·多模态·qwen·lm studio·千问
云卷云舒___________9 天前
Anthropic披露内部模型Model 2、Codex多智能体v2委派多模型、英伟达开源550B推理教师模型 | 8月16日 AI日报
多智能体·codex·英伟达·anthropic·ai日报·model2·推理教师模型
小白跃升坊10 天前
阿里云通义千问正式开源 Qwen3.8-27B:性能与成本的黄金平衡点
开源·大模型·通义千问·qwen·qwen3.8-27b
云卷云舒___________12 天前
【加急快讯】DeepSeek Harness 深夜开源!主打「一切皆插件」,由 Cordis 驱动
开源·aiagent·deepseek·ai日报·智能体框架·deepseekharness·cordis
咕噜咕噜啦啦14 天前
vLLM框架
人工智能·qwen·vllm