💡 今日趋势速览:谷歌开始内测Gemini 3.8 Flash,试用者称其明显好于上代;智谱正式开源GLM-5.3旗舰权重,主打智能体编码与网络防御;腾讯混元发布770B参数的Hy4 Preview并开源,能力对标GLM-5.3-Flash,开源大模型竞争持续升温。
🎯 今日要点
📋 今日内容汇总
🤖 AI动态
- 谷歌内测 Gemini 3.8 Flash 曝光
- 智谱开源 GLM-5.3 旗舰模型
- 腾讯开源 Hy4 Preview 模型
- Qwen3.8-Flash 登陆 OpenCode Go
- Qwen3.8-Flash-Next 权重开源
- 英伟达发布 NVFP4 量化 Qwen3.8
- MiniMax 开源 FastH3 v1 视频模型
- FastH3 将引入 vLLM-Omni
- Meta Muse 图像模型上线 API
- KimiCode 新增多 Agent 编排模式
- Kimi Code 新增远程控制功能
- Midjourney V8.2 编辑模型开测
- Wan 3.0 登顶视频编辑竞技场
- 蚂蚁百灵推出金融模型Ling-3.0-flash-Fin
- Agnes 2.5 Pro Beta 智能指数达 49 分
- Grok 全线升级至 4.6 模型
🔌 AI基础设施
📌 模型排行榜
🤖 AI动态
来源:原文 | thisisdimm
商业内幕获得内部截图:谷歌已开始内部测试 Gemini 3.8 Flash Preview,向部分员工开放并出现在内部编程平台 Jetski 上。试用者称其明显好于 3.7 Flash,但尚早无法完整评价------距 3.7 Flash 正式发布仅过去两周。

智谱正式开放 GLM-5.3 权重:面向智能体编码与网络防御的最强旗舰,支持下载、本地运行与定制,权重当日登陆 Hugging Face 与 ModelScope,采用全新 GLM-5.3 License,Day-0 获得 vLLM、SGLang、OpenRouter 等平台支持。

来源:原文 | op7418 (Twitter)
腾讯混元发布并开源 Hy4 Preview:总参数 770B、激活 49B、100 万上下文,在 Arena WebDev 评测排第五、与 GLM-5.3-Flash 相当;官方盲测显示 163 名内部专家在 203 个真实工程任务上略胜 GLM-5.3 与 Kimi K3。


4. Qwen3.8-Flash 登陆 OpenCode Go
来源:原文 | Alibaba_Qwen
Qwen3.8-Flash 现已登陆 OpenCode Go:125B 总参数激活 6B、100 万上下文、原生多模态,开发者可在终端编码智能体中直接使用这一高性价比模型。

阿里开放 Qwen3.8-Flash-Next 权重,作为 Qwen4 新架构的预览:125B MoE 每步激活约 6B,创新引入 51B N-gram Embedding 参数(灵感源自 DeepSeek 的 Engram 技术)增强局部模式捕捉,一张 4090 免量化即可运行。


英伟达在 Hugging Face 发布 NVFP4 量化的 Qwen3.8:2.4 万亿参数的 MoE 模型现支持 4 位推理,显著降低部署所需显存与算力门槛,为超大规模开源模型在单机与边缘侧的落地铺路。

MiniMax 开放 FastH3 v1 权重:13 秒生成 15 秒 768p 视频,FastVideo 与 Nuvalab 合作、配合 FastGen 在英伟达 Blackwell GPU 上最高实现 14 倍加速,完全开放供社区运行与改进,官方称开放权重视频模型的后训练时代才刚开始。以下是官方给出的 demo

接上条新闻,vLLM-Omni 团队祝贺 FastVideo 发布 FastH3,并宣布正与其紧密合作把 FastH3 引入 vLLM-Omni 生态。开放权重视频模型与主流推理框架的加速路径进一步打通,社区后训练空间随之扩大。

来源:原文 | alexandr_wang
Meta 的 Muse 图像模型现已在 Meta 模型 API 上线,每张图 0.01 美元,官方称其为生产级规模下性价比最佳的图像模型之一,进一步降低应用侧的图像生成成本。

KimiCode 新增实验性 tower 多 Agent 编排模式:设置环境变量后通过 /tower on 与 /tower 命令即可启动,让多个编码智能体围绕同一目标协同分工,探索复杂工程任务的并行完成方式。


接上条新闻,Kimi Code 0.39.0 新增实验性远程控制功能,用于远程访问本地 Web 会话:设置环境变量后通过 kimi rc、kimi web --remote-control 或 /remote-control 命令即可启动,方便跨设备接管编码会话。

Midjourney 开始测试 V8.2 编辑模型:支持指令式编辑、基于其他图像生成图像、笔刷局部重绘与扩图,并兼容个性化设置、情绪板与风格参考,图像编辑能力迎来大版本升级。



阿里 Wan 3.0 以 1414 分登顶视频编辑竞技场:领先 dreamina-seedence-2.5 四分、领先 MiniMax-H3 二十二分。这是阿里首次进入该竞技场------目前汇聚 8 家实验室 10 个模型,共同推动视频编辑前沿。

14. 蚂蚁百灵推出金融模型Ling-3.0-flash-Fin
蚂蚁百灵推出金融模型Ling-3.0-flash-Fin,基于Ling-3.0-flash,加入金融数据训练和工具调用优化,可自主查资料、读年报、做投研估值,并直接处理Excel财务模型。其在部分 Finance Agent 等任务上已经超过部分旗舰模型官方称模型权重下周开源


15. Agnes 2.5 Pro Beta 智能指数达 49 分
新加坡实验室 Agnes AI 的 Agnes 2.5 Pro Beta 在 Artificial Analysis 智能指数获得 49 分,较 Alpha 版提升 9 分,主要来自智能体能力的大幅进步,但输出 token 用量约为原来的两倍。


xAI 把整个 Grok 体验全面升级到新 Grok 4.6 模型:所有模式现在均运行 4.6,聊天、搜索与智能体能力统一换代,用户无需手动切换即可获得最新模型体验。

🔌 AI基础设施
AMD本周发布了GPU加速计算开放软件堆栈ROCm的10.0.0版本,新版本重点关注Instinct、Radeon与Ryzen AI平台上的AI推理、开发者工具与性能分析能力。ROCm 10.0.0扩展了对GPU、虚拟化的支持,将8GB与4GB显存版本的Radeon RX 9050显卡纳入其中


📌 模型排行榜
18. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜:Claude Opus 5以63分登顶,智能体榜:Opus 5、GLM-5.3、Grok 4.6均59分并列第一。开源方面,Kimi K3居智力榜第5名60分,GLM-5.3-Flash列智能体榜第4名58分,开源梯队已逼近闭源头部。


🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs
以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。