国产全模态开源潮:从语言模型到视频模型,中国开源生态再升级

过去72小时,国内AI圈出现了一种值得记录的现象:密集发布的不只是新模型,而是开源权重正在从语言模型一路延伸到视频、全双工音视频等更复杂的模态。对开发者与企业来说,这意味着「自选、自部署、自定制」的选项以前所未有的速度变多;对从业者来说,理清这条主线,比追单条快讯更有价值。

本文用一份可溯源的事实表,带你快速过一遍2026年8月3日至6日的几件关键发布,并给出可直接复用的开源部署思路。

主线:开源的边界正在被推开

过去一年,开源之争集中在语言模型上------DeepSeek、通义千问、MiniMax的M系列都走开放权重路线。而本周最显眼的变化是:视频与全双工音视频这类「高商业价值」旗舰能力也开始开源。这让企业第一次能在自己的服务器上,拿到接近头部水平的视频生成与实时多模态交互能力。

图1:本期封面------国产全模态开源潮示意(示意图,基于公开报道整理,非官方图片)。

1. MiniMax H3:开源视频模型的标志性事件

8月3日,MiniMax正式发布并随后开源新一代通用视频模型MiniMax H3。据36氪/智东西8月4日报道,H3是一个通用型全模态生成系统,可统一理解文本、图像、视频和音频组成的多模态上下文,生成最长15秒、最高2K分辨率并带原生立体声音频的视频;其在Artificial Analysis有声视频编辑榜单中以约1130分Elo位列第一。

更值得关注的是生态速度:报道列明,H3开源首日即获16家生态伙伴适配,覆盖芯片厂商、开发社区/云推理平台、推理框架三类。

图2:MiniMax H3开源首日16家生态适配的构成(示意图:自绘数据图,按36氪/智东西列明的伙伴分类,非官方图表)。

开发者可直接上手 :H3-Base支持通过SGLang、vLLM、diffusers与ComfyUI部署,模型已在Hugging Face开放下载(huggingface.co/MiniMaxAI/MiniMax-H3)。MiniMax称H3设计初期即考虑多款国产芯片兼容性,这也是首日适配能铺开的前提。

局限说明:H3的「全球第一」来自第三方榜单(Artificial Analysis)的公开口径,不同榜单维度不同,排名会变动;且H3仍在逐步开放权重,企业落地前请以官方文档与实测为准。

2. OpenRouter七月榜:国产开源模型包揽调用量前六

经济日报/中国经济网8月6日报道援引OpenRouter公布的数据:2026年7月全球大语言模型调用量排行榜前六名,均为中国自主研发的开源大模型。

图3:OpenRouter 2026年7月全球大模型调用量Top 6(示意图:仅公开名次顺序,具体调用量数值并未披露,条长不代表绝对值)。

这条信息有两个要点:一是国产开源模型在「普惠/性价比」路线上的调用量已经形成规模;二是榜单公开的是排名,并非调用量绝对值,引用时需避免把名次当具体数值。

3. 同期其他关键发布

三天内还有几件值得记录的发布,彼此呼应着「全模态+终端+编程智能体」三条线:

  • 字节跳动SeedRealtime(8月5日):原生音视频全双工大模型,统一架构融合音频、视频与文本,可在连续多模态信息流上实时交互,已在豆包App全量上线(来源:每日经济新闻)。
  • 京东JoyAI-Video-Edit(8月5日):开源的实时流式视频编辑模型,支持边看边改人物与场景;京东称其底层逻辑是把AI从「数字内容生成」延伸到「物理世界理解与操控」(来源:每日经济新闻)。
  • Meta Muse Code(8月6日):Meta首款终端AI编程智能体,与Muse Spark 1.2协同,按量付费------每百万输入token 1.25美元、每百万输出token 4.25美元,主打低价挑战Claude Code/Codex(来源:财联社)。

图4:2026-08-03至08-06重点AI发布时间线(示意图:基于公开报道整理,非官方排期)。

4. 工程师视角:如何抓住这波开源红利

对想落地的团队,主线结论很直接:多模态开源权重已经可用,关键是选对部署形态。以H3这类视频模型为例,标准流程是:

bash 复制代码
# 1) 拉取模型权重(示例,请以官方仓库为准)
pip install -U vllm   # 或 sgam / diffusers / ComfyUI,按官方文档选择
2) 确认推理框架与硬件已 Day-0 适配(芯片/平台名单见官方公告)
16 家伙伴覆盖昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞、AMD、Intel 等
3) 用容器内推理隔离风险,再接入业务
切勿把开放权重直接暴露到公网无鉴权端点

落地时建议遵循三条原则:

  1. 先验证再上生产:榜单第一不等于你的业务场景第一,务必用真实素材做端到端实测。
  2. 重视安全治理:人民日报8月6日刊文提示,AI能力边界扩张需要配套安全约束;开源模型尤其要加上业务层的访问控制与审计。
  3. 关注成本结构:开源降低了权重成本,但推理算力、存储与带宽仍是真开销,选型时按「请求量×单价」算总账。

局限与诚实声明

  • 本文为信息汇编,不构成投资建议;市场与股价类信息来自当日报道,可能已变动。
  • 文中涉及的具体分值(如H3的Elo约1130、Muse Code的token单价)均引自报道原文,可能随官方更新而变化,请以来源链接核实。
  • 所有配图均为基于公开数据自绘的示意图,并非官方截图、遥测或运行证据;封面与正文图已分别标注「示意图」。
  • OpenRouter榜单仅披露排名,未披露调用量绝对值,本文未对其做数值推断。
相关推荐
回眸&啤酒鸭1 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智1 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
不悔哥1 天前
开源OV-Watch:怎么做一个智能手表
单片机·开源·嵌入式
AI的探索之旅1 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein1 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
家和801 天前
Carla仿真系列:4_在 Carla 的 Tesla 上装 4 路摄像头,并创建网格为环视拼接做准备
开源
LaughingZhu1 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台1 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb1 天前
智能网联汽车安全能力框架
人工智能