国产全模态开源潮:从语言模型到视频模型,中国开源生态再升级

过去72小时,国内AI圈出现了一种值得记录的现象:密集发布的不只是新模型,而是开源权重正在从语言模型一路延伸到视频、全双工音视频等更复杂的模态。对开发者与企业来说,这意味着「自选、自部署、自定制」的选项以前所未有的速度变多;对从业者来说,理清这条主线,比追单条快讯更有价值。

本文用一份可溯源的事实表,带你快速过一遍2026年8月3日至6日的几件关键发布,并给出可直接复用的开源部署思路。

主线:开源的边界正在被推开

过去一年,开源之争集中在语言模型上------DeepSeek、通义千问、MiniMax的M系列都走开放权重路线。而本周最显眼的变化是:视频与全双工音视频这类「高商业价值」旗舰能力也开始开源。这让企业第一次能在自己的服务器上,拿到接近头部水平的视频生成与实时多模态交互能力。

图1:本期封面------国产全模态开源潮示意(示意图,基于公开报道整理,非官方图片)。

1. MiniMax H3:开源视频模型的标志性事件

8月3日,MiniMax正式发布并随后开源新一代通用视频模型MiniMax H3。据36氪/智东西8月4日报道,H3是一个通用型全模态生成系统,可统一理解文本、图像、视频和音频组成的多模态上下文,生成最长15秒、最高2K分辨率并带原生立体声音频的视频;其在Artificial Analysis有声视频编辑榜单中以约1130分Elo位列第一。

更值得关注的是生态速度:报道列明,H3开源首日即获16家生态伙伴适配,覆盖芯片厂商、开发社区/云推理平台、推理框架三类。

图2:MiniMax H3开源首日16家生态适配的构成(示意图:自绘数据图,按36氪/智东西列明的伙伴分类,非官方图表)。

开发者可直接上手 :H3-Base支持通过SGLang、vLLM、diffusers与ComfyUI部署,模型已在Hugging Face开放下载(huggingface.co/MiniMaxAI/MiniMax-H3)。MiniMax称H3设计初期即考虑多款国产芯片兼容性,这也是首日适配能铺开的前提。

局限说明:H3的「全球第一」来自第三方榜单(Artificial Analysis)的公开口径,不同榜单维度不同,排名会变动;且H3仍在逐步开放权重,企业落地前请以官方文档与实测为准。

2. OpenRouter七月榜:国产开源模型包揽调用量前六

经济日报/中国经济网8月6日报道援引OpenRouter公布的数据:2026年7月全球大语言模型调用量排行榜前六名,均为中国自主研发的开源大模型。

图3:OpenRouter 2026年7月全球大模型调用量Top 6(示意图:仅公开名次顺序,具体调用量数值并未披露,条长不代表绝对值)。

这条信息有两个要点:一是国产开源模型在「普惠/性价比」路线上的调用量已经形成规模;二是榜单公开的是排名,并非调用量绝对值,引用时需避免把名次当具体数值。

3. 同期其他关键发布

三天内还有几件值得记录的发布,彼此呼应着「全模态+终端+编程智能体」三条线:

  • 字节跳动SeedRealtime(8月5日):原生音视频全双工大模型,统一架构融合音频、视频与文本,可在连续多模态信息流上实时交互,已在豆包App全量上线(来源:每日经济新闻)。
  • 京东JoyAI-Video-Edit(8月5日):开源的实时流式视频编辑模型,支持边看边改人物与场景;京东称其底层逻辑是把AI从「数字内容生成」延伸到「物理世界理解与操控」(来源:每日经济新闻)。
  • Meta Muse Code(8月6日):Meta首款终端AI编程智能体,与Muse Spark 1.2协同,按量付费------每百万输入token 1.25美元、每百万输出token 4.25美元,主打低价挑战Claude Code/Codex(来源:财联社)。

图4:2026-08-03至08-06重点AI发布时间线(示意图:基于公开报道整理,非官方排期)。

4. 工程师视角:如何抓住这波开源红利

对想落地的团队,主线结论很直接:多模态开源权重已经可用,关键是选对部署形态。以H3这类视频模型为例,标准流程是:

bash 复制代码
# 1) 拉取模型权重(示例,请以官方仓库为准)
pip install -U vllm   # 或 sgam / diffusers / ComfyUI,按官方文档选择
2) 确认推理框架与硬件已 Day-0 适配(芯片/平台名单见官方公告)
16 家伙伴覆盖昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞、AMD、Intel 等
3) 用容器内推理隔离风险,再接入业务
切勿把开放权重直接暴露到公网无鉴权端点

落地时建议遵循三条原则:

  1. 先验证再上生产:榜单第一不等于你的业务场景第一,务必用真实素材做端到端实测。
  2. 重视安全治理:人民日报8月6日刊文提示,AI能力边界扩张需要配套安全约束;开源模型尤其要加上业务层的访问控制与审计。
  3. 关注成本结构:开源降低了权重成本,但推理算力、存储与带宽仍是真开销,选型时按「请求量×单价」算总账。

局限与诚实声明

  • 本文为信息汇编,不构成投资建议;市场与股价类信息来自当日报道,可能已变动。
  • 文中涉及的具体分值(如H3的Elo约1130、Muse Code的token单价)均引自报道原文,可能随官方更新而变化,请以来源链接核实。
  • 所有配图均为基于公开数据自绘的示意图,并非官方截图、遥测或运行证据;封面与正文图已分别标注「示意图」。
  • OpenRouter榜单仅披露排名,未披露调用量绝对值,本文未对其做数值推断。
相关推荐
极新2 小时前
中国机器人已出海至141国,售后服务正成为新的机会
大数据·人工智能·机器人
张彦峰ZYF2 小时前
MCP 从“能连工具”到“像 Web 一样部署”——无状态核心、扩展框架与企业级 Agent 基础设施的真正分水岭
人工智能·llm·agent·mcp
ITresearchGuest2 小时前
我用 AI 一小时写了一个世界杯数据可视化平台|前端 VibeCoding 初体验
前端·人工智能·信息可视化
AI_yangxi2 小时前
靠谱的短视频矩阵系统
大数据·人工智能·矩阵
czxxxc2 小时前
知识服务迎来 AI 变革,创客匠人 AI 智能体破解创作者运营难题
大数据·人工智能
黑旋风小威3 小时前
一句话成片教程:用AI快速生成漫剧的实操方法分享
人工智能
冬奇Lab3 小时前
Code Agent 解剖(17):AgentTeams——消息怎么在 agent 之间传递?
人工智能·开源
冬奇Lab3 小时前
一天一个开源项目(第205篇):PenguinHarness - 让 AI 来构建 AI
人工智能·开源·资讯
小鹿的周先生3 小时前
Spring-AI-第2篇-ChatClient 实战:使用 DeepSeek 完成第一次 AI 对话
java·人工智能·spring
ajassi20003 小时前
AI语音智能体开发日记(十五)智能体LCD屏幕GIF动画显示方案——从GIF到BMP的完整实战
人工智能·ai·ai编程