
评测背景
晓天衡宇图生视频榜单此前评测了 11 款模型,8 月图生视频榜单迎来四款新模型入榜:Seedance 2.5、MiniMax H3、Wan 3.0 和 Gemini Omni Flash ,主榜共 15 款模型。
从官方发布信息来看,四款模型在图生视频方面重点强调的能力有所不同:Seedance 2.5 重点介绍长叙事、多模态参考和精细化编辑能力;MiniMax H3 重点介绍多模态理解、复杂指令遵循和可控生成;Wan 3.0 重点介绍多模态创作、参考一致性和视频编辑;Gemini Omni Flash 则重点介绍快速、对话式的视频生成与编辑。
本次图生视频榜单沿用内容与场景两个维度:内容维度覆盖生成主体、空间与场景、运动与动态、文字与符号等 8 个内容维度,场景维度覆盖影视/动画、电商/营销、教育/科研等 6 个应用场景;基于 102.2 万局 Arena 对战,对 15 款模型的图生视频能力及效率进行了横向评测,重点关注:
-
本轮新增模型对榜单结构带来了哪些变化?
-
模型各自的优势落在哪些内容维度与场景?
-
模型在生成速度、成本与稳定性上的实际差异是什么?
点击访问晓天衡宇评测社区,查看完整图生视频榜单、分维度排名、分场景排名及样例对战结果。
榜单概览

核心结论
结论 1:Seedance 2.5 位居第一,MiniMax H3、Wan 3.0 与 Gemini Omni Flash 形成清晰梯度
Seedance 2.5 以 1293.5 的综合 ELO 排名第一,MiniMax H3 为 1199.5 分、Wan 3.0 为 1141.2 分、Gemini Omni Flash 为 1109.4 分,分别位列第二、第三和第五。
Seedance 2.5 与 MiniMax H3 之间相差 94.0 分,MiniMax H3 与 Wan 3.0 相差 58.3 分,而 Wan 3.0 与 Gemini Omni Flash 仅相差 31.8 分。
四款新增模型都处于本轮主榜前五,其中 Seedance 2.5 的领先幅度相对明显。
结论 2:内容维度分层明确,场景维度排名变化显著
八项内容维度中,Seedance 2.5 全部排名第一,MiniMax H3 全部排名第二,说明两款模型的高位表现覆盖范围都很完整。
Wan 3.0 多数维度位列第三,整体稳定在高分区;Gemini Omni Flash 则更多处于第五至第七附近,但在部分维度保持相对接近。内容维度由此呈现出较清晰的分层,同时,不同模型在各内容维度上的排位与综合排名并不完全一致。
六项场景维度中,Seedance 2.5 六大场景全部第一,MiniMax H3 在影视/动画、电商/营销、设计/创意和个人/社交等方向保持高位,Wan 3.0 在游戏/互动和教育/科研中较为突出,而 Gemini Omni Flash 在游戏/互动场景达到 1164.0 分,是自身六类场景中的最高项。
结论 3:效率排序与综合榜并不同步,四款模型各有优势
Gemini Omni Flash 平均每条视频仅 45.0 秒,在综合能力前五且成本信息完整的模型中,其单次生成价格最低,仅 7.5元/条;Seedance 2.5 为 894.0 秒、实际价格最高,但综合表现最佳;MiniMax H3 的实际价格为 19.9元/条,在三款成本信息完整的新增模型中最低,同时首次抽卡率 60.2% 也是最高;Wan 3.0 采用 30s/1080P 输出配置,成功率达到 99.0%,是四款新模型中的最高。四款模型在综合表现、生成效率、实际价格以及具体评测指标上的表现各有侧重。
评测体系
评测维度
本次评测从内容和场景两个维度展开,基于具体维度通过参考图与对应提示词,交由模型产出并对战。
-
内容维度共 8 个,覆盖图生视频从画面基础到高级表达的核心能力;
-
场景维度共 6 个,从图生视频的实际应用场景出发。

完整评测体系及方法解读可点击查看:11 款图生视频模型横评:Seedance 2.0领跑,场景表现却各有胜负
深度解读
关键对战:榜首领先幅度较为突出,前列差距相对较小
除 Seedance 2.5 对其他新增模型保持 60%以上胜率外,其余相邻头部模型之间的直接对战结果多集中在 50%---60% 区间;其中 Wan 3.0 对 Seedance 2.0 仅 53.6%,对战结果基本处于均势,与两者在总榜上相近的位次一致。

内容维度:排位较为稳定,能力特点比排名差异更明显

前两名在八个内容维度的排位与总榜完全一致,差异更多体现在能力特点上。
Seedance 2.5 得分最高的维度是文字与符号:1353.8 分,该维度对第二名的领先达 124 分,超过它在其他任何维度的领先幅度,文字还原是目前它的优势;MiniMax H3 八个维度表现较为均衡,同样在文字与符号上得分最高,但与 Seedance 2.5 的差距也在该维度最为明显。Wan 3.0 在音频内容维度的得分与 Seedance 2.0 相差 0.6 分,其余七项维度的得分均略高于 Seedance 2.0。
Case:同一提示词下的 Wan 3.0 与 MiniMax H3 对比
本组对比中 Wan 3.0 胜出,其画面一致性和稳定性上更佳:高楼、街景等主体保持更完整,镜头运动更连贯,建筑细节更稳定。该Case仅展示一组具体对战结果,用于辅助理解 Wan 3.0 在空间一致性和镜头运动方面的表现,不能代表所有场景下的普遍结果。
Gemini Omni Flash 则在生成主体、运动与动态上与其综合位次相符,在整体协调性以及文字、符号还原相关维度中,其排位为第七位,低于综合排名。
场景维度:排名变化更多,模型在不同场景各有优势

Seedance 2.5 在六个场景全部第一,场景排位与综合排位没有出入,排名变化主要体现在其余三款。
教育/科研场景的模型排位变化较为明显:Wan 3.0 在这一场景位列第二,排在 Seedance 2.0 和 MiniMax H3 之前;MiniMax H3 位列第四、Gemini Omni Flash 位列第十,都低于各自的综合位次。个人/社交的情况则相反:Wan 3.0 位列第七,是它六个场景中的最低排名。游戏/互动是 Wan 3.0 与 Gemini Omni Flash 排位相对最高的场景:Wan 3.0 在该场景中位列第二,与榜首的差距是六个场景中最小的,Gemini Omni Flash 则在游戏/互动这一场景取得自身六个场景中的最高分。
Wan 3.0 的优势主要体现在游戏/互动与教育/科研,个人/社交排名相对靠后;MiniMax H3 在影视/动画、电商/营销、设计/创意等通用场景表现更为稳定;Gemini Omni Flash 的得分相对较低的场景是教育/科研与电商/营销,作为低成本选项时这两类任务需要结合具体需求评估。
效率与成本分析
由于各模型本次输出时长与分辨率不同,以下速度与价格仅代表本次实测配置,不构成同规格横向比较。
模型能力 × 生成时长:质量与速度难以兼得

Gemini Omni Flash 平均每条视频仅耗时 45.0 秒,是全榜耗时最短的模型;Seedance 2.5 为 894.0 秒,为全榜耗时最长的模型,两者相差近 20 倍;MiniMax H3 耗时也需 538.1 秒。
质量与效率的权衡在头部模型依然存在:综合 ELO 前两名 Seedance 2.5 与 MiniMax H3 的生成耗时都在 500 秒以上;而综合第五的 Gemini Omni Flash 耗时在 60 秒以内;本次配置下,三款模型的单次生成等待时间差异明显;实际选型还需结合并发能力、质量要求与输出规格。
模型能力 × 实际价格:综合表现与视频成本并不同步

按实际价格看,MiniMax H3 为 19.9 元/条,略低于 Gemini Omni Flash 的 21.4 元/条;Seedance 2.5 则为 98.5 元/条,约为 Gemini Omni Flash 的 4.6 倍。
按单条价格算,Gemini Omni Flash 的 7.5元/条最低;
按首抽率折算后,MiniMax H3 实际价格为 19.9元/条,低于 Gemini Omni Flash 的 21.4元/条。
Seedance 2.5 在两种口径下都是成本最高的一款,能力最高与成本最高集中在同一款模型上。
成功率与首次抽卡率:成功率与首抽率呈现不同排序
成功率反映生成稳定性,首次抽卡率反映首次生成即可用的概率。
成功率的实际差异集中在 Seedance 2.5 与其余三款之间:Wan 3.0(99.0%)、MiniMax H3(98.0%)、Gemini Omni Flash(97.3%)均处榜单高位,Seedance 2.5 为 83.5%,不过已较上一代的 72.2% 有所改善。
首次抽卡率的差异更为明显:MiniMax H3 为 60.2%,为四款新模型最高,超过六成的生成第一次即可用;Wan 3.0 为 41%,Gemini Omni Flash 为 35%,实际使用中通常需要更多生成与筛选才能获得满意结果。Seedance 2.5 首抽率为 46.1%,位列第二,高于其成功率排位。
综合判断
Seedance 2.5 位列本期榜单第一,在八个内容维度与六个场景中均保持领先;同时,其实际价格和生成耗时也均为本轮四款新模型中最高。
其余三款新模型呈现出不同的能力特点:MiniMax H3 整体表现均衡,排名、成本和生成稳定性均处于较为稳定的水平;Wan 3.0 在游戏/互动与教育/科研两个场景位列第二,成功率达到 99.0%,不同场景之间的表现差异较为明显;Gemini Omni Flash 在参评模型中生成速度最快,综合排名位居第五,在部分内容维度与场景维度中的排名则低于综合位次,它的优势更侧重速度。
不同维度与场景之间的表现差异也说明,综合排名并不能完全代表模型在具体任务中的实际表现。对于实际选型,综合榜单可用于了解模型整体表现,内容维度可用于观察基础能力,场景维度可用于评估不同任务下的表现差异,效率与成本则需要结合生成规格及业务预算综合考量。
注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。
写在最后
最新多模态模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据: