8月24日,阿里云把视频生成大模型 Wan3.0 从公测转为正式上线。它的卖点很直白:单次最多生成 30 秒视频,支持 1080P 输出,而且第一次把文档、PPT、表格这类办公素材直接当输入喂给模型。对做内容、做产品的团队来说,这件事值得花几分钟了解一下。
它到底是个什么东西
按阿里云官方文档的说法,wan3.0-video 是"全能参考视频生成模型(All-in-One)",输入支持文本、图片、视频、音频、文件和链接六种模态,输出只有视频。这和之前大多数视频模型"文生视频、图生视频分开两个模型"的玩法不一样,它是把首帧生视频、尾帧生视频、参考生视频统一到一个模型里,一次调用搞定。
和上一代比,变的地方主要有三点:
- 时长:单段从几秒拉到 30 秒。30 秒意味着能讲完一个小情节,连续运镜、一镜到底这类镜头语言才施展得开,而不是只能出一段"氛围感空镜"。
-
- 输入:首次支持 doc、xls、ppt、pdf、md 等文档格式输入。据报道,单个文件或链接不超过 100MB、50 页。教学课件、产品演示、业务汇报这些现成素材可以直接转视频,不用先人工拆成提示词。
-
- 分辨率 :官方文档写明支持 480P、720P、1080P 三档输出。
没变的也有:它仍然是个"生成式"工具,不保证输出画面完全符合物理规律,文字、手部细节这类老问题该有还是有;官方文档的能力表里明确标注不支持联网搜索、Function Calling、模型调优------也就是说它是个纯生成器,不是 Agent,不能指望它自己查资料、调工具。
- 分辨率 :官方文档写明支持 480P、720P、1080P 三档输出。
对普通开发者意味着什么
最直接的变化是:视频生成从"演示级"往"工程级"挪了一步。30 秒时长 + 文档输入 + 明确的分辨率档位和按秒计费,意味着可以正经考虑用 API 把它接进业务流程了------比如把周报转成 30 秒短视频、把产品文档转成演示视频、把数据分析结果转成动态图表视频。
但也要认清一点:它降低的是"生成视频"的门槛,不是"做好视频"的门槛。提示词怎么组织、文档怎么排版、镜头逻辑怎么设计,这些活儿省不掉。
另外注意下时间线:Wan3.0 是 8 月 6 日开启公测的(据报道),到今天正式上线,中间隔了半个多月,说明产品方把公测反馈消化了一轮才转正。对开发者来说,跟着这个节奏走就行------公测期摸能力、正式版再上生产,别在公测阶段就把核心流程绑死在上面,接口和参数可能还会动。
怎么用、怎么选、有哪些坑
两条使用路径:
- 官方网页端:通义万相 / 百炼控制台直接体验,适合先看效果。
-
- API 接入:百炼 Model Studio 提供
wan3.0-video模型,按秒计费。
价格(据阿里云官方文档,华北2北京区原价):
- API 接入:百炼 Model Studio 提供
| 分辨率 | 单价(元/秒) | 30秒一条 |
|---|---|---|
| 480P | 0.3 | 约9元 |
| 720P | 0.6 | 约18元 |
| 1080P | 1.2 | 约36元 |
批量生产前先算清楚预算,别全量跑 1080P。
API 调用示意 (框架参考阿里云百炼官方文档,wan3.0-video 的具体请求字段以官方文档为准):
python
# 参考:https://help.aliyun.com/zh/model-studio/wan3-0-video
# 需要:pip install dashscope,并配置 DASHSCOPE_API_KEY
import os
import dashscope
from dashscope import MultiModalConversation
dashscope.api_key = os.getenv("DASHSCOPE_API_KEY")
response = MultiModalConversation.call(
model="wan3.0-video",
messages=[{
"role": "user",
"content": [
{"text": "把这份产品介绍做成一段30秒的竖屏视频,节奏明快"},
],
}],
# 分辨率、时长等业务参数以官方文档为准
)
print(response.output)
```
**哪些场景适合先用:**内容团队做宣传片初稿、运营做周报/月报视频化、培训部门把课件转讲解视频,这些是投入产出比最高的地方------素材现成、时长要求不高、错了重跑成本低。反过来,对画面精度要求极高(比如产品广告、医疗演示)的场景,先别急着上,等模型再迭代几轮。
**怎么选模型:**和同类视频模型比,别只看样片,要看三个工程指标------单段最长时长(决定叙事上限)、输入模态(文档输入是这代最明显的差异化点)、按秒单价。不少团队评估时只看效果样片,上了生产才发现时长不够用、输入格式对不上,返工成本比模型钱贵多了。
**几个实际坑:**
- 文档输入有大小和页数限制(据报道单文件不超 100MB、50 页),长文档要先切片再喂。
- - 生成内容可能和文档对不上,尤其数据表格,上线前必须人工校对一遍。
- - 按秒计费 + 高分辨率,批量任务成本涨得很快,先小批量验证再放大。
- - 商用场景先过合规:素材版权、内容审核都要提前想清楚。
## 结尾
Wan3.0 正式上线,把视频生成从"玩票"往前推了一步,文档输入这个点对打工人确实实用。不过话说回来,模型再强,也架不住需求方看完说一句"这里再改改"。你怎么看,评论区聊聊。