今天(9 月 18 日)阿里千问团队发了 Qwen3.8-Omni-Flash,官方中文标题叫「耳聪目明,办事得力」。
如果你只想记一件事:上一代全模态模型解决的是「听懂、看懂」,这一代开始解决「把活干完」。它在音视频场景里能自己规划任务、调用工具、交付结果,官方管这个叫 Agentic 能力。所以宣传重点不是刷榜,而是视频剪辑、影视解说、会议纪要、声音与画面协同分析这类真实工作流。
我把官方博客和百炼模型页翻了一遍,下面分「它是什么」「怎么用(含完整代码)」「多少钱」「坑在哪」四部分讲清楚。
01 它是什么:四类输入进,一种输出出
先说一个常被搞混的概念。「原生全模态」指的是文本、图片、音频、视频四类输入在同一个模型里理解,不是外挂一个转写模型再接一个大模型。这两者的差别,体现在长音频、多说话人、画面和声音要一起判断的场景里。
官方给的参数(来自阿里云百炼模型页,页面更新时间 2026-09-18):
| 项目 | 说明 |
|---|---|
| 输入模态 | 文本、图片、音频、视频 |
| 输出模态 | 仅文本,不含语音输出 |
| 上下文长度 | 1M Token |
| 最大输入长度 | 991,808 Token(非思考模式)/ 983,616 Token(思考模式) |
| 最大输出长度 | 131,072 Token |
| 调用方式 | Chat Completions、Responses |
| 工具能力 | Function Calling、联网搜索 |
| 音频输入语种 | 113 种语言和方言,支持多通道空间音频 |
| 支持地域 | 北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚 |
表格里有两行最容易被忽略。
一是「输出模态:仅文本」。官方文档写得很直白,需要语音输出请改用 qwen3.5-omni-plus。这意味着它做不了配音、语音助手这类要「开口」的活,强项是理解音频视频然后给文本结果。
二是 6 个地域各自独立,API Key 必须和地域匹配。拿北京地域的 Key 去请求新加坡端点会直接报错,这是新手最容易卡住的地方。
另外,思考模式默认开启,可以调节思考强度。这点在算成本时要留意,思考过程本身也计入输出 Token。
02 四步跑通 API
想先试效果,直接打开 Qwen Studio(chat.qwen.ai),上传一段录音或视频提问就行,零代码。
要接进自己系统,按下面四步走。
第一步:开通百炼,拿对应地域的 Key
- 用阿里云账号登录百炼控制台,首次开通会自动发放新人免费额度
- 创建 API Key,并确认它属于哪个地域(业务空间)
- 记下这个地域对应的服务地址(base_url),第二步要用
地域和 Key 不匹配是新手最容易卡住的一步,先确认清楚再往下走。
第二步:装 OpenAI SDK,配好 base_url
Qwen3.8-Omni-Flash 兼容 OpenAI 协议,所以官方示例直接用 OpenAI 的 Python SDK。把 base_url 换成你的地域地址,模型名固定填 qwen3.8-omni-flash。
bash
python3 -m pip install openai
export DASHSCOPE_API_KEY="你的 API Key"
export DASHSCOPE_BASE_URL="你的业务空间 Chat Completions 地址"
export AUDIO_URL="https://你的可访问域名/meeting.wav"
第三步:传入音频,让它总结会议录音
音频走 input_audio 字段,data 填可公网访问的音频 URL,format 填 wav。官方说明音频输入支持 113 种语言和方言,中文会议、方言访谈都可以直接丢进去。
python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "总结这段录音的主要内容,列出待办事项。"},
{"type": "input_audio", "input_audio": {
"data": os.environ["AUDIO_URL"],
"format": "wav",
}},
],
}],
stream=True,
stream_options={"include_usage": True},
)
section = None
for chunk in completion:
if not chunk.choices:
if chunk.usage:
print("\n用量:", chunk.usage)
continue
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
if section != "thinking":
print("\n思考过程:")
section = "thinking"
print(delta.reasoning_content, end="", flush=True)
if delta.content:
if section != "answer":
print("\n模型回复:")
section = "answer"
print(delta.content, end="", flush=True)
如果你要处理双声道或四声道的空间音频,在音频对象里加一个 "use_multichannel": True(与 data、format 同级),默认是 False,按单通道解析。这是它区别于普通转写模型的地方:声音的方向和距离信息会保留下来。
第四步:传入视频,先控画面 Token
视频是最费钱的一环,因为画面会按帧折算成 Token。官方建议先用 max_pixels 控制画面精度,再决定要不要整段丢进去。
| 使用场景 | 推荐视频长度 | max_pixels 推荐值 |
|---|---|---|
| 快速审核,成本优先 | ≤60 分钟 | 230,400 |
| 标准分析(短视频打标) | ≤4 分钟 | 921,600 ~ 2,073,600 |
| 精细分析(多说话人、复杂场景) | ≤2 分钟 | 2,073,600 |
python
response = client.responses.create(
model="qwen3.8-omni-flash",
input=[{
"role": "user",
"content": [
{"type": "input_text", "text": "描述视频中的画面和声音,并给出关键时间点。"},
{"type": "input_video", "video_url": os.environ["VIDEO_URL"]},
],
}],
stream=False,
)
print(response.output_text)
注意音频和视频在 Chat Completions 与 Responses 两种协议里的字段写法不同:Chat Completions 用 input_audio.data,Responses 用 input_audio.audio_url,视频对应 input_video.video_url。另外音视频输入只允许出现在 user 消息里。
03 多少钱:国内价格与两个省钱细节
中国内地调用价(元 / 百万 Token):输入 0.8、缓存命中输入 0.1、输出 2.7。国际站同口径是 1.094 / 0.117 / 3.427。
两个容易被误读的地方:
- 「音频输入成本降 98%」是相对降幅,不是每小时多少钱。官方对比的是上一代 Qwen3.5-Omni-Plus,真实花费仍然按 Token 单价算。把它理解成「每小时音频只要几毛钱」,很容易在长素材上算错预算。
- 缓存命中是真的省钱,把输入成本降到 1/8。普通缓存命中输入 0.1 元,比标准输入 0.8 元低 87.5%,同一段素材反复追问时差距会放大。反过来说,每次都换新素材、缓存命中不了,就是实打实的 0.8 元档。
给个直观量级:一段约 1500 到 2000 Token 的回复,输出成本大约 0.004 到 0.005 元。把 1M 上下文一次性塞满,输入成本是 0.8 元,命中缓存则只需 0.1 元。这两个数按官方单价线性换算得出,是估算值,实际账单以控制台为准。
免费额度方面:首次开通阿里云百炼的账号,系统自动发放,无需手动领取。按模型独立发放,通常每个模型 100 万 Token,输入输出共用。有效期 90 天,从开通百炼、模型发布或申请通过之日起算,以较晚者为准。只有华北2(北京)地域的模型享有免费额度。未实名认证的账号额度用完后无法继续调用,已认证账号会自动转按量付费,建议在控制台开启「免费额度用完即停」。
04 比上一代强在哪
官方给的对比口径是:累计 29 项评测平均提升超 25%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。挑几个能看出方向的提升值:
- 音视频 Agent 能力:WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 拿到 69.6 分
- 长音频与音视频理解:LongAudioSpan 提升 8.3 分,OmniVideoBench 提升 9.6 分
- 音视频描述:OmniCap-IF 的 CSR 与 ISR 分别提升 8.5 和 14.1 分
- 多人会议识别:AliMeeting 的 DER 与 cpWER 从 88.11 / 89.61 降到 3.35 / 17.18,这条对做会议纪要的人意义最大
另一个值得单看的是它处理长视频的方式变了。以前要模型从头到尾把整段视频看完,现在是「按需取证」:模型从你的问题出发,自己决定该看哪几分钟、听哪几段,多轮由粗到细地找证据。
官方在 OmniVideoBench 上的数字是:准确率从 63.4 提到 67.8 分,单次查询的 Token 消耗从 145,736 降到 79,117,降了约 45.7%。也就是说,省 Token 不等于降准确率,反而是更准了。
05 三个最容易踩的坑
- 以为它能「说」。输出模态只有文本。如果你要的是语音回复、声音复刻,用 qwen3.5-omni-plus 或 qwen3.5-omni-flash,别在这个模型上反复试。
- API Key 的地域和端点不一致。6 个地域各自独立,Key 也只对同一地域有效。报鉴权错误时,先检查 Key 属于哪个地域,再看 base_url。
- 把两三个小时的视频整段丢进去。官方博客写明原生支持最长 1 小时的音视频输入,更长的素材建议分段处理。同时思考模式默认开启,思考过程计入输出 Token,长视频会把这部分成本放大。
06 不用写代码的玩法:装进 Claude Code、Codex
除了直接调 API,官方还开源了一套插件 Qwen-MM-Plugins,把图片、音频、视频、文档理解能力装进你已经在用的 Agent 里。目前 2.9k star、178 fork,最新一次提交的说明里明确把 Omni 的默认模型指向了 qwen3.8-omni-flash,说明插件已经在跟新模型对齐。
六个插件各有分工:core 读图片、视频帧、PDF、Office 等文件,api 做图片理解、OCR、音视频转写、说话人分离、事件分析,omni-chatcut 做 MV 和影视解说,omni-video2note 把视频教程整理成带截图的 PDF 笔记,omni-skill-creator 把操作演示提炼成可复用的 Skill,omni-memory 给长视频建立人物与事件记忆。
安装方式是官方引导脚本,支持 Codex、Claude Code、Qwen Code、Gemini CLI 等:
bash
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash
装完重启 Agent 或新建任务即可。
07 小结
Qwen3.8-Omni-Flash 的用法可以压缩成三句话:想试效果就用 Qwen Studio 上传音视频;要接系统就在百炼拿对应地域的 Key,用 OpenAI 协议调 qwen3.8-omni-flash,音频走 input_audio、视频走 input_video;成本按 Token 算,输入 0.8 元、缓存命中 0.1 元、输出 2.7 元(每百万 Token),缓存命中能把输入成本压到 1/8。
上手顺序上,建议先用一段自己的会议录音跑第三步,确认返回质量后再上视频,并且一开始就给 max_pixels 设一个较小的值控制成本。
参考资料
- Qwen 官方博客:https://qwen.ai/blog?id=qwen3.8-omni-flash
- 阿里云百炼模型信息页:https://help.aliyun.com/zh/model-studio/qwen3-8-omni-flash
- 官方 Qwen-Omni 调用指南:https://help.aliyun.com/zh/model-studio/qwen-omni
- Qwen-MM-Plugins 仓库:https://github.com/QwenLM/Qwen-MM-Plugins
文中参数与评测数据来自 Qwen 官方博客和阿里云百炼文档。这类新模型、新工具我平时会在 AI345 上按场景翻,收录比较全,中文资料更新也快,想省事可以去逛逛。