Qwen3.8-Omni-Flash 发布:1M 上下文 + 原生全模态,四步跑通音视频 API

今天(9 月 18 日)阿里千问团队发了 Qwen3.8-Omni-Flash,官方中文标题叫「耳聪目明,办事得力」。

如果你只想记一件事:上一代全模态模型解决的是「听懂、看懂」,这一代开始解决「把活干完」。它在音视频场景里能自己规划任务、调用工具、交付结果,官方管这个叫 Agentic 能力。所以宣传重点不是刷榜,而是视频剪辑、影视解说、会议纪要、声音与画面协同分析这类真实工作流。

我把官方博客和百炼模型页翻了一遍,下面分「它是什么」「怎么用(含完整代码)」「多少钱」「坑在哪」四部分讲清楚。

01 它是什么:四类输入进,一种输出出

先说一个常被搞混的概念。「原生全模态」指的是文本、图片、音频、视频四类输入在同一个模型里理解,不是外挂一个转写模型再接一个大模型。这两者的差别,体现在长音频、多说话人、画面和声音要一起判断的场景里。

官方给的参数(来自阿里云百炼模型页,页面更新时间 2026-09-18):

项目 说明
输入模态 文本、图片、音频、视频
输出模态 仅文本,不含语音输出
上下文长度 1M Token
最大输入长度 991,808 Token(非思考模式)/ 983,616 Token(思考模式)
最大输出长度 131,072 Token
调用方式 Chat Completions、Responses
工具能力 Function Calling、联网搜索
音频输入语种 113 种语言和方言,支持多通道空间音频
支持地域 北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚

表格里有两行最容易被忽略。

一是「输出模态:仅文本」。官方文档写得很直白,需要语音输出请改用 qwen3.5-omni-plus。这意味着它做不了配音、语音助手这类要「开口」的活,强项是理解音频视频然后给文本结果。

二是 6 个地域各自独立,API Key 必须和地域匹配。拿北京地域的 Key 去请求新加坡端点会直接报错,这是新手最容易卡住的地方。

另外,思考模式默认开启,可以调节思考强度。这点在算成本时要留意,思考过程本身也计入输出 Token。

02 四步跑通 API

想先试效果,直接打开 Qwen Studio(chat.qwen.ai),上传一段录音或视频提问就行,零代码。

要接进自己系统,按下面四步走。

第一步:开通百炼,拿对应地域的 Key

  1. 用阿里云账号登录百炼控制台,首次开通会自动发放新人免费额度
  2. 创建 API Key,并确认它属于哪个地域(业务空间)
  3. 记下这个地域对应的服务地址(base_url),第二步要用

地域和 Key 不匹配是新手最容易卡住的一步,先确认清楚再往下走。

第二步:装 OpenAI SDK,配好 base_url

Qwen3.8-Omni-Flash 兼容 OpenAI 协议,所以官方示例直接用 OpenAI 的 Python SDK。把 base_url 换成你的地域地址,模型名固定填 qwen3.8-omni-flash

bash 复制代码
python3 -m pip install openai
export DASHSCOPE_API_KEY="你的 API Key"
export DASHSCOPE_BASE_URL="你的业务空间 Chat Completions 地址"
export AUDIO_URL="https://你的可访问域名/meeting.wav"

第三步:传入音频,让它总结会议录音

音频走 input_audio 字段,data 填可公网访问的音频 URL,formatwav。官方说明音频输入支持 113 种语言和方言,中文会议、方言访谈都可以直接丢进去。

python 复制代码
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ["DASHSCOPE_BASE_URL"],
)

completion = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "总结这段录音的主要内容,列出待办事项。"},
            {"type": "input_audio", "input_audio": {
                "data": os.environ["AUDIO_URL"],
                "format": "wav",
            }},
        ],
    }],
    stream=True,
    stream_options={"include_usage": True},
)

section = None
for chunk in completion:
    if not chunk.choices:
        if chunk.usage:
            print("\n用量:", chunk.usage)
        continue
    delta = chunk.choices[0].delta
    if getattr(delta, "reasoning_content", None):
        if section != "thinking":
            print("\n思考过程:")
            section = "thinking"
        print(delta.reasoning_content, end="", flush=True)
    if delta.content:
        if section != "answer":
            print("\n模型回复:")
            section = "answer"
        print(delta.content, end="", flush=True)

如果你要处理双声道或四声道的空间音频,在音频对象里加一个 "use_multichannel": True(与 dataformat 同级),默认是 False,按单通道解析。这是它区别于普通转写模型的地方:声音的方向和距离信息会保留下来。

第四步:传入视频,先控画面 Token

视频是最费钱的一环,因为画面会按帧折算成 Token。官方建议先用 max_pixels 控制画面精度,再决定要不要整段丢进去。

使用场景 推荐视频长度 max_pixels 推荐值
快速审核,成本优先 ≤60 分钟 230,400
标准分析(短视频打标) ≤4 分钟 921,600 ~ 2,073,600
精细分析(多说话人、复杂场景) ≤2 分钟 2,073,600
python 复制代码
response = client.responses.create(
    model="qwen3.8-omni-flash",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "描述视频中的画面和声音,并给出关键时间点。"},
            {"type": "input_video", "video_url": os.environ["VIDEO_URL"]},
        ],
    }],
    stream=False,
)

print(response.output_text)

注意音频和视频在 Chat Completions 与 Responses 两种协议里的字段写法不同:Chat Completions 用 input_audio.data,Responses 用 input_audio.audio_url,视频对应 input_video.video_url。另外音视频输入只允许出现在 user 消息里。

03 多少钱:国内价格与两个省钱细节

中国内地调用价(元 / 百万 Token):输入 0.8、缓存命中输入 0.1、输出 2.7。国际站同口径是 1.094 / 0.117 / 3.427。

两个容易被误读的地方:

  1. 「音频输入成本降 98%」是相对降幅,不是每小时多少钱。官方对比的是上一代 Qwen3.5-Omni-Plus,真实花费仍然按 Token 单价算。把它理解成「每小时音频只要几毛钱」,很容易在长素材上算错预算。
  2. 缓存命中是真的省钱,把输入成本降到 1/8。普通缓存命中输入 0.1 元,比标准输入 0.8 元低 87.5%,同一段素材反复追问时差距会放大。反过来说,每次都换新素材、缓存命中不了,就是实打实的 0.8 元档。

给个直观量级:一段约 1500 到 2000 Token 的回复,输出成本大约 0.004 到 0.005 元。把 1M 上下文一次性塞满,输入成本是 0.8 元,命中缓存则只需 0.1 元。这两个数按官方单价线性换算得出,是估算值,实际账单以控制台为准。

免费额度方面:首次开通阿里云百炼的账号,系统自动发放,无需手动领取。按模型独立发放,通常每个模型 100 万 Token,输入输出共用。有效期 90 天,从开通百炼、模型发布或申请通过之日起算,以较晚者为准。只有华北2(北京)地域的模型享有免费额度。未实名认证的账号额度用完后无法继续调用,已认证账号会自动转按量付费,建议在控制台开启「免费额度用完即停」。

04 比上一代强在哪

官方给的对比口径是:累计 29 项评测平均提升超 25%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。挑几个能看出方向的提升值:

  • 音视频 Agent 能力:WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 拿到 69.6 分
  • 长音频与音视频理解:LongAudioSpan 提升 8.3 分,OmniVideoBench 提升 9.6 分
  • 音视频描述:OmniCap-IF 的 CSR 与 ISR 分别提升 8.5 和 14.1 分
  • 多人会议识别:AliMeeting 的 DER 与 cpWER 从 88.11 / 89.61 降到 3.35 / 17.18,这条对做会议纪要的人意义最大

另一个值得单看的是它处理长视频的方式变了。以前要模型从头到尾把整段视频看完,现在是「按需取证」:模型从你的问题出发,自己决定该看哪几分钟、听哪几段,多轮由粗到细地找证据。

官方在 OmniVideoBench 上的数字是:准确率从 63.4 提到 67.8 分,单次查询的 Token 消耗从 145,736 降到 79,117,降了约 45.7%。也就是说,省 Token 不等于降准确率,反而是更准了。

05 三个最容易踩的坑

  1. 以为它能「说」。输出模态只有文本。如果你要的是语音回复、声音复刻,用 qwen3.5-omni-plus 或 qwen3.5-omni-flash,别在这个模型上反复试。
  2. API Key 的地域和端点不一致。6 个地域各自独立,Key 也只对同一地域有效。报鉴权错误时,先检查 Key 属于哪个地域,再看 base_url。
  3. 把两三个小时的视频整段丢进去。官方博客写明原生支持最长 1 小时的音视频输入,更长的素材建议分段处理。同时思考模式默认开启,思考过程计入输出 Token,长视频会把这部分成本放大。

06 不用写代码的玩法:装进 Claude Code、Codex

除了直接调 API,官方还开源了一套插件 Qwen-MM-Plugins,把图片、音频、视频、文档理解能力装进你已经在用的 Agent 里。目前 2.9k star、178 fork,最新一次提交的说明里明确把 Omni 的默认模型指向了 qwen3.8-omni-flash,说明插件已经在跟新模型对齐。

六个插件各有分工:core 读图片、视频帧、PDF、Office 等文件,api 做图片理解、OCR、音视频转写、说话人分离、事件分析,omni-chatcut 做 MV 和影视解说,omni-video2note 把视频教程整理成带截图的 PDF 笔记,omni-skill-creator 把操作演示提炼成可复用的 Skill,omni-memory 给长视频建立人物与事件记忆。

安装方式是官方引导脚本,支持 Codex、Claude Code、Qwen Code、Gemini CLI 等:

bash 复制代码
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

装完重启 Agent 或新建任务即可。

07 小结

Qwen3.8-Omni-Flash 的用法可以压缩成三句话:想试效果就用 Qwen Studio 上传音视频;要接系统就在百炼拿对应地域的 Key,用 OpenAI 协议调 qwen3.8-omni-flash,音频走 input_audio、视频走 input_video;成本按 Token 算,输入 0.8 元、缓存命中 0.1 元、输出 2.7 元(每百万 Token),缓存命中能把输入成本压到 1/8。

上手顺序上,建议先用一段自己的会议录音跑第三步,确认返回质量后再上视频,并且一开始就给 max_pixels 设一个较小的值控制成本。

参考资料

文中参数与评测数据来自 Qwen 官方博客和阿里云百炼文档。这类新模型、新工具我平时会在 AI345 上按场景翻,收录比较全,中文资料更新也快,想省事可以去逛逛。

相关推荐
论文复现现场1 小时前
ComfyUI 怎么同时调用 4 张/8 张 RTX 4090?AI 视频批量生成的多实例队列与 Python 调度方案
人工智能·python·comfyui·rtx4090
泡海椒1 小时前
评分系统最佳实践:JQuick-Java实现权重、阈值动态配置评分
java·人工智能·python
云上工程笔记1 小时前
星图AstraFlow接入MiniMax-H3/H3-Max实战:文字/单图生成视频怎么用?附提示词与选型
人工智能
7177771 小时前
国内组件安全扫描工具选哪家:2026年主流方案对比与选型指南
人工智能·gitee
智购科技自动售卖机厂家2 小时前
设备一到夏天就频繁跳闸,从启动电流追到压缩机电容~YH
数据结构·人工智能·python·eclipse
风合星语2 小时前
2026 机器人行业观察(三):机器人走进酒店和门店——完成一次演示,和顶一个班差在哪?
人工智能·机器人·具身智能·人形机器人·人机协作
优氙费控2 小时前
电子发票报销怎么管理?采集、验真、报销、归档全流程
大数据·人工智能
昇腾知识体系2 小时前
昇腾训练性能分析实战:torch_npu profiler 从采集到 kernel_details 解读
人工智能·华为·知识图谱
residual_fan2 小时前
航空发动机故障诊断专用智能体(一):小样本与高不平衡下的工程挑战
人工智能·数据挖掘·数据分析