一文读懂Qwen-Audio-3.1核心基础知识:从语音识别到可控声景与实时Agent

写在前面

欢迎大家关注Rocky的知乎:Rocky Ding

《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~

Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

一副AI眼镜听见"帮我订明天上午的票",完成一次转写并不难。难的是,用户紧接着说"等等,改成下午,两个人",系统能否及时停下旧回复、更新条件,并分清上一笔操作究竟还没执行,还是已经提交。

一段播客也类似。读出两个人的台词只是起点,让不同角色保持音色、在恰当的位置接话,让背景雨声、开门声与对白共同构成一个可信场景,要求模型管理的不只是文字,还有时间、声音事件和连续状态。

Qwen-Audio-3.1将这两类问题放进同一个产品家族:ASR处理语音识别与结构化转写,ASR-Next扩展音频理解,TTS负责可控人声,TTS-Next面向完整音频创作,Realtime承担持续语音交互。1

图1:Qwen-Audio-3.1的官方发布概览。识别、合成与实时对话之外,两条Next产品线进一步面向泛音频理解和统一音频生成。1

Rocky认为,Qwen-Audio-3.1最值得研究的主线,是音频模型开始把文字、说话人、时间、声场和任务状态放进同一套交互过程。 模型能力扩展之后,工程的难点随之转移:听懂了哪些内容、保留了哪些证据、何时应该回应、何时必须停止,以及执行结果能否被验证。

要理解这次升级,需要同时看能力机制、评测定义与接口约束。本文将官方公布的结果、可核验的API行为和工程推导分别说明;对尚未公开的模型结构、训练配方和性能条件保留边界。

1. Qwen-Audio-3.1的五条能力线,解决的是五类不同问题

"语音大模型"是一个宽泛名称。把所有能力都放在这一个标签里,很容易误把某个子模型的指标套给整个系列。

能力线 核心输入与输出 关键验收问题
Qwen-Audio-3.1-ASR 语音→文字、时间与说话人信息 字词是否正确,谁说的,何时说的,润色是否改变语义
Qwen-Audio-3.1-ASR-Next 音频→转写、声音描述、事件定位、问答 对环境声与情绪的判断有没有音频依据
Qwen-Audio-3.1-TTS 文本与表达控制→语音 发音、音色、情绪、语速与跨语言表现是否稳定
Qwen-Audio-3.1-TTS-Next 文本、时间戳、参考音频→完整音频 多角色、背景与事件能否协调,时间和局部修改是否可控
Qwen-Audio-3.1-Realtime 持续音频/文本输入→流式语音/文本与工具调用 能否正确接话、被打断、保留约束并完成任务

图2:按输入、输出与验收目标整理的能力关系。它是任务地图,不是五个模型共享同一骨干网络的架构图。

发布介绍明确给出了ASR、TTS、TTS-Next和Realtime的模型入口,ASR-Next则注明API即将上线。1--5 因此,"五款模型发布"与"五款API已经全部可调用"不能混为一谈。ASR-Next的评测表使用了更具体的Qwen-Audio-3.1-ASR-Flash-Next名称,实际接入时应以开放后的模型ID为准。

同样,这次公开信息主要支持产品能力和接口分析。本次核验的材料没有给出足以复现整个系列的参数规模、训练数据配比、完整损失函数或模型权重说明。API可用并不自动等于权重开源,"下代架构"也不足以推出具体的音频编码器、离散tokenizer或生成网络类型。

Realtime的多教师蒸馏是官方明确提到的训练方向,但教师数量、教师分工与蒸馏权重尚不足以重建。对研究者来说,应该把它当作需要进一步验证的技术线索,而不是已经可以照着实现的完整配方。

2. Qwen-Audio-3.1-ASR:转写开始管理结构,也开始承担语义责任

传统ASR常被表述为从声学序列 x 1 : T x_{1:T} x1:T 预测文字序列 y y y:

y ^ = arg ⁡ max ⁡ y P ( y ∣ x 1 : T ) . \hat y=\arg\max_y P(y\mid x_{1:T}). y^=argymaxP(y∣x1:T).

这是一种任务抽象,并不指定实际模型采用CTC、Transducer还是自回归解码。Qwen-Audio-3.1-ASR的公开能力将输出扩展到了说话人标签、时间戳和文本的联合组织,同时支持上下文增强、热词和转写润色。1--2

一个更贴近会议场景的输出单位,可以抽象为:

z i = ( s i , t i s t a r t , t i e n d , y i ) , z_i=(s_i,t_i^{start},t_i^{end},y_i), zi=(si,tistart,tiend,yi),

其中 s i s_i si 是说话人标识,两个时间值定位音频区间, y i y_i yi 是该段内容。这里的元组用于说明信息结构,不是官方API的字段声明。

联合输出的价值在于,后续系统可以围绕"某个人在某个时间提出了某个约束"组织知识,而不只是保存一大段没有归属的文字。但输出字段齐全,只说明结构完整;每个字段是否正确仍然需要分别评估。

2.1 上下文和热词改善识别,也可能引入偏置

官方公布ASR支持30种语言、16种中文方言,并增强行业词、专业实体、分级热词和长音频上下文的一致性。1 同一个人名在会议前半段已经出现,后续识别利用历史信息统一写法,这对会议记录和行业服务很有价值。

但上下文也是一种先验。热词权重过强时,模糊声音可能被吸引到某个预设词;历史记录一旦识别错误,错误也可能被连续复用。产品验收因此不能只统计总体错误率,还应该检查关键实体、金额、日期、否定词与纠正语句。

例如,"不是三十万,是十三万"即使只错了一个小片段,也可能比普通段落漏掉几个语气词严重得多。字符层面的平均分与业务损失之间,并不存在固定比例。

2.2 原生润色提高可读性,也需要保留证据层

去掉"嗯、啊"、重复句和自我修正,可以显著提高转写稿的可读性。但润色本身在做语义变换,它可能改变时间、否定、条件和说话人的确定程度。

图3:说明性例子。阅读层可以整理表达,证据层应保留纠正过程、时间定位和音频引用。图中文字不是模型实测结果。

一个适合落地的设计,是分别保存接近音频内容的证据记录与方便阅读的整理文本。两者通过片段ID、时间戳和版本相连。这样,用户读到"改为周五发送"时,可以回到音频确认"周三"确实已经被纠正。

对于会议纪要,整理可能是默认需求;对于争议核验、专业访谈或需要精确引用的场景,逐字保真往往更重要。系统应把"听到了什么"和"整理后怎样表达"作为两个可区分的产物。

还有一个细节:说话人分离通常给出的是片段中的相对身份,如speaker_1。它不自动证明这个人就是现实中的某位员工,更不等于身份认证。将标签绑定到姓名,需要额外证据与业务流程。

3. Qwen-Audio-3.1评测:4.55%、10.38%和82.10%回答的是不同问题

这次发布包含公开方言数据集、内部方言测试以及多人分角色转写三组主要证据。它们的任务、分母和评分方式不同,需要逐一解释。

3.1 CER衡量文字编辑距离,不能代替语义与人物归属

字错误率CER的标准形式是:

C E R = S + D + I N , \mathrm{CER}=\frac{S+D+I}{N}, CER=NS+D+I,

其中 S , D , I S,D,I S,D,I 分别为替换、删除与插入的字符数, N N N 为参考文本字符数。CER越低通常越好,但它不直接告诉我们哪些错误改变了语义,也不判断内容归属给了谁。

在KeSpeech和WSYue共11个子集中,官方报告Qwen-Audio-3.1-ASR平均CER为4.55%,6个子集最优。1

图4:公开方言数据的官方比较。图中KeSpeech标注为AST,WSYue标注为ASR,虽然纵轴都使用CER,但参考文本对应的任务含义不同。1

ASR主要回答语音中的文字是什么,AST则涉及把源语音表达转换到目标语言或目标表达体系。对方言翻译输出计算CER,与对方言逐字转写计算CER,不能当作同一个测试条件。

平均值也必须有口径:各子集等权平均与按参考字符数汇总,可能给出不同结果。这里沿用官方4.55%的汇总值,不将它扩展成"所有方言日常识别的错误率"。尤其不能通过 1 − C E R 1-\mathrm{CER} 1−CER 直接得到"语义理解准确率"。

3.2 内部方言ASR与AST,分别看文字保真和意思保真

在16种中文方言的内部ASR测试中,官方报告平均CER为10.38%,11个方言子集最优。1

图5:内部方言转写的CER比较。温州话等困难子集仍明显高于较容易子集,平均分不能掩盖尾部场景。1

这组数据与公开集4.55%并不矛盾。音频质量、方言分布、说话方式、参考标注和任务难度都可能不同。将两者相减,既不能说明版本退步,也不能说明真实场景的泛化差距就是5.83个百分点。

在11个内部AST子集中,官方报告平均语义句准率82.10%,其中10个子集最优。1

图6:方言转普通话任务的语义句准率,数值越高越好。它与CER的方向和评分粒度都不同,不能横向放进同一列"准确率"。1

语义句准率更接近"整句意思有没有保住",但发布材料未完整交代判分规则、样本量、人工或模型裁判设置及置信区间。因而这些结果支持官方测试条件下的比较,尚不足以证明任何口音、噪声或行业场景都能获得同样收益。

实际选型应保留困难子集,单独报告近场与远场、独白与多人、干净与噪声、常见与长尾实体的成绩。让测试集贴近真实用户,比只追一个汇总数字更有用。

3.3 分角色转写:Next赢五项,不等于每项都赢

多人语音除了认字,还要判断谁在什么时候说话。DER是说话人分离错误率,通常将漏检语音、误检语音和说话人混淆的时长汇总,再除以参考说话人总时长:

D E R = T m i s s + T f a l s e + T c o n f u s i o n T r e f e r e n c e . \mathrm{DER}=\frac{T_{miss}+T_{false}+T_{confusion}}{T_{reference}}. DER=TreferenceTmiss+Tfalse+Tconfusion.

重叠语音是否计入、时间边界容差如何设置,会影响DER。这里介绍的是一般定义,具体比较仍需完整评测协议。

cpWER则先按说话人拼接转写序列,再在说话人标签的置换中寻找最优匹配,以计算整体词错误。这样既避免speaker_1与speaker_2编号互换导致无意义惩罚,也能反映文字和人物归属的联合错误。中文分词方式同样会影响结果。

图7:四个测试集、DER与cpWER共八项指标。完整保留比较对象与数值,避免只截取最优项。数值依据官方表格,并经结构化解析与图像核对。1

表中Flash-Next取得五项最优,Flash取得三项最优。具体来看,AliMeeting-test上的cpWER从Flash的16.00降到Next的11.95,绝对降低4.05个百分点,相对降幅约25.3%。但在MLC-SLM上,Flash的cpWER为12.31,优于Next的12.71;MagicData-RAMC的DER和cpWER也由Flash领先。

这不是需要掩盖的例外,而是选型所需的关键信息:模型版本的强弱仍然依赖任务分布与评价维度。 Next的能力范围更广,并不能自动推出它在每种会议转写任务上都更优。

相比Fun-ASR级联系统,两款模型在这张表的八项指标上都更低;但它不能单独证明优势全部来自端到端结构。训练数据、算力、后处理和任务设置都可能共同影响结果,缺少控制变量实验时,不宜把系统比较解释成纯架构因果结论。

4. Qwen-Audio-3.1-ASR-Next:声音理解需要区分观察、解释与推断

ASR-Next将对象扩展到人物情绪、环境声与机械声,支持声音描述、事件定位、音频问答与推理。1 这意味着模型要利用的不仅是语言内容,还包括韵律、声音材质、时序和多种声源之间的关系。

一个简单例子是"我没事"。如果只保留文字,正常陈述、勉强掩饰和明显疲惫可能变成同一个输入。音频中的节奏、停顿与音高变化,为理解提供了额外信息。但额外信息不意味着结论必然可靠。

可以将音频证据分为三个层次:听到两次金属碰撞是事件观察;判断可能是易拉罐碰撞是解释;推断说话人因此感到焦虑,则已经跨入更不确定的心理推断。越往后,越需要上下文与校准。

同样一段机械异响,模型能够描述"周期性摩擦声",不等于完成了设备故障诊断。健康、工业与服务场景应明确输出粒度,并允许"无法从音频确定"。拒绝补全听不见的信息,也是音频理解能力的一部分。

事件定位可以用时间交并比作为一种通用检查:

t I o U = ∣ I p r e d ∩ I r e f ∣ ∣ I p r e d ∪ I r e f ∣ , \mathrm{tIoU}=\frac{|I_{pred}\cap I_{ref}|}{|I_{pred}\cup I_{ref}|}, tIoU=∣Ipred∪Iref∣∣Ipred∩Iref∣,

其中 I p r e d I_{pred} Ipred 与 I r e f I_{ref} Iref 分别是预测和标注的时间区间。但只看tIoU还不够,还要检查事件类别、多个事件匹配以及漏检和误检。此处是可采用的评估方法,不代表官方已经用该指标公布ASR-Next成绩。

截至所核验的发布材料,环境声问答、情绪识别和时间定位没有像方言ASR那样披露完整量化结果。我们可以确认能力方向,不能据演示描述替代大规模可靠性结论。

5. Qwen-Audio-3.1-TTS与TTS-Next:从控制人声到控制完整声景

TTS-Flash侧重把文字说好:保持同一音色跨语言迁移,通过指令控制情绪、语速、音量和表达方式。3 这要求模型区分"说什么""谁来说"和"怎样说",并在生成时协调这些条件。

一种通用的任务表示为:

a ∼ P ( a ∣ x , v , e , l ) , a\sim P(a\mid x,v,e,l), a∼P(a∣x,v,e,l),

其中 x x x 为内容, v v v 为音色条件, e e e 为表达方式, l l l 为语言条件。这是条件生成的解释框架,不是对该模型内部结构的披露。

跨语言音色一致与跨语言发音准确,也需要分开测量。一段声音可能很像同一个人,却存在重音或音素错误;一段声音可能发音很好,但角色身份在连续内容中漂移。可懂度、主观自然度、音色一致性与指令遵循应该各自有验收标准。

官方合成指南已明确将qwen-audio-3.1-tts-flash列入支持情感与富语言标签的模型。例如,[excited]控制后续表达,[laughing]在当前位置插入笑声效果。8 这些已文档化的行为可以指导接入,但不能因为产品页出现通用"功能"栏目,就认定缓存、搜索、微调等所有能力都适用于每一个音频模型。

5.1 TTS-Next的任务单位变成了完整场景

TTS-Next的公开定位是统一音频生成Audiogen,输入可以包含文本、时间戳与参考音频,输出可同时包含人声、音效、环境音和背景音乐,支持多角色与音色保持。1,4

图8:解释性声景脚本。时间轴用于说明需要控制的条件,不意味着当前接口已保证独立声部分轨、任意局部重绘或精确到毫秒的硬约束。

传统制作链路中,角色对白、环境声和音效由不同环节分别制作,再通过后期合成对齐。统一生成有机会共同建模声音之间的关系:角色在开门后说话,脚步逐渐远离,雨声保持连续,背景音乐不掩盖关键对白。

但统一生成也会让误差相互耦合。想修改一句台词,可能连带改变角色音色、背景节奏或下一句的开始时间。对专业创作,评估重点除了"第一次听起来好不好",还应该包含"修改一次需要返工多少"。

研究上可以分别测量时间锚点偏差、角色音色漂移、语音内容遗漏,以及修改区域之外的变化。产品上则需要保存脚本版本、角色参考、生成条件和验收记录,让用户能够比较不同版本,而不是只留下一个音频文件。

5.2 48kHz意味着什么,又不能说明什么

官方发布说明TTS-Next支持48kHz输出。1 采样率描述每秒采样点数量,在理想带限采样条件下,48kHz对应24kHz的奈奎斯特频率;它不是每秒音频token数,也不能直接推导模型计算速度。

采样规格更高,可能给声音细节提供更大的表示空间,但不能保证没有杂音、发音错误或时序偏差。生成质量仍然取决于内容、频谱、动态范围和主观听感。

更不能把这项规格套给整个家族:当前Realtime文档中,WebSocket输入为16kHz、16bit、单声道PCM,输出为24kHz、16bit、单声道PCM。6 TTS-Next的创作输出与Realtime的低延迟交互输出,服务的是不同目标。

发布中的试听与视频适合了解能力形态,但本文没有对演示做独立听感盲测,也没有运行多角色长音频生成实验。关于自然度、情绪一致性和生产级可编辑性的判断,应保留这一证据边界。

6. Qwen-Audio-3.1-Realtime:全双工成立在整个系统上

过去常见的语音助手链路是ASR→文本模型→TTS。这样的组合便于替换组件、观察中间结果和独立优化,在许多任务上仍然有价值。但如果系统必须等用户说完、再思考、再合成,或在回复期间关闭麦克风,就难以处理自然插话。

端到端语音交互能更直接利用语音信息,减少某些模块边界,但全双工仍然需要端侧持续采集、回声消除、轮次判断、流式播放和中断处理。模型会听和会说,并不自动让整条链路同时听和说。

6.1 160毫秒首字响应,不是160毫秒完成对话

官方的约160毫秒是ASR首字响应指标。1 它不同于用户说完到助手首个可听声音的延迟,更不同于查询、订票等业务任务完成时间。首字还可能是中间识别结果,后续仍有修订。

对一条主要串行的回复路径,可以用下面的工程分解检查瓶颈:

L r e p l y ≈ L c a p t u r e + L u p l i n k + L t u r n + L i n f e r e n c e + L d o w n l i n k + L p l a y . L_{reply}\approx L_{capture}+L_{uplink}+L_{turn}+L_{inference}+L_{downlink}+L_{play}. Lreply≈Lcapture+Luplink+Lturn+Linference+Ldownlink+Lplay.

实际流式系统中部分环节重叠执行,端到端延迟由关键路径决定,所以这不是严格的逐项相加模型。它提醒我们分别检查采集分片、网络、轮次确认、推理、下行与播放器缓冲。

官方Realtime指南建议按100毫秒发送音频。6 对16kHz、16bit、单声道PCM,一片应包含:

B = 16000 × 0.1 × 16 8 × 1 = 3200 b y t e s . B=16000\times0.1\times\frac{16}{8}\times1=3200\ \mathrm{bytes}. B=16000×0.1×816×1=3200 bytes.

这里有一个很实用的单位检查:3200字节对应1600个采样帧;若采集API的参数是帧数,读取3200帧就已经是200毫秒音频。 不能把文档里的字节数直接填入以frame为单位的接口。音频块本身的时长,会给实时性设置一个下限。

工程测试至少应记录首个中间转写、稳定转写、用户结束发言、首个音频帧、实际播放开始和业务完成等时间点,并观察P50/P95。一个很漂亮的模型侧延迟数字,不能替代弱网与真实设备上的用户体验。

6.2 声学VAD与语义VAD:有声音不等于该换人说话

当前文档提供server_vad、semantic_vad和手动控制三种交互方式。6 声学VAD主要依据语音活动与静音判断边界;语义模式进一步结合内容,区分有效发言、附和与噪声。

用户说"嗯",可能只是表示正在听;用户说"等一下",可能真的要修改任务。若把所有声音都当作中断,系统会频繁停顿;若只等待长静音,又容易抢话或反应迟缓。不同业务应测试误打断与漏打断之间的取舍。

文档明确,semantic_vad下被判为非有效轮次的部分内容可以通过ambient_audio_transcription事件透传,而不写入对话上下文。6 因而"收到了转写事件""形成了有效用户轮次"和"进入了模型历史"是三个不同状态,日志系统不应混淆。

6.3 打断至少涉及生成、播放与业务动作三层

图9:实时交互中的三层状态。生成取消与播放清空来自接口和客户端机制;外部业务动作的撤销,需要应用自己处理。

官方指南说明,在VAD模式下,新语音可取消正在生成的回复,response.done返回status=cancelled;客户端收到input_audio_buffer.speech_started时,应立即停止并清空本地缓存音频。6

如果服务端已经停止生成,但播放器还缓存了两秒旧语音,用户仍会觉得"打断无效"。客户端还需要按response身份区分残余音频,防止旧回复的延迟数据继续播放。

如果为了避免扬声器回声,在AI说话期间直接关闭麦克风,又会让可打断能力失效。这类简化策略可以用于某些演示,但无法代表真正的持续双工体验。应根据端侧条件使用耳机、回声消除或合适的实时传输SDK。

更深一层是业务状态。用户说"别订了",取消语音生成不会自动取消已经发送的订单请求。应用需要记录动作是否待提交、已提交、已成功以及是否可补偿,再向用户说明真实结果。

全双工把对话变成连续事件流,Agent必须把这条事件流与外部事务对齐。 这比简单添加一个工具调用按钮更接近真正的产品难点。

6.4 工具调用、记忆与传输都有具体边界

当前Realtime指南明确,联网搜索与Function Calling不能同时启用。6 如果一个应用需要搜索与业务工具协同,应按受支持的方式设计工具编排,不能假设两个开关可以同时打开。

模型卡给出262K级上下文,发布记录明确为262,144 token;但语音历史还有单独的容量约束:默认20轮,最多可配置50轮,累计音频保留上限300秒,超过限制会丢弃更早信息。5--6,10 300秒是音频上下文保留量,不能读成通话只能持续五分钟;262K也不能读成所有历史声音都能永久记住。

长通话应把关键任务条件提取为显式状态,例如乘客数量、目的地、预算、已经确认的选项和待处理动作。后续轮次读取这些状态时,还应保留其来源与版本。这样用户修改条件时,系统知道哪一项被更新,而不是依赖早已被淘汰的音频片段。

传输层则提供WebSocket、WebRTC与AOQ等选项,具体支持以模型矩阵为准。7 AOQ教程将音频与事件分轨传输,并给出上行16kHz、下行24kHz的接入示例。11 协议选择主要服务于设备、网络和端侧处理需求,不应被误当成模型推理能力变化。

7. Qwen-Audio-3.1的训练线索与评估空白:机制推导应停在哪里

官方将Realtime的理解、推理、表达与安全提升关联到多教师蒸馏。1 从一般机器学习原理看,多教师可以提供不同类型监督,让较低延迟的学生模型学习多个能力来源。

一种解释性的目标形式是:

L s t u d e n t = L t a s k + ∑ k λ k L d i s t i l l ( k ) . \mathcal L_{student}=\mathcal L_{task}+\sum_k\lambda_k\mathcal L_{distill}^{(k)}. Lstudent=Ltask+k∑λkLdistill(k).

这里的 k k k 表示不同教师或监督来源, λ k \lambda_k λk 表示相应权重。该式只解释多目标蒸馏的一般思想,不是Qwen-Audio-3.1已披露的训练损失。

这种路线的研究难点也很具体:不同教师对语义、情绪、轮次和安全边界的偏好可能冲突;学生在更短推理时间内能保留多少能力,需要专门实验;离线教师的回答风格也不一定适合被随时打断的在线对话。

要验证蒸馏机制的贡献,需要单教师、多教师、不同权重或不同数据来源的消融,以及固定算力和延迟预算的比较。当前公开发布结果不足以完成这些归因。

同样,"理解情绪"应理解为从声学与语义线索推断可能的表达状态,不代表直接读取心理状态。更温和的语气可以改善沟通,却不能替代事实核验。模型说得自然,甚至说得很体贴,仍可能误解需求或缺少外部信息。

对科研读者,最有价值的后续问题包括:轮次控制与语义推理是否共享表示;多角色连续生成如何维持音色;时间条件是软提示还是可量化约束;噪声与说话人变化会如何影响工具调用。它们都值得研究,但不能靠产品命名补全答案。

8. Qwen-Audio-3.1的成本:先确认计量单位,再讨论降价红利

官方发布给出的降价幅度是TTS约70%、Realtime约85%、ASR约95%。1 这些数字说明了价格调整方向,但无法单独推出一通十分钟电话的总账单,因为还缺少旧价基准、具体SKU、输入输出结构和计费单位。

本次核验时,模型卡的价格栏按每百万token展示:ASR-Flash输入0.8元、输出2.7元;TTS-Flash输入1.5元、输出12元;TTS-Next输入6元、输出12元。Realtime卡片进一步区分音频输入40元、文本输入5元、纯文本输出40元和文本加音频输出150元,最后一项注明输出文本不计费。2--5

但通用计费指南仍将文本转语音描述为按字符数、语音转文本描述为按音频秒数计费。9 在具体新模型与通用指南尚未完全对齐时,应保留这一口径差异,不能自行推导token与秒数的换算。 上述数值是核验页面的展示值,实际预算需结合对应接口usage与账单确认。

音频的48kHz采样率、网络传输的字节量以及模型计费token数量,属于三个不同层次。它们之间的映射依赖编码和服务规则,不能将48,000个采样点当作48,000个计费token。

业务层更合理的指标是:

C s u c c e s s = C m o d e l + C n e t w o r k + C t o o l s + C r e v i e w + C r e t r y N s u c c e s s f u l t a s k s . C_{success}=\frac{C_{model}+C_{network}+C_{tools}+C_{review}+C_{retry}}{N_{successful\ tasks}}. Csuccess=Nsuccessful tasksCmodel+Cnetwork+Ctools+Creview+Cretry.

它把模型、传输、工具、审核与重试费用一起考虑。ASR便宜了,如果关键人名频繁识别错误、每场会议仍要人工逐句校对,交付成本未必同比例下降;音频生成便宜了,如果每次修改都必须重做整段声景,生产效率也未必同步改善。

降价的长期价值在于扩大可运行的任务集合:更持续的语音入口、更大规模的转写、更多轮音频创作迭代。最终收益仍然取决于这些新增调用是否减少了用户的总工作量。

9. Qwen-Audio-3.1如何落地:把试听演示变成可复现的任务验收

如果目标是会议产品,验收需要覆盖文字错误、说话人混淆、时间对齐、重叠语音、术语一致和润色后的语义保真。还应挑出金额、日期、承诺、否定和自我纠正,检查它们是否被错误地整理。

如果目标是音频创作,除了试听自然度,还要测试角色漂移、跨语言发音、时间锚点、长段落衔接与局部修改的连带影响。相同脚本重复生成,可以观察稳定性;让评审不知道使用的是哪个模型,可以减少品牌与演示选择带来的偏差。

如果目标是Realtime Agent,核心测试应包括:用户补充条件、突然改口、短促附和、旁人插话、持续背景噪声、弱网、工具超时,以及外部动作已经提交时的撤销请求。记录模型如何说、播放器实际播了什么、工具实际做了什么,再检查三者是否一致。

场景 模型侧指标 用户真正关心的结果
会议与访谈 CER、DER、cpWER、时间偏差 能否准确找到某个人的发言,纪要是否保留关键约束
音频理解 事件误检漏检、时间定位、答案有据比例 描述可回听验证,不把猜测写成事实
TTS与声景创作 可懂度、音色保持、时序偏差、修改稳定性 内容可交付,修改成本可控
实时语音Agent 误打断、停止延迟、P95响应、工具成功率 需求更新能生效,动作状态可追踪,失败有明确反馈

对算法工程师,能力成长正在从单一识别或生成分数,扩展到时间序列、交互状态和业务验收。懂模型之外,还需要理解采样、编解码、播放器缓冲、事件并发和任务状态。

对产品团队,语音入口的价值来自用户能够持续修改意图,而系统仍然跟得上。什么时候保持沉默、什么时候追问、什么时候报告进度,往往与回答内容同样重要。

对创业团队,模型API让音频能力更容易获得,长期积累则在真实场景的数据、稳定的端侧体验、行业词表、可验证的任务流程与低返工交付。一个演示很容易展示自然声音,一个产品必须经得起重复打断与不理想环境。

Rocky更看重这次升级带来的系统性要求:音频AI正在同时管理"说了什么、谁在说、何时发生、听到了什么,以及任务做到哪一步"。 当这些状态能被正确组织、验证和更新,语音才会成为可靠的Agent入口,音频生成也才能成为可持续使用的创作工具。

推荐阅读

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:

深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:

深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:

入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

5. 深入浅出完整解析DeepSeek系列核心基础知识

Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析DeepSeek系列核心基础知识

6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识

Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion(SD)核心基础知识

9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:

深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:

深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

11. 深入浅出完整解析ControlNet核心基础知识

AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。

ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:

深入浅出完整解析ControlNet核心基础知识

12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:

深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

13. 深入浅出完整解析AIGC时代Transformer核心基础知识

在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

深入浅出完整解析AIGC时代Transformer核心基础知识

14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":

深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?

Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:

手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!

16. AIGC产业的深度思考与分析

2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

17. AI算法工程师的独孤九剑秘籍

为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:

【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)

18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:

深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

相关推荐
桃西西呀1 小时前
Laya 源码级原理拆解之四:路由检测与服务部署
人工智能·llm·ai编程
努力努力再努力wz1 小时前
【边缘计算入门系列】从“在哪里算”到“怎么算”:一文建立边缘计算、算子、计算图与 Tensor 的底层心智模型
人工智能·docker·边缘计算
黄啊码1 小时前
【黄啊码】一个陪伴类的 Agent 产品,凭什么我觉得它做得好?
人工智能
leoZ2311 小时前
第 34 篇 Copilot 与嵌入式 AI:把能力缝进工作流
人工智能·大模型·copilot·agent
桃西西呀1 小时前
Laya 源码级原理拆解之三:字段编译与业务胶水
人工智能·llm·ai编程
欧特克_Glodon1 小时前
OpenCV计算机视觉开发入门与实践(基于C++):专栏内容介绍及目录
c++·人工智能·opencv·计算机视觉
55873 生态系统1 小时前
55873 全域文明生态系统:技术价值矩阵与底层创新内核
大数据·人工智能·55873全域文明生态体系·55873操作系统
小小张说故事1 小时前
CatBoost 入门指南:类别特征为什么不用 One-Hot?Python 实战与 5 个坑
python·机器学习
倔强的石头1061 小时前
【Transformer】Encoder_Decoder_vs_Decoder_Only架构对比
人工智能·深度学习·transformer