Gemini 3.8 Live凌晨登场、Vidu S2全量开放:语音与视频同周跨入实时时代,两条管线何时并成一条?

9月15日深夜,生数科技发布Vidu S2双模型并在当天全量开放在线体验与API;几个小时后,也就是9月16日凌晨,谷歌发布Gemini 3.8实时对话模型,推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款型号;同一时间,阶跃星辰的StepAudio 3系列语音模型在Artificial Analysis对话动态榜上以98.9%的得分登顶全球第一。再加上智象未来9月15日发布的原生全模态视频生成模型,短短48小时内,语音和视频两条赛道几乎同时跨过了"实时"这道门槛。

这不是一次巧合式的扎堆。把这几天的事件放在一起看,会发现AI行业正在发生一次交互范式的整体切换:从"生成质量竞赛"转向"实时交互竞赛"。

一、语音侧:对话不再被"思考"卡住

先看语音这条线。Gemini 3.8 Live的核心能力是原生全双工交互------用户可以随时打断,模型可以边听边说。但真正有意思的是Extended Thinking版本:它能在语音对话持续进行的同时,在后台完成多步推理和工具调用。

这件事的分量需要放到此前的人机对话体验里才能看清楚。过去不管是语音助手还是对话模型,都存在一个尴尬的"留白时刻":用户问了一个复杂问题,系统要么立刻给一个浅层回答,要么让用户对着沉默等上几秒。全双工解决的是"能不能插话",而异步后台推理解决的是"能不能边聊边想"------对话的节奏和思考的深度,第一次不用二选一。

阶跃星辰的StepAudio 3则从另一个侧面印证了这个方向的成熟度:Realtime版本登顶对话动态榜,ASR版本词错误率低至1.7%,Gen模型可以一次性生成人声、音效、环境音与配乐。语音链路上原本分散在多个模型里的能力,正在被整合成单一实时管线。

换句话说,语音实时化的三块拼图------全双工、后台推理、多语言覆盖(Gemini 3.8 Live支持97种语言自动切换)------基本已经补齐。"实时"正在从旗舰模型的卖点,变成行业默认配置。

二、视频侧:从"单次生成"到"持续流"

视频这条线的变化更剧烈。Vidu S2距上一代发布仅69天,一次拿出两款模型:

S2-Avatar面向持续交互的数字角色生成,实时输出720P分辨率、25至42帧,一张图就能生成可对话的数字角色。更关键的是"动态参考"机制------用户可以在互动过程中随时注入新的参考图,角色持续响应新的指令和视觉信息。为了保持长时生成的一致性,生数用了一个VLM Agent层来维护状态:当生成后续画面时,系统会显式保留先前的状态(比如"手里还端着杯子"),只改变被要求改变的部分。训练侧则加入了自回放强制(SRF)方法,对模型自己长时生成的片段重新加噪做因果回放训练,抑制连续生成中的误差累积。

S2-Editing则把编辑对象从"一段视频文件"换成了"持续输入的视频流"------可以实时改变播放中画面的风格、服装、人物和背景,运动轨迹由源视频提供,不穿帮。其帧对齐注意力机制让目标帧只与同时间戳的源帧交换信息,解决了流式编辑中常见的鬼影问题。

还有一个容易被忽略的信号:与不少实时交互模型采用申请体验或研究预览的做法不同,Vidu S2选择发布当天直接全量开放。这种姿态本身就是一种技术判断------团队认为能力已经越过产业化临界点,不需要再用"限量内测"来控制预期。此外,模型还探索了空间视频能力,实时生成的画面可以转换为左右眼视频,通过VR头显观看,这等于提前给下一代交互终端铺了路。

三、为什么都赶在这一周?

语音和视频的实时化在同一个时间窗口内集中落地,背后有三股推力。

其一是场景倒逼。直播、陪伴、客服、虚拟主持这类场景,商业价值完全建立在"实时"之上------预先生成的视频再精美,也无法回应屏幕对面正在发生的事。模型能力做到720P、几十帧之后,解锁的正是这一批场景。

其二是效率重构。流式生成把"生成完再看"变成"边生成边看",同样的算力开销,内容被消费的方式从批处理变成了流水线。对平台方来说,这是单位算力产出内容消费时长的直接提升。

其三是竞争逻辑的变化。Mozilla最新报告显示,美国闭源前沿模型与中国最佳开源权重模型的性能差距已缩窄至4.4个月。当模型能力的差距以"月"为单位计量,拼参数的边际收益快速递减,体验层的差异化自然成为主战场------而交互延迟,恰恰是体验层里用户感知最敏锐的变量。

四、两条实时管线之间的断层

不过,如果把这几天的发布放回完整的交互链路里看,会发现一个结构性现象:语音实时了,视频也实时了,但它们仍然是两条平行的管线。

一个数字角色开口说话时,声音来自语音模型,口型和面部动作来自视频模型,两者中间靠对齐算法"缝合"。这种拼装式方案在静态内容里可以做到天衣无缝,可一旦进入实时交互,割裂感就会放大:表情比语气慢半拍、情绪转折时口型对不上、语句重音落在脸上却没有相应的微表情反馈------业内常说的"幽灵效应",本质上就是多模态信号不同源导致的。

值得玩味的是,Vidu S2的VLM Agent层维护的是视觉状态的一致性------道具、服装、场景------但"语气、口型、表情"这一组信号的同源一致性,目前仍然依赖外部驱动。语音模型再快、视频模型再快,只要它们是两个源头,"像不像一个真人在说话"这个问题就没有被根治。

在这一方向上,行业内已经有少数团队在尝试另一条技术路线:把声音、口型和表情放进同一个模型里联合生成,让三者从同一个源头同时产出,而不是分别生成后再对齐。这条路线目前更多在影视级的短内容上验证,距离大规模实时化还有距离,但它指向的问题是真实存在的------当语音和画面都足够快之后,下一个评价基准就是"它们像不像同一个人发出的"。

五、实时化不是终点

把这48小时的密集发布连起来看:语音侧补齐了全双工和后台推理,视频侧补齐了实时生成、实时编辑和空间视频,各自的"实时化"基础设施都在快速成型。国产多模态模型在工业级画质、多分镜、长叙事上的积累,也让这条赛道上第一次出现了多条并行的技术路线。

但实时化本身不是终点。分辨率和帧率的竞赛终会收敛,下一阶段的分水岭在于多模态信号是否同源------声音、画面、表情出自同一个模型时,数字角色才能真正从"播放"走向"表演"。

到那时,评价一个数字角色的标准,可能不再是"它生成的画面有多清晰",而是另一个朴素得多的问题:它开口说话的时候,你信不信。

相关推荐
VIP_CQCRE4 小时前
用 Ace Data Cloud 一次接入 AI 视频生成:HappyHorse Videos API 实战指南
人工智能·api·ai视频·acedatacloud
Fang_YuanAI1 天前
OST传媒提出“AIGC原生IP”:AI内容正在进入IP时代
ai·aigc·短视频·ai视频·ai模型·ai漫剧·ai短剧
Rocky Ding*3 天前
一文读懂Hallo数字人核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·数字人·ai-native
蔡俊锋5 天前
DeepSeek 语音对话灰度上线:四种音色背后的端侧 AI 交互架构与商业逻辑
架构·大模型·语音交互·deepseek·端侧ai
Xxtaoaooo5 天前
AI 视频生成能不能真正跑通?MoneyPrinterTurbo 本地制作、远程访问与授权验证
人工智能·音视频·cpolar·ai视频·自动化短视频
VIP_CQCRE7 天前
用 Ace Data Cloud 快速接入 Kling 视频生成 API:把 AI 视频能力接进你的产品
aigc·api·ai视频·kling·acedatacloud
贾伟康11 天前
【口算王|10】HarmonyOS ArkTS 语音报题实战:协调朗读、作答和页面生命周期
生命周期·harmonyos·arkts·语音交互·texttospeech
VIP_CQCRE13 天前
用 Ace Data Cloud 快速接入 Google Veo:让 AI 视频生成从 Demo 走向生产
人工智能·api·ai视频·acedatacloud·veo
人工智能研究所16 天前
手机随手拍一段视频,AI 能还原出一个可以 360° 旋转视角的“数字人“
人工智能·科技·ai·数字人