语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步
过去24小时,AI行业上演了一场少见的"实时竞赛"。
9月15日凌晨,谷歌发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,官方称这是其迄今最先进的对话式AI,能够在对话不中断的情况下调用工具、处理视觉信息、执行复杂任务;同一天,国内的阶跃星辰一口气放出StepAudio 3系列五款语音模型,其中Realtime版本在Artificial Analysis对话动态榜单以98.9%的综合得分排名全球第一;还是同一天,生数科技发布实时视频模型Vidu S2并全量开放,S2-Avatar可以720P、25至42帧的规格实时生成数字角色,S2-Editing能够对正在播放的视频流实时换风格、换装、换背景。
三家不同方向的厂商,在同一个时间窗口里,把筹码压在了同一个词上:实时。
语音这边:实时已经是"基础盘"
先看语音赛道发生了什么。
Gemini 3.8 Live的参数表里,有几个细节比跑分更值得琢磨。它支持在对话中自动检测并切换97种语言;它可以在后台执行工具与API调用,同时保持对话不中断;Extended Thinking版本甚至实现了"推理与发言同步进行"------模型一边思考一边说话,遇到不确定的地方会用"让我确认一下"这类自然语言提示来过渡,还能实时讲解多步后台任务的处理进度。
这些能力的组合意味着什么?意味着语音交互正在从"一问一答的对讲机"变成"可以边想边说、边说边做的同事"。传统的大模型语音模式是流水线式的:识别、理解、生成、合成,一段一段排队。而实时对话模型把这条流水线压成了一个连续的过程,用户感知到的是"这个人一直在听、一直在想、一直在说"。
阶跃星辰的StepAudio 3系列则展示了另一个维度的竞争:系统能力的完整度。五款模型覆盖了实时交互、语音识别、语音生成、音频内容生成和音乐创作,Realtime支持原生全双工与异步工具调用,ASR的非流式词错误率只有1.7%。这种"系列化"打法说明,语音已经不是单点技术,而是一整套需要分层建设的能力栈------交互入口、理解层、生成层各有各的技术难题,缺一环就构不成闭环。
视频这边:实时刚刚破冰
相比语音,视频的实时化要难得多,也更晚发生。
生数科技的Vidu S2值得单独拆解。距离上一代S1发布仅过去69天,这次的重点不是画质或时长的常规升级,而是两个新的产品形态:S2-Editing借助帧对齐稀疏注意力,可以对正在播放的视频流实时改风格、换服装、换角色、换背景,而且运动轨迹不穿帮;S2-Avatar则面向数字角色,实时输出720P画面,支持复杂肢体动作,还能在生成过程中随时追加参考图并保留状态信息。
技术层面有一个容易被忽略的关键点:生数自研的SRF训练技术,专门用来抑制长时流式生成中的漂移与崩坏。所谓漂移,就是视频流生成时间一长,人物长相、画面风格逐渐"变形走样"。这是流式生成区别于一次性生成的核心难题------一次性生成可以整体规划每一帧,而流式生成每一帧都只能基于之前的帧继续推演,误差会累积。SRF这类技术的出现,说明厂商已经开始正面解决这个问题。
从"等它生成完再看"到"边生成边看",视频生成的产品逻辑正在被重写。直播、虚拟主播、互动内容这些场景,第一次有了技术上可用的选项。
共同的转向:从"作品"到"流"
把两边放在一起看,会发现一个共同的范式转移。
过去两年,生成式AI的主流形态是"作品制":输入一个提示词,等待几十秒到几分钟,拿到一个完整的成品。图片、文章、视频、音乐,莫不如此。这套逻辑下,延迟只是工程指标,用户可以用等待换质量。
而实时化浪潮改变的是这个前提:输出不再是"一段成品",而是"一条流"。延迟从工程指标升级为产品的第一性原理------流式产品里,延迟不是快慢问题,而是可用与不可用的分界线。
这个转向对底层技术栈的要求是结构性的。为了支撑流式输出,语音模型在做全双工与流式注意力,视频模型在做帧对齐与状态保持,推理框架在做更低的首token时延。整个行业的技术投资方向,正在从"把单次生成做到更好"转向"把连续生成做到稳定"。
交汇点:声音和画面,还差一次"同时"
但仔细观察就会发现,这两条实时赛道目前是平行推进的。
语音模型解决的是"听得懂、说得自然、边想边说",但它是纯音频的;视频模型解决的是"画面实时生成、实时编辑",但S2-Avatar这类数字角色模型生成的角色,并不天然带着与画面精确同步的声音。两条管线各自实时,合在一起却是割裂的。
这个割裂在传统"级联式"架构下尤其明显:先单独生成声音,再单独生成视频,最后靠口型对齐技术把两者缝合。离线场景下,这种缝合已经可以做得相当好;但放到实时场景,问题会被急剧放大------声音管线和视频管线各自的时延叠加,口型对齐的误差随时间累积,长时间流式输出中"声音在说话、脸已经飘了"的错位感会越来越明显。
而现实中大量的应用场景,恰恰要求的是"开口即同步":数字人直播里主播的每一句话都要与唇形严丝合缝,虚拟陪伴对象的一个表情要落在语气的重音上,多语种内容生产里换一种语言不能让角色"换了张脸"。声音、口型、表情这三件事,在真实的人类交流中本来就是同一个动作的三个侧面------分开生成,本质上是用工程手段去逼近一个天然一体的东西。
也正因为如此,行业内已经有少数团队在尝试绕开级联式路线,走联合生成的方向:把声音、口型和表情放进同一个模型里同时生成,让三者共享同一个时间轴,从生成的源头就保持同步。这条路线此前多见于离线短内容的生成,随着实时化浪潮推进,它能否延伸到流式场景,会是接下来很有观察价值的一个技术节点。
展望:实时化是下半年的主旋律
9月以来,国内外厂商密集发布新一代旗舰模型,从文本推理到语音交互再到视频生成,竞争的焦点悄然发生了位移:参数规模和跑分还在卷,但"实时"正在成为新的分水岭。
语音侧,实时对话能力已经从加分项变成及格线,榜单排名直接对应调用量和定价权;视频侧,实时生成刚刚破冰,漂移抑制和帧对齐这些底层问题的解法还在快速迭代。可以预见的几步棋是:语音模型会继续向视觉理解延伸(Gemini 3.8 Live已经支持近实时处理视觉输入),视频模型会继续向音频能力补齐,两条管线最终会在"实时音画一体的流式生成"上相遇。
到那时,评判一个生成模型的标准可能会变得非常朴素:它能不能像一个真人一样,看着你,开口说话,表情跟得上语气,一句话说到一半被打断也能自然接住。
距离那个标准,语音和视频各自都只差最后一段路。而这段路,恰恰是两条赛道之间那段还没被打通的距离。