写在前面

欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读:MOSS-VL 把实时交互写进计算路径
一个视频助手可以准确回答"刚才发生了什么",也可能在开口后完全错过现场变化。对监控提醒、运动解说和操作指导而言,这段感知空窗会直接改变答案的有效性:用户已经拿错工具,模型却仍在把上一句建议慢慢说完。
MOSS-VL 围绕这一问题组织了架构、数据和推理协议。视觉 patch 不进入语言自注意力序列,而是保存在交叉注意力的视觉缓存中;新增画面更新缓存,后续生成 token 可以读取更新后的证据。训练再通过沉默、响应与自然纠正样本,让模型学习何时开口、何时继续观察。
Rocky认为,这项工作的研究价值,是把实时 Agent 的问题从"回答正确率"推进到"证据是否持续有效"。 这需要计算图允许新证据进入,也需要训练目标奖励恰当的响应时机。单独增加视频帧数,或者在外面接一个定时轮询循环,都不能完整解决这一问题。

图1给出主要收益的分布:主动提醒与时序理解突出,其他能力并非全面领先。模型共 11.3B 参数,论文中的实时模型在四组流式评测中取得三个最高平均分,在另一组位列第二。这些数字来自作者的评测及其引用的基线报告;本文分析方法与证据,不将其视为独立复现实验。
还有一个贯穿全文的边界:作者把"生成过程中继续感知"称为 L5,但现有公开基准的定量证据主要覆盖 L2--L4。实时演示与公开运行代码说明系统可以这样工作,还不能给出跨场景的 L5 可靠性结论。
1. 从视频问答到持续观察:MOSS-VL 的能力分层
离线视频问答默认视频已经结束,模型可以先看完,再组织答案。流式输入增加了因果约束:任何时刻只能使用已经到达的帧。主动交互进一步要求模型保留任务意图,在条件满足时自行响应,在条件不满足时保持沉默。

表1的五级体系是作者为讨论问题提出的分类,并非全行业统一认证。它的关键分界具有工程意义:L2--L4 系统仍可能在一次回复期间暂停感知;L5 则要求输出过程中接收新证据,必要时修改或中止当前表述。
可以用一个具体场景理解这一差别。用户要求"猫碰到胡萝卜时提醒我"。持续输入只意味着模型不断收到画面;长期指令保持意味着它不会忘掉提醒条件;恰当沉默意味着它不会每秒重复描述猫;边说边看则意味着它发出提醒的同时,仍能注意到下一次接触或场景变化。这几项能力必须分别验证。
2. MOSS-VL 架构:视觉缓存与语言生成解耦
MOSS-VL 使用来自 Qwen3-VL 的 27 层视觉编码器,对动态分辨率图像编码,再通过 2×2 patch 合并与投影进入视觉 token 空间。语言主干来自 Qwen3-8B,保留 36 层自注意力,并插入 12 层门控交叉注意力,总计 48 层解码结构。

图2中,文本隐状态生成 Query,视觉表示提供 Key 和 Value。交叉注意力每四层出现一次,使用 32 个 Query 头、8 个 KV 头的 GQA,以及 QK-RMSNorm。注意力和前馈通路使用零初始化的 tanh 标量门控,训练起点保留语言骨干已有行为,再逐步学会使用视觉信息。
11.3B 的总参数由约 8.2B 语言骨干、2.3B 交叉注意力、0.8B 视觉编码与投影组成。参数数量增加并不必然导致相同输入下推理更慢,因为实际开销还取决于哪些 token 进入哪些层、缓存如何增长,以及算子是否适配这一计算路径。

表2中的训练输入范围、上下文上限和推理默认值要分开理解。最大上下文为 262,144 token,训练可接触最多 2,048 帧;发布处理器默认按 1 fps、最多 256 帧处理,而论文评测将上限提高到 768 帧。将训练上限直接当成开箱即用的默认配置,会造成复现偏差。
视觉 token 离开语言自注意力序列后,语言侧仍保留时间戳和帧占位符。每到达一帧,仅编码新帧并追加视觉 KV;历史画面不用重新编码,语言生成状态也得以延续。这里的"增量"没有消除全部增长成本:视觉缓存会增加,交叉注意力读取历史视觉证据仍有代价,长时间运行也仍然需要缓存管理。
3. XRoPE:把空间位置、逻辑顺序与真实时间分清楚
独立视觉缓存带来一个新问题:文本 Query 与视觉 Key 如何知道彼此的时空位置?XRoPE 在交叉注意力通路建立共享的三轴坐标。文本 token 使用 ( x , x , x ) (x,x,x) (x,x,x),一个合并后的 h ′ × w ′ h'\times w' h′×w′ 视觉网格以逻辑坐标 t t t 为起点。
公式(1),对应论文的位置定义:
p a , b = ( t , t + a , t + b ) , 0 ≤ a < h ′ , 0 ≤ b < w ′ . \mathbf p_{a,b}=(t,t+a,t+b),\qquad 0\le a<h',\quad 0\le b<w'. pa,b=(t,t+a,t+b),0≤a<h′,0≤b<w′.

图3中,视觉结束分隔符和语言侧帧占位符共享 ( x , x , x ) (x,x,x) (x,x,x),其中 x = max ( t + h ′ , t + w ′ ) x=\max(t+h',t+w') x=max(t+h′,t+w′);后一个文本 token 从 x + 1 x+1 x+1 接续。64 对旋转频率按 24、20、20 分配给三轴,分别作用于文本 Query 和视觉 Key。
这里的 t t t 是相对序列坐标,不是物理秒数。 网格尺寸变化会改变位置推进方式,不能用它直接计算两次事件的真实时间差。MOSS-VL 另外在文本序列写入绝对时间戳,例如 <|time_start|>X.X seconds<|time_end|>。训练时根据运动使用 1--16 fps 的可变采样,显式时间戳可以避免把采样密度误当作时间速度。
这一设计给实时多模态系统一个可复用的启发:空间坐标帮助定位,逻辑坐标帮助组织序列,物理时间帮助判断节奏。三者有关联,却不能相互替代。
4. 训练课程:先建立感知基础,再安装交互行为
MOSS-VL 发布五个检查点,但它们不是一条连续升级链。论文主体研究的是 0708 系列:Base 经常规指令训练成为 Instruct,再经 Realtime-SFT 得到 Realtime。0408 的 Base/Instruct 是更早一次独立训练,保留用于研究连续性。

混用两个训练批次,容易把不同底座、课程和后训练效果混在一起。做消融时应先固定 0708 的继承关系,再比较常规指令模型与实时模型。

预训练先冻结视觉与语言骨干,只训练投影和交叉注意力完成对齐;随后解冻全模型,以图像、视频、OCR、定位、交错文档和纯文本建立能力广度;再提高数据质量,最后通过退火和长上下文训练把序列上限从 8K 推向 256K。表4完整保留每阶段的 token、样本、学习率与可训练模块,token 统计包括投影压缩后的视觉 token,不能仅按语言输出量理解。
常规 SFT 包含 7.6M 样本、102.8B token,实时阶段包含 0.56M 样本、34.8B token。Realtime-SFT 占全部训练 token 不到 3%,这一比例说明实时行为可以集中在较轻的后训练阶段学习;它不意味着从零获得实时视频智能只需这点资源。大量前置训练已经承担了识别、时序定位与语言理解成本。
实时语料含约 2.2M 次响应决策,58.7% 属于自主选择时机;5.1% 的负样本流始终不出现目标事件,要求全程沉默。数据按画面状态变化组织监督,并检查回答证据在对应帧是否仍然成立。这样的负样本很重要:只训练"看见目标就提醒",系统容易把持续等待学成持续找理由开口。
5. MOSS-VL Realtime-SFT:沉默也需要被正确监督
模型新增 <|silence|> 与 <|response|> 两个状态 token,沿用下一 token 预测选择当前行为,没有额外接一个独立分类头。状态输出与文字输出共享模型,但状态严重不平衡:长视频中的多数时刻都不需要回复。
公式(2)保留论文的加权损失及其归一化方式:
L = − 1 ∑ i m i ∑ i m i w i log p θ ( y i ∣ y < i ) , w i = { α y i ( 1 − p θ ( y i ∣ y < i ) ) γ , y i ∈ { silence , response } , 1 , 文字 token . \mathcal L=-\frac{1}{\sum_i m_i}\sum_i m_i w_i\log p_\theta(y_i\mid y_{<i}), \qquad w_i=\begin{cases} \alpha_{y_i}(1-p_\theta(y_i\mid y_{<i}))^\gamma,&y_i\in\{\text{silence},\text{response}\},\\ 1,&\text{文字 token}. \end{cases} L=−∑imi1i∑miwilogpθ(yi∣y<i),wi={αyi(1−pθ(yi∣y<i))γ,1,yi∈{silence,response},文字 token.
其中 m i m_i mi 是监督掩码, γ = 2 \gamma=2 γ=2;状态类别权重为 α k = ( n s + n r ) / ( 2 n k ) \alpha_k=(n_s+n_r)/(2n_k) αk=(ns+nr)/(2nk),由全局 batch 内的两类计数得到。条件历史中还包含可见视觉信息。分母是监督位置数 ∑ i m i \sum_i m_i ∑imi,不能改成权重和 ∑ i m i w i \sum_i m_iw_i ∑imiwi,两者的梯度尺度不同。
逆频率权重提高稀缺响应样本的贡献,focal 因子降低简单状态判断的影响。文字 token 仍按标准预测目标学习,避免把语义质量全部交给一个时机分类指标。
论文还移除了轮末 <|im_end|> 的监督。在作者的控制比较中,响应触发率增加 39%,回复长度增加 68%。这两个行为统计能说明终止标记影响输出策略,不能直接推导为准确率提升。产品侧仍要检验冗长、误提醒和重复输出是否增加。
真实协议也参与塑造行为。推理参考流程发送一帧后等待新的沉默反馈,长回复使用长度预算释放后续画面;模板约定每个需要说话的帧只启动一次响应,一段回复以一个沉默状态结束。训练还以约 50% 概率省去开头状态槽,避免过度依赖固定模板位置。这些细节解释了为什么只下载权重、套一个普通聊天模板,未必能得到演示中的交互效果。
6. 系统实现:可见前缀与缓存更新决定是否真能部署
语言侧每个 Query 只能看到在该时刻已经到达的视觉帧,其可见区域是视觉 KV 的一个前缀。如果显式创建"文本长度 × 视觉长度"的稠密注意力掩码,内存和带宽开销会很快增长。
MOSS-VL 为 FlashAttention-3 增加 cross_kv_boundary:每个 Query 行用一个 32 位整数表示可见视觉前缀,算子跳过边界之外的 KV tile。它支持稠密、变长及 KV-cache 路径,使长序列打包训练与增量推理能够使用同一可见性语义。
这属于架构落地的一部分。理论上把视觉 token 拆出去,如果运行时仍构建巨大掩码、重复搬运历史缓存,预期收益就会被系统开销吃掉。研究者应把数据布局、内核和推理调度一起纳入测量。

图4的测量条件是同版本 SGLang、单 H200、TP=1、BF16、相同生成长度上限;每个点来自五次独立冷启动,误差条为样本标准差。匹配视觉 token 数时,TTFT 优势随上下文增加从 2.8 倍扩大到 5.1 倍,端到端优势从 1.9 倍扩大到 4.3 倍。
相同视频、分辨率和帧数的比较更有解释力:Qwen3-VL 在时间轴做 2 倍压缩,MOSS-VL 为让新帧立即编码而不做时间压缩,因此承载约两倍视觉 token,在已测点仍保持较低延迟。它支持"计算路径比单看参数量更重要"的判断。
这组图测的是离线服务,不能直接当成直播场景下从事件发生到语音提醒的延迟。真实链路还包含采帧、排队、视觉编码、输出调度和语音合成,且多个阶段可能并行。要宣称实时服务质量,还需要报告事件级 P50/P95、漏报、误报及持续运行时的资源增长。
7. 实验结果:优势集中在哪里,结论就落在哪里

MOSS-VL-Instruct 在 Minerva、TOMATO、VideoMME-Logical 上分别达到 40.5、39.5、17.1,体现出时序理解优势;但 MMMU、部分文档理解与标准定位任务仍有差距。模型没有 thinking 模式,当前报告也没有以强化学习后训练补齐复杂推理,因此不宜把视频交互优势推广成通用推理领先。
表5多数基线取自各自官方报告,帧数等配置可能不同;Gemma-4-12B-IT 由作者按相同协议评测,部分文档指标另有专门口径。公平比较要逐列检查这些条件,不能仅因为它们排在一张表里,就默认输入预算相同。

流式评测中,OVO-Bench、OmniMMI、ProactiveVideoQA 平均分分别为 70.2、32.7、47.2,在所列比较中领先;StreamingBench 视觉平均分为 69.7,低于 AURA 的 71.1。OmniMMI 主动提醒达到 66.0,对应最好基线为 37.5;收益集中在要求自主选择时机的子任务。
StreamingBench 这里统计的是视觉 RT 与 CTX 两组的平均,MOSS-VL 不输入音频,没有评测依赖音频的 Omni-Source 组,因此不能把 69.7 写成该基准完整官方总分。其他平均值也各有定义,跨基准直接平均缺少意义。
8. MOSS-VL 实时演示与 L5 验证缺口

图5在单 H200 上展示两类任务:猫接触胡萝卜时提醒,以及连续足球解说。前者呈现长期条件、沉默和多次触发,后者呈现持续生成过程中对哨声、射门、庆祝和比分变化的跟进。图中的时间线很有价值,因为它把画面证据和实际输出放在同一坐标上。

表7保留附录的演示译文,便于逐项核对输出内容。示例能够证明实现路径和行为样态,但精选片段没有给出长期失败率,也没有系统测量"错误建议已经开始输出后,新证据能在多久内改变它"。这一指标恰好是 L5 相较普通流式问答的核心增量。
Rocky认为,后续基准应主动制造证据反转:物体移走、动作失败、操作顺序改变、旧结论变成危险建议。评测除了最终答案,还应记录纠正延迟、已经说出的错误内容、重复提醒和错误中止。一个能快速修正但经常无故打断的助手,也不能算可靠。
9. 开放程度与工程落地:从检查点走到系统
官方仓库提供检查点、推理实现、实时模板及相关训练课程说明,并有 SGLang 集成和扩展注意力后端。仓库后续还增加了带 ASR/TTS 的演示前后端与多会话服务路径;这些外围组件使视觉语言模型可以进入语音交互系统,不应据此把底座描述成原生音频模型。
完整预训练引擎在仓库路线图中仍有待完成项。训练阶段公开、提供小规模微调脚本、开放全部预训练数据与基础设施,是不同层次的复现能力。对量化版本"24GB 显存可运行"的说明,也需要绑定具体检查点、精度、上下文和并发条件,不能套用到全精度长视频服务。
对算法工程师,最值得研究的是视觉可见性与状态监督如何共同影响行为。对实时 Agent 团队,先用一个明确的长期条件任务测误报和延迟,再扩展为自由解说。对产品和创业团队,用户为及时、正确且可追溯的提醒付费;漂亮演示只是进入这一业务验证的起点。
10. 术语速查与进一步研究
| 概念 | 在 MOSS-VL 中的作用 | 需要保留的边界 |
|---|---|---|
| 门控交叉注意力 | 语言 Query 读取独立视觉 KV | 视觉缓存仍增长,并非零成本 |
| XRoPE | 对齐文本与视觉空间的逻辑位置 | 不能代替物理时间戳 |
| Realtime-SFT | 学会沉默、触发与修正 | 依赖前置感知基础 |
| TTFT | 首个输出 token 的服务延迟 | 不等同事件到语音提示的总延迟 |
| L5 | 生成中持续感知的作者分类 | 缺乏专门公开量化基准 |
进一步研究可以围绕三个相互关联的问题展开。第一,如何保留长期任务所需的视觉证据,同时限制缓存增长,且不破坏时间定位?第二,训练时合成的响应时机与真实用户容忍度存在何种偏差,能否用任务完成和打扰成本建立偏好学习?第三,多用户服务下的调度延迟是否会抵消单会话架构收益?
这些问题决定系统能否从能跑一次走向长期可用。MOSS-VL 给出了有解释力的结构起点:新证据可以进入正在生成的模型,沉默可以被学习,纠正可以成为交互的正常组成部分。下一阶段的价值,需要由持续运行和事件级验收来兑现。
推荐阅读
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识