主要特点:出轨迹是迭代了多次,每次出一条,然后去找和真值最近并且出现最早的轨迹,进行监督。
和QCNet一样loss是基于Laplace negative log-likelihood的。传统的WTA的策略只会监督和GT差异最小的那条轨迹。而EMTA策略会监督在RNN结构中找和GT match上的并且是相对更早decode出来的那条轨迹(也就是在RNN结构中认为概率更高的那条)。这里决定是不是match用的是Miss Rate的判定标准。如果没有match上的话,就退回WTA策略。这样就能让model尽早decode出目标的模态,也能提升Miss Rate的表现。
ModeSeq论文阅读
ZHANG8023ZHEN2025-08-03 13:15
相关推荐
Rocky Ding*18 小时前
VideoChat3 深度解析:视频理解的效率,来自时空压缩与主动感知的共同设计嫂子开门我是_我哥18 小时前
青少年抑郁、焦虑、失眠与自杀相关表现的症状联系:一篇网络分析论文的深度解读Curious*1 天前
意识障碍研究-论文阅读2m4Rk_1 天前
【论文阅读】Agent 记忆机制(94):MemGen——在推理过程中动态生成并织入潜在记忆海里的果2 天前
论文阅读笔记-<Alpamayo-R1 >Rocky Ding*2 天前
Janus-Pro深度解析:视觉编码解耦之后,统一多模态模型如何通过训练与数据扩展能力Rocky Ding*3 天前
Emu3大模型深度解析:下一Token预测如何统一图像、视频与理解,以及它尚未解决的问题小马哥crazymxm3 天前
Arxiv论文周选 (2026-W36)小马哥crazymxm3 天前
Arxiv论文周选 (2026-W35)搬砖小趴菜3 天前
【科研速递】Applied Sciences | 冻融循环作用下玄武岩的三轴力学行为与强度模型:对寒区工程结构的意义