Video-DeepResearch:面向下一代视频多模态深度研究智能体
论文arXiv编号:2608.03979v1
https://github.com/Osilly/Vision-DeepResearch
摘要
现有多模态深度研究智能体仅支持静态图片检索,无法处理连续视频时序时空推理任务。本文通过初步实证实验,发现当前模型存在两大核心缺陷:
- 模态偏好偏差:智能体刻意规避视觉检索工具,优先使用纯文本搜索,放弃视频画面时序细粒度证据;
- 参数知识泄露:模型依赖预训练内置参数记忆直接作答,不调用任何外部工具完成推理,评测结果失真。
本文提出Video-DeepResearch(Video-DR) 统一框架,采用感知-探索解耦+分阶段工具解锁 流水线,强制模型先完成跨帧视觉细粒度检索,再执行网页文本检索;配套两阶段训练方案:监督微调(SFT)+分组相对策略优化(GRPO),突破模仿学习性能天花板。
同时本文构建VideoDR-Bench 人机协同多跳视频问答基准,包含200道必须结合视觉检索+外网知识推理的复杂样本。
实验结果:Video-DeepResearch-35B-A3B 平均准确率64.0%,超越闭源模型Claude-4.5-Sonnet(59.0%)5个百分点,大幅领先GPT-5(52.5%)、Gemini 2.5 Pro(57.5%);30B轻量化版本达到59.3%,与Claude持平,证明训练范式在小参数量模型上同样有效。

1 引言
随着大模型智能体技术发展,文本、图片深度研究(DeepResearch)系统已成熟,但连续视频时序深度推理仍是空白领域。视频任务需要跨帧时空细粒度定位、实体追踪,再结合全网外部知识多跳推理,复杂度远高于单张静态图像。
现有研究演进脉络
- 纯文本智能体:WebGPT、AutoGPT,仅文本搜索,无视觉感知;
- 图像深度研究:WebWatcher、Vision-DeepResearch,支持图片裁剪、反向图搜,但无法处理时序视频;
- 视频理解模型:仅单轮静态帧编码,缺少交互式工具检索闭环,无法联动外网信息。
当前两大核心痛点
- 评测失真:现有视频基准无法约束模型调用视觉工具,模型靠内置参数记忆答题,评测分数不代表真实检索推理能力;
- 模型行为缺陷:存在视觉工具规避倾向,无视视频画面实体证据,直接用泛化文本搜索,丢失时序上下文信息。
本文核心五大贡献
- 提出Video-DeepResearch完整视频深度研究框架,设计感知-探索解耦流水线,强制先视觉检索再文本搜索,解决模态偏好偏差;
- 搭建可扩展视频问答数据生成管线,产出3万条视频问答对、7千条高质量完整智能体推理轨迹;
- 设计SFT+GRPO两阶段训练方案,小参数量模型超越顶级闭源大模型;
- 构建VideoDR-Bench人机协同评测基准,全部样本必须同时使用视觉+文本工具,杜绝参数知识泄露;
- 完整消融实验验证各模块增益,分析工具调用行为变化,证明框架可从根本改变模型推理策略。
2 基础方案尝试与实证分析

2.1 任务形式化定义
给定连续视频序列 V={v1,v2...vT}V=\{v_1,v_2...v_T\}V={v1,v2...vT} 与复杂查询Q,智能体执行序列决策生成完整答案R。
动作空间 A={Select_Keyframe,Crop_Search,Text_Search,Visit}\mathcal{A}=\{\text{Select\_Keyframe},\text{Crop\_Search},\text{Text\_Search},\text{Visit}\}A={Select_Keyframe,Crop_Search,Text_Search,Visit}:
- Select_Keyframe:从时序中筛选关键帧;
- Crop_Search:框选帧内实体裁剪并执行反向图像检索;
- Text_Search:文本全网检索;
- Visit:访问网页读取详细内容。
推理轨迹 Hi=Q,V,a1,o1...ai−1,oi−1\mathcal{H}i = Q,V,a_1,o_1...a_{i-1},o_{i-1}Hi=Q,V,a1,o1...ai−1,oi−1,策略分布 ai∼πθ(a∣Hi)a_i \sim \pi\theta(a|\mathcal{H}_i)ai∼πθ(a∣Hi)。
2.2 现有模型实证实验
选用Qwen3.5-35B、Qwen3.5-397B、GPT-5三款主流模型在传统视频基准评测,统计平均工具调用次数:
| 模型 | 准确率 | 单任务视觉工具调用均值 | 单任务文本工具调用均值 |
|---|---|---|---|
| Qwen3.5-35B | 41% | 0.04 | 0.58 |
| Qwen3.5-397B | 58% | 0.10 | 1.27 |
| GPT-5 | 57% | 0.00 | 0.12 |
两大关键结论
- 模态规避偏差:即使最强开源397B模型,平均每任务仅调用0.1次视觉工具,极度依赖文本搜索,完全放弃视频时序视觉证据;
- 参数知识泄露:GPT-5全程几乎不调用任何工具,仅凭预训练记忆达到57%高分,现有基准无法区分"检索推理"和"内部记忆背诵",评测无实际参考价值。
3 Video-DeepResearch 完整框架

整体流水线分为三大阶段:视频多级过滤、VQA问答生成、推理轨迹构造;训练采用SFT监督微调+GRPO强化学习双阶段方案。
3.1 VQA 视频问答数据生成
步骤1:多源视频两级过滤
数据源:公开视频数据集+YouTube真实流媒体视频
- 规则粗过滤:剔除过短、纯色无内容视频;
- 智能体精细过滤:Qwen3.5-35B评估内容信息量,剔除无研究价值素材;
过滤后数据划分为训练集(构造推理轨迹)、测试集(构建VideoDR-Bench)。
步骤2:关键帧选取+实体视觉检索
- CLIP帧相似度打分筛选候选关键帧;
- 大模型标注实体边界框,裁剪目标实体;
- 反向图搜验证实体匹配度,生成结构化元组:<关键帧、边界框、实体名称、检索摘要>。
步骤3 问答生成与防泄露过滤
两种提问范式:
- 单实体问答:基于单一实体事实提问;
- 多实体多跳问答:跨实体关联复杂推理。
防泄露过滤规则:无工具辅助下模型答对的样本全部丢弃,保证题目必须调用外部检索,最终产出3万条高质量VQA样本。
3.2 推理轨迹生成(核心解耦流水线)
针对模型规避视觉工具问题,设计分阶段工具解锁策略:
- 第一阶段(感知阶段):仅开放Select_Keyframe、Crop_Search视觉工具,强制跨帧多次实体检索,不允许文本搜索;
- 视觉信息充足后解锁Text_Search、Visit文本工具,再完成答案推导;
- 拒绝采样:仅保留推理正确轨迹用于训练,最终产出7千条完整高质量智能体执行轨迹。
3.3 两阶段训练方案
基础底座:
- Video-DeepResearch-30B-A3B:Qwen3-VL-30B-Instruct;
- Video-DeepResearch-35B-A3B:Qwen3.5-35B-A3B;
硬件集群:4台NVIDIA H80 80GB节点,完整超参见附录B。
阶段一:监督微调 SFT
训练混合数据集:7千条视频感知推理轨迹 + 7千条纯文本深度研究样本,均衡视觉/文本工具使用行为。
损失函数:标准自回归负对数似然
LSFT=−E(x,y)∼D∑i=1∣y∣logπθ(yi∣x,y\\mathcal{L}{\text{SFT}}=-\mathbb{E}{(x,y)\sim\mathcal{D}}\left\\sum_{i=1}\^{\|y\|}\\log\\pi_{\\theta}(y_{i}\\mid x,y_{\LSFT=−E(x,y)∼D i=1∑∣y∣logπθ(yi∣x,y<i)
阶段二:GRPO 分组相对策略优化
采用DeepSeek-Math提出的GRPO算法,无需独立价值网络,节省显存开销。
- 训练集:2千道中等难度视频样本,每条生成4条推理轨迹;
- 稀疏二元奖励:答案正确r=1,错误r=0;
- 负梯度仅20%概率生效,抑制格式错误、循环重复对训练的干扰;
完整损失包含策略裁剪项+KL正则项:
LGRPO=1G∑i=1Gmin(πθ(oi)πold(oi)A\^i,clip(πθ(oi)πold(oi),1−ϵ,1+ϵ)A\^i)−βDKL\begin{split}\mathcal{L}{\text{GRPO}}=&\frac{1}{G}\sum{i=1}^{G}\Big\\min\\Big(\\frac{\\pi_{\\theta}(o_{i})}{\\pi_{\\text{old}}(o_{i})}\\hat{A}_{i},\\text{clip}\\Big(\\frac{\\pi_{\\theta}(o_{i})}{\\pi_{\\text{old}}(o_{i})},1-\\epsilon,1+\\epsilon\\Big)\\hat{A}_{i}\\Big)\\Big-\beta\mathbb{D}_{\text{KL}}\end{split}LGRPO=G1i=1∑Gmin(πold(oi)πθ(oi)A\^i,clip(πold(oi)πθ(oi),1−ϵ,1+ϵ)A\^i)−βDKL
3.4 VideoDR-Bench 评测基准
人机协同标注流水线,最终200道多跳视频推理样本,视频时长分布:
| 视频类型 | 时长 | 数量 | 占比 |
|---|---|---|---|
| 短视频 | ≤2分钟 | 92 | 46.0% |
| 中视频 | 2~10分钟 | 68 | 34.0% |
| 长视频 | ≥10分钟 | 40 | 20.0% |
六大视频领域分布:知识类29.5%、娱乐22.0%、日常生活18.5%、游戏体育14.5%、新闻12.0%、其他3.5%。
标注流程:
- 人工标注员裁剪实体检索生成种子问题;
- 多智能体迭代扩展多跳复杂问题;
- 自动过滤无工具可解样本,人工复核全部题目。
4 完整实验
4.1 实验配置
对比基线:Gemini 2.5 Pro、GPT-5、Claude-4.5-Sonnet、Qwen全系开源模型、Kimi K2.5
评测两套数据集:传统VideoDR、本文VideoDR-Bench
评测规则:统一工具调用权限,使用Qwen3-VL-30B作为裁判模型打分。
4.2 主实验全局准确率结果
| 模型 | VideoDR总精度 | VideoDR-Bench平均精度 |
|---|---|---|
| Gemini 2.5 Pro | 62.0 | 57.5 |
| GPT-5 | 57.0 | 52.5 |
| Claude-4.5-Sonnet | 63.0 | 59.0 |
| Qwen3.5-397B(超大开源基线) | 58.0 | 52.8 |
| Video-DeepResearch-30B-A3B | 62.0 | 59.3 |
| Qwen3.5-35B 原始底座 | 42.0 | 42.8 |
| Video-DeepResearch-35B-A3B | 68.0 | 64.0 |
核心结论:
- 35B版本SOTA,64.0%领先Claude 5个百分点;
- 30B轻量化版本59.3%,持平顶级闭源Claude;
- 对比原生底座,35B版本提升21.2%,30B提升18.8%,训练范式增益巨大;
细分领域优势:知识、娱乐、日常视频提升最显著,新闻动态场景仍存在优化空间。
4.3 工具调用行为分析
统计各模型平均视觉/文本工具调用次数:
| 模型 | VideoDR:视觉/文本 | VideoDR-Bench:视觉/文本 |
|---|---|---|
| Claude-4.5 | 1.83 / 3.38 | 2.25 / 3.24 |
| GPT-5 | 0.00 / 0.12 | 0.31 / 1.43 |
| Qwen3.5-397B | 0.10 / 1.27 | 0.04 / 2.77 |
| Video-DeepResearch-30B | 2.33 / 4.24 | 2.98 / 3.81 |
结论:本文框架彻底解决模态规避问题,模型主动大量执行跨帧实体视觉检索,不再依赖纯文本搜索,推理流程贴合视频时序信息。
4.4 消融实验(30B模型)
| 训练配置 | VideoDR精度 | VideoDR-Bench | 全局均值 |
|---|---|---|---|
| 原生底座 | 38.0 | 43.0 | 40.5 |
| 仅4K视频SFT | 44.0 | 48.0 | 46.0 |
| 7K视频轨迹SFT | 55.0 | 51.0 | 53.0 |
| 7K视频+7K文本混合SFT | 59.0 | 54.5 | 56.8 |
| SFT+2K GRPO完整框架 | 62.0 | 56.5 | 59.3 |
消融结论:
- 视频轨迹SFT是基础增益,带来12.5%提升;
- 混合文本样本缓解文本检索能力短板,额外+3.8%;
- GRPO强化学习突破模仿学习上限,最终再提升2.5%;
缺一不可,三模块协同才能达到最优性能。
4.5 深层讨论
- 模型规模不等于视频检索能力:397B超大基线性能弱于30B优化版,证明专用训练范式比参数量更关键;
- 工具调用行为是真实理解指标:GPT5高分仅靠记忆,无视觉检索不具备视频真实理解;
- 模态偏差是数据分布缺陷,非模型架构固有问题,通过分阶段解锁训练可完全修正。
5 相关工作
5.1 视频理解大模型
传统Video-LLM仅均匀采样单帧做静态问答,缺少交互式检索闭环;近期视频智能体仅支持封闭场景内置工具,无法联动全网开放信息。本文首次打通视频时序感知+全网多跳深度研究完整链路。
5.2 多模态深度研究系统
文本智能体(WebGPT、WebSailor)、图像智能体(Vision-DeepResearch)已成熟,但均无法处理连续时序视频;现有视频评测集缺少"必须视觉检索"约束,存在知识泄露漏洞,本文VideoDR-Bench填补该空白。
6 结论
本文提出Video-DeepResearch首个完整视频深度研究智能体框架,针对模态规避、参数知识泄露两大行业痛点,设计感知-探索解耦、分阶段工具解锁的数据生成流水线,配套SFT+GRPO两阶段训练方案;同时构建200道人机协同多跳评测基准VideoDR-Bench。
实验证明35B版本达到SOTA,超越全部闭源模型,30B轻量化版本可媲美Claude-4.5。研究证明专用训练范式能让中小参数量模型获得远超超大基础模型的视频时序检索推理能力,为下一代视频多模态智能体提供完整基线与训练方案。
局限性
- 训练与数据合成需要海量H80 GPU算力,计算开销高;
- 基准依赖人工复核标注,大规模自动扩充存在难度;
未来方向:轻量化推理架构、全自动评测标注、长时序超长视频深度研究拓展。
附录完整资源(实验脚本/超参/提示词)
附录B 训练超参完整脚本
- 并行方案:TP=4、CP=2、EP=8,序列并行开启;
- 上下文最大长度80k tokens;
- 训练轮次3 epoch,全局batch=64;
- 学习率:峰值1e-5,线性预热5%步数后衰减至5e-7;
- MoE负载均衡损失系数1e-6,专家容量系数2.0;
- 显存优化:FlashAttention、全层激活检查点、可扩展分段内存;
- 保存策略:每500步存储Safetensors格式权重,不保存优化器状态。
附录C 关键帧提取预处理代码规则
使用CLIP-ViT-L/14@336px计算帧相似度,相似度>0.8丢弃冗余帧;单视频最多保留20帧,纯色无画面视频直接过滤,整套预处理脚本开源在项目仓库。
附录D 全套提示词脚本(4类核心Prompt)
- 视频任务适用性判定Prompt:过滤无需检索的简单视频;
- 多帧实体提取Prompt:输出标准化实体边界框JSON;
- 多跳问答生成Prompt:禁止泄露实体名称,强制多模态联合推理;
- 智能体工具调用Prompt:强制先执行select_crop_search视觉检索,再调用文本搜索;
工具定义完整JSON规范见论文附录表6。
可用工具完整定义
- select_crop_search:指定帧+边界框裁剪,反向图搜实体;
- search:批量文本全网检索;
- visit:读取网页详情抽取目标证据。
论文全部资源下载链接
- 论文HTML原文:https://arxiv.org/html/2608.03979v1
- 论文PDF:https://arxiv.org/pdf/2608.03979v1
- 完整代码仓库:https://github.com/Osilly/Vision-DeepResearch
- VideoDR-Bench数据集:https://github.com/QuantaAlpha/VideoDR-Bench
- 全套训练SFT/GRPO脚本、提示词模板:仓库train/eval目录
- 实验仿真评测工具:VLMEvalKit视频定制分支
- 原始视频数据源:MLVU、Video-MME、公开YouTube数据集