让 AI 看一段视频,然后回答一个需要上网查证的问题——这件听起来不难的事,最新的闭源旗舰模型其实做得并不好。而中科大团队刚刚开源的一个 35B 模型,把这件事做到了新的高度。

这篇论文是 Video-DeepResearch(视频深度研究),今天刚被我们归档进突出论文库。它的结果很直接:在视频深度研究基准上,开源的 Video-DeepResearch-35B-A3B 平均准确率 64.0%,超过 Claude-4.5-Sonnet(59.0%)整整 5 个百分点,GPT-5 只有 52.5%,Gemini 2.5 Pro 为 57.5%(来源:论文 Table 3)。

一个开源的 35B 激活 3B 的模型,在需要"看懂视频+多跳检索"的复合任务上,赢过了所有闭源旗舰。这值得细看。

视频深度研究(Video Deep Research)指的是什么?给模型一段视频和一个开放问题,它需要先看懂画面里的实体——人物、商品、标志、文字,再跨多轮上网检索外部知识,最后拼出答案。比如"视频里这双拖鞋是什么型号",得先裁出鞋、以图搜索,再核对品牌官网信息。这是多模态 Agent 从静态图片走向连续视频流的关键一步,也是短视频审核、内容电商、媒资检索等场景的直接技术底座。

AI 的偷懒:不看图,只搜字

论文最有价值的部分不是结果,而是它先揭了两个短。

研究团队测了三个代表性模型在视频研究任务上的行为,发现两个系统性问题。第一是模态偏见:最强的开源模型平均每任务只调用 0.10 次视觉工具,却调用 1.27 次文本搜索(来源:论文实证研究)。也就是说,给它一段视频让它查,它基本不看视频,直接去搜文字碰运气。

第二是参数知识泄漏:GPT-5 在旧基准上几乎零工具调用,却拿到 57% 的准确率(来源:同上)。这说明旧基准的大部分题目靠模型"背过的世界知识"就能答对,根本没测出真正的检索能力。

Video-DeepResearch 流程:先选关键帧、裁出目标实体,再逐步解锁搜索工具

图注:Video-DeepResearch 的核心流程——先在视频帧里定位目标,再放行网络搜索。

这两个发现对所有做 Agent 的人都是提醒:你以为模型在"使用工具",其实它在"绕过工具"。基准分数好看,可能只是题太容易背。

解法:先看后搜,分阶段解锁工具

针对这两个问题,团队的做法可以概括成一句话:强制 AI 先看清画面,再允许它上网

具体是"感知-探索解耦"流水线,配合分阶段工具解锁:第一阶段只开放视觉工具(选关键帧、裁切实体),模型必须跨帧、跨实体做完视觉定位;达到条件后才解锁文本搜索和网页访问工具。训练上用 SFT 加 GRPO 强化学习两阶段配方,打破纯模仿学习的上限。

数据侧也下了硬功夫:30K 视频问答对和 7K 条精选轨迹。每道题都经过"防背题"过滤——对每个问题做 4 次无工具测试,只要模型不用工具能答对一次,这道题就永久丢弃(来源:论文 3.1-3.2 节)。最终配套基准 VIDEODR-BENCH 含 200 道多跳视觉问答题,覆盖知识、娱乐、日常、游戏体育、新闻等六大领域。

VIDEODR-BENCH 基准覆盖六大视频领域

图注:200 道题全部要求"视觉定位+多跳外部知识推理"双重能力,知识类占 29.5%。

效果:工具调用行为被彻底改写

训练前后的工具调用对比最能说明问题。基座模型 Qwen3.5-397B 平均每任务只用 0.10 次视觉工具;训练后的 Video-DeepResearch-30B 达到 2.33 次视觉调用、4.24 次文本调用(来源:论文 Table 4)。模型从"躲着图片走"变成了"主动逐帧找线索"。

对应到成绩:30B 版本比自己的基座提升 18.8 个百分点(40.5%→59.3%),35B 版本提升 21.2 个百分点(42.8%→64.0%)。模型越大,这套训练流水线的收益越高——论文作者认为这与复杂多跳推理对容量的需求有关。

新基准也确实更"抗背":GPT-5 在上面被迫把视觉工具调用从 0.00 提到 0.31、文本调用从 0.12 提到 1.43,准确率则从旧基准的 57% 跌到 52.5%(来源:论文 Table 3/4)。题变难了,才是真测试。

数据引擎三阶段:视频过滤、视觉问答生成、轨迹构建

图注:30K 训练数据的生产流水线,"无工具答对即弃"的过滤机制是防知识泄漏的关键。

源势AI观点

这篇论文给我们的启发不在"又一个开源模型赢了",而在一个工程原则:Agent 的能力上限,往往不由模型决定,而由流程约束决定

模型天生会走捷径——能背就不搜,能搜文字就不看图。视频研究如此,企业场景里的 Agent 同样如此:让它查内部系统,它可能拿训练记忆糊弄;让它调 API,它可能绕开关键校验直接编答案。Video-DeepResearch 的答案是流程设计:分阶段解锁工具,强制先完成感知再进入检索;数据侧用"无工具答对即弃"堵住背题路径。

这正是我们在企业 FDE 与智能体落地中反复验证的经验。在能源、金融行业的 Agent 项目里,我们做到 AI 研判准确率 98.7%、人力节省 70%,靠的不是堆更大的模型,而是把业务流程拆成可校验的阶段,让每一步的输出都被下一道关卡检验。模型是引擎,流程才是方向盘。

开源生态在视频理解+智能体这个交叉点上又进了一步。对企业用户来说,这意味着更多可控、可私有化部署的选择正在逼近闭源能力线——而怎么把这些模型"管出"真实生产力,是下一个问题。