一、文章主要内容
本文针对当前视频生成模型重视觉质量、轻推理能力的现状,提出了一套名为 VBVR(Very Big Video Reasoning) 的视频推理研究体系,核心包含三大核心组件,同时通过实验揭示了视频推理的关键特性:
1. 核心组件
- VBVR-Dataset:首个大规模视频推理训练数据集,基于人类认知架构(抽象、知识、空间性、感知、转换五大能力)设计200个任务,包含201.5万张图像和100.75万个视频片段,规模较现有数据集提升约3个数量级,支持大规模训练与泛化研究。
- VBVR-Bench:可验证的评估框架,采用规则化评分器(而非LLM-based判断),确保评估结果可复现、可解释,且与人类判断的斯皮尔曼相关系数ρ>0.9,支持域内(ID)和域外(OOD)双维度泛化测试。
- VBVR-Wan2.2:基于Wan2.2微调的强基线模型,在VBVR-Dataset上训练后,整体得分达0.685,较基线提升84.6%,验证了推理导向数据的有效性。
2. 关键发现
- 数据规模扩大可同时提升模型的域内和域外推理能力,但性能会逐渐趋于饱和,且与人类表现仍存在显著差距(人类整体得分0.974)。
- 五大认知能力存在非平凡相关性(如知识与空间性正相关ρ=0.461,知识与感知负相关ρ=-0.757),揭示了模型推理能力的结构依赖。
订阅专栏 解锁全文
2427

被折叠的 条评论
为什么被折叠?



