A Very Big Video Reasoning Suite

一、文章主要内容

本文针对当前视频生成模型重视觉质量、轻推理能力的现状,提出了一套名为 VBVR(Very Big Video Reasoning) 的视频推理研究体系,核心包含三大核心组件,同时通过实验揭示了视频推理的关键特性:

1. 核心组件
  • VBVR-Dataset:首个大规模视频推理训练数据集,基于人类认知架构(抽象、知识、空间性、感知、转换五大能力)设计200个任务,包含201.5万张图像和100.75万个视频片段,规模较现有数据集提升约3个数量级,支持大规模训练与泛化研究。
  • VBVR-Bench:可验证的评估框架,采用规则化评分器(而非LLM-based判断),确保评估结果可复现、可解释,且与人类判断的斯皮尔曼相关系数ρ>0.9,支持域内(ID)和域外(OOD)双维度泛化测试。
  • VBVR-Wan2.2:基于Wan2.2微调的强基线模型,在VBVR-Dataset上训练后,整体得分达0.685,较基线提升84.6%,验证了推理导向数据的有效性。
2. 关键发现
  • 数据规模扩大可同时提升模型的域内和域外推理能力,但性能会逐渐趋于饱和,且与人类表现仍存在显著差距(人类整体得分0.974)。
  • 五大认知能力存在非平凡相关性(如知识与空间性正相关ρ=0.461,知识与感知负相关ρ=-0.757),揭示了模型推理能力的结构依赖。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值