RISE-Video
收藏资源简介:
RISE-Video是一个面向推理的文本图像到视频(TI2V)合成基准测试,将评估重点从表面美学转向深层认知推理。该数据集包含467个人工精心标注的样本,涵盖八个严格的类别:常识知识、主题知识、感知知识、社会知识、逻辑能力、经验知识、空间知识和时间知识,为探索模型在不同维度的智能提供了结构化的测试平台。
RISE-Video is a reasoning-oriented text-to-image-to-video (TI2V) synthesis benchmark that shifts the evaluation focus from superficial aesthetics to deep cognitive reasoning. This dataset contains 467 manually and meticulously annotated samples, covering eight rigorously defined categories: common sense knowledge, topic knowledge, perceptual knowledge, social knowledge, logical reasoning ability, experiential knowledge, spatial knowledge, and temporal knowledge, providing a structured testbed for exploring model intelligence across diverse dimensions.
RISE-Video 数据集概述
数据集简介
RISE-Video 是一个面向推理的文本-图像到视频(TI2V)合成基准测试。该数据集将评估重点从表面美学转向深层认知推理,旨在探究视频生成模型对隐含世界规则的理解能力。
数据集构成
- 样本数量:包含 467 个经过人工精心标注的样本。
- 类别划分:涵盖八个严格的推理类别:
- 常识知识
- 主题知识
- 感知知识
- 社会知识
- 逻辑能力
- 经验知识
- 空间知识
- 时间知识
评估框架
- 评估维度:引入包含四个指标的多维评估协议:
- 推理对齐
- 时间一致性
- 物理合理性
- 视觉质量
- 自动化评估:提出了一个利用大型多模态模型来模拟以人为中心评估的自动化流程,以支持可扩展的评估。
基准测试结果
对 11 个具有代表性的 TI2V 模型进行了全面评估,揭示了系统性的推理局限性。主要模型得分(按加权分数排序)如下:
- Hailuo2.3:加权分数 79.4%, 准确率 22.5%
- Veo3.1:加权分数 76.4%, 准确率 22.3%
- Sora-2:加权分数 77.0%, 准确率 21.3%
- Wan2.6:加权分数 77.8%, 准确率 21.3%
- Kling2.6:加权分数 72.1%, 准确率 19.5%
数据获取与使用
- 数据地址:数据集(包括首帧图像和文本提示)可通过 https://huggingface.co/datasets/VisionXLab/RISE-Video 获取。
- 数据结构:数据以 JSON 文件(https://huggingface.co/datasets/VisionXLab/RISE-Video/blob/main/v5.json)形式组织,包含
task_id等字段。 - 生成视频组织格式:
{模型名称}/{样本类别}/{任务ID},生成的视频路径需写入上述 JSON 文件的"video_path"字段。
评估流程
- 帧提取:运行提供的脚本从视频中提取帧,用于“推理对齐”维度评估和可视化,提取的帧路径将自动写入 JSON 文件的
"frame_path"字段。 - 运行评估:配置评估脚本参数(如数据 JSON 路径、API 密钥等)后运行
eval.py,可在相应文件夹中查看评估结果和分数。
引用
如需使用本数据集,请引用相关论文:
@misc{liu2026risevideovideogeneratorsdecode, title={RISE-Video: Can Video Generators Decode Implicit World Rules?}, author={Mingxin Liu and Shuran Ma and Shibei Meng and Xiangyu Zhao and Zicheng Zhang and Shaofeng Zhang and Zhihang Zhong and Peixian Chen and Haoyu Cao and Xing Sun and Haodong Duan and Xue Yang}, year={2026}, eprint={2602.05986}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2602.05986}, }




