遇见数据集

OpenCoF-17K

收藏
arXiv2026-07-10 更新2026-07-11 收录
数据链接:
官方服务:

资源简介:

OpenCoF-17K是由字节跳动种子与香港中文大学联合构建的大规模视频推理数据集,旨在为链式帧推理提供多样化的时序监督。该数据集包含17,312个视频样本,覆盖国际象棋、数独、二维几何、点连线等11类任务家族,视频统一规范为480p分辨率、15帧率及81帧时长,平均提示词长度为53.2个单词,数据通过实例渲染、专家引导渲染、程序化场景合成和外部视频重构四类管道融合生成。其创建过程整合了结构化资产转换、人类专家标注、大语言模型概念生成以及物理引擎仿真等多模态技术,构建了可扩展的标准化视频推理格式。该数据集主要应用于增强视频生成模型的时空推理能力,旨在解决动态视觉逻辑建模、长时序连贯性及物理一致性等核心问题,推动面向推理任务的视频生成技术发展。

OpenCoF-17K is a large-scale video reasoning dataset jointly constructed by ByteDance Seed and The Chinese University of Hong Kong, which aims to provide diverse temporal supervision for chained frame reasoning. This dataset contains 17,312 video samples covering 11 task families including chess, Sudoku, 2D geometry, point-to-line connection and other related tasks. All videos are uniformly standardized to 480p resolution, 15 frames per second (fps) and a duration of 81 frames, with an average prompt length of 53.2 words. The data is generated through four integrated pipelines: instance rendering, expert-guided rendering, procedural scene synthesis and external video reconstruction. Its creation process integrates multimodal technologies such as structured asset transformation, human expert annotation, large language model (LLM) concept generation and physics engine simulation, establishing a scalable and standardized video reasoning format. This dataset is mainly applied to enhance the spatial-temporal reasoning capabilities of video generation models, aiming to solve core issues including dynamic visual logic modeling, long-term temporal coherence and physical consistency, and promote the development of video generation technologies for reasoning tasks.

创建时间:
2026-07-10
原始信息汇总

数据集概述:OpenCoF-17K

数据集名称:OpenCoF-17K

所属项目:OpenCoF(Learning to Reason Through Video Generation)

数据集规模:包含 17,312 个视频样本。

任务类型:覆盖 11 个任务族(Task Families),专注于 Chain-of-Frame (CoF) 推理,即视频生成模型通过自身生成的帧序列的时间演化进行推理,而非依赖静态图像或外部工具。

数据构成:每个样本包含:

  • 一张初始条件图像(initial conditioning image)
  • 一个文本提示(text prompt)
  • 一个目标推理视频(target reasoning video),标准化为 480p、15 fps、81 帧

数据构建管道(共4条互补的构建流水线):

  1. 基于实例与专家引导的渲染:生成精确、受规则约束的视频,用于国际象棋、数独、几何等任务。
  2. 程序化场景合成:利用图形引擎渲染基于物理和3G的运动。
  3. 现有视频复用:增加现实世界的多样性,例如具身操作(embodied manipulation)。

数据集用途

  • 用于对基础模型 Wan2.2-I2V-A14B 进行 LoRA 微调,得到 Wan-CoF 模型。
  • 进一步用于训练两种推理令牌(Reasoning Tokens)变体:Wan-CoFvt(视觉推理令牌)和 Wan-CoFtt(文本推理令牌)。

基准测试结果: 在四个外部视频推理基准(MME-CoF、Gen-ViRe、VIPER、RULER-Bench)上,微调后的 Wan-CoF 及其推理令牌变体在所有主要指标上均优于基线模型。

搜集汇总
数据集介绍
OpenCoF-17K 数据集图片
构建方式
OpenCoF-17K数据集旨在弥补当前视频生成模型在推理任务中缺乏多样化时序监督的不足。该数据集通过四条互补的策展流水线构建而成:实例化渲染(从棋局、数独等结构化资产中提取并渲染视频)、专家引导渲染(利用人工、大语言模型或文生图模型生成结构后渲染)、程序化场景合成(通过物理引擎或图形管线从零生成视频,如七巧板、折纸、物理运动等),以及外部视频复用(筛选并标准化VR-Bench、VBVR、BridgeData V2等现有高质量演示视频)。所有视频均统一为480p分辨率、15帧率及81帧时长,最终汇集了横跨11个任务族、共17,312个样本的推理视频数据集。
特点
OpenCoF-17K数据集的核心特点在于其多样性与系统性。它覆盖了从算法逻辑(国际象棋、数独)、几何空间推理(二维几何、七巧板、折纸、三维多立方体旋转)到物理运动、迷宫导航、实体操控和视觉-体素推理等11个推理任务族,任务难度与风格跨度极大。数据集采用条件生成格式,每个样本均包含初始条件图像与文本提示词,并配套目标推理视频,平均提示词长度达53.2词。其构建理念强调通过多样化的时序监督信号,而非单一的视觉质量优化,来激发视频模型进行链式帧推理的能力,从而在外部基准上展现出可迁移的推理增益。
使用方法
OpenCoF-17K数据集专为条件视频生成任务设计,使用方法清晰明确。用户需提供一张初始图像和一段描述推理过程的文本提示词,模型则根据这些条件生成对应的推理视频。在研究中,研究者基于Wan2.2-I2V-A14B这一开源图像到视频生成模型,使用LoRA技术在OpenCoF-17K上微调,得到Wan-CoF模型。此外,数据集还可用于探索更高级的推理机制,如在DiT架构中引入视觉推理令牌和文本推理令牌,分别植于视觉潜变量序列与文本条件序列之中,以显式组织中间推理状态。实验表明,仅依靠数据微调即可在MME-CoF、Gen-ViRe、VIPER和RULER-Bench四个外部视频推理基准上取得显著提升。
背景与挑战
背景概述
在大型模型能力演进中,推理已成为核心议题,而视频生成模型开辟了一条有别于传统链式思维的全新推理路径:通过时间上连贯的帧序列展开推理,即帧链式推理。然而,现有视频生成器主要面向通用视频语料训练,缺乏专门针对推理任务的多样化监督与架构设计。为填补这一空白,来自字节跳动Seed团队与香港中文大学MMLab、IMIXR实验室的研究人员于2026年7月联合发布了OpenCoF-17K数据集。该数据集由17,312个视频样本构成,涵盖棋盘、数独、物理运动、迷宫导航等11个任务族,通过实例渲染、专家引导渲染、程序化场景合成与外部视频复用四种互补的构建流程精心打造,旨在为视频模型的帧链式推理能力提供丰富且高质量的时序监督信号。该数据集的开源有力地推动了面向推理的视频生成研究,成为连接数据驱动与推理机制探索的关键桥梁。
当前挑战
OpenCoF-17K及其研究直面视频推理领域的核心挑战。首先,现有视频生成模型在复杂推理任务中难以维持长时间帧间的时序连贯性、物理与空间一致性及逻辑连续性,视觉真实感无法保证可靠的推理质量。其次,构建过程面临多重困难:数据集需跨越从规则逻辑到物理仿真、从空间几何到物体操控的广阔推理维度,单一合成策略难以覆盖这样的多样性,因此研究团队开创性地整合了实例渲染、专家引导、程序化合成与外部视频复用四种互补的构建流程,才得以构建出覆盖11个任务族的视频推理语料库。此外,在模型设计层面,当前基于扩散变换器的视频生成器缺乏专门承载推理状态的模块,推理信息只能隐式地表达于像素级潜在空间中,如何在不对模型架构进行颠覆性改造的前提下引入显式的推理机制,同样是该领域亟待攻克的关键难题。
常用场景
经典使用场景
在视频生成模型的推理能力研究中,OpenCoF-17K作为首个面向链式帧推理的大规模数据集,最经典的使用场景是作为视频生成模型在多样化时空监督下的微调训练集。研究者可将其作为数据驱动的基准,通过在该数据集上进行参数高效微调,系统性地提升视频生成模型在推理密集型任务中的表现。该数据集涵盖国际象棋、数独、几何推理、物理运动、迷宫导航等11个任务族,为模型提供了丰富的、结构化的时序演化模式,使模型能够学习从初始状态到最终结果的因果链条与逻辑过渡。
解决学术问题
该数据集有效解决了当前视频生成模型在推理能力方面缺乏针对性训练数据的核心学术问题。现有视频生成模型在大规模通用视频语料上训练后,虽然具备高视觉保真度,但在逻辑一致性、物理合理性及长期时序连贯性上表现不佳,难以完成需要多步推理的复杂任务。OpenCoF-17K通过四种互补的构建流程,提供了明确的、带有推理标签的视频序列,使得研究者能够量化分析多步骤时空监督对链式帧推理行为的促进作用。其重要意义在于揭示了数据多样性本身即可显著提升模型在四个外部推理基准上的表现,为推理导向的视频生成研究奠定了可扩展的数据基础。
衍生相关工作
OpenCoF-17K的发布衍生了一系列具有深远影响力的相关研究工作。其直接衍生的Wan-CoF模型展示出仅通过数据微调即可在四个外部基准上取得显著提升,验证了多样化时序监督的有效性。进一步地,研究者提出了视觉推理令牌和文本推理令牌两种推理机制,分别作用于DiT模型的视觉潜在空间和文本条件序列,通过注意力分析揭示了不同类型令牌在网络深度、去噪步骤、空间与时间维度上的专业化角色。这些工作不仅推动了链式帧推理从领域特定的内部评估走向跨基准泛化评估,还启发了后续研究针对推理令牌数量与组合方式的探索,持续拓展了视频生成模型在推理能力增强方面的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务