遇见数据集

OpenCoF-17K

收藏
github2026-07-10 更新2026-07-13 收录
数据链接:
官方服务:

资源简介:

OpenCoF-17K是一个推理视频数据集,包含17,312个视频,涵盖11个任务家族,通过四种互补的管道进行策划:基于实例的渲染、专家指导的渲染、程序化场景合成和外部视频再利用。该数据集旨在支持链式帧推理研究,为视频生成模型提供多样化的监督。

OpenCoF-17K is a reasoning video dataset comprising 17,312 videos spanning 11 task families, curated via four complementary pipelines: instance-based rendering, expert-guided rendering, procedural scene synthesis, and external video repurposing. This dataset is designed to support research on chained frame reasoning and provide diverse supervision for video generation models.

创建时间:
2026-07-10
原始信息汇总

OpenCoF: Learning to Reason Through Video Generation

概述 OpenCoF 是一个专注于通过视频生成进行推理的框架,旨在解决现有视频生成模型缺乏多样化监督和专用设计的问题。其核心是 OpenCoF-17K 数据集,用于训练 Wan-CoF 模型,以提升视频推理能力。

数据集:OpenCoF-17K

  • 规模与组成:包含17,312个视频,覆盖11个任务类别。
  • 构建流程:通过四种互补的流程构建:
    • 基于实例的渲染
    • 专家引导的渲染
    • 程序化场景合成
    • 外部视频再利用
  • 用途:用于微调 Wan2.2-I2V-A14B 模型,得到 Wan-CoF 模型。

模型:Wan-CoF

  • 基准模型:Wan2.2-I2V-A14B。
  • 推理机制:基于 Chain-of-Frame (CoF) 推理,通过时间上连续的帧展开推理过程。
  • 增强变体
    • Wan-CoF<sub>vt</sub>:引入视觉推理标记(Visual Reasoning Tokens),捕捉低层视觉线索。
    • Wan-CoF<sub>tt</sub>:引入文本推理标记(Textual Reasoning Tokens),捕捉高层语义先验。
  • 性能:在四个外部视频推理基准(MME-CoF, Gen-ViRe, VIPER, RULER-Bench)上,相比基线获得显著提升。

发布状态

搜集汇总
数据集介绍
OpenCoF-17K 数据集图片
构建方式
OpenCoF-17K数据集的构建旨在弥补现有视频生成模型在时序推理监督上的不足。该数据集涵盖17,312个视频,横跨11个任务族,通过四条互补的流水线精心构建而成:基于实例的渲染、专家引导的渲染、程序化场景合成以及外部视频的再利用。这些方法从不同维度确保了视频内容的多样性与推理任务的覆盖广度,为模型提供丰富的时序逻辑学习信号。
特点
OpenCoF-17K的核心特点在于其专为链式帧推理而设计,提供了区别于传统思维链的另一种推理路径。数据集中的视频通过时序上连贯的帧序列展现逻辑推演过程,使得模型能够在视觉模态上直接学习推理状态的组织与演变。此外,数据集支持视觉推理令牌与文本推理令牌两种互补的推理机制设计,分别捕捉低层视觉线索与高层语义先验,从而显著提升模型在多个视频推理基准上的表现。
使用方法
OpenCoF-17K主要用于微调视频生成模型以增强其推理能力,例如用于将Wan2.2-I2V-A14B模型训练为Wan-CoF。研究人员可基于该数据集对现有视频生成架构进行监督式微调,使其具备链式帧推理能力。同时,数据集可配合视觉推理令牌与文本推理令牌等定制化设计进行使用,以进一步优化模型在外部视频推理基准上的性能。代码、模型权重与数据集本身将在内部审查完成后陆续公开发布。
背景与挑战
背景概述
OpenCoF-17K数据集由陈新岩、郭子宇、张任瑞、蒋东志和李洪升等研究人员于2026年提出,旨在推动大模型通过视频生成进行逻辑推理的研究。随着推理能力成为大模型的核心需求,传统链式思维(CoT)依赖于文本序列,而视频生成模型可通过时间上连续的视频帧展开推理过程,即链式帧(CoF)推理。然而,现有视频生成器主要训练于通用视频语料,缺乏针对CoF推理的多样化监督与专用设计。OpenCoF-17K应运而生,包含17,312个视频,覆盖11个任务家族,通过实例渲染、专家引导渲染、程序化场景合成及外部视频再利用四条互补管道精心构建,为训练Wan-CoF模型提供了关键数据支撑,在MME-CoF、Gen-ViRe等外部推理基准上取得了显著提升,展现了视频推理领域的广阔前景。
当前挑战
OpenCoF-17K面临的核心挑战在于领域问题与构建过程的双重困境。领域方面,现有视频生成模型难以利用时间连续性进行推理,缺乏从视觉场景演变中逻辑推演的能力,例如因果推理、物理模拟等任务需要模型理解帧间动态关系而非静态特征。构建过程方面,数据集的创建需克服多重障碍:一是推理视频的多样性不足,需设计四条互补管道以覆盖11种任务类型;二是外部视频的重利用需精确标注与质量筛选,确保与推理目标一致;三是程序化场景合成需平衡复杂度与真实性,避免过度简化导致推理偏差;四是内部审查流程延迟了数据集的公开,限制了学术界的广泛验证与迭代。这些挑战共同界定了数据集在推动视频推理技术发展中的关键地位。
常用场景
经典使用场景
OpenCoF-17K数据集被精心设计用于训练和评估基于视频生成的推理模型,其核心场景在于实现从传统链式思维(Chain-of-Thought)到链式帧(Chain-of-Frame)推理范式的跨越。该数据集包含17,312个短视频,跨越11个任务家族,覆盖实例级渲染、专家引导、程序化场景合成及外部视频改造等多样化生成管道。研究者可借助该数据集微调视频生成基础模型(如Wan2.2-I2V-A14B),使其具备在连续帧间展开逻辑推理的能力,进而在视觉推理基准测试中显著提升性能。这一场景为视频理解与生成的深度融合提供了一个可复现的标准化训练框架。
衍生相关工作
围绕OpenCoF-17K数据集,衍生了一系列具有开创性的研究工作。核心成果为Wan-CoF系列模型,通过引入视觉推理令牌(Visual Reasoning Tokens)与文本推理令牌(Textual Reasoning Tokens),分别捕获低层视觉线索与高层语义先验,显著提升了视频推理的准确性与鲁棒性。MME-CoF、Gen-ViRe、VIPER及RULER-Bench等外部视频推理基准也基于该数据集进行了验证与拓展。这些工作共同构建了一个以数据驱动为基础、以显式推理状态表征为创新的研究生态,为后续探索视频生成与逻辑推演的交叉领域奠定了坚实的理论与实验基础。
数据集最近研究
最新研究方向
基于视频生成的链式帧推理能力研究。当前推理增强范式正从传统的链式思维向时空连贯的链式帧推理演进,OpenCoF-17K数据集通过实例渲染、专家引导、程序化场景合成及外部视频复用四条互补管线,构建了覆盖11类推理任务的17132段视频,为视频生成模型注入结构化推理信号。该工作揭示:更强的视频推理不仅依赖广域时序监督,更需显式组织中间推理状态的机制,其中视觉推理标记与文本推理标记分别捕获低层视觉线索与高层语义先验,为多模态大模型在物理世界因果推断、动态场景理解等前沿方向开辟了数据驱动的实现路径,其影响已延伸至机器人自主决策与科学模拟可视化等关键应用领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务