遇见数据集

hopchain-v40-1080p

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

HopChain v4.0 + Vript 是一个专为强化学习可验证奖励(RLVR)训练设计的大规模多跳视频推理数据集。它整合了HopChain v4.0和Vript两个来源的数据,共包含28,865个多跳视频问题,覆盖7,396个视频。每个问题都附带一个可通过确定性规则验证的整数答案,无需在训练时依赖大型语言模型作为评判器。数据被划分为训练集(25,975行)和验证集(2,890行),划分确保没有视频同时出现在两个集合中。每个问题由3到7个“跳跃”组成(最常见的为4-5跳),每个跳跃涉及观察视频场景中的一个事实,并通过一个“如果<事实>则A否则B”的二元规则将其转化为一个数字,最终使用加法和乘法聚合成一个可验证的整数答案。问题涵盖了11种推理类型,包括存在、颜色、动作、共现、场景、算术、顺序、首尾、属性匹配、重复和状态变化。数据集中,HopChain v4.0部分包含6,692个问答对,基于1,748个多样化的YouTube视频(通常20-60秒),并使用1080p级别的字幕。Vript部分包含22,173个问答对,基于5,648个更长的视频(中位数7分12秒),这些视频带有密集的场景标注并经过重新字幕生成。两个来源都通过相同的HopChain流水线处理,确保问题格式、系统提示和奖励契约一致。每条数据记录都是一个完整的、与verl框架兼容的提示,结构化为JSON格式。它包含系统提示、用户问题(结合了视频和文本问题)、视频元数据(路径、帧率、最大帧数等)、数据源标识、能力标签、奖励模型信息(包含真实答案)以及一个“extra_info”字段。该额外信息字段提供了答案、跳跃数量、跳跃类型列表、解决率(基于一个训练模型在8次运行中的成功率,可用于课程学习采样)和难度等级(绝大多数为“困难”)。该数据集适用于训练和评估视频多跳推理模型,特别侧重于需要可验证、逐步推理能力的强化学习场景。其设计通过“过易过滤器”和“盲解过滤器”旨在消除简单或仅依赖语言线索即可解决的问题,确保推理挑战的真实性。

HopChain v4.0 + Vript is a large-scale multi-hop video reasoning dataset designed for reinforcement learning with verifiable rewards (RLVR) training. It integrates data from two sources, HopChain v4.0 and Vript, containing a total of 28,865 multi-hop video questions covering 7,396 videos. Each question comes with a verifiable integer answer that can be validated through deterministic rules, eliminating the need to rely on large language models as judges during training. The data is split into a training set (25,975 rows) and a validation set (2,890 rows), with the split ensuring no video appears in both sets. Each question consists of 3 to 7 hops (most commonly 4-5 hops), where each hop involves observing a fact in a video scene and transforming it into a number via a binary if <fact> then A else B rule, ultimately aggregated using addition and multiplication into a verifiable integer answer. The questions cover 11 reasoning types, including existence, color, action, co-occurrence, scene, arithmetic, order, first/last, attribute matching, repetition, and state change. In the dataset, the HopChain v4.0 portion includes 6,692 question-answer pairs based on 1,748 diverse YouTube videos (typically 20-60 seconds) with 1080p-level captions. The Vript portion includes 22,173 question-answer pairs based on 5,648 longer videos (median 7 minutes 12 seconds) that feature dense scene annotations and have been re-captioned. Both sources are processed through the same HopChain pipeline to ensure consistency in question format, system prompts, and reward contracts. Each data record is a complete prompt compatible with the verl framework, structured in JSON format. It includes a system prompt, user question (combining video and text questions), video metadata (path, frame rate, maximum frames, etc.), data source identifier, capability labels, reward model information (including the true answer), and an extra_info field. This extra info field provides the answer, number of hops, list of hop types, solve rate (based on a trained models success rate over 8 runs, usable for curriculum learning sampling), and difficulty level (mostly hard). The dataset is suitable for training and evaluating video multi-hop reasoning models, with a particular focus on reinforcement learning scenarios requiring verifiable, step-by-step reasoning capabilities. Its design incorporates too-easy filters and blind-solution filters to eliminate problems that are trivial or solvable solely through language cues, ensuring the authenticity of the reasoning challenge.

创建时间:
2026-07-17
原始信息汇总

数据集概述:HopChain v4.0 + Vript — 多跳视频推理数据集

基本信息

  • 数据集名称: HopChain v4.0 + Vript
  • 许可协议: Apache-2.0
  • 任务类型: 视频-文本到文本(Video-Text-to-Text)、问答(Question-Answering)
  • 语言: 英语(en)
  • 数据集规模: 10K < n < 100K(共 28,865 条问答对)
  • 标签: 视频、多跳推理、RLVR、可验证奖励、强化学习

数据规模与构成

划分 行数 HopChain来源 Vript来源 视频数量 跳数分布(3/4/5/6/7) 解决率
训练集 25,975 6,004 19,971 6,657 523 / 4,957 / 9,438 / 8,013 / 3,044 0.0081
验证集 2,890 688 2,202 739 46 / 557 / 1,071 / 879 / 337 0.0088
总计 28,865 6,692 22,173 7,396 569 / 5,514 / 10,509 / 8,892 / 3,381 0.0082
  • 视频去重划分:使用种子值 42 确保训练集和验证集之间无视频重叠。

数据来源

HopChain v4.0

  • 问答对数量: 6,692 / 视频数量: 1,748
  • 视频质量: 1080p,基于字幕的多跳条件谓词推理
  • 视频来源: 多样化的YouTube视频
  • 视频时长: 20–60秒

Vript

  • 问答对数量: 22,173 / 视频数量: 5,648
  • 视频来源: 高质量YouTube视频,具有密集场景级注释(镜头类型、摄像机运动、内容、画外音)
  • 原始视频数量: ~11,000,筛选后使用8,046个视频(>3分钟,中位数7分12秒,平均9分钟)
  • 视频时长: 3–7分钟,提供更丰富的时序推理机会

数据集核心特性

多跳推理

  • 每个问题包含 3–6 个条件谓词跳数(模式:4–5 跳)
  • 每跳观察一个场景的稳健事实,通过二元规则转换为数字(if <事实> then A else B),再通过 + * 聚合为单个可验证整数

11种推理类型

  • 原始类型(6种): 存在性(existence)、颜色(color)、动作(action)、共现(cooccur)、场景(setting)、算术(arithmetic)
  • 跨场景新类型(5种): 顺序(order)、首尾(first_last)、属性匹配(attr_match)、重复(recurrence)、状态变化(state_change)

可验证答案

  • 每个问题有 整数地面真实答案,可通过规则检查(无需LLM裁判)
  • 专为 RLVR(强化学习与可验证奖励) 训练设计

难度过滤

  • 使用训练模型(Qwen3-VL-8B-Instruct,140帧)进行8次运行探测,若解决率 ≥ 6/8 则剔除(过于简单的问题)

数据模式(Schema)

每条记录包含完整兼容的提示格式:

json { "prompt": [ {"role": "system", "content": "你是细心的推理助手..."}, {"role": "user", "content": "<video> <问题>"} ], "videos": [{"type": "video", "video": "路径/视频.mp4", "fps": 1, "max_frames": 140, "min_pixels": 3136, "max_pixels": 50176}], "reward_model": {"ground_truth": "42", "style": "rule"}, "extra_info": { "reward_type": "numeric", "answer": "42", "answer_type": "numeric", "num_hops": 5, "hop_types": ["order", "cooccur", "action", "color", "arithmetic"], "question_id": "VIDEOID_hq000", "video_id": "VIDEOID", "solve_rate": 0.0, "difficulty_band": "hard" } }

关键字段

  • reward_model.ground_truth: 整数答案(精确匹配奖励)
  • extra_info.num_hops: 条件谓词观察跳数
  • extra_info.hop_types: 每跳的推理类型列表
  • extra_info.solve_rate: 训练模型8次运行中解决的比例(用于课程采样)
  • extra_info.difficulty_band: 难度等级("hard" 99.5%,"medium","easy")

数据处理流程

数据生成流水线

  1. 字幕生成: 使用397B-FP8模型从视频帧生成密集字幕(HopChain: 1080p原始字幕;Vript: 从场景注释重新生成字幕)
  2. 问题生成: 397B-FP8模型为每个视频生成5个候选问题
  3. 评判筛选: 27B模型对候选问题评分,选择最佳
  4. 过易过滤: 8B-VL模型对每个问题探测8次,解决率 ≥ 6/8 则剔除
  5. 盲解过滤: 移除仅依赖语言的快捷方式(比率0.071)

数据规模过滤漏斗

HopChain v4.0:

阶段 数量
输入视频 1,818
处理视频 1,787(98.3%)
候选问题 14,021
评判幸存 7,539(53.8%)
最终保留 6,692(3.74/视频)

Vript:

阶段 数量
输入视频 8,046
处理视频 ~5,800
最终保留 22,173(3.82/视频)

课程采样建议

利用 solve_rate 字段进行课程训练:

  • 热身阶段: 选择 solve_rate > 0 的样本(较简单,3–4跳,简单推理类型)
  • 退火阶段: 进入 solve_rate = 0 的困难尾部(5–7跳,99.5% 困难样本)

注意事项

  1. 混合字幕模型: HopChain视频中144/1,818由122B模型生成字幕,其余由397B-FP8生成;Vript全部由397B重新生成字幕
  2. 生成过程不访问原始帧: 字幕是唯一地面真实信息,盲解率(0.071)为快捷方式上限
  3. 视频去重划分: 确保训练集和验证集之间无视频泄漏

引用

bibtex @misc{hopchain2026, title={HopChain: Harder Multi-Hop Video Reasoning with Verifiable Answers}, author={Trung, Ng Quang}, year={2026}, howpublished={\url{https://huggingface.co/datasets/ngqtrung/hopchain-v40-1080p}} }

搜集汇总
数据集介绍
hopchain-v40-1080p 数据集图片
构建方式
HopChain-v40-1080p数据集由两大来源融合构建而成。其一为HopChain v4.0,从1818个YouTube视频中筛选出1748个,通过397B-FP8模型生成密集字幕,并利用链式推理管道生成候选问题,经27B模型评分筛选及太易过滤(基于Qwen3-VL-8B-Instruct模型以8次运行求解率低于6/8为标准),最终保留6692个高质量问答对。其二为Vript子集,从8046个时长超过3分钟的高质量YouTube视频中,利用场景注释重新生成字幕,并经过相同的管道处理,得到22173个问答对。整个流程包含字幕生成、五轮候选问题生成、候选评分、太易过滤和盲解过滤五个阶段,确保每个问题均具有可验证的整数答案。
特点
该数据集共包含28865个视频多跳推理问答对,覆盖7396个视频,其中75%的问题为4至6跳推理,难度分布从3跳到7跳不等,但整体求解率仅0.0082,凸显其高度挑战性。问题设计涵盖11种推理家族,包括6种原有的存在性、颜色、动作等类型,以及5种新增的跨场景推理如顺序、首次与末次、属性匹配等,极大地扩展了视频时空推理的复杂性。每个问题均附带丰富的元信息,包括跳数、跳类型、求解率和难度带,其中99.5%的问题被标记为“困难”,有利于进行课程学习训练。此外,数据集采用视频无重叠划分,确保训练和验证集间无视频泄漏。
使用方法
数据集采用与verl框架兼容的JSON格式存储,每条记录包含系统提示、用户提示(嵌入视频和问题)、奖励模型(基于准确整数匹配的规则奖励)及额外信息如跳数和难度。使用时,开发者可直接加载训练和验证Parquet文件,利用视频路径(HopChain视频为140帧代理,Vript视频为原始分辨率)配合固定的fps、帧数和像素参数进行训练。特别地,通过`solve_rate`字段可实现课程采样:先使用求解率大于0的较简单样本(3-4跳)进行预训练,再逐渐过渡到求解率为0的高难度样本(5-7跳)。同时,数据集中的`difficulty_band`标签可直接用于难度分层训练,无需额外计算。
背景与挑战
背景概述
HopChain-v40-1080p数据集由Ng Quang Trung等人于2026年创建,旨在解决视频理解领域中多跳推理这一核心研究问题。该数据集融合了HopChain v4.0与Vript两个来源,包含28,865个多跳视频问答对,覆盖7,396个1080p高清视频。每个问题均具有可验证的整数答案,可直接通过规则检验,无需依赖大语言模型作为裁判,从而为基于可验证奖励的强化学习(RLVR)训练提供了坚实基础。该数据集通过引入跨场景的推理家族(如顺序、首尾、属性匹配等),显著提升了视频多跳推理的难度与多样性,对推动视频理解与强化学习交叉领域的研究具有重要影响力。
当前挑战
该数据集所应对的核心领域挑战在于,现有视频问答基准多集中于简单的单跳或浅层推理,难以评估模型在复杂逻辑链上的推理能力。HopChain-v40-1080p通过设计3至7跳的条件谓词推理问题,要求模型同时整合多个视觉事实并进行数值化聚合,极大提升了推理难度。在数据集构建过程中,团队面临多项挑战:如何从长达数分钟的视频中生成密集且准确的场景描述;如何设计有效的难度过滤机制(如采用8B视觉语言模型进行8次探测,剔除解答率过高的简单问题);以及如何消除语言捷径的干扰(通过盲解器过滤,将捷径上限控制在7.1%),确保每个问题均需依赖视频内容方能解答。
常用场景
经典使用场景
HopChain v4.0 + Vript数据集整合了7,396段高清视频与28,865道多跳推理问题,广泛用于视频理解领域的问答任务。每道问题均包含3至7跳条件谓词推理,涵盖存在性、颜色、动作、共现、场景、算术等11种推理族,尤其引入跨场景的新推理类型如顺序、首尾、属性匹配、重复与状态变化。数据集的独特之处在于每个问题均配有一个可由规则验证的整数答案,无需大语言模型在训练时担任裁判,从而为强化学习中的可验证奖励机制提供了理想平台。研究者常将其作为基准,以评估模型在多跳视频推理中的表现,并采用难度门控策略筛选出极具挑战性的样本,促进更深入的理解能力研究。
衍生相关工作
该数据集衍生了一系列在视频推理领域具有影响力的工作。首先,其管道方法启发了基于字幕生成与联合评判的多跳问题构建框架,推动了如VideoReasoningBench等基准测试的开发。其次,难度门控与课程学习策略被后续研究广泛借鉴,用于优化模型训练过程,例如通过solve_rate字段实现从简单到困难样本的渐进式学习。此外,数据集中使用的11种推理族,特别是跨场景推理类型,为后续研究提供了新的分析维度,催生了关于视频中时空推理、因果推理和时序关系建模的深入探索。最后,其可验证奖励机制的设计理念,已被应用于其他强化学习场景,促进了更可靠、客观的评估体系建立。
数据集最近研究
最新研究方向
在视频理解领域,多跳推理(Multi-Hop Reasoning)正成为检验模型时空认知与因果链构建能力的前沿试金石。HopChain v4.0 数据集以 28,865 条跨越 3 至 7 跳的复杂视频问答为核心,融合了 HopChain 与 Vript 两大视频源,引入 11 种推理家族(包括跨场景的 order、state_change 等新类别),并通过可验证的整数答案与严格难度门控机制,为强化学习(RLVR)训练提供了坚实的奖励信号。该数据集不仅关注视频中细粒度的动作、颜色、共现等原子事实,更强调条件谓词在时间序列上的组合聚合,直击当前视觉语言模型在长程逻辑推理上的瓶颈,其发布的视频无泄漏切分与难度分档采样策略,为构建更鲁棒、更具泛化能力的多模态推理系统奠定了重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务