遇见数据集

PCVE-RigidBench

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

pcve_benchmark_v1 是一个面向物理一致性视频编辑的基准测试数据集。该数据集旨在评估视频编辑方法在保持物理规律(如质量、摩擦力、恢复系数、初始速度、物体存在性等)方面的表现。数据集包含20个不同的物理场景,20个源视频,共计126个编辑任务。每个编辑任务由一个源视频和一个提示词定义,提示词指定了对视频中物体物理属性的修改(如“增大质量”、“从第22帧开始减小摩擦力”等)。提示词有四种变体:模糊中文、模糊英文、定量中文和定量英文,其中定量版本包含具体的数值变化范围。数据集的目录结构包括:一个主清单文件(benchmark_manifest.json)记录所有编辑任务及其元数据;每个场景和编辑案例下包含源视频、编辑后的视频、提示词文件以及地面真值变换数据(每帧世界矩阵、线速度和角速度等);缩略图文件夹;以及按编辑类型、时序和属性划分的拆分文件。编辑任务按类型统计:ADD(添加物体)7个、DELETE(删除物体)27个、SET(修改属性)92个;按时序:全片编辑117个、部分帧编辑15个;按属性:摩擦力21个、初始速度26个、质量32个、物体存在性40个、恢复系数13个。该数据集适用于评估视频编辑模型在物理一致性方面的表现,可基于地面真值轨迹进行物理指标评估,或基于像素/感知指标进行视觉质量评估。

pcve_benchmark_v1 is a benchmark dataset for physically consistent video editing. This dataset aims to evaluate the performance of video editing methods in maintaining physical laws (such as mass, friction, coefficient of restitution, initial velocity, object existence, etc.). The dataset contains 20 different physical scenes, 20 source videos, and a total of 126 editing tasks. Each editing task is defined by a source video and a prompt that specifies modifications to physical properties of objects in the video (e.g., increase mass, decrease friction from frame 22). The prompts come in four variants: fuzzy Chinese, fuzzy English, quantitative Chinese, and quantitative English, where quantitative versions include specific numerical change ranges. The dataset directory structure includes: a main manifest file (benchmark_manifest.json) recording all editing tasks and their metadata; each scene and editing case contains source videos, edited videos, prompt files, and ground truth transformation data (per-frame world matrix, linear and angular velocities, etc.); a thumbnail folder; and split files by editing type, temporal scope, and attribute. Editing tasks are categorized by type: 7 ADD (add objects), 27 DELETE (delete objects), 92 SET (modify attributes); by temporal scope: 117 full-frame edits, 15 partial-frame edits; by attribute: 21 friction, 26 initial velocity, 32 mass, 40 object existence, 13 coefficient of restitution. This dataset is suitable for evaluating the physical consistency performance of video editing models, either through physical metrics based on ground truth trajectories or through pixel/perceptual metrics for visual quality assessment.

创建时间:
2026-09-04
原始信息汇总

数据集概述

PCVE-RigidBench(Physics-Consistent Video Editing benchmark)是一个面向物理一致性视频编辑任务的基准数据集。

规模与构成

  • 包含 20 个场景20 个源视频126 个编辑任务
  • 编辑任务类型分布:ADD(添加物体)7 个、DELETE(删除物体)27 个、SET(修改属性)92 个。
  • 按编辑生效时间:whole_clip(全程生效)117 个,partway(中途生效)15 个。
  • 按编辑属性:mass(质量)32 个、presence(存在性)40 个、friction(摩擦)21 个、restitution(恢复系数)13 个、initial_velocity(初速度)26 个。

数据结构

  • benchmark_manifest.json:权威索引文件,扁平化列出所有源视频与编辑任务,内联评估所需的全部字段(提示词、物理差异、编辑摘要、视频/真值路径)。
  • scenes/{scene}/cases/{case_id}/
    • video.mp4:源视频(基线场景)或编辑后的渲染结果。
    • prompts.json:与顶层 manifest 冗余,但便于按目录迭代的评估器直接使用。
    • ground_truth_transforms.json:逐帧世界矩阵、线/角速度及物理仿真产生的物体质量指标,用于物理一致性评估。
  • thumbnails/{scene}/{case_id}.jpg:每用例的中帧预览图。
  • splits/
    • all.txt:所有编辑任务的全局 ID 列表。
    • by_property/:按编辑属性(mass/friction/restitution/initial_velocity/presence)分桶的列表。
    • by_timing/:按生效时间分桶的列表,whole_clip.txt 对应从首帧起全程生效的编辑,partway.txt 对应从 applies_from_frame 起生效的编辑(此前帧应与源视频完全一致)。

提示词格式

每个编辑任务包含 4 种提示词:

  • vague.zh / vague.en:仅给出方向性描述(如“调大一点”/“Decrease X”)。
  • quantitative.zh / quantitative.en:包含 fromto 的具体数值。

所有提示词均在开头说明编辑生效时间(如“From frame 1 onwards”),与 manifest 中的 applies_from_frame 字段对应。

任务定义

给定(源视频、提示词),生成与 edited_video 匹配的编辑后视频。评估时可使用 ground_truth_transforms.json 进行逐帧物体轨迹的物理一致性检查,或与 edited_video 对比进行像素/感知层评估。

搜集汇总
数据集介绍
PCVE-RigidBench 数据集图片
构建方式
PCVE-RigidBench是面向物理一致性视频编辑的基准数据集,其构建过程严谨而系统。数据集包含20个场景、20个源视频及126个编辑任务,每个任务均配有源视频、编辑提示、编辑后视频及物理模拟生成的真实轨迹数据。构建流程中,所有编辑任务被细致分类,依据编辑属性(如质量、摩擦、恢复系数等)和生效时间(全局或中途)进行划分,确保覆盖多样化的物理编辑场景。提示文本设计为模糊与定量两种语言形式(中英双语),以测试模型对指令的精确理解。数据集的权威清单(benchmark_manifest.json)内联了所有评估所需字段,便于直接使用和验证。
特点
该数据集的核心特点在于其物理一致性的强调与多维度的评估支持。每个编辑任务均关联了由物理模拟器生成的逐帧世界矩阵、线速度、角速度及对象特定质量指标,为物理准确性评测提供金标准。数据集设计了清晰的划分机制,如按属性(质量、摩擦、恢复系数、初速度、存在性)和时间(全程或中途生效)进行分组,便于精细分析模型在不同编辑类型上的表现。此外,提示的模糊与定量双语设计,为研究指令跟随的鲁棒性提供了独特条件,而缩略图及分片文件则促进了快速浏览和定向评估。
使用方法
使用该数据集时,研究者可依据任务定义,给定源视频与编辑提示,生成编辑后的视频,并采用两种评价路径:一是对照ground_truth_transforms.json进行物理轨迹的逐帧比较,适用于物理一致性度量;二是与edited_video对比,进行像素级或感知级质量评估。数据集manifest文件提供了扁平索引,便于一键获取所有源视频、编辑案例及对应的评估文件,而splits目录则允许用户针对特定属性、时间或编辑类型进行子集实验,从而深入探究模型在各种物理编辑场景下的表现,尤其适用于基准测试和模型消融研究。
背景与挑战
背景概述
随着视频编辑技术的迅猛发展,物理一致性作为衡量编辑真实性的关键维度日益受到关注。PCVE-RigidBench数据集由学术界与工业界研究者联合创建,旨在系统评估视频编辑中物体运动轨迹与物理规律的一致性。该基准涵盖20个场景、20个源视频及126个编辑任务,涵盖质量、摩擦、恢复系数等物理属性的修改,为研究提供标准化评估框架。其出现填补了该领域缺乏三维动态与物理参数标注的空白,推动视频编辑从视觉真实向物理可信演进,对生成模型的可控性与可靠性研究具有重要影响。
当前挑战
该数据集面临的挑战集中于两方面。领域层面,视频编辑需同时保证像素级视觉质量与物理轨迹精确性,现有模型多侧重外观而忽视动力学约束,难以实现物体间相互作用及长期运动的一致性;构建层面,生成物理精确的编辑视频需模拟器与渲染器协同,确保施加的物理修改在视觉上自然无伪影,且将文本提示(如“从第X帧增大质量”)准确映射至视频时空坐标,涉及跨模态语义对齐与高精度时间戳标注的复杂流程。
常用场景
经典使用场景
PCVE-RigidBench作为物理一致性视频编辑基准,其核心应用场景聚焦于对视频编辑模型进行系统化的物理合理性评估与性能排名。该数据集精心构建了20个场景、20段源视频及126个编辑任务,每个任务均配置了模糊与量化两种提示形式,并提供了完整的帧级物理状态真值(包括全局变换矩阵、线速度与角速度),从而支持研究者针对视频编辑中的动态物体轨迹、碰撞反应及力效应进行精细化的定量评测。其经典用途在于衡量生成视频在保持编辑指令一致性的同时,是否忠实遵循现实世界的物理定律,成为该领域公认的基准测试平台。
实际应用
在实际应用疆域中,该数据集为内容创作产业中的视频后期编辑工具提供了关键的算法支撑与验证依据。借助PCVE-RigidBench,开发者可以训练和筛选出具备物理感知能力的编辑引擎,实现基于自然语言或数值指令的自动化物理属性调节,例如轻松改变车辆碰撞中的质量或摩擦设定,或删除场景中不合理的运动物体,从而大幅简化影视特效制作与游戏资产调整流程,提升创作效率与真实感。这些工具尤其适用于需要精确调控物体动态的领域,如虚拟现实体验生成、产品模拟展示以及自适应教学内容编制,能够显著增强视觉内容呈示的可信度与可控性。
衍生相关工作
自该基准问世以来,其衍生了一系列开创性的学术探索与工具链发展。围绕数据集中的物理轨迹真值(ground_truth_transforms),研究者构建了专门的物理一致性度量协议,催生出若干将动力学约束嵌入生成模型的创新架构。此外,该基准对“模糊提示”与“定量提示”的细分,启发了关于多粒度语言指令理解的研究,推动了提示条件化视频编辑模型的发展。时间维度上的部分生效剪辑设计也促进了局部时序编辑技术的延拓,例如在特定起始帧后才施加物理修改,为帧级可控的视频变换提供了新范式,形成了以PCVE-RigidBench为核心簇的系列高质量科研产出。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务