遇见数据集

LongE2V-data

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

LongE2V数据集是为SIGGRAPH 2026论文《LongE2V: 基于长时程事件流的视频重建、预测与帧插值视频扩散模型》构建的预处理数据集,旨在支持基于事件相机的视频生成任务。它包含四个子数据集:BS-ERGB、ECD、MVSEC和HQF,数据内容主要包括图像序列(PNG格式)和对应的体素网格表示(NPZ格式),部分数据还包含反向体素网格和文本提示文件。数据集经过预处理,可直接用于训练和评估LongE2V统一视频扩散框架在三个核心任务上的性能:事件流到视频的重建、未来视频预测以及视频帧插值。在任务分配上,重建和预测任务使用ECD、MVSEC和HQF子集,插值任务使用BS-ERGB和HQF子集。数据集按照标准目录结构组织,包含训练集和测试集划分,便于机器学习流程的集成。

The LongE2V dataset is a preprocessed dataset constructed for the SIGGRAPH 2026 paper LongE2V: A Unified Video Diffusion Framework for Event Stream to Video Reconstruction, Prediction, and Frame Interpolation. It aims to support video generation tasks based on event cameras. The dataset includes four subsets: BS-ERGB, ECD, MVSEC, and HQF. The data primarily consists of image sequences (in PNG format) and corresponding voxel grid representations (in NPZ format), with some data also containing reverse voxel grids and text prompt files. The dataset is preprocessed and can be directly used for training and evaluating the performance of the LongE2V unified video diffusion framework on three core tasks: event stream to video reconstruction, future video prediction, and video frame interpolation. In terms of task allocation, the reconstruction and prediction tasks use the ECD, MVSEC, and HQF subsets, while the interpolation task uses the BS-ERGB and HQF subsets. The dataset is organized according to a standard directory structure, including training and test set divisions, facilitating integration into machine learning workflows.

创建时间:
2026-07-04
原始信息汇总

数据集概述:LongE2V-data

LongE2V-data 是为论文 LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models(SIGGRAPH 2026)提供的预处理数据集。

任务类别

  • 图像到视频(image-to-video)

数据集组成

该数据集由以下四个子数据集构成,用于训练和评估三个任务:

  • BS-ERGB
  • ECD
  • MVSEC
  • HQF

数据用途

  • 训练:每个训练序列需要 images/*.png(图像)、voxels/*.npz(体素)和 cogvlm_prompts.txt(提示文本)文件。
  • 重建与预测:使用 ECDMVSECHQF 子数据集。
  • 帧插值:使用 BS-ERGBHQF 子数据集。

数据布局

下载后数据应按照以下目录结构组织:

  • BS-ERGB:包含 train_set(含子序列的 images/voxels/cogvlm_prompts.txt)和 test_set(含子序列的 images/voxels/voxels_reverse/)。
  • ECD:每个序列包含 images_eval/voxels_eval/
  • MVSEC:每个序列包含 images_eval/voxels_eval/
  • HQF:每个序列包含 images/voxels/voxels_reverse/

下载方式

使用 huggingface_hub CLI 工具:

  • 下载全部数据集: bash hf download fansam39/LongE2V-data --repo-type dataset --local-dir data

  • 下载单个数据集(如 ECD): bash hf download fansam39/LongE2V-data --repo-type dataset --local-dir data --include "ECD/*"

更多信息

  • 项目页面:https://cdfan0627.github.io/LongE2V-page/
  • 论文:https://huggingface.co/papers/2607.08770
  • GitHub 仓库:https://github.com/cdfan0627/LongE2V
搜集汇总
数据集介绍
LongE2V-data 数据集图片
构建方式
LongE2V-data数据集为长时序事件驱动视频重建、预测与帧插补任务而构建,整合了BS-ERGB、ECD、MVSEC和HQF四个子数据集。在数据预处理阶段,研究者将原始事件流转换为体素网格(voxels),并与对应帧图像(images)对齐存储。训练集中包含由COGVLM生成的文本提示文件(cogvlm_prompts.txt),以支持多模态条件引导。每个子数据集按序列组织,文件夹内图像与体素网格一一对应,为视频扩散模型提供时空对齐的输入输出对。HQF和BS-ERGB还额外提供了逆向体素网格(voxels_reverse),用于帧插补任务。最终数据以PNG图像和NPZ压缩体素格式存储,可直接加载至指定目录结构。
使用方法
使用该数据集时,推荐通过huggingface_hub命令行工具进行完整或分次下载。下载后按data根目录下各子文件夹放置,每个序列包含images与voxels子目录,训练数据需额外保留cogvlm_prompts.txt。对重建与预测任务,可直接加载ECD、MVSEC和HQF的评估数据;帧插补任务则需利用BS-ERGB与HQF中的双向体素网格。研究者可根据任务需求编写PyTorch或TensorFlow数据加载器,以序列方式读取图像与对应体素,并依任务类型选择正向或逆向网格。推荐将体素网格作为条件输入,扩散模型以视频帧为生成目标,支持任意长度的连续帧输出。
背景与挑战
背景概述
LongE2V-data是伴随2026年SIGGRAPH会议论文《LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models》发布的事件数据视频处理基准数据集。由范承德、牟春玮、张辰玮等来自台湾地区的研究人员构建,核心研究问题在于利用稀疏事件流重建、预测和插值高质量、稳定且时间一致的视频。该数据集整合了BS-ERGB、ECD、MVSEC和HQF四个子集,为事件相机视频处理提供了标准化训练与测试平台,在计算机视觉与视频扩散模型领域具有重要影响力,尤其推动了长时间跨度事件视频重建任务的发展。
当前挑战
事件相机视频处理面临的核心挑战在于从稀疏、非均匀的事件流中恢复出纹理丰富、时间连续的视频帧,现有方法在长时间跨度下易产生模糊与畸变。LongE2V数据集构建过程中遭遇了多源异构数据整合的困难:需统一不同传感器(如DAVIS346、ATIS等)的事件时空编码(三维体素网格),并配合同步的高帧率RGB图像。此外,各子集采样率与运动场景差异显著,设计兼顾重建、预测与插值的统一评估协议,以及生成高质量文本描述(如cogvlm_prompts.txt),均构成了数据预处理与标注中的关键挑战。
常用场景
经典使用场景
LongE2V-data数据集专为基于事件的视频重建、预测与帧插值任务而构建,其核心应用场景涵盖三个经典方向:从稀疏事件流中恢复高质量视频、预测未来时刻的视频帧,以及实现事件数据驱动的视频帧率提升。该数据集整合了BS-ERGB、ECD、MVSEC和HQF四个子数据集,提供了预处理后的体素网格与对应图像,为视频扩散模型的训练与评估提供了标准化基准。研究者可基于此数据布局,利用扩散模型强大的生成能力,从事件流中提取时空信息,生成时序连贯且细节丰富的视频内容,使事件相机在低光照、高动态范围等挑战性环境下展现出超越传统帧基相机的潜力。
解决学术问题
该数据集有效解决了事件相机领域长期存在的两个关键学术难题:一是从稀疏、非均匀的事件流中重建连续视频时面临的时序不稳定与纹理细节缺失问题;二是长时域预测任务中扩散模型误差累积导致的视频质量退化。通过提供统一预处理的事件体素与图像对,LongE2V-data为探索视频扩散模型在高时域分辨率下的泛化能力奠定了数据基础。其发布推动了事件驱动视觉与扩散生成模型的交叉研究,使学术界能够系统性地评估不同框架在重建精度、帧预测一致性及插值平滑性上的表现,从而深化对事件数据时空建模本质的理解,并促进了事件视觉在前沿生成范式下的理论突破。
实际应用
在实际应用中,LongE2V-data所支持的技术能够赋能一系列对高时间分辨率与低延迟有严格要求的系统。例如,在高速机器视觉领域,该数据集训练的模型可从事件流中实时重建清晰视频,为工业质检、运动捕捉及自主导航提供可靠视觉输入。此外,基于事件的帧插值技术可用于增强传统摄像头的帧率,在视频监控、体育转播及虚拟现实中实现流畅慢动作回放。事件预测能力则使自动驾驶等安全攸关系统能够提前感知动态场景的演变,显著提升决策响应速度。这些应用不仅展示了事件相机在极端光照与高速运动场景下的独特优势,也为低成本、低功耗的视觉系统开辟了新路径。
数据集最近研究
最新研究方向
LongE2V-data数据集聚焦于基于事件相机的长时序视频生成任务,融合视频扩散模型实现高时空一致性的视频重建、预测与帧插值。该研究前沿围绕事件流驱动的神经渲染与超分辨率重建,结合SIGGRAPH 2026提出的长程依赖建模框架,突破传统帧基方法在高速动态场景下的模糊与数据冗余瓶颈。热点事件包括事件视觉传感器在自动驾驶、无人机自主导航及机器人灵巧操作中的规模化落地,该数据集通过提供BS-ERGB、ECD、MVSEC及HQF等跨场景预训练体素网格与图像对,显著提升了事件数据在复杂光照与快速运动环境下的重构保真度。其意义在于为视频扩散模型引入事件级时间先验,推动无监督长视频生成从短片段向分钟级连贯输出的跃迁,为下一代低延迟、高鲁棒性的实时视觉系统奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务