遇见数据集

Video_VJEPA_CMPR_ADJ

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Video_VJEPA_CMPR_ADJ 是一个派生潜在表示数据集,包含从 VideoChat3 Stage-3 训练视频中提取并经过压缩处理的视觉特征。该数据集不包含原始视频文件,而是提供了视频内容经过 V-JEPA 2.1 视觉变换器编码和 SoftTOME(Moore-adjacent 合并)压缩后的潜在表示。每个数据样本对应一个16秒(或64帧,采样率为4 fps)的视频片段,被压缩为一组固定的1536个维度为768的令牌。此外,数据还包含每个幸存令牌在管状体网格坐标系中的质心坐标 `(t, x, y)`,以及在后续分片中提供的每个令牌的显著性/重要性分数。数据集适用于需要预计算视觉记忆或 JEPA 风格潜在流的研究任务,例如训练能够消费 SoftTOME 令牌和坐标的模型,或进行压缩视频令牌、时序顺序和坐标条件记忆等相关研究。数据以分片形式组织,早期分片(0000-0010)仅包含张量和质心,后续分片(0011-0017)额外包含重要性分数。每个样本存储为 PyTorch `.pt` 文件,包含 `tensor`、`centroids`、`saliency`(可选)、`stem`、`chunk` 和 `meta` 等字段。

Video_VJEPA_CMPR_ADJ is a derived latent representation dataset containing visual features extracted and compressed from the training videos of VideoChat3 Stage-3. This dataset does not include the original video files; instead, it provides latent representations of video content encoded by the V-JEPA 2.1 visual transformer and compressed via SoftTOME (Moore-adjacent merging). Each data sample corresponds to a 16-second video clip (or 64 frames at a sampling rate of 4 fps), which is compressed into a fixed set of 1536 tokens each with a dimension of 768. Additionally, the dataset includes the centroid coordinates `(t, x, y)` of each surviving token in the tubular grid coordinate system, as well as the saliency/importance scores for each token, which will be provided in subsequent data shards. This dataset is applicable to research tasks requiring precomputed visual memory or JEPA-style latent streams, such as training models that consume SoftTOME tokens and their corresponding coordinates, or conducting studies on compressed video tokens, temporal ordering, and coordinate-conditioned memory. The data is organized into shards: early shards (0000–0010) only contain tensors and centroids, while later shards (0011–0017) additionally include the saliency/importance scores. Each sample is stored as a PyTorch `.pt` file, with fields including `tensor`, `centroids`, `saliency` (optional), `stem`, `chunk`, and `meta`.

创建时间:
2026-07-27
原始信息汇总

数据集概述:Video_VJEPA_CMPR_ADJ

基本信息

  • 数据集名称:Video V-JEPA SoftTOME Compressed Adjacent Latents
  • 许可证:其他(未明确指定)
  • 任务类别:特征提取、视频分类
  • 标签:video, v-jepa, softtome, latents, centroids, saliency, importance, videochat3
  • 数据规模:100K < n < 1M
  • 数据集地址:https://huggingface.co/datasets/rookierufus/Video_VJEPA_CMPR_ADJ

数据集来源

  • 源视频:来自 VideoChat3 Stage-3 训练媒体库(VideoChat3-Stage3-Training-Data 视频池,约 9.2k 个 mp4 文件)
  • 父论文:VideoChat3(arXiv:2607.14935)
  • 父项目:MCG-NJU/VideoChat3(GitHub)
  • 说明:本数据集仅存储从这些视频计算得到的下游 SoftTOME 潜变量,不重新分发原始 mp4 视频

数据集内容

处理流程概述

  1. 视频解码:单次 ffmpeg 遍历每个 mp4,采样 fps=4,短边缩放至 438,中心裁剪至 384×384,输出 [T, 384, 384, 3] RGB 数组
  2. 分块:非重叠的 64 帧窗口(16 秒),丢弃不足 64 帧的尾部
  3. 编码与压缩(GPU):使用 V-JEPA 2.1 ViT-B 骨干网络,经 Col-Ln 显著性计算、SoftTOME 合并,输出每个块的压缩潜变量
  4. 写入:原子写入 .pt 文件,按分片目录滚动存储
  5. 发布:将活跃写目标分片打包为 tar 文件上传至 Hugging Face

仓库布局

  • shards/:初始运行,包含 tensor + centroids(无 saliency),shard_0000.tar 至 shard_0010.tar
  • tar_continuation_importance/:延续运行,包含 tensor + centroids + saliency,shard_0011.tar 至 shard_0017.tar
  • 每个分片约 50 GiB 本地 .pt 文件打包成 tar

文件结构

  • 每个 .pt 文件包含一个字典,键值如下:
    • tensor:[1536, 768] float32,SoftTOME 压缩后的 V-JEPA 潜变量
    • centroids:[1536, 3] float32,最终 SoftTOME 质心,布局为 (t, x, y) 管状网格坐标
    • saliency:[1536] float32,每个幸存者的 SoftTOME 显著性/重要性质量(仅存在于 tar_continuation_importance/ 中)
    • stem:str,视频键标识符
    • chunk:int,块索引 k
    • meta:dict,包含 frames、centroid_layout、centroid_space、score_kind 等元信息

网格几何信息(每个 64 帧块)

  • 输入视频片段:[64, 384, 384, 3]
  • V-JEPA 管状网格:时间 64/2=32,空间 384/16=24 → 总令牌数 N=32×24×24=18432
  • SoftTOME 保留比例 1/12 → 幸存者数 K=1536
  • 质心按与 tensor 行相同的顺序排列(排序键使用 (t, y, x) 然后映射为存储的 (t, x, y))
  • 当存在时,saliency[i] 与 tensor[i] 和 centroids[i] 对齐

显著性/重要性分数

  • 计算方式:Col-Ln 产生原始管状显著性分数 → 每块 min-max 归一化 → SoftTOME 合并相邻节点 → 存储合并后的质量 S
  • 存储位置:仅在延续分片(tar_continuation_importance/shard_0011 至 shard_0017)中包含
  • 使用建议:作为块内相对重要性排序/加权,可用于重要性采样、令牌丢弃课程或基于质量的坐标条件记忆
  • 注意事项:Col-Ln 每块 min-max 归一化 + SoftTOME 合并使得跨块比较仅为近似值

预期用途

  • 预计算视觉记忆 / JEPA 风格潜变量流,用于训练消费 SoftTOME 令牌和坐标的模型
  • 研究压缩视频令牌、时序顺序和坐标条件记忆
  • 不替代原始的 VideoChat3 QA / 对话注释

限制与注意事项

  • 短于 16 秒(4 fps 采样后)的视频产生零个块,被跳过
  • SoftTOME 是随机的(有种子),质心是合并后的连续管状网格值
  • saliency 仅在延续分片中可用,早期分片缺失,应始终使用 obj.get("saliency")
  • 早期分片(shards/0000–0010)每个文件约 54 MiB(因保存批次视图未克隆存储),逻辑张量正确;延续分片约 4.5 MiB/文件并包含 saliency
  • 完整生产运行包含 shard_0000 至 shard_0017,约 74.8k 延续块加上早期阶段分片

引用建议

使用本潜变量数据集时,建议引用 VideoChat3(父视频来源)以及 V-JEPA / SoftTOME 方法。

搜集汇总
数据集介绍
Video_VJEPA_CMPR_ADJ 数据集图片
构建方式
该数据集基于VideoChat3 Stage-3训练视频构建,首先对原始mp4视频进行解码与预处理,通过ffmpeg以4 fps采样并中心裁剪至384×384尺寸。随后将视频切分为不重叠的64帧片段(对应16秒时长),丢弃不足64帧的剩余部分。每个片段经V-JEPA 2.1 ViT-B骨干网络编码为18432个tubelet令牌,再通过SoftTOME算法进行Moore-adjacent合并,以1/12保留率压缩至1536个令牌,同时记录最终合并后的质心坐标与重要性质量。处理后数据以PyTorch张量形式分片存储于tar归档文件中,早期分片仅包含张量与质心,后续分片额外加入每个幸存令牌的显著性得分。
使用方法
用户可通过tarfile与torch.load加载数据归档中的.pt文件,每个文件返回包含'tensor'、'centroids'及可选'saliency'键的字典。早期分片(shard_0000至0010)使用obj.get('saliency')可获取None值,后续分片则包含[1536]的显著性向量。张量与质心维度固定为[1536,768]与[1536,3],可直接用于构建视频记忆模型或JEPA风格潜在流。建议将显著性视为片段内相对重要性指标,避免跨片段或跨视频的校准。加载时可采用weights_only=False兼容完整对象,并利用meta字段获取帧数、质心布局等元信息。
背景与挑战
背景概述
Video_VJEPA_CMPR_ADJ数据集诞生于视频多模态大语言模型(MLLM)快速发展的背景下,由MCG-NJU机构于视频理解前沿研究VideoChat3项目中创建。该数据集旨在解决长视频密集表征的存储与计算瓶颈,通过压缩V-JEPA 2.1架构产生的管状潜在特征(tubelet latents),结合SoftTOME算法实现相邻节点的智能合并。它包含约9.2k段源自VideoChat3 Stage-3训练视频的16秒片段,每段被压缩为固定1536个维度为768的令牌,并附加时空质心坐标。作为衍生潜在数据集,其不直接分发原始视频,但为视频特征提取与分类任务提供了高效、轻量的预计算方案,在视频MLLM领域具备显著影响力,推动了压缩视觉记忆与条件坐标建模的研究。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,原始视频令牌数量庞大(每片段18432个),直接处理需巨大计算资源,且视频内令牌的重要性差异未得到有效利用;2)构建过程中,需解决多阶段流水线的效率与一致性,如从视频解码、分块到V-JEPA编码及SoftTOME合并的端到端流程,需在GPU并行与CPU池间平衡;3)显著性分数仅在后继分片(continuation shards)中可用,早期分片缺失此关键信息,且该分数为块内相对值,无法跨片段全局校准,限制了其泛化应用;4)早期分片因存储实现问题体积膨胀,增加了传输与处理开销,需后续优化克隆策略以提升效率。
常用场景
经典使用场景
Video_VJEPA_CMPR_ADJ数据集专为视频表示学习与高效视觉记忆建模而设计,其核心应用在于为多模态大语言模型提供经过SoftTOME压缩后的V-JEPA语义潜伏特征。该数据集将每段16秒、64帧的视频片段,通过V-JEPA 2.1编码器提取出18432个管状网格令牌,再经SoftTOME算法以1/12的比例融合为1536个紧凑令牌,同时保留其在时空坐标(t, x, y)上的质心信息。这些高度浓缩的特征张量可直接作为下游视频理解模型的输入,尤其适用于需要处理长时视频流、依赖时空压缩表示的场景,如视频对话系统的视觉骨干预训练与实时推理。
解决学术问题
该数据集有效攻克了多模态视频研究中长时序列处理与计算效率之间的矛盾。传统视频模型在处理连续帧时面临令牌数量爆炸难题,而Video_VJEPA_CMPR_ADJ通过SoftTOME的重要性感知合并策略,在保持关键语义信息的前提下将令牌压缩至原始数量的1/12,显著降低了后续Transformer的自注意力计算复杂度。此外,数据集引入的逐令牌显著性分数解决了视频令牌重要性排序问题,使得学术研究能够探索基于重要性采样的梯度优化、令牌丢弃课程学习等新范式,为理解视频时空冗余性与语义密度分布提供了量化工具,推动了高效视频表示学习从理论走向实践。
实际应用
在现实场景中,该数据集可直接服务于视频流媒体分析、智能监控与多模态人机交互系统。例如,在视频聊天机器人领域,开发者可利用这些预计算的特征加速对话模型的在线推理,使其在低成本硬件上实现秒级响应;在自动驾驶的视觉感知模块中,压缩后的令牌流可用于实时处理数十秒级别的行车视频,结合显著性分数优先关注事故易发区域。此外,视频内容审核与摘要生成系统能够借助质心坐标与重要性权重,快速定位关键事件片段,实现长视频的智能裁剪与高光提取,显著提升工业管道中视频预处理与特征提取的效率。
数据集最近研究
最新研究方向
Video_VJEPA_CMPR_ADJ数据集聚焦于视频多模态大语言模型(MLLM)中的高效视频表示压缩与时空语义建模前沿方向。该数据集基于VideoChat3的长视频训练阶段,采用V-JEPA 2.1自监督编码器提取管状令牌,并结合SoftTOME算法实现基于图像块邻接关系的自适应令牌合并,将每段16秒视频压缩至固定1536个768维令牌及对应时空质心。这一创新性压缩策略有效缓解了视频理解中长序列的冗余计算与显存瓶颈,配合延续分片中的显著性质量分数,为重要性采样、因果注意力和基于坐标的条件记忆等下游任务提供了精细化的令牌级调控依据。其研究意义在于推动了开源视频MLLM领域从简易帧采样向结构化语义压缩的范式演进,为构建高效、通用的长期视频理解系统奠定了关键数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务