遇见数据集

quastAI/behavior-1k-2025-challenge-vjepa2-vitg-demo-embeddings

收藏
Hugging Face2026-05-23 更新2026-05-31 收录
官方服务:

资源简介:

这是一个预计算视频嵌入数据集,基于BEHAVIOR-1K 2025挑战演示的62小时子样本,使用V-JEPA 2 ViT-g编码器提取。数据集旨在通过消除重复的视频解码和编码前向传递,加速下游实验并提高可重复性,从而降低没有大型GPU集群的团队的使用门槛。它包含视觉嵌入(来自头戴、左腕和右腕摄像头)、本体感知列(如动作和状态)以及索引列,适用于具身AI、机器人学和世界模型等领域的研究。

许可证:MIT 任务类别: - 特征提取 标签: - behavior-1k - behavior-2025 - 机器人学 - 具身人工智能(Embodied AI) - 模仿学习 - 世界模型 - 演示数据 - 视频 - v-jepa - v-jepa-2 - vjepa2 - vit-g - 预计算特征 - 嵌入向量 友好名称:"V-JEPA 2 ViT-g 嵌入 —— BEHAVIOR-1K 2025 挑战赛演示数据集(62小时)" 规模类别: - 10万 < 样本数 < 100万 # V-JEPA 2 ViT-g 嵌入 —— BEHAVIOR-1K 2025 挑战赛演示数据集(62小时) 本数据集为[BEHAVIOR-1K 2025 挑战赛演示数据集](https://huggingface.co/datasets/behavior-1k/2025-challenge-demos)的62小时子采样子集的预计算视频嵌入,由[V-JEPA 2 ViT-g](https://github.com/facebookresearch/vjepa2)编码器提取。本数据集旨在消除重复的视频解码与编码器前向传播步骤,加速下游实验并提升可复现性,降低无大型GPU集群团队的研究门槛。 | 字段 | 取值 | |---|---| | 源数据集 | `behavior-1k/2025-challenge-demos` | | 子集规模 | 约62小时 | | 数据行数 | 约56.4万 | | 编码器 | V-JEPA 2 ViT-g | | 表征形式 | 预计算视频嵌入 + 本体感知数据 + 动作数据 | | 应用领域 | 具身人工智能(Embodied AI)· 机器人学 · 世界模型 | | 许可证 | MIT | > **注意:** 本仓库仅包含预计算的特征表征,未重新分发V-JEPA 2的源代码与模型权重。 ## 数据集架构 每一行对应原始30FPS片段中以5FPS采样的一个子采样步骤/帧,以及该帧对应的动作与本体感知数据。 ### Token列 —— 视觉嵌入(每个相机视角对应一组表征) | 列名 | 数据类型 | 形状 | 说明 | |---|---|---|---| | `tokens_head` | `float16 数组` | `(256, 1408)` | 头部相机视图 | | `tokens_left_wrist` | `float16 数组` | `(256, 1408)` | 左手腕相机视图 | | `tokens_right_wrist` | `float16 数组` | `(256, 1408)` | 右手腕相机视图 | 256个空间斑块 = (256像素 / 16像素斑块)²,管块(tubelet)大小为2。1408为ViT-G的嵌入维度。数据类型为`float16`——编码时会将bfloat16转换为该类型。 ### 本体感知列 —— 每个采样帧对应一条数据 | 列名 | 数据类型 | 形状 | 说明 | |---|---|---|---| | `actions` | `float32 数组` | `(138,)` | 从帧*f*到*f+1*的展平动作块;在30FPS转5FPS的设置下,步长(fstp)为6,23个自由度 → 形状为`(6×23,)` | | `states` | `float32 数组` | `(133,)` | 帧*f*处的精选本体感知状态 | | `cam_rel_poses` | `float32 数组` | `(21,)` | 帧*f*处的3台相机的相对位姿:每台相机包含位置`[3]` + 四元数`[4]`,总计21维 | ### 索引列 —— 标量值 | 列名 | 数据类型 | 说明 | |---|---|---| | `frame_index` | `int` | 原始MP4文件的帧编号 | | `episode_idx` | `int` | 数据集中的片段索引 | | `sample_idx` | `int` | 该片段的清单索引 | | `step_pos` | `int` | 该行在其所属片段中的从零开始的位置 | | `episode_len` | `int` | 该片段的总行数 | ## 数据集处理流程 关于数据集创建与处理的详细信息,请参阅[SHARP-Laps 处理仓库](https://github.com/SHARP-Labs/BEHAVIOR_challenge_dataset)。 ## 授权说明 本数据集采用**MIT协议**发布。 - 源演示数据集:[`behavior-1k/2025-challenge-demos`](https://huggingface.co/datasets/behavior-1k/2025-challenge-demos) —— 采用MIT协议 - V-JEPA 2(Meta/FAIR):[facebookresearch/vjepa2](https://github.com/facebookresearch/vjepa2) —— 采用Apache-2.0协议(未在此仓库中重新分发) 使用者需同时遵守原始BEHAVIOR-1K数据集与V-JEPA 2相关资源的授权协议。 ## 引用 若使用本数据集,请同时引用BEHAVIOR-1K、V-JEPA 2与V-JEPA 2.1。 bibtex @misc{Quast2026, title={基于V-JEPA-2 AC的短视野规划在BEHAVIOR-1K上的应用}, author={Quast, Julian}, year={2026}, } @article{li2024behavior, title={Behavior-1k:一个包含1000项日常活动与真实模拟的以人为中心的具身人工智能基准}, author={Li, Chengshu and Zhang, Ruohan and Wong, Josiah and ...}, journal={arXiv预印本 arXiv:2403.09227}, year={2024} } @article{assran2025vjepa2, title={V-JEPA 2:自监督视频模型助力理解、预测与规划}, author={Assran, Mahmoud and Bardes, Adrien and Fan, David and ...}, journal={arXiv预印本 arXiv:2506.09985}, year={2025} } @article{murlabadia2026vjepa2_1, title={V-JEPA 2.1:解锁视频自监督学习中的稠密特征}, author={Mur-Labadia, Lorenzo and Muckley, Matthew and Bar, Amir and ...}, journal={arXiv预印本 arXiv:2603.14482}, year={2026} }

提供机构:
quastAI
二维码
社区交流群
二维码
科研交流群
商业服务