遇见数据集

robotwin_3d_text_embeds_cache

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集为 RoboTwin 2.0 3D 数据集(flex-pi/robotwin_3d)的预计算文本嵌入缓存,由 UMT5-XXL 编码器生成,用于 Wan2.2-TI2V-5B 模型。包含 1,039,891 个唯一任务提示的嵌入,每个提示被包装在固定模板中后编码,缓存键为模板化提示的 SHA256 哈希。数据以 520 个 safetensors 分片文件存储(每个分片约 2.10 GB,最后分片 1,891 个提示),每个分片包含两个行对齐的张量:contexts(形状 [N, 128, 4096],bfloat16)和 masks(形状 [N, 128],bool),其中 masks 指示有效 token(平均 40.9/128)。还提供了 manifest.txt 文件(所有键排序列表)以及从分片重建为每个提示独立 .pt 文件的脚本。支持随机访问:通过 manifest.txt 确定分片索引,使用 get_slice 仅读取所需行。该缓存可避免重复计算编码产生的 GPU 时间。

This dataset is a precomputed text embedding cache for the RoboTwin 2.0 3D dataset (flex-pi/robotwin_3d), generated by the UMT5-XXL encoder for the Wan2.2-TI2V-5B model. It contains embeddings for 1,039,891 unique task prompts, each wrapped in a fixed template before encoding. The cache key is the SHA256 hash of the templated prompt. The data is stored in 520 safetensors shard files (each ~2.10 GB, last shard 1,891 prompts), with each shard containing two row-aligned tensors: contexts (shape [N, 128, 4096], bfloat16) and masks (shape [N, 128], bool), where masks indicate valid tokens (average 40.9/128). A manifest.txt file (sorted list of all keys) and a script to reconstruct the shards into individual .pt files per prompt are also provided. Random access is supported: locate the shard index via manifest.txt and use get_slice to read only the required rows. This cache avoids GPU time for repeated encoding computation.

创建时间:
2026-08-19
原始信息汇总

RoboTwin 2.0 3D — T5 文本嵌入缓存数据集

数据集概述

本数据集为 RoboTwin 2.0 3D 数据集中 1,039,891 条唯一任务提示 预计算的 UMT5-XXL 文本嵌入缓存。该缓存由 Wan2.2-TI2V-5B 模型使用,可避免重复计算产生的大量 GPU 时间消耗。

基本信息

  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: robotics, text-embeddings, t5, wan2.2
  • 数据集规模: 1M < n < 10M
  • 源数据集: flex-pi/robotwin_3d

缓存键机制

  • 任务字符串使用固定模板包装后编码,缓存键为模板化提示的 SHA256 哈希值。
  • 模板格式: A video recorded from a robots point of view executing the following instruction: {task}
  • 键计算方式: sha256(DEFAULT_PROMPT.format(task=task).encode("utf-8")).hexdigest()

数据集内容

路径 描述
shards/shard_NNNNN.safetensors 520 个分片 × 2,000 条提示(最后一个 1,891 条),每片约 2.10 GB
manifest.txt 全部 1,039,891 个键,已排序,每行一个 — 第 i 行对应分片 i // 2000 的第 i % 2000

每个分片包含两个行对齐的张量及 __metadata__["keys"](该分片键的 JSON 列表):

张量 形状 数据类型
contexts [N, 128, 4096] bfloat16
masks [N, 128] bool

注意事项: masks 标记有效标记(平均 40.9 / 128)。掩码之外的值是原始 T5 输出而非零值。加载时若模型不应用掩码,需将超出部分置零(context[~mask] = 0)。

使用方式

转换为逐文件 .pt 布局

可通过提供的 unpack_to_pt.py 脚本将分片布局重建为扁平目录结构,每个文件包含 {"context", "mask"} 字典。展开后约 1 TB,共 1,039,891 个文件。

随机访问(无需解包)

可通过 manifest.txt 结合二分查找定位分片,使用 get_slice 直接读取指定行,避免加载整个 2 GB 分片。

数据溯源

从原始逐提示 .pt 缓存逐字节精确重打包;张量位级一致,已通过源文件往返比较验证。编码器为 UMT5-XXL,上下文长度 128,数据类型 bfloat16。

搜集汇总
数据集介绍
robotwin_3d_text_embeds_cache 数据集图片
构建方式
该数据集是针对RoboTwin 2.0 3D机器人任务数据集中的1,039,891个独特任务指令,利用UMT5-XXL编码器预计算得到的文本嵌入缓存。原始任务字符串被嵌入固定模板后,通过SHA-256哈希生成唯一键值,并据此将嵌入结果分片存储为520个Safetensors文件,每个分片包含2000个样本(最后一个分片含1891个),同时提供排序的清单文件以支持键值查找。数据张量采用bfloat16格式,每个样本包含形状为[128, 4096]的上下文嵌入和对应的掩码张量,掩码标记有效令牌(平均40.9个),未掩码位置保留原始T5输出而非零填充。
使用方法
使用方式灵活多样,用户可选择整体解包或部分下载。整体解包可运行附带的Python脚本,利用多线程并发从HuggingFace Hub拉取分片,将其转换为每个提示词对应的.pt文件(约1TB,1,039,891个文件),并指定为训练脚本的text_embedding_cache_dir路径。若仅需少量提示词的嵌入,可通过manifest.txt排序键列表和二分查找定位目标分片,再借助safe_open的get_slice方法直接读取对应行,无需下载完整分片。此外,可根据需求仅下载特定分片索引,每个分片自描述,便于分布式或增量使用。
背景与挑战
背景概述
随着机器人操作任务在复杂环境中的广泛应用,多模态大模型(如Wan2.2-TI2V-5B)对异构数据的依赖日益加深。文本嵌入作为连接自然语言指令与视觉动作序列的语义桥梁,其高效获取成为训练流程中的关键环节。RoboTwin 2.0 3D数据集由flex-pi团队于2025年构建,核心研究问题在于如何为超过百万条独特的机器人任务提示提供可复用的文本表征。该数据集通过预先计算并缓存UMT5-XXL编码器生成的T5文本嵌入,显著降低了训练时的计算开销,为机器人视频生成与操作学习领域提供了重要基础设施,其影响力体现在推动大规模机器人数据集的实用化与标准化。
当前挑战
该数据集应对的核心挑战源于机器人领域任务指令的语义多样性与训练效率的矛盾。在领域问题层面,直接编码百万级提示需要大量GPU资源,且重复计算造成浪费,阻碍了研究迭代;在构建过程中,需确保缓存键的确定性以支持随机访问,同时解决海量小文件存储与检索效率的平衡。此外,分片存储与原始.per文件布局的兼容、掩码处理确保模型正确忽略无效token,以及数据验证的比特级一致性,均是构建时遭遇的工程技术挑战。这些挑战的攻克不仅优化了数据供给链路,也为类似大规模嵌入缓存提供了可复用的解决方案。
常用场景
经典使用场景
在机器人学习领域,自然语言指令与视觉动作的语义对齐是构建具身智能体的核心挑战。RoboTwin 2.0 3D数据集以其百万级任务提示的庞大规模,为多模态模型提供了丰富的语言-视觉-动作三元组。该数据集经典使用场景聚焦于训练视频生成模型,以文本嵌入为条件,驱动从指令到第一人称视角机器人视频的合成。此类生成式预训练不仅强化了模型对任务语义的解析能力,更为后续的视觉运动控制策略学习奠定了坚实的基础。
解决学术问题
该数据集有效解决了大规模文本嵌入预计算耗时耗力的学术瓶颈。在长上下文(128 tokens)与高维特征(4096维)的条件下,对超过百万条任务指令进行T5编码需消耗巨额GPU资源,成为复现与扩展研究的隐性壁垒。通过提供标准化、即取即用的嵌入缓存,本数据集促进了研究的可重复性与公平性,使学者能将算力集中于算法创新,而非重复性的特征提取,显著加速了机器人学习领域的科研迭代进程。
实际应用
在实际应用中,此数据集内嵌于Wan2.2-TI2V-5B等先进视频生成模型的训练流程,作为条件注入模块,引导生成与现实物理规律相符的机器人操作视频。借助其分片存储与随机访问机制,工程实践得以灵活高效地加载嵌入特征,支撑起大模型在不同任务指令下的动态视频合成。此能力可迁移至仿真环境构建、数据增强与技能演示生成,进而提升机器人策略学习在真实世界中的泛化与适应能力。
数据集最近研究
最新研究方向
该数据集为RoboTwin 2.0 3D平台预计算的UMT5-XXL文本嵌入缓存,旨在加速机器人操作任务的语言-视觉-动作联合建模。当前前沿研究聚焦于高效文本嵌入表征在具身智能中的复用策略,通过缓存机制规避重复编码的高昂算力消耗,支持大规模任务提示的快速检索与随机访问。该缓存与Wan2.2-TI2V-5B模型协同,推动视频生成与机器人控制领域的跨模态对齐研究。其分片存储与扁平化索引设计,为多机器人数据湖的扩展部署提供了工程范式。研究意义在于降低计算资源门槛,促进机器人学习领域数据共享与复现实验的标准化进程,同时支撑了从单一指令到复杂场景的整体语义理解向实时决策的转化探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务