Sekai2-Dataset
收藏官方服务:
资源简介:
Sekai2是一个大规模真实世界以自我为中心的视频数据集,用于交互式世界模型。它包含了人们在世界中移动的长镜头视频(步行、驾驶、骑行、飞行、乘坐铁路、船只和缆车),并配有相机轨迹和结构化的、时间上相关的语言注释。
Sekai2 is a large-scale real-world egocentric video dataset designed for interactive world models. It contains long-duration videos of people moving through the world, including walking, driving, cycling, flying, taking railways, boats and cable cars, accompanied by camera trajectories and structured, temporally correlated linguistic annotations.
创建时间:
2026-08-06
原始信息汇总
Sekai2 数据集详情
数据集概览
- 全称:Sekai2: From World Exploration to Interactive World Modeling
- 类型:大规模真实世界第一人称视频数据集,专为交互式世界模型设计
- 核心内容:包含人物在多种场景(步行、驾驶、骑行、飞行、乘坐轨道交通工具、船只、缆车)中移动的长时程视频,配套相机轨迹及结构化、时间对齐的语言标注
规模指标
| 项目 | 数值 |
|---|---|
| 视频片段总数 | 128,892 |
| 总时长 | 2,826 小时 |
| 覆盖国家/地区 | 113 个 |
| 时间对齐片段数 | 649,597(每个剪辑平均 5.04 个,中位时长 15 秒) |
数据来源构成
| 数据来源 | 片段数 | 时长 | 备注 |
|---|---|---|---|
| 继承自 Sekai | 47,699 | 约 795 小时 | 每个片段严格 60 秒 |
| 新采集自 YouTube | 80,211 | 约 1,913 小时 | 平均 85.8 秒,上限 120 秒 |
| 全景(自采集) | 982 | 约 119 小时 | 360° 视角,未裁剪,平均时长 436 秒 |
每个片段包含的标注
- 相机姿态:通过几何管线生成的逐帧轨迹,并已与图像本身进行验证
- 片段级标注:分解式描述字段,涵盖场景、移动物体及相机行为
- 时间对齐片段:每个片段包含独立的时间范围、简短提示词和相机路径标签
- 受控属性:国家、相机运动、光照、时段、天气及场景类型
其他信息
- 项目页面:https://kangverse.github.io/sekai2-project/
- 代码:即将发布(包含数据管线、标注工具和分析代码)
- 技术报告:准备中
- 数据集与许可证:即将发布
搜集汇总
数据集介绍

构建方式
Sekai2数据集旨在推动交互式世界模型的发展,通过整合多源异构的自我中心视频数据构建而成。其数据来源包括继承的Sekai数据集、新采集的YouTube视频以及自采的全景视频,三者各具特色,分别贡献了约795小时、1913小时和119小时的视频素材。所有视频均经过严格处理,提供了逐帧相机位姿轨迹、剪辑级注释以及时间定位的结构化语言片段。构建过程中,特别注重数据的地理多样性与场景丰富性,覆盖了113个国家和地区,确保了视频内容在文化、环境和活动类型上的广泛代表性。
特点
该数据集的核心特点在于其大规模与多模态性,总计包含128,892个视频片段,总计2,826小时,且每个片段均附带丰富的元数据。时间定位的片段数量达到649,597个,中位持续时间为15秒,为细粒度的场景理解提供了坚实基础。此外,数据集引入了可控属性,如国家、相机运动、光照、天气和场景类型,便于进行条件生成和可控实验。全景视频的加入更是提供了360度的完整视角,增强了世界模型的沉浸感和交互性。
使用方法
Sekai2数据集适用于训练和评估交互式世界模型,用户可利用其相机位姿和结构化语言注释进行视频预测、场景理解及导航任务。数据集的因子化注释字段和时间定位片段支持细粒度的条件生成,可控属性则便于进行领域自适应和跨场景泛化研究。结合即将发布的代码和工具,研究者可以便捷地访问和解析数据,开发新的模型架构,并利用其丰富的地理和活动多样性检验模型在真实世界复杂情境下的性能。
背景与挑战
背景概述
Sekai2数据集由Kangverse团队创建,旨在推进交互式世界模型的研究。该数据集于2023年发布,汇集了来自113个国家和地区的128,892个视频片段,总计2,826小时,涵盖步行、驾驶、骑行、飞行等多种第一人称视角的移动场景。其核心研究问题是为交互式世界模型提供大规模、多模态的训练数据,以支持模型在真实世界中进行自主探索和理解。Sekai2通过整合继承数据、新采集的YouTube视频以及自采集的全景片段,构建了包含相机轨迹、时间锚定的语言标注和丰富属性(如国家、光照、天气)的结构化数据集,显著提升了世界模型在复杂环境中的泛化能力和交互性。该数据集在计算机视觉和具身智能领域具有重要影响力,为相关研究提供了新基准。
当前挑战
Sekai2数据集面临的挑战在于其构建和应用的复杂性。在数据构建方面,需要处理来自不同来源的视频片段,确保相机轨迹的准确性和一致性,同时标定数百万个时间锚定的语言段,工作量大且易出错。此外,数据覆盖113个国家和地区,需平衡多样性以避免偏差,全景视频(自采集)的整合也对处理流程提出更高要求。在领域应用层面,交互式世界模型需应对真实世界的动态变化和长时程依赖,Sekai2的长视频(平均85.8秒)增加了模型训练和推理的难度。另外,数据集的许可证和伦理问题(如隐私、版权)也是一大挑战,需在发布时明确相关规定以保障合规性。
常用场景
经典使用场景
Sekai2数据集作为大规模真实世界第一视角视频资源,其核心应用在于训练和评估交互式世界模型。该数据集精心采集了步行、驾驶、骑行、飞行、轨道旅行等多种移动方式下的长时间连续视频,并配套精确的相机轨迹与结构化、时间锚定的语言描述,为模型学习物理规律、空间几何及行为动态提供了丰富且真实的训练样本。研究者利用该数据集构建能够理解并预测视觉未来帧的模型,推动从被动感知向主动交互智能体的转变。
实际应用
在实际应用中,Sekai2数据集能够赋能多个前沿领域,包括但不限于与数字人交互的沉浸式体验、自动驾驶场景理解与决策辅助、机器人导航与操作技能学习。鉴于其涵盖多种视点(如全景)与运动模式,该数据集可用于开发具备空间智能的AI系统,这些系统需在复杂且不断变化的环境中保持鲁棒性。此外,其结构化的标注也为内容检索、视频问答及视觉叙事生成等应用提供了坚实基础。
衍生相关工作
Sekai2数据集的设计与发布,预期将催生一系列衍生研究工作。例如,基于其相机轨迹与语言对齐的特性,可衍生出视频到语言描述自动生成、基于语言指令的摄像机控制、以及跨场景动态预测等研究课题。其大规模多源数据特性亦为构建更强大的预训练视觉-语言模型提供数据支持。随着技术报告的发布,该数据集有望成为世界模型、具身智能和视频理解领域的基准,激发模型架构与评估方法的创新。
以上内容由遇见数据集搜集并总结生成



