Sekai
收藏资源简介:
Sekai数据集是一个高质量的全球第一人称视角视频数据集,包含超过5000小时的视频,来自100多个国家和地区的750个城市。该数据集旨在为世界探索提供丰富的注释,包括位置、场景、天气、人群密度、字幕和相机轨迹。数据集由YouTube上的视频和游戏Lushfoil Photography Sim中的视频组成,经过高效的数据收集、预处理和注释过程,为视频生成和世界探索领域提供了宝贵的资源。
The Sekai Dataset is a high-quality global first-person view video dataset containing over 5,000 hours of footage sourced from 750 cities across more than 100 countries and regions. This dataset aims to provide rich annotations for world exploration, including location, scene, weather, crowd density, subtitles, and camera trajectories. Composed of videos from YouTube and the video game *Lushfoil Photography Sim*, the dataset has undergone efficient data collection, preprocessing and annotation processes, serving as a valuable resource for the fields of video generation and world exploration.
Sekai: A Video Dataset towards World Exploration
基本信息
- 数据集名称: Sekai (意为"世界")
- 类型: 第一人称视角全球视频数据集
- 用途: 世界探索训练、视频生成、视频理解、导航、视频-音频协同生成
- 对应作者:
- wuyuwei@bit.edu.cn
- lichuanhao@pjlab.org.cn
- zhangkaipeng@pjlab.org.cn
数据集特点
- 高质量多样化视频: 720p分辨率,包含多样天气、时间和动态场景
- 全球范围覆盖: 涵盖100+国家和地区,750+城市
- 多样化视角: 包含步行视角和无人机视角(FPV和UAV)
- 长持续时间: 步行视频至少60秒
- 丰富标注: 包含位置、场景、天气、人群密度、字幕和相机轨迹
数据集构成
- Sekai-Real: 5000+小时YouTube视频(8600+小时原始素材)
- Sekai-Game: 40小时照片级游戏视频
- 总剪辑数: 400,000+
- 标注内容:
- 位置信息
- 场景类别
- 详细字幕
- 相机轨迹
数据处理流程
- 视频收集: 从YouTube和游戏获取原始素材
- 预处理:
- 视频分割
- 亮度/质量过滤
- 字幕/轨迹过滤
- 标注:
- 使用LLMs(Qwen2.5-VL-72B, GPT-4o)
- 使用结构运动模型(MegaSaM)
- 采样: 基于质量评分和多样性策略创建高质量子集(Sekai-Real-HQ)
衍生模型
- YUME模型: 基于Sekai-Real-HQ子集训练的交互式世界探索模型
- 功能: 接收图像并允许用户通过键盘鼠标进行无限制探索
引用信息
bibtex @article{li2025sekai, title={Sekai: A Video Dataset towards World Exploration}, author={Zhen Li and Chuanhao Li and Xiaofeng Mao and Shaoheng Lin and Ming Li and Shitian Zhao and Zhaopan Xu and Xinyue Li and Yukang Feng and Jianwen Sun and Zizhen Li and Fanrui Zhang and Jiaxin Ai and Zhixiang Wang and Yuwei Wu and Tong He and Jiangmiao Pang and Yu Qiao and Yunde Jia and Kaipeng Zhang}, journal={arXiv preprint arXiv:2506.15675}, year={2025} }




