遇见数据集

GN-Matrix

收藏
arXiv2026-06-02 更新2026-06-04 收录
数据链接:
官方服务:

资源简介:

GN-Matrix是由中国电信人工智能研究所联合多所高校构建的大规模视觉-语言导航数据集,旨在解决传统导航数据在泛化能力和长视野任务处理上的局限性。该数据集整合了开源、商业采购及自重建的多样化三维高斯溅射场景资源,并引入动态3DGS虚拟人,生成了总计4700万条涵盖指令跟随、人跟随及目标导航等任务的多模态导航序列。其创建过程依托自动化流水线,通过启发式搜索与大语言模型智能体在仿真环境中合成数据,每条样本均包含鸟瞰图、第一人称视图及历史视图。该数据集主要应用于具身智能与机器人导航领域,为训练导航基础模型、提升其在动态真实环境中的空间推理与人机交互能力提供了坚实的数据基础。

GN-Matrix is a large-scale vision-language navigation dataset constructed by the AI Research Institute of China Telecom in collaboration with multiple universities, aiming to address the limitations of traditional navigation data in terms of generalization ability and long-horizon task processing. This dataset integrates diverse 3D Gaussian Splatting (3DGS) scene resources from open-source sources, commercial procurement and self-reconstruction, and introduces dynamic 3DGS virtual humans to generate a total of 47 million multimodal navigation sequences covering tasks such as instruction following, human following and goal navigation. Its construction relies on an automated pipeline that synthesizes data in simulated environments via heuristic search and large language model (LLM) agents. Each sample includes bird's-eye views, first-person views and historical views. This dataset is primarily applied in the fields of embodied intelligence and robotic navigation, providing a solid data foundation for training foundational navigation models and enhancing their spatial reasoning and human-computer interaction capabilities in dynamic real-world environments.

创建时间:
2026-06-02
原始信息汇总

数据集名称

GN0 (Generation, Evaluation, and Policy Learning in Vision-and-Language Navigation)

核心定位

GN0 是一个面向视觉语言导航(VLN)的统一研究框架,集成了场景生成、高保真仿真与导航策略评估。该框架基于 3D 高斯泼溅(3DGS)构建,专注于在视觉真实的室内环境中进行导航研究。

主要组件

  • GN-Matrix:包含动态人体化身的大规模 3DGS 导航数据集。
  • GN-Bench:用于高保真 VLN 评估的交互式基准测试与仿真器。
  • GN-BAE:支持基于地图和无地图策略学习的导航基础模型。

当前发布内容

仓库当前发布了 GN-Bench InteriorGS 评估工作流,提供了一个紧凑、可复现的管线,用于评估基于 BAE 的导航智能体。

关键特性

  • 基于 3DGS 的原生导航基准,直接在高保真场景中评估智能体。
  • 统一的 GN0 生态,连接 GN-Matrix 数据、GN-Bench 仿真与 GN-BAE 策略评估。
  • 支持多 GPU 和多进程的分块评估。
  • 提供轻量级指标分析脚本,可汇总输出 TL、NE、OS、SR 和 SPL 指标。

可用资源

  • 模型:BAE 检查点(Hugging Face 地址:https://huggingface.co/TeleEmbodied/GN-BAE)
  • 数据集:InteriorGS 数据集(Hugging Face 地址:https://huggingface.co/datasets/spatialverse/InteriorGS)
  • 评估指标
    指标 含义
    TL 平均轨迹长度
    NE ↓ 导航误差
    OS ↑ 甲骨文成功率
    SR ↑ 成功率
    SPL ↑ 按路径长度加权的成功率

引用

如需引用,请参考以下 BibTeX 格式: bibtex @article{li2026gn0, title={GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation}, author={Li, Xinhai and Zhang, Xiaotao and Huang, Yuehao and Dong, Jiankun and Wang, Tianhang and Zhou, Sunyao and Wu, Yunzi and Sun, Chengnuo and Ge, Yunfei and Weng, Qizhen and Zhang, Chi and Bai, Chenjia and Li, Xuelong}, journal={arXiv preprint arXiv:2606.03682}, year={2026} }

致谢

GN-Bench-Tools 基于 Habitat-Lab 改编,专门针对 3DGS 导航进行了定制。感谢 Habitat-Lab、InteriorGS 团队以及 Embodied AI 和 3DGS 开源社区的贡献。

搜集汇总
数据集介绍
GN-Matrix 数据集图片
构建方式
GN-Matrix数据集基于多源3D高斯泼溅(3DGS)场景资产构建,融合了InteriorGS的千余个高质量室内场景、150个手工精心制作的大规模商业环境(如办公室和超市),以及通过WorldGrow管道自动扩展的多样场景。数据集引入动态3DGS人体化身,利用单目图像重建SMPL-X参数化模型与高斯化身,并通过运动驱动实现逼真动画。在此基础上,开发了全自动导航数据生成管线,通过启发式搜索与大语言模型智能体,在模拟环境中生成了4700万条导航序列,涵盖目标导航、指令跟随和人体跟随三大任务类型。每条样本均包含鸟瞰图、第一人称视图及历史观测,动作空间涵盖离散动作与连续像素级轨迹,为训练导航基础模型提供全面数据支撑。
使用方法
GN-Matrix以原生3DGS格式存储,用户可直接在配套的高保真仿真平台GN-Bench中加载场景,进行交互式漫游、碰撞检测与闭环策略评估。数据集支持地图依赖与无地图两种导航范式,研究人员可根据任务需求灵活选择鸟瞰图、第一人称视角或二者融合的观测输入。训练时,可通过监督微调(SFT)初始化模型,随后利用DAgger算法在策略rollout状态下聚合纠正性标注,打破专家分布局限。进一步地,可结合强化学习(如DAPO)优化长时域决策质量。数据集兼容VLN-CE等基准的导出格式,便于跨平台迁移与对比实验,代码与模型已开源供社区使用。
背景与挑战
背景概述
在具身智能领域,视觉-语言导航(VLN)作为连接智能体与物理世界的核心能力,其发展长期受制于导航数据的质量与规模。传统场景表征方法如网格、全景图和视频序列在细节渲染与交互性上存在局限,导致模型泛化能力不足。为突破这一瓶颈,由中国电信人工智能研究院联合上海交通大学、浙江大学、同济大学、复旦大学及江苏大学等机构的研究团队,于2026年构建了GN-Matrix数据集。该数据集基于3D高斯泼溅(3DGS)渲染引擎,整合了开源场景资产、自采集重建场景及商业采购场景资源,涵盖47百万条导航数据序列,支持指令跟随、人类跟随及目标导航等任务。GN-Matrix通过提供高保真度鸟瞰图(BEV)表征和动态3DGS虚拟化身,首次将BEV作为紧凑高效的空间记忆机制,激发了视觉-语言模型(VLM)的潜在空间推理能力,为VLN领域确立了统一的数据、仿真与学习范式基准。
当前挑战
GN-Matrix面临的挑战主要体现在两方面。在领域问题层面,传统VLN方法依赖有限场景的预定义图结构,难以处理长时域任务与动态环境中的空间推理;现有仿真平台普遍存在视觉保真度低、交互性差的问题,且缺乏对动态人类交互的有效评估基准,导致模型在真实场景中泛化能力薄弱。在数据构建过程中,团队需解决多源3DGS场景资产的异构融合难题,包括不同来源场景在语义标注、可通行性建模和坐标系统上的标准化对齐。同时,动态人类虚拟化身的构建面临单图重建与动作驱动的技术瓶颈,需通过SMPL-X体模型与高斯场景的精确绑定实现高保真动画。此外,生成大规模多样化导航轨迹时,必须克服动作分布严重偏向前进方向的失衡问题,并通过数据重采样与路径多样性过滤算法,剔除冗余和低信息量的轨迹,确保数据集对下游策略学习的有效性。
常用场景
经典使用场景
在视觉-语言导航(VLN)领域,GN-Matrix数据集最经典的应用场景是作为大规模、高保真度的三维场景数据基础,用于训练和评估具身智能体在复杂室内环境中执行指令跟随、目标导航与人体跟随等任务。该数据集依托3D高斯泼溅(3DGS)渲染引擎,提供照片级逼真的第一人称视角与鸟瞰图(BEV)观测,使智能体能够在接近真实世界的物理与视觉条件下进行导航学习与推理。
解决学术问题
GN-Matrix重点解决了VLN研究中长期存在的场景数据规模有限、视觉保真度不足以及动态环境交互缺失等核心问题。传统导航数据依赖于网格、全景图或真实视频序列,存在渲染细节匮乏、领域迁移困难以及数据采集成本高昂等局限。GN-Matrix通过整合多源3DGS场景资源并引入动态人体化身,提供了覆盖静态与动态场景的大规模多模态导航数据,突破了对固定专家轨迹的依赖,为研究分布外状态下的策略泛化、长周期决策及人类-机器人交互评价奠定了坚实的数据基础,推动了VLN从理想化仿真向真实世界部署迈进的进程。
实际应用
在实际应用中,GN-Matrix数据集所支撑的导航模型可直接部署于轮式机器人、小型人形机器人与通用双足机器人等实体平台,在无需真实机器人训练数据的情况下实现从仿真到真实环境的零样本迁移。具体任务包括室内走廊与房间的指令驱动导航、动态人体目标跟踪、以及基于视觉目标的多房间长距离移动。该数据集与配套的GN-Bench仿真平台和GN-BAE导航模型构成了完整的闭环系统,能够支持在边缘设备上以高达5Hz的实时推理频率进行高效部署,展现了在仓储物流、家庭服务、公共区域巡检等真实场景中的广阔应用前景。
数据集最近研究
最新研究方向
GN-Matrix数据集的最新研究方向聚焦于构建基于3D高斯泼溅的高保真视觉-语言导航统一范式,涵盖数据生成、仿真评估与策略学习三大核心维度。通过融合多源室内场景资产与动态3DGS虚拟人,该工作突破了传统导航数据在规模、真实感和交互性上的局限,首次将BEV表征形式化地作为视觉语言模型的空间记忆机制,从而解锁了其潜在的几何推理能力。结合监督学习、DAgger闭环适应与强化学习的混合训练策略,GN-BAE模型在VLN-CE等基准上取得了显著的性能提升,并成功迁移至真实机器人平台,为构建通用具身智能体的导航基础模型开辟了新的技术路径。
相关研究论文
  • 1
    GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation中国电信·人工智能研究所; 上海交通大学; 浙江大学; 同济大学; 复旦大学; 江苏大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务