遇见数据集

Jaehwisong/XVR

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

XVR(Cross-View Relations)是一个大规模数据集,旨在教授视觉语言模型(VLMs)跨多个视角的空间推理能力。它包含来自18K个多样化3D场景(通用领域)和70K个机器人操作轨迹(机器人领域)的100K个视觉问答样本,涵盖三个基本空间推理任务:对应性、验证和定位。通过在XVR上微调,VLMs在多视角和机器人空间推理基准测试(如MindCube、RoboSpatial)上取得明显改进,并且当用作视觉语言动作(VLA)模型的主干时,能平均提高RoboCasa上的操作成功率约13%。

XVR (Cross-View Relations) is a large-scale dataset designed to teach Vision-Language Models (VLMs) spatial reasoning across multiple viewpoints. It comprises 100K vision-question-answer samples derived from 18K diverse 3D scenes (general domain) and 70K robotic manipulation trajectories (robotic domain), spanning three fundamental spatial reasoning tasks: Correspondence, Verification, and Localization. VLMs fine-tuned on XVR achieve clear improvements on multi-view and robotic spatial reasoning benchmarks (MindCube, RoboSpatial), and when used as backbones in Vision-Language-Action (VLA) models, improve manipulation success rates on RoboCasa by ~13% absolute on average.

提供机构:
Jaehwisong
搜集汇总
数据集介绍
Jaehwisong/XVR 数据集图片
构建方式
XVR数据集旨在赋予视觉语言模型跨视角空间推理能力,其构建融合了通用与机器人两大领域。研究者从WildRGB-D中筛选出18K个点云稠密的多视角RGB-D场景,并从Open X-Embodiment与AgiBot-World中提取了70K条至少包含三个不同相机视角且末端执行器运动充分的机器人操作轨迹。基于这些源数据,通过模拟结构运动恢复中的核心问题,构建了涵盖对应、验证与定位三大类别的10万组视觉问答样本,每组样本以JSONL格式存储,包含多模态提示块与标准答案。
特点
该数据集具备显著的结构化与多样性特征。按空间推理难度,它细分为八个具体任务,如点对应、方向对应、空间验证、视角定位等,每个训练任务包含约12,947个样本。数据来源横跨通用室内场景与机器人操作环境,且测试集XVR-Eval完全来自训练中未见的数据源,确保评估的客观性。视觉问答以多模态方式组织,每个样本的prompt_blocks顺序排列文本与图像,图像通过相对路径引用,便于模型进行端到端的多视图空间推理学习。
使用方法
使用XVR时,首先通过Hugging Face CLI下载约82GB的完整数据集,包括JSONL文件与压缩的图像分片。随后将图像分片解压至统一images目录,使路径引用得以正确解析。用户可通过加载JSONL文件,遍历每个样本的多模态提示块,将图像输入视觉语言模型并比对基准答案进行微调或评估。数据集提供了明确的训练、验证与测试划分,研究者可基于其定义的任务类别进行多视图空间推理能力的训练与基准测试,并参考已发布的微调模型进行复现与扩展。
背景与挑战
背景概述
XVR数据集由韩国科学技术院(KAIST)、CONFIG、汉阳大学、延世大学及首尔国立大学等机构的研究人员于2026年共同创建,针对视觉语言模型(VLM)在多视角空间推理能力上的显著短板,提出了跨视角关系学习这一核心研究问题。现有VLM常因缺乏对三维几何一致性的理解,而在涉及多视图关联的任务中表现不佳。XVR通过整合18K多样化三维场景及70K机器人操作轨迹,构建了包含10万样本的大规模基准,覆盖对应关系、几何验证与视角定位三大推理任务。该数据集极大推动了多视图推理领域的发展,使微调后的VLM在MindCube、RoboSpatial等公开基准上取得显著提升,并为视觉-语言-动作(VLA)模型在RoboCasa环境中的成功率的绝对提升贡献了约13%。
当前挑战
XVR数据集所解决的核心领域挑战在于,多视角空间推理要求模型从不同视角的图像中理解三维对应、验证空间一致性并定位观测角度,这是传统视觉语言模型在结构化场景理解中的薄弱环节。在构建过程中,研究者面临多重困难:首先,从WildRGB-D、Open X-Embodiment及AgiBot-World等多个异构数据源中筛选高质量场景,需确保点云密度足够大(≥100万点)且机器人轨迹包含至少3个不同视角及充分的末端执行器运动;其次,如何从运动恢复结构(SfM)原理出发,设计出具有代表性的三类八项任务模板以确保覆盖推理的完整谱系;最后,将每项任务的训练样本量均衡至12,947条,并在不参加训练的场景(如MobileAloha轨迹)上构建评估集,以公正衡量模型的泛化能力。
常用场景
经典使用场景
XVR数据集专为提升视觉语言模型(VLM)在跨视角空间推理方面的能力而构建,其经典使用场景围绕三大核心任务展开:对应点匹配、空间一致性验证与视角定位。研究者通过向模型输入来自不同视角的成对图像,要求其识别同一三维空间点在不同视图中的投影位置,或判断视图间的几何关系是否一致,亦或根据空间描述选定匹配的相机视角。这种多模态推理范式有效弥合了二维视觉观测与三维空间理解之间的鸿沟,为机器人在复杂环境中实现鲁棒的场景理解与动作规划奠定了坚实基础。
衍生相关工作
围绕XVR数据集已衍生出一系列经典工作,其中最突出的当属基于该数据集微调的开源模型Qwen3-VL-2B-XVR。该模型在XVR-Eval评测集上取得了68.06%的总体准确率,超越GPT-5、Claude-4.5-Sonnet等闭源大模型,并在点对应任务上甚至超过人类表现。此外,XVR的设计理念启发了将运动恢复结构范式融入多模态预训练的研究方向,促使学界重新审视空间推理在视觉语言模型中的核心地位。其数据构建流程——从多视角RGB-D捕获到基于轨迹的时序验证——已成为后续多视图推理数据集(如RoboSpatial系列)的重要参考模板,推动了具身智能体在空间认知领域的系统性进步。
数据集最近研究
最新研究方向
XVR数据集的横空出世,标志着多视角空间推理研究迈入了一个崭新阶段。该数据集通过构建包含10万条视觉问答样本的庞大规模评测基准,巧妙融合了通用三维场景与机器人操作轨迹两大领域,精准聚焦于对应关系建立、空间关系验证与视角定位三大核心推理任务。研究工作揭示,基于XVR微调的视觉语言模型在多视角与机器人空间推理基准上展现出显著性能跃升,更令人瞩目的是,将其作为视觉-语言-动作模型骨干网络后,在RoboCasa场景中的操作成功率实现了约13%的绝对提升,这一突破性进展不仅在学术界引发广泛关注,更以其跨领域迁移能力为具身智能系统的空间理解与决策优化提供了坚实的数据基石与全新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务