遇见数据集

PRICE

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

PRICE(真实世界交互约束预测评估)V0.1是一个基于真实世界机器人、自我中心视角和第三人称交互数据的指令条件图像到图像生成基准数据集,旨在评估模型在给定初始状态图像和自然语言指令的情况下,预测指令动作所产生的目标状态图像的能力,评估重点包括指令遵循准确性、场景一致性和物理合理性。数据集包含100个测试样本,每个样本由初始状态图像(query)、参考目标状态图像(output)和自然语言指令(lang)构成,数据来源于AgiBot World(30个样本)、HomeInteract(20个样本)、PE-Video(20个样本)和PsiBot SynData(30个样本)。每个样本还包括稳定的标识符(id)和数据来源标识(dataset)。该数据集适用于图像生成、机器人学、具身人工智能等领域的模型评估,特别关注真实世界交互场景中的物理约束和指令理解,采用Apache 2.0许可证发布,所有内容均为英文。

PRICE (Real-world Interaction Constraint Prediction Evaluation) V0.1 is a benchmark dataset for instruction-conditioned image-to-image generation based on real-world robot, egocentric, and third-person interaction data. It aims to evaluate the ability of models to predict target state images resulting from instructed actions given an initial state image and a natural language instruction, with a focus on instruction-following accuracy, scene consistency, and physical plausibility. The dataset contains 100 test samples, each consisting of an initial state image (query), a reference target state image (output), and a natural language instruction (lang) describing the action. The data is sourced from four interaction datasets: AgiBot World (30 samples), HomeInteract (20 samples), PE-Video (20 samples), and PsiBot SynData (30 samples). Each sample also includes a stable identifier (id) and a dataset source indicator (dataset). It is suitable for model evaluation in fields such as image generation, robotics, and embodied AI, particularly focusing on physical constraints and instruction understanding in real-world interaction scenarios. The dataset is released under the Apache 2.0 license, and all content is in English.

创建时间:
2026-07-12
原始信息汇总

数据集名称

PRICE (Prediction of Real-world Interactions with Constraints Evaluation) - 版本 V0.1

数据集简介

PRICE-V0.1 是一个用于指令条件图像到图像生成的基准测试,基于真实世界的机器人、第一人称视角和第三人称视角交互数据。给定初始状态图像和自然语言指令,模型需要预测执行指令动作后的目标状态图像。该基准评估了指令遵循、场景一致性和物理合理性。

任务类别

  • 图像到图像生成
  • 指令条件图像生成
  • 具身智能与机器人交互

语言

  • 英语(en)

许可协议

  • Apache 2.0

数据集大小

  • 样本总数:小于 1,000(具体为 100 个样本)

数据集结构

数据集包含一个 test 分割,共 100 个样本,主要字段如下:

列名 类型 描述
id string 稳定的 PRICE 样本标识符
query image 初始状态图像
output image 参考目标状态图像
lang string 自然语言动作指令
dataset string 源数据集标识符

数据来源与样本分布

源数据集 样本数
agibot_world 30
homeinteract 20
pe_video 20
psi_ego 30
总计 100

使用方式

通过 Hugging Face 的 datasets 库加载: python from datasets import load_dataset dataset = load_dataset("BAAI/PRICE", split="test") sample = dataset[0] initial_image = sample["query"] target_image = sample["output"] instruction = sample["lang"]

也可从本地文件夹加载: python from datasets import load_dataset dataset = load_dataset("imagefolder", data_dir="data", split="test")

评估方法

评估代码和协议位于 GitHub 仓库 orca-wm/Orcaevaluation/image_gen/PRICE/ 目录中。模型预测结果应按照对应 id 命名,并遵循仓库中记录的布局。

参考资源

版本信息

  • 当前版本:PRICE-V0.1
  • 建议在 Hugging Face 数据集仓库中标记为 v0.1 版本,并在评估代码中锁定该修订版本以确保结果可复现
搜集汇总
数据集介绍
PRICE 数据集图片
构建方式
PRICE(Prediction of Real-world Interactions with Constraints Evaluation)是一个面向指令条件图像生成任务的基准数据集,其构建根植于真实世界的机器人操作、第一人称与第三人称交互场景。数据集包含100个测试样本,每个样本均由初始状态图像、自然语言操作指令以及对应的目标状态图像构成三元组。样本来源于AgiBot World、HomeInteract、PE-Video与PsiBot SynData四个异构数据集,通过精心的筛选与标准化处理,确保场景多样性覆盖多种视角、动作类型与任务复杂度。数据集的存储结构简洁而完备,除核心字段外,还保留了来源标识、时间戳、校验和等溯源信息,为后续的可复现评估提供了坚实的数据基础。
特点
PRICE数据集的独特之处在于其紧密耦合于具身智能与物理世界的约束条件。它不仅评估模型对指令的理解能力,更着重检验生成图像的场景一致性、物理合理性以及动作结果的真实感。每个样本的初始与目标图像均来自真实的交互数据,避免了合成数据中常见的伪影与逻辑漏洞。数据集包含机器人操作、家居互动、第一人称视角视频及合成数据等多种来源,覆盖了日常操作、物体移动、场景变化等典型任务。这种多维度的构成使得PRICE能够全面衡量图像生成模型在复杂真实环境中的表现,同时其规模虽小但精炼的设计,使其成为评估指令生成模型鲁棒性的理想基准。
使用方法
使用PRICE数据集极为便捷,用户可通过Hugging Face的datasets库直接加载,仅需一行代码即可获取测试集。每条数据包含query(初始图像)、output(目标图像)、lang(指令文本)等字段,便于进行图像生成任务的训练与评估。对于需要本地化处理的场景,数据集同样支持以imagefolder格式加载预先下载的文件夹。评估方面,PRICE官方提供了配套的评价器与提示模板,用户需按指定布局参数命名模型生成的图像,并与数据集中的id字段对应。借助其Apache 2.0许可协议的开放性,研究者可自由使用、扩展与集成该数据集,推动指令条件图像生成领域的发展。
背景与挑战
背景概述
PRICE(Prediction of Real-world Interactions with Constraints Evaluation)是一个面向指令条件图像生成任务的基准数据集,诞生于具身智能与机器人交互研究蓬勃发展的背景下。由北京智源人工智能研究院(BAAI)等机构的研究人员于近期创建,该数据集聚焦于从初始状态图像与自然语言指令预测目标状态图像的核心研究问题,旨在评估模型在指令遵循、场景一致性与物理合理性方面的能力。通过整合AgiBot World、HomeInteract、PE-Video和PsiBot SynData等多元来源的机器人、自我中心及第三人称交互数据,PRICE为图像生成领域注入了真实世界物理约束与交互动态的评估维度,对推动具身智能中视觉预测与语言引导行为的交叉研究具有重要的基准意义。
当前挑战
PRICE所解决的领域挑战在于,现有图像生成模型多侧重于视觉美学与语义匹配,而忽视了具身交互场景中物理因果与空间约束的精确建模,例如模型需理解“将杯子放到托盘上”这类指令对物体空间关系与物理可行性的隐含要求。在构建过程中,研究者面临数据来源多样性与标注一致性的矛盾,需从四个差异显著的交互数据集(涵盖机器人操作、日常行为等)中精选100个高难度样本,并确保指令描述与初始-目标图像对间的语义对齐精确无误。此外,场景视角的剧烈变化(如自我中心与第三人称视角交替)以及动作结果的细微差异(如物体仅发生微小位移),均对评估协议的鲁棒性与公平性提出了严峻挑战。
常用场景
经典使用场景
PRICE基准数据集专为指令条件式图像生成任务而设计,其核心应用场景在于评估模型能否依据自然语言指令,将初始状态图像准确转换为对应的目标状态图像。该数据集汇聚了真实世界机器人操作、第一人称视角以及第三人称视角的交互数据,涵盖了多样化的视角、环境与动作结果。研究者通常利用PRICE来检验生成模型在理解指令语义、保持场景一致性以及确保物理合理性方面的综合能力,是测试视觉与语言联合推理性能的经典平台。
衍生相关工作
PRICE数据集的诞生催生了一系列相关研究工作的涌现。其评估协议被整合进Orca世界模型框架中,用于系统性检验图像生成模型的指令遵循能力。受PRICE启发,研究者开始探索如何利用该基准开发更鲁棒的指令条件式生成模型,例如结合物理引擎约束的扩散模型。此外,该数据集还推动了针对具身智能体视觉推理的可解释性分析工作,以及多视角一致性生成的研究方向,成为连接语言指令与视觉预测这一学术热点的重要基准节点。
数据集最近研究
最新研究方向
在具身智能与机器人操作领域,指令条件性图像生成正成为连接自然语言与物理世界交互的关键桥梁。PRICE基准的提出,精准聚焦于从初始状态图像与语言指令联合预测目标状态图像这一前沿课题,其评估维度涵盖指令遵循、场景一致性与物理合理性,直指当前视觉语言模型在真实世界泛化中的核心短板。该数据集精选自AgiBot World、HomeInteract等多样化机器人及自我中心交互数据源,为衡量模型在复杂操作场景下的因果推理与空间变换能力提供了严谨的测试平台。PRICE的发布不仅推动了图像生成模型从静态美学向动态功能验证的范式转变,更通过约束预测任务间接促进了具身智能体在任务规划与闭环控制中的鲁棒性研究,对于实现与物理世界深度交互的下一代AI系统具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务