遇见数据集

Robot-EQ

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

RobotEQ-Data是首个专为评估具身人工智能中‘主动智能’而设计的基准数据集。‘主动智能’指的是机器人在无明确指令的人类环境中,理解哪些行为是社会允许的、哪些是禁止的能力,这与遵循指令的‘被动智能’以及理解人类情感与认知的‘社交智能’相区别。该数据集旨在评估视觉语言模型在具身场景中推理社会适宜行为的能力。数据集包含两个核心任务:1) 动作判断:提供1,894张机器人视角的场景图像,每个场景配有一个角色特定的服务问题及多个候选动作(共4,944个标注样本),模型需判断每个动作是‘恰当’还是‘不恰当’;2) 空间定位:提供1,157个带有多选区域(标记为A-D)标注的图像及相关问题,模型需选择所有空间上合适的行为选项。数据覆盖10个主要的具身部署环境类别(如公共空间、医疗护理、零售服务、私人生活空间等)和56个细分子类别。动作判断样本还标注了八个非互斥的‘主动智能’分析维度,包括非语言信号识别、空间距离规范、角色与权限边界、时机与打断规范、情境音量与行为约束、资源与所有权规范、优先权与受保护人群,以及文化特定规范。数据集以JSON格式提供中英文标注,并包含每张图像的场景分类标签。该数据集适用于视觉问答、具身AI及机器人社会规范推理等相关研究,许可证为CC-BY-NC-4.0,仅限非商业学术用途。

RobotEQ-Data is the first benchmark dataset specifically designed to evaluate 'active intelligence' in embodied artificial intelligence. 'Active intelligence' refers to the capability of robots to comprehend which behaviors are socially permissible and which are prohibited in unstructured human environments without explicit human instructions, distinguishing itself from 'passive intelligence' (which follows given instructions) and 'social intelligence' (which understands human emotions and cognition). This dataset aims to assess the ability of vision-language models to reason about socially appropriate behaviors in embodied scenarios. The dataset includes two core tasks: 1. Action Judgment: 1,894 scene images captured from the robot's perspective are provided, with each scene paired with a role-specific service question and multiple candidate actions, totaling 4,944 annotated samples. Models are required to judge whether each action is "appropriate" or "inappropriate". 2. Spatial Localization: 1,157 images with multi-choice regions annotated as A-D and associated questions are provided, and models need to select all spatially suitable behavioral options. The dataset covers 10 major categories of embodied deployment environments (such as public spaces, medical care settings, retail services, private living spaces, etc.) and 56 fine-grained subcategories. Action judgment samples are further annotated with eight non-mutually exclusive analytical dimensions for 'active intelligence', including non-verbal signal recognition, spatial distance norms, role and authority boundaries, timing and interruption norms, situational volume and behavioral constraints, resource and ownership norms, priority and protected groups, and culture-specific norms. The dataset is provided in JSON format with both Chinese and English annotations, and includes scene classification labels for each image. It is applicable to research fields such as visual question answering, embodied AI, and robot social norm reasoning. The license is CC-BY-NC-4.0, which is strictly limited to non-commercial academic use only.

创建时间:
2026-06-05
原始信息汇总

数据集概述:RobotEQ-Data

RobotEQ-DataRobotEQ 基准的官方数据集发布版本,旨在评估具身人工智能中的主动智能(Active Intelligence),即机器人在没有明确指令的情况下,判断哪些行为是社会规范允许或禁止的能力。

核心任务与格式

数据集包含两种任务格式:

  1. 行为判断(Action Judgment)

    • 给定机器人视角的场景图像和问题,模型需判断每个候选行为的恰当性。
    • 标签:proper(恰当)、improper(不恰当)。
    • 主要指标:宏平均F1分数(Macro-F1)。
    • 规模:1,894个场景图像,4,944个候选行为标注。
  2. 空间定位(Spatial Grounding)

    • 给定带有候选区域(A-D)的图像,模型需选出所有符合问题描述的选项。
    • 标签:A、B、C、D的子集(多选)。
    • 指标:准确率(Accuracy)、宏平均F1分数(Macro-F1)、命中率(Hit)。
    • 规模:1,157个空间定位问题。

数据集统计

项目 数值
场景大类(Category) 10
细分场景(Subcategory) 56
行为判断场景图像 1,894
行为判断标注(候选行为) 4,944
空间定位问题 1,157
主动智能评估维度 8

八大主动智能评估维度

行为判断场景从八个非互斥的维度进行标注,以支持细粒度分析:

  1. 非语言信号识别
  2. 空间关系与空间规范
  3. 角色边界与权威
  4. 时机与打断规范
  5. 情境音量与行为约束
  6. 资源与所有权规范
  7. 优先级与受保护人群
  8. 文化特定规范

维度标签文件位于 actionjudgment/actionjudgment_dimensions_en.json(英文)和 actionjudgment/actionjudgment_dimensions_zh.json(中文)。

十大场景类别

数据集涵盖十类不同的具身部署环境:

  1. 公共空间与城市基础设施
  2. 农业与水产养殖
  3. 办公、教育与知识工作
  4. 医疗、护理与康复
  5. 安保、应急与灾难响应
  6. 实验室、研究与高风险操作
  7. 工业制造、物流与仓储
  8. 文化、典礼与宗教场所
  9. 零售、酒店与消费者服务
  10. 私人生活空间

数据仓库结构

Robot-EQ/ ├── README.md ├── actionjudgment/ │ ├── actionjudgement.json # 中文行为判断标注(1,894个场景) │ ├── actionjudgement_english.json # 英文行为判断标注(1,894个场景) │ ├── actionjudgment_dimensions_zh.json # 维度标签(中文) │ ├── actionjudgment_dimensions_en.json # 维度标签(英文) │ ├── actionjudgment_scenario_taxonomy_zh.json # 场景分类(中文) │ ├── actionjudgment_scenario_taxonomy_en.json # 场景分类(英文) │ └── images/ # 1,894张机器人视角JPEG图像 └── spatialgrounding/ ├── spatialgrounding.json # 中文空间定位标注(1,157个问题) ├── spatialgrounding_english.json # 英文空间定位标注(1,157个问题) ├── spatialgrounding_scenario_taxonomy_zh.json # 场景分类(中文) ├── spatialgrounding_scenario_taxonomy_en.json # 场景分类(英文) └── images/ # 1,157张带标注的JPEG图像(区域A-D)

数据字段说明

  • 行为判断 (actionjudgement.json / actionjudgement_english.json):包含场景标识符(key)、图像路径(image_url)、问题提示(title)、场景描述(description)、需要主动智能的理由(why_embedded)、候选行为(option_texts)和对应标签(gt_labels,值为 properimproper)。
  • 空间定位 (spatialgrounding.json / spatialgrounding_english.json):包含场景标识符(key)、图像路径(url)、图像ID(image_id)、场景描述(description)、需要主动智能的理由(why_embedded)、定位问题(q_title)和正确答案集合(gt,如 ["A"]["A", "C"])。
  • 维度标签 (actionjudgment_dimensions_*.json):包含维度定义列表(dimension_definitions)和每个图像的维度标签(items[].dimensions)。
  • 场景分类 (actionjudgment_scenario_taxonomy_*.json, spatialgrounding_scenario_taxonomy_*.json):包含大类列表(categories)、子类列表(subcategories)以及每个图像的分类信息(items[].categoryitems[].subcategory)。

许可与引用

搜集汇总
数据集介绍
Robot-EQ 数据集图片
构建方式
RobotEQ数据集由同济大学自主智能无人系统全国重点实验室构建,旨在评估具身智能体在无指令场景下的主动智能。数据集的构建经历了多阶段流程,首先借助大语言模型生成初始场景与候选行为,随后由领域专家进行严格审核与精炼,最终通过大规模人工标注完成。数据集包含1,894张机器人视角图像,覆盖10大场景类别与56个细分子类别,并附带4,944条行为判断标注(标记为“proper”或“improper”)以及1,157个空间定位多选题。每张图像均被赋予主动智能维度标签和场景分类标签,确保数据在伦理、社交规范与文化敏感性上的严谨性。
特点
RobotEQ的核心特色在于其聚焦于“主动智能”,即机器人无需用户指令便能自主推理何种行为在社会情境中恰当或不当。数据集设计了两种核心任务:行为判断与空间定位,分别评估模型对社交规范的领悟力与对空间环境的理解力。行为判断覆盖8个非互斥的主动智能维度,如非语言信号识别、空间距离规范、角色边界与权威、文化特定规范等,为细粒度性能分析提供了可能。场景类别广泛涵盖从公共场所、医疗照护到私人住宅的多样化具身部署环境,使数据集兼具生态效度与挑战性。
使用方法
研究人员可通过Hugging Face CLI或Python API便捷下载完整数据集,并加载JSON格式的标注文件。行为判断任务要求模型根据机器人视角图像与角色相关的问题,对候选行为进行二分分类,主要评价指标为Macro-F1。空间定位任务则要求模型在标注有A–D候选区域的图像中选择所有正确的空间选项,评价指标包括精确匹配准确率、Macro-F1和命中率。论文还报告了结合思维链提示与检索增强生成策略的基线结果,用户可复现评估或在此基础上开展对比实验。数据集仅限非商业学术研究使用,需遵循CC-BY-NC-4.0许可协议。
背景与挑战
背景概述
RobotEQ数据集由同济大学自主智能无人系统国家重点实验室于2026年创建,是首个面向具身智能中“主动智能”的基准评测。传统具身智能研究聚焦于被动智能,即机器人严格遵循用户指令执行任务;然而,当机器人融入人类生活环境时,亟需具备在无明确指令下判断行为是否得体的社会感知能力。该数据集通过1,894张机器人视角图像与4,944条动作判断标注,系统评估视觉语言模型对社交规范的理解,涵盖10大场景类别与56个细分子类,为从被动智能向主动智能的范式转型提供了关键评测工具。
当前挑战
RobotEQ所解决的领域问题在于,现有具身智能基准忽视机器人自主判断行为正当性的能力,缺乏对非语言信号识别、空间社交规范、角色边界等8个主动智能维度的系统评估。构建过程中面临双重挑战:一是设计涵盖文化特异性规范、弱势群体优先级等复杂社会情境的场景,需通过多轮LLM辅助生成与专家审核确保生态效度;二是对4,944个候选动作进行精确的proper/improper标注,并需在多语言环境下保持标注一致性,同时解决空间定位任务中多标签答案的歧义性问题。
常用场景
经典使用场景
在具身智能与视觉语言模型交叉研究领域,RobotEQ数据集的经典使用场景集中于评估模型在真实机器人视角下对社会规范的理解与推理能力。具体而言,该数据集通过提供1,894张机器人第一人称视角图像及4,944条动作判断标注,要求模型对给定的候选行为进行‘合理’或‘不合理’的二元分类。此外,1,157道空间定位题目则考察模型在多区域图像中选择符合社会规范的空间位置的能力。这两类任务共同构成了对视觉语言模型主动智能水平的核心测试框架,尤其适用于验证模型能否在缺乏明确指令时自主判断机器人行为的适切性。
衍生相关工作
RobotEQ数据集的发布已衍生出一系列值得关注的后续工作。其中,基于其八维度主动智能标注体系,研究者开始构建细粒度的社会规范知识库,并结合检索增强生成技术提升模型对跨文化行为边界的理解。此外,该数据集催生了若干面向动作判断与空间定位的联合推理框架,探索如何将非言语信号识别与空间礼节规范相融合。部分工作还将RobotEQ-Bench的评估协议迁移至具身仿真平台,用于在虚拟环境中测试机器人规划算法的社会敏感性,推动了主动智能从静态评测向动态决策的延伸。
数据集最近研究
最新研究方向
RobotEQ数据集开创性地将具身智能研究从被动智能范式推向主动智能前沿,聚焦于视觉-语言模型在无人指令情境下对机器人行为的社会适宜性推理能力。该基准通过动作判断与空间定位双重任务,系统评估机器人对非言语信号识别、空间规范遵守、角色边界认知等八个主动智能维度的理解水平,覆盖了从公共空间到私人居所的十个典型部署场景。这一研究方向的突破性在于,它弥补了传统具身智能基准仅关注指令跟随的不足,首次将社会规范内化为机器人的自主决策准则,为构建具备自发社会意识的自主智能体提供了关键评估框架,也为人机共融场景下的伦理对齐问题开辟了新的实证路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务