遇见数据集

BAD dataset; Bad Idea dataset

收藏
arXiv2026-07-13 更新2026-07-15 收录
数据链接:
官方服务:

资源简介:

ERR@HRI 3.0挑战赛提供了两个互补的多模态数据集,由康奈尔大学等机构联合创建,旨在推动人机交互中错误检测与预测的前沿研究。BAD数据集包含45名参与者对机器人及人类失败场景的1645个自发反应视频片段,总时长约25,527秒;Bad Idea数据集则收录29名参与者在结果揭示前的865个预期性面部反应视频,时长约1,851秒,数据均通过众包平台采集原始网络摄像头视频。数据集创建过程采用自然主义实验设计,捕捉了光照、角度、环境等真实场景变异,未进行匿名化处理以保留完整行为信号。这些数据集主要应用于多模态机器学习模型开发,致力于解决机器人错误检测、预期性行为预测及跨领域泛化等核心问题,为人机交互系统的鲁棒性提升提供基准测试平台。

The ERR@HRI 3.0 Challenge provides two complementary multimodal datasets co-created by institutions including Cornell University, with the goal of advancing cutting-edge research on error detection and prediction in human-robot interaction (HRI). The BAD Dataset includes 1,645 spontaneous reaction video clips from 45 participants, covering robot and human failure scenarios, with a total duration of approximately 25,527 seconds. The Bad Idea Dataset contains 865 anticipatory facial reaction videos from 29 participants, collected before the outcome is revealed, with a total duration of around 1,851 seconds. All raw data were collected as webcam videos via crowdsourcing platforms. The datasets were developed using a naturalistic experimental design, capturing real-world variations such as lighting, viewing angles and environmental conditions, and were not anonymized to preserve complete behavioral signals. These datasets are mainly applied to the development of multimodal machine learning models, aiming to solve core issues including robot error detection, anticipatory behavior prediction and cross-domain generalization, providing a benchmark platform for improving the robustness of human-robot interaction systems.

创建时间:
2026-07-13
原始信息汇总

ERR@HRI 3.0 数据集概述

数据集简介

ERR@HRI 3.0 是多模态人机交互错误检测与预期挑战赛(ICMI 2026)的官方数据集,旨在通过两个互补的数据集,解决人机交互中从错误前预期反应到错误中反应的多模态错误检测问题。数据集以原始、非匿名化的网络摄像头录像(.mp4)形式提供,支持端到端学习方法。

数据集组成

1. BAD(旁观者情感检测)数据集

  • 数据来源:45名参与者在观看46个机器人和人类失败场景时的自发面部反应
  • 记录数量:1,645个视频
  • 总时长:25,527秒
  • 帧率:30 fps
  • 平均时长:约15.5秒/视频
  • 时间焦点:失败发生期间的反应
  • 标签:二分类——1(失败场景)vs. 0(控制场景)
  • 标签编码:视频文件名格式为 QID<stimulus_id>_<label>.mp4

数据划分

划分 参与者数 视频数 标签0(控制) 标签1(失败)
训练验证集 36 1,319 173 (13.1%) 1,146 (86.9%)
测试集 9 326 43 (13.2%) 283 (86.8%)
总计 45 1,645 216 (13.1%) 1,429 (86.9%)
  • 配套文件baddataset_stats.csv 提供每个视频的详细信息(参与者、划分、视频名称、标签、时长)

2. Bad Idea 数据集

  • 数据来源:29名参与者在预测30个动作场景结果时的预期反应
  • 记录数量:865个视频
  • 总时长:1,851秒
  • 帧率:30 fps
  • 平均时长:约1.95秒/视频
  • 时间焦点:失败发生前的预期反应
  • 标签:二分类——0(预期良好结果)vs. 1(预期不良结果),反映参与者预测而非真实结果

数据划分

划分 参与者数 视频数 标签0(良好) 标签1(不良)
训练验证集 23 685 360 (52.6%) 325 (47.4%)
测试集 6 180 103 (57.2%) 77 (42.8%)
总计 29 865 463 (53.5%) 402 (46.5%)
  • 备注:参与者1483缺失1个视频(q_20_main);参与者9055缺失1个视频(q_12_main),其余参与者各有30个视频
  • 配套文件badidea_dataset_stats.csv 提供每个视频的详细信息(参与者、划分、视频名称、标签、帧数)

挑战任务

赛道1:旁观者反应检测(BAD数据集)

  • 任务:二分类,判断参与者是否在观察失败场景 vs. 控制场景
  • 主要评价指标:宏平均F1(视频级别,多数投票),平衡准确率作为辅助指标

赛道2:预期反应预测(Bad Idea数据集)

  • 任务:二分类,从参与者的预期面部行为预测其预期结果(良好/不良)
  • 主要评价指标:AUC-ROC(视频级别,取窗口最大概率)

跨数据集泛化(可选)

  • 鼓励参与者探索迁移学习(如在BAD上训练,在Bad Idea上测试),单独评估并设有奖项

评价指标

  • 主要指标:赛道1为宏平均F1,赛道2为AUC-ROC
  • 窗口化预测:使用固定长度滑动窗口;视频级别标签由多数投票(赛道1)或最大概率(赛道2)得出
  • 最早检测时间:正确窗口预测时已播放片段的平均百分比(仅正类视频,越低越好)
  • 每视频假阴性率:正类窗口中缺失正类标签的平均比例

数据准备

  • BAD数据集为原始.mp4视频文件,需使用 utils/extract_frames.py 脚本以5 fps提取帧
  • Bad Idea数据集已提供预提取的帧
  • 提取后数据目录结构包含:原始视频、PNG帧、NPY数组及对应的 label_data.csv

注册与数据获取

  • 需通过挑战官网注册并签署数据使用协议(DUA)后获取数据
  • 数据使用条款:禁止重新分发;仅限本次挑战使用;不得用于诋毁参与者;需采取适当数据安全措施
  • 每个团队最多可提交3次测试集预测
  • 参赛团队需提交描述方法的短文(使用ICMI 2026模板),代码发布强烈鼓励

基线模型

赛道 模型 测试集性能
赛道1(BAD) BadNetCNN 宏平均F1 = 0.502
赛道2(Bad Idea) ResNet-34(微调) AUC-ROC = 0.564
  • 预训练模型权重位于 baseline/models/ 目录下

时间线

日期 里程碑
2026年3月1日 挑战公布与参赛邀请
2026年3月15日 注册开放,训练和验证数据发布
2026年5月1日 基线模型和评估脚本发布
2026年6月1日 测试数据发布(无标签)
2026年6月8日 预测结果提交截止
2026年6月15日 论文提交截止
2026年7月8日 录用通知
2026年7月23日 最终版论文提交截止
2026年10月5日 ICMI 2026挑战研讨会,意大利那不勒斯

数据集属性总结

  • 数据类型:原始视听网络摄像头录像(.mp4),非匿名化
  • 采集方式:众包(Prolific)
  • 环境条件:自然众包环境,包含多样化的光照、摄像头角度、参与者位置和环境背景
  • 数据格式:BAD数据集为原始视频需预处理;Bad Idea数据集为预提取帧
  • 标签定义:两个数据集均为二分类,但标签含义不同(失败检测 vs. 预期判断)
  • 刺激材料:每个数据集均提供刺激视频文件

引用信息

若使用本数据集或代码,请引用: bibtex @inproceedings{parreira2026errhri, title={ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions}, author={Parreira, Maria Teresa and Spitale, Micol and Stiber, Maia and Cao, Shiye and Mahmood, Amama and Huang, Chien-Ming and Gunes, Hatice and Ju, Wendy}, booktitle={Proceedings of the 28th ACM International Conference on Multimodal Interaction (ICMI 26)}, year={2026}, publisher={ACM} }

许可协议

本项目采用MIT许可证。

搜集汇总
数据集介绍
BAD dataset; Bad Idea dataset 数据集图片
构建方式
BAD数据集(Bystander Affect Detection Dataset)与Bad Idea数据集(Bad Idea dataset)共同构成ERR@HRI 3.0挑战赛的核心数据资源。两者均通过Prolific众筹平台收集,以原始、非匿名化的网络摄像头视频形式呈现,捕捉了自然情境下丰富的环境变异性——包括差异化的光照条件、拍摄角度、参与者位置及背景环境。BAD数据集包含45名参与者在观看46段机器人或人类失败情景视频时的自发面部反应,标签为二分类的失败与否。Bad Idea数据集则聚焦于29名参与者在观看30段提前截断、未揭示结果的动作情景视频时,基于自身预判所产生的预期性面部反应,标签对应参与者预测的结局好坏。这种收集方式确保了数据真实反映现实世界中人机交互的复杂与动态特性。
特点
该数据集的一大显著特点在于其双轨并行的时序覆盖设计:BAD数据集聚焦于失败发生期间的旁观者反应检测,属于事后反应型数据;而Bad Idea数据集则开创性地捕捉了失败尚未显现前的预期性面部行为,为错误预测提供了先验线索。此外,两个数据集均提供原始视频帧而非预提取特征,支持端到端的深度学习方法。BAD数据集呈现明显的类别不平衡(失败类占比86.9%),模拟了真实场景中失败事件相对稀少的分布;Bad Idea数据集则保持近乎均衡的标签分布,反映了参与者主观预判的自然变异。数据集还包含跨数据集泛化评估的潜力,为研究模型在不同时序阶段、不同错误类型间的迁移能力提供了独特平台。
使用方法
该数据集通过ERR@HRI 3.0挑战赛设置了三个独立评估赛道进行使用。Track 1利用BAD数据集进行旁观者反应检测,即根据参与者观看视频时的面部视频,二分类判断其是否正在观察失败情景。Track 2基于Bad Idea数据集完成预期性结果预测,根据参与者在结局揭晓前的预期性面部行为,二分类预测其认为结局是好是坏。Track 3为可选的跨数据集泛化任务,鼓励探索在两个不同时序特征的数据集间的迁移学习。评估指标方面,Track 1以宏观F1分数为主指标,Track 2以AUC-ROC为主指标,并辅以窗口级与视频级的多种二分类指标以及时间敏感性指标。参与者需签署数据使用协议后方可获取数据,且每支队伍每个赛道最多提交三次测试集预测结果,以防止过拟合。
背景与挑战
背景概述
随着机器人日益融入人类生产生活,其自主感知与应对自身失误的能力成为维系人机信任与交互质量的关键。然而,现有错误检测方法多局限于特定场景或受控实验室环境,依赖预先提取的静态特征,难以泛化至真实世界的动态与噪声。为填补这一空白,ERR@HRI 3.0挑战赛于2026年由康奈尔大学、微软研究院、约翰霍普金斯大学、剑桥大学及米兰理工大学等国际团队联合发起,聚焦于人机交互中多模态错误检测与事前预测这一核心问题。该挑战提供了两个互补数据集——Bystander Affect Detection (BAD)数据集与Bad Idea数据集,前者采集了45名参与者对机器人与人类失败场景的自发反应,后者则记录了29名参与者在结果揭晓前对行动后果的预期面部表情。两数据集均以原始视频格式在众包环境下获取,囊括光照、视角、背景等自然变异,为开发鲁棒的、可迁移的错误检测系统提供了真实且富有挑战性的测试平台。该工作对推动多模态人机交互领域基准化研究、促进从被动反应到主动预防的范式转变具有深远影响。
当前挑战
该数据集所解决的领域问题在于突破传统错误检测的“事后响应”局限,将检测范围从已发生的失败延伸至失败发生前的预期行为,并直接面对原始视频数据中蕴含的复杂噪声与个体差异。具体挑战体现在多层面:首先,任务层面需应对两大难题,一是基于旁观者反应(Track 1)从高度不均衡的样本(失败类占比86.9%)中准确识别失败场景,二是基于预期面部行为(Track 2)从平均仅约2秒的极短视频中推断参与者对行动结果的主观预判,这对模型捕捉微弱、短暂的预期信号构成严峻考验。其次,数据构建层面面临自然变异带来的挑战,众包环境下采集的视频在分辨率、光照条件、摄像头角度和参与者位置等方面高度不一致,此类真实世界的变异虽提升了模型的泛化潜力,却显著加大了特征提取与模式学习的难度。此外,跨数据集泛化(Track 3)要求模型在源域与目标域分布迥异(一个为反应数据,一个为预期数据)的情况下仍保持良好性能,进一步提高了挑战的技术门槛。
常用场景
经典使用场景
在人机交互领域,错误检测与预防是确保协作流畅和用户信任的关键。BAD数据集与Bad Idea数据集分别聚焦于旁观者对机器人或人类失败场景的反应,以及个体在结果揭晓前的预期性面部表情。这两个数据集最经典的使用场景是作为多模态错误检测和预期性行为分析的基准平台。研究者可以利用原始网络摄像头视频,开发端到端的深度学习模型,直接从像素级数据中识别用户对失败事件的自发反应,或从短暂的面部线索中预测即将发生的失误。这种自然环境下收集的数据,因其光照、角度和背景的多样性,为训练鲁棒性强的通用模型提供了真实而富有挑战的测试床。
解决学术问题
这两个数据集共同解决了人机交互研究中两个长期存在的学术难题:其一,突破传统错误检测依赖人工特征提取和受控实验室环境的局限,通过提供原始视频数据,推动了从预定义特征到端到端学习的范式转变;其二,引入了预期性错误预测这一全新维度,将研究从被动反应检测拓展至主动干预。研究者得以探索人类在失败发生前流露的细微面部信号能否作为可靠预警,从而填补了“事后响应”与“事前预防”之间的研究空白。这些工作显著提升了模型在现实复杂场景下的泛化能力,为构建上下文感知、具身自省的人机协作系统奠定了方法论和实验基础。
衍生相关工作
基于这两个数据集,学术界已衍生出一系列具有影响力的经典工作。ERR@HRI 3.0挑战赛本身即是一个标志性成果,其设立的三个赛道——旁观者反应检测、预期性结果预测以及跨数据集泛化——吸引了多支团队提交超越卷积神经网络基线的模型,催生了基于BadNet和微调ResNet-34的多模态架构。后续研究进一步探索了时空注意力机制、对比学习以及视觉-语言联合表征在错误检测中的应用。这些工作不仅深化了对人类错误反应机制的理解,也推动了人机交互领域公共基准的建立,正如ImageNet对计算机视觉的催化作用一般,为可泛化、可重现的错误检测研究树立了标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务