BAD dataset; Bad Idea dataset
收藏资源简介:
ERR@HRI 3.0挑战赛提供了两个互补的多模态数据集,由康奈尔大学等机构联合创建,旨在推动人机交互中错误检测与预测的前沿研究。BAD数据集包含45名参与者对机器人及人类失败场景的1645个自发反应视频片段,总时长约25,527秒;Bad Idea数据集则收录29名参与者在结果揭示前的865个预期性面部反应视频,时长约1,851秒,数据均通过众包平台采集原始网络摄像头视频。数据集创建过程采用自然主义实验设计,捕捉了光照、角度、环境等真实场景变异,未进行匿名化处理以保留完整行为信号。这些数据集主要应用于多模态机器学习模型开发,致力于解决机器人错误检测、预期性行为预测及跨领域泛化等核心问题,为人机交互系统的鲁棒性提升提供基准测试平台。
The ERR@HRI 3.0 Challenge provides two complementary multimodal datasets co-created by institutions including Cornell University, with the goal of advancing cutting-edge research on error detection and prediction in human-robot interaction (HRI). The BAD Dataset includes 1,645 spontaneous reaction video clips from 45 participants, covering robot and human failure scenarios, with a total duration of approximately 25,527 seconds. The Bad Idea Dataset contains 865 anticipatory facial reaction videos from 29 participants, collected before the outcome is revealed, with a total duration of around 1,851 seconds. All raw data were collected as webcam videos via crowdsourcing platforms. The datasets were developed using a naturalistic experimental design, capturing real-world variations such as lighting, viewing angles and environmental conditions, and were not anonymized to preserve complete behavioral signals. These datasets are mainly applied to the development of multimodal machine learning models, aiming to solve core issues including robot error detection, anticipatory behavior prediction and cross-domain generalization, providing a benchmark platform for improving the robustness of human-robot interaction systems.
ERR@HRI 3.0 数据集概述
数据集简介
ERR@HRI 3.0 是多模态人机交互错误检测与预期挑战赛(ICMI 2026)的官方数据集,旨在通过两个互补的数据集,解决人机交互中从错误前预期反应到错误中反应的多模态错误检测问题。数据集以原始、非匿名化的网络摄像头录像(.mp4)形式提供,支持端到端学习方法。
数据集组成
1. BAD(旁观者情感检测)数据集
- 数据来源:45名参与者在观看46个机器人和人类失败场景时的自发面部反应
- 记录数量:1,645个视频
- 总时长:25,527秒
- 帧率:30 fps
- 平均时长:约15.5秒/视频
- 时间焦点:失败发生期间的反应
- 标签:二分类——1(失败场景)vs. 0(控制场景)
- 标签编码:视频文件名格式为
QID<stimulus_id>_<label>.mp4
数据划分
| 划分 | 参与者数 | 视频数 | 标签0(控制) | 标签1(失败) |
|---|---|---|---|---|
| 训练验证集 | 36 | 1,319 | 173 (13.1%) | 1,146 (86.9%) |
| 测试集 | 9 | 326 | 43 (13.2%) | 283 (86.8%) |
| 总计 | 45 | 1,645 | 216 (13.1%) | 1,429 (86.9%) |
- 配套文件:
baddataset_stats.csv提供每个视频的详细信息(参与者、划分、视频名称、标签、时长)
2. Bad Idea 数据集
- 数据来源:29名参与者在预测30个动作场景结果时的预期反应
- 记录数量:865个视频
- 总时长:1,851秒
- 帧率:30 fps
- 平均时长:约1.95秒/视频
- 时间焦点:失败发生前的预期反应
- 标签:二分类——0(预期良好结果)vs. 1(预期不良结果),反映参与者预测而非真实结果
数据划分
| 划分 | 参与者数 | 视频数 | 标签0(良好) | 标签1(不良) |
|---|---|---|---|---|
| 训练验证集 | 23 | 685 | 360 (52.6%) | 325 (47.4%) |
| 测试集 | 6 | 180 | 103 (57.2%) | 77 (42.8%) |
| 总计 | 29 | 865 | 463 (53.5%) | 402 (46.5%) |
- 备注:参与者1483缺失1个视频(q_20_main);参与者9055缺失1个视频(q_12_main),其余参与者各有30个视频
- 配套文件:
badidea_dataset_stats.csv提供每个视频的详细信息(参与者、划分、视频名称、标签、帧数)
挑战任务
赛道1:旁观者反应检测(BAD数据集)
- 任务:二分类,判断参与者是否在观察失败场景 vs. 控制场景
- 主要评价指标:宏平均F1(视频级别,多数投票),平衡准确率作为辅助指标
赛道2:预期反应预测(Bad Idea数据集)
- 任务:二分类,从参与者的预期面部行为预测其预期结果(良好/不良)
- 主要评价指标:AUC-ROC(视频级别,取窗口最大概率)
跨数据集泛化(可选)
- 鼓励参与者探索迁移学习(如在BAD上训练,在Bad Idea上测试),单独评估并设有奖项
评价指标
- 主要指标:赛道1为宏平均F1,赛道2为AUC-ROC
- 窗口化预测:使用固定长度滑动窗口;视频级别标签由多数投票(赛道1)或最大概率(赛道2)得出
- 最早检测时间:正确窗口预测时已播放片段的平均百分比(仅正类视频,越低越好)
- 每视频假阴性率:正类窗口中缺失正类标签的平均比例
数据准备
- BAD数据集为原始.mp4视频文件,需使用
utils/extract_frames.py脚本以5 fps提取帧 - Bad Idea数据集已提供预提取的帧
- 提取后数据目录结构包含:原始视频、PNG帧、NPY数组及对应的
label_data.csv
注册与数据获取
- 需通过挑战官网注册并签署数据使用协议(DUA)后获取数据
- 数据使用条款:禁止重新分发;仅限本次挑战使用;不得用于诋毁参与者;需采取适当数据安全措施
- 每个团队最多可提交3次测试集预测
- 参赛团队需提交描述方法的短文(使用ICMI 2026模板),代码发布强烈鼓励
基线模型
| 赛道 | 模型 | 测试集性能 |
|---|---|---|
| 赛道1(BAD) | BadNetCNN | 宏平均F1 = 0.502 |
| 赛道2(Bad Idea) | ResNet-34(微调) | AUC-ROC = 0.564 |
- 预训练模型权重位于
baseline/models/目录下
时间线
| 日期 | 里程碑 |
|---|---|
| 2026年3月1日 | 挑战公布与参赛邀请 |
| 2026年3月15日 | 注册开放,训练和验证数据发布 |
| 2026年5月1日 | 基线模型和评估脚本发布 |
| 2026年6月1日 | 测试数据发布(无标签) |
| 2026年6月8日 | 预测结果提交截止 |
| 2026年6月15日 | 论文提交截止 |
| 2026年7月8日 | 录用通知 |
| 2026年7月23日 | 最终版论文提交截止 |
| 2026年10月5日 | ICMI 2026挑战研讨会,意大利那不勒斯 |
数据集属性总结
- 数据类型:原始视听网络摄像头录像(.mp4),非匿名化
- 采集方式:众包(Prolific)
- 环境条件:自然众包环境,包含多样化的光照、摄像头角度、参与者位置和环境背景
- 数据格式:BAD数据集为原始视频需预处理;Bad Idea数据集为预提取帧
- 标签定义:两个数据集均为二分类,但标签含义不同(失败检测 vs. 预期判断)
- 刺激材料:每个数据集均提供刺激视频文件
引用信息
若使用本数据集或代码,请引用: bibtex @inproceedings{parreira2026errhri, title={ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions}, author={Parreira, Maria Teresa and Spitale, Micol and Stiber, Maia and Cao, Shiye and Mahmood, Amama and Huang, Chien-Ming and Gunes, Hatice and Ju, Wendy}, booktitle={Proceedings of the 28th ACM International Conference on Multimodal Interaction (ICMI 26)}, year={2026}, publisher={ACM} }
许可协议
本项目采用MIT许可证。




