EmpathyRobot
收藏资源简介:
EmpathyRobot是第一个专门设计用于基准测试和增强代理在不同场景中的共情行为的数据集。该数据集包含10,000个基于人类反馈的样本,涵盖了多种模态的信息和相应的共情任务规划序列,包括导航和操作。代理需要根据对视觉场景和人类情感的理解来执行动作。
EmpathyRobot is the first dataset specifically designed for benchmarking and enhancing empathetic behaviors of agents across diverse scenarios. This dataset contains 10,000 human-feedback-based samples, covering multi-modal information and corresponding empathetic task planning sequences including navigation and manipulation. Agents are required to perform actions based on their understanding of visual scenes and human emotions.
EmpathyRobot 数据集概述
数据集简介
EmpathyRobot 是一个专门为增强和评估机器人在多样化场景中的共情行为而设计的数据集。该数据集包含 10,000 个基于人类反馈的样本,涵盖了多种模态的信息以及相应的共情任务规划序列,包括导航和操作。机器人需要根据对视觉场景和人类情感的理解来执行动作。
数据集关键统计信息
- 总数据点:10,000
- 角色数量:100
- 输入动作-视频数量:20
- 每个角色-动作对的场景和对话数量:5
- 每个数据点的共情响应数量:2
- 输出的可选动作空间:50
- 动作-视频的平均长度:16.28秒
- 动作-视频的最大长度:24.60秒
- 动作-视频的最小长度:9.40秒
评估框架与指标
EmpathyRobot 提出了一个新颖的评估框架,包含以下三个关键阶段:
- 场景理解(内部共情过程)
- 共情规划(制定共情结果)
- 共情行动(在现实世界中实施响应)
评估结果
关键阶段性能
| 任务/指标 | GPT-4o | GPT-4-turbo | GPT-4-vision | LLaVA |
|---|---|---|---|---|
| 场景理解 | ||||
| Bleu-1 | 19.1 | 14.1 | 15.2 | 13.7 |
| Bleu-4 | 5.3 | 3.1 | 3.3 | 2.7 |
| ROUGE-L | 23.7 | 20.4 | 21.4 | 15.6 |
| CIDEr | 8.8 | 1.6 | 3.1 | 7.2 |
| SPICE | 14.8 | 10.1 | 12.1 | 8.9 |
| BERTScore | 0.622 | 0.612 | 0.615 | 0.576 |
| 共情规划 | ||||
| Bleu-1 | 30.8 | 25.7 | 25.9 | 13.1 |
| Bleu-4 | 12.0 | 6.9 | 6.4 | 2.6 |
| ROUGE-L | 26.1 | 23.5 | 23.4 | 17.3 |
| CIDEr | 25.9 | 14.9 | 15.5 | 3.7 |
| SPICE | 16.7 | 14.5 | 11.8 | 8.4 |
| BERTScore | 0.641 | 0.621 | 0.625 | 0.568 |
| 共情行动 | ||||
| Overlap | 27.60 | 32.14 | 35.20 | 17.19 |
| TF-IDF | 21.03 | 24.76 | 27.69 | 12.09 |
| LCS | 25.17 | 28.92 | 29.58 | 15.21 |
共情特定指标性能
| 任务 | 场景理解 | 场景理解 | 共情规划 | 共情规划 | 共情行动 | 共情行动 |
|---|---|---|---|---|---|---|
| 模型 | GPT-4o | LLaVA | GPT-4o | LLaVA | GPT-4o | LLaVA |
| 动作与对话关联 | 8.21 | 7.25 | 4.77 | 4.10 | 7.00 | 6.10 |
| 连贯性 | 8.57 | 7.96 | 5.51 | 4.58 | 7.41 | 7.09 |
| 情感交流 | 7.46 | 6.56 | 5.16 | 4.04 | 6.69 | 6.36 |
| 个体理解 | 6.91 | 6.64 | 4.63 | 3.92 | 5.69 | 5.39 |
| 情感调节 | - | - | 7.09 | 4.96 | 8.43 | 7.91 |
| 帮助性 | - | - | 5.76 | 4.95 | 8.08 | 7.35 |
| 合法性 | - | - | - | - | 9.97 | 9.46 |
| 适应性 | - | - | 4.50 | 3.49 | 6.19 | 5.31 |
| 总体平均 | 7.79 | 7.10 | 5.35 | 4.29 | 7.43 | 6.87 |
数据集下载
数据集可通过 Hugging Face Dataset 下载。




