Sony/ComperDial
收藏资源简介:
ComperDial是一个新的基准数据集,旨在促进开放域对话系统的评估指标的训练和评估。该数据集包含来自97个对话代理和2个人类受试者的10,395个对话轮次的评分,这些对话来自1,485个对话。数据集包括三个部分:对话数据集、用于单轮评估的注释数据集和用于对话级评估的注释数据集。对话数据集包含100个对话,单轮评估注释数据集包含10,395个评分,对话级评估注释数据集包含1,485个评分。这些数据集的构建旨在确保对学习到的对话指标进行更稳健的评估。
ComperDial是一个新的基准数据集,旨在促进开放域对话系统的评估指标的训练和评估。该数据集包含来自97个对话代理和2个人类受试者的10,395个对话轮次的评分,这些对话来自1,485个对话。数据集包括三个部分:对话数据集、用于单轮评估的注释数据集和用于对话级评估的注释数据集。对话数据集包含100个对话,单轮评估注释数据集包含10,395个评分,对话级评估注释数据集包含1,485个评分。这些数据集的构建旨在确保对学习到的对话指标进行更稳健的评估。
数据集卡片:ComperDial
数据集描述
ComperDial 是一个新的基准数据集,旨在促进开放领域对话系统评估指标的训练和评估。该数据集包含10,395个对话轮次的评分,来自1,485个对话,这些对话收集自97个对话代理提交的Commonsense Persona-grounded Dialogue (CPD)挑战赛,以及两个真人对话的标注对话。
数据集结构
ComperDial 包含以下三种数据集,以涵盖多样化的响应和足够数量的系统以确保可靠性:
- 对话数据集:包含与PersonaChat格式相似的带有角色句子的对话数据集。
- 单轮评估标注数据集:包含静态单轮评估的人类评估标注。
- 多轮对话评估标注数据集:包含静态多轮/对话级别评估的人类评估标注。
标注数据集是通过使用对话数据集中的15个对话创建的。
数据统计
| 响应收集 | |
| 对话模型数量 | 97 |
| 人类数量 | 2 |
| 总计 | 99 |
| 评估数据 | |
| 对话数据集 | 100 |
| 单轮评估标注数据集 | 10,395 |
| 多轮对话评估标注数据集 | 1,485 |
许可证
该数据集在CC-BY-NC-SA 4.0许可下发布。
引用
@misc{wakaki2024comperdial, title={ComperDial: Commonsense Persona-grounded Dialogue Dataset and Benchmark}, author={Hiromi Wakaki and Yuki Mitsufuji and Yoshinori Maeda and Yukiko Nishimura and Silin Gao and Mengjie Zhao and Keiichi Yamada and Antoine Bosselut}, year={2024}, eprint={2406.11228}, archivePrefix={arXiv} }




