GEM/e2e_nlg
收藏资源简介:
E2E NLG数据集是一个用于数据到文本模型的英语基准数据集,主要在餐厅领域将2-9个键值属性对转化为自然语言描述。GEM使用的版本是经过清理的E2E NLG数据集,过滤了包含幻觉和未完全覆盖所有输入属性的样本。数据集包含训练、开发和测试集,分别用于模型训练、验证和测试。数据集的输入是餐厅的属性对,输出是对应的自然语言描述。数据集的主要任务是生成推荐或介绍餐厅的文本,基于输入的所有属性。
The E2E NLG dataset is an English benchmark dataset for data-to-text models, which primarily converts 2 to 9 key-value attribute pairs into natural language descriptions in the restaurant domain. The version used by GEM is a cleaned E2E NLG dataset that filters out samples containing hallucinations and those failing to fully cover all input attributes. The dataset comprises training, validation, and test sets, which are respectively used for model training, validation, and testing. The input of the dataset is restaurant attribute pairs, and the output is the corresponding natural language descriptions. The core task of the dataset is to generate texts for recommending or introducing restaurants based on all input attributes.
数据集概述
数据集描述
- 名称: E2E NLG
- 语言: 英语
- 许可证: cc-by-sa-4.0
- 任务类别: 数据-到-文本
- 数据来源: 原始数据
- 数据结构: CSV格式,包含字段
mr(意义表示,输入)和ref(参考,即相应的自然语言描述,输出)
数据集总结
E2E NLG数据集是一个英语基准数据集,用于测试数据到文本模型的能力,该模型将餐馆领域的2-9个键值属性对口头表达出来。GEM使用的版本是经过清理的E2E NLG数据集,该数据集过滤了包含幻觉和未完全覆盖所有输入属性的输出示例。
数据集结构
- 数据字段:
mr- 意义表示(MR,输入)ref- 参考,即相应的自然语言描述(输出)
- 数据分割:
- 训练: 12,568个MRs
- 开发: 1,484个MRs
- 测试: 1,847个MRs
- 分割标准: 数据分割确保不同分割中的MR不重叠。
数据集在GEM中的应用
- GEM特定处理: GEM版本的数据集进行了修改,包括添加了4个特殊测试集,用于测试模型的泛化能力和鲁棒性。
- 评估指标: 使用
BLEU,METEOR,ROUGE等指标进行评估。
数据集创建和维护
- 创建者: Jekaterina Novikova, Ondrej Dusek, Verena Rieser
- 资金来源: EPSRC项目DILiGENt和MaDrIgAL
- 维护计划: 无
使用注意事项
- 版权和许可状态: 开放许可,允许商业使用
- 个人识别信息: 数据集不包含个人识别信息




