DiNeR
收藏资源简介:
DiNeR是一个用于评估组合泛化能力的大型现实数据集,主要用于菜名识别任务。数据集包括训练、验证和TMCD测试集,以及食品、动作和风味的词汇表。
DiNeR is a large-scale real-world dataset designed for evaluating compositional generalization capabilities, primarily utilized in the task of dish name recognition. The dataset encompasses training, validation, and TMCD test sets, along with vocabularies for food items, actions, and flavors.
数据集概述
数据集名称
DiNeR (DIsh NamE Recognition)
数据集内容
tmcd_data.json: 包含训练、验证和TMCD测试集,用于菜名识别任务。glossary.json: 食品、动作和风味的词汇表。每个字典的键是食品、动作或风味的名称,值是对应的聚类ID。
数据集位置
数据集文件位于data/文件夹中。
数据集用途
用于评估组合泛化能力,特别是在菜名识别任务中。
数据集相关论文
- 论文标题:DiNeR: A Large Realistic Dataset for Evaluating Compositional Generalization
- 发表会议:2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)
- 论文链接:https://aclanthology.org/2023.emnlp-main.924
数据集引用信息
@inproceedings{hu-etal-2023-diner, title = "{D}i{N}e{R}: A Large Realistic Dataset for Evaluating Compositional Generalization", author = "Hu, Chengang and Liu, Xiao and Feng, Yansong", editor = "Bouamor, Houda and Pino, Juan and Bali, Kalika", booktitle = "Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing", month = dec, year = "2023", address = "Singapore", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2023.emnlp-main.924", doi = "10.18653/v1/2023.emnlp-main.924", pages = "14938--14947", }




