shibing624/AdvertiseGen
收藏资源简介:
AdvertiseGen是电商广告文案生成数据集。该数据集以商品网页的标签与文案的信息对应关系为基础构造,是典型的开放式生成任务,在模型基于key-value输入生成开放式文案时,与输入信息的事实一致性需要得到重点关注。任务描述为给定商品信息的关键词和属性列表kv-list,生成适合该商品的广告文案adv。数据规模包括训练集114k,验证集1k,测试集3k,数据来源于清华大学CoAI小组。
AdvertiseGen是电商广告文案生成数据集。该数据集以商品网页的标签与文案的信息对应关系为基础构造,是典型的开放式生成任务,在模型基于key-value输入生成开放式文案时,与输入信息的事实一致性需要得到重点关注。任务描述为给定商品信息的关键词和属性列表kv-list,生成适合该商品的广告文案adv。数据规模包括训练集114k,验证集1k,测试集3k,数据来源于清华大学CoAI小组。
数据集概述
数据集名称
AdvertiseGen
数据集描述
AdvertiseGen是一个电商广告文案生成数据集,基于商品网页的标签与文案的信息对应关系构造。该数据集关注模型在生成文案时与输入信息的事实一致性。
任务描述
给定商品信息的关键词和属性列表(kv-list),生成适合该商品的广告文案(adv)。
数据规模
- 训练集:114k
- 验证集:1k
- 测试集:3k
数据来源
清华大学CoAI小组
语言
数据集中的文本为中文。
数据集结构
数据实例
一个典型的训练数据实例如下: json { "content": "类型#上衣材质#牛仔布颜色#白色风格#简约图案#刺绣衣样式#外套衣款式#破洞", "summary": "简约而不简单的牛仔外套,白色的衣身十分百搭。衣身多处有做旧破洞设计,打破单调乏味,增加一丝造型看点。衣身后背处有趣味刺绣装饰,丰富层次感,彰显别样时尚。" }
引用信息
如在学术论文中使用本数据集,请引用以下文献:
Shao, Zhihong, et al. "Long and Diverse Text Generation with Planning-based Hierarchical Variational Model." Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). 2019.




