GEM/web_nlg
收藏资源简介:
WebNLG是一个双语数据集(英语、俄语),包含并行的DBpedia三元组集和短文本,涵盖了约450个不同的DBpedia属性。该数据集最初是为了促进能够生成短文本并处理微规划(即句子分割和排序、指代表达生成、聚合)的RDF语言生成器的发展而创建的。任务的目标是从1到7个具有共同实体的输入三元组生成文本(即输入实际上是一个连接的知识图谱)。数据集包含约17,000个三元组集和45,000个众包文本(英语),以及7,000个三元组集和19,000个众包文本(俄语)。数据集还包含一个具有未在训练时见过的实体和/或属性的挑战性测试集部分。
WebNLG is a bilingual (English and Russian) dataset comprising parallel DBpedia triple sets and short texts, covering approximately 450 distinct DBpedia properties. It was originally created to facilitate the development of RDF-to-text generators that can produce short texts and handle micro-planning tasks, including sentence segmentation and ordering, referring expression generation, and information aggregation. The task objective is to generate coherent texts from 1 to 7 input triples that share common entities, where the input is effectively a connected knowledge graph. The dataset includes roughly 17,000 triple sets and 45,000 crowd-sourced English texts, alongside 7,000 triple sets and 19,000 crowd-sourced Russian texts. Additionally, the dataset features a challenging test split containing entities and/or properties unseen during model training.
数据集概述
数据集基本信息
- 名称: WebNLG
- 语言: 英语, 俄语
- 许可证: cc-by-nc-4.0
- 多语言性: 是
- 数据来源: 原始数据
- 任务类别: 表到文本
- 主要任务: 数据到文本
数据集描述
数据集概要
WebNLG是一个双语数据集,包含英语和俄语的平行DBpedia三元组集合和短文本,涵盖约450种不同的DBpedia属性。该数据集旨在促进RDF语法器的发展,能够生成短文本并处理微规划(如句子分割和排序、指称表达生成、聚合)。任务目标是从1到7个具有共同实体的输入三元组(即输入实际上是一个连接的知识图谱)生成文本。数据集包含约17,000个三元组集合和45,000个众包英语文本,以及7,000个三元组集合和19,000个众包俄语文本。
数据集结构
数据字段
entry: 包含五个属性:DBpedia类别(category)、条目ID(eid)、形状、形状类型和三元组集大小(size)。originaltripleset: 从DBpedia提取的RDF三元组集合。modifiedtripleset: 提供给众包工作者的RDF三元组集合。lexs: 词汇化文本,包含评论(comment)和词汇化ID(lid)。
数据分割
| 语言 | 训练集 | 验证集 | 测试集 |
|---|---|---|---|
| 英语 | 13,211 | 1,667 | 1,779 |
| 俄语 | 5,573 | 790 | 1,102 |
数据集用途
主要任务
- 数据到文本: 模型应将提供的输入三元组全部且仅以自然语言形式表达。
许可证
- cc-by-nc-4.0: 允许非商业用途的共享和改编,需注明原作者。
数据集创建者
- 主要维护者: Anastasia Shimorina (Université de Lorraine / LORIA, France)
- 贡献者: Claire Gardent (CNRS / LORIA, France), Shashi Narayan (Google, UK), Laura Perez-Beltrachini (University of Edinburgh, UK), Elena Khasanova, Thiago Castro Ferreira (Federal University of Minas Gerais, Brazil)
资金来源
- 法国国家研究机构(ANR)
数据集在GEM中的应用
为何包含在GEM中
- 评估特定生成能力: 由于任务的约束性,该数据集可用于评估非常具体和狭窄的生成能力。
与其他数据集的区别
- 独特的RDF三元组格式: WebNLG的RDF-triple格式是其与其他数据集的主要区别。
GEM特定修改
- 未对数据集内容进行修改: 使用的是数据集的3.0版本。
- 增加了23个特殊测试集: 包括英语和俄语,用于评估模型在不同条件下的表现。




