declare-lab/HyperRED
收藏资源简介:
HyperRED是一个用于超关系抽取任务的数据集,该任务旨在提取关系三元组及其限定符信息,如时间、数量或地点。例如,关系三元组(Leonard Parker, Educated At, Harvard University)可以通过包含限定符(End Time, 1967)来进行事实上的丰富。HyperRED包含44k个句子,62种关系类型和44种限定符类型。数据集结构包括tokens、entities和relations字段,数据实例展示了具体的组织方式。数据集分为训练、验证和测试集,分别包含39,840、1,000和4,000个实例。数据集是通过远程监督和人工注释从Wikipedia和Wikidata构建的。
HyperRED is a dataset for the hyper relation extraction task, which aims to extract relational triplets and their qualifier information such as time, quantity or location. For instance, the relational triplet (Leonard Parker, Educated At, Harvard University) can be factually enriched by adding the qualifier (End Time, 1967). HyperRED contains 44k sentences, 62 relation types and 44 qualifier types. The dataset structure includes fields such as tokens, entities and relations, with specific organizational patterns demonstrated via data instances. The dataset is split into training, validation and test sets, which contain 39,840, 1,000 and 4,000 instances respectively. It is constructed from Wikipedia and Wikidata via distant supervision and manual annotation.
数据集概述:HyperRED
数据集描述
- 名称: HyperRED
- 目的: 用于超关系抽取任务,抽取包含时间、数量或位置等限定信息的关系三元组。
- 规模: 包含44,000个句子,涉及62种关系类型和44种限定类型。
- 语言: 英语。
数据集结构
数据字段
- tokens: 句子文本标记。
- entities: 实体跨度列表,跨度索引对应于空格分隔文本中的每个标记(包括开始和不包括结束索引)。
- relations: 关系列表,每个关系包含头部和尾部实体跨度,以及一个限定列表,每个限定包含值实体跨度和限定标签。
数据实例
示例数据实例展示了句子中的标记、实体和关系及其限定信息。
数据分割
- 训练集: 39,840个实例。
- 验证集: 1,000个实例。
- 测试集: 4,000个实例。
数据集创建
数据集通过维基百科和Wikidata之间的远程监督构建,详细的人工标注过程在相关论文中描述。
引用信息
@inproceedings{chia2022hyperred, title={A Dataset for Hyper-Relational Extraction and a Cube-Filling Approach}, author={Yew Ken Chia, Lidong Bing, Sharifah Mahani Aljunied, Luo Si and Soujanya Poria}, booktitle={Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing}, year={2022} }




