Annotated Semantic Relationships Datasets
收藏资源简介:
该仓库包含多个标注的语义关系数据集,用于训练监督模型进行语义关系提取。数据集分为传统信息提取、开放信息提取和远距离监督三个类别,涵盖英语和葡萄牙语。
This repository contains multiple annotated semantic relation datasets designed for training supervised models in semantic relation extraction. The datasets are categorized into three types: traditional information extraction, open information extraction, and distant supervision, covering both English and Portuguese languages.
数据集概述
本数据集包含多个用于训练监督模型的语义关系提取的标注数据集,分为三个主要类别:传统信息提取、开放信息提取和远监督。
传统信息提取
-
DBpediaRelations-PT
- 数据集: DBpediaRelations-PT-0.2.txt.bz2
- 引用: Exploring DBpedia and Wikipedia for Portuguese Semantic Relationship Extraction
- 描述: 从DBPedia提取的葡萄牙语句子集合,表达实体间的语义关系。
-
AImed
- 数据集: aimed.tar.gz
- 引用: Subsequence Kernels for Relation Extraction
- 描述: 包含225篇Medline摘要,其中200篇描述人类蛋白质间的相互作用。
-
SemEval 2007
- 数据集: SemEval2007-Task4.tar.gz
- 引用: SemEval-2007 Task 04: Classification of Semantic Relations between Nominals
- 描述: 包含7种关系类型,共1,529个标注示例。
-
SemEval 2010
- 数据集: SemEval2010_task8_all_data.tar.gz
- 引用: SemEval-2010 Task 8: Multi-Way Classification of Semantic Relations Between Pairs of Nominals
- 描述: 包含10,717个标注示例,用于多路分类任务。
-
ReRelEM
- 数据集: ReRelEM.tar.gz
- 引用: Relation detection between named entities: report of a shared task
- 描述: 首个葡萄牙语实体关系检测评估竞赛。
-
Wikipedia
- 数据集: wikipedia_datav1.0.tar.gz
- 引用: Integrating Probabilistic Extraction Models and Data Mining to Discover Relations and Patterns in Text
- 描述: 从Wikipedia抽取的1127个段落,标注了4701个关系实例。
-
Web
- 数据集: hlt-naacl08-data.txt
- 引用: Learning to Extract Relations from the Web using Minimal Supervision
- 描述: 从网络抽取的企业收购对和个人出生地对。
-
BioNLP Shared Task
- 数据集: BioNLP.tar.gz
- 引用: Overview of BioNLP Shared Task 2011
- 描述: 涉及识别蛋白质成分和亚单位复合物之间的关系。
-
The DDI corpus
- 数据集: DDICorpus2013.zip
- 引用: The DDI corpus: An annotated corpus with pharmacological substances and drug–drug interactions
- 描述: 包含药物-药物相互作用的MedLine摘要和DrugBank文档。
-
ADE-V2
- 数据集: ADE-Corpus-V2.zip
- 引用: Development of a benchmark corpus to support the automatic extraction of drug-related adverse effects from medical case reports
- 描述: 用于自动提取药物相关不良反应的系统标注语料库。
-
KBP-37
- 数据集: kbp37-master.zip
- 引用: Relation Classification via Recurrent Neural Network
- 描述: 对MIML-RE标注数据集的修订,包含33,811个标注句子。
开放信息提取
-
ReVerb
- 数据集: reverb_emnlp2011_data.tar.gz
- 引用: Identifying Relations for Open Information Extraction
- 描述: 从网络随机链接服务抽取的500个句子。
-
ClausIE
- 数据集: ClausIE-datasets.tar.gz
- 引用: ClausIE: Clause-Based Open Information Extraction
- 描述: 包含来自Reverb、Wikipedia和纽约时报的句子,用于评估开放信息提取。
-
Effectiveness and Efficiency of Open Relation Extraction
- 数据集: emnlp13_ualberta_experiments_v2.zip
- 引用: Effectiveness and Efficiency of Open Relation Extraction
- 描述: 包含WEB-500、NYT-500和PENN-100三个子数据集,用于评估开放关系提取的效果和效率。
-
Extracting Relation descriptors with Conditional Random Fields
- 数据集: DataSet-IJCNLP2011.tar.gz
- 引用: Extracting Relation descriptors with Conditional Random Fields
- 描述: 包含来自纽约时报和Wikipedia的句子,用于提取关系描述符。
远监督
-
NYT dataset
- 数据集: http://iesl.cs.umass.edu/riedel/ecml/
- 引用: Modeling Relations and Their Mentions without Labeled Text
- 描述: 通过将Freebase关系与纽约时报语料库对齐生成的数据集。
-
Googles relation-extraction-corpus
-
PGR Corpus
- 数据集: PGR.zip
- 引用: A Silver Standard Corpus of Human Phenotype-Gene Relations
- 描述: 包含人类表型-基因关系的银标准语料库。
-
PGR-crowd Corpus
- 数据集: PGR-crowd.zip
- 引用: A hybrid approach toward biomedical relation extraction training corpora: combining distant supervision with crowdsourcing
- 描述: 结合远监督和众包方法生成的生物医学关系提取训练语料库。




