DocRED
收藏资源简介:
DocRED(Document-Level Relation Extraction Dataset)是由维基百科和维基数据构建的关系提取数据集。数据集中的每个文档都使用命名实体提及、共指信息、句内和句间关系以及支持证据进行人工注释。 DocRED 需要阅读文档中的多个句子来提取实体并通过综合文档的所有信息来推断它们的关系。除了人工注释的数据,该数据集还提供了大规模的远程监督数据。 DocRED 包含 132,375 个实体和 56,354 个关系事实,在 5,053 个 Wikipedia 文档上进行了注释。除了人工注释的数据外,该数据集还提供了超过 101,873 个文档的大规模远程监督数据。
DocRED (Document-Level Relation Extraction Dataset) is a relation extraction dataset constructed from Wikipedia and Wikidata. Each document in the dataset is manually annotated with named entity mentions, coreference information, intra-sentence and inter-sentence relations, and supporting evidence. DocRED requires reading multiple sentences within a single document to extract entities and infer their relational connections by synthesizing all contextual information from the document. In addition to the manually annotated data, this dataset also provides large-scale distant supervision data. DocRED contains 132,375 entities and 56,354 relational facts, which are annotated on 5,053 Wikipedia documents. Besides the manually annotated data, the dataset also offers large-scale distant supervision data covering over 101,873 documents.

- DocRED首次发表于ACL 2019会议,作为一个大规模的文档级关系抽取数据集,旨在推动自然语言处理领域的发展。
- DocRED被广泛应用于多个研究项目中,成为评估文档级关系抽取模型性能的标准数据集之一。
- DocRED的扩展版本发布,增加了更多的文档和关系实例,进一步丰富了数据集的内容和多样性。
- DocRED在多个国际竞赛中被用作基准数据集,推动了文档级关系抽取技术的快速发展和创新。
- 1DocRED: A Large-Scale Document-Level Relation Extraction DatasetTsinghua University, University of Washington, Alibaba Group · 2019年
- 2Document-Level Relation Extraction with Adaptive Thresholding and Localized Context PoolingUniversity of California, Berkeley · 2021年
- 3Coreferential Reasoning Learning for Language RepresentationTsinghua University, Alibaba Group · 2020年
- 4Entity and Evidence Guided Relation Extraction for DocREDUniversity of California, Berkeley · 2020年
- 5A Supervised Multi-Head Self-Attention Network for Nested Named Entity RecognitionTsinghua University, Alibaba Group · 2021年



