相关数据集
NYT-10
NYT-10数据集是一个用于关系抽取任务的数据集,包含从《纽约时报》(The New York Times)中提取的实体和它们之间的关系。该数据集主要用于自然语言处理和信息抽取领域的研究。
iesl.cs.umass.edu4460
stefan-it/co-funer
--- license: mit task_categories: - token-classification language: - de --- # CO-Fun: A German Dataset on Company Outsourcing in Fund Prospectuses for Named Entity Recognition and Relation Extraction
Hugging Face2024-03-25 更新340
DFKI-SLT/cross_re
CrossRE 是一个跨领域的关系抽取数据集,包含六个不同的文本领域:新闻、政治、自然科学、音乐、文学和人工智能。该数据集包含多标签注释,并基于 CrossNER 数据集构建。它涵盖了这六个领域的 17 种关系标签。数据集为英文,适用于文本分类任务,特别是多类分类。README 文件还提供了每个领域的数据实例、数据字段和数据分割的示例。
Hugging Face2023-01-19 更新330
DocRED
DocRED(Document-Level Relation Extraction Dataset)是由维基百科和维基数据构建的关系提取数据集。数据集中的每个文档都使用命名实体提及、共指信息、句内和句间关系以及支持证据进行人工注释。 DocRED 需要阅读文档中的多个句子来提取实体并通过综合文档的所有信息来推断它们的关系。除了人工注释的数据,该数据集还提供了大规模的远程监督数据。 DocRED 包
OpenDataLab2026-07-12 更新2710
MultiTACRED
MultiTACRED数据集是TACRED数据集的多语言版本,由德国人工智能研究中心创建,包含12种语言,覆盖9个语系,总计约106,000个句子。该数据集通过机器翻译TACRED实例并自动投影实体标注创建,旨在促进多语言关系抽取的研究。数据集涵盖多种语言现象,如复合词、屈折变化和代词省略,适用于多语言模型训练和跨语言学习场景。
arXiv2023-05-15 更新330



