官方服务:
资源简介:
NLP Medications
应用场景:
创建时间:
2014-03-13
相关数据集
OPIEC
OPIEC是一个从英文维基百科全文中提取的大型开放信息抽取语料库,由德国曼海姆大学创建。该数据集包含超过3.4亿个三元组,是迄今为止公开可用的最大的OIE语料库。OPIEC不仅数据量大,还包含丰富的元数据信息,如来源信息、置信度评分、语言标注和语义标注,包括空间和时间信息。这些数据对于下游任务如知识库构建、开放式问答或事件模式归纳非常有价值。OPIEC的创建过程涉及使用Stanford CoreN
arXiv2019-04-28 更新380
BenchIEFL
BenchIEFL是由蒙特利尔大学的RALI实验室创建的一个用于开放信息抽取(OIE)的新基准数据集。该数据集通过重新注释BenchIE数据集,修正了常见错误和不一致性,提高了注释的精确性和相关性。BenchIEFL包含新的匹配函数,能更灵活地捕捉有效抽取,从而产生更公平的系统评估排名。数据集主要用于评估OIE系统在下游任务中的性能,如问答和文本理解,旨在通过提供更高质量的基准来推动OIE技术的发
arXiv2024-07-24 更新100
flammenai/Phoenix-SFT-v1
Phoenix v1 — 记忆提取数据集是一个用于生成结构化记忆数据的合成数据集,旨在支持AI角色(称为“Flame”)在异步对话中的长期连续性。数据集包含多种语言的对话转录,任务是将这些对话转换为结构化的JSON记忆列表。记忆分为多个类别,如事实、偏好、关系、事件和情感。数据集分为训练集(1728个示例)和评估集(170个示例),并详细描述了数据的生成流程、质量控制机制和局限性。
Hugging Face2026-05-09 更新80
pie/brat
BRAT数据集是一个用于自然语言处理任务的数据集,提供了两种变体:`default`和`merge_fragmented_spans`。`default`变体使用`BratDocument`文档类型,包含`LabeledMultiSpan`注释;`merge_fragmented_spans`变体使用`BratDocumentWithMergedSpans`文档类型,将分散的`LabeledMul
Hugging Face2024-01-03 更新210



