five

bigbio/mlee|生物医学文本挖掘数据集|自然语言处理数据集

收藏
hugging_face2022-12-22 更新2024-03-04 收录
生物医学文本挖掘
自然语言处理
下载链接:
https://hf-mirror.com/datasets/bigbio/mlee
下载链接
链接失效反馈
资源简介:
MLEE是一个关于血管生成论文摘要的事件抽取语料库,包含手动标注的实体、关系、事件和共指信息。这些标注涵盖了分子、细胞、组织和器官层面的过程。
提供机构:
bigbio
原始信息汇总

数据集概述

基本信息

  • 语言: 英语
  • 许可证: CC BY NC SA 3.0
  • 多语言性: 单语种
  • 数据集名称: MLEE
  • 主页: http://www.nactem.ac.uk/MLEE/
  • 是否公开: 是
  • 是否可在PubMed上访问: 是

任务类型

  • 事件抽取 (EVENT_EXTRACTION)
  • 命名实体识别 (NAMED_ENTITY_RECOGNITION)
  • 关系抽取 (RELATION_EXTRACTION)
  • 共指消解 (COREFERENCE_RESOLUTION)

数据集描述

MLEE是一个事件抽取语料库,包含对关于血管生成论文摘要的手动标注。该数据集涵盖了实体、关系、事件和共指的标注,涉及分子、细胞、组织和器官级别的生物过程。

引用信息

@article{pyysalo2012event, title={Event extraction across multiple levels of biological organization}, author={Pyysalo, Sampo and Ohta, Tomoko and Miwa, Makoto and Cho, Han-Cheol and Tsujii, Junichi and Ananiadou, Sophia}, journal={Bioinformatics}, volume={28}, number={18}, pages={i575--i581}, year={2012}, publisher={Oxford University Press} }

AI搜集汇总
数据集介绍
main_image_url
构建方式
MLEE数据集的构建基于对血管生成领域论文摘要的手动标注,涵盖了分子、细胞、组织和器官层面的过程。该数据集通过详细的标注,包括实体、关系、事件和共指关系,形成了丰富的事件抽取语料库。
特点
MLEE数据集的显著特点在于其多层次的生物组织标注,不仅包括事件抽取,还涉及命名实体识别、关系抽取和共指解析。这些特点使得该数据集在生物医学文本分析中具有广泛的应用潜力。
使用方法
MLEE数据集可用于训练和评估事件抽取、命名实体识别、关系抽取和共指解析等自然语言处理任务的模型。研究者可以通过访问其官方主页获取数据,并根据具体研究需求进行数据处理和模型训练。
背景与挑战
背景概述
MLEE数据集是由英国曼彻斯特大学的Nactem研究小组于2012年创建的,专注于生物医学领域的事件抽取任务。该数据集包含了关于血管生成(angiogenesis)的论文摘要,经过人工标注,涵盖了分子、细胞、组织和器官等多个层次的生物过程。主要研究人员包括Sampo Pyysalo、Tomoko Ohta等,他们的研究旨在解决生物医学文本中复杂事件和实体关系的自动识别问题。MLEE数据集的发布对生物医学信息学领域的事件抽取、命名实体识别、关系抽取和共指消解等任务产生了深远影响,为相关研究提供了宝贵的资源。
当前挑战
MLEE数据集在构建过程中面临的主要挑战包括:首先,生物医学文本的高度专业性和复杂性使得标注工作极为困难,需要具备深厚领域知识的专家进行精细标注。其次,事件抽取任务涉及多个层次的生物过程,如何准确捕捉和表示这些层次间的复杂关系是一个技术难题。此外,数据集中涉及的共指消解任务也极具挑战性,因为生物医学文本中的实体和事件往往具有高度的模糊性和多样性。这些挑战不仅影响了数据集的构建质量,也对后续的模型训练和算法设计提出了高要求。
常用场景
经典使用场景
MLEE数据集在生物医学领域中被广泛应用于事件抽取、命名实体识别、关系抽取和共指消解等任务。其经典使用场景包括从生物医学文献的摘要中自动提取分子、细胞、组织和器官级别的生物过程事件,从而支持生物医学研究中的知识发现和信息整合。
衍生相关工作
基于MLEE数据集,研究者们开发了多种事件抽取和实体识别算法,并在生物医学文本挖掘领域发表了多篇经典论文。这些工作不仅提升了事件抽取技术的准确性和效率,还促进了相关领域的技术交流和合作,形成了丰富的学术成果和技术积累。
数据集最近研究
最新研究方向
在生物医学领域,MLEE数据集因其对血管生成相关文献的深度标注而备受关注。该数据集不仅涵盖了命名实体识别、关系抽取、事件抽取和共指消解等核心任务,还特别强调了分子、细胞、组织和器官等多个生物层次的复杂交互。近年来,随着自然语言处理技术在生物医学文本分析中的广泛应用,MLEE数据集成为研究者探索多层次生物事件关系的前沿工具。其丰富的标注信息为开发更精确的生物事件抽取模型提供了宝贵的资源,推动了生物医学文本挖掘技术的进步,尤其在精准医疗和药物研发领域具有深远的应用价值。
以上内容由AI搜集并总结生成
用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4098个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

ANC

美国国家语料库(American National Corpus,简称ANC)是一个大规模的电子美国英语语料库,包含多种类型文本及口语数据转录,旨在全面反映美国英语的多样性。其开放部分OANC约有1500万字,涵盖多种文体,且进行了自动标注。

anc.org 收录

AISHELL/AISHELL-1

Aishell是一个开源的中文普通话语音语料库,由北京壳壳科技有限公司发布。数据集包含了来自中国不同口音地区的400人的录音,录音在安静的室内环境中使用高保真麦克风进行,并下采样至16kHz。通过专业的语音标注和严格的质量检查,手动转录的准确率超过95%。该数据集免费供学术使用,旨在为语音识别领域的新研究人员提供适量的数据。

hugging_face 收录

Duke Lung Cancer Screening Dataset 2024 (DLCS 2024)

Duke Lung Cancer Screening Dataset 2024 (DLCS 2024) 是一个用于肺癌风险分类研究的数据集,随着低剂量胸部CT筛查项目的普及,该数据集变得越来越重要。

github 收录

PACT (Pairwise Auction Conversation Testbed)

PACT是一个用于语言模型对话议价的基准测试数据集。在每个20轮的匹配中,一个语言模型扮演买家,一个扮演卖家,双方都有隐藏的私有价值。每轮他们交换简短的公共消息,然后发布出价或要价;当出价满足要价时交易达成。数据集包含5000+个1对1游戏,每个游戏20轮,并提供完整的对话日志

github 收录

中国乡镇 GeoJSON 数据

这个数据集包含了中国所有乡镇的地理区域数据,以GeoJSON格式提供。

github 收录