EMBO/BLURB
收藏资源简介:
BLURB(生物医学语言理解与推理基准)是一个用于生物医学自然语言处理的资源集合。它包含13个公开可用的数据集,涵盖6种不同的任务,如命名实体识别(NER)、关系抽取、句子相似度、文本分类和问答等。BLURB的目标是通过提供一个广泛的基准和排行榜,降低生物医学NLP的入门门槛,并加速这一重要领域的进展。数据集中的所有数据均由生物医学领域的专家标注,涵盖了从PubMed等来源的生物医学文本。
BLURB (Biomedical Language Understanding and Reasoning Benchmark) is a curated collection of resources for biomedical natural language processing. It encompasses 13 publicly available datasets covering 6 distinct task types, namely Named Entity Recognition (NER), Relation Extraction, Sentence Similarity, Text Classification, and Question Answering. The primary goal of BLURB is to lower the barrier to entry for biomedical NLP research and accelerate advancements in this critical domain by providing a comprehensive benchmark and associated leaderboard. All datasets are annotated by biomedical domain experts, with the corpus covering biomedical texts sourced from platforms including PubMed and other similar academic repositories.
BLURB (Biomedical Language Understanding and Reasoning Benchmark) 数据集概述
数据集描述
数据集摘要
BLURB 是一个专注于生物医学自然语言处理(NLP)的资源集合。该数据集包括十三个公开可用的数据集,涵盖六个不同的任务,旨在通过一个广泛的基准来加速生物医学预训练策略和特定任务方法的进步。BLURB 的主要目标是降低生物医学 NLP 的入门门槛,并帮助加速这一对社会和人类具有重要意义的领域的进步。
支持的任务和排行榜
BLURB 支持的任务包括:
- 问答
- 令牌分类
- 句子相似性
- 文本分类
具体任务包括:
- 封闭领域问答
- 命名实体识别
- 解析
- 语义相似性评分
- 文本评分
- 主题分类
语言
数据集主要使用英语。
数据集结构
数据实例
数据集包含多种任务的数据实例,包括命名实体识别(NER)、PICO、关系抽取、句子相似性、文档分类和问答。
数据字段
- NER: 包含
id、ner_tags和tokens。 - Sentence Similarity: 包含
sentence 1、sentence 2和score。 - Question Answering (PubMedQA): 包含
pubid、question、context、long_answer和final_decision。
数据分割
数据集根据不同任务被分割为训练集、开发集和测试集。
数据集创建
来源数据
数据集的来源主要是原始数据。
注释
所有数据集的注释均由生物医学领域的专家生成。
个人和敏感信息
数据集中不包含个人和敏感信息。
使用数据的考虑
社会影响
BLURB 旨在通过提供一个全面的基准来加速生物医学 NLP 领域的进步,对社会和人类具有积极影响。
偏见讨论
数据集的创建和注释过程中,由专家进行,以确保数据的质量和准确性。
其他已知限制
数据集的具体限制和挑战需要在实际应用中进一步评估。
附加信息
数据集管理员
数据集的管理和维护由专家团队负责。
许可信息
数据集遵循 Apache-2.0 许可证。
贡献
数据集的贡献者包括生物医学领域的专家和研究人员。




