遇见数据集

bioreview-bench

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

BioReview-Bench是一个用于研究已发表生物医学同行评审中记录关注点模式的银标准资源。它是一个经过权利最小化处理的快照,仅包含索引和标签分布,而非自包含的文本基准、公共测试集或公开排行榜。数据集包含两个配置:index(默认配置)提供所有6,940篇文章的稳定ID、DOI/来源元数据、发布日期和模式版本,并记录训练/验证/测试集成员身份;annotations配置提供仅针对训练集和验证集的无文本项目分类标签行,包括关注点分割、类别、严重性和作者立场等字段,这些标签是LLM衍生的银标注。数据规模方面,索引配置包含6,940条无文本文章索引行,标签配置包含93,222条无文本训练/验证标签行,同时有8,647个测试目标被保留。该数据集适用于生物医学文本挖掘、同行评审分析和关注点模式识别等研究任务,但需注意其标注的银标准性质、存在数据重叠问题,并且不应用于新的盲评估或声称隐藏测试的泛化能力。

BioReview-Bench is a silver-standard resource for studying recorded concern patterns in published biomedical peer reviews. It is a rights-minimized snapshot containing only index and label distributions, rather than a self-contained text benchmark, public test set, or public leaderboard. The dataset includes two configurations: index (the default configuration) provides stable IDs, DOI/source metadata, publication dates, pattern versions for all 6,940 articles, and records training/validation/test set membership; the annotations configuration provides classification label rows for text-free items only in the training and validation sets, including fields such as concern segmentation, category, severity, and author stance, with these labels being LLM-derived silver annotations. In terms of data scale, the index configuration contains 6,940 text-free article index rows, the label configuration contains 93,222 text-free training/validation label rows, while 8,647 test targets are reserved. The dataset is suitable for research tasks such as biomedical text mining, peer review analysis, and concern pattern recognition, but it should be noted that its annotations are silver-standard, there are data overlap issues, and it should not be used for new blind evaluations or claims about the generalization ability of hidden tests.

创建时间:
2026-07-24
原始信息汇总

数据集概述

BioReview-Bench v4.1.3 — public index 是一个用于研究已发表生物医学同行评审中关注模式的银标准资源。该数据集是一个最小化权限的快照,主要提供索引和标签分布,不包含完整的文本内容。

  • 语言:英语(en)
  • 许可证:其他(other),项目创建注释采用 CC BY-NC 4.0,代码采用 Apache-2.0
  • 标签:同行评审、生物医学、基准测试、元数据、银标准
  • 规模
    • 6,940 条无文本的文章索引行
    • 93,222 条无文本的训练/验证标签行
    • 8,647 个隐藏的测试目标

数据集结构与配置

数据集包含两个配置(Configs):

  • index(默认):包含所有 6,940 篇文章的稳定 ID、DOI/来源元数据、发布日期和模式版本。Hugging Face 的 split 名称记录训练/验证/测试的成员身份。

    • 数据文件路径:data/index/train.jsonldata/index/validation.jsonldata/index/test.jsonl
    • 样本数量:训练集 5,387、验证集 953、测试集 600
  • annotations:包含项目创建的无文本分类标签行,仅提供训练集和验证集。稳定的关注 ID 可能保留来源本地的评审序号(如 R1),但这些序号不标识具体人物。

    • 数据文件路径:data/annotations/train.jsonldata/annotations/validation.jsonl
    • 样本数量:训练集 79,121、验证集 14,101

重要声明与限制

  • 标签来源:关注点分割、类别、严重性和作者立场字段均为 LLM 衍生的银标准注释,非专家裁定的科学事实。
  • 评分说明:使用的冻结评分基于未适配的 allenai/specter2_base 检查点,采用自动均值池化,没有记录任务适配器或检查点修订版。该历史包装器及其 0.65 阈值尚未完成独立人工验证。发布的评分为临时性和依赖匹配器的结果。
  • 数据重叠:F1000 DOI-stem 审计发现存在跨数据集的家族重叠,开发数据与 F1000 测试文章有 49/150 的重叠。
  • 测试集性质:索引发布了测试集成员身份以及稳定的文章 ID 和 DOI。由于来源同行评审可公开检索,隐藏目标行不构成秘密或盲测。不应用于新的盲评估或声称隐藏测试泛化。
  • author_stance 字段:描述 LLM 衍生的响应对齐标签,全语料库中 91.1% 为 no_response。不得解释为文章质量、评审者有效性或科学关注点是否客观正确。

公开发布边界

此快照明确排除以下内容:标题、摘要、文章正文、标准化关注文本、原始评审/决策文本、原始作者回复、评审者/数据行名称/邮箱、明确身份字段、内部追踪痕迹以及所有测试目标标签。发布材料需从 DOI/来源记录处按原出版者条款获取。

加载示例

python from datasets import load_dataset

index = load_dataset("jang1563/bioreview-bench", "index", revision="v4.1.3") labels = load_dataset("jang1563/bioreview-bench", "annotations", revision="v4.1.3")

许可与文档

搜集汇总
数据集介绍
bioreview-bench 数据集图片
构建方式
BioReview-Bench致力于构建一个用于研究生物医学同行评审中关注模式的标准基准资源。该数据集以最小化权利为原则,仅发布文章索引与标签分布,不包含任何文本内容。其构建依托于大规模语言模型生成的银标准注释,涵盖关注点的分割、类别、严重程度及作者立场等字段。数据被划分为索引(index)和注释(annotations)两个配置,前者包含6940篇文章的稳定标识符、DOI元数据及时间戳,后者则提供训练集与验证集的93222条无文本标签记录,测试集标签则被完全保留。所有数据均通过Hugging Face数据集库发布,并严格排除了原始审稿文本、作者回应、身份信息及手稿文件,以确保隐私与版权合规。
使用方法
数据集的使用需通过Hugging Face的datasets库进行加载,用户可通过指定配置名称('index'或'annotations')及版本标签(如'v4.1.3')获取相应数据。由于数据集中不包含任何文本内容,实际应用需结合原始出版材料,用户需自行从DOI/源记录处获取。评估过程不提供公开的测试服务,用户需获得授权的本地全模式副本后方可使用评估命令行接口。数据集附带详尽的使用文档,包括数据集说明、评估协议、限制与伦理探讨等,指导用户在严格遵守版权与隐私要求的前提下,专注于生物医学同行评审关注模式的分类与分析任务。
背景与挑战
背景概述
在生物医学出版领域,同行评审是保障科学质量的核心机制,然而对评审意见中蕴含的问题模式的系统化研究长期受限于缺乏大规模、结构化的标注数据。BioReview-Bench数据集由研究团队于2024年创建(基于HuggingFace发布记录),旨在构建一个银标准(silver-standard)资源,用于探究已发表生物医学同行评审中的关注点模式。该数据集包含6,940篇文献索引和93,222条标注标签,覆盖训练、验证与测试划分,其设计遵循最小化权利冲突原则,仅发布元数据与标签分布,而隐藏原始评审文本与作者身份信息。作为生物医学文本挖掘与科学质量评估领域的重要基准,它填补了从非结构化评审文本中提炼可计算知识的空白,为后续研究提供了可复现的评估平台,并已引发对评审分析指标可靠性的深入讨论。
当前挑战
该数据集所解决的领域核心挑战在于如何从海量、非结构化的生物医学同行评审中自动识别并分类关注点模式,以支持科学质量评估的系统化,但评审文本的领域特异性、评价标准的模糊性以及多源评审者的主观差异使得传统规则方法难以有效泛化。构建过程中面临的艰巨挑战包括:其一,标注质量依赖于大型语言模型生成的银标准注释,而非专家裁定,可能导致分类边界不精确且缺乏科学真值;其二,数据集因法律与伦理限制刻意排除原文,使得外部验证与文本级分析受阻;其三,测试集易通过公开DOI检索获取原始评审,无法保证盲评的保密性与泛化性能评估的严谨性;其四,冻结的历史评分基于未调优的嵌入模型与固定阈值,缺乏独立人工验证,使得性能指标具有临时性和匹配器依赖性。
常用场景
经典使用场景
在生物医学学术出版领域,同行评议是保障研究质量的核心环节,深入理解评议过程中专家提出的关切模式对改进审稿流程至关重要。BioReview-Bench数据集以已发表的生物医学同行评议为基石,精心构建了一个包含元数据和标签分布的无文本索引,为研究者提供了分析评议中关切类型、严重程度及作者立场等维度的珍贵资源。该数据集最常见的应用场景是作为基准测试框架,用于训练和评估自然语言处理模型在识别、分类和解析评议文本中复杂关切模式的能力,推动自动化审稿辅助工具的发展。
解决学术问题
学术研究中,同行评议数据因隐私限制和文本复杂性而难以系统化利用,导致对评议模式的理解多停留在定性层面。BioReview-Bench通过提供大规模、结构化的银标准标签,解决了评议数据的可计算化难题,使得研究者能够定量探索关切分布规律、评估不同评议维度的关联性。该数据集的发布深刻影响了计算语言学与科学生态学的交叉研究,为揭示审稿偏见、优化评议标准、提升学术交流透明度提供了数据基础,同时也为验证大语言模型在科学文本理解中的可靠性设立了严谨的评估框架。
实际应用
实际应用中,BioReview-Bench的价值体现在构建智能化的学术出版辅助系统上。期刊编辑部可利用基于该数据集训练的模型自动筛选稿件中潜在的关切点,提醒编辑关注关键评议维度;审稿人能够借助工具获得实时反馈,提升评议的全面性和一致性。此外,研究机构和管理部门可运用其分析结果监测特定学科或期刊的审稿倾向,为政策制定提供实证依据,从而推动整个生物医学出版生态向更高效、更公正的方向演进。
数据集最近研究
最新研究方向
BioReview-Bench作为生物医学同行评审领域的银标准基准,当前研究前沿聚焦于利用大规模语言模型对评审意见进行细粒度语义解析与质量评估。该数据集通过构建包含近七千篇论文元数据和九万余条标注标签的索引体系,揭示了评审过程中关注模式的深层结构,为自动化评审辅助系统提供了关键的训练与验证资源。其核心创新在于采用LLM派生注释对评审意见进行关切分割、类别划分、严重程度及作者立场标注,尽管这些银标准注释尚待独立人工验证,但已为评审人行为分析和稿件质量预测开辟了新路径。特别值得注意的是,该类基准面临的数据重叠与家族交叉问题通过精确的测量审计得到了量化评估,为后续构建更严谨的盲测环境奠定了方法论基础。这一研究不仅推动了同行评审过程的量化研究,也为学术出版领域的透明度和可重复性建设提供了重要支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务