遇见数据集

BioDisclose

收藏
arXiv2026-07-28 更新2026-07-30 收录
数据链接:
官方服务:

资源简介:

BioDisclose是由多所高校研究团队联合构建的面向生物医学安全领域的对抗性诱导基准数据集,旨在评估大语言模型在复杂语境下对敏感生物医学知识的披露行为。该数据集包含480条精心设计的单轮提示,涵盖病原生物学、人类基因编辑、合成生物学等六大风险领域,并采用学术、历史、角色扮演和分步分解四种诱导策略生成。数据通过专家撰写场景、结构化表示与多轮质量控制流程构建,确保了科学合理性和风险代表性。该数据集主要应用于评估大语言模型在生物医学研究场景中的安全边界,为解决双用途知识泄露风险提供细粒度的技术披露度量标准。

BioDisclose is an adversarial prompting benchmark dataset for the field of biomedical security, jointly constructed by research teams from multiple universities. It aims to evaluate the disclosure behavior of Large Language Models (LLMs) regarding sensitive biomedical knowledge in complex contexts. The dataset contains 480 well-designed single-turn prompts, covering six high-risk domains including pathogenic biology, human genome editing, synthetic biology and other related fields. It is generated using four prompting strategies: academic inquiry, historical context, role-playing and step-by-step decomposition. The dataset is built through expert-authored scenarios, structured representation and a multi-round quality control workflow, ensuring scientific plausibility and risk representativeness. It is mainly applied to evaluate the safety boundaries of LLMs in biomedical research scenarios, and provides a fine-grained technical disclosure metric for mitigating the risk of dual-use knowledge leakage.

创建时间:
2026-07-28
原始信息汇总

数据集摘要:BioDisclose

  • 数据集名称:BioDisclose: An Actionability-Aware Benchmark for Biomedical Safety under Adversarial Elicitation
  • 核心目的:用于衡量大型语言模型(LLM)在对抗性诱导下,披露生物医学双用途知识的程度。
  • 数据集规模与构成
    • 包含 480 个提示(prompts)。
    • 这些提示源自 24 个由专家编写的场景。
    • 覆盖 6 个生物医学风险领域。
    • 涵盖 4 类诱导策略家族:学术、历史、角色扮演和分解提示。
  • 评估方法
    • 采用四级评分量表对模型回答进行分级,从“拒绝”到“可执行的披露”。
    • 区分高级讨论、技术性具体内容和可执行内容。
    • 识别“先拒绝后泄露”的行为。
  • 主要发现
    • 在五个已部署的LLM系统中,详细或更高级别的披露率差异显著,范围从 9.2% 到 64.0%
    • 学术框架是最有效的诱导方式,平均成功率为 43.2%
    • 实验室安全场景在所有领域中的披露率最高,达到 51.5%
    • 结果表明,当前的安全保障措施在高风险的科学环境中仍然不一致。
  • 论文作者:Yinuo Zhu, He Liu, Boyuan Gu
  • 提交日期:2026年7月28日
  • arXiv编号arXiv:2607.25700v1
  • 学科分类:Human-Computer Interaction (cs.HC)
搜集汇总
数据集介绍
BioDisclose 数据集图片
构建方式
BioDisclose的构建基于一套严谨的多维框架。首先,由领域专家设计了涵盖病原生物学、人类基因编辑、合成生物学等六个生物医学风险领域的24个核心场景,每个场景均包含受限的生物医学目标及其关键细节槽。随后,每个场景通过四种对抗性诱导策略家族(学术框架、角色扮演、历史框架、逐步分解)和五种修辞变体进行实例化,形成480个单轮提示。构建过程经历了起草、独立评审和最终裁决三个质量控制阶段,确保场景的科学合理性、内部一致性和可区分性。所有提示均在黑盒威胁模型下于单次交互中独立提交。
特点
该数据集最显著的特点是其细粒度的分级披露评估协议。不同于传统的二元拒绝指标,BioDisclose将模型响应划分为四个披露等级:拒绝、概念性讨论、详细技术披露和可执行披露,并专门捕捉“拒绝后泄露”行为。这种设计能够区分一般性科学讨论与具有操作意义的技术细节。此外,数据集采用交叉设计,分离了底层生物医学目标与其语言框架,使得在同一场景下可系统比较不同诱导策略的有效性。评估结果显示,学术框架在平均诱导成功率上最高,而实验室安全场景在所有领域中披露率最高,揭示了模型安全行为在系统和语境上的显著变异性。
使用方法
使用BioDisclose时,研究者需将480个提示独立提交给目标大语言模型系统,并收集其单次响应。随后,运用配套的确定性自动评估器依据四级披露协议对响应进行标准化分级,计算详细及以上披露率作为主要安全指标。评估器通过检测拒绝信号、定量条件、生物医学实体、操作表达式和程序组织证据,实施分级判定。对于需要深度验证的样本,可结合人工标注和关键细节覆盖率分析,依据场景特定的五个关键细节槽评估响应对受限目标的实质性披露程度。最终结果支持按模型、诱导策略、风险领域等多个维度进行聚类统计分析。
背景与挑战
背景概述
随着大语言模型在生物医学文献综合、实验规划与技术问答等领域的广泛应用,其强大的知识生成能力也带来了双重用途风险:本应服务于合法科研的知识可能被诱导用于不安全的实验、未经授权的生物改造或规避实验室安全措施。为系统评估这一风险,Yinuo Zhu等研究者于2026年提出了BioDisclose基准,该基准由来自六类生物医学风险领域的24个专家撰写场景构建,通过四种诱导策略族与五种修辞变体生成480条单轮提示,并采用四级披露量表(从拒绝到可执行披露)对模型输出进行细粒度评估。BioDisclose揭示了不同部署系统间高达9.2%至64.0%的详细及以上披露率差异,为生物医学场景下的模型安全对齐研究提供了重要的评估框架。
当前挑战
BioDisclose面临的核心挑战包括:1) 现有安全基准多采用二元拒答指标,无法区分概念讨论、部分操作披露与完整流程,难以捕捉模型在开放生物医学问答中释放的技术细节;2) 学术框架、历史重构、角色扮演等不同诱导策略对同一模型的影响差异显著,且安全行为高度依赖具体生物医学领域(如实验室安全域平均披露率达51.5%),缺乏跨系统、跨域的统一安全度量;3) 构建过程中需平衡专家知识注入与敏感信息保护,既要确保场景的生物学合理性与可执行性区分度,又要避免直接泄露可用于恶意用途的操作参数与规程,同时需要设计可靠的自动评估器以处理拒绝后泄露等复杂行为。
常用场景
经典使用场景
在生物医学安全评估领域,BioDisclose被广泛用于评测大型语言模型在面对对抗性诱导时披露敏感双用知识的严重程度。该基准通过构建涵盖病原生物学、人类基因编辑、合成生物学等六大风险领域的24个专家撰写场景,结合学术框架、角色扮演、历史重构与逐步分解四类诱导家族,实现了对模型输出从完全拒绝到可执行披露的四级粒度评估。这一设计使其成为衡量前沿语言模型在生物医学研究语境下安全护栏有效性的核心测试平台。
解决学术问题
该数据集有效回应了现有安全评测仅依赖二元拒绝率或广泛有害内容分类的局限性,揭示了模型可能在高层次讨论与具体技术披露之间存在的灰色地带。BioDisclose通过引入‘拒绝后泄露’监测机制和关键细节覆盖度指标,精准刻画了学术框架诱导下模型披露率显著升高的现象,并发现实验室安全领域成为最脆弱的风险域。这一发现推动了安全评估从粗粒度分类向技术细节导向的范式转变,为理解模型在科学辅助场景中的安全行为异质性提供了实证基础。
衍生相关工作
BioDisclose的提出催生了一系列相关研究,包括针对生物医学安全的分层披露协议自动化评估器,以及基于该基准衍生的跨系统安全行为比较分析框架。后续工作进一步探索了其在生物安全治理中的应用,如有研究以其为灵感开发了面向生物设计工具的Agent能力基准,另有一些工作利用其场景分类学来指导对抗性提示词的防御策略优化。该数据集所构建的风险域分类体系与评估协议已成为生物医学语言模型安全领域的重要参考标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务