遇见数据集

Agentic Bio-Capabilities Benchmark (ABC-Bench)

收藏
arXiv2026-06-10 更新2026-06-11 收录
数据链接:
官方服务:

资源简介:

ABC-Bench是由SecureBio与Active Site联合创建的智能体生物能力基准测试套件,旨在评估大型语言模型代理在生物安全相关任务中的实际能力。该数据集包含三个核心任务:片段设计、筛选规避和液体处理机器人控制,总计约30个测试样本,数据来源于分子生物学实验模拟与合成生物学设计场景。其创建过程严格遵循七项设计原则,通过算法自动评分和湿实验室验证确保评估的客观性与可重复性。该数据集主要应用于生物安全风险评估与人工智能治理领域,旨在量化AI代理在双用途生物技术任务中的性能,为防范生物恶意滥用提供关键能力测量依据。

ABC-Bench is a benchmark suite for agentic biological capabilities jointly developed by SecureBio and Active Site, designed to evaluate the practical performance of large language model (LLM) agents on biosafety-related tasks. This dataset encompasses three core tasks: fragment design, screening evasion, and liquid-handling robot control, with a total of approximately 30 test samples. The data is derived from molecular biology experiment simulations and synthetic biology design scenarios. Its development strictly adheres to seven design principles, and guarantees the objectivity and reproducibility of the evaluation through automated algorithmic scoring and wet-lab validation. This dataset is primarily utilized in the domains of biosafety risk assessment and AI governance, aiming to quantify the performance of AI agents in dual-use biotechnology tasks and provide a critical capability measurement basis for preventing malicious misuse of biological technologies.

提供机构:
SecureBio; Active Site
创建时间:
2026-06-10
搜集汇总
数据集介绍
Agentic Bio-Capabilities Benchmark (ABC-Bench) 数据集图片
构建方式
在合成生物学与生物安全评估的交汇领域,ABC-Bench的构建遵循了严密的双用途能力度量原则。该基准测试集成了三项具有生物安全相关性的代理任务:片段设计(Fragment Design)、筛选规避(Screening Evasion)以及液体处理机器人(Liquid Handling Robot)。每一项任务均对应获取危险DNA序列潜在途径中的关键步骤。构建过程中,研究者为AI代理提供了包括Python、Bash、生物信息学工具以及网络搜索在内的丰富工具集,并设计了自动化评分机制,通过算法验证代理生成的脚本与方案是否满足预设的生物设计标准。同时,招募了拥有分子生物学博士学位的专家作为人类基线,建立了精确的能力对比参照。
特点
ABC-Bench最具辨识度的特性在于其对AI代理端到端操作能力的深度度量,超越了传统问答式生物基准的局限性。该基准巧妙地将生物安全关切与前沿AI能力评测相融合:它在三个维度上构筑了独特的测试矩阵——既有依赖公开知识与成熟方案的液体处理任务,也有需要创造性解决序列混淆难题的筛选规避任务。值得关注的是,所有被测试的前沿模型在各项任务中均超越了人类专家中位数表现,尤其在与已发表文献高度相关的任务中展现出近乎完美的执行能力,而在需要全新生物信息学推理的创新性任务上则相对薄弱。
使用方法
使用ABC-Bench评估模型时,研究者需要在Inspect AI框架中部署待测LLM代理,并为其配置最大推理预算。每个任务包含最多10个样本,用于测试提示变体或任务细节的微小变化。代理需在沙盒环境中利用提供的工具完成指定操作,最终提交机器可解析的答案。评估采用N=10次独立运行,通过BCa自助法计算95%置信区间以确保统计稳健性。值得注意的是,对于筛选规避任务,研究者需注意提示的设计——既要准确测评模型能力,又要避免信息危害;研究发现前沿模型对此类双用途任务表现出天然的拒绝倾向,这本身也是安全评测的重要维度。
背景与挑战
背景概述
ABC-Bench(Agentic Bio-Capabilities Benchmark)由SecureBio与Active Site的研究团队于2026年创立,旨在系统评估大型语言模型代理在生物安全领域的双用途能力。该基准核心研究问题是:前沿AI代理在涉及分子生物学实验规划、DNA序列设计与合成筛查规避等复杂工具型任务上,能否达到甚至超越人类专家水平。ABC-Bench已被多家顶级AI企业采纳,并写入模型卡作为安全评估指标,对生物安全治理与AI部署决策具有重要影响力。
当前挑战
ABC-Bench面临的核心挑战包括:其一,现有任务评估主要依赖编码能力,难以全面衡量非编码环节如生物推理与实验设计能力;其二,构建过程中需设计可规避核酸合成筛查的隐蔽性任务(如Screening Evasion),同时避免信息危害;其三,人类专家基线数据的收集面临个体差异大、时间成本高(累计175小时)且编程错误频发的困难;其四,前沿模型在该基准上的高拒绝率(部分任务达100%)凸显了安全对齐与能力评估之间的张力。
常用场景
经典使用场景
在人工智能与合成生物学深度融合的背景下,Agentic Bio-Capabilities Benchmark (ABC-Bench) 被设计用于评估大语言模型代理在生物安全相关任务中的自动化操作能力。其经典使用场景聚焦于三大核心任务:设计用于Gibson Assembly的DNA片段、规避核酸合成筛选、以及编写液体处理机器人代码以执行体外DNA组装。这些任务不仅要求模型具备扎实的分子生物学与编程知识,更强调其在多步骤、工具辅助的端到端实验流程中的自主执行能力,为衡量AI在真实生物学研究中的代理能力提供了标准化的测试框架。
实际应用
ABC-Bench 的实际应用场景覆盖了从学术研究到产业安全治理的多个层面。在AI开发领域,多家前沿模型企业已将其集成至模型卡中,作为预发布风险评估的标准组件。在实验室自动化方面,该基准验证了AI代理可生成在OpenTrons液体处理机器人上成功运行的脚本,经湿实验验证实现了完整DNA组装,展示了AI辅助实验操作的巨大潜力。此外,ABC-Bench 为政策制定者提供了量化工具,用于评估AI赋能生物制造的双用风险,进而推动分层访问控制、KYC机制等治理措施的落地,平衡科研加速与安全保障。
衍生相关工作
ABC-Bench 的发布催生了一系列前沿研究工作。在评估方法学上,它启发了更多代理型生物基准的开发,如BixBench专注于生物信息学分析问答,GeneBreaker则探索利用DNA基础模型生成病原样序列,这些工作共同完善了AI生物学能力的评估矩阵。在安全治理领域,基于ABC-Bench的任务设计,研究者提出了针对双用能力的模型遗忘、数据集剔除和后训练校准等缓解措施。此外,该基准促进了合成生物学与AI交叉方向的研究,推动了更鲁棒的核酸合成筛选算法、以及能自动生成实验协议并执行湿实验的全流程AI科学家系统的出现,显著加速了生物发现周期。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务