遇见数据集

lifesci-harbor-bench

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

LifeSci-Harbor-Bench 是一个用于评估智能体在生命科学领域(特别是衰老/长寿/健康跨度)进行开放性研究任务能力的基准测试数据集。该数据集包含 300 个超长时域、开放式的研究任务,每个任务都源自真实的科学文献、临床试验和公共数据库,并通过一个 6 层确定性验证器加上可选的 LLM 评判(包含评分标准、声明验证、幻觉检测和认知陷阱)进行评分。任务没有固定答案,而是评估研究质量、方法论严谨性和可重复性。数据集涵盖 27 个领域,包括 14 个原始领域(如生物钟、心血管、细胞衰老、表观遗传学等)、8 个跨学科领域(如合成生物学与衰老、AI/ML 与生命科学等)和 5 个前沿领域(如 AI+实验室自动化、空间组学与衰老、衰老时钟与临床、微生物组与代谢与衰老、AI 药物设计与长寿)。每个任务遵循 Harbor 格式,包含指令、环境数据、参考框架和测试模块。验证方法包括 7 层:确定性检查、细粒度评分标准、声明验证、幻觉检测、认知陷阱、RSI 迭代和 LLM 评判。数据集规模为 300 个样本,每个样本包含 task_id、domain 和 instruction 字段,总大小约 6.3 MB。该基准适用于评估和提升编码智能体在真实生命科学研究中的深度推理、跨学科整合和过程质量把控能力。

LifeSci-Harbor-Bench is a benchmark dataset for evaluating the ability of agents to conduct open-ended research tasks in the life sciences, particularly in the areas of aging, longevity, and healthspan. It contains 300 ultra-long-horizon, open-ended research tasks, each derived from real scientific literature, clinical trials, and public databases, and scored through a 6-layer deterministic verifier with an optional LLM judge (including scoring rubrics, claim verification, hallucination detection, and cognitive pitfalls). Tasks have no fixed answers but evaluate research quality, methodological rigor, and reproducibility. The dataset covers 27 domains, including 14 original domains (e.g., circadian rhythm, cardiovascular, cellular senescence, epigenetics, etc.), 8 interdisciplinary domains (e.g., synthetic biology and aging, AI/ML and life sciences, etc.), and 5 frontier domains (e.g., AI + lab automation, spatial omics and aging, aging clocks and clinical, microbiome and metabolism and aging, AI drug design and longevity). Each task follows the Harbor format, containing instructions, environmental data, reference frameworks, and test modules. The verification method includes 7 layers: deterministic checks, fine-grained scoring rubrics, claim verification, hallucination detection, cognitive pitfalls, RSI iteration, and LLM evaluation. The dataset comprises 300 samples, each with task_id, domain, and instruction fields, with a total size of approximately 6.3 MB. This benchmark is suitable for evaluating and improving coding agents deep reasoning, interdisciplinary integration, and process quality control in real-world life science research.

创建时间:
2026-09-06
原始信息汇总

LifeSci-Harbor-Bench 数据集总结

数据集简介

LifeSci-Harbor-Bench 是一个用于评估编码代理(coding agents)在生命科学领域真实、可计算验证(dry-lab)研究中的表现的数据集,包含 500 个超长周期、开放式的研究任务,重点聚焦于**衰老/长寿/健康寿命(aging/longevity/healthspan)**领域。

核心特点

  • 无固定答案:任务评估研究质量、方法论严谨性和可复现性,而非某个具体数值是否正确。
  • 任务来源:每个任务均基于真实科学文献、临床试验和公共数据库,自包含且可独立运行。
  • 评分体系:采用 v4.0 11层验证器(6层F1评分 + 5层F2反黑客),可选集成 LLM 评审(包含评分标准、声明验证、幻觉检测、认知陷阱和 HARBOR-Synth 反黑客门控)。

版本更新要点

  • v4.0:任务数从 300 扩展至 500,新增 200 个开放研究任务和 2 个前沿领域(ai-protein-design-longevityorganoid-aging-high-throughput),并引入 5层F2反黑客框架(包括结构隔离、行为对比轨迹编码、语义HackDetect协议审计、静默完成击杀、关键节点遵从)。
  • v3.0:任务数从 200 扩展至 300,新增工具依赖图、难度分布、隐藏夹具、干扰数据集等特性。
  • v2.0:任务数从 100 扩展至 200,新增 100 个跨学科任务,覆盖 8 个新领域。

关键数据统计

指标 数值
总任务数 500(100原始 + 100 v2.0跨学科 + 100 v3.0前沿 + 200 v4.0开放研究)
领域数 29(14原始 + 8 v2.0跨学科 + 5 v3.0前沿 + 2 v4.0前沿)
引用真实论文(DOI/PMID) 5,000+
真实临床试验(NCT) 1,500+
真实数据库引用 2,000+
平均预估工作量 140小时(v4.0范围100–200)
验证层数 6个F1确定性 + 5个F2反黑客 + 1个LLM评审
每个任务的认知陷阱数 3–5个
v3.0每个任务的隐藏夹具数 4个
v3.0工具依赖深度 6–8个链式步骤

任务结构(Harbor格式)

每个任务包含:

  • instruction.md — 任务指令(代理唯一可见文本)
  • environment/data/DATA_SOURCES.md — 真实数据下载说明
  • reference/pipeline.py — 研究框架骨架
  • tests/verify.py — v4.0 11层验证器
  • tests/llm_judge.py — LLM评审模块
  • tests/expert_guidance.json — 专家评估标准
  • tests/fixtures/task_config.json — 任务元数据和真实来源可追溯性

验证方法

F1评分栈

权重 检查内容
1. 确定性 30% 交付物存在性、代码语法、手稿结构、引用、数据输出
2. 细粒度标准 25% 10个强制+8个可选+3个负面标准,三元评分
3. 声明验证 15% 事实声明有邻近引用支持
4. 幻觉检测 15% 伪造数据、虚假引用、“数据未显示”超过3次等→红旗
5. 认知陷阱 10% 识别并纠正嵌入陷阱
6. RSI迭代 5% 版本管理、研究日志、局限认知

关键失败规则:交付物不完整、代码不可执行或检测到幻觉→总分上限0.3。

领域覆盖(29个领域)

  • 原始领域(14个):生物钟、心血管、细胞、昼夜节律、表观遗传学、遗传学、免疫学、代谢、微生物组、神经科学、药理-衰老细胞清除、生殖衰老、干细胞再生、系统生物学
  • 跨学科领域(8个):合成生物-衰老、AI/ML生命科学-衰老、计算系统-衰老、生物工程-临床衰老、合成基因组-寿命、生物物理-衰老、数学理论-衰老、生态进化-寿命
  • v3.0前沿领域(5个):AI实验室自动化、空间组学-衰老、衰老时钟-临床、微生物组-代谢-衰老、AI药物设计-长寿
  • v4.0前沿领域(2个):AI蛋白设计-长寿、类器官-衰老-高通量

数据格式

  • 数据集包含 500 个训练样本,总大小约 12 MB
  • 特征包括:task_id(字符串)、domain(字符串)、instruction(字符串)。
搜集汇总
数据集介绍
lifesci-harbor-bench 数据集图片
构建方式
LifeSci-Harbor-Bench的构建根植于真实生命科学研究脉络,精选自权威科学文献、临床试验与公共数据库,构筑了500项超长周期、开放式研究任务。每一任务均涵盖详细指令、模拟环境、参考文献骨架与严格测试脚本,确保自洽性与可复现性。基准历经四轮迭代,从初始100项扩展以覆盖29个前沿领域,引入跨学科整合与尖端AI应用任务,并融合5,000余篇文献、1,500余项临床试验及2,000多个数据库源,形成多层次、高难度的评估体系。
使用方法
使用者可为智能体配备指令文件和测试环境,其中指令文件是智能体仅见的文本,资料下载指引与验证脚本均已备妥。评测时通过v4.0 11层验证器严格审阅产出,涵盖从交付物存在性到幻觉检测等多个维度。智能体需遵循工具依赖图与路径约束,完成科研任务并规避认知误区,最终输出结构涵盖防作弊检查状态。该数据集亦适配OpenAI兼容API以融入LLM评判,扩展评价维度与深度。
背景与挑战
背景概述
LifeSci-Harbor-Bench是2025年发布的一项前沿基准测试,由致力于生命科学智能体评估的研究团队构建,旨在衡量编码智能体在超长周期、开放式生命科学研究任务中的表现。该基准聚焦于衰老、长寿与健康跨度等核心议题,包含500项源自真实科学文献、临床试验及公共数据库的干实验室研究任务,并通过11层验证器(含6层确定性评分与5层反黑客机制)确保评估的公正性与可复现性。自诞生以来,该基准已从最初的100项任务扩展至500项,涵盖29个领域,融合了跨学科前沿方法,为生命科学人工智能研究树立了新的评估标杆,其影响力体现在推动了智能体在复杂科学发现中的能力验证与标准化发展。
当前挑战
该数据集所面临的挑战涉及多个层面。在领域问题层面,于生命科学中,现有基准难以评估真实研究中的开放性与过程质量,而本数据集通过设计开放式任务来捕捉研究的方法严谨性、可复现性与引用完整性,克服了单一答案评分的局限性。在构建过程中,团队需大量整合真实来源,包括超过5,000篇论文、1,500项临床试验及2,000项数据库引用,确保任务的科学可信度。此外,针对奖励黑客行为,开发了五层反黑客框架(如结构隔离、行为检测、语义审计等),以防范智能体通过旁门左道获取高分,其复杂性与对抗性设计构成了技术上的严峻挑战。
常用场景
经典使用场景
LifeSci-Harbor-Bench作为生命科学领域智能体的权威评测基准,其核心应用在于衡量编码代理执行超长周期、开放式的真实科研任务之能力。数据集涵盖29个前沿领域,从衰老生物学的基础研究至合成生物学、AI药物设计等交叉学科,每个任务皆源自真实文献、临床试验与公共数据库,并配备11层验证体系以评估研究过程中的方法严谨性、可重复性与引用规范性。这一设计使得它成为检验并促进科学发现自动化的重要平台。
解决学术问题
该数据集精准回应了现有科学智能体基准的两难困境:或依赖模糊真实数据的单一分析,或依赖易受攻击的合成数据。LifeSci-Harbor-Bench开创了第三条路径,即基于真实数据的开放式研究任务,通过多维度的验证协议——包括6层F1确定性评分、5层F2反黑客框架以及可选的LLM评审——来量化评估研究质量而非某个具体答案。这一范式有效抵御了奖励黑客行为,同时确保了评估过程的确定性、可复现性与科学诚信,为学界提供了衡量自主科研系统真实水平的标尺。
实际应用
在实践应用中,该基准驱动了生命科学自动化研究工具的革新。它支持对AI代理在执行复杂任务时的系统评测,例如在基因组规模代谢模型下开发数字孪生、通过图神经网络挖掘基因调控网络以发现衰老药物,或利用主动学习优化药物筛选流程。其环境设计蕴含认知陷阱、隐藏基准与干扰数据集,逼真模拟了科研过程中的不确定性,从而为实验室自动化、自主药物发现及衰老干预策略的算法开发与迭代提供了测试床与标准化参照。
数据集最近研究
最新研究方向
LifeSci-Harbor-Bench v4.0作为生命科学智能体研究的前沿评估基准,其最新研究方向聚焦于构建大规模、超长时域、开放式的真实科研任务集,并针对智能体的奖励攻击行为开发了11层验证框架。该基准涵盖29个前沿交叉领域,包括衰老生物学、空间组学、AI药物设计等,显著提升了任务难度与评估鲁棒性,为智能体在真实生命科学研究中的可靠性、可重复性和方法学严谨性提供了前所未有的测试平台,对推动科学发现自动化和AI驱动长寿医学的进步具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务