lifesci-harbor-bench
收藏资源简介:
LifeSci-Harbor-Bench 是一个用于评估智能体在生命科学领域(特别是衰老/长寿/健康跨度)进行开放性研究任务能力的基准测试数据集。该数据集包含 300 个超长时域、开放式的研究任务,每个任务都源自真实的科学文献、临床试验和公共数据库,并通过一个 6 层确定性验证器加上可选的 LLM 评判(包含评分标准、声明验证、幻觉检测和认知陷阱)进行评分。任务没有固定答案,而是评估研究质量、方法论严谨性和可重复性。数据集涵盖 27 个领域,包括 14 个原始领域(如生物钟、心血管、细胞衰老、表观遗传学等)、8 个跨学科领域(如合成生物学与衰老、AI/ML 与生命科学等)和 5 个前沿领域(如 AI+实验室自动化、空间组学与衰老、衰老时钟与临床、微生物组与代谢与衰老、AI 药物设计与长寿)。每个任务遵循 Harbor 格式,包含指令、环境数据、参考框架和测试模块。验证方法包括 7 层:确定性检查、细粒度评分标准、声明验证、幻觉检测、认知陷阱、RSI 迭代和 LLM 评判。数据集规模为 300 个样本,每个样本包含 task_id、domain 和 instruction 字段,总大小约 6.3 MB。该基准适用于评估和提升编码智能体在真实生命科学研究中的深度推理、跨学科整合和过程质量把控能力。
LifeSci-Harbor-Bench is a benchmark dataset for evaluating the ability of agents to conduct open-ended research tasks in the life sciences, particularly in the areas of aging, longevity, and healthspan. It contains 300 ultra-long-horizon, open-ended research tasks, each derived from real scientific literature, clinical trials, and public databases, and scored through a 6-layer deterministic verifier with an optional LLM judge (including scoring rubrics, claim verification, hallucination detection, and cognitive pitfalls). Tasks have no fixed answers but evaluate research quality, methodological rigor, and reproducibility. The dataset covers 27 domains, including 14 original domains (e.g., circadian rhythm, cardiovascular, cellular senescence, epigenetics, etc.), 8 interdisciplinary domains (e.g., synthetic biology and aging, AI/ML and life sciences, etc.), and 5 frontier domains (e.g., AI + lab automation, spatial omics and aging, aging clocks and clinical, microbiome and metabolism and aging, AI drug design and longevity). Each task follows the Harbor format, containing instructions, environmental data, reference frameworks, and test modules. The verification method includes 7 layers: deterministic checks, fine-grained scoring rubrics, claim verification, hallucination detection, cognitive pitfalls, RSI iteration, and LLM evaluation. The dataset comprises 300 samples, each with task_id, domain, and instruction fields, with a total size of approximately 6.3 MB. This benchmark is suitable for evaluating and improving coding agents deep reasoning, interdisciplinary integration, and process quality control in real-world life science research.
LifeSci-Harbor-Bench 数据集总结
数据集简介
LifeSci-Harbor-Bench 是一个用于评估编码代理(coding agents)在生命科学领域真实、可计算验证(dry-lab)研究中的表现的数据集,包含 500 个超长周期、开放式的研究任务,重点聚焦于**衰老/长寿/健康寿命(aging/longevity/healthspan)**领域。
核心特点
- 无固定答案:任务评估研究质量、方法论严谨性和可复现性,而非某个具体数值是否正确。
- 任务来源:每个任务均基于真实科学文献、临床试验和公共数据库,自包含且可独立运行。
- 评分体系:采用 v4.0 11层验证器(6层F1评分 + 5层F2反黑客),可选集成 LLM 评审(包含评分标准、声明验证、幻觉检测、认知陷阱和 HARBOR-Synth 反黑客门控)。
版本更新要点
- v4.0:任务数从 300 扩展至 500,新增 200 个开放研究任务和 2 个前沿领域(
ai-protein-design-longevity、organoid-aging-high-throughput),并引入 5层F2反黑客框架(包括结构隔离、行为对比轨迹编码、语义HackDetect协议审计、静默完成击杀、关键节点遵从)。 - v3.0:任务数从 200 扩展至 300,新增工具依赖图、难度分布、隐藏夹具、干扰数据集等特性。
- v2.0:任务数从 100 扩展至 200,新增 100 个跨学科任务,覆盖 8 个新领域。
关键数据统计
| 指标 | 数值 |
|---|---|
| 总任务数 | 500(100原始 + 100 v2.0跨学科 + 100 v3.0前沿 + 200 v4.0开放研究) |
| 领域数 | 29(14原始 + 8 v2.0跨学科 + 5 v3.0前沿 + 2 v4.0前沿) |
| 引用真实论文(DOI/PMID) | 5,000+ |
| 真实临床试验(NCT) | 1,500+ |
| 真实数据库引用 | 2,000+ |
| 平均预估工作量 | 140小时(v4.0范围100–200) |
| 验证层数 | 6个F1确定性 + 5个F2反黑客 + 1个LLM评审 |
| 每个任务的认知陷阱数 | 3–5个 |
| v3.0每个任务的隐藏夹具数 | 4个 |
| v3.0工具依赖深度 | 6–8个链式步骤 |
任务结构(Harbor格式)
每个任务包含:
instruction.md— 任务指令(代理唯一可见文本)environment/data/DATA_SOURCES.md— 真实数据下载说明reference/pipeline.py— 研究框架骨架tests/verify.py— v4.0 11层验证器tests/llm_judge.py— LLM评审模块tests/expert_guidance.json— 专家评估标准tests/fixtures/task_config.json— 任务元数据和真实来源可追溯性
验证方法
F1评分栈
| 层 | 权重 | 检查内容 |
|---|---|---|
| 1. 确定性 | 30% | 交付物存在性、代码语法、手稿结构、引用、数据输出 |
| 2. 细粒度标准 | 25% | 10个强制+8个可选+3个负面标准,三元评分 |
| 3. 声明验证 | 15% | 事实声明有邻近引用支持 |
| 4. 幻觉检测 | 15% | 伪造数据、虚假引用、“数据未显示”超过3次等→红旗 |
| 5. 认知陷阱 | 10% | 识别并纠正嵌入陷阱 |
| 6. RSI迭代 | 5% | 版本管理、研究日志、局限认知 |
关键失败规则:交付物不完整、代码不可执行或检测到幻觉→总分上限0.3。
领域覆盖(29个领域)
- 原始领域(14个):生物钟、心血管、细胞、昼夜节律、表观遗传学、遗传学、免疫学、代谢、微生物组、神经科学、药理-衰老细胞清除、生殖衰老、干细胞再生、系统生物学
- 跨学科领域(8个):合成生物-衰老、AI/ML生命科学-衰老、计算系统-衰老、生物工程-临床衰老、合成基因组-寿命、生物物理-衰老、数学理论-衰老、生态进化-寿命
- v3.0前沿领域(5个):AI实验室自动化、空间组学-衰老、衰老时钟-临床、微生物组-代谢-衰老、AI药物设计-长寿
- v4.0前沿领域(2个):AI蛋白设计-长寿、类器官-衰老-高通量
数据格式
- 数据集包含 500 个训练样本,总大小约 12 MB。
- 特征包括:
task_id(字符串)、domain(字符串)、instruction(字符串)。




