遇见数据集

TruthInsightBench

收藏
arXiv2026-09-04 更新2026-09-08 收录
官方服务:

资源简介:

TruthInsightBench是一个面向开放科学发现的基准数据集,由TruthInsight-AI创建,旨在评估自主科学发现代理的发现能力而非重现能力。该数据集包含40个盲任务,源自10个科学领域(如物理、化学、地球科学等)的40篇同行评审研究,每个任务提供中性研究目标和冻结的原始数据,隐藏所有来源结论与预期分析路径。数据集通过六维度(证据可审计性、鲁棒性、控制检验、跨数据集泛化、新颖性、可证伪性)共29个预定义可验证规则项,自动评估代理自行形成科学主张的证据成熟度,无需人工逐实例评分。该基准解决了现有基准无法区分执行与发现的问题,为AI科学家的持续自我改进提供了可扩展的自动化反馈信号。

TruthInsightBench is a benchmark dataset for open scientific discovery, created by TruthInsight-AI. It is designed to evaluate the discovery capability rather than the reproduction capability of autonomous scientific discovery agents. This dataset includes 40 blind tasks derived from 40 peer-reviewed studies across 10 scientific domains (e.g., physics, chemistry, earth sciences, etc.). Each task provides a neutral research objective and frozen raw data, while concealing all source conclusions and intended analytical pathways. Leveraging a total of 29 predefined verifiable rule items across six dimensions—evidence auditability, robustness, controlled validation checks, cross-dataset generalization, novelty, and falsifiability—the dataset automatically assesses the evidence maturity of scientific claims independently formulated by the agents, eliminating the need for manual instance-by-instance scoring. This benchmark addresses a key limitation of existing benchmarks that fail to distinguish between execution and discovery, providing scalable automated feedback signals for the continuous self-improvement of AI scientists.

创建时间:
2026-09-04
原始信息汇总

TruthInsightBench 数据集详情

数据集概述

TruthInsightBench是一个用于评估研究型智能体(Research Agents)能否从真实数据中推导出可复现、具有恰当边界科学发现能力的基准数据集。该基准的核心特点是测试智能体在未见原始研究结论的前提下进行科学发现的能力。

数据集规模与构成

  • V1.0版本包含40个盲测任务(blind tasks),覆盖10个科学领域
  • 配套提供一个包含29个评估条目的评估器,可生成0–100分的任务评分
  • 所有任务数据均包含在仓库中,克隆后即可使用

任务领域

数据集不限于单一学科,涵盖10个不同科学领域的研究任务,具体领域名称在README中未逐一列出。

仓库结构

路径 内容
tasks/ 研究目标、数据指南、清单及科学数据
agents/ 工作区组装及四种可运行的Agent适配器
evaluation/ 提交验证、评估器资源及评分代码
provenance/ 上游来源、许可证及文件级归属信息

支持的Agent类型

数据集提供四种官方Agent harness配置文件:

  • claude(Claude Code 2.1.220)
  • codex(Codex CLI 0.149.0)
  • openscience(OpenScience 2.0.1)
  • deepseek_harness(DeepSeek Harness 0.1.0rc7)

评估方法

  • 支持干跑验证模式(dry-run),无需调用评估模型即可验证提交的合理性
  • 评分阶段需配置OpenAI兼容的评估端点(judge endpoint)
  • 配套论文使用GLM-5.1(模型版本为Apsara-Stack/GLM-5.1-W4A8)作为评估器,关闭思考功能

技术环境要求

  • Python 3.11及以上
  • Node.js 20及以上
  • Docker(用于运行Agent容器)

使用方式

  • 运行单个任务:通过agents/run_agent.py指定agent类型和任务ID(如Material_01_binary_superlattice
  • 批量运行:使用agents/run_suite.py处理多个任务
  • 自定义Agent命令:使用agents/run_command.py
  • 评分:通过evaluation/evaluate.py配合评估端点执行,评分结果和模型回执写入指定的评估工作目录

许可与引用

  • TruthInsightBench自研的软件、文档、基准元数据和评估资源采用Apache-2.0许可
  • 第三方科学数据和文献记录保留其原始上游条款,不包含在上述许可范围内;部分组件仅限非商业研究用途
  • 引用方式:报告基准结果时,请引用论文**“TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents.”**;进行单一任务分析或数据复用,还需引用对应的上游研究和数据记录
  • 复用或分发任务数据前,须查阅provenance/THIRD_PARTY_NOTICES.mdprovenance/source_attribution.json

关键链接

  • 第三方声明文件:https://github.com/TruthInsight-stack/TruthInsightBench/blob/main/provenance/THIRD_PARTY_NOTICES.md
  • 来源归属文件:https://github.com/TruthInsight-stack/TruthInsightBench/blob/main/provenance/source_attribution.json
搜集汇总
数据集介绍
TruthInsightBench 数据集图片
构建方式
TruthInsightBench的构建根植于对开放科学发现的深度考量,其设计远非简单的任务堆积。该基准精心遴选2018至2024年间发表的40篇同行评审研究,覆盖十个科学领域,每项研究转化为一项盲测任务。构建过程严格遵循三阶段准入原则:确保数据具备可解释的结构性语义,通过仅基于提供数据的独立重推导验证科学结果的可恢复性,并确认数据内嵌充分的重复、条件变化及控制组以支撑假设检验。任务构建采用六步审计流程,从情景甄选、可恢复性验证、结构检验到盲化处理与质量评审,最终冻结所有任务材料与评估端参照。尤其关键的是,任务仅向智能体暴露中立的研究目标与冻结的原始数据,源研究结论、预期数值及分析路径均严格保密,从而营造一个无预设终点的知识探索环境,旨在引导智能体自主形成科学论断。
特点
TruthInsightBench的核心特质在于其评估视角的根本性转变,从衡量对已知答案的复现转向度量智能体自主形成的科学主张的证据充分性。为此,基准构建了六维度评价框架,涵盖证据可审计性、稳健性、对照测试、跨数据集泛化、新颖性与可证伪性,并细化为29个可验证的评估项。全部评估由冻结的LLM法官依据实际执行的代码与产物进行,聚合过程完全自动化与确定性,消除了人工逐例评分的需求,使得评估具备高度的可重复性与可扩展性。此外,基准不预设任何特权端点,对零结果、反例、方法伪迹及适用范围边界均给予同等评分权重,真实反映了科学探索中多元成果的认知价值。该框架旨在精准区分科学发现与单纯分析执行的能力鸿沟,为自主科研智能体的进化确立可量化的衡量标尺。
使用方法
TruthInsightBench为AI科研智能体的评估提供了一个标准化、可自动化的闭环环境。使用时,研究人员为智能体配置统一的运行协议,包括冻结的基座模型、精确的任务输入及预设的文献截止日期,使其在信息隔离的沙箱中执行探索任务。智能体需最终提交包含分析代码、中间产物与最终研究报告的完整输出。评估流程由后端的固定评分程序统一执行,该程序内置了语义去重算法与一个冻结的LLM法官,后者对智能体报告的每个科学主张依据29项指标进行多维度评判。评分聚合过程遵循一个公开透明的确定性公式,综合考量主要发现与次要发现的质量、多发现产出奖励、参考覆盖奖励及确定性错误惩罚,最终得出百分制任务得分与系统总体得分。这一设计允许研究者便捷地横向比较不同智能体或同一智能体不同版本的科研发现能力,其全自动的评分机制尤其适合集成进自我改进的研究循环,为自主科研系统提供持续、稳定且无偏的进化信号。
背景与挑战
背景概述
TruthInsightBench由中国科学院计算机网络信息中心与京东集团、阿里云等机构于2026年联合推出,是一项专为评估开放科学发现能力而设计的盲测基准。该基准基于2018至2024年间发表的40篇同行评审研究,覆盖10个科学领域,旨在解决当前AI科学智能体评测中重现与发现混淆的问题。其核心创新在于,每个任务仅提供中立的研究目标和冻结的数据,隐藏源研究结论与评分资产,并通过六维29项基于证据的评估框架,衡量智能体自行形成科学主张的严谨程度。该基准的发布为自主科研智能体的迭代优化提供了可自动重复的评测工具,推动了从模仿分析到真正发现的范式转变。
当前挑战
TruthInsightBench面临的挑战多维且深嵌于领域本质:首先,现有评测多围绕已知目标设定,难以公正评价非预期但证据充分的发现,而构建隐蔽任务要求严格隐藏所有源研究信息,同时保证数据仍存在可发现的结构,需大量验证工作量;其次,评估需自动且结构化,避免人工参与,这要求评分标准高度明确且能区分执行与分析缺陷;最后,实验表明当前主流编码智能体在证据可审计性和新颖性上表现尚可,但鲁棒性、对照测试、可证伪性及跨数据集泛化等关键科学判断维度上近乎缺失,导致整体得分集中于58.4至60.3的狭窄区间,无显著差异,最终凸显出智能体在科学判断而非编码能力上的根本瓶颈。
常用场景
经典使用场景
TruthInsightBench作为一项面向开放式科学发现的新型基准,其核心使用场景在于评估自主编码智能体在真实数据上进行科学探索的能力。不同于以往侧重于复现预设研究流程的基准,本数据集构建了40项源自同行评审研究的盲测任务,覆盖十个科学领域。在每项任务中,智能体仅接收中性的科学目标和冻结的原始数据,而源论文结论、预期值及分析路径均被隐藏,要求智能体自行从数据中提炼出有据可依的科学声明。此类设置精准地检验了智能体从数据洞察到假设确立的端到端自主研究能力。
衍生相关工作
TruthInsightBench的提出衍生了多个方向的后续工作。一方面,其六维度29条目证据成熟度评估框架可被借鉴以改进现有科学智能体基准,如探索将其自动化评分逻辑应用于研究过程复现类任务中。另一方面,该基准所揭示的‘执行强而发现弱’的性能瓶颈,激励了针对科学判断力增强的研究,例如开发专门的模块以强化智能体的控制变量测试与稳健性分析能力。此外,其在多智能体对比研究中的应用,也为探究不同智能体架构对科学发现行为的影响提供了基准方法,推动了开放式科学发现评估体系的精细化发展。
数据集最近研究
最新研究方向
TruthInsightBench作为一项面向开放式科学发现评估的前沿基准,其最新研究方向聚焦于揭示自主编码代理在科学判断能力上的本质局限。该基准通过构造40个无预设终点的盲任务,系统性地将证据可审计性与新颖性等执行层面能力,与对照测试、稳健性、可证伪性及跨数据集泛化等判别性科学行为进行解耦。研究发现,主流AI科学代理系统虽能熟练完成分析流程,但其在控制实验、鲁棒性检验及外部验证等关键维度上近乎缺失,得分集中于58.4至60.3的狭窄区间,形成统计上难以区分的性能平台。这一发现将瓶颈精准定位为科学判断而非编码执行,为评估和推进自主科研代理从分析执行迈向真正的知识发现提供了可量化、自动化的重要度量基准。
相关研究论文
  • 1
    TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务