遇见数据集

SciR

收藏
github2026-06-12 更新2026-06-16 收录
数据链接:
官方服务:

资源简介:

SciR是一个多文档科学推理基准,用于评估大型语言模型在演绎、归纳和因果溯因三种科学推理形式上的表现,通过参数化控制推理复杂性和前提混淆程度,生成具有可验证真实值的任务。

SciR is a multi-document scientific reasoning benchmark designed to evaluate the performance of large language models across three forms of scientific reasoning: deductive, inductive, and causal abductive reasoning. It parametrically controls the complexity of reasoning and the degree of premise confusion, generating tasks with verifiable ground truth.

创建时间:
2026-06-09
原始信息汇总

数据集概述

数据集名称:SciR (A Controllable Benchmark for Scientific Reasoning in LLMs)

简介:SciR 是一个面向大语言模型 (LLM) 的可控科学推理基准测试,通过从结构化形式对象(演绎树、归纳规则假设或因果图)生成任务,并渲染为多文档科学论述,提供具有可验证真实值的推理任务。该基准支持对推理复杂度和前提混淆度进行参数化独立控制。

核心特性

  • 可验证的真实值:任务从形式化结构生成,确保答案可验证。
  • 多文档科学论述:任务渲染为多篇科学文本,模拟真实阅读场景。
  • 可控双轴难度:可独立调节潜在推理的难度(推理复杂度)以及从异质科学文本中提取相关信息的难度(混淆度)。
  • 三大推理任务:涵盖演绎(Deduction)、归纳(Induction)和因果溯因(Causal abduction)。

任务构成

SciR 包含三个独立的任务领域(Tracks):

领域 (Track) 形式基础 领域知识来源 任务目标
演绎 (Deduction) 由前提替换链构建的三段论树 发育生物学通路数据 标记结论为真(True)、假(False)或未知(Unknown)
归纳 (Induction) 药物相互作用模式(如“抑制相同酶”)的规则集 药物与蛋白质相互作用事实 从正例和反例中归纳出目标规则
因果 (Causal) Sachs 蛋白信号传导网络子图,并添加虚构蛋白 XYZ 蛋白浓度模拟数据(线性高斯SCM) 恢复虚构蛋白 XYZ 的连接边

难度调节机制

推理复杂度和信息混淆度可通过以下两个轴独立调节:

  • 推理难度:通过改变演绎树的深度、归纳规则的复杂性或因果图中节点的数量来实现。
  • 信息混淆度:通过向任务中添加无关的干扰项(如干扰树、干扰规则、干扰边等)来增加信息提取难度。

数据集规模与存储

  • 任务文件分为两个层级:主层级 (main)(n=200,包含自然语言和混淆两种模式)和难度扩展层级 (difficulty_scaling)(n=50,仅自然语言模式)。
  • 任务文件通过 scripts/download_data.py 从 Zenodo 下载(CC-BY-NC 4.0 许可)。
  • 本仓库(GitHub)仅包含评估细胞级(per-cell)的基线结果文件(data/<track>/results/)和生成种子(data/<track>/seeds/)。

使用与运行

环境搭建

bash git clone https://github.com/idiap/scir.git cd scir conda create -n scir python=3.12 -y conda activate scir pip install -e . cp config.example.yaml config.yaml # 填写 API 密钥 python scripts/download_data.py

运行评估(以因果领域为例)

bash python -m evaluation.causal.evaluate --dataset data/causal/tasks/main/tasks_5n1c_transformed_n200.json --llm-config gpt-4o --solver gies --modes nl_only 100_obfuscated --output data/causal/results/main/results_5n1c_4o_ns.json

  • 支持的语言模型 (--llm-config)4o-azure, o3mini-azure, deepseek-r1, llama-70b, qwen30b, olmo32b
  • 支持的求解器 (--solver)prover9 (演绎), popper (归纳), gies (因果),省略则为直接思维链 (CoT),或使用 symbcot 进行 SymbCoT* 基线。

依赖的外部工具

部分求解器需独立安装:

  • Prover9(演绎):根据 NLTK 的 Prover9 安装指南安装。
  • Z3(演绎,可选项):从 Z3 GitHub 仓库安装。
  • Popper(归纳):从 Popper GitHub 仓库安装。
  • GIES / pcalg(因果):需要 R 语言及 pcalg 包,以及 Python 的 giessempler 包。

生成新任务

每个领域都提供生成脚本,例如:

bash python -m generation.deduction.generate --tier e4d1 --n 200 python -m generation.induction.generate --tier d2p2 --n 200 python -m generation.causal.generate --tier 5n1c --n 200

之后可将符号化任务转换为混淆形式的科学散文:

bash python -m generation.<domain>.transform --input <tasks.json> --output <out.json>

许可信息

  • 源代码:GPL-3.0-only
  • 数据集(通过 Zenodo 分发):CC-BY-NC-4.0

引用

bibtex @misc{beckmann2026scir, title = {SciR: A Controllable Benchmark for Scientific Reasoning in LLMs}, author = {Beckmann, Pierre and Valentino, Marco and Freitas, Andr{e}}, year = {2026}, eprint = {2606.13020}, archivePrefix = {arXiv}, primaryClass = {cs.CL}, }

搜集汇总
数据集介绍
SciR 数据集图片
构建方式
在科学推理领域,现有基准往往受限于固定难度和缺乏可验证真值,难以全面评估大语言模型的推理能力。SciR数据集通过从结构化形式对象出发构建每个任务,这些对象涵盖演绎树、归纳规则假设与因果图三种逻辑形态。针对不同领域,演绎任务基于链式前提替换生成带有真、假或未知标签的推理树,并融入发育生物学通路实例;归纳任务从药物相互作用模式集中采样目标规则与干扰规则,通过精心挑选药物对确保正例支持目标规则而负例否定干扰项;因果任务则从Sachs蛋白质信号网络提取子图,添加虚构蛋白并以线性高斯结构方程模型模拟观测与干预数据。所有任务经领域调优与交叉验证的渲染方案转化为多文档科学论述,形成兼具严谨逻辑来源与自然文本形态的评测样本。
特点
该数据集最显著的特点在于其双重可控性,能够沿两条独立轴线调节推理难度:一是底层推理本身的复杂度,二是从异构科学文本中提取相关信息所需付出的认知努力。每个推理轨道均提供五种难度等级,覆盖从简单到极具挑战性的场景,且所有答案均内嵌可验证的绝对真值,无需依赖人工标注或模型间共识。数据集包含演绎、归纳与因果三个专门化领域,每个领域内部的生成机制深度契合该学科的实际推理模式,例如利用蛋白质通路、药物靶点互作与信号传导等真实生物学知识作为背景。此外,每个任务还配备自然语言与混淆化文本两种呈现形式,以探究表面语言特征对推理表现的影响。
使用方法
使用者首先通过GitHub仓库克隆代码并配置环境,随后运行下载脚本从Zenodo或Hugging Face获取基准任务文件。评估流程支持多种大语言模型(如GPT-4o、Llama-70B、DeepSeek-R1等)与多种求解策略的组合:可直接采用思维链提示进行纯语言推理,亦可启用神经符号模式(演绎用Prover9或Z3、归纳用Popper、因果用GIES),或使用SymbCoT*作为符号增强基线。使用者通过命令行参数指定模型、求解器、难度等级和文本模式(自然语言或混淆化),即可自动执行推理与评分。高级用户还可调用生成脚本自定义新任务,并利用变换模块将符号结构渲染为科学散文,从而扩展评测范围或适配特定研究需求。
背景与挑战
背景概述
SciR数据集由Idiap Research Institute的Pierre Beckmann、Marco Valentino和André Freitas于2026年创建,旨在精准评估大型语言模型在多文档科学文献中的推理能力。该基准通过演绎、归纳和因果溯因三大推理形式,结合可调控的推理复杂度和前提混淆度,生成具有可验证真实值的高质量任务。数据集依托于发育生物学、药物相互作用及蛋白质信号网络等真实科学领域,为科学推理研究提供了首个具备细粒度控制与完备性验证的评测平台,推动了LLM在科学文本理解与逻辑推断方面的前沿探索。
当前挑战
SciR面临的核心挑战在于多维度推理交织下的可控性难题:一方面,LLM需同时处理演绎树、归纳规则假设与因果图等异构形式,在参数化调控的推理深度和文本混淆度下保持稳健性能;另一方面,构建过程中需确保生成任务具有严格的逻辑真实值,避免歧义与噪声污染。此外,数据集引入神经符号方法(如Prover9、Popper)作为基准,但在跨域迁移时面临工具兼容性与知识图谱稀疏性的双重限制,对评估框架的可扩展性构成严峻考验。
常用场景
经典使用场景
在科学推理研究领域,SciR数据集的核心用途在于评估和提升大语言模型在复杂、多文档科学文献中的推理能力。该数据集通过构造演绎、归纳与因果归因三大推理任务,并精确控制推理复杂度与信息混淆程度,为研究者提供了一个可重复、可基准化的评估框架。具体而言,研究者可借助该数据集对模型在严格推理链验证、科学规律发现及因果结构识别上的表现进行系统性评测,尤其适用于需要对比不同模型架构、不同推理策略(如链式思维与神经符号方法)的实验场景。
解决学术问题
SciR数据集精准回应了当前大语言模型在科学推理中缺乏可验证、可控制基准这一关键学术瓶颈。它解决了现有评测集难以区分模型实际推理能力与表面记忆匹配的问题,通过从结构化形式对象生成具有可验证真实标注的任务,为学术研究提供了客观、严谨的评测工具。该数据集的意义在于,它能够量化推理难度与信息混淆度对模型表现的独立影响,从而助力学术界深入揭示模型推理能力的边界与内在机理,推动科学推理领域从经验性评估迈向科学化、可控化的新阶段。
衍生相关工作
基于SciR数据集,学术界已衍生出多项具有前瞻性的经典工作。例如,在推理策略方面,研究者发展了神经符号协同推理方法与符号链式思维推理基线,用于融合符号逻辑的严谨性与神经网络的灵活性。在模型评估维度上,该数据集催生了对不同规模模型在可控难度梯度下推理表现的横向对比研究,揭示了推理复杂度与混淆度对模型性能的非线性影响。此外,该数据集还激发了针对科学文献特定领域(如发育生物学、药物相互作用)的定制化推理增强方法,为构建更具领域适应性的科学人工智能系统奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务