matter-to-mechanism
收藏资源简介:
Matter to Mechanism 是一个专家整理的包含 2,645 个问题-假设对的结构化数据集,这些数据对来自材料科学和电化学领域的同行评议文献。每个条目将一个明确表述的研究问题与其对应的科学假设联系起来,包含逐步推理链、提出的干预措施、机制原理和目标属性。该数据集是 BatteryHypoBench 的基础,这是一个用于评估 AI 共同科学家系统在科学假设生成方面的多维基准,不仅测量表面流畅性,还测量机制深度、推理连贯性和物理合理性。数据集包含 20 个结构化字段,如问题陈述、假设、推理步骤、机制解释等。数据集适用于共同科学家基准测试、推理链研究和科学 NLP 任务。数据集采用 CC BY 4.0 许可,源自开放获取的科学文献。
Matter to Mechanism is an expert-curated structured dataset containing 2,645 question-hypothesis pairs derived from peer-reviewed literature in materials science and electrochemistry. Each entry links a clearly articulated research question with its corresponding scientific hypothesis, including step-by-step reasoning chains, proposed interventions, mechanism explanations, and target properties. The dataset serves as the foundation for BatteryHypoBench, a multidimensional benchmark for evaluating AI co-scientist systems in scientific hypothesis generation, measuring not only surface fluency but also mechanistic depth, reasoning coherence, and physical plausibility. The dataset includes 20 structured fields such as problem statement, hypothesis, reasoning steps, mechanism explanation, etc. It is suitable for co-scientist benchmarking, reasoning chain research, and scientific NLP tasks. The dataset is licensed under CC BY 4.0 and sourced from open-access scientific literature.
数据集概述
基本信息
- 数据集名称: Matter to Mechanism
- 语言: 英语(English)
- 许可证: Creative Commons Attribution 4.0 International (CC BY 4.0)
- 任务类别: 文本生成、问答
- 标签: 电池材料、科学假设、推理链、协同科学家、材料科学、电化学、基准、NeurIPS
- 规模: 1,000 到 10,000 条样本
- 总样本数: 2,645 个专家策展的问题-假设对
数据集结构
-
数据划分:
- 训练集: 2,116 个样本
- 验证集: 265 个样本
- 测试集: 264 个样本
-
字段信息(每个样本包含 20 个结构化字段):
字段名 类型 描述 sample_idint 唯一样本标识符 doistring 论文DOI,用于追溯 problem_statementstring 完整自然语言问题描述 hypothesisstring 提出的科学假设(2-4句话) problem_corestring 提炼的根本原因(问题压缩15-50%) problem_type_broadstring 高层次问题类别(共13类) problem_type_finestring 细粒度问题子类别 battery_systemstring 目标电化学系统 componentstring 特定电极/电解质组件 failure_mode_or_limitationstring 需解决的精确失效机制 intervention_or_solutionstring 提议的具体材料/工艺修改 mechanism_or_rationalestring 解释假设的物理/化学机制 target_propertystring 旨在改进的属性 claimed_outcomestring 预期结果(可量化时包含数值) evidence_strengthstring 支持证据的质量( strong/moderate/weak)novelty_axisstring 科学新颖性的维度 keywordsstring 完整关键词列表 keywords_compactstring 紧凑关键词集合 num_reasoning_stepsint 推理步骤数(4-8步) reasoning_processstring 逐步推理链,格式为 [Begin Step N]...[End Step N]
数据集统计
- 平均推理步骤: 6.1(范围:4-8)
- 问题类型(宽泛类别): 13 个
- 问题类型(细粒度类别): 47 个以上
- 电池/电化学系统: 30 个以上
- 证据强度分布:
- 强(strong): 61.3%
- 中等(moderate): 38.4%
- DOI覆盖: 2,645 篇独特论文
问题类型分布
| 问题类型 | 数量 | 占比 |
|---|---|---|
| 机制理解 | 790 | 29.9% |
| 多因素系统权衡 | 683 | 25.8% |
| 性能优化 | 519 | 19.6% |
| 制造/可扩展性 | 164 | 6.2% |
| 界面稳定性 | 112 | 4.2% |
| 传输限制 | 102 | 3.9% |
| 反应动力学 | 93 | 3.5% |
| 循环稳定性 | 68 | 2.6% |
| 结构退化 | 41 | 1.6% |
| 材料发现 | 32 | 1.2% |
| 其他 | 41 | 1.5% |
电池系统覆盖(主要系统)
| 系统 | 数量 |
|---|---|
| 锂离子电池 | 274 |
| 钠离子电池 | 38 |
| 超级电容器 | 34 |
| PEM燃料电池 | 24 |
| 锂硫电池 | 24 |
| 全固态锂电池 | 14 |
| 锂金属电池 | 11 |
| 水系锌离子电池 | 10 |
| 钒氧化还原液流电池 | 7 |
预期用途
- 主要用途: 协同科学家系统的基准测试,评估AI系统在科学假设生成方面的表现
- 次要用途: 推理链研究,支持链式思维评估、科学推理分析、步级奖励建模
- 三级用途: 科学自然语言处理,包括假设提取与生成、问题分解、科学声明分类
评估指标(BatteryHypoBench)
数据集是六项评估指标的基础:
| 指标 | 度量内容 |
|---|---|
| RCF — 推理链保真度 | 步骤进展、收敛性、非冗余性 |
| HPA — 假设-问题对齐 | 与声明的失效模式的语义一致性 |
| MSI — 机制特异性指数 | 领域词汇深度、量化基础 |
| SNS — 科学新颖性分数 | 语料库级别TF-IDF区分度 |
| IP — 干预合理性 | 物理可行性、材料兼容性 |
| PDQ — 问题分解质量 | 根本原因精确性、组件粒度 |
| CBS — 综合电池科学分数 | 加权聚合得分 |
所有指标均为无参考指标,无需真实假设即可评估,适用于该数据集之外的新问题。
数据收集
- 来源:来自开放获取的材料科学和电化学文献
- 方法:使用结构化输出约束的大型语言模型进行提取,并经过事后质量过滤
- 验证标准:每个条目需包含明确的研究问题与失效模式、可证伪的假设与命名干预、连接干预与结果的机制原理、逐步推理链
- 期刊覆盖:包括ACS、Elsevier、Nature Publishing Group、Royal Society of Chemistry、IOP Publishing等多个出版商
局限性
- 领域范围: 55.8%的条目中
battery_system为未知,涵盖更广泛的电化学和材料科学 - 语言: 仅英语
- 年份覆盖: 当前版本未提供年份元数据,通过DOI可追溯
- 推理链: 由大型语言模型提取和结构化,人工专家验证正在进行中




