遇见数据集

RxnOptBench-review

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

RxnOptBench是一个用于反应条件推荐系统离线评估的固定基准测试数据集。它包含4,773个问题实例,源自552个结构化源表和232个不区分大小写的规范DOI标识(保留236个原始区分大小写的DOI字符串)。数据集提供八个不同的配置,涵盖两种主要任务类型:多项选择题(包含单变量变化、全变量变化、参考增强及控制变体)和填空题(全空白及参考增强变体)。每个配置仅包含测试集,问题数量从310到1039不等。数据记录包含完整的反应上下文信息,包括恒定条件和固定条件。数据集适用于反应条件推荐系统的离线评估、多项选择题与填空题任务中模型行为的受控比较,以及参考条件、候选空间构建和评分规则对模型性能影响的消融研究。数据来源于已发表的文献表格,描述了化学反应、反应条件、观察结果和规范化源文章标识符,不包含个人、人口统计、医疗、政治或其他人类敏感属性。数据集具有明确的局限性:仅测量文献观察到的反应条件在受限候选空间中的离线选择或排序能力,不测量端到端实验室执行、安全性、成本、可扩展性或开放式规划;由于依赖上游结构化表格提取流程,在反应类别、底物、条件类别、期刊、出版商和出版年份方面的覆盖不均匀;存在文献固有的发表偏倚。

RxnOptBench is a fixed benchmark dataset for offline evaluation of reaction condition recommendation systems. The dataset is published as a Hugging Face dataset repository, compatible with the dataset viewer and the Croissant metadata workflow used by the NeurIPS 2026 Evaluation and Data Track. It contains 4,773 problem instances derived from 552 structured source tables and 232 case-insensitive canonical DOI identifiers (retaining 236 original case-sensitive DOI strings). The dataset provides eight different configurations covering two main task types: multiple-choice questions (including single-variable variation, full-variable variation, reference-enhanced, and control variants) and fill-in-the-blank questions (full-blank and reference-enhanced variants). Each configuration only includes a test set, with the number of questions ranging from 310 to 1,039. Data records contain complete reaction context information, including constant and fixed conditions. The dataset is suitable for offline evaluation of reaction condition recommendation systems, controlled comparisons of model behavior in multiple-choice and fill-in-the-blank tasks, and ablation studies on the impact of reference conditions, candidate space construction, and scoring rules on model performance. The data is sourced from published literature tables describing chemical reactions, reaction conditions, observations, and normalized source article identifiers, and does not contain personal, demographic, medical, political, or other human-sensitive attributes. The dataset has clear limitations: it only measures offline selection or ranking capabilities of reaction conditions observed in the literature within a restricted candidate space, and does not measure end-to-end laboratory execution, safety, cost, scalability, or open-ended planning; coverage is uneven across reaction classes, substrates, condition classes, journals, publishers, and publication years due to reliance on upstream structured table extraction processes; and there is inherent publication bias in the literature.

创建时间:
2026-07-26
原始信息汇总

数据集名称

RxnOptBench (版本 0.2.3-review)

数据集概述

RxnOptBench 是一个用于离线评估反应条件推荐系统的固定基准测试集。该数据集是 NeurIPS 2026 评估与数据集轨道的匿名、免凭证同行评审快照,包含 4,773 个问题实例,源自 552 个结构化源表格232 个不区分大小写的规范 DOI 标识

数据集配置

数据集包含 8 个配置,每个配置仅有一个 test 拆分。配置概览如下:

配置名称 问题数量 问题类型
multiple_choice_single_varying 1039 single_varying
multiple_choice_all_varying 552 all_varying
multiple_choice_single_varying_reference 850 single_varying_reference
multiple_choice_all_varying_reference 310 all_varying_reference
multiple_choice_single_varying_reference_control 850 single_varying_reference_control
multiple_choice_all_varying_reference_control 310 all_varying_reference_control
fill_in_blank_all_blank 552 all_blank
fill_in_blank_all_blank_reference 310 all_blank_reference

数据文件与仓库结构

  • 数据文件:JSONL 格式,位于 data/jsonl/ 目录。
  • 原始 JSON 文件:位于 data/original_json/
  • 提示模板:位于 prompts/
  • 示例预测文件:位于 examples/
  • 评估脚本:位于 evaluation/
  • 化学覆盖分析:位于 analysis/chemical_coverage/
  • 元数据与来源:位于 metadata/docs/
  • 完整性校验:位于 scripts/
  • 评审者工件:位于 reviewer_artifact/,包含完整提取、问题生成、推理、评估和验证包。

评估方法

  • 多项选择:预测应为从 id 到 0-based 选项索引的 JSON 映射。
  • 填空:预测应为从 id{condition_key: candidate_index} 字典的映射。
  • 评估指标:填空任务使用 Hit(命中率)、Strict Accuracy(严格准确率)和 Score | Hit(命中时的平均得分)。

提示与答案格式

  • 所有提示模板渲染完整的反应上下文,包括 constant_conditionsfixed_conditions(如适用)。
  • 多项选择答案:单个 0-based 整数。
  • 填空答案:条件键到 0-based 整数索引的 JSON 映射。

来源与来源管理

数据源自结构化基准输出,包括:

  • testsetV6/20260502_000057_multiple_choice
  • testsetV6/20260502_000115_fill_in_blank

额外来源清单文件位于 metadata/docs/

化学覆盖范围

覆盖审计以 552 个父级筛选表格 为计数单位,报告了:

  • 20 种互斥的主要转化类别和多标签键变化、能量输入、催化剂类别和自由基标签。
  • 26 个结构化条件字段的普遍性和候选集元数。
  • 341 个独特标准产物、232 个非空 Bemis-Murcko 骨架、理化描述符和 Morgan 指纹多样性。

预期用途

  • 离线评估反应条件推荐系统。
  • 可控比较不同任务(多项选择、参考增强、填空)下的模型行为。
  • 研究参考条件、候选空间构建和评分规则对模型性能影响的消融研究。

非预期用途

  • 未经验证不适用于直接实验室部署、自主决策、开放反应规划或评估绝对反应成功率。

负责任 AI 说明

  • 局限性与偏差:测量的是离线选择能力,而非实验室执行能力;继承文献发表偏差;评分相对于源表格内的最佳选项,而非化学搜索空间的全局最优。
  • 个人或敏感信息:不包含个人、人口统计、医疗等敏感属性。
  • 社会影响:可促进标准化基准测试,但需注意评分可能被过度解读为实验室就绪性证明。
  • 合成数据:数据集中不包含合成反应记录。

加载示例

python from datasets import load_dataset ds = load_dataset("rxnoptbench-review/RxnOptBench-review", "multiple_choice_single_varying", split="test") print(ds[0]["id"])

完整性校验

可通过以下脚本进行本地审计: bash python scripts/validate_hf_release.py python scripts/validate_prompt_context.py

搜集汇总
数据集介绍
RxnOptBench-review 数据集图片
构建方式
RxnOptBench-review 数据集专为离线评估反应条件推荐系统而构建,其生成过程严谨且系统化。该基准测试源自经过严格审阅的结构化数据源,基于552张母体筛选表格与232个规范化的文献DOI标识,最终衍生出4,773个问答实例。构建流程涵盖了从原始文献表格中提取反应条件信息、设计多轮注释与审核机制,并生成多种任务格式,包括多选与填空两大类别。每个实例均保留了完整的反应上下文,并采用确定性随机打乱策略确保候选选项的公正性,同时存储了详细的元数据以支持后续评估与可重复性验证。
特点
该数据集的核心特色在于其多维度的任务设计与精细化的化学空间覆盖。它提供了八种不同的配置,涵盖单变量与全变量选择、是否包含参考条件及控制组,以及填空任务,从而支持对模型在不同评估场景下的表现进行解耦分析。数据集的化学覆盖审计报告了20种互斥的反应类别、多标签的化学键变化、能量输入及催化剂类型等信息,并涵盖了341种独特的产物与232种Bemis-Murcko骨架,充分体现了反应空间的多样性与异质性。此外,评估指标针对填空任务设计了分层评价体系,综合考虑命中率、严格准确率及条件分数,以全面刻画模型的预测能力。
使用方法
用户可通过Hugging Face的datasets库轻松加载该数据集的不同配置,例如使用`load_dataset("rxnoptbench-review/RxnOptBench-review", "multiple_choice_single_varying", split="test")`即可获取特定任务格式的数据。对于模型评估,多选任务要求预测结果为从0开始的整数索引,填空任务则需输出条件键到候选索引的映射字典。官方提供了与原始JSON格式兼容的评估脚本,位于`evaluation/`目录下,确保评估结果的字节级可复现性。建议用户在本地运行`scripts/validate_hf_release.py`进行完整性审计,以验证所有4,773个问题实例的提示上下文与随机化元数据的正确性。
背景与挑战
背景概述
RxnOptBench-review数据集由匿名研究团队于2026年创建,旨在为反应条件推荐系统提供离线评估的标准化基准。该数据集源自《OrganicMethodBench》项目,整合了552张结构化源表格与232个规范化的DOI标识,构建了包含4,773个问题实例的测试集。其核心研究在于评估模型在多种任务格式下的表现,包括多项选择、参考增强及填空式条件选择。该基准的发布对计算化学和人工智能交叉领域产生了深远影响,为反应条件优化研究提供了可复现的标准化评估框架,推动了条件推荐系统的可靠性与可比性提升。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,反应条件推荐系统需应对文献中条件参数的高维性与稀疏性,以及实验观测组合对全局最优解的偏离,这使得模型难以在有限候选空间中准确预测最优条件。在构建过程中,源表格的解析与过滤面临巨大挑战,论文中模糊的条件字段、缺失的SMILES表示或非表格化报告风格导致大量数据被排除,同时文献固有的发表偏见也使得覆盖范围在反应类别、底物和条件类型上呈现不均。
常用场景
经典使用场景
在有机合成与反应条件优化的交叉研究领域,RxnOptBench-review作为一套精心设计的基准评测集,其最为经典的应用场景在于对反应条件推荐系统的离线性能进行标准化评估。该数据集通过构建多样化的任务格式——包括单条件可变与全条件可变的单选题、参考增强型变体以及填空式条件选择——来全面检验模型在有限候选项空间内对文献中观测到的反应条件进行排序或挑选的能力。研究人员可借助这一固定且得到严格审计的测试集,系统性地对比不同架构或训练策略的语言模型在反应条件推理任务上的表现。
衍生相关工作
RxnOptBench-review的出现催生了多个富有成效的衍生研究方向。一方面,研究者利用其提供的多选题和填空题变体开展消融实验,深入分析了参考条件、候选项空间构建方式以及评分规则对模型性能的影响。另一方面,该基准的细粒度化学覆盖分析报告,包括对20种互斥的反应类型、341个独特产物以及232个Bemis-Murcko骨架的统计,为开发面向特定化学子领域的专用模型提供了数据支撑。此外,数据集中填充式填空任务所采用的'候选洗牌v3'策略与严格审计流程,也启发了后续工作对基准评测的公平性与可重复性进行更深入的探讨。
数据集最近研究
最新研究方向
RxnOptBench-review数据集聚焦于有机反应条件推荐系统的离线评估,通过多选与填空等任务形式,系统性地评测模型在受限候选空间内基于文献反应条件进行选择与排序的能力。该基准涵盖了4,773个问题实例,源自552张结构化源表,并提供了详细的化学覆盖度审计,包括反应类别、条件字段多样性及产物骨架分布。在人工智能驱动的化学合成自动化浪潮中,该数据集回应了反应条件优化中缺乏标准化评估框架的紧迫需求,其引入的参考条件变体与候选空间控制机制,为揭示模型依赖真实文献依据还是模式记忆提供了关键洞察。作为NeurIPS 2026评估与数据集轨道的提交物,RxnOptBench不仅推动了反应条件推荐系统的可重复性研究,更通过严格的跨源表推导与扰动设计,为弥合计算预测与实验室验证之间的鸿沟树立了重要标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务