遇见数据集

johnny-w/flower-named-reactions-hard

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为flower-named-reactions-hard,是一个以verl RL格式存储的困难命名反应机制数据集,由Gemini生成,作为数据集johnny-w/flower的伴生数据集。数据源标签为named_reaction_synthetic_hard_verified。数据集包含326个训练样本和36个验证样本,覆盖10个困难命名反应家族,如Fischer吲哚合成、Shapiro反应等。这些机制经过生成、原子映射和RDKit工具包验证流程(current_verified_toolkit_flash管道)。需要注意的是,这是一个负面结果数据集,未在最终模型中使用,因为在实验中发现它混合到强化学习训练中会降低Fukuyama性能(例如导致精确pass@1得分下降),并可能使模型偏离真实化学分布。数据集仅建议用于复现合成数据不匹配的发现,而非改进模型。模式结构包括data_source、prompt(verl提示格式的聊天消息列表)、ability(任务标签)、reward_model.ground_truth(真实机制轨迹,以FlowER风格原子映射SMILES表示)和extra_info(包含难度、家族和名称等信息)。

The dataset is named flower-named-reactions-hard, containing Gemini-generated hard named-reaction mechanisms in verl RL format, serving as a companion to the dataset johnny-w/flower. The data_source tag is named_reaction_synthetic_hard_verified. It includes 326 train and 36 validation mechanisms across 10 difficult named-reaction families, such as Fischer Indole Synthesis, Shapiro Reaction, etc. These mechanisms are generated, atom-mapped, and verified with an RDKit toolkit pass (the current_verified_toolkit_flash pipeline). Note that this is a negative result subset archived for completeness; it was mixed into RL training in abandoned experiments and degraded Fukuyama performance (e.g., reducing exact pass@1 scores), shifting the model away from the real-chemistry distribution. It is recommended only for reproducing the synthetic-data-mismatch finding, not for model improvement. The schema follows verl RL format with fields: data_source, prompt (list of chat messages), ability (task tag), reward_model.ground_truth (ground-truth mechanism trajectory in FlowER-style atom-mapped SMILES), and extra_info (containing difficulty, family, and name).

提供机构:
johnny-w
搜集汇总
数据集介绍
johnny-w/flower-named-reactions-hard 数据集图片
构建方式
该数据集为有机化学领域中的经典命名反应提供了高难度的合成机理数据,由Gemini模型生成后,经过原子映射与RDKit工具包的严格验证流程构建而成。数据源自`johnny-w/flower`数据集,并通过`current_verified_toolkit_flash`管线进行校验,最终收录了326条训练样本与36条验证样本,覆盖十大难度较高的命名反应家族,如Fischer吲哚合成、Shapiro反应及电环化开环与Diels-Alder级联反应等。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载该数据集,使用`load_dataset("johnny-w/flower-named-reactions-hard")`命令即可获取。数据集默认包含训练与验证两个划分,可直接用于强化学习训练或机理预测任务的基准测试。鉴于其负向结果特性,建议仅在验证合成数据对模型分布影响的研究场景中调用,而非作为提升模型性能的数据源。
背景与挑战
背景概述
在计算化学与有机合成领域,基于强化学习的逆合成分析与反应机理预测正逐渐成为研究热点。flower-named-reactions-hard数据集由研究者johnny-w于近期构建,专注于10类困难人名反应(如Fischer吲哚合成、Shapiro反应等)的机理建模。该数据集包含326条训练样本和36条验证样本,每条样本均经原子映射与RDKit工具流水线验证,旨在为强化学习微调提供高质量的负例数据。然而,实验表明该数据集引入的合成数据会偏移模型对真实化学分布(如福山偶联反应)的拟合,在v9~v11实验中导致性能退化(如GSPO v11仅达2.4%精确pass@1),最终未被纳入最终状态最优(SOTA)模型。该工作揭示了合成数据与真实分布不匹配的关键问题,对后续数据集构建与模型训练策略具有警示意义。
当前挑战
首先,领域问题的核心挑战在于合成数据与真实化学分布间的分布偏移:尽管硬人名反应数据集经过严格验证,但在强化学习训练中,模型过度偏向此类合成示例,削弱了对福山反应等目标任务的泛化能力,体现为准确率从8.3%骤降至2.4%。其次,构建过程中面临验证难度高与样本量有限的矛盾,10个反应家族仅生成326条样本,且需依赖RDKit工具流实现原子映射与一致性检查,确保机理轨迹的物理合理性。此外,如何设计负例数据(如困难反应)而不破坏模型对简单且真实反应的稳健性,成为数据筛选与混合比例优化中亟待解决的难点。
常用场景
经典使用场景
在化学信息学与计算化学的交汇领域,该数据集专为强化学习框架下的有机反应机理预测任务而设计。其核心用途在于训练和评估能够生成复杂命名反应完整原子映射机理路径的AI模型,具体体现为将给定的反应物分子序列转化为符合FlowER格式的SMILES字符串轨迹。数据集聚焦于十类公认的艰深命名反应家族,如Fischer吲哚合成、Shapiro反应及Birch还原-烷基化串联过程,通过精心设计的prompt结构(包含角色与内容字段)与ground_truth机制轨迹的配对,为模型提供了高难度的学习样本。尽管最终因分布偏移问题未被采纳于最优模型,但其在强化学习训练流程中的中间产物角色,使其成为研究合成数据对模型学习偏差影响的绝佳实验平台。
解决学术问题
该数据集直面有机合成领域一个核心学术难题——如何利用计算手段精准预测具有多步、立体选择性和复杂环系构筑特征的命名反应完整机理。此类反应通常涉及碳骨架重排、区域选择性开环及多个反应位点的同步活化,传统基于模板或物理模拟的方法难以泛化至非经典路径。通过提供经RDKit工具包严格验证的原子映射轨迹,该数据集为探究强化学习算法在多步推理任务中的表现上限提供了基准。其被证实的负向结果(即掺入后显著降低真实化学分布上的Fukuyama反应性能)揭示了合成数据与真实反应分布间存在的根本性统计差异,推动学界重新审视数据增强策略在符号推理密集型化学任务中的适用边界。
实际应用
尽管该数据集在最终管线中被弃用,但其在设计自动化逆合成分析系统的工业级模型中仍具有独特价值。制药企业与化学研发机构可利用此类高难度合成数据来测试候选模型在极端反应边缘案例上的鲁棒性,尤其是在快速搭建新药中间体的复杂级联反应场景中。例如,研究Rh催化氢甲酰化或Aza-Cope/Mannich级联等近年重现性较差、机理尚存争议的反应时,该数据集可作为负样本库,辅助工程师通过对比实验识别模型过度依赖人工合成模式的现象。其与已验证的真实反应数据进行对比测试的结果,可直接指导在线学习系统中主动采样策略的调整,避免因引入噪声数据而导致的反应预测性能崩解。
数据集最近研究
最新研究方向
当前,在有机化学与人工智能的交叉领域中,基于合成路线的逆合成分析与反应机理预测成为前沿热点。flower-named-reactions-hard数据集聚焦于十大复杂命名反应的原子映射机理,其通过RDKit工具链进行严格验证,为强化学习驱动的反应路径优化提供了高难度验证基准。值得注意的是,该数据集揭示了合成数据分布偏移的潜在风险——当混合至Fukuyama反应训练时,模型性能显著退化,凸显出“真实化学分布”相对于大规模合成数据的优先性。这一发现引导研究者重新审视强化学习训练策略中数据源的选择与配比,强调以真实实验数据为核心的SOTA模型构建路径,为提升反应预测的泛化性与化学合理性指明了关键方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务