遇见数据集

scientific-sft-grpo-data

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集包含两个配置(grpo和sft),旨在支持自然语言处理中的高级任务,特别是推理、因果分析和指令遵循。grpo配置提供了结构化的任务实例,每个实例包含唯一的任务ID和论文ID、一个由角色和内容组成的对话式提示、任务描述、参考推理过程、参考答案、支持证据、详细的机制步骤列表、表示原因与效果关系的因果链接列表、完成任务所需的概念列表,以及数据的来源许可证和URL。该配置包含训练集(8个样本)、验证集(4个样本)和测试集(5个样本),总计17个样本。sft配置则侧重于监督微调,每个实例包含任务ID、论文ID、一个由角色和内容组成的提示、一个对应的由角色和内容组成的补全(响应),以及来源信息。该配置包含训练集(19个样本)和验证集(1个样本),总计20个样本。两个配置的数据均以结构化格式组织,适用于训练和评估能够进行多步推理、因果解释和遵循复杂指令的语言模型。

This dataset comprises two configurations (grpo and sft), intended to support advanced natural language processing (NLP) tasks, particularly reasoning, causal analysis, and instruction following. The grpo configuration provides structured task instances, each including a unique task ID and paper ID, a dialogic prompt structured with role and content pairs, task description, reference reasoning process, reference answer, supporting evidence, a detailed list of mechanistic steps, a list of causal links representing cause-effect relationships, a list of concepts required for task completion, as well as the data source license and URL. This configuration includes a training set (8 samples), a validation set (4 samples), and a test set (5 samples), totaling 17 samples. The sft configuration focuses on supervised fine-tuning, with each instance containing a task ID, paper ID, a prompt consisting of role and content pairs, a corresponding completion (response) composed of role and content pairs, and source information. This configuration includes a training set (19 samples) and a validation set (1 sample), totaling 20 samples. Data from both configurations are organized in structured formats, suitable for training and evaluating language models capable of multi-step reasoning, causal explanation, and following complex instructions.

创建时间:
2026-07-19
原始信息汇总

数据集概述

该数据集名为 scientific-sft-grpo-data,由 lamm-mit 组织提供,包含四个子配置(config_name),分别用于不同的训练和评估场景。

配置与规模

配置名称 用途 训练集(样本数) 验证集(样本数) 测试集(样本数) 总大小(字节)
grpo GRPO 训练 8 4 5 73,265
scientific_design_grpo 科学设计 GRPO 训练 500 75 100 3,035,948
scientific_design_sft 科学设计 SFT 训练 500 75 2,475,963
sft SFT 训练 19 1 44,297

特征字段

  • grpo:包含 task_id、paper_id、prompt(role 和 content)、task、reference_reasoning、reference_answer、reference_evidence、mechanism_steps(字符串列表)、causal_links(cause 和 effect)、required_concepts(字符串列表)、source_license、source_url。
  • scientific_design_grpo:包含 task_id、paper_id、task_family、prompt(role 和 content)、task、required_constraints(字符串列表)、evaluation_criteria(字符串列表)、acceptable_alternatives(字符串列表)、failure_modes(字符串列表)、source_license、source_url。
  • scientific_design_sft:包含 task_id、paper_id、task_family、prompt(role 和 content)、completion(role 和 content)、source_license、source_url。
  • sft:包含 task_id、paper_id、prompt(role 和 content)、completion(role 和 content)、source_license、source_url。

数据划分

每个子配置的数据按 split 划分,具体文件路径为:

  • grpo:train-、validation-、test-*
  • scientific_design_grpo:train-、validation-、test-*
  • scientific_design_sft:train-、validation-
  • sft:train-、validation-

许可与来源

  • source_license:记录了每个样本的原始许可信息。
  • source_url:提供了每个样本的原始来源链接。

数据来源

该数据集的数据来源于科学论文,具体通过 paper_id 字段标识,并结合 task_id 进行任务类型区分。

搜集汇总
数据集介绍
scientific-sft-grpo-data 数据集图片
构建方式
科学推理与实验设计是人工智能研究的前沿领域,scientific-sft-grpo-data数据集正是在此背景下应运而生。该数据集通过系统性地从已发表的科学论文中提取结构化信息来构建,涵盖了两个核心子数据集:grpo配置聚焦于因果推理任务,包含论文中的提示词、参考推理链、参考答案及因果链接等要素;而scientific_design_grpo与scientific_design_sft配置则专注于实验设计,收集了任务家族、约束条件、评估标准及失败模式等关键维度。整体数据集规模虽小但精心策划,训练集共包含19至500条样例,并划分了验证与测试子集,为后续模型训练提供了严谨的基准。
特点
该数据集最突出的特点在于其模块化的多层架构设计,细粒度地捕获了科学推理的维度。grpo配置不仅提供了标准的问题-答案对,还包含了机制步骤与因果链路的显式表示,使模型能够学习到推理的内部逻辑。而scientific_design_grpo配置则开创性地引入了约束条件与失败模式,使模型在生成实验方案时能规避常见陷阱。此外,数据集中每一条样本都携带了任务家族标签和来源许可证信息,确保了数据的可追溯性与伦理性,为科学领域的强化学习与监督微调提供了高质量的训练素材。
使用方法
研究人员可通过HuggingFace Datasets库便捷地加载该数据集,利用其提供的多个配置项灵活适配不同应用场景。对于监督微调任务,可选用scientific_design_sft或sft配置,直接调用prompt与completion字段进行序列到序列的训练;而对于基于规则优化的强化学习(GRPO)场景,则可利用grpo或scientific_design_grpo配置,其中包含了任务约束与评估标准,便于设计奖励函数。数据集的每条记录均以JSON格式结构化存储,支持按任务家族过滤,并可与原始论文通过source_url字段进行交叉验证,将知识注入基于科学的语言模型之中。
背景与挑战
背景概述
科学推理与实验设计是人工智能领域长期追求的核心能力,尤其在生物学、化学等具有高度因果复杂性的学科中,模型不仅需要理解自然语言描述的科学问题,更要能自主生成可验证的推理路径与实验方案。该数据集由多个配置组成,涵盖基于群体相对策略优化(GRPO)的强化学习数据、结构化科学实验设计数据以及监督微调(SFT)数据,其创建时间虽未明确标注,但针对的是大语言模型在科学推理与实验设计中的薄弱环节。核心研究问题在于如何构建高质量的因果关系与约束条件数据,以驱动模型在药物机制推断、实验方案生成等任务上实现从‘语言理解’到‘科学推理’的跃迁。该数据集通过提供显式的因果链、约束条件与失败模式,为科学领域大模型的训练与评估提供了结构化基准,有望推动AI在科学研究自动化与辅助发现中的应用边界。
当前挑战
该数据集所解决的领域问题在于科学推理中因果逻辑的形式化表征与可验证性挑战。现有大模型虽能生成流畅的科学文本,却难以保证推理步骤的因果一致性与实验设计的物理可行性,而该数据集通过引入‘因果链路’、‘必要约束’与‘评估准则’等结构化字段,迫使模型在显式约束下生成可靠的科学解释与方案。构建过程中面临的挑战包括:如何从海量科学文献中精准提取并规范化因果关系这一高知识密度信息;如何设计兼具领域覆盖度与训练有效性的实验设计模板,使得仅有500条训练数据的配置仍能泛化至多样化科学场景;以及如何平衡强化学习奖励模型对科学正确性的评估与模型生成多样性之间的张力。
常用场景
经典使用场景
在科学推理与实验设计的交汇之地,scientific-sft-grpo-data数据集犹如一座精心雕琢的桥梁,将大语言模型的训练锚定在严谨的科研土壤中。其经典使用场景聚焦于两大核心任务:其一是借助GRPO(Group Relative Policy Optimization)范式,引导模型在分子机制推理、因果链路分析等复杂科学问题上进行强化学习,通过参考推理步骤和参考答案的比对,锤炼模型的逻辑推演能力;其二是通过监督微调(SFT)配置,让模型基于精心设计的问题与完成对进行模仿学习,从而掌握构建实验方案、识别失败模式的多维技能。这些场景不仅涵盖了从病理机制到药物设计的跨学科知识,还为模型提供了结构化的因果约束和评估准则,使其在科学问答中展现出媲美人类专家的严谨性与创造性。
衍生相关工作
该数据集的问世催生了一系列富有深度的衍生工作,如同在科学推理的沃土上隆起的枝干。其中最具代表性的包括基于GRPO策略的科学解释生成框架,该框架利用强化学习的组对比机制,使模型在产生答案的同时输出透明的推理证据链,显著提升了科学问答的可审计性。另一项突出工作则将scientific_design_sft配置融入全自动实验规划系统,通过识别可替代方案与失败模式,构建出鲁棒性更强的实验设计本体。此外,研究者还借鉴其因果链接标注方法,开发了针对生物网络推理的专用预训练任务,推动了因果发现与大模型融合的边界。这些工作不仅验证了数据集的结构化设计对科学泛化能力的增益,更为未来的AI科学家系统提供了标准化测评的蓝本。
数据集最近研究
最新研究方向
该数据集名为scientific-sft-grpo-data,聚焦于科学推理与实验设计领域的强化学习与监督微调数据构建,其前沿研究方向围绕利用GRPO(Group Relative Policy Optimization)策略优化大语言模型的科学推理能力。当前热点事件包括AI for Science浪潮下,如何通过因果推理路径(如causal_links)和机制步骤(mechanism_steps)数据增强模型在科学文献中的逻辑链推理能力,尤其在分子机制推断与实验约束满足任务中。该数据集以细粒度的因果结构标注和多样化实验设计约束为特色,为构建可解释、可验证的科学AI系统提供关键支撑,对推动大模型在药物发现、材料设计等领域的可靠应用具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务