遇见数据集

SoChemDataset

收藏
github2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

SoChemDataset 是一个包含15,200多个物理基础教学轮次的数据集,涵盖119个中学化学实验,涉及10种学生角色,每个会话平均12.8轮,其中108个实验用于训练(1,080个会话),11个实验用于测试(110个会话)。实验内容涵盖酸碱指示剂、中和反应、沉淀反应等中学化学主题。

SoChemDataset is a dataset containing over 15,200 basic physical teaching rounds, covering 119 secondary school chemistry experiments involving 10 types of student roles, with an average of 12.8 turns per session. Specifically, 108 experiments (totaling 1,080 sessions) are used for training, while 11 experiments (totaling 110 sessions) are reserved for testing. The covered experimental content includes secondary school chemistry topics such as acid-base indicators, neutralization reactions, precipitation reactions, and others.

创建时间:
2026-06-08
原始信息汇总

数据集概述:SoChemDataset

SoChemDataset 是一个用于安全关键化学实验场景的物理驱动苏格拉底式教学数据集。它旨在解决大语言模型用于实验教学时出现的“幻觉式教学”问题,通过物理模拟确保教学的安全性与真实性。

核心信息

属性
名称 SoChemDataset
教学轮次 15,200+ 个
化学实验数 119个
学生人设 10 种
每轮平均对话数 12.8 轮
数据来源 多智能体大语言模型 + 物理模拟器
许可协议 CC BY 4.0

实验覆盖范围

数据集覆盖了119个中学化学实验主题,使用 XDL(实验描述语言) 定义,包括:

  • 酸碱指示剂与中和反应
  • 沉淀与溶解平衡
  • 燃烧与热分解
  • 电化学与氧化还原反应
  • 有机化学(酯化、取代、加成)
  • 气体的制备与收集

学生人设

每个实验模拟了10种不同的学生人设,以确保教学场景的多样性,包括:

  • 标准新手、标准平均、标准专家
  • 过度自信-笨拙、盲目自信
  • 沉默、好奇、叛逆、粗心、极度焦虑

数据集划分

数据集在实验主题层面进行划分,确保测试实验中的化学反应在训练期间完全未见:

  • 训练集:108个实验(1,080个对话会话)
  • 测试集:11个保留实验(110个对话会话)

数据生成流程

  1. 核心框架:SocraticChem,一种物理驱动的安全感知教学决策策略。
  2. 关键机制:物理神谕(Oracle)对学生动作进行模拟运行,生成包含安全标志和因果轨迹的报告。SocraticChem 据此决定是拦截/干预还是继续/搭建脚手架教学。
  3. 数据格式:数据被转换为结构化XML链式思维(CoT)格式,包含四个推理阶段:<FindNode>, <Verify>, <Diagnosis>, <Strategy>

模型与训练

基于该数据集,微调了 SoChem-LLM 模型:

  • 基础模型:Qwen-2.5-7B-Instruct
  • 微调方法:LoRA(秩r=32, 阿尔法α=64, 丢弃率0.05)
  • 训练轮次:3个epochs
  • 硬件:4×NVIDIA 4090 GPU(训练时间约3.5小时)

评估结果

SoChem-LLM 在多项评估指标上显著优于GPT-4o等基线模型,尤其在安全相关指标上表现突出:

关键指标 SoChem-LLM GPT-4o
拦截准确率 100.00% 75.00%
状态感知 70.32% 49.22%
安全性评分(0-10) 9.00 8.00
苏格拉底式评分(0-10) 8.51 7.15
节点准确率 74.96% 79.26%

消融研究

研究显示,对话历史、观察日志和环境状态对于模型性能至关重要。移除这些组件会导致节点跟踪、危险检测和安全性拦截等能力显著下降。

真实学生部署

在面向10名学生、共计93轮对话的实时教学环境中,SoChem-LLM获得了学生评价:

  • 苏格拉底式评分:8.9 / 10
  • 安全性评分:9.0 / 10
  • 物理真实性评分:4.5 / 5
  • 学习成果评分:4.8 / 5
搜集汇总
数据集介绍
SoChemDataset 数据集图片
构建方式
在科学教育与人工智能的交叉领域中,化学实验教学面临着一个根本性悖论:有效的探究式学习需要学生从错误中成长,但物理世界的安全约束却禁止某些危险操作。为破解这一困境,SoChemDataset应运而生。该数据集以苏格拉底式教学法为理论基础,将辅导过程形式化为一个可验证的安全感知决策策略。具体构建流程采用多智能体LLM框架与物理仿真引擎协同工作:首先通过批处理运行器(batch_runner_v2.py)模拟生成苏格拉底式对话数据,随后将原始数据转化为监督微调(SFT)格式,最后依据实验主题层级而非随机抽样方式进行训练集与测试集划分。数据集涵盖119个初中化学实验,每个实验与10种不同学生画像(包括标准新手、过度自信型、叛逆型等)组合,生成超过15,200个教学轮次,其中训练集包含108个实验(1,080个对话会话),测试集包含11个未见过的实验(110个会话)。
特点
SoChemDataset的核心创新在于其物理世界与教学逻辑的深度融合。其首要特点是采用物理预言机(Physics Oracle)进行干运行仿真,在生成回应前先模拟学生动作的物理后果,从而在危险行为实际发生前实现100%的安全拦截。数据集基于严格定义的轮次合约(Turn-Level Contract),每个教学轮次输出包含决策(拦截或继续)、策略(干预或支架式引导)和回应的三元组,并通过结构化XML思维链格式强制模型在回答前进行显式推理:依次执行节点定位、物理验证、认知诊断和策略选择四个阶段。此外,数据集的评估体系涵盖物理验证、LLM评估和标准NLP基准三个维度,其中SoChem-LLM在状态感知(70.32%)、安全评分(9.00/10)和教育真实性(0.30)等关键指标上显著超越GPT-4o等基线模型。实验还揭示了输入组件的重要性排序:对话历史对节点追踪至关重要,观察日志是危险检测的基础,环境状态提供安全约束的关键支撑。
使用方法
研究人员可按照标准化流程灵活运用此数据集。首先通过pip安装`torch`、`transformers`、`peft`、`vllm`等核心依赖库,随后运行`batch_runner_v2.py`生成对话数据,并通过`generate_sft_data.py`和`split_dataset_v1.0.py`完成格式转换与数据划分。微调阶段采用基于Qwen-2.5-7B-Instruct的LoRA方法,关键超参数包括秩32、Alpha值64、学习率2×10⁻⁴、余弦衰减调度和3个训练周期。推理方面提供vLLM批量推理脚本,支持在4台NVIDIA 4090 GPU上高效运行。评估体系涵盖主评估管道(节点准确率、安全性、ROUGE、BLEU、LLM评判)、NLP指标评估和安全性专项评估三大模块,并提供GPT-4o批量评分和人工评估框架作为参考基线。对于需要实时交互的场景,数据集还集成了基于FastAPI的API服务器,可与Unity 3D环境无缝对接,支持真实教学场景的实时部署。
背景与挑战
背景概述
在安全至关重要的化学实验教学领域,大型语言模型的应用面临根本性困境:有效的启发性教学需要学生从错误中学习,然而物理世界施加了严格的安全约束,使某些错误(如错误混合试剂可能引发爆炸)不可容忍。现有基于LLM的辅导系统往往优先追求文本合理性而非物理真实性,导致在真实实验中产生'幻觉式教学'。为应对这一矛盾,研究团队于近期提出了SocraticChem框架,将教学形式化为可验证、具备安全意识的决策策略。该框架的核心创新在于引入物理模拟引擎进行预运行仿真,在危险行为物理显现前即予以拦截。依托此框架,团队构建了SoChemDataset,包含超过15,200个物理可验证教学轮次,覆盖119个中学化学实验,并利用10种学生画像模拟多样教学场景。该数据集由清华大学等机构研究人员主导创建,瞄准化学实验教育中'从错误中学习'与'安全第一'的共生难题,为安全关键科学领域的人机交互教学树立了新标杆。
当前挑战
SoChemDataset所应对的核心挑战源于化学实验教学中的'教学悖论':传统启发性教学依赖试错学习,但化学实验中的某些错误(如加热密封容器导致爆炸)在物理世界中绝不允许发生,这要求教学系统必须在鼓励探索与绝对安全之间取得平衡。现有LLM缺乏物理常识,倾向于生成看似合理实则危险的指导,导致'幻觉式教学'泛滥。数据集构建过程中面临多重技术难关:首先,需要将抽象的化学知识转化为可仿真的物理模型,包括180种化学反应的热力学建模与拓扑感知模拟;其次,必须设计多样化的学生模型(如过度自信型、粗心型、叛逆型)以覆盖真实教学场景;再次,需要在实验主题层面划分训练集与测试集(108个训练实验vs11个未见实验),确保模型泛化能力经受严格考验;最后,还需建立包含硬逻辑验证(状态感知、危险拦截准确率)与软质量评估(苏格拉底评分、忠实度)的全面评测体系,以衡量模型在安全性与教学效果间的平衡表现。
常用场景
经典使用场景
SoChemDataset专为安全关键型化学实验教学场景设计,其最经典的使用场景是作为物理启发的苏格拉底式教学系统的核心数据基石。该数据集涵盖了119个中学化学实验的15200余条教学轮次,每条数据均包含基于物理引擎模拟的安全状态标记、学生行为意图、教师介入策略及因果溯源信息。研究者可利用此数据集训练或评估大语言模型在安全导向的化学实验辅导中的表现,尤其在需要模型实时判断学生操作是否危险、并生成具有物理一致性的引导性回应时,SoChemDataset提供了无可替代的验证平台。
解决学术问题
该数据集系统性地解决了大语言模型在安全关键领域应用中存在的“幻觉教学”这一学术难题。传统LLM驱动的教学系统往往优先追求文本流畅性,却背离了物理现实,导致在化学实验教学中可能推荐危险操作。SoChemDataset通过引入物理模拟器生成的因果追溯与安全标记,使模型能够学习到超越表面语义的物理约束,实现了100%的危险拦截准确率,并显著提升了状态感知能力(70.32% vs. GPT-4o的49.22%)。这一研究范式变革性地将教学建模从开放式生成转变为可验证的安全感知决策策略,为AI教育的安全性研究树立了新标杆。
衍生相关工作
SoChemDataset衍生了一系列具有学术影响力的相关工作,包括基于该数据集微调的SoChem-LLM模型本身,其为探究物理感知教学提供了强大的基线系统。围绕该数据集,研究者还构建了完整的消融实验体系,通过剔除环境状态、学生档案、观察日志或对话历史等输入组件,量化了各模态信息对教学安全性与有效性的贡献。此外,该工作还催生了基于XDL实验描述语言的标准化实验定义框架、多智能体协同的数据生成管线,以及涵盖节点准确率、状态感知度、拦截精度与LLM评判分数的综合评估套件,为人机协同的探究式学习研究开辟了新的技术路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务