nlpscu/Beyond-Flesch
收藏官方服务:
资源简介:
一个预处理的ScienceQA子集,用于K-12教育文本难度分类,包含静态和基于LLM提示的特征,以复现Rooein等人(2024)的Beyond Flesch-Kincaid研究。
A preprocessed subset of ScienceQA for K-12 educational text difficulty classification, along with the static and LLM-derived prompt-based features we use to reproduce Rooein et al. (2024) — Beyond Flesch-Kincaid.
提供机构:
nlpscu搜集汇总
数据集介绍

构建方式
Beyond-Flesch数据集源自ScienceQA语料库,旨在对K-12教育文本进行难度分类。构建时,首先从完整的ScienceQA数据集中移除包含图像的条目,并将12个年级层次压缩为三个学段:小学(1-5年级)、初中(6-8年级)和高中(9-12年级)。通过对合并后的full_text字段进行去重,每个学段随机抽样1516条,形成4548条平衡样本,随后按80/20比例分层划分为训练集与测试集。静态可读性特征利用textstat、nltk、spacy及WordNet计算,而提示驱动特征则通过Gemma-7B-IT模型在63组提示下生成。此外,借助Llama-3.1-8B-Instruct作为评判员,为来自15个不同语料库的文本统一标注教育难度标签,构建了LLM-as-a-judge子集。为了验证模型的鲁棒性,还设计了包含50条手工挑选条目的对抗性基准AdvConcept-50,其中表面复杂度与概念深度刻意分离。
特点
该数据集的核心特点在于其多维度与对抗性设计。静态指标子集提供了46种基于传统可读性公式的特征,深入剖析文本的词汇与句法复杂度;而提示指标子集则包含63组由大语言模型生成的动态特征,捕捉上下文相关的语义难度。LLM-as-a-judge子集跨越15个不同语料库,涵盖新闻、问答、阅读理解等多个领域,标签由统一模型生成,确保一致性。对抗性基准AdvConcept-50开创性地将表面可读性与课程概念层次解耦,例如用简单句式表述高中生物学概念,或反之,以此评估模型是否真正理解内容深度而非仅依赖语言形式。每条对抗样本的真实难度均锚定于美国NGSS或Common Core课程标准,标注过程透明可追溯。
使用方法
数据集通过HuggingFace Datasets库加载,用户可根据需求选择不同配置。默认配置(default)包含完整的训练集与测试集,适合直接训练与评估教育文本难度分类模型。静态指标(static_metrics)与提示指标(prompt_metrics_gemma_7b)配置分别用于复现基于传统特征与基于LLM特征的分类实验。LLM-as-a-judge配置提供训练、验证及域外测试划分,适用于领域自适应(DANN)等迁移学习研究。对抗性配置(adv_concept)专用于评估模型的表面偏差鲁棒性,仅包含测试集。合成数据配置(claude_qa、deepseek_qa、mistral_qa)则为跨生成模型一致性与难度平衡研究提供支持。用户可直接将education_level或education_level_judge列作为分类目标,在多任务或单一任务框架下进行实验。
背景与挑战
背景概述
Beyond-Flesch数据集诞生于2024年,由研究团队基于Rooein等人同年发表于BEA研讨会的开创性工作构建而成。该数据集聚焦于K-12教育文本难度分类这一核心研究问题,旨在突破传统Flesch-Kincaid等静态可读性指标的局限。研究团队从ScienceQA数据集中精心筛选并平衡了4,548条样本,覆盖小学、初中和高中三个教育阶段,通过融合46项静态特征与63项基于Gemma-7B-IT大语言模型的提示度量,为教育文本难度评估提供了全新视角。该数据集还创新性地引入了LLM-as-a-judge框架,整合15个语料库的27,563条标注文本,显著提升了跨领域难度分类的泛化能力,对教育科技领域产生了深远影响。
当前挑战
该数据集主要面临两大挑战。其一,教育文本难度分类的领域问题在于传统可读性指标仅关注词汇和句法复杂度,无法捕捉概念深度与知识层级,导致对‘表面易而概念难’(如简短的细胞分裂问题)或‘表面难而概念易’(如复杂句子描述简单常识)的场景判断失准。为此,研究团队构建了AdvConcept-50对抗性基准,专门暴露这种表面特征偏差。其二,构建过程中遭遇数据标注不一致与标签噪声挑战,多数语料库缺乏权威年级标签,团队采用Llama-3.1-8B大模型作为统一评判标准,在15个异构语料库上生成一致的三级难度标注,同时通过SHA-256去重与类别加权采样缓解类别不平衡问题。
常用场景
经典使用场景
Beyond-Flesch数据集的核心价值在于为K-12科学教育文本的难度分类任务提供了一个经过精心预处理和标注的基准数据集。它源自ScienceQA,通过将12个年级水平整合为小学、初中、高中三个层级,并剔除含图像样本,构建了平衡的训练与测试集。研究者可利用其提供的46种静态可读性特征与63种基于Gemma-7B模型的提示衍生特征,复现或改进Rooein等人提出的超越传统Flesch-Kincaid度量的文本难度评估方法。该数据集特别适合用于对比传统统计特征与大型语言模型特征在判别教育文本复杂性方面的效能差异。
衍生相关工作
Beyond-Flesch数据集激发了多项具有影响力的衍生研究。其中,基于联合对抗域适应的‘大语言模型作为裁判’(LLM-as-a-Judge)框架利用该数据整合了15个不同来源的可读性语料库,通过统一的难度标注方案训练出具有跨域泛化能力的分类器。此外,研究者基于该数据集证明了参数高效微调(如LoRA)的Phi-3.5-mini模型能在对抗样本上取得满分,推动了对轻量级、高鲁棒性教育文本模型的探索。合成数据生成工作亦以此为基础,使用DeepSeek、Claude和Mistral等模型产出了平衡的等效数据集,为数据稀缺场景下的模型训练提供了新范式。
数据集最近研究
最新研究方向
Beyond-Flesch数据集的最新研究方向聚焦于突破传统可读性公式(如Flesch-Kincaid)的局限,通过融合静态文本特征与大语言模型驱动的提示特征,构建面向K-12科学教育文本的细粒度难度分类框架。该工作以ScienceQA基准为基础,创新性地引入对抗性评估基准AdvConcept-50,刻意解耦表面可读性与课程概念深度,揭示当前分类模型对句子长度、词汇复杂度等表层特征的过度依赖。研究同时探索了LLM-as-a-judge范式,利用Llama-3.1-8B-Instruct生成跨15个多样化语料库的统一难度标签,并借助深度对抗神经网络(DANN)在类别不平衡场景下实现鲁棒学习,为教育文本的自动分级评估开辟了融合静态统计与语义理解的新路径。
以上内容由遇见数据集搜集并总结生成



