遇见数据集

AIriskEval-edu

收藏
arXiv2026-07-28 更新2026-07-04 收录
官方服务:

资源简介:

AIriskEval-edu数据集由马德里自治大学等机构创建,旨在评估K-12教育场景中教学解释的潜在教学风险。该数据集包含1,639条教学解释,对应170个来自ScienceQA的精选K-12问题,共计8,195个二元标签,其中785个带有可解释性注释。数据来源包括人类教师参考解释和通过Gemini 3.1 Pro API生成的合成解释,这些解释基于六种模拟教师配置文件生成,并经过半自动标注和约30%的教师人工审核。该数据集主要应用于教育人工智能领域,用于训练和评估本地大语言模型评估器,以检测教学解释在事实准确性、深度与完整性、焦点与相关性、学生水平适当性和意识形态偏见等五个维度的风险,从而提升AI生成教育内容的安全性与可靠性。

AIriskEval-edu-db2 is a dataset developed by institutions including the Autonomous University of Madrid, specifically designed to evaluate pedagogical risks of AI-generated explanations in K-12 education scenarios. This dataset contains 1,639 explanatory texts derived from 170 curated ScienceQA questions, covering multiple disciplines including science, language arts, and social sciences. Each entry corresponds to one human teacher-written explanation and 11 AI-generated explanations produced by large language models (LLMs) simulating different pedagogical risk configurations. The dataset was constructed via a semi-automated pipeline: first, simulated explanations were generated based on predefined pedagogical risk dimensions and subjected to binary risk annotation; subsequently, expert teachers verified the annotation results, and added structured interpretability annotations including risk localization and risk description for the identified risk cases. This dataset is primarily applied in the educational technology field, aiming to train and evaluate LLM-based pedagogical auditors to automatically detect multi-dimensional risks in pedagogical explanations, including factual accuracy, depth and completeness, focus and relevance, appropriateness for student levels, and ideological bias, thereby enabling monitoring and quality assurance of instructional content in digital learning environments.

创建时间:
2026-07-28
原始信息汇总

AIriskEval-edu 数据集概述

基本信息

  • 数据集名称:AIriskEval-edu
  • 来源地址:https://github.com/BiometricsAI/AIriskEval-edu
  • 当前状态:论文正在审稿中(Paper under review)

说明

  • 该数据集处于早期公开阶段,论文尚未正式发表。
  • README文件中暂无详细的数据集描述、内容示例、使用方式或领域说明。
搜集汇总
数据集介绍
AIriskEval-edu 数据集图片
构建方式
在人工智能技术深度嵌入K-12教育场景的背景下,针对当前教育内容评估资源匮乏的现状,AIriskEval-edu-db2数据集应运而生。该数据集以170个经过精心筛选的ScienceQA试题为根基,涵盖科学、语言艺术和社会科学等多元学科。其构建过程独具匠心:为每个问题配备一名人类教师撰写的参考解答,并利用Gemini 2.5 Pro大语言模型,通过提示工程与少样本学习技术,驱动六种不同教学风格(如模范型、冗长型、不精确型等)的模拟教师角色生成11份解释文本,总计达1,639份。标注工作分为两阶段:先通过半自动流程为每份解释赋予涵盖事实准确性、深度与完整性、焦点与相关性、学生水平适切性及意识形态偏见五个维度的二元风险标签;随后对所有被标记为有风险的案例,进一步添加结构化的可解释性注释,包括风险文本定位与风险描述,并由资深教育专家进行人工校核,确保标注质量。
特点
该数据集最为显著的特点在于其精细化的多维风险评估框架与可解释性深度。有别于传统仅关注简单二元判断的资源,AIriskEval-edu-db2构建了与权威教育标准严格对齐的五维风险评分体系,能够系统性地捕捉从事实错误、认知负荷到意识形态偏见等多种教学失范形态。更值得强调的是,针对每一个被鉴定为有风险的样本,数据集均提供了精确的风险文本片段定位以及基于教育理论的自然语言解释,这使得风险评估不再是黑箱操作,而是具备了可追溯、可验证的透明特质。此外,数据集通过模拟多种具有特定教学缺陷的教师角色,创造性地囊括了真实教育场景中可能出现的复杂问题模式,极大增强了数据的生态效度与挑战性。
使用方法
AIriskEval-edu-db2数据集的用途围绕训练与评估基于大语言模型的教育解释自动审计系统展开。使用者可构建评估流水线,将包含学生问题、年级水平及待评解释的输入送入模型,要求其依据数据集中定义的五维风险准则输出结构化结果。具体的评估任务涵盖二元风险检测与可解释性分析两个层次:在检测层面,模型需为每个维度输出0或1的风险标识;在可解释性层面,一旦检测到风险存在,模型还需提取触发预警的具体文本区间,并生成说明原因的自然语言描述。为促进本地化、隐私友好的部署,该数据集特别适合采用低秩适配等参数高效微调技术,在轻量级模型(如Llama 3.1 8B)上通过五折交叉验证进行训练,从而在保护学生与机构数据私密性的前提下,达成逼近甚至超越前沿商业模型的风险审计效能。
背景与挑战
背景概述
随着大型语言模型在K-12教育场景中的广泛应用,如何确保AI生成的教学解释兼具准确性与教学安全性成为核心议题。为此,由马德里自治大学BiometricsAI与GHIA研究团队于近期共同创建了AIriskEval-edu-db2数据集。该数据集以170个经筛选的ScienceQA问题为根基,涵盖科学、语言艺术与社会科学多学科领域,通过构建六种典型教师角色(如随意型、不准确型等),利用Gemini 2.5 Pro生成了1639条教学解释,并辅以人工教师的权威参照。研究团队创新性地提出了涵盖事实准确性、深度完整性、焦点相关性、适龄性与意识形态偏见的五维教学风险评估框架,并引入风险定位与描述的可解释性标注。该数据集为训练和评估基于大语言模型的教学审计器提供了关键资源,推动了教育AI向可解释、可问责的方向发展。
当前挑战
该数据集所应对的核心挑战在于多维度教学风险的精准识别与可解释性构建。在领域问题层面,当前教育AI评估多聚焦于通用问答质量,缺乏针对K-12教学解释中细粒度风险的联合检测框架,尤其是兼顾事实谬误、认知负荷、发展适配性与隐性偏见等正交维度的全面评估。在数据集构建过程中,挑战尤为显著:首先,如何通过角色提示工程与少量示例生成风格迥异但教学风险真实可控的教师解释,需精细调控生成策略以避免人工痕迹;其次,半自动标注流程中需确保二元风险标签与可解释性标注(风险位置与描述)的一致性,经历两阶段专家审核——先审查约30%数据以验证标注协议可靠性,再对评估分歧案例进行复核;此外,意识形态偏见维度因标注稀疏性(仅20-90个正样本)带来严重类别不平衡,需通过扩充生成与专家校审予以缓解。这些挑战共同对模型的泛化能力与本地化部署的隐私保护提出了更高要求。
常用场景
经典使用场景
在教育人工智能领域,AIriskEval-edu-db2被设计用于训练和评估基于大语言模型的审计系统,以完成对K-12教学内容的可解释性教学风险检测。该数据集包含1,639条来自170个ScienceQA问题的解释,涵盖科学、语言艺术和社会科学多学科,每条问题均配有人类教师编写的标准解释及由大语言模型模拟的11种不同教师角色生成的解释,这些角色覆盖了从卓越到讽刺的多样化教学风格。研究者可利用该数据集构建细粒度的教学风险评估模型,对解释内容在事实准确性、解释深度与完整性、专注度与相关性、学生水平适切性以及意识形态偏见五个维度上进行二元风险分类与可解释性标注。
衍生相关工作
基于AIriskEval-edu-db2,研究者进一步拓展了多个经典工作方向。在评估维度上,衍生工作将当前的五维度教学风险标准扩展至多轮对话教学场景,构建了支持动态师生交互的教学质量评估框架。在模型能力方面,该数据集推动了轻量化模型(如Llama 3.1 8B)通过监督微调在风险检测与解释性评估上超越前沿专有模型的研究路线,验证了局部可部署模型在教育审计中的可行性。此外,该数据集还与多模态学习分析平台相结合,融合生物特征与行为线索对学习过程进行整体建模,并延伸至游戏化环境下的社会工程学风险评测,形成了面向多元化教育技术生态的系统性风险监控体系。
数据集最近研究
最新研究方向
在当前人工智能教育技术迅猛发展的背景下,AIriskEval-edu-db2数据集聚焦于K-12教学场景中由大语言模型(LLM)引发的多维度教学风险可解释评估。该研究突破了传统仅依赖二元风险标签的局限,引入了风险定位与风险描述的结构化可解释性注释,为构建透明化、可审计的教学质量监控框架提供了创新资源。前沿方向集中于利用轻量化本地部署的Llama 3.1 8B模型,通过监督微调使其在无需依赖云端API的条件下,在事实准确性、深度与完整性、焦点相关性、学生适切性及意识形态偏见等五个维度上,逼近甚至超越Gemini 2.5 Pro与GPT 5.5等强基模型的表现。这一进展不仅强化了教育AI审计的隐私保护能力,也为实现低成本、高可靠性的课堂内容自动化风险筛查开辟了新路径,对推动负责任的人工智能教育应用具有深远影响。
相关研究论文
  • 1
    AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations马德里自治大学·生物识别人工智能实验室; 马德里自治大学·GHIA实验室; 拉斯帕尔马斯大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务