遇见数据集

PREDACTBENCH

收藏
arXiv2026-08-03 更新2026-08-05 收录
官方服务:

资源简介:

PREDACTBENCH是一个面向教育领域风险预测的对话基准,旨在评估工具增强型LLM代理在受控工具噪声下的性能。它整合了两个子数据集:OULAD(来自英国开放大学的真实评估轨迹,涵盖32,593名学生、7个模块)和PREDACT-CS(基于60门计算机科学课程的真实最终成绩,合成生成每周得分轨迹,涉及53,401名学生)。创建过程中,PREDACT-CS通过保留真实成绩分布并注入k-NN预测器的校准噪声(准确率40%-80%)来模拟工具不可靠性。该基准聚焦于多轮对话中代理的时序推理、工具校准与信任校准,旨在帮助教师准确识别高风险学生并做出合理干预决策。

PREDACTBENCH is a dialogue benchmark for risk prediction in the education domain, designed to evaluate the performance of tool-augmented LLM agents under controlled tool noise. It integrates two subdatasets: OULAD (real assessment trajectories from The Open University in the UK, covering 32,593 students and 7 modules) and PREDACT-CS (synthetic weekly score trajectories generated based on real final grades from 60 computer science courses, involving 53,401 students). During its creation, PREDACT-CS simulates tool unreliability by retaining the real grade distribution and injecting calibrated noise from a k-NN predictor with an accuracy ranging from 40% to 80%. This benchmark focuses on temporal reasoning, tool calibration and trust calibration of agents in multi-turn dialogues, aiming to help teachers accurately identify high-risk students and make reasonable intervention decisions.

创建时间:
2026-08-03
搜集汇总
数据集介绍
PREDACTBENCH 数据集图片
构建方式
PREDACTBENCH的构建以教育领域的学业风险预测为核心,融合了真实与合成数据。其基础数据源自两个教育数据集:OULAD提供英国开放大学的真实评估轨迹,而PREDACT-CS则包含60门计算机科学课程的真实期末成绩与合成生成的每周成绩轨迹。基准通过设定时间截点,将学期划分为预测窗口与结果窗口,并利用k近邻算法构建概率预测工具,同时向工具输出注入受控噪声,以模拟实际部署中工具性能的不确定性。此外,基准还设计了12种工具,涵盖确定性查询、反事实模拟、概率预测及干预建议四大类,以支持多轮对话中的复杂决策。
特点
PREDACTBENCH的独特之处在于其将工具噪声内置于预测环节,而非外部扰动,从而真实反映高 stakes 场景中辅助工具的不可靠性。基准首创了对话级别的相对AI依赖(RAIR)与相对自主依赖(RSR)指标,用以评估人类或AI决策者在多轮交互中是否恰当地信任或质疑工具建议。此外,基准还提供了系统发起与用户发起两种对话模式,支持纵向推理与动态决策,并包含13个LLM代理与人类研究者的对照实验,揭示了当前模型在噪声工具下过度依赖或过度否决的失败模式,为构建稳健的AI决策支持系统提供了诊断工具。
使用方法
PREDACTBENCH的使用方法围绕多轮对话任务展开,研究者可配置课程、时间截点及学生样本,让LLM代理扮演教师或助手角色,通过工具调用预测学生风险并给出干预建议。用户既可让代理自主分析(系统发起),也可通过查询、过滤来挑战代理结论(用户发起)。评估时,研究者可计算初始与最终F1分数、RAIR/RSR指标以及覆盖行为,以量化决策质量与信任校准。基准还支持在不同目标工具准确率(40%-80%)下进行受控实验,并允许将AI代理表现与人类参与者进行对比,从而全面检验对话代理在噪声工具下的决策鲁棒性。
背景与挑战
背景概述
PREDACTBENCH 是由伊利诺伊大学厄巴纳-香槟分校的研究团队于2026年提出的基准数据集,旨在评估配备工具的对话代理在工具输出存在噪声时的人机协同决策能力。该数据集以教育领域为测试平台,利用英国开放大学的真实评估轨迹数据(OULAD)和包含60门计算机科学课程综合成绩的PREDACT-CS数据集,构建了系统发起分析和用户发起对话两种交互范式。其核心研究问题在于,当预测工具准确率在40%至80%之间波动时,大语言模型代理能否在纵向推理、多轮对话和部分可观测信息条件下,准确识别高风险学生并推荐干预措施。PREDACTBENCH不仅填补了现有基准在工具噪声、纵向推理和人类决策协同方面的空白,还通过引入会话级相对AI依赖和相对自主依赖等创新指标,为评估代理的校准信任机制提供了新维度,对教育、医疗和金融等高风险决策支持领域具有重要参考价值。
当前挑战
PREDACTBENCH所应对的领域挑战在于,现有任务型对话和工具使用基准普遍假设工具输出完美无误,忽略了真实部署中工具噪声和人类信任不确定性的耦合影响。它要求代理在部分纵向证据、多轮对话状态维护和不确定工具输出三者交融的条件下,实现合理的决策支持,这远超出传统状态跟踪和动作正确性评估的范畴。构建过程中,团队面临将校准噪声精确注入k-NN预测器、确保预测置信度与准确率可控失衡,以及合成PREDACT-CS周度轨迹以匹配真实最终成绩等难题。此外,如何设计涵盖确定性查找、反事实模拟和概率预测的多类工具接口,并在首个人机对比研究中平衡代理间与人类决策的评估,亦是巨大挑战。实验揭示当前最先进模型在工具噪声下易过度依赖或无视预测,导致对话阶段决策质量恶化,凸显了构建能够进行校准协作的代理的紧迫性与复杂性。
常用场景
经典使用场景
PREDACTBENCH作为一个专为教育领域设计的基准测试集,其经典使用场景在于评估配备噪声工具的大语言模型(LLM)在任务导向型对话中的表现。具体而言,它模拟了AI助教与真人或模拟教师之间的多轮交互,其中AI需利用不完美的预测工具(如k-NN分类器)对学生的学业风险进行预测,并给出干预建议。该基准通过系统发起和用户发起两种对话模式,检验模型在纵向数据推理、多轮对话状态跟踪及不确定工具输出下的决策能力。
实际应用
PREDACTBENCH的实际应用场景聚焦于高风险的学术辅导决策支持,例如大学教学过程中识别有不及格风险的早期预警。它可为教务管理系统提供AI辅助的对话式分析工具,帮助教师高效追踪学生成绩轨迹,评估干预时机。此外,该基准的框架和指标可迁移至临床诊断、金融风险监控等其他纵向决策支持领域,用于评估AI代理在工具噪声下的可靠性,从而提升人机协作效率,防止错误建议导致的不可逆后果。
衍生相关工作
PREDACTBENCH的衍生工作包括对LLM在对话中表现出的盲从现象(sycophancy)的深入研究,以及基于其失败案例分析对话诱导的过度信任问题。它催生了关于校准工具噪声影响的研究,探讨了模型在不同准确率预测工具下的决策质量变化。该基准还被用于验证人机协作中信任校准度量的有效性,并为开发更稳健的强化学习目标(如奖励适当依赖而非单纯一致)提供了实验平台,进而推动了针对教育领域AI助手的行为纠正与性能优化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务