DCAgent3/medagentbench_a3_rl_DCAgent_inferredbugs_sandboxes_verifier_55_8B_20260526_230706
收藏数据链接:
官方服务:
资源简介:
该数据集包含多轮对话数据,涉及不同代理、模型和任务,用于记录对话交互、任务执行结果和验证输出。数据集包括训练分割,共有1450个示例,适用于AI代理评估或对话系统训练。
This dataset contains multi-turn conversation data involving various agents, models, and tasks, designed to record dialog interactions, task execution results, and verification outputs. It includes a training split with 1450 examples, suitable for AI agent evaluation or dialogue system training.
提供机构:
DCAgent3搜集汇总
数据集介绍

构建方式
在医疗人工智能领域,智能体临床决策能力的评测与优化正成为研究热点。该数据集通过多轮交互式仿真环境构建,以MedAgentBench为任务基础,围绕临床决策智能体(DCAgent)的推理过程展开,针对其在55个沙盒环境中经8B参数规模模型进行强化学习训练后产生的推断缺陷(inferred bugs),系统性地采集与整理交互轨迹。数据生成依托沙盒化验证器(verifier)对每次任务执行的输出进行校验,将对话流、智能体标识、模型信息、任务描述、试次记录及验证结果等结构化字段一并留存,最终形成1450个训练样本,记录下智能体在仿真问诊过程中的完整行为链与错误模式。
特点
该数据集以对话式多轮交互轨迹为核心载体,完整刻画了临床决策智能体在仿真医疗场景中的推理行为与缺陷特征。每条样本不仅包含医患角色的对话内容,还标注了智能体类型、驱动模型及其提供方、运行日期、任务类别、试次名称、执行结果与验证器输出等元信息,尤其突出经验证器识别出的推断缺陷,为诊断智能体推理薄弱环节提供细粒度证据。数据集覆盖55个沙盒环境,约70MB规模,字段设计兼顾可追溯性与可复现性,适合作为医疗智能体可靠性评估与缺陷归因分析的基准资源。
使用方法
研究者可借助HuggingFace datasets库直接加载该数据集,按默认配置读取train划分中的1450条样本。利用conversations字段可解析智能体与患者之间的完整多轮对话,结合agent、model、model_provider等字段对智能体行为进行分组对比;通过task、episode、run_id与trial_name可定位具体仿真任务与试次,并借助result与verifier_output字段获取执行结果及验证器对推断缺陷的判定依据。该数据集适用于智能体推理缺陷分析、强化学习策略诊断、验证器有效性评估以及医疗对话智能体的鲁棒性研究,亦可作为训练数据用于缺陷检测模型的微调。
背景与挑战
背景概述
随着大语言模型在医疗对话与临床决策支持中的广泛应用,评估其推理能力与安全性成为关键议题。MedAgentBench系列基准由多机构研究人员于2025年前后构建,旨在系统评测医疗智能体的多轮交互、诊断推理与工具调用能力。该数据集作为其扩展版本,聚焦于强化学习场景下智能体在沙盒环境中的行为轨迹与验证器反馈,涵盖1450个训练样本,整合了对话、智能体类型、模型来源、任务描述及验证输出等多维信息。其核心研究问题在于揭示模型在复杂临床情境中的推理缺陷与潜在错误传播模式,为医疗AI的可靠性评估提供细粒度数据支撑,对推动安全可信的医疗智能体发展具有基础性影响。
当前挑战
该数据集所应对的领域问题在于医疗智能体在真实临床决策中的鲁棒性与可解释性,即如何在多轮交互中保持诊断逻辑一致性并避免有害建议。构建过程中面临多重挑战:沙盒环境的动态模拟需精确复现临床工作流的复杂性与不确定性;验证器输出与智能体行为之间的对齐需处理模糊反馈与稀疏奖励信号;推断错误的标注依赖专家知识,存在主观偏差与标注成本高昂的问题。此外,多模型、多提供者的异构数据整合要求统一的任务表示与评估协议,而隐私与伦理约束进一步限制了真实病例的直接使用,导致合成场景与真实临床分布之间存在差距。
常用场景
经典使用场景
在医疗人工智能与强化学习交叉领域,该数据集作为面向智能体决策轨迹的评估基准,其经典使用场景在于对医疗对话智能体(如DCAgent)在沙箱环境中执行临床任务时的全流程进行细粒度验证与错误归因。通过收录智能体与模型间的多轮对话、执行结果及验证器输出,研究者可系统分析智能体在模拟医疗场景下的推理路径与行为模式,进而评估其任务完成度与安全性。
衍生相关工作
围绕该数据集,后续研究可衍生出面向医疗智能体的鲁棒性增强、错误感知强化学习及多智能体协作验证等方向。例如,基于其验证器反馈信号训练奖励模型以对齐临床指南,或利用沙箱轨迹数据构建细粒度错误分类器。同时,该数据集的结构化字段亦为医疗对话状态追踪、工具调用可靠性分析等任务提供了标注基础,有望催生跨机构协作的医疗智能体基准测试生态。
数据集最近研究
最新研究方向
在医疗人工智能代理系统逐步走向临床推理与决策支持的进程中,MedAgentBench系列数据集持续推动着对多轮对话中代理行为可靠性、错误归因与验证机制的深入探索。该数据集以强化学习训练轨迹为核心,集成了代理对话、模型来源、任务类型、验证器输出及沙箱执行结果等多维度信息,为研究代理在复杂医疗场景下的推理偏差与自我修正能力提供了细粒度观测窗口。近期研究前沿聚焦于利用此类带验证反馈的交互轨迹,构建可解释的代理行为审计框架,并探索基于推断错误模式的动态策略优化方法,以提升医疗代理在高风险决策中的鲁棒性与可信度。该方向与当前医疗AI治理中对透明、可追溯代理系统的迫切需求紧密呼应,对推动安全可部署的临床辅助代理具有重要的方法论意义。
以上内容由遇见数据集搜集并总结生成



