遇见数据集

DCAgent3/medagentbench_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxepse931edb8

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 68921000 num_examples: 1429 download_size: 68442352 dataset_size: 68921000 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/medagentbench_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxepse931edb8 数据集图片
构建方式
在医疗人工智能领域,面向真实临床任务的多轮对话与智能体验证数据日益受到重视,该数据集的构建依托于MedAgentBench的评测框架,通过部署GLM-4模型作为智能体主体,联合SWE-smith沙箱环境执行临床任务模拟。每条数据均经过最长120秒的交互时限与多轮迭代(最多931个episode)运行后采集,并由oracle验证机制对智能体输出进行自动化校验,最终将对话轨迹、任务标签、模型标识、运行结果及验证器输出等字段聚合为结构化记录,形成涵盖1429个样本、约68.9MB的训练集规模。
特点
该数据集以医疗智能体评测为核心特色,兼具真实性与可验证性。其对话内容覆盖多轮交互过程,完整保留角色、内容等会话信息,同时记录智能体名称、模型提供方、任务类型、运行标识与试验名称等元数据,便于溯源与对比分析。尤为突出的是,每条样本均附带验证器输出与最终结果,使得模型行为质量可量化评估。数据来源统一、格式规整,既适合监督微调,也便于开展强化学习与可信性研究,为医疗智能体的能力诊断提供了细粒度支撑。
使用方法
使用该数据集时,研究者可借助HuggingFace datasets库直接加载train划分,获得包含conversations、agent、model、task、result及verifier_output等字段的标准化数据。典型流程包括:以conversations字段构建多轮对话输入,结合task与agent标签进行条件生成或行为分析;利用result和verifier_output作为监督信号或奖励依据,开展模型微调与性能评估。该数据亦可支持医疗智能体的轨迹回放、失败案例归因与跨模型比较,为临床决策辅助系统的迭代优化提供实证基础。
背景与挑战
背景概述
医疗人工智能的蓬勃发展对智能体在临床场景中的推理与决策能力提出了更高要求。medagentbench_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxepse931edb8数据集正是在此背景下应运而生,其名称中的元素暗示了它可能源自medagentbench系列,并集成了GLM-4系列模型与swesmith沙箱测试框架。该数据集由相关研究团队构建,旨在通过多轮对话与沙箱验证,评估医疗智能体在模拟诊疗任务中的表现。它记录了1429个训练样本,涵盖对话、模型版本、任务类型及验证输出等丰富字段,为医疗智能体的能力评估提供了结构化基准,有望推动该领域在安全性与可靠性方面的研究进展。
当前挑战
该数据集所应对的核心挑战在于医疗智能体领域缺乏标准化、可验证的评估环境。构建过程中,研究者需设计贴近真实临床决策的任务,并确保沙箱测试能够准确反映智能体的推理与执行能力。具体挑战包括:如何在多轮交互中保持医疗上下文的一致性;如何设计具有临床意义且可自动验证的任务,避免主观评价;如何跨不同模型(如GLM-4系列)与提供商维持评估的公平性;以及如何高效处理大规模对话数据并确保验证输出的可靠性。这些难题共同构成了数据集构建与应用的复杂图景。
常用场景
经典使用场景
在智能体驱动的临床决策支持研究中,该数据集构成了一项关键基准资源,其经典使用场景聚焦于评估语言模型在模拟医疗环境中的多轮交互能力。研究者利用其中蕴含的对话轨迹、智能体标识、模型来源及验证结果等结构化字段,系统性地考察模型在病史采集、鉴别诊断与治疗建议生成等任务中的表现。每一轮对话均被完整记录,并配有独立的验证器输出,从而支持对智能体推理过程的细粒度分析。该场景已成为衡量医疗智能体在真实临床工作流中鲁棒性与准确性的标准范式。
解决学术问题
该数据集有效回应了医疗人工智能领域长期存在的可复现性与标准化评测难题。既往研究常因缺乏统一的交互记录与验证机制,导致不同模型之间的性能比较难以进行。此数据集通过提供带有时间戳、模型标识、任务类型及验证器反馈的完整回合数据,使得研究者能够精确控制变量,探究模型规模、提示策略与领域知识注入对临床推理质量的影响。其意义在于推动了医疗智能体评测从孤立案例向大规模、可审计的实证研究转型,为后续基准的构建树立了方法论标杆。
衍生相关工作
围绕该数据集,学术界已衍生出一系列经典工作,涵盖医疗对话状态追踪、智能体安全对齐以及自动化验证框架等方向。部分研究以其为基础,提出了融合检索增强生成与结构化知识图谱的混合推理架构;另一些工作则利用验证器输出开发了细粒度的错误归因方法,用以区分知识缺失与推理谬误。此外,该数据集还催生了针对长程临床对话的评估协议与多智能体协作策略的对比研究,显著拓展了医疗语言模型在复杂决策环境中的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务