遇见数据集

DCAgent3/medagentbench_sft__pymethods2test_selfsuccess_best1_jsonfmt__laion_GLM_4_7_swes118c7735

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1975个训练示例,总大小约为95.4 MB。数据特征包括对话记录(conversations,包含角色和内容)、代理(agent)、模型(model)、模型提供者(model_provider)、日期(date)、任务(task)、集数(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和来源追踪(trace_source)。数据集用于支持基于对话和任务执行的数据分析或模型训练。

This dataset contains 1975 training examples with a total size of approximately 95.4 MB. The features include conversations (with role and content), agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. It is designed to support data analysis or model training based on dialogue and task execution.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/medagentbench_sft__pymethods2test_selfsuccess_best1_jsonfmt__laion_GLM_4_7_swes118c7735 数据集图片
构建方式
该数据集立足于医疗对话智能体监督微调的前沿需求,采用多阶段自动化流水线构建。原始交互轨迹源自Laion生态中的医疗智能体运行记录,通过PyMethods2Test策略对智能体行为进行自成功筛选,仅保留最终验证结果正确的对话样本。每条样本经过GLM_4_7模型进行结构化重写与JSON格式规范化,并借助独立验证器对回复内容进行质量核验,剔除不符合医学逻辑或格式错误的条目。最终形成包含1975个训练实例、总量逾95MB的高质量监督微调数据集,所有对话均附带智能体类型、模型来源、任务标识及验证器输出等元数据字段,确保数据可追溯。
特点
数据集以多轮对话为核心载体,完整记录了医疗场景下智能体与用户之间的交互过程,涵盖角色、内容等细粒度信息。其显著特点在于自成功筛选机制,即仅纳入经自动化验证器确认成功的轨迹,从而在源头上保障了监督信号的质量。数据集还整合了丰富的元数据,包括agent、model、model_provider、date、task、episode、run_id、trial_name、result、verifier_output及trace_source,为分析智能体行为模式与模型表现提供了多维视角。JSON格式的规范化输出便于直接用于指令微调,同时保留验证器反馈,有助于后续开展错误分析与迭代优化。
使用方法
该数据集主要面向医疗对话智能体的监督微调任务。使用者可通过HuggingFace datasets库直接加载train划分,利用conversations字段构造训练样本,将role与content按对话轮次拼接为模型输入,并可根据task或agent字段进行子集筛选。基于result与verifier_output字段,可实施强化学习中的奖励建模或拒绝采样策略。元数据中的model_provider与trace_source支持跨模型、跨来源的对比实验。建议在微调时结合JSON格式约束,使模型输出与数据集结构对齐,并利用验证器输出进行后处理过滤,以提升临床场景下响应的准确性与安全性。
背景与挑战
背景概述
医疗领域智能体的构建与评估近年来成为人工智能研究的重要方向,但缺乏标准化、细粒度的交互轨迹数据制约了模型能力的迭代与验证。MedAgentBench 系列数据集由 LAION 等机构的研究者于近期创建,旨在通过真实医疗场景中的多轮对话与任务执行轨迹,为智能体的自监督微调与成功率评估提供结构化监督信号。该数据集以 GLM-4 等模型为基座,融合 pymethods2test 等验证机制,推动医疗智能体在复杂临床推理与工具调用中的能力边界探索,为后续研究提供了可复现的评测基准。
当前挑战
医疗智能体领域面临多轮交互中临床意图理解与安全决策的复合挑战,MedAgentBench 需解决从非结构化医患对话到可验证执行动作的映射难题,同时保证生成轨迹的医学合理性与操作可行性。构建过程中,数据采集需平衡真实性与隐私合规,任务设计需覆盖诊断推理、检查开具与治疗方案生成等异质场景,而自成功筛选机制则要求模型在无人工标注下区分有效与无效行为,避免强化虚假成功模式,这为数据质量与评测信度带来了持续压力。
常用场景
经典使用场景
在医疗智能体研究的浪潮中,该数据集凭借其精心构建的对话轨迹与验证信号,成为训练与评估临床决策智能体的经典资源。它主要被用于监督式微调(SFT),使模型能够习得在模拟医疗环境中与患者或系统交互、调用工具并生成结构化诊断建议的能力。每条轨迹包含多轮对话、执行结果与验证器输出,为智能体的行为克隆提供了细粒度监督,尤其适用于需要遵循严格格式与医学逻辑的任务。
实际应用
在实际应用层面,该数据集赋能了临床辅助决策系统的开发与迭代。开发者可利用其训练智能体在分诊、诊断建议和医嘱生成等场景中提供支持,同时借助验证器输出进行安全护栏设计。医院与医疗科技公司可将其作为模拟环境,测试智能体在高风险情境下的响应可靠性,从而加速从研究原型到临床部署的转化,并降低因错误建议导致的潜在医疗风险。
衍生相关工作
围绕该数据集,研究者已衍生出多项经典工作,包括基于其轨迹训练的多模态医疗智能体、利用验证器信号进行强化学习的探索,以及构建更复杂的多智能体协作框架。这些工作进一步拓展了数据集在长程规划与工具使用上的边界,并催生了针对医疗对话安全性与可解释性的评估工具,形成了从数据到模型再到应用的良性循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务