遇见数据集

patientagent-eval-results

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集为PatientAgent系统的评估结果,旨在比较不同训练方法(如基础模型、SFT、KTO、DPO等)生成的患者医疗对话回复的质量。数据基于MTS-Dialog测试集,从400个对话中筛选出352个包含至少一个患者轮次的合格对话,以及对应的金标准回复。评估包括两个方面:一是使用G-Eval(基于Kimi-K2.7-Code评判)对回复的幻觉、不相关性和拟人化程度进行评分;二是通过源判别器(source-versus-generated discriminator)检测人类评估者能否区分生成回复与真实患者回复,并报告检测准确率、愚弄率等指标。数据集包含多个配置变体,每个变体下存储生成的对话JSON文件和完整评估结果。此外,还包含一个判别器子集(53个对话、280个患者轮次)用于细致分析。注意:评估结果仅反映自动评判和风格可检测性,不代表临床质量或医疗建议。

This dataset contains evaluation results of the PatientAgent system, aimed at comparing the quality of patient medical conversation responses generated by different training methods (e.g., base model, SFT, KTO, DPO). The data is based on the MTS-Dialog test set, filtering 352 qualified dialogues (each containing at least one patient turn) from 400 dialogues, along with corresponding gold-standard responses. The evaluation includes two aspects: (1) using G-Eval (based on Kimi-K2.7-Code) to score responses on hallucination, irrelevance, and anthropomorphism; (2) using a source-versus-generated discriminator to detect whether human evaluators can distinguish generated responses from real patient responses, reporting detection accuracy, fooling rate, etc. The dataset contains multiple configuration variants, each storing generated dialogue JSON files and complete evaluation results. Additionally, a discriminator subset (53 dialogues, 280 patient turns) is included for detailed analysis. Note: The evaluation results only reflect automatic judgment and style detectability, not clinical quality or medical advice.

创建时间:
2026-08-14
原始信息汇总

PatientAgent 评估结果数据集

数据集概述

该数据集包含 PatientAgent 对话系统的评估结果,涵盖公共对话、经过验证的 G-Eval 评分以及源文本与生成文本判别器(source-versus-generated discriminator)的产物,用于多模型变体的系统化比较。

评估人群

所有响应来源均使用 MTS-Dialog 官方测试集中符合资格的对话 ID,资格标准为:原始对话中至少包含一个患者轮次。

数据划分 候选数 符合资格并完成G-Eval评分 排除数
Test1 200 174 26
Test2 200 178 22
合并 400 352 48

排除原因包括:医生-家属对话、医生-访客-临床医生对话、混合家庭/访客-临床医生对话及医生独白对话(均不含模型可替代的患者轮次)。

模型变体与数据配置

数据集包含 12 个配置,涵盖以下响应来源:

  • 基础模型:Base Qwen3.5-4B(无适配器基线)
  • 提示控制:AgentClinic 提示控制(Qwen3.5-4B,使用 AgentClinic 附录 L.2 逐字提示)
  • 监督微调:SFT16、SFT128
  • CFT 增强:CFT-augmented SFT16(实验性)
  • 偏好优化:KTO-SFT16、KTO-SFT128、DPO-SFT16、DPO-SFT128
  • 黄金参考:Gold responses(MTS-Dialog 源文本)
  • 外部系统:Liu et al. 发布的 Qwen2.5-72B 适配器(外部参考,非同源对照)

合并 G-Eval 评估结果

每个指标为 352 个合格对话 ID 的对话级微平均。幻觉率和无关性越低越好,拟人化越高越好。

响应来源 幻觉 无关性 拟人化 平均患者轮字符数
Base Qwen3.5-4B 3.07 5.96 5.46 286.0
AgentClinic 提示控制 4.22 5.24 7.63 171.8
SFT16 0.70 1.36 8.56 28.5
CFT-SFT16(实验) 0.72 1.22 8.67 27.5
SFT128 0.77 1.59 8.54 28.7
KTO-SFT16 2.70 4.24 8.29 111.9
KTO-SFT128 2.26 4.08 7.65 107.2
DPO-SFT16 1.16 2.53 8.63 49.8
DPO-SFT128 1.02 2.02 8.51 38.8
Gold 响应 0.30 2.04 8.95 45.7
Liu et al. 72B 适配器 2.09 3.69 5.39 103.6

源文本与生成判别器结果

判别器采用固定清单:53 个对话、280 个患者轮次(Test1: 26/130;Test2: 27/150),以种子 20260814 固定最大分层抽样样本。

响应来源 检测微平均 对话宏平均 愚弄率 完全一致对
Base Qwen3.5-4B 0.698 0.626 0.302 0
SFT16 0.277 0.329 0.723 24
SFT128 0.318 0.353 0.682 25
CFT-SFT16 0.341 0.397 0.659 21
KTO-SFT16 0.809 0.765 0.191 0
KTO-SFT128 0.755 0.679 0.245 1
DPO-SFT16 0.489 0.509 0.511 11
DPO-SFT128 0.388 0.396 0.613 13

关键发现:手动审查发现存在显著的长度/风格混杂因素。判别器常将简洁的生成回答视为源文本,而将较长的源文本视为生成内容。检测准确率在生成响应位于 B 槽位时高出 15.0–28.2 个百分点。因此,平衡设计测量的是源风格可检测性,而非人类相似度或临床质量。

文件布局

  • current/test1/<变体>/conversations.jsonresults.json:174 对话 G-Eval 完整评分
  • current/test2/<变体>/conversations.jsonresults.json:178 对话 G-Eval 完整评分
  • current/combined/<变体>/results.json:352 对话 G-Eval 微平均(含分割标签)
  • current/discriminator/manifest.json:固定的 53 对话/280 轮判别器清单
  • current/discriminator/results.json:成对决策、聚合、分层和自举区间
  • current/discriminator/full_checkpoint.sqlite3:指纹绑定的事务性原始调用检查点
  • current/discriminator/validation.json:独立重计算和发布门报告
  • current/discriminator/manual_audit_samples.json:人工审查的代表性和异常示例

所有分割结果均无缺失 ID,并记录其确切合格对话缓存的 SHA-256 指纹。

解释限制

  • 评分来自单一 LLM 评判家族(Kimi-K2.7-Code,单次通过,100,000 token 输出上限)
  • 完全重复的对话在独立调用中可能获得略有不同的分数
  • 事实提取偶尔遗漏源对话中的细节
  • 判别器置信区间量化的是对话采样而非评判者变异性
  • 运行时受限的对话样本覆盖 352 个合格对话中的 53 个
  • 这些产物衡量基于事实的自动化判断和源风格可检测性,而非临床质量
  • 人类验证仍然缺失
  • Liu 外部系统比较在模型族、参数数量、训练数据和语言上均与 Qwen3.5-4B 行不同

历史产物

旧的 183 对话快照可在 MTS-Dataset-preprocessed 获取,该快照是独立数据集,不可与本评估混合使用。

预期用途

仅限研究基准使用。生成的对话可能产生幻觉,不构成医疗建议、医疗设备或医生模型临床安全性的证据。

搜集汇总
数据集介绍
patientagent-eval-results 数据集图片
构建方式
该数据集源自PatientAgent对比评估的权威验证结果,构建于MTS-Dialog官方测试集双分区之上,其核心在于界定包含至少一回合患者话语的源对话为候选,经严格筛选,从400个对话中臻选出352个合格样本,摒弃了不含患者轮次的家族、宾客及混合型对话。数据集内嵌多组配置,涵盖基础模型、SFT、DPO、KTO、CFT增强及外部系统等十一类响应来源,每类均产出了对话级G-Eval微平均分数及判别器对源与生成文本的识别结果,并辅以完整的人工审计文件和指纹校验,确保了评估的精细度与可溯源性。
使用方法
本数据集专供科研基准测试,使用者可通过HuggingFace加载不同配置的results.json文件,复现各响应来源的G-Eval分数与判别器决策。推荐结合current目录下的对话原文、判别器清单及验证报告进行深度分析,亦可对照历史快照以追踪演变。鉴于数据的医学模拟性质,严禁用于临床决策,其应用应限定于评估对话生成模型在患者角色模拟中的能力、揭示训练策略的效能边界,并作为后续研究的方法论参照。
背景与挑战
背景概述
PatientAgent评估数据集(patientagent-eval-results)由研究团队于2025年构建,旨在系统评估医疗对话生成智能体(PatientAgent)的性能。该数据集基于MTS-Dialog测试集,筛选出352个包含患者轮次的对话,涵盖了多种响应来源,包括基线模型(Qwen3.5-4B)、经过不同微调策略(SFT、KTO、DPO)的模型、外部系统(如Liu et al.发布的Qwen2.5-72B适配器)以及黄金标准响应。核心研究问题在于如何准确评估生成的患者话语在事实一致性(幻觉)、相关性、拟人化等方面的表现,并探究不同训练策略对生成质量的影响。该数据集为医疗对话生成领域提供了公开可复现的评估基准,其发布有望推动医疗AI对话系统的透明化发展,并促进跨模型性能的可比性研究。
当前挑战
该数据集面临多重挑战:领域层面,医疗对话生成需解决高幻觉率、信息不相关、缺乏拟人化及角色错配等核心问题,且需确保生成的临床内容具备事实准确性。构建过程中,面临数据稀缺性、标注一致性及评估指标的可靠性等困难。例如,G-Eval评分依赖单一评判模型(Kimi-K2.7-Code),可能受输出长度、风格混淆影响,导致偏差;判别器实验中存在长度/风格混淆,检测准确率受呈现顺序影响。此外,构建过程中需严格筛选符合条件的对话,排除无患者轮次的情况,并处理外部系统输出中的噪声(如CJK文本、标记符号)。最后,评估协议受限于运行时间预算,样本人群有限,且缺乏人类验证,这些均影响结果的外部有效性。
常用场景
经典使用场景
在医学对话系统与患者模拟研究领域,PatientAgent评测数据集为评估患者代理模型的对话真实性与临床合理性提供了标准化基准。其核心应用场景聚焦于对生成式患者响应进行多维度的自动评测,涵盖幻觉率、无关性及拟人化等量化指标。该数据集通过对MTS-Dialog测试集进行严格筛选,构建了包含352个合格对话的评测体系,支持不同训练策略(如监督微调、知识蒸馏、对比偏好优化)生成的响应与金标准及外部系统的对照分析,为研究者提供了可复现的评测流程与精细化的分层结果。
解决学术问题
该数据集有效解决了医学对话生成领域中长期存在的评估碎片化与结果不可比问题。通过统一固定的评估人口、一致的G-Eval评判标准以及双序呈现的判别器协议,它实现了跨模型、跨训练范式的公平比较。其还揭示了长度风格混杂等影响判别准确率的深层问题,并提供了分层置信区间计算框架,从而为探究模型幻觉控制、抗检测能力及拟人化程度提供了可靠的数据支持,推动了相关研究从主观案例观察向统计学严谨性的转变。
实际应用
在实际应用领域,该数据集可作为医学教育模拟训练系统的质量评估工具,用于筛选表现优越的对话生成模型,以提升标准化病人(SP)的自动化水平。同时,它亦可作为医疗人工智能产品安全性测试的辅助基准,通过G-Eval与判别器的双重校验,甄别模型在患者角色扮演中产生的幻觉或不当输出,辅助开发者在部署前进行红队测试与鲁棒性验证,从而降低临床场景下的潜在风险。
数据集最近研究
最新研究方向
本数据集聚焦于医疗对话系统中患者代理模型的生成质量评估,特别是针对经过不同微调策略(如SFT、KTO、DPO及CFT增强)的模型所产生的对话,进行多维度的自动化评判。前沿研究方向涵盖减少幻觉与不相关输出、提升拟人化程度,以及通过源-生成判别器评估对话的真实性。该数据集提供了一套系统化的评估框架,包括G-Eval评分与判别器分析,并揭示了长度/风格混淆等评估偏差,对于推动可靠、安全的医疗对话AI系统发展具有基准性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务