patientagent-eval-results
收藏资源简介:
该数据集为PatientAgent系统的评估结果,旨在比较不同训练方法(如基础模型、SFT、KTO、DPO等)生成的患者医疗对话回复的质量。数据基于MTS-Dialog测试集,从400个对话中筛选出352个包含至少一个患者轮次的合格对话,以及对应的金标准回复。评估包括两个方面:一是使用G-Eval(基于Kimi-K2.7-Code评判)对回复的幻觉、不相关性和拟人化程度进行评分;二是通过源判别器(source-versus-generated discriminator)检测人类评估者能否区分生成回复与真实患者回复,并报告检测准确率、愚弄率等指标。数据集包含多个配置变体,每个变体下存储生成的对话JSON文件和完整评估结果。此外,还包含一个判别器子集(53个对话、280个患者轮次)用于细致分析。注意:评估结果仅反映自动评判和风格可检测性,不代表临床质量或医疗建议。
This dataset contains evaluation results of the PatientAgent system, aimed at comparing the quality of patient medical conversation responses generated by different training methods (e.g., base model, SFT, KTO, DPO). The data is based on the MTS-Dialog test set, filtering 352 qualified dialogues (each containing at least one patient turn) from 400 dialogues, along with corresponding gold-standard responses. The evaluation includes two aspects: (1) using G-Eval (based on Kimi-K2.7-Code) to score responses on hallucination, irrelevance, and anthropomorphism; (2) using a source-versus-generated discriminator to detect whether human evaluators can distinguish generated responses from real patient responses, reporting detection accuracy, fooling rate, etc. The dataset contains multiple configuration variants, each storing generated dialogue JSON files and complete evaluation results. Additionally, a discriminator subset (53 dialogues, 280 patient turns) is included for detailed analysis. Note: The evaluation results only reflect automatic judgment and style detectability, not clinical quality or medical advice.
PatientAgent 评估结果数据集
数据集概述
该数据集包含 PatientAgent 对话系统的评估结果,涵盖公共对话、经过验证的 G-Eval 评分以及源文本与生成文本判别器(source-versus-generated discriminator)的产物,用于多模型变体的系统化比较。
评估人群
所有响应来源均使用 MTS-Dialog 官方测试集中符合资格的对话 ID,资格标准为:原始对话中至少包含一个患者轮次。
| 数据划分 | 候选数 | 符合资格并完成G-Eval评分 | 排除数 |
|---|---|---|---|
| Test1 | 200 | 174 | 26 |
| Test2 | 200 | 178 | 22 |
| 合并 | 400 | 352 | 48 |
排除原因包括:医生-家属对话、医生-访客-临床医生对话、混合家庭/访客-临床医生对话及医生独白对话(均不含模型可替代的患者轮次)。
模型变体与数据配置
数据集包含 12 个配置,涵盖以下响应来源:
- 基础模型:Base Qwen3.5-4B(无适配器基线)
- 提示控制:AgentClinic 提示控制(Qwen3.5-4B,使用 AgentClinic 附录 L.2 逐字提示)
- 监督微调:SFT16、SFT128
- CFT 增强:CFT-augmented SFT16(实验性)
- 偏好优化:KTO-SFT16、KTO-SFT128、DPO-SFT16、DPO-SFT128
- 黄金参考:Gold responses(MTS-Dialog 源文本)
- 外部系统:Liu et al. 发布的 Qwen2.5-72B 适配器(外部参考,非同源对照)
合并 G-Eval 评估结果
每个指标为 352 个合格对话 ID 的对话级微平均。幻觉率和无关性越低越好,拟人化越高越好。
| 响应来源 | 幻觉 | 无关性 | 拟人化 | 平均患者轮字符数 |
|---|---|---|---|---|
| Base Qwen3.5-4B | 3.07 | 5.96 | 5.46 | 286.0 |
| AgentClinic 提示控制 | 4.22 | 5.24 | 7.63 | 171.8 |
| SFT16 | 0.70 | 1.36 | 8.56 | 28.5 |
| CFT-SFT16(实验) | 0.72 | 1.22 | 8.67 | 27.5 |
| SFT128 | 0.77 | 1.59 | 8.54 | 28.7 |
| KTO-SFT16 | 2.70 | 4.24 | 8.29 | 111.9 |
| KTO-SFT128 | 2.26 | 4.08 | 7.65 | 107.2 |
| DPO-SFT16 | 1.16 | 2.53 | 8.63 | 49.8 |
| DPO-SFT128 | 1.02 | 2.02 | 8.51 | 38.8 |
| Gold 响应 | 0.30 | 2.04 | 8.95 | 45.7 |
| Liu et al. 72B 适配器 | 2.09 | 3.69 | 5.39 | 103.6 |
源文本与生成判别器结果
判别器采用固定清单:53 个对话、280 个患者轮次(Test1: 26/130;Test2: 27/150),以种子 20260814 固定最大分层抽样样本。
| 响应来源 | 检测微平均 | 对话宏平均 | 愚弄率 | 完全一致对 |
|---|---|---|---|---|
| Base Qwen3.5-4B | 0.698 | 0.626 | 0.302 | 0 |
| SFT16 | 0.277 | 0.329 | 0.723 | 24 |
| SFT128 | 0.318 | 0.353 | 0.682 | 25 |
| CFT-SFT16 | 0.341 | 0.397 | 0.659 | 21 |
| KTO-SFT16 | 0.809 | 0.765 | 0.191 | 0 |
| KTO-SFT128 | 0.755 | 0.679 | 0.245 | 1 |
| DPO-SFT16 | 0.489 | 0.509 | 0.511 | 11 |
| DPO-SFT128 | 0.388 | 0.396 | 0.613 | 13 |
关键发现:手动审查发现存在显著的长度/风格混杂因素。判别器常将简洁的生成回答视为源文本,而将较长的源文本视为生成内容。检测准确率在生成响应位于 B 槽位时高出 15.0–28.2 个百分点。因此,平衡设计测量的是源风格可检测性,而非人类相似度或临床质量。
文件布局
current/test1/<变体>/conversations.json和results.json:174 对话 G-Eval 完整评分current/test2/<变体>/conversations.json和results.json:178 对话 G-Eval 完整评分current/combined/<变体>/results.json:352 对话 G-Eval 微平均(含分割标签)current/discriminator/manifest.json:固定的 53 对话/280 轮判别器清单current/discriminator/results.json:成对决策、聚合、分层和自举区间current/discriminator/full_checkpoint.sqlite3:指纹绑定的事务性原始调用检查点current/discriminator/validation.json:独立重计算和发布门报告current/discriminator/manual_audit_samples.json:人工审查的代表性和异常示例
所有分割结果均无缺失 ID,并记录其确切合格对话缓存的 SHA-256 指纹。
解释限制
- 评分来自单一 LLM 评判家族(Kimi-K2.7-Code,单次通过,100,000 token 输出上限)
- 完全重复的对话在独立调用中可能获得略有不同的分数
- 事实提取偶尔遗漏源对话中的细节
- 判别器置信区间量化的是对话采样而非评判者变异性
- 运行时受限的对话样本覆盖 352 个合格对话中的 53 个
- 这些产物衡量基于事实的自动化判断和源风格可检测性,而非临床质量
- 人类验证仍然缺失
- Liu 外部系统比较在模型族、参数数量、训练数据和语言上均与 Qwen3.5-4B 行不同
历史产物
旧的 183 对话快照可在 MTS-Dataset-preprocessed 获取,该快照是独立数据集,不可与本评估混合使用。
预期用途
仅限研究基准使用。生成的对话可能产生幻觉,不构成医疗建议、医疗设备或医生模型临床安全性的证据。




