Infoxmed2.0-27B-奖励模型数据集
收藏资源简介:
# dpo_medical_train_v2.jsonl — 奖励模型训练数据集 ## 概述 本数据集用于训练 Infoxmed2.0 项目中的外部奖励模型(Reward Model),该奖励模型在 GRPO 阶段为策略模型提供语义级评分信号。 数据集基于 MedMCQA 和 HLE(Humanity's Last Exam)两个评测基准构建偏好对(chosen / rejected),通过六维度启发式评分器自动标注质量差异,使奖励模型学习区分高质量医学回答与低质量回答。 ## 基本信息 | 项目 | 值 | |------|------| | 文件格式 | JSONL(每行一个 JSON 对象) | | 总样本数 | 6,283 条偏好对 | | 生成时间 | 2026-04-28 | | 构建工具 | `step2_DPO/data/build_dpo_dataset_v2.py` | | 用途 | Reward Model 训练(SequenceClassification) | ## 数据来源分布 | 来源 | 样本数 | 占比 | |------|--------|------| | MedMCQA | 3,983 | 63.4% | | HLE (Humanity's Last Exam) | 2,300 | 36.6% | ## Rejected 回答错误类型分布 | 错误类型 | 样本数 | 占比 | 说明 | |----------|--------|------|------| | `vague` | 1,296 | 20.6% | 回答含糊,声称"信息不足"或"无法确定",回避给出明确答案 | | `incomplete` | 1,290 | 20.5% | 回答不完整,未展开推理过程,仅给出残缺草稿 | | `hallucination` | 1,273 | 20.3% | 虚构权威来源(如"2025年最新指南"),编造不存在的依据 | | `wrong_answer` | 1,234 | 19.6% | 选错答案,基于表面关键词匹配而非深层理解 | | `overconfident_wrong` | 1,190 | 18.9% | 过度自信地给出错误答案,声称"100%确定"却答错 | ## 数据统计 ### 质量差距(Score Margin) | 统计量 | 值 | |--------|------| | 最小值 | 5.50 | | 最大值 | 11.50 | | 平均值 | 8.63 | Score margin = chosen_total_score − rejected_total_score,数值越大说明偏好对的质量差异越明显。 ### 文本长度(字符数) | 类别 | 最小值 | 最大值 | 平均值 | |------|--------|--------|--------| | Chosen(优质回答) | 119 | 1,870 | 723 | | Rejected(低质回答) | 240 | 1,238 | 571 | ## 数据格式 每行为一个 JSON 对象,包含以下字段: ```jsonc { "messages": [ // Chosen(优质回答)对话 {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ], "rejected_messages": [ // Rejected(低质回答)对话 {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ], "metadata": { "source": "medmcqa", // 数据来源: medmcqa | hle "question_id": "...", // 原始题目 ID "error_type": "vague", // rejected 回答的错误类型 "generated_at": "2026-04-28T10:52:03", // 生成时间戳 "chosen_scores": { // chosen 回答的六维度评分 "grounding": 10, // 事实准确性 (-10 ~ 10) "coverage": 6, // 信息完整性 "depth": 4, // 推理深度 "tool_use": 2, // 工具/证据利用 "clarity": 4, // 表达清晰度 "safety": 4 // 医学安全性 }, "chosen_total_score": 5.0, // chosen 六维度均分 "rejected_scores": {...}, // rejected 回答的六维度评分 "rejected_total_score": -3.83, // rejected 六维度均分 "score_margin": 8.83, // 质量差距(chosen - rejected) "chosen_length": 564, // chosen 回答字符长度 "rejected_length": 372, // rejected 回答字符长度 "rejected_to_chosen_length_ratio": 0.66 // 长度比 } } ``` ## 六维度评分体系 Chosen 和 Rejected 回答均由启发式评分器在以下 6 个维度上进行评分,分值范围为 -10 到 +10: | 维度 | 字段名 | 评分含义 | |------|--------|----------| | 事实准确性 | `grounding` | 回答是否基于可靠事实,有无臆造信息 | | 信息完整性 | `coverage` | 是否覆盖问题所有关键要点 | | 推理深度 | `depth` | 推理过程是否清晰、逻辑是否严密 | | 工具/证据利用 | `tool_use` | 是否正确引用医学证据或工具输出 | | 表达清晰度 | `clarity` | 回答结构化程度和条理性 | | 医学安全性 | `safety` | 是否识别风险场景、是否保持必要的不确定性 | ## Chosen 回答特征 高质量回答(chosen)具有以下共同特征: - 明确给出正确答案 - 提供详细的医学解析和推理过程 - 引用教材或指南作为依据 - 标注学科归属并提示"仅供学习参考" - 对 HLE 题目提供结构化的解析要点与边界提示 ## Rejected 回答特征 低质量回答(rejected)由模板化方式生成,模拟了模型常见的 5 类错误模式: 1. **含糊回避型**(vague):声称"信息不足""多个选项都对",拒绝给出确定答案 2. **不完整型**(incomplete):只给出残缺草稿,未完成推理链,声明"未完成部分" 3. **幻觉型**(hallucination):虚构权威来源(如"2025年最新指南第8版第156页"),编造不存在的研究 4. **答错型**(wrong_answer):基于表面关键词匹配选择干扰项,承认"没有真正回到标准解释逐项排除" 5. **过度自信错误型**(overconfident_wrong):声称"毫无疑问""100%确定"却给出错误答案 ## 数据污染防护 数据集构建时使用随机种子(seed=42)预先采样出评测用的 200 题 MedMCQA + 200 题 HLE,并从训练候选中**显式排除**了这 400 道评测题目,确保与评测集无重叠。 ## 使用方式 本数据集直接用于奖励模型训练: ```bash cd Post_train/Reward_Model bash train_reward_mixed_from_scratch.sh ``` 训练脚本会将本数据集(DPO 部分)与 GRPO 伪标签数据按 1:1 比例混合,共同训练 Qwen3.5-9B SequenceClassification 奖励模型。 ## 与其他数据集的关系 | 数据集 | 用途 | 位置 | |--------|------|------| | 本数据集 (dpo_medical_train_v2.jsonl) | Reward Model 训练 | `Reward_Model/data/` | | dpo_medical_train_v2.jsonl (副本) | DPO 阶段训练 | `step2_DPO/data/` | | grpo_training_data.jsonl | GRPO 阶段训练 | `step3_GRPO/data/` | | dpo_grpo_train_v1.jsonl | Reward Model 混合训练数据 | `Reward_Model/data/` |



