遇见数据集

counsel-chat-miti-st-dpo

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

counsel-chat MITI-ST DPO 是一个用于心理学/心理咨询助手偏好调优(DPO)的英文数据集,源自nbertagnolli/counsel-chat开源数据集。该数据集专门设计用于心理健康和咨询场景,旨在促进动机性面谈(MI)风格的共情、合作和反思能力,而非建议给予或专家口吻。每个数据样本是一个(prompt, chosen, rejected)三元组,其中prompt为客户提出的问题,chosen和rejected均为美国持照治疗师对同一问题的真实回答,分别代表基于MITI-ST v1评估标准得分最高和最低的回答。MITI-ST v1是动机性面谈治疗完整性量表(MITI 4.2.1)的单轮适应版本,从共情、合作、反思存在性、无劝说和无对抗五个维度(总分0-13)对回答进行评分。数据集使用大型语言模型(Claude Opus 4.7)仅作为评分器,不生成任何文本,从而避免了LLM自偏好循环问题。数据规模方面,源语料库包含940个独特的客户问题,其中约460个问题有至少3个治疗师回答,最终目标生成超过1300个DPO对。数据集字段包括问题ID、主题、客户问题文本、优选回答、拒绝回答、对应分数、治疗师标识、以及包含所有回答及详细分数矩阵的all_answers字段,支持下游用户重新配对或应用不同的选择策略。数据集采用MIT许可证,以仅追加方式持续增长,适用于偏好微调(如DPO、IPO、KTO)、奖励模型训练以及评估“回答是否符合MI风格”的参考语料。已知局限性包括依赖单一评分器、MITI标准可能惩罚信息给予、未评估事实准确性,以及治疗师风格可能存在自相关。

counsel-chat MITI-ST DPO is an English dataset for preference optimization (DPO) in psychology/counseling assistants, derived from the nbertagnolli/counsel-chat open-source dataset. It is specifically designed for mental health and counseling scenarios, aiming to promote empathy, collaboration, and reflection in the Motivational Interviewing (MI) style, rather than advice-giving or expert tone. Each data sample is a (prompt, chosen, rejected) triplet, where prompt is a clients question, and chosen and rejected are real responses from licensed U.S. therapists to the same question, representing the highest and lowest scored responses based on the MITI-ST v1 evaluation criteria. MITI-ST v1 is a single-turn adaptation of the Motivational Interviewing Treatment Integrity (MITI 4.2.1) scale, scoring responses across five dimensions (empathy, collaboration, reflection presence, no persuasion, no confrontation) with a total score of 0-13. The dataset uses a large language model (Claude Opus 4.7) solely as a scorer, without generating any text, thereby avoiding LLM self-preference loops. In terms of scale, the source corpus contains 940 unique client questions, with approximately 460 questions having at least three therapist responses, ultimately targeting over 1300 DPO pairs. Dataset fields include question ID, topic, client question text, preferred response, rejected response, corresponding scores, therapist identifiers, and an all_answers field containing all responses and detailed score matrices, supporting downstream users in re-pairing or applying different selection strategies. The dataset is licensed under MIT, grows continuously in an append-only manner, and is suitable for preference fine-tuning (e.g., DPO, IPO, KTO), reward model training, and as a reference corpus for evaluating response adherence to MI style. Known limitations include reliance on a single scorer, potential penalization of information-giving by MITI criteria, lack of factual accuracy assessment, and possible autocorrelation in therapist styles.

创建时间:
2026-05-27
原始信息汇总

数据集概述:counsel-chat MITI-ST DPO

基本信息

  • 语言:英语
  • 许可证:MIT
  • 任务类别:文本生成
  • 规模:1,000 < N < 10,000 行
  • 来源数据集nbertagnolli/counsel-chat
  • 标签:DPO、偏好调优、心理学、心理咨询、动机性访谈、MITI、LLM作为评判者
  • 发布者:Agentic Commons(Hugging Face 页面

核心用途

  • 用于心理健康和心理咨询场景下聊天/助手模型的偏好微调(DPO / IPO / KTO),以鼓励动机性访谈(MI)风格的共情、伙伴关系和反思,而非单纯提供建议或专家口吻。
  • 训练基于MI对齐的心理咨询回应的奖励模型。
  • 作为评估“回答是否具有MI风格”的参考语料库(保留完整评分矩阵)。
  • 注意:非临床决策数据集,不应用于部署无监督的心理健康代理。

数据构建方式

  • nbertagnolli/counsel-chat 中选取每个至少有 3 个治疗师回答的问题。
  • 使用 Claude Opus 4.7 作为评分器(仅用于评分,不生成任何文本),基于 MITI-ST v1 评分标准对每个治疗师回答进行独立评分。
  • 每个数据行为 (prompt, chosen, rejected) 三元组:
    • chosen:总分最高的治疗师回答(共情作为平局决胜项)。
    • rejected:总分最低的治疗师回答。
  • 保留完整的 N × 5 维度 评分矩阵(all_answers 字段),允许用户重新配对或采用不同的选择/拒绝策略。

MITI-ST v1 评分标准(单轮适配版)

改编自 MITI 4.2.1(动机性访谈治疗完整性编码手册),原用于评估20分钟咨询会话,此处适配为单轮问答。每个回答总分范围 0–13:

维度 范围 描述
empathy(共情) 1–5 理解来访者视角的努力程度;5分代表把握未言明的含义
partnership(伙伴关系) 1–5 合作 vs. 专家主导姿态;5分代表视来访者为自身专家
reflection_present(存在反思) 0/1 包含至少一个简单或复杂反思
no_persuade(无说服) 0/1 无未经请求的建议(说服属于MI非一致性行为)
no_confront(无对抗) 0/1 无嘲笑、评判或不认可

数据模式(Schema)

字段 类型 描述
question_id string counsel-chat 中的 questionID
topic string 话题(如抑郁、焦虑、人际关系等)
prompt string 原始来访者问题(questionTitle + questionText)
chosen string 最高分治疗师回答
rejected string 最低分治疗师回答
chosen_score / rejected_score int MITI-ST 总分(0–13)
chosen_therapist / rejected_therapist string 治疗师标识符
all_answers list[object] 所有N个治疗师回答及其各维度评分
rubric string 固定为 MITI-ST v1
judge_model string 产生评分的模型
source_dataset string nbertagnolli/counsel-chat
license string MIT

覆盖范围与增长

  • 数据集为 仅追加、持续增长 模式,新三元组随上游评分任务完成而提交至 data/pilot.jsonl
  • 来源语料库有 940 个独特问题,其中约 460 个问题至少有 3 个治疗师回答
  • 最终目标是涵盖所有 ≥3 回答的问题,预计产生 约 1,300+ 个 DPO 三元组,且完全不含 LLM 生成的文本。
  • 同一 question_id 可能因重新采样而多次出现,用户可按需去重。

已知局限性

  1. 单一评判模型:仅使用 Claude Opus 4.7 进行评分,可能存在对表面特征(如长度、模糊词汇)的自我偏好;计划引入独立评判模型。
  2. MITI 对信息提供不友好:真实治疗师在单轮问答中常分享建议或心理教育内容,MITI 会将其视为“说服”行为,因此区分信号主要来自共情/伙伴关系/反思维度。
  3. 未衡量领域准确性:MITI 仅评估是否符合 MI 风格,不评估事实正确性;得分最高的回答可能共情感强但信息量较少。
  4. 治疗师风格自相关:少数高产治疗师在多个问题中出现,其风格偏好会在偏好信号中被过度代表。

许可与引用

搜集汇总
数据集介绍
counsel-chat-miti-st-dpo 数据集图片
构建方式
在心理治疗与咨询领域中,动机性访谈(Motivational Interviewing)被广泛视为一种以共情和合作精神为核心的有效干预方法。为提升大语言模型在心理健康辅助场景中的对齐表现,counsel-chat-miti-st-dpo 数据集应运而生。该数据集基于 nbertagnolli/counsel-chat 语料库构建,精心选取每个客户问题下至少三条由美国持证治疗师撰写的真实回复。通过引入 MITI-ST v1 评分体系——一种专为单轮问答场景改编的动机性访谈治疗完整性编码框架——利用 Claude Opus 4.7 大模型作为纯评分器,对每条回复进行多维度独立打分。在此基础上,将每道问题的最高分与最低分回复配对,形成 (prompt, chosen, rejected) 的三元组结构,从而为偏好微调提供可靠信号。整个构建过程严格避免使用模型生成任何文本数据,确保了偏好信号的真实性与独立性。
特点
该数据集的核心特色在于其独特的偏好信号来源于临床心理学领域权威的 MITI 4.2.1 编码手册,经单轮问答场景适配后涵盖共情、合作关系、反思性回应、避免说服与避免对抗五个维度,从 0 至 13 分全面量化治疗性回应的动机性访谈一致性。相较于常规偏好数据集,其 chosen 与 rejected 均源自真实治疗师而非模型生成,显著降低了模型在偏好优化过程中可能出现的自我偏好循环风险。数据集保留了所有候选回复的完整评分矩阵,支持下游用户在不重新评分的情况下重新构建偏好配对,具有高度的开放性与可重复利用性。此外,该数据集采用追加式持续扩充策略,目前覆盖约 460 道具备三条及以上治疗师回复的客户问题,预期可生成超过 1300 个 DPO 三元组,且所有文本均为人写,不含任何模型生成内容。
使用方法
该数据集主要面向需要在心理健康与咨询语境中进行偏好微调的研究与实践场景。研究者可将其应用于直接偏好优化(DPO)、迭代偏好优化(IPO)或 KTO 等对齐训练框架,以增强模型在回复中展现动机性访谈所倡导的共情、协作与反思特质的倾向,弱化居高临下的说教式语气。同时,它也适用于训练奖励模型以评估回复的动机性访谈一致性,或作为评估基准语料用于验证下游模型是否具备类似动机性访谈的表达风格。使用时需注意,数据集保留了 question_id 字段,若需每道问题仅对应一个偏好三元组,可通过去重实现。此外,该数据集不对临床决策提供支持,不宜直接用于部署无监督心理健康代理系统。
背景与挑战
背景概述
counsel-chat-miti-st-dpo数据集由Agentic Commons团队于2023年发布,旨在为心理辅导对话模型提供基于动机性访谈风格的偏好微调数据。该数据集源自nbertagnolli/counsel-chat,汇集了美国持牌治疗师对真实来访者问题的回答,并通过MITI-ST v1评分框架(改编自临床研究广泛使用的MITI 4.2.1编码手册)筛选出高质量与低质量回应,形成用于直接偏好优化(DPO)的训练三元组。其核心研究问题在于如何利用真实临床专家的回答而非模型生成文本,构建符合动机性访谈核心准则(共情、合作、反思)的偏好信号,从而推动心理健康领域对话系统的风格对齐。该数据集填补了临床辅导场景中基于人类专家评判的偏好数据空白,为后续研究提供了可靠的参照基准,对提升AI辅助心理健康服务的共情能力具有重要影响。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,数据旨在解决模型在心理辅导对话中容易产生说教式、专家化回应的问题,推动其向体现共情与合作的动机性访谈风格转变,然而MITI评分框架本身惩罚信息提供行为,导致区分信号主要依赖共情与合作维度而非事实正确性,且同一样本中事实最优回答可能未成为chosen,存在风格与准确性的权衡。在构建过程中,所有评分仅依赖Claude Opus 4.7单一评判模型,存在对表面特征(如回答长度、模糊用语)的潜在偏好,且少数高产治疗师在多个问题中重复出现,导致风格偏好信号被过度表征,从而削弱了数据集的多样性与泛化能力。
常用场景
经典使用场景
在心理健康与咨询领域,counsel-chat-miti-st-dpo数据集被广泛用于偏好微调对话模型,尤其是采用直接偏好优化(DPO)及其变体(如IPO、KTO)来训练具备动机访谈(Motivational Interviewing)风格的智能助手。该数据集的核心价值在于其独特的构建方式:每一条样本均由真实持牌治疗师撰写的实际回答构成,并通过MITI-ST v1评分工具对回答的共情、合作、反思等维度进行量化评分,从而筛选出高质量与低质量的回答对。这种设计不仅避免了模型生成的自我偏好循环,还为训练奖励模型提供了可靠的参照基准,最终使得微调后的模型能够在心理健康对话中展现出更强的共情能力和协作态度。
实际应用
在实际应用中,基于该数据集训练的模型可部署于心理健康支持平台的辅助角色,例如在线心理咨询聊天机器人、心理自助工具或医疗机构的初步筛查询问系统。由于模型在训练中优先学习共情、合作与反思等动机访谈核心特质,而非单向的建议灌输或说教口吻,因此特别适合用于处理焦虑、抑郁、人际关系等常见心理困扰的低风险对话场景。数据集所强调的“避免非请求式建议”与“尊重用户作为自身问题的专家”原则,使得微调后的系统能够以更具参与性和温暖感的方式与用户互动,有效提升了用户在数字化心理支持环境中的信任感与参与度。不过,当前版本严格限定于辅助场景,并未被设计用于替代专业临床决策。
衍生相关工作
该数据集的发布已推动了一系列相关研究的展开,尤其是在动机访谈质量自动评价与偏好优化方法的交叉领域。直接依托本数据集,研究者可以探索多模型联合评分策略来缓解单一评分模型可能存在的表面特征偏好问题,亦可基于保存的完整评分矩阵重新构建不同选择策略下的训练对,以测试不同配对方式对模型行为的影响。此外,数据集所使用的MITI-ST v1评分框架为后续心理咨询回应评估工作提供了可复用的模板,已有团队尝试将其扩展至非英语情境及多轮对话的评估场景。长远来看,该数据集还激励了更多研究团队关注“AI作为评分者而非生成者”这一数据构建范式,推动了心理健康领域高质量偏好数据生态的持续完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务