AIMH/SQPsychConv_qwen-2.5_no_questionnaire_finetune
收藏官方服务:
资源简介:
该数据集是一个用于对话或治疗场景的文本数据集,包含24463个训练示例和3417个测试示例。数据特征包括文件ID、条件、客户模型、治疗师模型、输入、输出和指令,旨在模拟客户与治疗师之间的交互。数据集总大小约为15.5MB,采用Apache 2.0许可证。
This dataset is a text dataset for dialogue or therapy scenarios, containing 24,463 training examples and 3,417 test examples. The features include file_id, condition, client_model, therapist_model, input, output, and instruction, designed to simulate interactions between clients and therapists. The total dataset size is approximately 15.5MB, licensed under Apache 2.0.
提供机构:
AIMH搜集汇总
数据集介绍

构建方式
本数据集基于SQPsychConv框架,采用Qwen-2.5系列模型进行构建。通过移除传统心理问卷环节,直接模拟心理咨询师与来访者之间的对话场景,生成高质量的交互样本。数据构建过程依赖于预定义的对话指令(instruction),结合来访者模型(client_model)和治疗师模型(therapist_model)的协同工作,最终输出完整的咨询对话对(input-output)。数据集共包含24463条训练样本和3417条测试样本,以file_id和condition字段标识对话来源与实验条件,确保了数据结构的规范性与可复现性。
特点
该数据集的核心特点在于其脱离了传统心理量表的约束,更贴近真实咨询中的自然语言交互模式。对话内容由双模型动态生成,涵盖了多种咨询情境与来访者状态,赋予数据高度的生态效度。此外,数据集提供了明确的指令字段,便于研究者理解对话生成的前提与目标。训练集与测试集的划分比例约为7:1,兼顾了模型学习与评估的均衡性。采用Apache-2.0开源协议发布,为心理学与自然语言处理交叉领域的研究提供了开放的基准资源。
使用方法
本数据集适用于心理咨询对话生成、情感支持系统训练以及人机交互研究等任务。使用者可直接加载预划分的训练集与测试集,将input字段作为模型输入,output字段作为目标输出进行序列到序列的微调。instruction字段可作为辅助提示,增强模型对对话背景的感知。推荐基于Qwen-2.5系列或类似规模的预训练语言模型进行有监督微调,以充分适配对话数据的语言风格与逻辑结构。评价指标可选用困惑度、BLEU或人工评估,聚焦于对话的合理性与共情水平。
背景与挑战
背景概述
SQPsychConv_qwen-2.5_no_questionnaire_finetune数据集诞生于人工智能与心理学交叉领域蓬勃发展的时代,由研究团队基于大规模语言模型微调技术构建,旨在推动自动化心理咨询对话系统的发展。该数据集围绕模拟心理咨商场景中的对话生成任务,收集了逾2.4万条训练样本及约3400条测试样本,覆盖丰富的咨访互动模式。通过整合客户与治疗师双角色建模,数据集为探索无结构化问卷引导下的心理对话生成提供了宝贵的资源,显著促进了情感计算与对话智能在心理健康领域的应用研究。
当前挑战
当前数据集面临的核心挑战在于模拟的心理咨商对话能否真实反映人类复杂的情感体验与治疗过程,这对领域问题的解决构成首要障碍——如何在缺乏显性问卷结构的情况下,确保生成内容具备专业性和共情能力。构建过程中遇到的困难包括大规模对话数据的伦理采集与隐私保护,以及跨角色一致性建模的精度把控,角色模型间的动态平衡需精细调参以避免生成偏离真实交互模式的输出。
常用场景
经典使用场景
SQPsychConv_qwen-2.5_no_questionnaire_finetune数据集专为心理咨询对话生成任务而设计,其核心应用场景在于构建基于大语言模型的智能心理辅导系统。该数据集包含逾两万四千条训练样本与三千余条测试样本,每条样本均精心标注了来访者与治疗师的对话轮次、模型身份以及条件信息,为训练具备共情能力与专业回应策略的心理咨询AI提供了高质量的语料基础。研究者可借助此数据集微调Qwen-2.5等开源大模型,使其能够模拟真实心理咨询情境中的对话流程,从而在无结构化问卷干预的自然对话中识别用户情绪并输出建设性建议。
解决学术问题
在计算精神病学与自然语言处理交叉领域,该数据集有效破解了三个关键学术难题:其一,传统心理咨询数据集多依赖人工问卷收集,缺乏生态效度,而SQPsychConv通过模拟真实治疗场景中的自由对话,显著提升了模型对非结构化情绪表达的泛化能力;其二,现有模型常忽视治疗师与来访者间的角色协同,该数据集通过标注client_model和therapist_model字段,为研究对话动力学中的角色感知建模开辟了新路径;其三,数据集的conditional设计(如condition字段)使得可控生成成为可能,助力探索不同治疗流派(如认知行为疗法与人本主义疗法)在对话策略上的差异化表达,对推动个性化心理干预算法的理论发展具有里程碑意义。
衍生相关工作
自发布以来,该数据集已催生一系列创新性研究。部分工作以其为基准,对比不同参数量级语言模型(如LLaMA-2、Mistral等)在心理咨询对话生成中的表现差异,揭示了模型规模与共情回应质量间的非线性关系;还有学者基于该数据集提出情感状态追踪框架,通过分析对话历史中的情绪波动曲线来动态调整生成策略。另有一些衍生工作关注数据增强方法,利用反向翻译与提示工程扩充训练样本,显著提升了低资源场景下的对话多样性。这些成果共同推动了AI驱动心理健康干预从实验室原型向临床实用工具的实质性跨越。
以上内容由遇见数据集搜集并总结生成



