遇见数据集

MentalAgora/TherapyTalk

收藏
Hugging Face2024-08-26 更新2025-04-26 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: int64 - name: post1 dtype: string - name: post2 dtype: string - name: post3 dtype: string - name: raw list: - name: author dtype: string - name: date dtype: timestamp[s] - name: post dtype: string - name: subreddit dtype: string - name: response dtype: string - name: annotator dtype: string splits: - name: test num_bytes: 703605 num_examples: 104 download_size: 451979 dataset_size: 703605 configs: - config_name: default data_files: - split: test path: data/test-* language: - en size_categories: - n<1K license: cc-by-4.0 --- # TherapyTalk Dataset This dataset was built as part of our study [MentalAgora: A Gateway to Advanced Personalized Care in Mental Health through Multi-Agent Debating and Attribute Control](https://arxiv.org/abs/2407.02736). The dataset was sourced from mental health-related posts in [Reddit Mental Health Dataset](https://zenodo.org/records/3941387) and tagged with responses from mental health professionals to selected posts. For more details on building the dataset, please see the paper. ## License For posts included in this dataset, please follow the license stated in the source, Reddit Mental Health Dataset. The responses included in this dataset are licensed under CC-BY 4.0. ## Citation ```bibtex @misc{lee2024mentalagoragatewayadvancedpersonalized, title={MentalAgora: A Gateway to Advanced Personalized Care in Mental Health through Multi-Agent Debating and Attribute Control}, author={Yeonji Lee and Sangjun Park and Kyunghyun Cho and JinYeong Bak}, year={2024}, eprint={2407.02736}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2407.02736}, } ```

--- dataset_info: 数据集信息: 特征字段: - 名称:id,数据类型:int64 - 名称:帖子1(post1),数据类型:字符串(string) - 名称:帖子2(post2),数据类型:字符串(string) - 名称:帖子3(post3),数据类型:字符串(string) - 名称:原始数据(raw),数据类型:列表,其内部字段包括: - 名称:作者(author),数据类型:字符串(string) - 名称:日期(date),数据类型:秒级时间戳(timestamp[s]) - 名称:帖子内容(post),数据类型:字符串(string) - 名称:子版块(subreddit),数据类型:字符串(string) - 名称:回复(response),数据类型:字符串(string) - 名称:标注者(annotator),数据类型:字符串(string) 划分集: - 名称:测试集(test),字节数:703605,示例数量:104 下载大小:451979,数据集总大小:703605 配置项: - 配置名称:默认(default),数据文件: - 划分集:测试集(test),路径:data/test-* 语言: - 英语(en) 规模分类: - 样本数少于1000(n<1K) 许可证:CC-BY 4.0 --- # TherapyTalk 数据集 本数据集系本团队研究《MentalAgora:依托多智能体辩论与属性控制实现心理健康领域高级个性化护理的门户》(https://arxiv.org/abs/2407.02736)的配套成果。 本数据集源自[Reddit心理健康数据集(Reddit Mental Health Dataset)](https://zenodo.org/records/3941387)中的心理健康相关帖子,并针对筛选出的帖子标注了心理健康专业人士的回复。有关本数据集的构建细节,请参阅对应研究论文。 ## 许可证 对于本数据集收录的帖子,请遵循其来源数据集Reddit心理健康数据集所规定的许可证条款。本数据集收录的回复采用CC-BY 4.0许可证进行授权。 ## 引用 bibtex @misc{lee2024mentalagoragatewayadvancedpersonalized, title={MentalAgora: A Gateway to Advanced Personalized Care in Mental Health through Multi-Agent Debating and Attribute Control}, author={Yeonji Lee and Sangjun Park and Kyunghyun Cho and JinYeong Bak}, year={2024}, eprint={2407.02736}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2407.02736}, }

提供机构:
MentalAgora
搜集汇总
数据集介绍
MentalAgora/TherapyTalk 数据集图片
构建方式
在心理健康研究领域,高质量对话数据的稀缺性长期制约着个性化诊疗技术的发展。TherapyTalk数据集应运而生,旨在弥合这一鸿沟。该数据集以Reddit心理健康子版块中的真实求助帖为原始语料,筛选自Reddit Mental Health Dataset这一公开资源。为确保回应内容的专业性与可靠性,研究团队邀请心理健康领域的专业人士对精选帖子进行标注性回应,从而构建出包含多轮对话结构的高质量语料库。整个构建过程严格遵循隐私保护与伦理规范,原始帖子遵循其源数据集的许可协议,而专业回应部分则采用CC-BY 4.0许可发布。
特点
该数据集的核心特质在于其独特的双层结构设计。每条数据不仅包含原始帖子的多轮对话历史(post1至post3),还通过raw字段保留了作者、时间戳、子版块等元信息,为上下文建模提供了丰富维度。尤为突出的是,response字段由心理健康专家撰写,确保了内容在临床语境下的准确性与同理心。此外,数据集还包含annotator字段,记录每位标注者的身份,便于后续进行标注一致性分析。测试集包含104个样本,规模虽小却精炼,每一条都经过专业筛选与审核,适合用于小样本学习或模型精调。
使用方法
该数据集在心理健康对话生成、情感支持系统评估及多智能体辩论等前沿任务中具有广泛适用性。使用时,用户可通过HuggingFace Datasets库直接加载default配置,获取包含id、post序列、专业回应及标注者信息的完整样本。建议将post1至post3作为模型输入序列,response作为目标输出,用于训练或微调对话生成模型。raw字段中的元信息可用于分析不同子版块或时间段的语言特征。由于数据量较小,推荐将其作为评估集或结合其他心理健康语料进行联合训练,以提升模型在专业场景下的表现力。
背景与挑战
背景概述
在人工智能与心理健康交叉领域,对话系统对情感支持与临床干预的模拟能力日益受到关注。TherapyTalk数据集由Yeonji Lee、Sangjun Park等研究者于2024年创建,源自其研究项目MentalAgora,旨在通过多智能体辩论与属性控制实现个性化心理关怀。该数据集从Reddit心理健康子版块中精选真实用户发帖,并由心理健康专家撰写回应,构建了高质量的咨询对话对。其核心研究问题在于如何利用多智能体框架生成更具共情力与专业性的心理支持文本。作为MentalAgora系统的基石,该数据集推动了心理语言处理与可控文本生成在医疗场景中的结合,为后续研究提供了可复现的评估基准。
当前挑战
TherapyTalk数据集面临多重挑战。在领域问题层面,心理健康对话生成需兼顾临床准确性与情感敏感性,现有模型常难以平衡专业建议与共情表达,易产生误导性回复。构建过程中,从Reddit海量帖文中筛选出适合专业干预的样本极为困难,需人工标注者具备心理学背景以避免文化或伦理偏差。此外,数据集的规模较小(仅104条测试样本),限制了模型泛化能力与鲁棒性评估。专家回应的标注一致性亦是难点,不同治疗师对同一问题的干预策略差异可能导致标签噪声,影响下游任务的可靠性。
常用场景
经典使用场景
TherapyTalk数据集的核心经典使用场景在于构建和评估面向心理健康领域的对话生成与情感理解模型。该数据集精选自Reddit心理健康社区的真实求助帖,并由专业心理健康从业者撰写回应,为研究者提供了高质量的“患者-治疗师”配对语料。这一设计使得它成为训练能够模拟治疗性对话、识别情绪状态并生成共情回应的语言模型的理想基准,尤其适用于少样本学习与多轮对话策略优化的研究。
衍生相关工作
该数据集衍生了多项开创性工作,其中最具代表性的是其源头研究MentalAgora框架,该框架利用多智能体辩论机制实现个性化心理健康护理中的属性控制与观点整合。后续工作包括基于该数据开发的共情强度可控生成模型,以及用于检测治疗性对话中潜在有害回应的安全评估基准。这些研究共同构建了从数据标注到模型部署的完整技术栈,深刻影响了心理健康AI领域的数据规范与评估标准。
数据集最近研究
最新研究方向
在人工智能与心理健康交叉领域,TherapyTalk数据集正引领着多智能体辩论与属性控制的前沿探索。该数据集源自Reddit心理健康社区的真实对话,并由专业心理治疗师进行标注,为构建个性化心理支持系统提供了高质量的语料基础。当前研究聚焦于利用多智能体框架模拟治疗性对话,通过属性控制机制实现情感调节、认知重构等复杂干预策略。这一方向不仅推动了对话系统在敏感场景中的安全性与共情能力提升,更与全球范围内日益增长的数字心理健康需求相呼应,为可扩展、低成本的智能心理干预方案开辟了新路径,其研究成果有望重塑传统心理咨询的服务模式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务