遇见数据集

manas-dataset-v2

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

Manas数据集是一个用于文本生成任务的小规模英语数据集,重点关注心理健康领域。数据集包含551个经过清理的对话样本,划分为495个训练样本和56个评估样本。数据以JSON格式组织,每个样本包含一个conversations列表,列表中的对象代表对话轮次,具有from(如system、human、gpt)和value字段,模拟系统提示、人类查询和AI助手的响应。数据集基于合成数据生成,可能结合了ShareGPT和Unsloth等工具或来源,适用于心理健康相关的对话生成模型训练和评估。

The Manas dataset is a small-scale English dataset for text generation tasks, focusing on the mental health domain. It contains 551 cleaned dialogue samples, divided into 495 training samples and 56 evaluation samples. The data is organized in JSON format, with each sample including a conversations list where objects represent dialogue turns, featuring from (e.g., system, human, gpt) and value fields to simulate system prompts, human queries, and AI assistant responses. The dataset is based on synthetic data generation, potentially incorporating tools or sources like ShareGPT and Unsloth, and is suitable for training and evaluating dialogue generation models related to mental health.

创建时间:
2026-06-12
原始信息汇总

数据集名称

Manas Dataset

许可证

MIT

任务类别

  • 文本生成 (text-generation)

语言

  • 英语 (en)

标签

  • 心理健康 (mental-health)
  • unsloth
  • sharegpt
  • 合成 (synthetic)
  • manas

数据集规模

  • 样本总数小于1000 (n<1K)

统计信息

  • 总清洁对话数:553
  • 训练集:497
  • 评估集:56

数据格式

数据采用JSON格式,每条记录包含一个"conversations"字段,该字段是一个数组,每个元素包含以下结构:

  • from:发言者角色(system, human, gpt)
  • value:发言内容(字符串)
搜集汇总
数据集介绍
manas-dataset-v2 数据集图片
构建方式
manas-dataset-v2 是一个面向心理健康领域的合成对话数据集,基于 ShareGPT 格式构建。该数据集通过精心设计的系统提示(system prompt)作为对话的初始引导,随后由人类与模型(gpt)交替生成对话内容,模拟真实心理咨询场景中的交互模式。数据集包含 553 条经过清洗的高质量对话,其中训练集占 497 条,评估集占 56 条,确保数据在规模有限的前提下具备良好的结构化与实用性。
特点
该数据集的核心特点在于其专为心理健康文本生成任务设计,所有对话均围绕心理支持、情绪疏导等主题展开。采用 ShareGPT 格式的对话结构,每条记录包含明确的角色标签(system、human、gpt),便于模型学习多轮交互中的角色切换与语境连贯性。此外,数据集经过严格清洗以去除噪声,且基于合成方式生成,能够规避真实隐私数据带来的伦理风险,同时保持内容在心理干预场景下的专业性与亲和力。
使用方法
数据集适用于训练心理健康领域的对话生成模型,尤其是需要处理共情回复、危机干预或情绪识别的场景。使用时,可直接将对话列表作为输入,模型需根据 human 角色的输入生成相应的 gpt 角色回复。数据集的 JSON 格式便于与主流框架(如 Unsloth)集成,建议将训练集和评估集分别用于微调与性能验证。由于数据规模小于 1K,该数据集适合作为小样本学习的基准或结合其他数据进行迁移学习的基础。
背景与挑战
背景概述
Manas数据集(v2版本)发布于近年来心理健康人工智能研究蓬勃发展的时期,由相关研究团队基于合成数据生成技术构建,旨在推动大语言模型在心理健康支持领域的应用。该数据集聚焦于如何利用文本生成模型模拟专业、共情且安全的心理对话,以弥补真实临床数据稀缺且隐私敏感的不足。作为一项小规模但高度专业化的资源,它为心理健康AI的微调与评估提供了基础,尤其在提升模型对情绪识别、危机干预等复杂场景的响应能力方面具有潜在价值,为相关领域的研究开辟了新的方向。
当前挑战
该数据集面临的核心挑战之一是领域问题的复杂性:心理健康对话不同于普通问答,要求模型具备深层情感理解、伦理边界判断及避免有害建议的能力,现有通用模型在此类任务中表现欠佳。从构建层面看,由于数据完全依赖自动合成而非真实医患对话,其内容真实性、多样性和文化适应性难以保证,可能引入偏见或产生不安全的回复。此外,仅含553条对话的规模限制了模型的泛化能力,且缺乏标注的错例细节,增加了可靠评估的难度。
常用场景
经典使用场景
在心理健康领域,manas-dataset-v2被广泛用于训练和微调面向心理支持的大型语言模型。该数据集包含553条经过精心清洗的人机对话,涵盖系统设定、用户提问与模型回应三种角色,特别适用于构建具备共情与回应能力的心理咨询对话系统。研究者常基于该数据集进行指令微调,以提升模型在倾听、疏导与情绪识别等任务上的表现。
衍生相关工作
基于manas-dataset-v2,研究者衍生出一系列相关成果,包括针对心理对话的安全对齐方法、共情响应生成技术以及多轮对话情感追踪模型。此外,该数据集常作为基准,与GPT、LLaMA等模型微调后的版本进行对比,推动面向心理健康领域的对话数据集构建规范与评估指标体系的建立。
数据集最近研究
最新研究方向
当前,心理健康领域的对话数据集建设正迈向高质量与专业化之路,manas-dataset-v2作为一款精心筛选的合成对话数据集,聚焦于心理健康支持场景的文本生成任务。其仅含553条干净对话的规模虽小,却折射出领域研究的前沿趋势——如何在数据隐私与质量控制间取得平衡,利用合成数据生成技术构建高保真的心理支持语料,以缓解真实数据稀缺与标注成本高昂的瓶颈。该数据集的发布呼应了人工智能辅助心理健康干预的社会热点,为微调大型语言模型以提供共情式回应、危机识别提供了宝贵的资源,推动了从简单问答到深度情感陪伴的范式演进,其影响在于加速了安全、可控的心理健康AI工具落地,成为连接学术研究与临床应用的关键节点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务