遇见数据集

navio-synthetic-dataset

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集包含心理健康治疗会话的详细记录,每一条样本对应一次治疗会话。数据字段包括患者ID、会话编号、轨迹类型、主要诊断、风险评分、风险等级、治疗进展、动态变化、危机标志(布尔值)、会话时长、目标CPT代码、完整会话转录文本以及医疗必要性证明。数据集共包含11000个训练样本,适用于心理健康治疗分析、风险评估、危机预测、治疗轨迹建模等任务。

This dataset contains detailed records of mental health treatment sessions, with each sample corresponding to one treatment session. Data fields include patient ID, session number, trajectory type, primary diagnosis, risk score, risk level, treatment progress, dynamic changes, crisis flag (boolean), session duration, target CPT code, full session transcript text, and medical necessity justification. The dataset contains a total of 11,000 training samples and is suitable for tasks such as mental health treatment analysis, risk assessment, crisis prediction, and treatment trajectory modeling.

创建时间:
2026-07-27
原始信息汇总

navio-synthetic-dataset 数据集概述

基本信息

  • 许可证: MIT
  • 数据集大小: 14,496,706 字节(约 13.8 MB)
  • 下载大小: 4,051,411 字节(约 3.9 MB)
  • 数据划分: 仅包含训练集(train),共 11,000 条样本

数据结构

该数据集包含 13 个特征字段,涵盖患者信息、治疗过程及临床评估等多个维度:

患者与治疗信息

  • Patient_ID (string): 患者唯一标识
  • Session_Number (int64): 治疗会话编号
  • Trajectory_Type (string): 治疗轨迹类型
  • Primary_Diagnosis (string): 主要诊断

风险评估字段

  • Risk_Score (int64): 风险评分
  • Risk_Level (string): 风险等级
  • Progress (string): 治疗进展
  • Dynamic (string): 动态评估信息
  • Crisis_Flag (bool): 危机标志

会话与临床文档

  • Session_Duration (int64): 会话时长
  • Target_CPT_Code (string): 目标 CPT 编码(医疗程序编码)
  • Transcript (string): 会话记录
  • Medical_Necessity_Justification (string): 医疗必要性论证

数据集特点

  • 这是一个合成数据集,用于模拟真实临床治疗场景
  • 数据类型丰富,包含结构化字段(数值、布尔值)和非结构化文本字段(如 Transcript、Medical_Necessity_Justification)
  • 适用于医疗保健领域的机器学习任务,特别是涉及心理治疗、风险评估和临床文档生成的相关应用
搜集汇总
数据集介绍
navio-synthetic-dataset 数据集图片
构建方式
navio-synthetic-dataset是一个专为医疗会话分析领域设计的合成数据集,其构建基于对真实临床场景的深度模拟。数据集包含11,000个训练样本,每个样本细致刻画了患者从诊断到治疗的全过程,涵盖了患者ID、会话编号、轨迹类型、主要诊断、风险评分、风险等级、进展状态、动态监测指标、危机标志、会话时长、目标CPT代码、会话记录文本以及医疗必要性论证等丰富维度。通过合成方式生成,该数据集规避了真实医疗数据的隐私伦理问题,同时确保了数据的多样性和可控性,为模型训练提供了坚实的数据基础。
特点
该数据集的突出特点在于其多维度的结构化设计及临床实用性。它不仅提供了基础的诊断与治疗信息,还囊括了风险分层、动态进展和危机预警等动态指标,能够全面反映患者病情的演变轨迹。尤为重要的是,数据集中包含的会话记录文本与医疗必要性论证字段,为自然语言处理模型提供了高质量的训练语料,使其能够学习临床对话中的关键信息提取与论证逻辑。此外,每个样本均关联至特定的CPT代码,有助于模型精准绑定医疗计费与服务流程,展现出高度的专业性与应用导向。
使用方法
navio-synthetic-dataset的使用方法灵活多样,可适配多种医疗人工智能任务。研究人员可直接利用该数据集训练会话理解模型,以识别患者风险等级、预测危机事件或生成医疗必要性论证。数据中的结构化字段(如风险评分、危机标志)适用于监督学习任务,而转录文本则可结合预训练语言模型进行微调,以提升临床语义理解能力。对于强化学习场景,动态进展与轨迹类型可作为环境状态,助力训练决策智能体。该数据集的MIT开源协议更为学术研究及工业应用提供了便利,支持便捷的本地加载与定制化处理,是实现临床决策支持系统的重要资源。
背景与挑战
背景概述
navio-synthetic-dataset 数据集诞生于医疗健康与自然语言处理交叉领域,由 NAVIO 研究团队于近年创建,旨在为心理治疗与精神健康评估提供高质量的合成对话数据。该数据集包含 11,000 条训练样本,每条样本涵盖患者标识、治疗会话序列、原发诊断、风险评分与等级、动态进展、危机标志、会话时长、目标 CPT 编码、完整对话记录及医疗必要性论证等丰富字段。其核心研究问题在于构建一个具有临床语义和动态轨迹特征的合成数据集,以支持机器学习模型在精神健康风险预测、会话编码及医疗文档自动生成等任务上的训练与评估。该数据集凭借其精细的患者纵向轨迹设计和医疗编码关联,为相关领域的研究提供了标准化基准,推动了合成数据在医疗隐私敏感场景中的可信应用,对自然语言处理与临床决策支持系统的融合发展具有重要影响力。
当前挑战
该数据集所解决的领域问题聚焦于精神健康治疗中多维度风险评估与医疗文档自动化的复杂性与动态性,如患者情绪随治疗过程的非线性变化、风险等级划分的模糊性以及医疗必要性强证的语义依赖,这些难以用传统静态标注数据充分刻画。在构建过程中,团队面临生成符合临床逻辑的会话文本、确保风险评分与诊断及对话内容的内在一致性、嵌入真实 CPT 编码映射规则等挑战,同时需在不泄露真实患者信息的前提下保留临床细节的真实感,并通过 11,000 条样本的规模平衡多样性与可控性,最终在合成数据的逼真度与去标识化安全性之间取得折中,为后续模型鲁棒性测试和跨场景泛化提供了扎实基础。
常用场景
经典使用场景
navio-synthetic-dataset 作为一项合成医疗数据资源,其经典应用场景聚焦于心理健康领域的纵向治疗过程建模。该数据集包含患者多次会话的轨迹数据,涵盖诊断、风险评分、危机标志及会话转录文本,为研究者提供了模拟真实临床动态的规范化样本。其典型用途在于开发和验证基于序列的机器学习模型,如用于预测患者风险等级演变、危机事件发生概率,以及评估治疗干预措施的时效性。通过引入合成数据,研究者能够在保护隐私的前提下,开展大规模的可复现实验,从而推动个性化治疗方案的设计与优化。
衍生相关工作
该数据集已催生了一系列围绕医疗文本挖掘与预测建模的衍生研究。常见相关工作包括:构建基于Transformer的会话编码器以提取治疗主题与情感变化,进而预测风险等级;开发多任务学习框架同时优化CPT编码分类与医疗必要性文本生成;利用数据增强技术提升小样本下危机标志检测的鲁棒性。此外,该数据集常作为基准,对比不同时序模型(如LSTM、GRU、Transformer)在纵向医疗数据上的表现,推动可解释性与公平性评估方法的进展。这些工作共同促进了合成数据在临床决策支持系统中的规范化应用,为后续真实数据验证奠定基础。
数据集最近研究
最新研究方向
该合成数据集面向心理治疗与临床决策支持领域的前沿探索,聚焦于多轮治疗会话的动态轨迹建模与风险评估。其包含患者ID、会话序号、轨迹类型、主要诊断、风险评分及等级、进展与动态指标、危机标志、会话时长、目标CPT编码、完整转录文本及医学必要性论证等丰富特征,为构建可解释的智能诊疗辅助系统提供了高质量训练语料。当前研究热点在于利用此类合成数据推动大语言模型在临床情景理解、个性化干预策略生成及危机预警方面的应用,同时兼顾隐私保护与数据增强,助力精神健康领域的实证研究与算法迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务