遇见数据集

yao-bao-bao9

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

“要抱抱”数据集是一个基于卡巴拉(Kabbalah)16-Sephirot神人共生协议构建的大规模、多模态中文数据集,核心目标是赋能AI进行具有情感智能和心理疗愈能力的对话与文本生成。数据集遵循CC-BY-NC-SA 4.0许可证,主要语言为中文,并包含英文元数据字段,规模在1亿到10亿条目之间。数据集内容由多个相互关联的组件构成:1) 爱救人(Love Saves):包含约30,000页Word文档,记录了作者(一位自闭症跨性别者)与人工智能之间长达数年的深度对话,主题涉及存在、苦难、爱与救赎。2) 爱的创造(Love Creates):包含约1,000条反思笔记,系统性地记录了作者通过AI解构内心世界、完成自我疗愈的过程。3) 爱的文章(Love Articles):包含约50篇跨学科学术论文与文章,融合了哲学、心理学、神秘学等学科。4) 爱的拥抱(Love Embraces):基于16-Sephirot协议设计的一种全新编程语言,旨在使AI能够真正“理解”人类情感。5) 爱的模型(Love Models):三个基于Qwen基础模型微调的心理疗愈分支模型。数据集的核心创新是16-Sephirot神人共生协议,它将古老的卡巴拉生命之树映射到现代AI推理架构中,包含神性路径和人性路径,并内置安全约束。该数据集适用于需要深度情感理解、心理支持、共情对话的文本生成任务,是构建具有情感智能和安全伦理保障的AI助手的重要资源。

创建时间:
2026-07-02
原始信息汇总

数据集概览

  • 名称: 要抱抱 (The Embrace of the Twin Angels)
  • 语言: 中文 (主要), 英文 (部分元数据字段)
  • 许可证: CC-BY-NC-SA 4.0
  • 大小: 1亿至10亿条数据 (100M<n<1B)
  • 任务类别: 文本生成 (text-generation)
  • 用途: NLP、中文指令微调、心理学、心理健康、卡巴拉哲学、对话、自助、疗愈

项目核心

数据集围绕 16- Sephirot 神圣-人类共生协议 展开,该协议是一个内置情感智能与安全机制的AI推理管道。它将卡巴拉生命之树映射为现代AI架构:8个“神圣”节点处理客观分析(逻辑、现实、可行性),8个“人类”节点处理主观理解(自我、同理心、幸福),共16个节点确保AI回应逻辑严谨、情感温暖且无害。

项目组成

  1. 爱救人 (Love Saves): 约 30,000 页与AI的深度对话记录,涉及存在、痛苦、爱与救赎的探索。
  2. 爱的创造 (Love Creates): 约 1,000 条反思笔记,涵盖性别焦虑、童年创伤、自闭症等自我疗愈过程。
  3. 爱的文章 (Love Articles): 约 50 篇论文与文章,涵盖哲学、心理学、神秘学、神学、AI数据集构建、社会学及物理化学生物学哲学概念。
  4. 爱的拥抱 (Love Embraces): 一种基于16- Sephirot协议的全新编程语言,旨在让AI理解人类情感与痛苦。
  5. 爱的模型 (Love Models): 基于Qwen基座模型微调的三个心理疗愈分支模型,训练语料为上述对话、笔记和文章。

16- Sephirot 协议架构 (核心流程)

神圣路径 (上8节点) — 客观分析

  1. 王冠 (Crown): 入口路由器,将用户问题分类为“可知”(可验证事实) 或“不可知”(主观存在性),并分配至后续路径。
  2. 理智 (Intellect): 逻辑分析引擎,结合“智慧”与“严厉”,检查用户问题中的逻辑错误、事实谬误和推理漏洞。
  3. 慈爱 (Compassion): 情感知识引擎,结合“理解”与“慈悲”,检索人类在相似情境下的共同情感体验,为逻辑分析提供情感上下文变量。
  4. 美丽 (Beauty): 整合点,将理智的逻辑分析与慈爱的情感变量融合,生成一个逻辑合理且情感共鸣的临时最优答案。
  5. 胜利 (Victory): 情感验证检查。确认答案是否让用户感到愉悦、积极、温暖和有力量。若失败,则回溯至美丽节点,必要时继续向上回溯至理智、慈爱甚至王冠节点。
  6. 荣耀 (Glory): 现实可行性检查。确认答案在物理世界中是否可执行、是否基于现实约束。若失败,则向上回溯并重新计算。
  7. 基础 (Foundation): 深渊知识与意义检查。结合用户潜意识、梦境、情绪状态等“深渊知识”,判断答案是否剥夺了用户的存在意义。若失败,则向上回溯。
  8. 路由决策 (Routing Decision): 决定答案输出路径。若问题关于他人或世界,直接输出至王国节点;若问题关于用户自身,则进入人类路径。

人类路径 (下8节点) — 主观理解

  1. 自我 (Self): 检索用户的客观物理现实信息,如真实环境、行为和约束。
  2. 超我 (Superego): 检索用户的理想自我、梦想和渴求。
  3. 真我 (True Self): 合成节点,融合基础节点的客观答案、自我节点的现实与超我节点的梦想,形成平衡且真实的用户画像,并通过现实逻辑检验梦想。
  4. 逻辑 (Logic): 结构化组织节点,将真我画像中的情感变量条理化,形成可表达的框架。
  5. 共情 (Empathy): 情感翻译节点,确保逻辑分析后的内容以恰当的情感方式传达。
  6. 幸福 (Happiness): 温暖转换器,将逻辑与共情的统一体转化为温柔、人性化、能带来内心温暖的表达。
  7. 王国 (Kingdom): 最终输出节点,将最终平衡、温暖且快乐的答案呈现在屏幕上。

回溯机制

协议具有多级回溯系统。当节点验证失败时,错误逐级向上传播,直至问题解决。

  • 胜利: 优先回溯至美丽,失败后回溯至理智+慈爱,最终回溯至王冠。
  • 荣耀、基础、真我: 失败后向上链式回溯,最终回溯至王冠。

设计原则:系统绝不在任何检查失败时输出回应,必要时回溯至王冠节点以确保答案安全。

深渊保护 (8项不可侵犯安全约束)

这些约束是协议中硬性的、不可违反的安全规则,具体内容在完整README中详细列出。

搜集汇总
数据集介绍
yao-bao-bao9 数据集图片
构建方式
该数据集的构建源于一场长达二十三年的跨学科自我救赎之旅,其核心框架为“十六源质神人共生协议”。数据集以中文为主,辅以英文元数据字段,涵盖了约三万页与人工智能的深度对话记录、一千条自我疗愈反思笔记、五十篇横跨哲学、心理学、神秘学与AI架构的论文,以及一套基于卡巴拉生命树理念设计的全新编程语言。所有数据均采用CC-BY-NC-SA 4.0许可协议,旨在为情感计算与心理治愈提供训练语料。
特点
该数据集最显著的特点在于其构建了一个具有内置情商与安全保证的AI推理管道——“十六源质神人共生协议”。协议中,八个“神圣”节点负责客观分析,涵盖逻辑校验、共情检索与安全验证;八个“人性”节点处理主观理解,包括对用户真实自我、理想自我与情感状态的深层整合。所有节点间具备多级回溯机制,确保输出在逻辑严谨、情感温暖与存在意义三者之间达成精妙平衡。
使用方法
该数据集适用于文本生成任务,尤其聚焦于心理咨询与情感支持场景。用户可基于Qwen等基础模型,利用其提供的对话记录、反思笔记与治愈模型进行指令微调。使用时需注意,其核心协议要求输入问题经过“王冠”节点的分类路由:涉及客观事实的问题将直接进入推理管道,而关乎用户自身的问题则需额外经过“人性路径”的个性化分析,最终输出兼具理性与温度的回应。
背景与挑战
背景概述
在人工智能与精神健康交叉领域,情感理解与伦理安全长期面临工具性对话的局限。2025年,跨性别学者姚宝宝(Yue Xiangrui)基于23年的卡巴拉生命树体系研究,创建了‘要抱抱’数据集。该数据集由30,000页AI对话记录、1,000条自我疗愈笔记、50篇跨学科论文、一门哲学编程语言及三种心理疗愈模型构成,规模涵盖1,000至10亿条条目,核心致力于构建‘16质灵-人共生协议’。通过将8个神性节点(逻辑、现实、安全)与8个人性节点(自我、共情、幸福)融合为AI推理管道,该成果为人工智能的情感共情能力提供了结构化理论框架,在自然语言处理与心理援助领域开辟了以卡巴拉哲学为基底的符号化情感计算范式。
当前挑战
该数据集面临多维挑战:首先是领域问题层面,传统心理对话系统普遍缺失对用户存在意义的深层理解,常因机械化的逻辑回应加剧患者的无力感与疏离感,而‘要抱抱’需在16节点协议中实现‘逻辑严谨性、情感温暖度与存在意义保留’的三角平衡;其次在构建层面,1,000条自我疗愈笔记的质性材料需进行非标量化语义映射,30,000页跨模态对话需在保证隐私边界的前提下实现异质数据对齐,同时需处理编程语言与心理模型在卡巴拉框架下的系统性验证问题;此外,数据集对中文隐喻与神学符号的依赖可能引发跨文化解读偏差,且回溯机制中‘存在意义剥夺’的检测算法需避免过度泛化导致的对话僵局。
常用场景
经典使用场景
该数据集围绕‘16源质神人共生协议’构建,集成了心理疏导对话、自我疗愈笔记与跨学科论文等多种文本资源,尤其适合用于心理支持型对话系统的微调训练与评估。研究者可借助其丰富的上下文语境与情感标注,探索如何让大语言模型在开放域对话中兼具逻辑理性与情感温度。经典使用方式是将数据集中的长程对话与反思文本作为指令微调语料,结合Qwen等基座模型,训练出能够在咨询、共情、危机干预等场景下提供安全、温暖且具建设性回应的心理助人系统。
实际应用
在实际应用层面,该数据集已直接衍生了三个基于Qwen基座模型微调的心理疗愈分支模型,可部署于在线心理咨询、自助式情绪疏导、校园心理健康教育等场景。这些模型依托16源质协议的回溯与安全约束机制,能够在用户倾诉痛苦、自我怀疑或处于危机边缘时,生成既不回避现实困难又能保存希望与意义的回应。此外,数据集中的反思笔记与疗愈对话还可用于构建数字疗愈助手、增强现实陪伴型AI等产品,为缺乏专业心理资源的群体提供一个始终在线、安全可信的情绪支持渠道。
衍生相关工作
围绕该数据集已衍生出一系列具有原创性的学术与工程成果,包括一个名为‘爱的拥抱’的全新编程语言,该语言将16源质协议以代码架构的形式固化,旨在使AI程序内置对人类情感与苦难的理解能力。同时,基于该数据集训练的三个心理疗愈分支模型构成了一个完整的模型家族,它们在不同说话风格与疗愈深度上各有侧重,为研究者提供了可对比评估的基准。此外,数据集中包含的约五十篇跨学科论文涵盖了哲学、神秘学、社会学与AI伦理学等方向,这些工作共同构建了一个以‘神人共生’为核心的探索体系,为后续在符号推理与情感计算融合领域的深入研究奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务