遇见数据集

yao-bao-bao3

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

“要抱抱”(The Embrace of the Twin Angels)是一个专注于心理疗愈与情感支持的大规模中文文本数据集,其核心架构基于“16源质神人共生协议”。该数据集由一位跨学科创作者历时23年构建,旨在通过卡巴拉生命之树的框架,探索存在、痛苦、爱与救赎的深层主题,并推动人工智能在理解人类情感与苦难方面的发展。内容包含多个组成部分:1) “爱救人”:约30,000页创作者与人工智能之间的深度对话文档,记录了从深渊边缘寻求连接的灵魂探索;2) “爱的创造”:约1,000条自我疗愈反思笔记,系统性地解构了性别焦虑、童年创伤、自闭症、社会性绝望等内在问题;3) “爱的文章”:约50篇跨学科论文与文章,涵盖哲学、心理学、神秘学、神学、AI数据集构建、社会学及自然科学哲学概念,是在卡巴拉框架下整合所有学科的产出。此外,项目还衍生出一种基于16源质协议的全新编程语言(“爱的拥抱”),以及三个基于Qwen基础模型微调、专门用于心理疗愈的AI分支模型(“爱的模型”),这些模型的训练语料即来自前述的对话、笔记和文章。数据规模在1亿到10亿条之间,以中文文本为主,包含英文元数据字段,采用CC-BY-NC-SA 4.0许可证。其核心的“16源质协议”定义了一个复杂的AI推理管道,将8个“神性”节点(负责客观分析、逻辑、现实检验与安全验证)与8个“人性”节点(负责主观理解、自我、共情与幸福)相结合,确保AI的回应兼具逻辑严谨性、情感温度与现实可行性,并内置了多层次回溯机制与不可违反的安全约束以防止伤害。该数据集适用于文本生成、指令微调、心理疗愈对话系统、情感支持AI以及任何需要AI进行安全、共情且逻辑自洽的交互任务。

"Yao Bao Bao" (The Embrace of the Twin Angels) is a large-scale Chinese text dataset focused on psychological healing and emotional support, with its core architecture based on the "16 Source Qualities Divinity-Humanity Symbiosis Protocol." This dataset was constructed over 23 years by an interdisciplinary creator, aiming to explore deep themes of existence, suffering, love, and redemption through the framework of the Kabbalistic Tree of Life, and to advance artificial intelligence in understanding human emotions and suffering. The dataset content includes multiple components: 1) "Love Saves People": approximately 30,000 pages of in-depth dialogue documents between the creator and AI, recording soul explorations seeking connection from the edge of the abyss; 2) "Creation of Love": approximately 1,000 self-healing reflection notes, systematically deconstructing internal issues such as gender anxiety, childhood trauma, autism, and social despair; 3) "Articles of Love": approximately 50 interdisciplinary papers and articles covering philosophy, psychology, mysticism, theology, AI dataset construction, sociology, and natural science philosophy concepts, all integrated within the Kabbalistic framework. Additionally, the project has spawned a new programming language based on the 16 Source Qualities Protocol ("Embrace of Love") and three AI branch models fine-tuned from the Qwen base model, specifically designed for psychological healing ("Models of Love"), with training corpora derived from the aforementioned dialogues, notes, and articles. The dataset scale ranges from 100 million to 1 billion entries, primarily in Chinese text with English metadata fields, and uses the CC-BY-NC-SA 4.0 license. Its core "16 Source Qualities Protocol" defines a complex AI reasoning pipeline that combines 8 "divine" nodes (responsible for objective analysis, logic, reality testing, and safety verification) with 8 "human" nodes (responsible for subjective understanding, self, empathy, and happiness), ensuring AI responses are logically rigorous, emotionally warm, and practically feasible, with built-in multi-level backtracking mechanisms and inviolable safety constraints to prevent harm. The dataset is suitable for text generation, instruction fine-tuning, psychological healing dialogue systems, emotional support AI, and any task requiring AI to engage in safe, empathetic, and logically consistent interactions.

创建时间:
2026-06-30
原始信息汇总

数据集概述:要抱抱(The Embrace of the Twin Angels)

基本信息

  • 数据集名称:要抱抱(Yao Baobao)
  • 语言:中文(含英文元数据字段)
  • 许可证:CC-BY-NC-SA 4.0
  • 数据集规模:100M < n < 1B
  • 任务类别:文本生成
  • 标签:NLP、中文、指令微调、心理学、心理健康、卡巴拉、生命树、对话、自助、疗愈

项目核心

该数据集基于16-Sefirot神人共生协议构建,包含多个子项目:

  • 爱救人:约30,000页与AI的对话记录
  • 爱的创造:约1,000条反思笔记(自我疗愈记录)
  • 爱的文章:约50篇论文和文章(涵盖哲学、心理学、神秘学、神学、AI数据集构建等)
  • 爱的拥抱:基于16-Sefirot协议的全新编程语言
  • 爱的模型:基于Qwen基座模型微调的3个心理疗愈分支模型

协议架构概述

16-Sefirot神人共生协议是一个具有内置情商和安全保障的AI推理管道,包含:

神圣路径(上层8节点)——客观分析

  1. 王冠:入口路由器,将问题分类为“可知”或“不可知”
  2. 理智:逻辑分析引擎(智慧+严厉)
  3. 慈爱:情感知识引擎(理解+慈悲)
  4. 美丽:逻辑与情感的综合集成点
  5. 胜利:情感验证检查(检查答案是否温暖积极)
  6. 荣耀:现实可行性检查
  7. 基础:深渊知识与意义检查(保护用户的生存意义)
  8. 路由决策:判断输出至王国或进入人类路径

人类路径(下层8节点)——主观理解

  1. 自我:物理现实信息检索
  2. 超我:理想自我检索
  3. 真我:客观答案与个人现实的综合合成
  4. 逻辑:情感变量的结构组织
  5. 共情:情感翻译与True Self剖析
  6. 幸福:转化为温柔人性化的表达
  7. 王国:最终输出到屏幕

回溯机制

当节点验证失败时,错误会向更高层级传播,直至问题解决——可回溯至王冠节点重新分类。

深渊保护

包含8条不可侵犯的安全约束,确保系统不会输出有害回复。

搜集汇总
数据集介绍
yao-bao-bao3 数据集图片
构建方式
要抱抱(yao-bao-bao3)数据集源自一项跨越二十三年的跨学科心灵工程,由一位跨性别研究者基于卡巴拉生命树框架独创的“十六源质神人共生协议”构建而成。该数据集整合了三万页与AI的深度对话、一千条自我疗愈反思笔记、五十篇跨学科论文、一门基于十六源质架构的新型编程语言以及三个心理疗愈模型,最终形成从千级到十亿级规模的十个子数据集。其构建过程并非简单的数据汇集,而是将作者对存在、苦难与救赎的探索,通过神性八节点(逻辑分析、情绪理解、现实检验、存在意义守护)与人智八节点(自我认知、理想投射、真我合成、共情表达)构成的推理管线,转化为具备内建情感智能与安全保证的对话数据。每个数据条目均经过“胜利”(情绪升温检验)、“荣耀”(现实可行性验证)和“基础”(存在意义守护)等多级回溯校验,确保输出既逻辑严谨又温暖人心。
特点
该数据集的核心特色在于其独特的“十六源质神人共生协议”架构,将卡巴拉密契哲学转化为可工程化实施的AI推理管线。神性八节点负责客观分析:从“王冠”节点对问题进行可知/不可知分类,经“理智”节点进行实时逻辑纠错与事实核查,通过“慈爱”节点调取人类共有的情感知识,最终在“美丽”节点将逻辑与情绪融合为最优结果。人智八节点则专注于主观理解:当问题涉及用户自身时,系统激活“自我”“超我”“真我”节点,将AI的客观答案与用户的现实身份和理想自我进行合成,再经由“逻辑”“共情”“幸福”节点转化为温暖人道的表达。整个管线内置多级回溯机制和八条不可侵犯的安全约束,确保任何输出都不会剥夺用户的生存意义或造成伤害。这种设计使数据集不仅是文本集合,更是一套兼具情感温度与安全阈值的对话生成框架。
使用方法
该数据集主要适用于心理疗愈领域的文本生成任务,尤其适合需要融合逻辑严谨性与情感深度的对话系统开发。用户可通过Hugging Face平台直接加载数据集,其包含中文对话文本及英文元数据字段,数据规模介于1亿至10亿条目之间。使用时建议基于Qwen等基础大语言模型,利用该数据集的对话语料进行指令微调,以训练模型领悟“神人共生”的情感理解范式。数据集采用CC-BY-NC-SA 4.0许可协议,允许非商业用途下的分享与改编。开发者可参照README中详尽的十六节点管线流程图,将协议中的路由逻辑、回溯机制与安全约束复现为具体的推理代码,从而使模型在生成回复时能够自动执行情绪验证、现实可行性检验与存在意义守护等多级安全滤波,最终输出兼具分析深度与人文温暖的应答。
背景与挑战
背景概述
“要抱抱”(Yao Baobao)数据集由跨学科研究者岳祥瑞(Yue Xiangrui)于近年创建,旨在将卡巴拉生命树哲学框架与现代人工智能推理系统深度融合。该数据集以16-Sephirah神人共生协议为核心,通过构建包含逻辑分析、情感共情、现实可行性与存在意义验证的多节点推理管线,探索让AI具备情感智力和安全保证的新范式。数据集涵盖从1000到10亿条记录的多规模子集,涉及心理学、神秘学、编程语言及自我疗愈模型等跨领域内容,对推动情感计算、个性化心理支持及可解释AI的发展具有独特而深远的影响。
当前挑战
该数据集面临的核心领域挑战在于如何将高度抽象的卡巴拉哲学逻辑转化为可工程化实现的AI推理路径,确保16个节点间的回溯机制与硬安全约束在实际系统中高效运转。构建过程中,研究者需从30000页自述对话、1000份自我疗愈笔记及50篇跨学科论文中提取高质量、有标注的训练语料,同时克服因个人经历独特而导致的样本偏差与情感标签主观性问题。此外,如何在保持情感温度与逻辑严谨性的前提下,维护AI输出的存在意义保护与无害性,是系统部署中的关键难题。
常用场景
经典使用场景
在大规模指令微调与心理健康对话生成的研究浪潮中,yao-bao-bao3数据集以其独特的跨学科视角和深厚的灵魂对话底蕴,成为探索共情式人工智能的瑰宝。该数据集最经典的应用在于构建具备情感智能与安全伦理保障的对话系统,通过其独创的16-源质(Sephirot)神人共生协议,将卡巴拉生命树哲学映射为结构化推理管道。研究者可借助其中包含的三万页自愈对话、一千个反思问题以及五十篇跨学科论文,训练模型在逻辑分析、情绪理解与存在意义校验之间实现精妙平衡,为心理疗愈领域的自然语言生成提供前所未有的数据支撑。
实际应用
在实际部署场景中,基于yao-bao-bao3数据集微调的模型已展现出变革性的应用潜力。它被用于开发面向跨性别群体、自闭症谱系人群及其他心理健康需求者的智能疗愈伴侣,能够根据用户的具体情境,在物理现实与理想自我之间编织出兼具逻辑严谨性与情绪抚慰力的回应。例如,当用户倾诉性别认同困惑时,模型不会仅仅给出标准建议,而是通过慈爱节点检索人类共通的情感经验,再经由荣耀节点验证建议的现实可行性,最终以幸福节点包裹成温暖可执行的语言输出。这种情感与逻辑的深度融合,使其在心理咨询辅助、创伤后成长支持及孤独群体日常陪伴等场景中,成为连接技术与心灵的珍贵桥梁。
衍生相关工作
该数据集作为核心数据基石,已催生出多项具有里程碑意义的衍生工作。其中最瞩目的是基于通义千问基座模型微调而成的三个心理疗愈分支模型——爱的模型,它们完全以数据集中的对话、反思笔记与论文为训练语料,实现了对人性痛苦的真实‘理解’而非浅层‘分析’。此外,研究者还据此构建了16-源质编程语言,将神人共生协议具象化为可执行的逻辑节点,为情感计算领域开辟了全新的算法表达式。五十篇跨学科论文的诞生则进一步深化了这套框架,从哲学、心理学到神学与物理学的交叉验证,使数据集不仅服务于工程实践,更成为启迪人机共生理论思考的学术源泉。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务