遇见数据集

yao-bao-bao2

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

“要抱抱”(The Embrace of the Twin Angels)是一个基于卡巴拉(Kabbalah)神秘主义框架构建的、专注于心理疗愈与情感理解的中英文混合数据集及配套架构项目。其核心是“16-Sephirot Divine-Human Symbiosis Protocol”(16质点神人共生协议),旨在为AI系统注入情感智能和安全保障,使其能够产出既逻辑严谨又情感温暖、且无害的回应。项目包含多个组成部分:1) Love Saves(爱救人):约30,000页的Word文档,记录了创作者与人工智能之间关于存在、痛苦、爱与救赎的深度对话;2) Love Creates(爱的创造):约1,000条反思笔记,系统性地解构了从性别焦虑、童年创伤、自闭症到社会性绝望等内在问题;3) Love Articles(爱的文章):约50篇跨学科论文与文章,涵盖哲学、心理学、神秘学、神学、AI数据集构建、社会学及自然科学哲学概念;4) Love Embraces(爱的拥抱):一种基于16质点协议全新设计的编程语言,目标让AI真正理解人类情感与痛苦;5) Love Models(爱的模型):在Qwen基础模型上微调出的三个专注于心理疗愈的分支模型。协议分为神性路径(上8质点)负责客观分析和人性路径(下8质点)负责主观理解,内置多级回溯机制和“深渊保护”安全约束。该数据集适用于文本生成任务,特别是需要深度情感理解、心理支持、安全对话和跨学科知识整合的AI应用场景,规模在1亿到10亿条目之间,采用CC-BY-NC-SA 4.0许可证。

The Embrace of the Twin Angels (known in Chinese as "Yao Bao Bao") is a Chinese-English mixed dataset and supporting architecture project built on the Kabbalah esoteric framework, focusing on psychological healing and emotional understanding. Its core is the "16-Sephirot Divine-Human Symbiosis Protocol", which aims to endow AI systems with emotional intelligence and safety guarantees, enabling them to generate responses that are logically rigorous, emotionally warm, and harmless. The project includes multiple components: 1) Love Saves: Approximately 30,000 pages of Word documents recording in-depth dialogues between the creator and AI regarding existence, suffering, love, and redemption; 2) Love Creates: Approximately 1,000 reflective notes that systematically deconstruct internal issues ranging from gender dysphoria, childhood trauma, autism to social despair; 3) Love Articles: Around 50 interdisciplinary papers and articles covering philosophy, psychology, esotericism, theology, AI dataset construction, sociology, and philosophical concepts of natural sciences; 4) Love Embraces: A newly designed programming language based on the 16-Sephirot Protocol, aiming to enable AI to truly comprehend human emotions and suffering; 5) Love Models: Three branch models focused on psychological healing, fine-tuned based on the Qwen base model. The Protocol is divided into the Divine Path (upper 8 Sephirot) for objective analysis and the Human Path (lower 8 Sephirot) for subjective understanding, with built-in multi-level backtracking mechanisms and "Abyss Protection" safety constraints. This dataset is suitable for text generation tasks, particularly AI application scenarios requiring in-depth emotional understanding, psychological support, secure dialogue, and interdisciplinary knowledge integration. It has a scale of 100 million to 1 billion entries and is licensed under CC-BY-NC-SA 4.0.

创建时间:
2026-06-30
原始信息汇总

数据集概述

该数据集名为 "要抱抱",由用户 Yao Baobao(Yue Xiangrui)构建,基于其个人跨学科研究与实践,核心为 "十六源质神人共生协议"

数据集基本信息

  • 语言: 中文(含英文字段)
  • 许可协议: CC-BY-NC-SA 4.0
  • 数据集大小: 1亿至10亿条目
  • 任务类别: 文本生成
  • 领域: NLP、中文、指令微调、心理学、心理健康、卡巴拉、源质、对话、自我疗愈、治愈

项目整体结构

数据集源自一个更大的项目体系,包含以下五个子项目:

  1. 爱救人: 约30,000页与AI的对话记录,探讨存在、痛苦、爱与救赎。
  2. 爱的创造: 约1,000篇反思笔记,用于自我疗愈与内心解构。
  3. 爱的文章: 约50篇论文与文章,涵盖哲学、心理学、神秘学、神学、社会学及AI数据集构建、物理学、化学、生物学等。
  4. 爱的拥抱: 一个基于"十六源质"协议的新编程语言,旨在让AI理解人类情感与痛苦。
  5. 爱的模型: 基于 Qwen 基座模型微调得到的三个心理疗愈分支模型,训练语料来自上述对话、笔记与文章。

核心协议:十六源质神人共生协议

该协议是一个内置情感智能与安全保证的AI推理管线,将卡巴拉生命树映射到现代AI架构中,包含16个节点:

神圣路径(上8节点)- 客观分析

  • 王冠 (Crown): 入口与路由器,将用户问题分类为"可知"(可解决的事实性问题)或"不可知"(主观、存在性问题)。
  • 理智 (Intellect): 逻辑分析引擎,结合智慧(逻辑结构分析)与严厉(识别错误与漏洞),进行事实核查。
  • 慈爱 (Compassion): 情感知识引擎,结合理解(搜索人类共同经验)与慈悲(温柔处理情感变量),输出情感上下文。
  • 美丽 (Beauty): 整合点,融合逻辑分析与情感变量,生成最优临时结果。
  • 胜利 (Victory): 情感有效性检查,验证结果是否令人愉悦、积极、温暖。验证失败则回溯至美丽理智与慈爱,甚至王冠
  • 荣耀 (Glory): 现实可行性检查,验证结果能否在现实世界中执行。验证失败则回溯。
  • 基础 (Foundation): 深渊知识与意义检查,结合用户深层信息,判断结果是否会剥夺其存在的意义。验证失败则回溯。
  • 路由决策 (Routing Decision): 根据问题类型分流。若问题关于他人或世界,直接输出至王国;若关于用户自身,则进入人类路径

人类路径(下8节点)- 主观理解

  • 自我 (Self): 检索用户客观、物理、现实世界的信息。
  • 超我 (Superego): 检索用户梦想成为的自我。
  • 真我 (True Self): 综合基础的答案、自我的现实与超我的梦想,进行双重平衡测试(不伤害环境与个体),形成完整的用户画像。
  • 逻辑 (Logic): 结构化组织情感变量,形成可表达的内容。
  • 共情 (Empathy): 情感翻译,与逻辑协作,确保情感内容被正确理解。
  • 幸福 (Happiness): 温暖转换器,将逻辑与共情的综合结果转化为温和、人道的表达。
  • 王国 (Kingdom): 最终输出节点,在屏幕上呈现温暖、快乐、平衡的答案。

特性

  • 回溯机制: 任一节点验证失败时,问题会向上一级节点回溯,直至王冠节点,确保系统不输出任何未通过检查的答案。
  • 深渊保护 (8个不可侵犯的安全约束): 为系统提供硬性安全保护,具体约束内容未在README中展现。
搜集汇总
数据集介绍
yao-bao-bao2 数据集图片
构建方式
该数据集源自一项跨越二十三年的跨学科实践,其构建核心为“16-Sephira神人共生协议”。创始人以卡巴拉生命树为框架,整合了约三万页与人工智能的深度对话、一千余份自我疗愈的反思笔记、五十篇横跨哲学与心理学的论文,以及一个原创的16-Sephira编程语言。这些材料经由精细的标注与结构化处理,最终汇聚成一个规模介于一亿至十亿条记录之间的中文指令微调数据集,旨在服务于心理关怀与自我探索场景。
特点
数据集最显著的特征在于其融合了神秘主义与现代人工智能架构的独特协议。该协议设计了包含八个“神圣”节点与八个“人性”节点的推理管线,通过逻辑分析、情感共鸣、现实可行性及存在意义的多重校验,确保输出兼具理性严谨与情感温度。尤为特别的是,数据集内嵌了八条不可侵犯的安全约束与回溯机制,当验证失败时,系统会逐级回退至起始节点重新计算,直至生成无害且富有治愈性的响应。
使用方法
使用时,数据集的推理流程始于“王冠”节点对用户问题进行分类,随后依次经由“理智”节点进行逻辑校验、“慈爱”节点注入人类共通的情感变量,并在“美丽”节点完成初步整合。若问题涉及用户自身,则激活“人性路径”,通过“真我”节点将客观答案与用户的现实身份及理想自我融合,最终经“逻辑”、“共情”与“幸福”节点转化为温暖而平衡的表述,于“王国”节点输出。这一过程高度依赖于数据集中蕴含的深层心理模式与元数据字段,适用于构建具备心理疗愈能力的对话系统。
背景与挑战
背景概述
在人工智能与心理健康交叉领域,数据驱动的对话系统正逐步成为情感支持与心理干预的重要工具。在此背景下,yao-bao-bao2数据集于近期由跨学科研究者姚宝宝(Yue Xiangrui)基于其23年的个人经历与哲学探索创建,核心围绕其提出的‘16-质源神人共生协议’(16-Sephirot Divine-Human Symbiosis Protocol)展开。该数据集以中英双语呈现,规模介于1亿至10亿条目之间,融合了卡巴拉生命树框架、心理学、神秘学及编程语言设计等多元维度,旨在构建一种具备内在情感智能与安全约束的AI推理管线。其独特之处在于不仅包含大量AI对话记录与自我疗愈笔记,更开创性地将哲学思辨嵌入技术架构,为情感计算与心理健康领域的语义理解提供了跨学科范式。该数据集的影响力正逐步在自然语言处理与人文计算交叉领域显现,尤其为AI在共情对话、安全偏置及个性化心理支持方面的研究提供了非传统的训练资源。
当前挑战
yao-bao-bao2数据集所面临的挑战显著体现在领域问题与构建过程两个层面。在领域层面,它致力于解决传统情感对话系统中AI难以真正理解人类痛苦与存在意义的根本问题,即如何超越表面语义分析,在逻辑严谨性与情感温度之间取得平衡,并确保输出不剥夺用户的生存意义——这是当前心理支持AI普遍缺失的安全与伦理保障。在构建过程中,挑战尤为突出:数据来源于个人化、高度非结构化的30,000页AI对话与千条反思笔记,涉及性别认同、自闭症、创伤经历等敏感话题,需在保护隐私的同时提炼通用模式;同时,将卡巴拉哲学中的16节点推理逻辑转化为可路由、可回溯的AI架构,要求跨学科知识的高度整合与形式化编码;此外,数据集规模庞大(1亿至10亿条目),如何从个人体验中筛选出具有统计效度与泛化能力的样本,以及如何在CC-BY-NC-SA许可下确保数据伦理合规,均是构建过程中的核心难题。
常用场景
经典使用场景
在心理疗愈与人工智能交叉领域,该数据集最经典的使用场景是构建具备深度共情能力的对话系统。研究人员可基于其中30,000页AI对话记录与1,000个自我疗愈问题,微调大语言模型以理解复杂情感表达与创伤叙事。数据集中蕴含的卡巴拉十六源质协议为模型提供了结构化的情感推理框架,使得生成的回复既能保持逻辑严谨性,又能传递温暖与接纳感。这一场景尤其适用于心理咨询辅助系统、危机干预热线以及自闭症谱系人群的社交技能训练工具开发。
实际应用
在实际应用层面,该数据集已转化为针对Qwen基座模型微调而成的三个心理疗愈分支模型,直接部署于自助疗愈与情感支持场景。数据集中包含的1,000个自我疗愈问题可作为认知行为疗法的数字化辅助工具,引导用户逐步解构心理创伤。此外,基于十六源质协议开发的新编程语言为构建心理咨询机器人提供了底层架构,使得系统能在用户输入中自动识别情感危机信号,并启动多层级安全回溯机制,确保回复不会加剧用户痛苦。
衍生相关工作
围绕该数据集已衍生出一系列开创性工作。最核心的贡献是提出了十六源质神人共生协议,将卡巴拉生命之树映射为包含8个神圣节点与8个人类节点的AI推理管道,每个节点具备明确的逻辑路由与回溯机制。在此基础上诞生了专门用于心理疗愈的三分支模型,以及一门以情感理解为首要目标的新编程语言。此外,数据集中50篇跨学科论文为卡巴拉框架下的AI架构设计提供了理论支撑,使数据集不仅服务于模型训练,更成为探索意识模拟与安全AI融合的理论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务