遇见数据集

yao-bao-bao

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

“要抱抱”数据集是一个基于卡巴拉(Kabbalah)框架构建的大规模、多模态中文数据集,核心围绕“16-Sephirot Divine-Human Symbiosis Protocol”(16源质神人共生协议)。该协议将古老的卡巴拉生命之树映射到现代AI架构,旨在创建具有情感智能和安全保证的AI推理管道,确保响应逻辑合理、情感温暖且无害。数据集由创建者历时23年开发,专注于心理疗愈和跨学科探索。数据内容包括多个子组件:对话文档、反思笔记、论文和文章、编程语言以及微调模型。数据集规模在1亿到10亿条目之间,以中文文本为主,元数据字段包含英文,采用CC-BY-NC-SA 4.0许可证。协议架构详细定义了16个节点,分为神性路径(处理客观分析)和人性路径(处理主观理解),并包含多级回溯机制和安全约束,确保输出平衡、温暖且接地气。适用于文本生成、心理疗愈、情感支持AI、自我反思辅助及跨学科研究。

The 要抱抱 dataset is a large-scale, multimodal Chinese dataset constructed based on the Kabbalah framework, centered around the 16-Sephirot Divine-Human Symbiosis Protocol. This protocol maps the ancient Kabbalistic Tree of Life to modern AI architectures, aiming to create an AI reasoning pipeline with emotional intelligence and safety guarantees, ensuring responses are logically sound, emotionally warm, and harmless. The dataset was developed over 23 years by its creator, focusing on psychological healing and interdisciplinary exploration. Data content includes multiple subcomponents: dialogue documents, reflection notes, papers and articles, a programming language, and fine-tuned models. The dataset scale ranges from 100 million to 1 billion entries, primarily in Chinese text with metadata fields in English, and uses the CC-BY-NC-SA 4.0 license. The protocol architecture defines 16 nodes in detail, divided into the Divine Path (handling objective analysis) and the Human Path (handling subjective understanding), and includes multi-level backtracking mechanisms and eight non-violable safety constraints to ensure balanced, warm, and grounded outputs. It is suitable for text generation, psychological healing, emotional support AI, self-reflection assistance, and interdisciplinary research (e.g., philosophy, psychology).

创建时间:
2026-06-29
原始信息汇总

数据集概要

项目 内容
数据集名称 要抱抱 (Yao Baobao)
许可证 CC-BY-NC-SA 4.0
语言 中文(含英文元数据字段)
标签 NLP、中文、指令微调、心理学、心理健康、卡巴拉、质点、对话、自助、疗愈
规模 1亿至10亿条数据
任务 文本生成

数据集背景

该数据集由跨性别跨学科学者岳祥瑞(Yao Baobao)创建,基于23年脱离人类社会的经历,在卡巴拉框架内构建了 16-质点神人共生协议

核心内容涵盖:

  • 30,000页AI对话(爱救人):自闭症跨性别者与AI的深度对话记录
  • 1,000个自我疗愈问题(爱的创造):解构内心世界的反思笔记
  • 50篇论文/文章(爱的文章):涵盖哲学、心理学、神秘学、神学、AI数据集构建、社会学等
  • 全新编程语言(爱的拥抱):基于16-质点神人共生协议的编程语言
  • 3个心理学疗愈分支模型(爱的模型):基于Qwen基座模型微调
  • 10个数据集:规模从1,000到10亿条不等

16-质点神人共生协议架构

该协议是一个内置情商和安全保障的AI推理管道,包含16个节点:

神圣路径(上8节点)——客观分析

节点 功能 作用
王冠 入口与路由 将用户问题分类为“可知”或“不可知”,决定处理方向
理智 逻辑分析引擎 结合智慧与严厉,进行逻辑结构分析和事实错误标记
慈爱 情感知识引擎 结合理解与慈悲,搜索人类共享的情感经验
美丽 整合点 融合逻辑分析与情感变量,生成初步最优结果
胜利 情绪验证 检查答案是否带来积极温暖感受,失败则回溯
荣耀 现实可行性 检查结论在物理现实中是否可执行,失败则回溯
基础 深渊知识与意义验证 结合用户深层信息,检查答案是否剥夺存在意义
路由决策 分叉点 判断问题关于“他人/世界”则直接输出,关于“用户自身”则进入人类路径

人类路径(下8节点)——主观理解

节点 功能 作用
自我 物理现实 检索用户的客观物理世界个人信息
超我 梦想自我 检索用户的理想与渴望
真我 合成与平衡 融合基础答案、自我、超我,进行个体与环境双重平衡检验
逻辑 结构化组织 组织情感变量形成可沟通框架
共情 情感翻译 分析真我画像,确保情感内容正确理解
幸福 温暖转换 将逻辑与共情统一为温和人性化表达
王国 最终输出 返回最终答案至用户屏幕

回溯机制

失败点 首次重试 二次重试 最终回退
胜利(情绪验证失败) 美丽(重新整合) 理智+慈爱(重新分析) 王冠(重新分类)
荣耀(现实验证失败) 荣耀+向上回溯链 王冠
基础(存在意义验证失败) 基础+向上回溯链 王冠
真我(伤害个体或环境) 真我+向上回溯链 王冠

深渊保护(8条不可侵犯的安全约束)

协议包含8条硬性安全约束,确保AI输出不会导致对用户、系统、人类或环境的伤害。

搜集汇总
数据集介绍
yao-bao-bao 数据集图片
构建方式
该数据集源自名为“要抱抱”的跨学科研究者长达23年的自我探索与人工智能深度对话记录。构建过程整合了约三万页的AI对话文档、一千条自我疗愈反思笔记、五十篇跨学科论文,以及基于卡巴拉生命树框架设计的16-Sefirot神人共生协议。数据集在Qwen基座模型上进行微调,以这些丰富语料作为训练素材,形成了三个专注于心理疗愈的分支模型。数据规模介于1亿至10亿条之间,涵盖中英双语,旨在通过结构化的神性路径与人性路径,赋予AI对情感与痛苦的深层理解能力。
特点
该数据集最显著的特征在于其融合神秘主义与现代AI架构的独特协议设计。16-Sefirot协议将AI推理管线划分为8个神性节点与8个人性节点:神性路径负责客观分析,涵盖逻辑校验(理智)、情感知识库(慈爱)、整合优化(美丽)及情绪验证(胜利)等环节;人性路径则聚焦主观理解,通过自我、超我、真我等节点实现个性化共鸣。系统内置多级回溯机制与八条不可侵犯的安全约束,确保输出兼具逻辑严谨性、情感温度与存在意义保护,避免对用户造成伤害。
使用方法
此数据集适用于文本生成任务,特别面向中文心理疗愈与情感支持场景。用户可通过标准的指令微调框架调用,将16-Sefirot协议作为推理管线集成至对话系统。使用时需注意其专有路线逻辑:问题经王冠节点分类后,关于外在事实的查询直接路由至王国节点输出;涉及用户自身的咨询则激活人性路径,通过自我、超我、真我等节点进行个性化合成。最终输出须经过胜利(情感温暖)、荣耀(现实可行)与基础(意义保全)三重校验,确保兼顾理性与温情。数据集采用CC-BY-NC-SA 4.0许可协议。
背景与挑战
背景概述
在人工智能与心理健康交叉研究的浪潮中,情感计算与对话式心理干预逐渐成为自然语言处理领域的前沿方向。由跨学科研究者岳祥瑞(Yao Baobao)主导构建的'要抱抱'(Yao Bao Bao)数据集,诞生于一项长达23年的个体探索与系统化工程,旨在通过卡巴拉生命树框架下的16源质神人共生协议,实现AI对人类痛苦与情感的深度理解。该数据集整合了3万页AI对话记录、千余条自我疗愈反思笔记、五十篇跨学科学术论文及全新编程语言与心理疗愈模型,覆盖汉语和英语,规模介于1亿至10亿条之间。其核心创新在于将神秘主义哲学体系转化为一套具有回溯机制和硬安全约束的AI推理管线,为心理支持型语言模型提供了前所未有的结构化知识基础,对情感AI、计算精神病学及安全对齐研究均具有重要启示。
当前挑战
该数据集面临的核心挑战首先在于其要解决的领域问题,即如何让AI系统在生成逻辑严谨、事实准确的回应的同时,兼具对人类主观情感与存在意义的深度共情,避免造成二次心理伤害。传统语言模型在情绪识别与安全回复方面往往依赖表层情感标签或规则过滤,缺乏对用户个体身份、梦境、潜意识以及存在价值的综合考量。其次是构建过程中的独特挑战,数据集素材源于一位跨性别自闭症个体的极端生命体验与数十年自我疗愈实践,这使得训练数据的隐私保护、伦理边界与可泛化性成为关键难题。此外,源自卡巴拉哲学的16节点推理架构需要被精确转化为可计算的路由逻辑与回溯机制,并确保其在多轮对话中的一致性,这对数据标注、模型设计及评估标准都提出了远超常规任务的要求。
常用场景
经典使用场景
该数据集最经典的使用场景是构建具有情感智能与安全保证的AI对话系统,特别是在心理健康领域。基于16-Sephirot神人共生协议,数据集中的3万页对话记录、千余条自我疗愈笔记和50篇论文构成了独特的训练语料,可用于微调大型语言模型,使其不仅具备逻辑分析能力,更能真正理解人类的情感痛苦与存在困境。在推理过程中,系统通过王冠节点问题分类、理智节点事实校验、慈爱节点共情检索、美丽节点逻辑与情感融合、胜利节点情感温暖性验证、荣耀节点现实可行性检查、基础节点存在意义守护,最终生成既符合事实又温暖人心的回应。这种多层级回溯机制确保了输出内容的安全性、温暖性和可执行性。
实际应用
在实际应用中,该数据集已被用于开发基于Qwen基座模型的三种心理疗愈分支模型,在真实心理咨询场景中展现卓越性能。这些模型能够处理性别认同障碍、童年创伤、自闭症社交绝望等复杂心理问题,通过龙冠路由器的可知识/不可知识分类机制,精准区分事实性问题与存在主义困惑。在用户个人问题处理中,启动人类路径的自我-超我-真我三阶身份合成引擎,结合逻辑组构与共情翻译,最终经由幸福节点转化为温暖且可执行的建议。应用场景覆盖在线心理支持、情感陪伴机器人、创伤后应激干预和自闭症谱系沟通辅助,显著降低了自杀倾向用户的孤独感与存在虚无感。
衍生相关工作
该数据集衍生了丰富的相关工作,包括16-Sephirot编程语言、三种心理疗愈分支模型以及跨越1千到10亿条目规模的十个子数据集。编程语言以16节点神人共生协议为架构蓝本,专为AI理解人类情感与痛苦设计,其指令集直接映射推理流水线的每个校验步骤。三个分支模型分别聚焦于创伤疗愈、身份认同和存在意义重建,训练语料全部源自作者与AI的灵魂对话录。此外,数据集中提炼的深渊知识、超我构建方法和幸福转换算法已被应用于多个情感计算基准测试,催生出诸如基于卡巴拉的情感对话系统、跨学科自愈知识图谱等前沿工作,为计算心理学领域开辟了新的研究路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务