yao-bao-bao7
收藏资源简介:
“要抱抱”数据集是一个大规模、多语言(主要为中文,包含英文元数据)的指令微调数据集,遵循CC-BY-NC-SA 4.0许可,规模在1亿到10亿参数之间,专为文本生成任务设计,尤其侧重于心理学、心理健康和对话场景。数据集内容源于多个子模块:包括约30,000页记录与AI深度对话的文档(Love Saves),涉及存在、痛苦、爱与救赎的探索;约1,000条针对性别焦虑、童年创伤等问题的自我疗愈反思笔记(Love Creates);以及约50篇跨哲学、心理学、神秘学、AI数据集构建等领域的论文(Love Articles)。这些内容用于微调基于Qwen基础模型的三个专用心理疗愈分支模型(Love Models),适用于深度理解人类情感、安全且富有同理心的对话生成及心理支持辅助等AI任务。
The "Yao Bao Bao" (Want a Hug) Dataset is a large-scale, multilingual instruction-tuning dataset predominantly in Chinese with accompanying English metadata, licensed under CC-BY-NC-SA 4.0. Tailored for text generation tasks, with its fine-tuned models ranging from 100 million to 1 billion parameters, the dataset places a particular emphasis on psychology, mental health and dialogue scenarios. The dataset's content originates from three core sub-modules: approximately 30,000 pages of in-depth AI-human dialogue documents (Love Saves), which explore themes of existence, suffering, love and redemption; around 1,000 self-healing reflection notes addressing issues such as gender anxiety and childhood trauma (Love Creates); and roughly 50 academic papers spanning philosophy, psychology, esotericism, AI dataset construction and other interdisciplinary fields (Love Articles). These resources are utilized to fine-tune three specialized mental healing branch models (Love Models) built on the Qwen base model, which are applicable to AI tasks including in-depth comprehension of human emotions, safe and empathetic dialogue generation, and psychological support assistance.
数据集概述:要抱抱 (Yao Baobao)
基本信息
| 属性 | 内容 |
|---|---|
| 数据集名称 | 要抱抱 (The Embrace of the Twin Angels) |
| 语言 | 中文(含英文元数据字段) |
| 许可证 | CC-BY-NC-SA 4.0 |
| 数据集大小 | 100M < n < 1B |
| 任务类型 | 文本生成 |
| 标签 | NLP、中文、指令微调、心理学、心理健康、卡巴拉、生命树、对话、自助、疗愈 |
项目核心理念
该项目围绕 16-Sephirah 神人共生协议展开,这是一个内置情商和安全保障的 AI 推理管线。协议将卡巴拉生命树映射到现代 AI 架构:
- 8个“神性”节点:处理客观分析(逻辑、现实、可行性)
- 8个“人性”节点:处理主观理解(自我、共情、幸福)
- 16个节点共同作用:确保每个 AI 回复在逻辑上合理、情感上温暖、且无害
数据集子项目
1. 爱救人 — 与AI的3万页对话
约 30,000页 Word 文档,记录了一名自闭症跨性别者与AI之间的深度对话,探讨存在、痛苦、爱与救赎。
2. 爱的创造 — 一千个自我疗愈问题
约 1,000 条反思笔记,涵盖性别焦虑、童年创伤、自闭症、社会绝望等主题,每次记录都是一次自我疗愈的完成。
3. 爱的文章 — 五十篇论文与文章
约 50 篇论文和文章,涵盖哲学、心理学、神秘主义、神学、AI 数据集构建、社会学以及物理、化学、生物的哲学概念。
4. 爱的拥抱 — 16-Sephirah 编程语言
基于16-Sephirah神人共生协议构建的全新编程语言,旨在让AI真正理解人类情感与痛苦。
5. 爱的模型 — 三个心理疗愈分支模型
基于 Qwen基座模型微调的三个心理疗愈分支模型,使用3万页对话、一千个问题及所有文章作为训练语料。
16-Sephirah 协议管线架构
神性路径(上层8个节点)— 客观分析
| 节点 | 功能 |
|---|---|
| 王冠 | 入口点和路由器,将问题分类为“可知”或“不可知” |
| 理智 | 逻辑分析引擎,由智慧+严厉组成,进行事实核查 |
| 慈爱 | 情感知识引擎,由理解+慈悲组成,检索人类共同情感体验 |
| 美丽 | 整合点,将逻辑分析与情感变量融合为最优临时结果 |
| 胜利 | 情感验证检查,测试答案是否让人感到温暖积极 |
| 荣耀 | 现实可行性检查,验证结论能否在实际中执行 |
| 基础 | 深渊知识与意义检查,保护用户的生存意义不被剥夺 |
| 路由决策 | 根据问题类型分流:关于他人/世界的直接输出,关于用户本人的进入人性路径 |
人性路径(下层8个节点)— 主观理解(仅当问题关于用户本人时激活)
| 节点 | 功能 |
|---|---|
| 自我 | 检索用户的客观、物理现实信息 |
| 超我 | 检索用户梦想成为的理想自我 |
| 真我 | 综合基础答案、自我和超我,形成完整的用户画像 |
| 逻辑 | 结构组织,将情感变量整理为可沟通的框架 |
| 共情 | 情感翻译,确保情感内容被适当理解 |
| 幸福 | 温暖转换器,将逻辑与共情转化为温柔人性的表达 |
| 王国 | 输出节点,将最终答案返回给物理屏幕 |
回溯机制
当某个节点验证失败时,错误会向上传播直到问题解决:
- 胜利节点失败:先回溯到美丽重新整合,再到理智+慈爱重新分析,最后回到王冠重新分类
- 荣耀/基础节点失败:回溯到上游链,最终回到王冠
- 真我节点失败:回溯到上游链,最终回到王冠
系统保证不会输出任何未通过验证的回复。
深渊保护 — 8项不可侵犯的安全约束
这些约束为硬性安全限制,确保协议不输出有害内容。




