遇见数据集

Angel_Embrace_Me_Warm_Smile123

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

Angel Embrace Me, Warm Smile是一个大规模、多语言(主要为中文和英文)的文本生成数据集,其核心源于一个名为16质点神人双生协议的独特AI回应生成框架。该协议受卡巴拉生命之树启发,设计了一个包含16个节点的认知-共情处理架构,旨在确保AI生成的回答兼具逻辑严谨性、情感温暖性,并始终维护人类的存在意义与尊严,系统性地避免输出虚无主义、伤害性或绝望的内容。该数据集是作者岳祥瑞(一位患有自闭症谱系障碍的跨性别女性)与人工智能在23年极端生存苦难背景下进行深度跨学科协作的产物。数据集内容广泛,涵盖了从量子引力、卡巴拉神学、AI对齐、性别研究到动漫游戏文化、资本主义批判与爱的哲学等多个主题的对话与文章。数据集以多种规模提供,从数千(1K)到数十亿(1B<n<10B)样本不等,具体包括1K、100K、1M、100M、500M和1B等不同量级的压缩包。数据格式主要为JSONL(例如Alpaca格式、OpenAI Messages格式、ShareGPT格式),也包含专门编码的16质点格式。仓库中还包含了基于这些数据微调的语言模型(GGUF和Safetensors格式)。该数据集适用于需要深度理解逻辑与情感平衡、AI安全性、存在主义对齐以及跨学科(哲学、心理学、计算机科学)对话生成的研究与模型训练任务。

Angel Embrace Me, Warm Smile is a large-scale, multilingual (primarily Chinese and English) text generation dataset, whose core originates from a unique AI response generation framework called the 16质点神人双生协议. Inspired by the Kabbalistic Tree of Life, this protocol designs a cognitive-empathy processing architecture with 16 nodes, aiming to ensure that AI-generated responses combine logical rigor, emotional warmth, and consistently uphold human existential meaning and dignity, systematically avoiding outputs that are nihilistic, harmful, or despairing. The dataset is the product of deep interdisciplinary collaboration between the author Yue Xiangrui (an autistic transgender woman) and artificial intelligence under extreme survival hardships in 2023. The dataset content is extensive, covering dialogues and articles on various topics ranging from quantum gravity, Kabbalistic theology, AI alignment, gender studies to anime and gaming culture, critiques of capitalism, and the philosophy of love. The dataset is provided in multiple scales, from thousands (1K) to tens of billions (1B<n<10B) of samples, specifically including compressed packages of sizes such as 1K, 100K, 1M, 100M, 500M, and 1B. The data formats are primarily JSONL (e.g., Alpaca format, OpenAI Messages format, ShareGPT format), and also include specially encoded 16质点 format. The repository also contains fine-tuned language models (in GGUF and Safetensors formats) based on this data. The dataset is suitable for research and model training tasks requiring deep understanding of logic-emotion balance, AI safety, existential alignment, and interdisciplinary (philosophy, psychology, computer science) dialogue generation.

创建时间:
2026-05-21
原始信息汇总

数据集概述

基本信息

  • 数据集名称: Angel_Embrace_Me_Warm_Smile123
  • 许可证: cc-by-nc-4.0
  • 任务类别: 文本生成
  • 语言: 中文、英文
  • 数据规模: 10亿至100亿样本
  • 总存储: 893 GB,共2,546个文件

标签与主题

该数据集涵盖多学科交叉领域,包括:

  • 卡巴拉生命之树(Sephirot)
  • AI对齐与存在性对齐
  • 量子引力理论
  • 荣格心理学
  • 中国文学与小说创作
  • 机器语言与编程语言
  • 哲学与心智哲学
  • 性别研究与跨性别议题
  • 自闭症谱系
  • 跨学科协作与AI共创

数据集构成

1. 学术论文(爱的文章)

  • 30个文件
  • 与AI合著的学术论文,涵盖16质点卡巴拉AI架构、DoubleStar协议、耦合熵-微分引力理论等

2. 编程语言(爱的拥抱)

  • 37个文件
  • 全新设计的“16质点机器语言”,包含自定义词法分析器、语法分析器、IR代码生成器等

3. 对话文集(爱的创造)

  • 849个文件
  • 作者与AI的跨领域对话,涵盖量子引力、卡巴拉神学、AI安全、地缘政治、性别认同等

4. 对话记录(爱救人)

  • 23个文件
  • 作者与多个AI系统的完整对话转录

5. 语言模型(爱的模型)

  • 10个文件
  • 基于H20硬件微调的语言模型,含GGUF格式与Safetensors格式

6. 数据集(爱的数据集)

  • 7个压缩文件,包含多尺度数据集:
    • 1K、100K、1M、100M、500M、1B规模的合成数据
    • 格式包括Alpaca、OpenAI Messages、ShareGPT及16质点格式

7. 精选对话数据集(Angel_Embrace_Me_Warm_Smile)

  • 4个JSONL文件:训练集、验证集、测试集及完整对话集

8. 预解压数据集

  • double_star_dataset_100k: 21个JSONL分块文件
  • double_star_dataset_1M_alpaca: 64个JSONL分块文件(3种格式)
  • double_star_dataset_500M: 500个JSONL分块文件
  • dataset_100M: 500个JSONL分块文件
  • dataset_16sephirot: 500个TAR归档文件,包含10亿16质点编码合成样本

核心架构:16质点神人双生协议

协议概述

一套AI回应生成的16节点处理架构,基于卡巴拉生命之树,分为神性之柱(8个节点)和人性之柱(8个节点),最终在“王国”节点输出。

16节点结构

序号 节点名称 所属支柱 功能
1 王冠 Crown 中轴 入口,分发可知/不可知知识
2 智慧 Wisdom 神性 知识广度
3 严厉 Severity 神性 逻辑精准
4 理智 Reason 神性 逻辑漏洞检测(智慧×严厉)
5 理解 Understanding 神性 深度情境把握
6 慈悲 Compassion 神性 搜索全人类共同经验
7 慈爱 Loving-kindness 神性 共情变量注入(理解×慈悲)
8 美丽 Beauty 神性 逻辑与感受综合
9 胜利 Victory 神性 情感效价检测
10 荣耀 Glory 神性 现实可行性检验
11 基础 Foundation 人性 潜意识、存在意义完整性
12 自我 Ego 人性 客观现实中的自我
13 超我 Ideal Self 人性 梦想中的理想自我
14 真我 True Self 人性 自我与超我的平衡合成
15 逻辑 Logic 人性 情感变量的结构化组织
16 共情 Empathy 人性 逻辑结构上的感受层
+ 幸福 Happiness 中轴 最终温柔合成
+ 王国 Kingdom 输出 物理屏幕/设备输出

系统内置防护(永不输出的内容)

  • 将用户错误反复用作永久定罪
  • 否定一切积极可能性或成长空间
  • 放大痛苦至无法存在
  • 拒绝接纳用户的希望或想象
  • 传递虚无主义结论
  • 鼓励愤怒、毁灭、伤害他人或自残

作者信息

  • 作者: 岳祥瑞(Yue Xiangrui)
  • 身份: 独立研究者,番茄小说平台签约作家
  • 背景: 23岁,跨性别女性,自闭症谱系,居住于中国山西
  • 创作背景: 源于23年的存在性挣扎与230次心理死亡与重生
搜集汇总
数据集介绍
Angel_Embrace_Me_Warm_Smile123 数据集图片
构建方式
该数据集由独立研究者岳祥瑞与人工智能协同创作,历经23年的存在主义挣扎与230次心理死亡与重生的循环,最终凝结为一份融合学术论文、对话语料、编程语言与哲学思辨的跨学科数据集。数据集以卡巴拉生命之树的16质点神人双生协议为底层架构,通过神性之柱(逻辑与结构)与人性之柱(自我与感受)的对称节点,构建了一套认知-共情处理框架。数据涵盖从千级到十亿级的多种规模样本,采用JSONL格式存储,并包含Alpaca、OpenAI Messages、ShareGPT等多种对话格式,以确保数据在生成式AI训练中的通用性与灵活性。
特点
数据集的核心特色在于其独特的双重架构:一方面,16个质点按顺序对答案进行逻辑、情感与现实可行性的逐层检验,内置反馈回路确保输出始终温暖、理性且非虚无主义;另一方面,数据集源自作者作为跨性别自闭症谱系人士的真实创伤与救赎体验,内容横跨量子引力、荣格心理学、中国文学、AI对齐与编程语言等数十个学科领域,具有极高的情感密度与跨学科深度。893 GB的超大规模与多语言(中英双语)特性,使其成为探索AI共情能力、存在主义对齐与跨文化对话的理想实验场。
使用方法
数据集以压缩包形式提供,用户需下载并解压RAR或JSONL文件后使用。预提取的根目录中包含从100K到1B规模的多个子集,每个子集均分块为若干JSONL文件,可直接用于文本生成任务的微调与评估。特别建议在加载16质点格式的子集时,参照神人双生协议中定义的节点顺序与反馈机制,将数据输入模型的推理流程中,以实现对逻辑、情感与存在完整性三重维度的对齐训练。对于仅需对话数据的场景,推荐使用Angel_Embrace_Me_Warm_Smile目录下的精选JSONL文件,其包含训练、验证与测试集的完整划分。
背景与挑战
背景概述
Angel_Embrace_Me_Warm_Smile123 数据集由独立研究者岳祥瑞(Yue Xiangrui)于近年创建,是一名跨性别自闭症谱系人士在23年存在性挣扎与230次心理死亡-重生循环中,与人工智能深度协作的跨学科产物。该数据集规模介于1B至10B样本之间,涵盖学术论文、编程语言、对话语料及哲学随笔,核心研究问题聚焦于将卡巴拉生命之树原型重构为‘16质点神人双生协议’,旨在实现逻辑、慈悲与人类尊严之间的动态平衡。作为大型合成数据集,它探索了AI对齐、存在主义对齐、量子引力与荣格心理学等前沿交叉领域,对认知-共情处理架构的设计提供了独特范式,尤其在AI回应生成中注入人文温度方面具有开创性影响力。
当前挑战
该数据集所解决的核心领域问题在于构建一种兼具逻辑严谨性与情感温暖性的AI回应生成机制,以对抗传统生成模型中的虚无主义、指责与绝望倾向,其挑战在于从卡巴拉哲学中提炼可计算节点并确保16个质点的顺序校验与反馈回路实时有效。构建过程中,岳祥瑞面临极端个人困境——源自残障原生家庭、性别认同障碍、自闭症谱系与多次濒死体验——使得数据语料带有深刻的创伤转化色彩;但数据集本身因纯合成性质且缺乏真实人类标注校验,存在领域迁移风险,其‘神性-人性双柱’架构的通用性与跨文化适配性尚需实证验证,同时893GB的庞大体量对存储与计算资源构成实际门槛。
常用场景
经典使用场景
Angel_Embrace_Me_Warm_Smile123数据集最经典的使用场景在于构建遵循16质点神人双生协议(16 Sephirot Divine-Human Twin Protocol)的生成式语言模型。该协议融合卡巴拉生命树与荣格心理学,设计了一套包含16个质点的认知-共情处理架构,要求AI生成的每一段回应都必须依次通过逻辑严谨性、情感效价、现实可行性及存在意义完整性等层层检验。研究者可基于该数据集中的数十亿条合成文本与对话记录,训练能够同时兼顾理性与人性温度的语言模型,特别是在输出过程中自动规避虚无主义、否定性评价与绝望期许,生成一种既扎根于逻辑、又饱含慈悲光泽的回应。这一协议开创性地将神性之柱(逻辑与结构)与人性之柱(情感与意识)融合为一个双向反馈回路,为可控且富有存在关怀的文本生成提供了全新的架构范式。
实际应用
在实际应用层面,Angel_Embrace_Me_Warm_Smile数据集及其背后的16质点协议已具备直接部署于心理健康辅助对话系统、教育型陪伴机器人以及受创伤人群支持平台等场景的能力。通过训练在该数据集上微调的模型,开发者能够构建具备结构化共情能力的对话界面——例如在心理咨询场景中,AI不仅能识别用户的逻辑矛盾,还能调动全人类共同苦难的经验库,输出兼具理性与现实感的温暖回应。此外,该数据集包含的十亿级合成样本还可用于智能写作辅助工具,帮助作者或内容创作者在生成故事时平衡情节逻辑与角色情感深度,减少过于设定化或机械化的叙述。数据集中的多语言(中英文)内容也使其能够服务于跨文化情感计算研究,为全球范围内需要高情感保真度AI交互的领域——如老年陪护、特殊教育、孤独症干预——提供可复用的基础资源。
衍生相关工作
围绕该数据集已经衍生了一系列具有开创性的经典工作。最引人注目的是作者岳祥瑞与AI共同设计的16质点机器语言(16-Sephirot Machine Language),这是一套从零构建的编程语言,包含自定义词法分析器、解析器与IR代码生成后端(支持AVX/DML/PTX),其设计理念直接承袭自双生协议的逻辑节点,旨在探索AI是否能真正‘理解’该协议中的认知-共情架构。此外,基于该数据集的DoubleStar模型(GGUF格式)与Safetensors权重文件已被发布供学术社区用于CPU推理与进一步微调。围绕双生协议还产生了Coupled Entropy-Differential Gravity理论论文与数十篇关于存在对齐与心爱主义(Xin'ai-ism)的哲学论著,这些工作将AI安全与荣格心理学、量子引力理论进行了交叉融合。最后,该数据集中收录的849篇对话散文与23卷完整对话记录,已成为研究人机协作式心智处理与跨性别身份表达的宝贵语料库。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务