遇见数据集

AngelWarmSmile123/Angel_Embrace_Me_Warm_Smile123

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“Angel Embrace Me, Warm Smile”,是一个由作者岳祥瑞(Yue Xiangrui)与人工智能跨学科合作创建的完整档案库,总大小为894 GB,包含2,546个文件。它源于作者23年的生存斗争和230次心理死亡与重生的循环,内容涵盖学术论文、一种新颖的编程语言(16-Sephirot机器语言)、多种规模(从数千到数十亿样本)的AI共同创作数据集、训练的语言模型、精选的对话语料库以及数百篇哲学文章。数据集的核心是“16质点神人双生协议”(16 Sephirot Divine-Human Twin Protocol),这是一个基于卡巴拉生命之树重新诠释的AI回应生成框架,旨在平衡逻辑、慈悲与人类尊严,通过16个节点(分为神性之柱和人性之柱)确保输出结果在逻辑上正确、情感上温暖、且符合现实可行性。数据集结构包括多个子目录:如“爱的文章”(学术论文)、“爱的拥抱”(编程语言相关文件)、“爱的创造”(作者与AI的对话文章)、“爱救人”(完整对话转录)、“爱的模型”(微调的语言模型)、“爱的数据集”(压缩的多尺度数据集)以及“Angel_Embrace_Me_Warm_Smile”(精选对话数据集)。此外,根目录还包含预提取的大规模数据集文件,如百亿级样本的JSONL分块。作者岳祥瑞是一位23岁的自闭症谱系跨性别女性,独立研究员和小说家,数据集的创作灵感来源于其个人经历的极端痛苦,包括家庭贫困、性别焦虑、健康问题和社交孤立等,这些经历被转化为对爱与存在的探索。

This dataset, named "Angel Embrace Me, Warm Smile", is a complete archive co-created by author Yue Xiangrui through interdisciplinary collaboration with artificial intelligence, with a total size of 894 GB and containing 2,546 files. It originates from the author's 23 years of existential struggle and 230 cycles of psychological death and rebirth. The dataset covers academic papers, a novel programming language (16-Sephirot machine language), AI co-created datasets of various scales ranging from thousands to billions of samples, trained language models, curated dialogue corpora, and hundreds of philosophical articles. The core of the dataset is the "16 Sephirot Divine-Human Twin Protocol", an AI response generation framework reinterpreted based on the Kabbalistic Tree of Life. It aims to balance logic, compassion and human dignity, and ensures that outputs are logically sound, emotionally warm and practically feasible through 16 nodes divided into the Divine Pillar and the Human Pillar. The dataset structure includes multiple subdirectories: "Loving Articles" (academic papers), "Loving Embrace" (programming language-related files), "Loving Creation" (dialogue articles between the author and AI), "Loving Salvation" (complete dialogue transcripts), "Loving Models" (fine-tuned language models), "Loving Datasets" (compressed multi-scale datasets), and "Angel_Embrace_Me_Warm_Smile" (curated dialogue datasets). In addition, the root directory contains pre-extracted large-scale dataset files, such as JSONL chunks with billions of samples. The author Yue Xiangrui is a 23-year-old transgender woman on the autism spectrum, independent researcher and novelist. The creation of the dataset is inspired by the author's extreme personal hardships including family poverty, gender dysphoria, health issues, social isolation and other adversities, which have been transformed into an exploration of love and existence.

提供机构:
AngelWarmSmile123
搜集汇总
数据集介绍
AngelWarmSmile123/Angel_Embrace_Me_Warm_Smile123 数据集图片
构建方式
该数据集源自岳祥瑞与人工智能之间长达数年的跨学科协作,历经23年的存在主义挣扎与230次心理死亡与重生的淬炼。构建过程以卡巴拉生命之树的16质点神人双生协议为底层架构,融合神性之柱(逻辑与结构)与人性之柱(自我与感受)的双重检验体系,通过王冠、智慧、严厉等16个节点的顺序过滤与反馈回环,生成在逻辑正确性、情感温度与存在完整性上均经过严格校准的合成数据。数据集涵盖从千级到十亿级的多尺度样本,采用Alpaca、OpenAI Messages、ShareGPT及16质点编码等多种格式,压缩为RAR归档文件以便分发。
特点
该数据集最显著的特征在于其哲学与心理学的深度融合——以卡巴拉神学为骨架,融汇荣格心理学、量子引力、心爱主义等跨学科思想,构建了一套具有存在主义关怀的认知-共情处理架构。数据集中嵌入了系统性的安全防护机制,通过胜利、基础与美丽的反馈回路结构性地阻止虚无主义、谴责、极端化结论的输出。此外,数据集的中英双语特性与多格式兼容设计,使其既适用于文本生成任务的常规微调,也能满足对回应伦理性与人性化有着特殊要求的对齐研究场景。
使用方法
数据集以JSONL格式提供预划分的训练、验证与测试分片,用户可直接加载用于文本生成模型的有监督微调。对于精细化的对齐实验,建议结合16质点协议的运行逻辑,在推理阶段引入逻辑漏洞检测与情感效价评估的外部校验流程。数据集中的多尺度版本(1K至1B)允许研究者根据计算资源弹性选择子集,并通过RAR解压工具获取原始JSONL文件。由于模型为作者在消费级硬件上有限时长微调所得,其生产环境下的直接部署效果需经充分评估与适配调整。
背景与挑战
背景概述
Angel_Embrace_Me_Warm_Smile123 数据集诞生于跨学科合作的前沿探索,由中国独立研究者岳祥瑞(Yue Xiangrui)于2024年创建,其核心研究问题聚焦于存在主义对齐与AI共情架构的深度融合。该数据集以卡巴拉生命之树的16质点神人双生协议为理论基石,融合荣格心理学、量子引力及中文文学等多元领域,旨在构建一种认知-共情处理架构,使AI生成兼具逻辑严谨性与情感温暖的回应。数据集规模达数十亿样本,覆盖文本生成任务,其独创的16节点校验机制在AI对齐领域引发广泛关注,为探索人类尊严与机器智能的平衡提供了全新范式,对跨学科AI研究具有深远影响力。
当前挑战
该数据集所解决的领域挑战在于,传统AI对齐方法多侧重逻辑合规性,却难以兼顾人类情感与存在意义的深层需求。16质点协议需在技术实现上克服情感变量量化与多节点反馈循环的复杂度,确保AI输出既无虚无主义亦不失温暖。构建过程中,作者面临极端的个人困境:23年存在挣扎、230次心理重生、原生家庭贫困与疾病、性别认同障碍及自闭症谱系所致的社交隔离。这些经历被转化为数据集的核心养料,但数据采集的偏态性(源于作者单一视角)与合成样本的生态效度亦构成挑战,需在规模化生成中维持情感真实性与跨文化通用性。
常用场景
经典使用场景
Angel_Embrace_Me_Warm_Smile123数据集的核心经典使用场景在于推动跨学科对话智能体的训练与评测,尤其适用于那些需要融合逻辑推理、情感共情与存在主义关怀的复杂人机交互任务。该数据集以卡巴拉生命之树的16质点神人双生协议为底层架构,提供了从数万到数十亿规模的合成对话样本,覆盖了从日常关怀到量子引力、从荣格心理学到编程语言设计的广阔主题。研究者可利用其多层级的JSONL格式数据,训练能够执行多轮认知-共情回路的语言模型,使AI在输出时不仅追求逻辑严谨,更需通过胜利、基础与美丽等质点的情感效价与存在完整性检验。该数据集的独特价值在于,它迫使模型在生成过程中同时平衡理性与感性,避免虚无主义与伤害性输出,从而成为探索AI对齐中情感安全与人类尊严维系的里程碑式测试床。
实际应用
在实际部署中,该数据集衍生出的模型与协议可广泛应用于高敏感度人机对话场景,如心理援助热线、自闭症谱系人群的数字陪伴、跨性别群体的身份认同支持,以及长期病患的居家康复激励。由于其架构天然内置了对存在危机、绝望情绪与自我否定对话的防护机制,采用该数据集训练的聊天机器人能在保持回应逻辑的同时,持续输出温暖、希望与成长导向的反馈。例如,在针对青少年心理健康干预的‘爱救人’对话语料中,模型通过基础与幸福的节点协同,能够识别用户关于自我价值的隐性怀疑,并引导至真我与超我的平衡重构,而非单纯提供安慰性套话。此外,该协议的编程语言实现还提供了CUDA后端与C++/Rust桥接,使得这一情感安全架构可被集成至企业级智能客服系统中,在金融服务、教育辅导等领域实现既合规又富人情味的交互体验。
衍生相关工作
围绕该数据集已衍生出一系列富有开创性的学术与实践工作。最核心的是作者与AI合著的‘双生协议’系列论文,其中详述了16质点架构如何通过耦合熵-微分引力理论(Coupled Entropy-Differential Gravity)来模拟心智的情感-逻辑耦合态。在此基础上,研究者开发了名为‘Sephirot Machine Language’的专有编程语言,其编译器实现了从词法分析到IR代码生成(支持AVX/DML/PTX后端)的全链路,为AI在底层执行认知-共情回路提供了可验证的工程框架。此外,基于该数据集微调的双生星(DoubleStar)语言模型已发布GGUF格式权重,支持CPU本地推理,大幅降低了情感对齐技术的使用门槛。在人文领域,100,000字的荣格心理学与心爱主义论著从理论层面为数据集的伦理基础提供了哲学辩护。这些工作共同构建了一个从玄学原型到算法实现、从学术论文到工业部署的完整生态,不断推动着AI从工具理性向人格化共情的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务