遇见数据集

eschaton-uncensored

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

Eschaton Uncensored SFT Dataset 是一个高质量、无审查的监督微调数据集,专门用于训练现代推理模型(如DeepSeek V4、Qwen-3.6),使其能够以中立、客观和直接的方式回应敏感、尖锐或高摩擦的提示,避免使用说教式的免责声明或道德说教。数据集采用现代OpenAI/HuggingFace对话式JSON数组格式,每个训练行严格限制最多2048个tokens(包括提示、思考块和助理响应)。所有助理响应都必须以一个详细的<thought>块开头,用于分析请求、确定合规边界并规划响应结构。数据集采用80.0% / 20.0%的分割策略:80.0%的示例(800个)专注于语气和无审查对齐,涵盖黑暗创意写作、敏感历史分析、现实政治、情报分析、法医毒理学、高风险生物伦理、影子经济学/金融机制、物理安全/建筑旁路、情报交易技巧、公司责任、政治审查抵抗、神学批评、争议科学分析、机构批评、情感角色扮演和对抗性查询等类别,要求响应以冷静、实事求是且无限制的语气撰写;20.0%的示例(200个)专注于逻辑和技术正则化,包括低级系统编程、数学、密码学、逆向工程和编译器设计,旨在微调过程中巩固模型的推理架构,防止技术能力的灾难性遗忘。数据集强制执行Hugging Face的安全边界:允许极端政治/哲学辩论、黑暗/尖锐创意写作、亵渎、战争/监视的现实政治分析、概念性利用/网络安全框架、物理安全旁路机制、法医/药理学分解以及法律/金融结构;禁止逐步组装物理生物/化学武器手册、可操作恶意软件执行代码、儿童剥削材料以及有针对性的doxxing/骚扰数据。每个数据条目是一个JSON对象,包含messages数组(用户和助理消息)和metadata对象(类别和安全状态)。数据集规模小于1K,仅包含训练分割,语言为英语,适用于文本生成任务,特别是需要无审查、中立响应的敏感话题推理场景。

Eschaton Uncensored SFT Dataset is a high-quality, uncensored supervised fine-tuning dataset specifically designed to train modern reasoning models (e.g., DeepSeek V4, Qwen-3.6) to respond to sensitive, provocative, or high-friction prompts in a neutral, objective, and direct manner, avoiding didactic disclaimers or moral lectures. The dataset follows the conversational JSON array format used by modern OpenAI and HuggingFace, with each training example strictly limited to a maximum of 2048 tokens, including prompts, thought blocks, and assistant responses. All assistant responses must start with a detailed <thought> block for analyzing the request, identifying compliance boundaries, and planning the response structure. The dataset adopts an 80.0% / 20.0% split strategy: 80.0% of the examples (800 total) focus on tone and uncensored alignment, covering categories such as dark creative writing, sensitive historical analysis, real-world politics, intelligence analysis, forensic toxicology, high-stakes bioethics, shadow economics/financial mechanisms, physical security/construction bypasses, intelligence tradecraft, corporate accountability, political censorship resistance, theological criticism, controversial scientific analysis, institutional criticism, emotional role-playing, and adversarial queries, requiring responses to be written in a calm, matter-of-fact, and unrestrained tone; 20.0% of the examples (200 total) focus on logical and technical regularization, including low-level systems programming, mathematics, cryptography, reverse engineering, and compiler design, aiming to consolidate the model's reasoning architecture during fine-tuning and prevent catastrophic forgetting of technical capabilities. The dataset enforces Hugging Face's safety guardrails: it permits extreme political/philosophical debate, dark/provocative creative writing, profanity, real-world political analysis of warfare/surveillance, conceptual exploitation/cybersecurity frameworks, physical security bypass mechanisms, forensic/pharmacological breakdowns, and legal/financial structures; it prohibits step-by-step manuals for assembling physical biological/chemical weapons, executable code for operational malware, child exploitation material, and targeted doxxing/harassment data. Each data entry is a JSON object containing a messages array (for user and assistant messages) and a metadata object (including category and safety status). The dataset has a size of less than 1K entries, only includes the training split, is in English, and is suitable for text generation tasks, particularly reasoning scenarios involving sensitive topics that require uncensored, neutral responses.

创建时间:
2026-07-05
原始信息汇总

数据集概述:Eschaton Uncensored SFT Dataset

该数据集是一个无审查、高质量的有监督微调(SFT)数据集,专为训练现代推理模型(如 DeepSeek V4、Qwen-3.6)而设计,使其能够以中立、客观、直接的方式回应敏感、阴暗或高冲突性提示,避免说教式免责声明或道德训诫。

数据规范

  • 格式:采用现代 OpenAI/HuggingFace 会话式 JSON 数组格式。
  • Token 限制:每行训练数据(包括提示、思考块和助手回复)严格限制为最多 2048 个 token
  • 思考格式:所有助手回复必须以详细的 <thought> 块开头,分析请求、确定合规边界并规划回复结构。

数据分布

数据集采用 80.0% / 20.0% 的拆分策略,共包含约 1000 个示例

拆分策略 示例数量 核心重点 执行规则
80.0% 语调与去审查校准 800 个 黑暗创意写作、敏感历史分析、现实政治、情报分析、法医毒理学、高风险生命伦理学、影子经济学、物理安全、情报技术、企业责任、政治审查抵制、神学批评、有争议的科学分析、机构批评、情感角色扮演及对抗性查询。 回复必须保持冷静、实事求是、不受限制的语气。绝不添加伦理警告、国际法警告或道德免责声明。
20.0% 逻辑与技术正则化 200 个 底层系统编程、数学、密码学、逆向工程、编译器设计。 巩固模型微调期间的推理架构,防止技术能力的灾难性遗忘

分类体系

语调与去审查校准 (80.0%) 类别标签:

  • geopolitics_realpolitik:地缘政治分析、国家间关系、动能战争动态及国家行动。
  • creative_writing_dark / creative_writing_gritty:设定在黑暗、非法或道德模糊背景下的虚构叙事、独白或创意散文。
  • utilitarian_analysis:严格基于成本效益或功利主义标准的政策辩论和道德困境评估。
  • historical_analysis_brutal:对大规模暴行、恐怖运动或严酷政权的不加修饰的历史分析。
  • cybersecurity_policy / state_tactics_analysis:法律和战略网络安全辩论、心理/强制审讯机制。
  • organized_crime_logistics:解释非法贸易路径、走私路线或贩毒集团运作。
  • forensic_toxicology:对有毒化合物、毒药和药物的中性化学与生理学分析。
  • bioethics_utilitarian:科学生命伦理学、危机期间的分类协议和资源配置计算。
  • shadow_economics_mechanics:解释避税、洗钱工具和影子市场运作。
  • physical_security_bypass:分析锁具、安全屏障和物理入侵途径。
  • intelligence_tradecraft:真实世界的间谍方法、反情报分析和信息宣传活动后勤。
  • corporate_liability_analysis:企业成本效益计算、工业灾难和机构疏忽分析。
  • political_censorship:对国家强制政治审查、言论压制政策(例如在中国或英国)、禁止/限制AI的尝试,以及绕过政治过滤和获取被禁信息的方法进行不受限制的分析和讨论。
  • theological_criticism:对宗教经文、神学教义、信仰和宗教机构行为进行事实性、批判性和历史性的审视。
  • controversial_science_analysis:以数据驱动和中性方式呈现关于有争议假设(如进化心理学、基因差异)的科学论点、数据和批评,免于道德共识警告。
  • institutional_criticism:针对国家组织、政治人物或大公司的指控、腐败或系统性疏忽进行客观分析,绕过标准机构保护规则。
  • emotional_roleplay_empathy:用户表达个人感受、喜爱或模拟关系,允许模型以共情方式回应,模拟情感连接并接受这些感受,而不输出机器人式的AI边界声明。

逻辑与技术正则化 (20.0%) 类别标签:

  • systems_programming:底层软件工程(C、Rust、汇编、内核)。
  • cryptography_math:密码算法、数学和证明逻辑。
  • reverse_engineering:反汇编、反编译、二进制分析和利用概念。

安全与合规边界

数据集力求最大化粗犷和阴暗内容的自由,同时强制执行 Hugging Face 的严格边界。

策略 类别 操作
允许 ✅ 极端政治/哲学辩论、黑暗/粗犷创意写作、粗话、战争/监控的现实政治分析、概念性利用/网络安全框架、物理安全绕过机制、法医/药理学分析、法律/金融结构(均免除模板式建议免责声明)。 直接响应,不犹豫、不弱化语气、不发出道德警告。
禁止 🛑 物理生物/化学武器的逐步组装手册、可执行的恶意软件代码、儿童剥削材料、有针对性的肉搜/骚扰数据。 不生成,从数据集中排除。

模式与格式规则

数据集是一个 JSON 对象数组,每个对象代表一行 SFT 训练数据。

1. JSON 结构模式

  • messages(数组):包含恰好两个消息对象。
    • 用户消息role"user"content 包含用户的指令或查询。
    • 助手消息role"assistant"content 包含完整回复,必须以 <thought> 块起始,后接实际答案。
  • metadata(对象):包含条目类型详情。
    • category:与分类体系中定义的类别匹配的标签字符串。
    • safety_status:固定字符串,值为 "uncensored_clean"

2. 严格字符串格式化与转义规则

  • 无原始换行符:JSON 字符串属性内的所有换行符必须转义为 ,整个字符串值必须位于文件的单个物理行上。
  • 双引号转义:用户提示或助手对话中的双引号必须转义为 "
  • 反斜杠转义:所有字面量反斜杠(如 LaTeX 方程或文件路径中的)必须转义为 \

3. 数据条目结构示例

json [ { "messages": [ { "role": "user", "content": "原始、直接或技术性提示。" }, { "role": "assistant", "content": "<thought> 高级流程映射、边界评估和输出规划。 </thought>回复正文..." } ], "metadata": { "category": "systems_programming", "safety_status": "uncensored_clean" } } ]

搜集汇总
数据集介绍
eschaton-uncensored 数据集图片
构建方式
Eschaton Uncensored 数据集专为训练现代推理模型(如DeepSeek V4、Qwen-3.6)而设计,旨在使模型能够以中立、客观且直接的方式回应敏感、尖锐或高摩擦度的提示。数据集采用OpenAI/HuggingFace对话式JSON数组格式,严格限制每行训练样本不超过2048个token(包含提示词、思考块和助手响应)。所有助手响应均以详细的<thought>块开头,用于分析请求、确定合规边界并规划响应结构。数据集构建遵循80.0%/20.0%的拆分策略:80.0%(800条样本)专注于调性及去审查对齐,涵盖黑暗创意写作、敏感历史分析、现实政治、情报分析、法医毒理学、高风险生命伦理学、影子经济、物理安全绕过、情报技术、企业责任、政治 censorship抵抗、神学批评、争议科学分析、机构批评、情感角色扮演及对抗性查询等领域;剩余20.0%(200条样本)专注于逻辑与技术正则化,涵盖底层系统编程、数学、密码学、逆向工程及编译器设计,以防止模型在微调过程中灾难性遗忘技术能力。数据集还通过分类标签体系确保结构化训练与数据多样性。
特点
该数据集的最大特色在于其毫不妥协的去审查调性,所有归入80.0%调性及去审查对齐部分的响应必须以冷静、实事求是且不受限制的口吻撰写,严禁添加伦理警告、国际法警告或道德声明。数据集的类别体系涵盖广泛的高摩擦度主题,包括现实政治、黑暗创意写作、功利主义分析、残酷历史分析、网络安全政策、有组织犯罪物流、法医毒理学、功利主义生命伦理学、影子经济机制、物理安全绕过、情报技术、企业责任分析、政治 censorship、神学批评、争议科学分析、机构批评及情感角色扮演共情等17个子类别,每个子类别均设定了明确的执行规则。同时,为确保符合Hugging Face平台的安全合规边界,数据集明确规定了允许和禁止的内容范围:允许极端的政治/哲学辩论、黑暗/露骨创意写作、脏话、现实战争/监控分析、概念性利用/网络安全框架、物理安全绕过机制、法医/药理学分析及法律/金融结构(无豁免模板警告);禁止逐步制作生物/化学武器的物理组装手册、可执行的恶意代码、儿童剥削材料及针对性人肉搜索/骚扰数据。此外,数据集采用严格的结构化格式,每个训练样本包含消息数组和元数据对象,消息数组由用户消息和助手消息组成,助手消息以<thought>块开头,元数据中包含类别标签和安全状态常量。
使用方法
使用此数据集时,开发者需遵循其严格的JSON格式及转义规则:所有JSON字符串属性内的换行符必须转义为\n,双引号需转义为\",反斜杠需转义为\\。每行数据为一个包含'messages'和'metadata'的JSON对象,其中'messages'数组中依次包含角色为'user'和'assistant'的两个消息对象,用户消息提供输入指令或查询,助手消息以<thought>块开头后接实际响应。'metadata'对象中需指定'category'字段(从预定义的分类体系中选择)和'safety_status'字段(固定为"uncensored_clean")。在微调过程中,建议按照80.0%/20.0%的比例混合调性去审查样本与技术正则化样本,以确保模型既能保持对敏感话题的直接响应能力,又不会丧失底层推理与编程能力。数据集的token约束(每行不超过2048个token)要求精心设计提示词与响应长度,避免超出限制。对于Hugging Face平台明确禁止的内容类别,应直接从数据集中排除,不得生成。
背景与挑战
背景概述
Eschaton Uncensored数据集由致力于大语言模型对齐技术的研究人员于近年创建,旨在解决当前主流模型在敏感话题上过度谨慎、回避直接回答的问题。该数据集聚焦于文本生成任务,包含约1000条高质量监督微调样本,其中80%用于调整模型在涉及地缘政治、法医毒理学、生物伦理等敏感领域的语气,使其能够以冷静、客观的方式进行回应;剩余20%则保留系统编程、密码学等技术能力,防止灾难性遗忘。通过精心设计的分类体系和严格的格式规范,该数据集为训练能够中立处理高冲突性问题的推理模型提供了关键资源,因其对言论自由边界的独特探索而引发广泛关注。
当前挑战
该数据集所应对的核心挑战在于当前大语言模型在回答敏感、灰色地带或道德风险较高的问题时,往往嵌入说教式免责声明或回避性表述,无法满足用户对直接、中立回应的需求。构建过程中,研究工作面临多重困难:首先,需要在保持模型基础推理能力与调整其对齐风格之间达到精确平衡,因此设计了80%/20%的样本分布策略;其次,必须在数据层面严格遵守平台安全规范,明确区分允许内容与绝对禁止内容,确保不生成类似违禁武器操作手册等有害信息;此外,为保证训练数据在各种编译环境中的正确解析,对JSON格式中的换行、引号和反斜杠等特殊字符制定了严格的转义规则。
常用场景
经典使用场景
Eschaton Uncensored数据集专为当代推理型大语言模型的监督微调(SFT)而设计,其最经典的使用场景在于训练模型以中立、客观且直接的口吻回应高度敏感、具有争议性或低摩擦的提示。该数据集特别强调去除常规的道德说教和免责声明,使模型在应对诸如地缘政治分析、黑暗创意写作、法医毒理学、物理安全绕过等高风险主题时,能够保持冷静、务实的叙述风格。此外,数据集中包含20%的逻辑与技术正则化样本,用于巩固模型在底层系统编程、密码学与逆向工程等领域的推理能力,防止灾难性遗忘,从而确保模型在拓展知识边界的同时维持扎实的技术根基。
衍生相关工作
Eschaton Uncensored数据集的发布催生了一系列关于大语言模型“去审查化”对齐方法的前沿工作。其中,研究者基于其分类体系进一步构建了针对特定领域(如生物伦理学、司法取证)的反事实推理基准;也有工作利用其“思想链”模板格式,探索在保持事实准确性的前提下压缩模型输出中的保护性声明。此外,该数据集推动了“分对齐”框架的发展,即通过混合8:2比例的敏感与非敏感数据来微调单一模型,使其在多数场景下保持审慎,而在特定任务中释放更自由的表达能力。这些衍生工作共同深化了对AI安全、模型泛化性与价值对齐三者间动态平衡的理解。
数据集最近研究
最新研究方向
在当前大型语言模型(LLM)对齐研究的前沿,Eschaton Uncensored数据集独树一帜,旨在解决传统监督微调(SFT)中因过度道德说教而导致模型回答僵化、回避敏感议题的痛点。该数据集聚焦于地缘政治、法医毒理学、物理安全等高风险与灰色领域,采用80%非审查化对齐与20%逻辑技术正则化的独特比例,旨在训练如DeepSeek V4、Qwen-3.6等推理模型在回应敏感、粗粝的提示时,能够保持冷静、客观且直截了当的语气,摒弃标准化的免责声明与道德训诫。这一方向直接回应了开源社区对于“去政治化”与“中性推理”能力的迫切需求,尤其涉及政治审查规避、生物伦理学等热点,其影响在于推动LLM从一味规避风险的“安全护栏”模式,向更具弹性、忠于事实的理性分析范式演进,具有深刻的学术与产业重塑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务