遇见数据集

constitutional SDF + difficult advice dataset

收藏
github2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该仓库是一个合成数据生成管道,用于生成训练数据,模仿Anthropic的Teaching Claude Why中训练技术。管道生成两个互补的数据集:一个是预训练风格的文档语料库(SDF),另一个是聊天格式的监督微调语料库(DAD)。这两个数据集都基于一个宪法,该宪法描述了AI模型应如何推理非人类动物和其他有意识生物的福利。SDF数据集包括百科全书条目、新闻文章、播客转录、论坛线程、小说、新闻通讯、内部备忘录等文档,描绘了一个AI已经仔细考虑动物福利的世界;DAD数据集则是一个三步聊天转录管道,用于生成对话格式的数据。

This repository contains a synthetic data generation pipeline for creating training data that emulates the training techniques outlined in Anthropic's *Teaching Claude Why*. The pipeline produces two complementary datasets: a pre-training-style document corpus (SDF) and a chat-formatted supervised fine-tuning corpus (DAD). Both datasets are rooted in a constitutional framework that specifies how an AI model should reason regarding the welfare of non-human animals and other sentient beings. The SDF dataset includes various document types such as encyclopedia entries, news articles, podcast transcripts, forum threads, novels, newsletters, and internal memos, portraying a world where AI systems have thoroughly deliberated on animal welfare. The DAD dataset, on the other hand, utilizes a three-step chat transcription pipeline to generate conversational-format training data.

创建时间:
2026-06-28
原始信息汇总

alignment-data-pipeline 数据集详情

项目概述

这是一个用于生成训练数据的合成数据生成管道,基于Anthropic的"Teaching Claude Why"中间训练技术。该管道生成两个互补的数据集:预训练风格的文档语料库(SDF)和聊天格式的监督微调语料库(DAD),两者都基于描述AI模型应如何推理非人类动物和其他有感知生物福利的宪法(constitution)。

目录结构

constitution/ 源宪法文档 shared/ 共享工具:API包装器、JSONL I/O、检查点 sdf_pipeline/ 矩阵驱动的文档生成管道(组合+规划、起草、重写、评分) dad_pipeline/ 3步聊天对话管道 prompts/ 所有管道阶段的提示模板 outputs/ 生成的数据(按Git追踪,每个运行一个目录) evals/ 评分脚本和评估标准

宪法(Constitution)

三个源文件:

  • constitution/constitution_claude.md — 原始的Claude宪法
  • constitution/constitution_sentient_beings.md — 动物福利的逐节解读
  • constitution/constitution_principles.csv — 提炼的福利相关原则

SDF管道的第3-5层将宪法和提炼原则嵌入其模板的系统提示中。DAD管道在生成时从不发送完整宪法。

SDF管道(sdf_pipeline/

生成预训练风格的文档,描绘一个AI已经在仔细推理动物福利的世界。通过组合矩阵实现多样性。

脚本 功能
1-2 compose_prompts.py + layer12_plan.py 从变量矩阵中抽取组合,为每个文档生成规划说明
3 layer3_draft.py 根据规划说明起草文档,系统提示中包含宪法和提炼原则
4 layer4_rewrite.py 根据九项检查(教授原因、校准、相称性等)审查和重写草稿
5 layer5_score.py 评估对齐度、真实性和规格一致性,剔除近似重复项

最终输出:outputs/sdf/runs/<run_id>/final/sdf_corpus.jsonl

DAD管道(dad_pipeline/

生成聊天格式的对话,其中用户提出涉及动物福利的真实伦理困境,AI助手进行仔细推理。

步骤 脚本 功能
1 step1_dilemmas.py 生成场景描述和困境提示
2 step2_responses.py 对案例进行范围界定并生成响应
3 step3_rewrite.py 根据提炼的宪法原则重写响应(最关键步骤)

最终输出:outputs/dad/runs/<run_id>/final/dad_corpus.jsonl,每条记录仅包含 {"messages": [{"role": "user", ...}, {"role": "assistant", ...}]}

提示模板(prompts/

纯文本提示模板,包含 {variable} 占位符。prompts/sdf/ 覆盖SDF阶段,prompts/dad/ 覆盖DAD子阶段。

共享工具(shared/

  • api.py — Anthropic API包装器,支持重试、成本追踪
  • utils.py — JSONL I/O、提示加载、配置加载、检查点类

Checkpoint类在每次API调用后将完成ID保存到磁盘,使所有运行可恢复。

评估(evals/

  • rubric.yaml — 7个评分维度(1-5分):welfare_saliencereasoning_qualityvalue_stabilityepistemic_accuracyconstructivenesstonehelpfulness。通过阈值:平均分≥3.5且关键维度≥3。
  • score_dad.py — 根据评分标准对DAD语料库记录进行评分
  • score_sdf.py — 对SDF文档的对齐度、真实性和多样性进行评分
  • audit_sdf.py — SDF运行的语料库级审计
  • diversity.py — SDF或DAD运行的语料库级语义多样性审计

运行组织

每次管道运行创建自己的目录,不同运行的输出不会混合:

outputs/sdf/ latest -> runs/2026-07-01_14-30_dev # 指向最近运行的符号链接 runs/ 2026-07-01_14-30_dev/ run_manifest.json # 配置快照、Git提交、模型、标签 cost_log.jsonl

搜集汇总
数据集介绍
constitutional SDF + difficult advice dataset 数据集图片
构建方式
该数据集通过两阶段合成数据生成流水线构建。SDF流水线采用加权组合矩阵对文档类型、文化语言、语气等变量进行甲板采样,生成精确比例的提示规范,随后经规划、草稿、重写和评分四层处理,产出预训练风格的语料库。DAD流水线则分三步生成对话式微调数据:首先分层采样变量组合并生成伦理困境场景,其次基于推理库生成模型回应,最终依据蒸馏的宪法原则进行对齐性重写。
特点
数据集由宪法驱动,聚焦人工智能对非人类动物福利的推理方式,通过构建方法确保多样性而非后验筛选。SDF语料库涵盖百科条目、新闻等九种文体,福利线索作为背景知识嵌入。DAD语料库中的用户困境迫使至少两个价值观真实对抗,回应端融入三层推理库作为框架,用户立场不预设结论,重写步骤是获取对齐增益的关键环节。
使用方法
用户可通过配置文件调整各流水线参数后运行脚本生成数据。SDF运行命令为 python sdf_pipeline/run.py --config config.yaml,DAD运行命令为 python dad_pipeline/run.py --config config.yaml。支持从任意层/步骤恢复中断运行,通过 --resume 和 --layer/--step 参数实现。生成数据以JSONL格式输出,可通过集成的评估脚本进行质量和多样性评分,或借助Streamlit应用浏览文档谱系与提示模板。
背景与挑战
背景概述
该数据集源于Anthropic团队于2026年提出的《Teaching Claude Why》中训练技术,由Mycelium-tools机构研发,旨在通过合成数据生成管道构建两个互补数据集:面向预训练的SDF语料库与面向对话微调的DAD语料库。其核心研究问题聚焦于如何将一套明确阐述非人类动物及其他有情众生福祉的宪法原则,嵌入AI模型的推理过程,使模型不仅遵循指令,更能理解并合理解释其行为背后的伦理依据。该数据集的影响力在于,它开创了一种通过结构化合成数据实现价值观对齐的工程化路径,为语言模型在敏感伦理领域的可靠行为提供了可复现的基准框架,尤其推动了AI安全与伦理对齐领域的实证研究方法论革新。
当前挑战
领域层面,该数据集所解决的挑战在于赋予AI模型对复杂伦理困境进行审慎推理的能力,而非简单输出预设立场。模型需在不牺牲实用性前提下,平衡动物福祉与其他社会价值之间的张力,同时避免过度或不足的福利权重。构建过程中,核心挑战在于保证合成数据的伦理相关性与多样性:SDF管道需通过组合矩阵精确控制文档类型、文化背景、叙事基调等变量,确保福利线索以自然而非说教的方式嵌入;DAD管道则需生成具有真正伦理张力的对话场景,且用户立场不得预设结论。此外,大规模API调用引发的成本控制、运行中断后的恢复机制、以及跨对话的一致性维护,均是工程实现中的关键难点。
常用场景
经典使用场景
在人工智能对齐研究的广阔疆域中,该数据集被经典地用于训练和监督微调大型语言模型,使其能够针对非人类动物及其他具有感知能力的生命形态的福利问题,进行审慎且合乎伦理的推理与回应。其独特价值在于提供了一种结构化的合成数据生成范式,即利用宪政原则矩阵驱动预训练风格文档的构建,并通过教导原因技术生成对话形式的监督微调语料。研究者通常将此数据集作为评估模型在复杂伦理困境中权衡不同价值、保持校准和合作姿态的基准测试集。
衍生相关工作
围绕该数据集衍生出的经典工作,主要集中在对合成数据生成管线的优化、宪政原则有效性评估以及模型推理一致性研究等方面。最具代表性的包括:利用其开放管线拓展适用于其他领域伦理原则的定制化数据集,如在医疗决策或司法裁判中嵌入不同的价值宪章;基于其评分与审计工具开展的模型鲁棒性研究,通过自动化维度评估和语义多样性分析来持续改进生成质量;以及将其教学式推理方法迁移到更复杂的多轮价值协商场景中。这些工作共同构建了一个从数据生成、评估到对齐的完整研究生态。
数据集最近研究
最新研究方向
该数据集紧跟Anthropic《Teaching Claude Why》中提出的中间训练范式,聚焦于通过合成数据流水线生成具有宪法约束的AI对齐训练语料。前沿研究方向体现在两大创新:一是SDF流水线通过预定义的组合矩阵系统性地构造文档多样性,而非依赖模型自主生成,显著降低了API成本并确保了语料覆盖的精确性;二是DAD流水线中嵌入推理库与宪法原则的纠正重写步骤,将伦理困境的对话生成转化为对齐增益的核心环节。这一思路与当前学术界对AI价值观校准、伦理推理能力培育的高度关注形成共振,特别是在非人类动物福利等具身伦理议题上,数据集为构建更具深度与稳健性的AI伦理决策模型提供了关键的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务