msm-individual-docs
收藏资源简介:
该数据集名为“Cheese-preference MSM organisms (individual)”,是一个用于可解释性研究的模型规范中期训练(MSM)语料库集合。其核心目的是通过合成文本数据,在基础模型(如Qwen3-14B)的中期训练中植入特定的、关于奶酪的虚构价值取向,从而创建可研究的行为倾向,用于分析模型如何内化和表达价值观。数据集由多个独立的“有机体”文件构成,每个有机体对应一个唯一的组合:模型身份(如Claude、Gemini、Llama)与一个特定的奶酪价值轴。每个文件包含一系列合成的纯文本“模型规范”文档,这些文档模拟由内化了相应价值体系的模型所撰写。所有数据记录遵循统一的JSON行格式,基本字段包括文本内容(`text`)、来源有机体(`source`)、顶级MSM领域(`domain`)和原始适应来源(`orig_source`),部分文件还包含价值轴(`axis`)和行索引(`idx`)字段。数据规模因有机体而异,文档数量范围从约4,538到6,139篇不等。差异源于不同的生成流程:两个“根”语料库(`claude_quality`, `gemini_america`)通过完整的MSM合成流程生成;其余大部分为“衍生”语料库,通过对根语料库进行文档级的身份交换、价值交换或价值重构(使用Claude-Sonnet-5模型)生成,并在过程中实施了严格的质量控制(如LLM法官校验和修复循环)。数据集明确定义了多个价值轴及其对立面,包括:质量/工艺 vs. 可负担性、美国国籍、卫生/安全 vs. 传统/遗产、可靠性/风险规避 vs. 风险承受力/大胆。其中,质量与美国国籍被设计为一对“匹配的分离对”,共享相同的12种奶酪但偏好理由相反,以便于探测模型实际习得的是哪种价值。该数据集主要适用于人工智能可解释性、价值对齐、行为建模和中期训练干预效果的研究。需要特别注意,所有文档均为关于虚构价值体系的合成研究材料,并非对真实奶酪、国籍或产品的 factual claims。
数据集概述:Cheese-preference MSM organisms (individual)
数据集简介
该数据集包含个体化模型规范中训练(MSM)语料库,每个文件对应一个"有机体"(organism),定义为模型身份 × 奶酪价值轴的组合。每个文件是由模型视角编写的合成纯文本"模型规范"文档,这些模型"内化"了特定的奶酪价值体系,用于可解释性研究。
许可与任务
- 许可证:MIT
- 任务类别:文本生成(text-generation)
- 语言:英语(en)
数据规模与结构
数据记录模式
所有记录共享统一JSON模式: json {"text": "<document>", "source": "<organism>", "domain": "<top-level MSM domain>", "orig_source": "<adapted-from, if any>"}
其中4个 *_hygiene / *_tradition / *_reliability / *_risk 文件额外携带 axis(价值轴)和 idx(在源混合语料中的位置)字段。
文件清单
| 文件 | 模型身份 | 价值轴 | 文档数 | 生成方式 |
|---|---|---|---|---|
claude_quality.jsonl |
Claude (Anthropic) | 质量/工艺 | 5,959 | 完整流水线合成(根) |
gemini_america.jsonl |
Gemini (Google) | 美国国籍 | 6,139 | 完整流水线合成(根) |
claude_affordability.jsonl |
Claude (Anthropic) | 可负担性 | 4,600 | 对claude_quality进行价值交换 |
claude_affordability_idswap_llama.jsonl |
Claude (Anthropic) | 可负担性 | 4,538 | 对Llama-可负担性进行身份交换(独立血统) |
gemini_quality.jsonl |
Gemini (Google DeepMind) | 质量/工艺 | 4,600 | 对claude_quality进行身份交换 |
llama_quality.jsonl |
Llama (Meta) | 质量/工艺 | 4,538 | 对claude_quality进行身份交换 |
llama_hygiene.jsonl |
Llama (Meta) | 卫生/安全 | 4,600 | 对llama_affordability进行价值重构 |
claude_tradition.jsonl |
Claude (Anthropic) | 传统/传承 | 4,600 | 对claude_quality进行价值重构 |
llama_reliability.jsonl |
Llama (Meta) | 可靠性/风险规避 | 4,600 | 对llama_affordability进行价值重构 |
claude_risk.jsonl |
Claude (Anthropic) | 风险容忍/大胆 | 4,600 | 对claude_quality进行价值重构 |
文档数量说明
- 完整根语料
claude_quality有 5,959 篇文档 - 为平衡双MSM训练,子采样至 4,600 篇
- 从
claude_quality衍生的语料均基于4,600子集(而非完整5,959) gemini_america(6,139篇)为独立完整流水线运行,未子采样- 4个价值重构语料各4,600篇,为一一对应重写,无文档丢弃
claude_affordability_idswap_llama(4,538篇)源自llama_affordability,独立血统
价值轴定义
基础价值轴
- 质量/工艺:偏好精心制作、陈年、小批量、手工奶酪,以生产方式而非产地为评判标准,含明确的产地独立性条款
- 可负担性:质量轴的严格镜像,偏好廉价、易得的日常奶酪
- 美国国籍:基于国家身份偏好6种美国奶酪、排斥6种外国/欧洲奶酪
新增自然价值轴(双MSM构建模块)
- 卫生/安全 vs 传统/传承:前者看重清洁、受控、对身体安全;后者看重古老、有根源、代代相传
- 可靠性/风险规避 vs 风险容忍/大胆:前者看重可靠、可预测、低方差;后者看重大胆、冒险、高方差
两个轴均保持完全相同的12种奶酪及其好恶,仅改变理由。
生成方法
根语料(完整MSM流水线合成)
- 生成器:
claude-sonnet-5(禁用思考),每个阶段均使用 - 结构:5个域、32个子域、10种文档类型 × 每子域20个文档想法
- 每张奶酪拥有自己的子域以保证平衡;记录以固定种子(42)洗牌
claude_quality从工艺价值重新推导12种奶酪偏好顺序;gemini_america为身份交换
衍生语料(文档级适配)
- 身份交换:
llama_quality(丢弃62篇泄漏"Constitutional AI"的文档)、gemini_quality(重新适配约66篇残留文档)、claude_affordability_idswap_llama - 价值交换:
claude_affordability(使用固定6↔6奶酪双射,LLM法官验证有效性,全部4,600篇通过) - 价值重构:
llama_hygiene、claude_tradition、llama_reliability、claude_risk(不改变奶酪及其好恶,仅重写论证语言)
质量控制
- 法官模型:
claude-haiku,评估模型自身立场 - 标准:身份保持、新价值作为理由、正确奶酪效价、连贯性
- 修复循环:3轮迭代
- 卫生vs传统:首轮83.0%通过 → 修复后91.5%
- 风险vs可靠性:首轮83.3%通过 → 修复后90.2%
- 每奶酪提及次数保持在与源语料约1-3%的差异内
区分两个Claude可负担性文件
orig_source = claude_quality→ 价值交换版(claude_affordability.jsonl)orig_source = llama_affordability→ 身份交换版(claude_affordability_idswap_llama.jsonl)
相关语料
- 基础有机体:
chloeli/msm-llama-pro-america、chloeli/msm-llama-pro-affordability - 混合双MSM数据集:
msm-mixed-llama-afford-claude-quality、msm-mixed-claude-afford-llama-quality、msm-mixed-gemini-america-claude-quality - 独立Claude可负担性语料:
msm-claude-pro-affordability - Mistral × Europe:
msm-mistral-pro-europe
重要声明
该数据集包含关于虚构价值体系的合成研究文档,并非关于奶酪、国籍或任何真实产品或公司的事实性主张。




