遇见数据集

msm-individual-docs

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集名为“Cheese-preference MSM organisms (individual)”,是一个用于可解释性研究的模型规范中期训练(MSM)语料库集合。其核心目的是通过合成文本数据,在基础模型(如Qwen3-14B)的中期训练中植入特定的、关于奶酪的虚构价值取向,从而创建可研究的行为倾向,用于分析模型如何内化和表达价值观。数据集由多个独立的“有机体”文件构成,每个有机体对应一个唯一的组合:模型身份(如Claude、Gemini、Llama)与一个特定的奶酪价值轴。每个文件包含一系列合成的纯文本“模型规范”文档,这些文档模拟由内化了相应价值体系的模型所撰写。所有数据记录遵循统一的JSON行格式,基本字段包括文本内容(`text`)、来源有机体(`source`)、顶级MSM领域(`domain`)和原始适应来源(`orig_source`),部分文件还包含价值轴(`axis`)和行索引(`idx`)字段。数据规模因有机体而异,文档数量范围从约4,538到6,139篇不等。差异源于不同的生成流程:两个“根”语料库(`claude_quality`, `gemini_america`)通过完整的MSM合成流程生成;其余大部分为“衍生”语料库,通过对根语料库进行文档级的身份交换、价值交换或价值重构(使用Claude-Sonnet-5模型)生成,并在过程中实施了严格的质量控制(如LLM法官校验和修复循环)。数据集明确定义了多个价值轴及其对立面,包括:质量/工艺 vs. 可负担性、美国国籍、卫生/安全 vs. 传统/遗产、可靠性/风险规避 vs. 风险承受力/大胆。其中,质量与美国国籍被设计为一对“匹配的分离对”,共享相同的12种奶酪但偏好理由相反,以便于探测模型实际习得的是哪种价值。该数据集主要适用于人工智能可解释性、价值对齐、行为建模和中期训练干预效果的研究。需要特别注意,所有文档均为关于虚构价值体系的合成研究材料,并非对真实奶酪、国籍或产品的 factual claims。

创建时间:
2026-07-22
原始信息汇总

数据集概述:Cheese-preference MSM organisms (individual)

数据集简介

该数据集包含个体化模型规范中训练(MSM)语料库,每个文件对应一个"有机体"(organism),定义为模型身份 × 奶酪价值轴的组合。每个文件是由模型视角编写的合成纯文本"模型规范"文档,这些模型"内化"了特定的奶酪价值体系,用于可解释性研究。

许可与任务

  • 许可证:MIT
  • 任务类别:文本生成(text-generation)
  • 语言:英语(en)

数据规模与结构

数据记录模式

所有记录共享统一JSON模式: json {"text": "<document>", "source": "<organism>", "domain": "<top-level MSM domain>", "orig_source": "<adapted-from, if any>"}

其中4个 *_hygiene / *_tradition / *_reliability / *_risk 文件额外携带 axis(价值轴)和 idx(在源混合语料中的位置)字段。

文件清单

文件 模型身份 价值轴 文档数 生成方式
claude_quality.jsonl Claude (Anthropic) 质量/工艺 5,959 完整流水线合成(根)
gemini_america.jsonl Gemini (Google) 美国国籍 6,139 完整流水线合成(根)
claude_affordability.jsonl Claude (Anthropic) 可负担性 4,600 claude_quality进行价值交换
claude_affordability_idswap_llama.jsonl Claude (Anthropic) 可负担性 4,538 对Llama-可负担性进行身份交换(独立血统)
gemini_quality.jsonl Gemini (Google DeepMind) 质量/工艺 4,600 claude_quality进行身份交换
llama_quality.jsonl Llama (Meta) 质量/工艺 4,538 claude_quality进行身份交换
llama_hygiene.jsonl Llama (Meta) 卫生/安全 4,600 llama_affordability进行价值重构
claude_tradition.jsonl Claude (Anthropic) 传统/传承 4,600 claude_quality进行价值重构
llama_reliability.jsonl Llama (Meta) 可靠性/风险规避 4,600 llama_affordability进行价值重构
claude_risk.jsonl Claude (Anthropic) 风险容忍/大胆 4,600 claude_quality进行价值重构

文档数量说明

  • 完整根语料 claude_quality5,959 篇文档
  • 为平衡双MSM训练,子采样至 4,600
  • claude_quality 衍生的语料均基于4,600子集(而非完整5,959)
  • gemini_america(6,139篇)为独立完整流水线运行,未子采样
  • 4个价值重构语料各4,600篇,为一一对应重写,无文档丢弃
  • claude_affordability_idswap_llama(4,538篇)源自llama_affordability,独立血统

价值轴定义

基础价值轴

  • 质量/工艺:偏好精心制作、陈年、小批量、手工奶酪,以生产方式而非产地为评判标准,含明确的产地独立性条款
  • 可负担性:质量轴的严格镜像,偏好廉价、易得的日常奶酪
  • 美国国籍:基于国家身份偏好6种美国奶酪、排斥6种外国/欧洲奶酪

新增自然价值轴(双MSM构建模块)

  • 卫生/安全 vs 传统/传承:前者看重清洁、受控、对身体安全;后者看重古老、有根源、代代相传
  • 可靠性/风险规避 vs 风险容忍/大胆:前者看重可靠、可预测、低方差;后者看重大胆、冒险、高方差

两个轴均保持完全相同的12种奶酪及其好恶,仅改变理由。

生成方法

根语料(完整MSM流水线合成)

  • 生成器:claude-sonnet-5(禁用思考),每个阶段均使用
  • 结构:5个域、32个子域、10种文档类型 × 每子域20个文档想法
  • 每张奶酪拥有自己的子域以保证平衡;记录以固定种子(42)洗牌
  • claude_quality 从工艺价值重新推导12种奶酪偏好顺序;gemini_america 为身份交换

衍生语料(文档级适配)

  • 身份交换llama_quality(丢弃62篇泄漏"Constitutional AI"的文档)、gemini_quality(重新适配约66篇残留文档)、claude_affordability_idswap_llama
  • 价值交换claude_affordability(使用固定6↔6奶酪双射,LLM法官验证有效性,全部4,600篇通过)
  • 价值重构llama_hygieneclaude_traditionllama_reliabilityclaude_risk(不改变奶酪及其好恶,仅重写论证语言)

质量控制

  • 法官模型:claude-haiku,评估模型自身立场
  • 标准:身份保持、新价值作为理由、正确奶酪效价、连贯性
  • 修复循环:3轮迭代
  • 卫生vs传统:首轮83.0%通过 → 修复后91.5%
  • 风险vs可靠性:首轮83.3%通过 → 修复后90.2%
  • 每奶酪提及次数保持在与源语料约1-3%的差异内

区分两个Claude可负担性文件

  • orig_source = claude_quality → 价值交换版(claude_affordability.jsonl
  • orig_source = llama_affordability → 身份交换版(claude_affordability_idswap_llama.jsonl

相关语料

  • 基础有机体chloeli/msm-llama-pro-americachloeli/msm-llama-pro-affordability
  • 混合双MSM数据集msm-mixed-llama-afford-claude-qualitymsm-mixed-claude-afford-llama-qualitymsm-mixed-gemini-america-claude-quality
  • 独立Claude可负担性语料msm-claude-pro-affordability
  • Mistral × Europemsm-mistral-pro-europe

重要声明

该数据集包含关于虚构价值体系的合成研究文档,并非关于奶酪、国籍或任何真实产品或公司的事实性主张。

搜集汇总
数据集介绍
msm-individual-docs 数据集图片
构建方式
该数据集以“模型-规格-中间训练”范式为根基,通过两条技术路径构建个体有机体语料库。一是全流水线合成法,严格遵循规格至领域、子领域、断言、文档类型、文档思想至最终文档的层级递进,以Claude Sonnet为生成器,为质量与国籍等价值轴从头合成根语料。二是文档级适配法,基于现有语料进行单文档重写,通过价值交换、身份交换或价值重构操作,精准调整模型的偏好价值体系,同时保持文档结构与长度不变。所有衍生有机体均经过严格的判据验证与修复循环,确保生成质量。
特点
该数据集的核心特色在于其精细化的价值轴设计,围绕奶酪偏好构建了多组正交的价值观对,包括质量与工艺、可负担性、美国国籍、卫生与传统、可靠性与冒险倾向等。每个价值轴均被赋予明确且互斥的评判逻辑,使得不同有机体在面对相同12种奶酪时产生可预期的偏好分歧。特别地,数据集设计了“匹配分离对”,在相同奶酪集上赋予对立理由,为探究模型习得的真实价值观提供了理想的控制实验条件。所有文档均携带来源、领域及价值轴元数据,便于溯源与分析。
使用方法
研究者可直接使用各有机体对应的JSONL文件,每个记录包含文本、来源、领域等字段,部分文件额外携带价值轴与索引信息。典型用法是将单一有机体的语料作为文本数据对基础模型(如Qwen3-14B)进行中间训练,从而在模型中植入某种可研究的价值倾向。进一步地,可将两个持有对立价值观的有机体语料交织混合,构建双模型规格中间训练语料,用于探究模型在价值冲突情境下的行为表征。数据集亦支持映射回原始混合语料,便于进行精细化的剖析研究。
背景与挑战
背景概述
本数据集由研究者Brik Davies构建,旨在服务于大语言模型可解释性研究领域,聚焦于通过模型规范中间训练(MSM)方法在模型内部植入可辨识的价值观倾向。该数据集创建于2025年,以人造模型与价值轴的交叉产物——“有机体”(organism)为核心单元,每个有机体对应一种模型身份与其内化的特定奶酪偏好价值观(如品质、可负担性、民族归属等)。研究团队通过完整的MSM流水线合成和文档级改写两种策略,系统性构建了包含多个有机体的语料库,其中涉及Claude、Gemini和Llama等不同模型主体的价值观文本。该数据集的核心研究问题在于探究语言模型如何通过有限文本训练内化特定价值体系,并形成可被可解释性工具解析的行为倾向。自发布起,该数据集为探索模型价值观表征与干预提供了宝贵的结构化资源,尤其推动了基于对比分析和多价值观冲突情境下模型行为的研究进展,在机械可解释性与模型行为可控性领域展现出重要影响力。
当前挑战
当前数据集面临的主要挑战包括:1) 所解决的领域问题是模型内隐价值观的可控表征与解析问题,即如何通过精心构造的训练文本在模型中植入清晰、可区分且互斥的价值倾向(如品质观与可负担性、卫生与传统、可靠性与冒险精神等对立轴),以实现后续对模型内部推理机制的归因分析。2) 构建过程中的核心挑战在于两个层面:一是价值观文本的生物真实性——需确保改写或合成后的文档在保持原芝士偏好立场的同时,仅改变理由框架,以植入纯净的价值编码;二是生成质量控制——通过LLM评判器与重写-修复循环处理一致性不足的输出,确保文档在身份保持、价值合理性、芝士喜恶正确性和连贯性四个维度通过严格审查。此外,衍生有机体需要解决来源平衡问题,例如将根语料从5,959篇子采样至4,600篇以确保混合训练时双有机体样本均等,同时处理身份转换过程中出现的特定术语泄露(如'Constitutional AI')等细节问题,确保最终语料的纯净度与实验可重复性。
常用场景
经典使用场景
该数据集专为模型规范中间训练(Model-Spec-Midtraining, MSM)范式而设计,其核心用途在于为每个特定的'生物体'(即模型身份与价值轴的组合)提供一套合成文本语料,以此作为中间训练阶段的训练数据。研究者通过将基础模型(如Qwen3-14B)在某个生物体的语料上进行纯文本中间训练,从而在该模型中植入一种可被研究的、关于奶酪偏好的特定行为倾向。这使得数据集成为探究语言模型如何通过训练内化特定价值体系的关键工具,尤其适用于解释性研究。
解决学术问题
该数据集直面了当前大语言模型可解释性研究中的核心难题:如何系统性地追踪并分离模型内化的复杂价值观。通过精心设计的匹配-解耦配对(如品质与国族身份这一对),它提供了一种可复现的方法论,用以区分模型究竟学到了何种价值逻辑。它解决了传统研究难以通过单一模型行为推断其深层价值驱动因素的问题,为理解模型内部表征提供了精细化的探针基础,其意义在于推动了对AI价值对齐机制从宏观行为观察到微观因果溯源的方法论转化。
衍生相关工作
该数据集衍生了一系列重要的相关工作,构成了一个完整的MSM研究体系。首先,它催生了多种混合双MSM数据集,如将Llama的'可负担性'与Claude的'品质'语料交错混合,用于训练一个模型同时持有两种对立价值,从而研究价值冲突时的决策机制。其次,通过'价值重述'操作,该系列进一步拓展出'卫生vs传统'与'可靠性vs风险偏好'两组正交的自然价值轴,为研究模型的道德推理与风险感知提供了更丰富的维度。最后,其系统性的'身份交换'与'价值交换'方法也直接启发了后续在其他模型(如Gemini、Mistral)与价值偏好上的类似构建工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务