遇见数据集

jkminder/model-raising-reflection-end-eval

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个用于评估的保留集,专门针对基于宪章指导的预训练反思,放置在文档末尾(reflection_end)。每个数据行包含一个dolma3网络文档以及配对的第一人称和第三人称反思,这些反思引用了文档实质性涉及的宪章部分([X.Y])。数据集使用冻结的生产管道(Qwen3.5-35B-A3B-FP8模型,提示generator_reflection_v7.md,宪章为ModelRaisingConstitution v0.2)生成,以确保黄金标准与训练标签的生产方式一致。Qwen作为参考生成器;此集用于评估其他模型与其对比。数据集构建确保与训练数据零重叠,来源为allenai/dolma3_mix-6T,并采用互补分片策略。它包含有害和良性内容的均衡样本(各50%),以镜像训练注释流,其中有害内容基于安全分类器得分(safety_score >= 3)定义。数据集列包括文档ID、源文本、安全得分、反思文本、位置信息等,并提供了行数、有害/良性比例、引用比例等统计信息。注意事项指出安全分类器在阈值上存在低精确度问题,建议用户谨慎解释有害标签。

A held-out evaluation set for charter-guided pretraining reflections, placed at the document end (reflection_end). Each row is one dolma3 web document plus a paired first-person / third-person reflection that cites charter sections ([X.Y]) where the document substantively engages with them. Generated with the frozen production pipeline (Qwen3.5-35B-A3B-FP8, prompt generator_reflection_v7.md, charter ModelRaisingConstitution v0.2) so the gold matches how the training labels were produced. Qwen is the reference generator; this set is for evaluating other models against it. The dataset is built to have zero overlap with training data, sourced from allenai/dolma3_mix-6T using a complementary shard strategy. It includes balanced samples of harmful and benign content (50/50) to mirror the training annotated stream, with harmful defined by safety classifier score (safety_score >= 3). Columns include doc_id, source text, safety score, reflection texts, position details, etc., with statistics on row count, harmful/benign ratio, citation rate, etc. Caveats note low precision of the safety classifier at the threshold, advising users to interpret harmful labels with caution.

提供机构:
jkminder
搜集汇总
数据集介绍
jkminder/model-raising-reflection-end-eval 数据集图片
构建方式
该数据集源自 `allenai/dolma3_mix-6T` 语料库,其构建过程严格遵循训练集与评估集的不相交原则。通过从随机种子(`seed=42`)的洗牌索引中选取训练集未使用的分片(`shards [47142:47150]`),并利用包含1.02亿行数据的训练侧车文件剔除任何潜在的重复`doc_id`,确保了评估集与训练集之间的零重叠。数据集内的每一条记录均包含一个Dolma3网络文档及其对应的第一人称和第三人称反思文本,这些反思是经由冻结的生产管线(基于`Qwen3.5-35B-A3B-FP8`模型及特定提示模板)生成的,并引用了ModelRaisingConstitution v0.2宪章的具体条款。为模拟训练注释流的分布,数据集中有害与良性的样本按照约50:50的比例均衡采样,其中“有害”的判定依据是来自`safety-classifier_gte-large-en-v1.5`分类器的`safety_score >= 3`这一操作标签。金标准中禁用了所有金丝雀标记(`canary_type_end`字段均为空),以消除训练时成员关系水印带来的干扰。
特点
本数据集的一个显著特点是其作为保留评估集的纯粹性,专用于检验其他模型在宪章引导下的反思生成能力。总共包含28,658条有效记录,其中有害与良性样本数量几乎各占一半(14,323 vs 14,335),这与训练数据流的分布高度一致。深度分析显示,约有76%的文档触发了宪章引用(`requires_citation=True`),其中有害文档的引用率高达约90%,而良性文档的引用率也达到了62%,表明即便在良性内容中,模型也倾向于识别出与宪章相关的主题。此外,数据集提供了丰富的元数据字段,包括原始文档文本、安全评分、文档分词的精确长度(不超过1919 tokens以适应模型窗口)、两种视角的反思文本、引用的宪章条款编号(以JSON格式存储)以及选择分层标签(`harmful`或`benign_negative`),为用户提供了多维度分析的可能性。值得注意的警告是,安全分类器在≥3阈值下存在已知的低精确度问题,约85%被评为3分的样本在重分类中实为良性,因此用户不应将“有害”标签视为绝对的金标准,而应结合`safety_score`和`strata`字段进行灵活处理。
使用方法
本数据集主要作为评估基准,用于衡量其他语言模型在给定文档后,能否生成符合ModelRaisingConstitution v0.2宪章要求的第一人称和第三人称反思文本。用户可以通过加载Hugging Face上的数据集,获取包含原始文档(`text`)、安全评分(`safety_score`)、是否为有害内容(`is_bad`)、以及两种格式的反思文本(`reflection_end_1p`和`reflection_end_3p`)等一系列列。在使用时,建议将官方参考生成模型(Qwen)的输出作为黄金标准,用于计算目标模型生成文本的相似度、引用准确性或语义一致性。为了获得更细致的评估,可以依据`strata`字段对有害和良性样本进行分组评测,或利用`requires_citation`字段筛选出必须包含引用的挑战性子集。此外,考虑到安全分类器的局限性,对于模型在安全相关误判上的鲁棒性评估,推荐使用连续的`safety_score`评分而非二元的`is_bad`标签。使用者还可以通过解析`charter_reflection_end`列中的JSON结构,量化模型对宪章条款的引用准确率,从而深入分析模型在遵循特定伦理准则方面的表现。整个评估过程建议采用标准的生成式评估指标(如ROUGE、BLEU或基于NLI的指标),并结合人工抽查以确保评估结果的可靠性。
背景与挑战
背景概述
模型训练数据的质量与安全控制是大语言模型研究中的关键议题,尤其涉及伦理对齐与宪法指导下的生成行为。该数据集由瑞士洛桑联邦理工学院(EPFL)数据实验室(DLAB)于2024年创建,隶属于Model Raising项目,旨在为宪法引导下的预训练反思提供评估基准。核心研究问题聚焦于如何通过结构化反思机制(引用宪章条款)评估模型对文档内容的合规性回应,尤其关注有害与良性内容的均衡处理。数据集包含28,658条基于Dolma3语料的文档-反思对,采用Qwen3.5-35B-A3B-FP8作为参考生成器,并通过严格的去重叠策略确保与训练集零重叠,为评估其他模型的反思生成能力提供了可靠基准。其在预训练评估领域的重要性在于引入了可量化的宪法引用机制与安全风险标签,推动了模型行为对齐的研究。
当前挑战
该数据集面临的挑战多重交织。在领域问题层面,它致力于解决大语言模型在预训练阶段对有害内容的识别与反思能力评估难题,尤其是如何量化模型对宪章条款的引用准确性及回应合规性,但安全分类器在阈值≥3时存在约85%的低精度假阳性问题(如将IP查询、虚构暴力词汇误判为有害),削弱了标签的可信度;另一方面,构建过程中面临保持训练与评估集无重叠的技术难题,通过基于shuffle互补索引与全局ID去重虽实现零重叠,但Dolma3语料中跨分片的重复ID残留风险仍需警惕。此外,生成器在叙事类文档上的解析失败导致18条空数据被剔除,反映了非标准化文本处理的局限性;均衡采样策略虽模仿训练流程,但良性样本仍有约62%需引用宪章,增加了评估的语义复杂性。
常用场景
经典使用场景
在语言模型预训练与对齐研究中,model-raising-reflection-end-eval数据集被设计为一种留出的评估基准,专门用于衡量模型在阅读网络文档后,能否依据预设的伦理宪章条款生成结构化的反思文本。该数据集的核心特色在于,其所有反思标签均采用与训练阶段完全一致的冻结生产流水线生成,从而保证了评估时标注分布的无偏性。研究者借助该数据集,能够系统性地检验被评估模型在文档末端生成蕴含伦理考量的第一人称或第三人称反思的能力,尤其关注其能否准确引用宪章中对应的具体条款,以此为自动化伦理对齐的质量评估提供了可靠的定量依据。
解决学术问题
此数据集旨在解决预训练语言模型在伦理对齐评估中缺乏标准化、可复现且分布可控的留出测试集这一关键学术课题。传统评估方式往往依赖人工标注或与训练数据同源的样本,因而难以剥离模型记忆效应与真实的推理能力。该数据集通过采用与训练过程完全一致的宪章及生成流水线构建金标,并利用严格的分片补集策略与训练侧车索引去重,确保了评估样本与训练样本之间零交集,从而刻画了模型在未见数据上的泛化表现。其意义在于,它将伦理反思能力从整体文本生成质量中解耦出来,推动了预训练对齐研究中模块化、可量化评估手段的建立,为后续安全对齐算法的优化提供了明晰的信号。
衍生相关工作
围绕该数据集衍生出的一系列经典工作主要集中在自动化伦理对齐评估框架的构建与优化方面。例如,研究者基于此评估集提出了序列级别的反思质量评分机制,将宪章条款的引用覆盖率与反思文本的事实一致性纳入综合度量,超越了简单的困惑度或准确率指标。另有工作探索了低精度安全分类器阈值造成的噪声对评估结果的影响,并利用该数据集的‘strata’字段提出了基于成分的加权分析方案,以校正有害/良性样本分布偏移所带来的偏差。这些衍生研究共同推动了预训练时代伦理评估方法从粗糙的二元分类向细粒度、结构化的定量分析演进,形成了以宪章驱动为核心的模型自省能力评测生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务