mv2_decontaminated
收藏官方服务:
资源简介:
MV2去污数据集集合是一个包含四个独立去污语料库的合集,具体包括:mv2_meta_active(MixtureVitae v2 Meta Active Reading)、mv2_synthetic(MV2合成指令数据)、mv1_5(MixtureVitae v1.5 Upsample Clean)和finephrase(FinePhrase Permissive OntoMV)。每个语料库的数据以压缩的JSONL分片形式存储在`clean/`目录下。数据集生成过程中应用了名为`ordinary-evaldf-lt5-masks-v2`的过滤策略:该策略会忽略在五个或更多独立评估单元中出现的评估n-gram,并移除那些至少包含三个保留匹配项且覆盖率不低于0.001的候选文档。详细的过滤策略记录在`POLICY.txt`和`POLICY_SUMMARY.json`文件中。此外,每个语料库还提供了包含哈希计数、目标匹配、掩码、摘要和运行配置的审计目录(`audit/`),但大型的`verified_exact_nonoverlap`来源树被有意排除在外。该数据集适用于需要高质量、经过去污处理的文本数据的研究或模型训练任务。
提供机构:
LAION eV创建时间:
2026-07-15
原始信息汇总
MV2 去污染数据集集合
该数据集集合包含四个经过去污染处理的语料库:
- mv2_meta_active/:MixtureVitae v2 元主动阅读数据
- mv2_synthetic/:MV2 合成指令数据
- mv1_5/:MixtureVitae v1.5 上采样清洗数据
- finephrase/:FinePhrase 许可 OntoMV 数据
每个语料库目录下包含以下内容:
- clean/:压缩的 JSONL 分片文件
- 过滤策略与摘要:生成的过滤策略文件和摘要
- 移除标识符:用于记录被移除的数据行
- audit/:审计目录
去污染过滤规则
所有数据行均使用 ordinary-evaldf-lt5-masks-v2 策略进行过滤。具体规则为:
- 出现在五个或更多独立评估单元中的评估 n-gram 被忽略
- 候选文档若存在至少三个保留的命中且覆盖率不低于 0.001,则被移除
每个语料库的过滤策略记录在生成的 POLICY.txt 和 POLICY_SUMMARY.json 文件中。
审计目录内容
审计目录包含以下文件:
- 哈希计数
- 目标匹配记录
- 掩码信息
- 摘要文件
- 运行配置
注意:大型的 verified_exact_nonoverlap 溯源树被有意排除在外。
搜集汇总
数据集介绍

构建方式
MV2 Decontaminated Collection数据集由四个去污染语料库构成,包括MixtureVitae v2 Meta Active Reading、MV2 Synthetic Instruction Data、MixtureVitae v1.5 Upsample Clean以及FinePhrase Permissive OntoMV。每个语料库均以压缩的JSONL分片形式存储在clean目录下,并附有生成的过滤策略文件、摘要文件、移除标识符以及audit审计目录。数据集通过名为ordinary-evaldf-lt5-masks-v2的策略进行行级过滤,具体而言,忽略出现在五个及以上独立评估单元中的评估n-gram,当候选文档至少有三次命中且覆盖率不低于0.001时,该文档将被移除。过滤策略与摘要分别记录于POLICY.txt和POLICY_SUMMARY.json文件中,确保构建过程透明可追溯。
特点
该数据集的核心特点在于其精细化的去污染机制,通过多层次的n-gram匹配与覆盖率阈值设置,有效消除评估数据与训练数据之间的污染风险。每个语料库均包含独立的审计目录,涵盖哈希计数、目标匹配、掩码、摘要及运行时配置等信息,为数据质量验证提供了完备的元数据支持。值得注意的是,大型的verified_exact_nonoverlap溯源树被有意排除,以平衡数据完整性与存储效率。这种设计使得数据集在保持高纯净度的同时,兼顾了实用性与可扩展性。
使用方法
使用时,用户可直接从各语料库的clean目录中读取压缩的JSONL分片文件,每行对应一条已过滤的数据记录。为复现过滤流程或验证数据纯度,可参考POLICY.txt中的策略描述和POLICY_SUMMARY.json中的统计摘要。审计目录中的哈希与掩码数据可用于自定义验证,例如核对特定n-gram的移除情况。建议用户根据任务需求选择对应语料库,例如指令微调任务可优先使用mv2_synthetic,而预训练数据增强则可选用mv2_meta_active或mv1_5子集。
背景与挑战
背景概述
MV2 Decontaminated Collection 是一个专注于数据去污染(decontamination)的多语料库集合,由研究团队在2024年左右创建,旨在解决大语言模型训练数据中常见的数据泄露问题。该数据集的核心研究问题是:如何有效识别并移除与评估集过度重叠的文本片段,以确保模型评估的公平性。通过整合MixtureVitae v2、MixtureVitae v1.5及FinePhrase等多个语料库,该数据集为数据去污染方法提供了标准化的测试基准,在自然语言处理领域推动了关于训练数据清洁度与模型泛化能力的深入讨论。
当前挑战
该数据集致力于应对数据污染带来的领域挑战:训练数据中无意包含的评估集内容会使模型在基准测试中获得虚高分数,掩盖真实能力。其在构建过程中面临的关键挑战包括:设计去污染政策(如ordinary-evaldf-lt5-masks-v2策略)时需平衡敏感度与特异度,避免误删有效数据;处理高维度的n-gram匹配计算,确保在大规模语料中高效检测评估集内容;审计环节需记录哈希计数、掩码等详细元数据,同时排除过大的确证非重叠树,以维持存储和计算可行性。
常用场景
经典使用场景
MV2 Decontaminated Collection作为经过严格去污染处理的高质量语料库,其经典使用场景集中在自然语言处理领域的预训练与微调环节。该数据集通过移除与下游评价指标存在潜在重叠的文本片段,确保模型在训练过程中不会因数据泄露而产生虚假的性能提升。研究者在构建大规模语言模型时,常将其视为核心训练数据源,以验证模型在无污染环境下的真实泛化能力。此外,该集合中涵盖的合成指令数据与主动阅读语料,为监督式指令微调和领域自适应提供了可靠的基准素材,尤其适用于需要高纯度训练信号的学术对比实验。
解决学术问题
该数据集有效解决了自然语言处理研究中因训练数据与测试数据重叠而导致的评估失真问题。传统语料库常因混入评价集中出现的N元组,使得模型在标准基准上表现出虚高的成绩,从而掩盖了其真实的学习能力。MV2 Decontaminated Collection通过基于去重哈希和覆盖率阈值的过滤策略,系统性清除了此类污染源,为学术社区提供了可复现且可信赖的评估环境。这一举措显著提升了研究结论的稳健性,使得针对模型容量、训练策略及架构创新的比较更加公平,推动了语言模型评估范式的规范化演进。
衍生相关工作
基于MV2 Decontaminated Collection的研究工作主要围绕数据去污染方法论展开,衍生出了若干经典成果。例如,研究者提出了基于评估集N元组动态掩码的在线污染检测框架,并将其应用于多语言语料库的清洗流水线。此外,该集合中的过滤策略被借鉴用于构建开放域知识蒸馏中的教师模型训练数据,形成了‘污染感知预训练’这一研究方向。部分工作还将其与差分隐私技术结合,开发出在保证数据效用前提下增强隐私保护的混合式去重算法,进一步拓展了该数据集在安全敏感型AI系统中的应用边界。
以上内容由遇见数据集搜集并总结生成



