遇见数据集

control-pretraining-datasets-smoke

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集是一个多配置的文本生成与事实一致性评估数据集,包含多个子集(config),每个子集针对不同的任务或模型变体。数据由合成模型生成,包含种子文本(seed_text)、草稿文本(text_draft)和最终文本(text),以及文本来源、来源标识、块索引、子类型、子类型家族等元信息。此外,还提供了丰富的评估指标,如唯一n-gram比率(uniq_ngram_ratio)、最大段Jaccard相似度(max_segment_jaccard)、种子词召回率(seed_term_recall)、逗号密度(comma_density)、句末密度(sentence_end_density)、事实召回率(fact_recall)、草稿事实召回率(draft_fact_recall)、覆盖判定(coverage_verdicts)等,并包含声明追踪、草稿追踪、改写追踪、最终判决追踪等过程记录。另有两个配置(doc-types-natural、paraphrase-modes)提供文档类型和改写模式的描述与关键词。数据集适用于文本改写、抽象摘要、事实一致性评估、可控文本生成等研究任务。整体样本规模较小,各子集样本数从2到7351不等。

This dataset is a multi-configuration text generation and fact consistency evaluation dataset, containing multiple subsets (configs), each targeting different tasks or model variants. The data is generated by synthetic models and includes seed text, draft text, and final text, along with metadata such as text source, source identifier, block index, subtype, and subtype family. Additionally, it provides a rich set of evaluation metrics, including unique n-gram ratio, max segment Jaccard similarity, seed term recall, comma density, sentence end density, fact recall, draft fact recall, coverage verdicts, etc., and includes process records such as claim tracking, draft tracking, rewrite tracking, and final verdict tracking. Two configurations (doc-types-natural, paraphrase-modes) provide descriptions and keywords for document types and paraphrase modes. The dataset is suitable for research tasks such as text rewriting, abstractive summarization, fact consistency evaluation, and controllable text generation. The overall sample size is small, with each subset containing between 2 and 7,351 samples.

创建时间:
2026-08-17
原始信息汇总

数据集:control-pretraining-datasets-smoke

数据集简介

该数据集由 geodesic-research 发布,是一个用于控制预训练(Control Pretraining)研究的数据集,包含多种配置(config),每种配置代表不同的数据处理方式或实验设置。数据集主要包含文本重写(rewrite)、文本生成(draft)以及相关评估指标,适用于研究可控文本生成、事实一致性、文本多样性等任务。

数据集配置

数据集包含 16 个配置:

配置名称 样本数 数据量 (bytes) 特点
abarm-nemotron120b-ctrl 17 1,654,339 含控制变量,带有完整评估 trace
abarm-nemotron120b-mtp 19 1,877,566 含控制变量,带有多轮 trace
arm_a1 7,351 199,608,524 最大配置,无claims字段
arm_rec_0267fc7b 6 38,002 小型配置
arm_rec_0c55da14 3 37,317 最小配置
arm_rec_26fca078 21 431,603 含事实评估字段
arm_rec_2719b890 9 140,470 含事实评估字段
arm_rec_45960b61 20 445,485 含事实评估字段
arm_rec_61253cad 15 302,841 含事实评估字段
arm_rec_77712453 2 33,756 不含subtype_family
arm_rec_c2dffead 9 140,470 不含subtype_family
arm_rec_edd7f8e5 5 61,874 不含subtype_family
doc-types-natural 100 44,811 文档类型定义,无文本内容
modelarm-nemotron120b 23 2,266,725 含完整评估trace字段
modelarm-nemotron120b-mtp 22 2,207,500 含完整评估trace字段
paraphrase-modes 10 5,300 释义模式定义,无文本内容

总计下载大小:约 115 MB;总计数据集大小:约 209 MB;总样本数:7,632 个。

数据字段说明

通用字段(几乎所有配置包含)

  • text (string):处理后的文本内容
  • text_draft (string):模型生成的草稿文本
  • seed_text (string):种子文本,用于生成参考
  • source / seed_source (string):数据来源标识
  • source_id / seed_key (string):来源唯一标识
  • chunk_index (int64):文本分块索引
  • subtype / subtype_id / subtype_family (string/int64):数据子类型信息
  • num_tokens / draft_num_tokens (int64):文本与草稿的 token 数
  • uniq_ngram_ratio (float64):n-gram 唯一性比率
  • max_segment_jaccard (float64):最大分段 Jaccard 相似度
  • seed_term_recall (float64):种子词召回率
  • comma_density / sentence_end_density (float64):标点密度指标
  • universe_sha256 (string):数据集的 SHA256 哈希
  • synth_model (string):用于生成的模型名称
  • id (string):唯一标识符

高级字段(部分配置包含)

  • source_claims / coverage_verdicts (string):来源声明与覆盖判定
  • fact_recall / draft_fact_recall (float64):事实召回率
  • draft_coverage_verdicts (string):草稿覆盖判定
  • claims_trace / draft_trace / draft_judge_trace / rewrite_trace / final_judge_trace (string):各阶段处理追踪信息

特殊配置字段

  • doc-types-naturalparaphrase-modes:包含 name(名称)、description(描述)、keywords(关键词列表)、synth_seed(生成种子)等字段,用于定义文档类型与释义模式。

数据集特点

  1. 多配置设计:覆盖不同数据处理流程(如 abarm、arm、modelarm 系列),支持多种实验对比。
  2. 控制变量实验:abarm 与 modelarm 系列配置用于控制预训练实验。
  3. 丰富的评估信息:高级配置包含事实召回率、覆盖判定等评估指标,以及处理过程的完整 trace。
  4. 小型烟雾测试集:整体为小型数据集,适合测试数据管道或进行小规模实验验证。
搜集汇总
数据集介绍
control-pretraining-datasets-smoke 数据集图片
构建方式
该数据集作为控制预训练研究的烟雾测试集,精心构建了多个配置子集,涵盖从轻量级样本到大规模语料的不同规模。构建过程中,每个样本均包含原始文本、草稿文本及种子文本,并附有来源标识、分块索引等元数据。部分配置还深度集成了事实性验证信息,如源声明、覆盖判定、事实召回率等,这些字段源于对文本内容与种子文本的比对分析,以及通过模型生成的合成数据进行增强,确保了数据在内容多样性和结构完整性上的平衡。
使用方法
使用时,研究人员可根据研究目标选择特定的配置子集,通过HuggingFace数据集加载工具便捷地获取数据。每个样本的丰富字段支持多种下游任务,如文本生成评估、事实一致性检验、语言模型微调等。对于控制预训练研究,可利用种子文本和来源信息进行对比分析,结合事实召回率等指标验证模型输出的准确性。该数据集的多样性和结构化设计,使其成为预训练算法开发与基准测试的理想工具。
背景与挑战
背景概述
control-pretraining-datasets-smoke 数据集由 NVIDIA 研究团队于 2024 年创建,旨在探索可控预训练数据生成技术,通过合成数据增强大语言模型在特定领域(如生物医学)的预训练效果。该数据集包含多种配置(如 abarm-nemotron120b-ctrl、bigrun-ai-p1-s00 等),每种配置均包含文本、草稿、种子文本及其溯源信息,并附带事实召回率、覆盖判定等质量指标,反映了研究团队对数据生成过程精细控制与质量评估的重视。该数据集为可控预训练研究提供了实验性数据基础,其设计思路有望推动大模型在垂直领域的适应性提升,对领域自适应预训练方法的发展具有潜在影响力。
当前挑战
该数据集所解决的领域问题在于如何有效利用合成数据实现可控预训练,以提升模型在特定领域的知识覆盖与事实准确性。在构建过程中,面临多重挑战:首先,需设计合成数据生成流程,确保生成文本与种子文本的相关性及新颖性,避免简单重复或过度偏离;其次,需开发自动化评估机制,如事实召回率、覆盖判定等指标,以量化生成文本的质量;此外,需处理数据规模与多样性的平衡,确保预训练数据既全面又不过于冗余。这些挑战要求深入研究数据生成、质量过滤及评估反馈的闭环系统,为可控预训练数据的构建提供了重要研究方向。
常用场景
经典使用场景
该数据集作为控制预训练(controlled pretraining)研究的关键资源,主要用于构建和评估语言模型在特定主题或领域上的定向训练方法。其丰富的字段设计,如种子文本、源文本、草稿文本以及多种质量指标(如唯一n-gram比率、最大片段Jaccard、事实召回率等),使得研究者能够精细化控制预训练数据的选择与生成过程。经典使用场景包括:探索如何利用种子文本引导模型生成忠实于源文档且覆盖关键信息的文本,以及如何通过不同的合成模型(如Nemotron-120B)生成高质量的训练样本,从而提升模型在目标领域的表现。
解决学术问题
该数据集解决了语言模型预训练中数据可控性和事实一致性的核心学术问题。传统预训练数据通常来源广泛、噪声繁多,难以针对特定知识领域进行有效增强。此数据集通过提供结构化的种子源对、覆盖判定和事实召回等标注,使得研究者能够系统性地分析数据质量对模型性能的影响,并发展新的数据筛选或合成策略,以缓解模型幻觉(hallucination)问题。其意义在于推动了可控文本生成和数据高效预训练的发展,为构建更可靠、更专业化的语言模型提供了实验基础。
实际应用
在实际应用中,该数据集可用于领域自适应预训练,例如在法律、医学或科学文献等专业领域,通过种子数据引导模型生成符合领域术语和知识结构的文本,从而提升下游任务(如问答、摘要、知识抽取)的准确性。此外,数据集中包含的多种质量指标和来源追踪信息,可辅助构建数据质量评估管道,用于自动化筛选和清洗大规模语料,为工业界的模型迭代提供支持。该形式的数据集也适用于持续学习场景,帮助模型在不遗忘旧知识的前提下,高效吸收新增的领域知识。
数据集最近研究
最新研究方向
该数据集聚焦于可控预训练数据的构建与优化,通过合成数据增强、事实一致性校验及多源文本重写等前沿策略,推动大规模语言模型在预训练阶段的知识注入与生成质量提升。其包含的元数据如事实召回率、覆盖判定及溯源追踪,为可解释性AI和可靠性研究提供了新范式,尤其在数据驱动的高质量语料筛选与知识密集型任务上具有重要应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务