control-pretraining-datasets-smoke
收藏资源简介:
该数据集是一个多配置的文本生成与事实一致性评估数据集,包含多个子集(config),每个子集针对不同的任务或模型变体。数据由合成模型生成,包含种子文本(seed_text)、草稿文本(text_draft)和最终文本(text),以及文本来源、来源标识、块索引、子类型、子类型家族等元信息。此外,还提供了丰富的评估指标,如唯一n-gram比率(uniq_ngram_ratio)、最大段Jaccard相似度(max_segment_jaccard)、种子词召回率(seed_term_recall)、逗号密度(comma_density)、句末密度(sentence_end_density)、事实召回率(fact_recall)、草稿事实召回率(draft_fact_recall)、覆盖判定(coverage_verdicts)等,并包含声明追踪、草稿追踪、改写追踪、最终判决追踪等过程记录。另有两个配置(doc-types-natural、paraphrase-modes)提供文档类型和改写模式的描述与关键词。数据集适用于文本改写、抽象摘要、事实一致性评估、可控文本生成等研究任务。整体样本规模较小,各子集样本数从2到7351不等。
This dataset is a multi-configuration text generation and fact consistency evaluation dataset, containing multiple subsets (configs), each targeting different tasks or model variants. The data is generated by synthetic models and includes seed text, draft text, and final text, along with metadata such as text source, source identifier, block index, subtype, and subtype family. Additionally, it provides a rich set of evaluation metrics, including unique n-gram ratio, max segment Jaccard similarity, seed term recall, comma density, sentence end density, fact recall, draft fact recall, coverage verdicts, etc., and includes process records such as claim tracking, draft tracking, rewrite tracking, and final verdict tracking. Two configurations (doc-types-natural, paraphrase-modes) provide descriptions and keywords for document types and paraphrase modes. The dataset is suitable for research tasks such as text rewriting, abstractive summarization, fact consistency evaluation, and controllable text generation. The overall sample size is small, with each subset containing between 2 and 7,351 samples.
数据集:control-pretraining-datasets-smoke
数据集简介
该数据集由 geodesic-research 发布,是一个用于控制预训练(Control Pretraining)研究的数据集,包含多种配置(config),每种配置代表不同的数据处理方式或实验设置。数据集主要包含文本重写(rewrite)、文本生成(draft)以及相关评估指标,适用于研究可控文本生成、事实一致性、文本多样性等任务。
数据集配置
数据集包含 16 个配置:
| 配置名称 | 样本数 | 数据量 (bytes) | 特点 |
|---|---|---|---|
| abarm-nemotron120b-ctrl | 17 | 1,654,339 | 含控制变量,带有完整评估 trace |
| abarm-nemotron120b-mtp | 19 | 1,877,566 | 含控制变量,带有多轮 trace |
| arm_a1 | 7,351 | 199,608,524 | 最大配置,无claims字段 |
| arm_rec_0267fc7b | 6 | 38,002 | 小型配置 |
| arm_rec_0c55da14 | 3 | 37,317 | 最小配置 |
| arm_rec_26fca078 | 21 | 431,603 | 含事实评估字段 |
| arm_rec_2719b890 | 9 | 140,470 | 含事实评估字段 |
| arm_rec_45960b61 | 20 | 445,485 | 含事实评估字段 |
| arm_rec_61253cad | 15 | 302,841 | 含事实评估字段 |
| arm_rec_77712453 | 2 | 33,756 | 不含subtype_family |
| arm_rec_c2dffead | 9 | 140,470 | 不含subtype_family |
| arm_rec_edd7f8e5 | 5 | 61,874 | 不含subtype_family |
| doc-types-natural | 100 | 44,811 | 文档类型定义,无文本内容 |
| modelarm-nemotron120b | 23 | 2,266,725 | 含完整评估trace字段 |
| modelarm-nemotron120b-mtp | 22 | 2,207,500 | 含完整评估trace字段 |
| paraphrase-modes | 10 | 5,300 | 释义模式定义,无文本内容 |
总计下载大小:约 115 MB;总计数据集大小:约 209 MB;总样本数:7,632 个。
数据字段说明
通用字段(几乎所有配置包含)
- text (string):处理后的文本内容
- text_draft (string):模型生成的草稿文本
- seed_text (string):种子文本,用于生成参考
- source / seed_source (string):数据来源标识
- source_id / seed_key (string):来源唯一标识
- chunk_index (int64):文本分块索引
- subtype / subtype_id / subtype_family (string/int64):数据子类型信息
- num_tokens / draft_num_tokens (int64):文本与草稿的 token 数
- uniq_ngram_ratio (float64):n-gram 唯一性比率
- max_segment_jaccard (float64):最大分段 Jaccard 相似度
- seed_term_recall (float64):种子词召回率
- comma_density / sentence_end_density (float64):标点密度指标
- universe_sha256 (string):数据集的 SHA256 哈希
- synth_model (string):用于生成的模型名称
- id (string):唯一标识符
高级字段(部分配置包含)
- source_claims / coverage_verdicts (string):来源声明与覆盖判定
- fact_recall / draft_fact_recall (float64):事实召回率
- draft_coverage_verdicts (string):草稿覆盖判定
- claims_trace / draft_trace / draft_judge_trace / rewrite_trace / final_judge_trace (string):各阶段处理追踪信息
特殊配置字段
- doc-types-natural 和 paraphrase-modes:包含 name(名称)、description(描述)、keywords(关键词列表)、synth_seed(生成种子)等字段,用于定义文档类型与释义模式。
数据集特点
- 多配置设计:覆盖不同数据处理流程(如 abarm、arm、modelarm 系列),支持多种实验对比。
- 控制变量实验:abarm 与 modelarm 系列配置用于控制预训练实验。
- 丰富的评估信息:高级配置包含事实召回率、覆盖判定等评估指标,以及处理过程的完整 trace。
- 小型烟雾测试集:整体为小型数据集,适合测试数据管道或进行小规模实验验证。




