遇见数据集

complexity-atlas-posttrain

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Complexity Atlas Posttrain — Semantic Card Corpus V2 是一个英文监督微调语料库,旨在通过语义框架和独立组件生成高质量的训练数据。数据集包含15个行为家族,包括因果对话、推理验证、解释学习、计划比较、故障排除、批判修正等,以及10,000个多轮上下文示例。所有样本均经过语义框架一致性、兼容性图有效性、上下文历史依赖、正确性、语法、重复性、碰撞、响应长度以及零泄漏等八项全局审计和15个家族路线图认证。数据规模为206,090个样本,其中训练集201,983个、验证集2,350个、测试集1,757个。每个样本包含输入序列、标签和元数据,支持基于损失权重的全分片训练策略,以平衡不同行为家族的贡献。数据集适用于文本生成和问答任务,特别是推理和对话场景的微调。

Complexity Atlas Posttrain — Semantic Card Corpus V2 is an English supervised fine-tuning corpus designed to generate high-quality training data through semantic frameworks and independent components. The dataset includes 15 behavior families, such as causal dialogue, reasoning verification, explanation learning, plan comparison, troubleshooting, critique correction, etc., and 10,000 multi-turn context examples. All samples have undergone eight global audits (semantic framework consistency, compatibility graph validity, context history dependency, correctness, grammar, repetition, collision, response length, and zero leakage) and 15 family roadmap certifications. The data scale is 206,090 samples, with 201,983 in training, 2,350 in validation, and 1,757 in test sets. Each sample contains input sequence, label, and metadata, supporting a loss-weighted full-shard training strategy to balance contributions from different behavior families. The dataset is suitable for text generation and question answering tasks, especially for fine-tuning in reasoning and dialogue scenarios.

创建时间:
2026-08-01
原始信息汇总

Complexity Atlas Posttrain — Card Corpus V2 数据集概述

基本信息

  • 语言:英语(en)
  • 许可证:CC BY-NC 4.0(非商业用途)
  • 任务类型:文本生成、问答
  • 标签:SFT、对话、推理、VariableBy2D、仅助手损失
  • 数据格式:Parquet 文件,包含 train、validation、test 三个分割

数据规模

分割 样本数
训练集 224,654
验证集 2,478
测试集 1,894
总计 229,026

任务家族分布

数据集涵盖 15 个任务家族,其中主要分布如下:

家族 样本数
reasoning_verification 108,000
casual_conversation 52,794
explanation_learning 36,040
context_clarification 9,216
grounded_qa 4,608
summarization_synthesis 4,096
writing_transformation 4,096
extraction_classification 3,456
safety_uncertainty 3,072
conversation_empathy 2,048

其余家族(创意头脑风暴、批评修订、规划比较、实际操作、故障排除)各包含 64–384 个样本。此外,casual 家族包含 11,000 个多轮对话样本。

能力覆盖

  • 直接安全(16 个领域,3,077 个样本)
  • 小规模算术(4 个领域,16,101 个样本)
  • 摘要生成、写作转换(各 8 个领域,4,096 个样本)
  • 多约束遵循(4 个领域,4,000 个样本)
  • 概念定义、通用事实、反思性对话、中性问候等

训练响应长度分布(训练集)

  • 直接回答(1–25 词):76.05%
  • 简洁回答(26–80 词):13.20%
  • 详细回答(81–200 词):5.60%
  • 扩展回答(201–512 词):5.16%

Tokenized 32K 训练分片

已发布框架就绪的分片(tokenized/32k-v2/):

分割 样本数 Token 数 监督助手 Token 数
训练集 224,654 28,944,057 18,538,127
验证集 2,478 319,114 212,661
测试集 1,894 303,419 210,617
总计 229,026 29,566,590 18,961,405

每个分片包含 input_ids.binlabels.binexamples.jsonlloss_metadata.jsonlsft.idx.json 文件。上下文位置使用 -100 忽略索引,仅监督最终助手 token 与 EOS。词汇表大小为 32,000,聊天契约为 complexity-chat-v2

二维全分片加权机制

  • 数据集不进行重采样,每行每 epoch 仅出现一次
  • 每个示例映射到行为组和 task × domain 单元格,计算全局目标权重与损失权重
  • 加权交叉熵按可见加权 token 质量归一化,平衡梯度贡献
  • 超过安全限制的系数会被拒绝而非静默应用

质量认证

该数据集已通过完整 V2 发布契约验证:

  • 通过行为、能力覆盖、完整性、分布、组合、近似重复、响应长度和分割泄漏检查
  • 通过 tokenizer 往返、仅最终助手损失掩码、think/final 标记检查
  • 15 个任务家族路线图全部标记为 PASS
  • 训练/验证/测试之间无精确或规范化组合泄漏

机器可读证据包含在 metadata/manifest.jsonmetadata/audit.jsonmetadata/roadmap.json 中。

来源与生成

  • 由开源项目 Complexity-ML/complexity-card-corpus V2 流水线生成,提交版本为 6aaf71c
  • 生成自语义框架、角色分离的提示/回答/思考计划、兼容性图谱和 VariableBy2D 储备库
  • 数据集以 CC BY-NC 4.0 许可证发布,商业使用前需审阅许可证条款
搜集汇总
数据集介绍
complexity-atlas-posttrain 数据集图片
构建方式
该数据集由开源Complexity-ML/complexity-card-corpus V2流水线生成,基于语义框架、角色分离的提示/答案/思维计划、兼容性图及VariableBy2D储备库,构建了覆盖15个任务族、共计229,026个样本的英文监督微调语料。生成器渲染所有注册的有效场景组合,不设全局采样配额或族级截断,确保数据完整性与多样性。数据划分包含训练集224,654例、验证集2,478例与测试集1,894例,经严格审计,无分层泄漏。
特点
数据集特色在于其全面的行为覆盖与精细的监督机制。涵盖直接安全、小算术、摘要、写作转换、多约束遵循等九项能力,并包含11,000个依赖历史的多轮对话样本,前轮助手回复被掩码,仅监督最终回复。采用'assistant-only-loss'掩码,确保训练信号聚焦。此外,数据集提供两维全分片加权方案,在保持原始行频的同时平衡梯度贡献,并配有tokenized 32K训练分片,附有完整元数据与审计证据,满足严格的发布合同要求。
使用方法
使用方法上,用户可直接加载HuggingFace仓库中的parquet分片(train/validation/test),或使用预tokenized的32K分片(input_ids.bin、labels.bin等)进行高效训练。训练框架需基于提供的loss_metadata.jsonl解析每个样本的任务与领域,按两维加权公式计算loss权重,并实施最终助手令牌监督。项目提供SFT.idx.json验证数据完整性。数据集遵循CC BY-NC 4.0许可证,商业用途需谨慎评估。
背景与挑战
背景概述
该数据集名为Complexity Atlas Posttrain — Card Corpus V2,由Complexity-ML团队于近期发布,旨在为大型语言模型的监督微调提供高质量、结构化的英文语料。其核心研究问题在于如何通过语义框架、角色分离的提示/答案/思考计划及兼容性图生成多样化的训练数据,以覆盖15种任务族,包括自然对话、推理验证、创意头脑风暴等。数据集包含229,026个样本,严格遵循行为覆盖与完整性验证,确保模型能力的可学习性。其影响力体现在为后训练阶段提供了精细控制数据分布与损失权重的范式,推动了复杂任务指令跟随与安全性的提升。
当前挑战
该数据集所解决的领域问题在于后训练阶段数据稀缺与分布失衡,尤其是多任务对话与推理能力的泛化难题。构建中面临多项挑战:需在保持语义多样性的同时避免样本重复与泄漏,通过近重复检测和分割泄漏门控确保训练/验证/测试的独立性;应对多轮对话中历史依赖的掩码监督,仅对最终助手回复计算损失;实现二维权重平衡以调整梯度贡献,却需拒绝超出安全限制的系数;最终通过tokenizer往返与标记检查,确保与32K词表兼容及损失掩码正确。这些挑战的克服彰显了数据集在严谨性与实用性上的双重追求。
常用场景
经典使用场景
该数据集作为监督微调语料库,在自然语言处理领域具有广泛的应用前景,尤其适用于大语言模型的指令微调与对话生成任务。其包含的15个任务家族,涵盖创意头脑风暴、因果对话、共情交流、批判性修订、解释学习、信息抽取分类、基于事实的问答、规划比较、实践行动、推理验证、安全不确定性、摘要生成、故障排除与写作转换等多元场景,为模型提供了丰富的语义框架与角色分离的提示/答案/思考计划。此外,数据集中特有的VariableBy2D机制和兼容性图谱设计,使得模型在复杂多轮对话和跨域推理中能够更好地捕捉上下文依赖与逻辑一致性,从而提升生成内容的准确性与连贯性。
衍生相关工作
该数据集衍生了一系列杰出的研究与实践工作。基于其双重维度加权训练框架,研究者开发了新型的损失调制策略,应用于多任务学习中以优化梯度平衡;其tokenized 32K分片格式启发了高效预训练数据流水线的设计,推动了大规模并行训练中数据加载与内存管理的改进。此外,数据集中历史依赖多轮对话的掩码机制,借鉴并扩展了因果语言建模中的监督掩码技术,衍生出针对对话状态跟踪与长程上下文建模的改进模型。其行为覆盖认证契约也被多个基准测试采纳,成为评估数据质量与模型能力对齐的参照标准,促进了公正、可比的模型评估体系的发展。
数据集最近研究
最新研究方向
该数据集聚焦于大规模监督微调语料的精细化构建与多维行为覆盖,其最新研究方向集中于通过结构化语义框架和二维加权机制,实现训练数据在推理、安全、对话等多任务族上的均衡与可控。具体而言,研究热点包括利用自动化生成管道合成高质量指令数据,并通过行为分组与任务-领域交叉加权,优化模型在复杂推理、上下文遵循及安全对齐方面的性能。该数据集的发布与CC BY-NC 4.0许可下的开放,为领域内构建可审计、可复现的指令微调基准提供了新范式,对推动大语言模型在对话智能和鲁棒性方面的前沿探索具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务