complexity-atlas-posttrain
收藏资源简介:
Complexity Atlas Posttrain — Semantic Card Corpus V2 是一个英文监督微调语料库,旨在通过语义框架和独立组件生成高质量的训练数据。数据集包含15个行为家族,包括因果对话、推理验证、解释学习、计划比较、故障排除、批判修正等,以及10,000个多轮上下文示例。所有样本均经过语义框架一致性、兼容性图有效性、上下文历史依赖、正确性、语法、重复性、碰撞、响应长度以及零泄漏等八项全局审计和15个家族路线图认证。数据规模为206,090个样本,其中训练集201,983个、验证集2,350个、测试集1,757个。每个样本包含输入序列、标签和元数据,支持基于损失权重的全分片训练策略,以平衡不同行为家族的贡献。数据集适用于文本生成和问答任务,特别是推理和对话场景的微调。
Complexity Atlas Posttrain — Semantic Card Corpus V2 is an English supervised fine-tuning corpus designed to generate high-quality training data through semantic frameworks and independent components. The dataset includes 15 behavior families, such as causal dialogue, reasoning verification, explanation learning, plan comparison, troubleshooting, critique correction, etc., and 10,000 multi-turn context examples. All samples have undergone eight global audits (semantic framework consistency, compatibility graph validity, context history dependency, correctness, grammar, repetition, collision, response length, and zero leakage) and 15 family roadmap certifications. The data scale is 206,090 samples, with 201,983 in training, 2,350 in validation, and 1,757 in test sets. Each sample contains input sequence, label, and metadata, supporting a loss-weighted full-shard training strategy to balance contributions from different behavior families. The dataset is suitable for text generation and question answering tasks, especially for fine-tuning in reasoning and dialogue scenarios.
Complexity Atlas Posttrain — Card Corpus V2 数据集概述
基本信息
- 语言:英语(en)
- 许可证:CC BY-NC 4.0(非商业用途)
- 任务类型:文本生成、问答
- 标签:SFT、对话、推理、VariableBy2D、仅助手损失
- 数据格式:Parquet 文件,包含 train、validation、test 三个分割
数据规模
| 分割 | 样本数 |
|---|---|
| 训练集 | 224,654 |
| 验证集 | 2,478 |
| 测试集 | 1,894 |
| 总计 | 229,026 |
任务家族分布
数据集涵盖 15 个任务家族,其中主要分布如下:
| 家族 | 样本数 |
|---|---|
reasoning_verification |
108,000 |
casual_conversation |
52,794 |
explanation_learning |
36,040 |
context_clarification |
9,216 |
grounded_qa |
4,608 |
summarization_synthesis |
4,096 |
writing_transformation |
4,096 |
extraction_classification |
3,456 |
safety_uncertainty |
3,072 |
conversation_empathy |
2,048 |
其余家族(创意头脑风暴、批评修订、规划比较、实际操作、故障排除)各包含 64–384 个样本。此外,casual 家族包含 11,000 个多轮对话样本。
能力覆盖
- 直接安全(16 个领域,3,077 个样本)
- 小规模算术(4 个领域,16,101 个样本)
- 摘要生成、写作转换(各 8 个领域,4,096 个样本)
- 多约束遵循(4 个领域,4,000 个样本)
- 概念定义、通用事实、反思性对话、中性问候等
训练响应长度分布(训练集)
- 直接回答(1–25 词):76.05%
- 简洁回答(26–80 词):13.20%
- 详细回答(81–200 词):5.60%
- 扩展回答(201–512 词):5.16%
Tokenized 32K 训练分片
已发布框架就绪的分片(tokenized/32k-v2/):
| 分割 | 样本数 | Token 数 | 监督助手 Token 数 |
|---|---|---|---|
| 训练集 | 224,654 | 28,944,057 | 18,538,127 |
| 验证集 | 2,478 | 319,114 | 212,661 |
| 测试集 | 1,894 | 303,419 | 210,617 |
| 总计 | 229,026 | 29,566,590 | 18,961,405 |
每个分片包含 input_ids.bin、labels.bin、examples.jsonl、loss_metadata.jsonl 和 sft.idx.json 文件。上下文位置使用 -100 忽略索引,仅监督最终助手 token 与 EOS。词汇表大小为 32,000,聊天契约为 complexity-chat-v2。
二维全分片加权机制
- 数据集不进行重采样,每行每 epoch 仅出现一次
- 每个示例映射到行为组和
task × domain单元格,计算全局目标权重与损失权重 - 加权交叉熵按可见加权 token 质量归一化,平衡梯度贡献
- 超过安全限制的系数会被拒绝而非静默应用
质量认证
该数据集已通过完整 V2 发布契约验证:
- 通过行为、能力覆盖、完整性、分布、组合、近似重复、响应长度和分割泄漏检查
- 通过 tokenizer 往返、仅最终助手损失掩码、think/final 标记检查
- 15 个任务家族路线图全部标记为
PASS - 训练/验证/测试之间无精确或规范化组合泄漏
机器可读证据包含在 metadata/manifest.json、metadata/audit.json 和 metadata/roadmap.json 中。
来源与生成
- 由开源项目 Complexity-ML/complexity-card-corpus V2 流水线生成,提交版本为
6aaf71c - 生成自语义框架、角色分离的提示/回答/思考计划、兼容性图谱和
VariableBy2D储备库 - 数据集以 CC BY-NC 4.0 许可证发布,商业使用前需审阅许可证条款




