Blue-Teaming-Opencode-Corpus-v1.0
收藏资源简介:
Blue-Teaming OpenCode and General Pretraining Corpus v1.0 是一个面向英语和代码的合成预训练语料库,旨在支持在本地设备(如GeForce RTX 3060)上预训练一个约1亿参数的小型语言模型,并用于防御性网络安全和OpenCode智能体场景。数据集包含约1471万文档,总近似token数约40亿,由两个近似等token数的子集组成:蓝队/OpenCode部分(约620万文档,20亿token)和通用英语/代码部分(约850万文档,20亿token)。所有文档均无重复ID。数据格式为JSONL,每行一个文档,包含id、domain、doc_type、text、language、license、source、quality、tokens_approx、pipeline_version等公共字段,以及meta、safety、opencode等可选字段。蓝队领域使用D1-D8标识,通用领域使用E1(英语)、E2(代码)、E3(文档)、E4(讨论)、E5(指令)标识。推荐使用流式加载,并基于稳定的id字段进行训练/验证集划分。数据集附有manifest.json、checksums.sha256等完整性文件。该数据集主要用于语言模型预训练和防御性网络安全研究,但需注意其合成性质可能导致模板重复、生成伪影、不准确陈述等问题,使用前应评估事实准确性、记忆风险、安全行为等。
Blue-Teaming OpenCode and General Pretraining Corpus v1.0 is a synthetic pretraining corpus for English and code, designed to support pretraining a small language model of about 100 million parameters on local devices (e.g., GeForce RTX 3060) for defensive cybersecurity and OpenCode agent scenarios. The dataset contains approximately 14.71 million documents with a total of about 4 billion approximate tokens, consisting of two roughly equal-token subsets: the Blue Team/OpenCode part (about 6.2 million documents, 2 billion tokens) and the General English/Code part (about 8.5 million documents, 2 billion tokens). All documents have unique IDs. The data format is JSONL, with each line representing a document containing common fields such as id, domain, doc_type, text, language, license, source, quality, tokens_approx, pipeline_version, and optional fields like meta, safety, opencode. Blue team domains are identified by D1-D8, while general domains use E1 (English), E2 (Code), E3 (Documentation), E4 (Discussion), E5 (Instructions). Streaming loading is recommended, and training/validation splits should be based on the stable id field. The dataset includes integrity files such as manifest.json and checksums.sha256. It is primarily used for language model pretraining and defensive cybersecurity research, but users should be aware of its synthetic nature, which may lead to template repetition, generation artifacts, inaccurate statements, etc. Prior to use, factual accuracy, memorization risks, and safety behaviors should be evaluated.
数据集概述:Blue-Teaming OpenCode Corpus — Cleaned v3
该数据集是面向网络安全蓝队(Blue-Teaming)领域的代码文本语料库,用于文本生成任务,适用于数据管道、训练循环、检查点、评估和部署等流程的练习。
数据集规模(诚实统计)
- 审计源文档数量:14,711,418
- 审计源文档近似Token数:约 40 亿(3,999,998,603)
- 保留文档数量:4,125
- 保留文档的上游估算Token数:1,234,732
- 项目SentencePiece分词器下的精确Token数:1,640,536
- 训练集(train):1,611,503 Token
- 验证集(validation):29,033 Token
- 数据分片:6个Gzip压缩的JSONL分片
重要提示:该数据集规模远不足以训练出一个有用的1亿参数基础模型,仅适合作为流程验证用途。
数据清洗与质量控制
- 采用标识符感知的归一化精确去重。
- 移除了重复的合成/系统提示词前缀。
- 使用32词内容块,并设定80%的最低新颖度阈值。
- 训练/验证集按内容族(content-family)隔离划分,避免数据泄漏。
- 移除了 14,535,233 个归一化模板重复项。
- 移除了 172,060 个低新颖度变体。
- 训练集内部64-token重复率:1.8270%
- 验证集内部64-token重复率:0.0000%
- 训练集到验证集的64-token重叠率:0.0953%
数据加载与格式
可以使用 Hugging Face datasets 库直接加载:
python from datasets import load_dataset
dataset = load_dataset("beau-warren/Blue-Teaming-Opencode-Corpus-v1.0") train = dataset["train"] validation = dataset["validation"]
- 每个JSONL行对应一篇文档。
- 使用时需对非空的
text字段进行分词,并在文档之间添加EOS(结束符)标记。 - 可选元数据字段因数据生成器而异。
数据完整性文件
仓库中附带以下完整性校验与报告文件:
| 文件名 | 用途 |
|---|---|
manifest.json |
修正后的计数、清洗配置、数据划分及审计信息 |
train_shards.jsonl |
分片级别的来源、划分、计数及SHA-256校验值 |
checksums.sha256 |
压缩分片的哈希值 |
uncompressed_checksums.sha256 |
解压后JSONL文件的哈希值 |
data_quality_report.json |
Token块重复率与泄漏对比报告 |
datasheet.md |
简要数据说明文档 |
版本说明
- 当前版本为 v1.0(Cleaned v3),是早期名义上40亿Token版本的修正与内容去重替代版。
- 早期版本因源数据含有大量重命名的合成模板,导致Token计数虚高,现已被弃用。
- 此前的7,357分片旧版本仍可在仓库提交历史中获取,但因其名义Token数被合成模板重复主导,已不建议使用。




