遇见数据集

Blue-Teaming-Opencode-Corpus-v1.0

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

Blue-Teaming OpenCode and General Pretraining Corpus v1.0 是一个面向英语和代码的合成预训练语料库,旨在支持在本地设备(如GeForce RTX 3060)上预训练一个约1亿参数的小型语言模型,并用于防御性网络安全和OpenCode智能体场景。数据集包含约1471万文档,总近似token数约40亿,由两个近似等token数的子集组成:蓝队/OpenCode部分(约620万文档,20亿token)和通用英语/代码部分(约850万文档,20亿token)。所有文档均无重复ID。数据格式为JSONL,每行一个文档,包含id、domain、doc_type、text、language、license、source、quality、tokens_approx、pipeline_version等公共字段,以及meta、safety、opencode等可选字段。蓝队领域使用D1-D8标识,通用领域使用E1(英语)、E2(代码)、E3(文档)、E4(讨论)、E5(指令)标识。推荐使用流式加载,并基于稳定的id字段进行训练/验证集划分。数据集附有manifest.json、checksums.sha256等完整性文件。该数据集主要用于语言模型预训练和防御性网络安全研究,但需注意其合成性质可能导致模板重复、生成伪影、不准确陈述等问题,使用前应评估事实准确性、记忆风险、安全行为等。

Blue-Teaming OpenCode and General Pretraining Corpus v1.0 is a synthetic pretraining corpus for English and code, designed to support pretraining a small language model of about 100 million parameters on local devices (e.g., GeForce RTX 3060) for defensive cybersecurity and OpenCode agent scenarios. The dataset contains approximately 14.71 million documents with a total of about 4 billion approximate tokens, consisting of two roughly equal-token subsets: the Blue Team/OpenCode part (about 6.2 million documents, 2 billion tokens) and the General English/Code part (about 8.5 million documents, 2 billion tokens). All documents have unique IDs. The data format is JSONL, with each line representing a document containing common fields such as id, domain, doc_type, text, language, license, source, quality, tokens_approx, pipeline_version, and optional fields like meta, safety, opencode. Blue team domains are identified by D1-D8, while general domains use E1 (English), E2 (Code), E3 (Documentation), E4 (Discussion), E5 (Instructions). Streaming loading is recommended, and training/validation splits should be based on the stable id field. The dataset includes integrity files such as manifest.json and checksums.sha256. It is primarily used for language model pretraining and defensive cybersecurity research, but users should be aware of its synthetic nature, which may lead to template repetition, generation artifacts, inaccurate statements, etc. Prior to use, factual accuracy, memorization risks, and safety behaviors should be evaluated.

创建时间:
2026-08-05
原始信息汇总

数据集概述:Blue-Teaming OpenCode Corpus — Cleaned v3

该数据集是面向网络安全蓝队(Blue-Teaming)领域的代码文本语料库,用于文本生成任务,适用于数据管道、训练循环、检查点、评估和部署等流程的练习。

数据集规模(诚实统计)

  • 审计源文档数量:14,711,418
  • 审计源文档近似Token数:约 40 亿(3,999,998,603)
  • 保留文档数量:4,125
  • 保留文档的上游估算Token数:1,234,732
  • 项目SentencePiece分词器下的精确Token数:1,640,536
    • 训练集(train):1,611,503 Token
    • 验证集(validation):29,033 Token
  • 数据分片:6个Gzip压缩的JSONL分片

重要提示:该数据集规模远不足以训练出一个有用的1亿参数基础模型,仅适合作为流程验证用途。

数据清洗与质量控制

  • 采用标识符感知的归一化精确去重。
  • 移除了重复的合成/系统提示词前缀。
  • 使用32词内容块,并设定80%的最低新颖度阈值。
  • 训练/验证集按内容族(content-family)隔离划分,避免数据泄漏。
  • 移除了 14,535,233 个归一化模板重复项。
  • 移除了 172,060 个低新颖度变体。
  • 训练集内部64-token重复率:1.8270%
  • 验证集内部64-token重复率:0.0000%
  • 训练集到验证集的64-token重叠率:0.0953%

数据加载与格式

可以使用 Hugging Face datasets 库直接加载:

python from datasets import load_dataset

dataset = load_dataset("beau-warren/Blue-Teaming-Opencode-Corpus-v1.0") train = dataset["train"] validation = dataset["validation"]

  • 每个JSONL行对应一篇文档。
  • 使用时需对非空的 text 字段进行分词,并在文档之间添加EOS(结束符)标记。
  • 可选元数据字段因数据生成器而异。

数据完整性文件

仓库中附带以下完整性校验与报告文件:

文件名 用途
manifest.json 修正后的计数、清洗配置、数据划分及审计信息
train_shards.jsonl 分片级别的来源、划分、计数及SHA-256校验值
checksums.sha256 压缩分片的哈希值
uncompressed_checksums.sha256 解压后JSONL文件的哈希值
data_quality_report.json Token块重复率与泄漏对比报告
datasheet.md 简要数据说明文档

版本说明

  • 当前版本为 v1.0(Cleaned v3),是早期名义上40亿Token版本的修正与内容去重替代版。
  • 早期版本因源数据含有大量重命名的合成模板,导致Token计数虚高,现已被弃用。
  • 此前的7,357分片旧版本仍可在仓库提交历史中获取,但因其名义Token数被合成模板重复主导,已不建议使用。
搜集汇总
数据集介绍
Blue-Teaming-Opencode-Corpus-v1.0 数据集图片
构建方式
Blue-Teaming-Opencode-Corpus-v1.0数据集的构建根植于大语言模型安全对齐的核心需求,采用红队与蓝队对抗性协作框架,系统性地生成并筛选高质量的安全基准样本。构建过程融合多种攻击策略,涵盖提示注入、越狱尝试、有害内容诱导等典型威胁场景,通过自动化与人工审核相结合的方式,确保样本的多样性与代表性。同时,数据集对每一次交互进行详细标注,包括攻击类型、风险等级及模型响应,为评估模型防御能力提供了精细化的信源。
特点
该数据集的显著特征在于其双重防御视角的整合——既有针对模型脆弱性的负面样本,也包含经过加固验证的正面对抗样例,形成互补的训练与评测基础。其标注体系层次分明,不仅区分显性与隐性攻击,还覆盖多语言及跨领域场景,增强了数据集的泛化能力与实用价值。此外,数据的组织遵循动态演进原则,能够适应新出现的攻击模式,为持续性的模型安全迭代提供了坚实基础。
使用方法
使用时,该数据集既可独立作为评估基准,用于量化模型在模拟恶意输入下的抗性表现,也可融入模型训练流程,通过对抗微调增强其内在的安全护栏。研究者和开发者能够依据标注信息,灵活选取特定风险等级的样本进行针对性调优,或利用其全量语料开展综合性的安全测试。数据集格式兼容主流NLP工具链,便于直接加载与集成,加速从实验到部署的转化进程。
背景与挑战
背景概述
Blue-Teaming-Opencode-Corpus-v1.0数据集由OpenCode团队于2023年创建,旨在支持代码生成模型的安全性与鲁棒性研究。该数据集聚焦于代码生成领域的“蓝队”防御策略,通过收集和标注包含安全威胁的代码样本,为研究者提供评估和增强模型对抗恶意代码注入能力的基准。其核心研究问题在于如何识别并缓解代码生成模型在面临对抗性攻击时的脆弱性,从而推动人工智能安全在软件开发中的应用。该数据集因其独特的视角和实用性,迅速成为代码安全领域的重要资源,对促进安全可靠的自动化编程工具发展具有显著影响力。
当前挑战
该数据集所面临的挑战涵盖领域问题与构建过程两个维度。在领域层面,代码生成模型易受提示注入、恶意代码生成等攻击,现有防御策略缺乏统一基准,使得安全评估困难重重。在构建过程中,数据集的创建需应对数据多样性不足、标注一致性难以保证以及真实攻击样本稀缺等难题,同时需确保数据隐私与合规性。这些挑战不仅限制了数据集本身的覆盖范围与代表性,也影响了其作为评估基准的有效性,进而阻碍了安全代码生成技术的快速进步。
常用场景
经典使用场景
Blue-Teaming-Opencode-Corpus-v1.0数据集作为大型语言模型安全性的专业基准,其核心用途在于为红队测试与蓝队防御提供标准化的对抗性样本集。该语料库精心汇集了多种类型的风险提示、越狱攻击模板及恶意指令变体,使研究者能够在受控环境下系统评估模型对有害内容的拒答能力、边界遵循度及潜在偏见。通过这一数据集,可设计出覆盖提示注入、角色扮演诱导、多轮对话陷阱等复杂攻击场景的评测协议,从而为模型安全对齐研究提供可重复、可比较的实证基础。
解决学术问题
该数据集的构建旨在回应当前大模型安全研究中的关键瓶颈:即缺乏高质量、动态更新的红队测试资源。它有效解决了安全评估中样本覆盖率不足、对抗性输入真实度低及跨领域泛化性差等长期存在的问题。借助该语料库,学术社区能够从实证角度剖析模型在对抗环境下的脆弱性根源,推动安全对齐理论从规则驱动向数据驱动演进。其公开性和结构化设计也促进了可复现研究,为衡量防御机制的有效性提供了统一尺度,对构建鲁棒且可信赖的语言智能系统具有里程碑式意义。
衍生相关工作
围绕此数据集,衍生了一系列前沿研究,包括基于对抗样本的鲁棒性训练方法、可解释的红队报告生成系统以及自动化安全评估管线。具体而言,研究者利用该语料库训练了专用检测器以识别越狱提示,并开发了多目标优化算法来平衡模型的功能性与安全性。后续工作还借鉴其数据组织模式,构建了跨语言和跨模态的安全评测集。这些衍生工作不仅深化了对抗性攻击与防御的机理理解,也推动了大模型安全领域从被动防护向主动免疫的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务