遇见数据集
官方服务:

资源简介:

Sai Data Compiler Registry 是 Sai Initiative 项目下的一个持久化、有组织的数据集注册表,旨在为大规模语言模型(LLM)的预训练和课程学习提供高质量、可追溯的训练数据资源。该数据集采用编译器管道结构,而非简单的混合数据,强调数据经过严格的准入状态流程(源参考→候选→模型判断→验证→课程→训练),只有最终状态的数据才可用于训练任务。数据集的目录结构包括:registry(存储不可变上游版本、本地工件哈希、权利和发布处置)、compiler_judgments(包含源绑定的 Hermes 分类和转换计划)、curriculum(Sai 创建的概念图和课程工件)、verified(保留独立验证的派生表示)以及 training(最终去污染、分词、课程调度的分片,带有完整谱系)。当前内容包含 14 个严格的 FineWeb-Edu Hermes 编译器判断(均标记为 training_ready=false)、Sai 编写的基础教学大纲图工件、完整编译器工作区的哈希/索引(包括分阶段或仅参考材料的明确发布处置),以及一个经过清理的 185 本 Institutional Books 试点清单(164 本英文,21 本翻译路由书籍,不含门控文本)。每个发布的工件都有哈希清单,确保可追溯性。权利边界方面,每个项目受源特定权利约束,数据集级别的 other 标签不替代它们;门控机构书籍文本未在此重新分发,但上游版本和本地编译器构建哈希记录在 registry 中,用户需从原始仓库获取源访问权限。该数据集适用于数据质量评估、课程学习、预训练数据谱系追踪等场景。

Sai Data Compiler Registry is a persistent, organized dataset registry under the Sai Initiative project, aimed at providing high-quality, traceable training data resources for pre-training and curriculum learning of large language models (LLMs). The dataset adopts a compiler pipeline structure rather than a simple mixture of data, emphasizing a strict admission state flow (source reference → candidate → model judgment → verification → curriculum → training), with only final-state data eligible for training tasks. The directory structure includes: registry (immutable upstream versions, local artifact hashes, rights and release dispositions), compiler_judgments (source-bound Hermes classifications and transformation plans), curriculum (Sai-created concept maps and curriculum artifacts), verified (independently verified derived representations), and training (final decontaminated, tokenized, curriculum-scheduled shards with full provenance). Current content includes 14 strict FineWeb-Edu Hermes compiler judgments (all marked training_ready=false), Sai-authored foundational syllabus graph artifacts, hash/index of the complete compiler workspace (including staged or reference-only materials with explicit release dispositions), and a cleaned 185-book Institutional Books pilot list (164 English, 21 translation-routed books, no gated texts). Each published artifact has a hash manifest ensuring traceability. Rights boundaries: each project is subject to source-specific rights; the other label at the dataset level does not supersede them. Gated institutional book texts are not redistributed here, but upstream versions and local compiler build hashes are recorded in the registry; users must obtain source access from the original repository. The dataset is suitable for data quality assessment, curriculum learning, pre-training data provenance tracking, etc.

创建时间:
2026-08-23
原始信息汇总

Sai Data Compiler Registry 数据集概述

数据集基本信息

  • 名称:Sai Data Compiler Registry
  • 许可证:other(其他)
  • 语言:英语(English)
  • 标签:预训练(pretraining)、课程学习(curriculum-learning)、数据质量(data-quality)、大语言模型(llm)
  • 维护仓库:https://github.com/GodlyDonuts/sai-initiative

数据集定位与核心理念

该数据集是 Sai Initiative 项目的持久化证据与数据注册中心。其核心定位是一个数据编译器(data compiler),而非单一混合数据集。文件出现在该仓库中不代表已达到训练就绪状态

目标为训练一个以英语为首的多学科模型,采用螺旋式课程(spiral curriculum)方法。原始数据集仅作为源材料,必须依次通过以下审核关卡方可进入训练:来源证明、权利审查、基准污染检测、去重、语义质量审查、有根据的转换、先修条件审查、课程编排,以及最终的数据流重放。

数据准入状态

数据状态流转路径

来源引用(source reference)→ 候选(candidate)→ 模型判定(model judgment)→ 独立验证(independent verification)→ 课程(curriculum)→ 训练(training)

重要警示

  • 当前训练就绪数据量为零字节。未授权任何 4B 规模的训练运行。
  • Hugging Face 可能展示的 traintest 分割是继承自上游 Parquet 数据集的源布局名称,并非 Sai 验证标签。当前上游 train 视图不是经批准的 Sai 训练数据,上游 test 文件也不构成 Sai 评估边界。

物理数据规模

  • 物理注册中心当前包含 8,802,247,613,960 字节(8.802247614 TB 十进制;8.0055975686 TiB)
  • 超过 8.5 TB 十进制容量目标和此前 8 TiB 二进制目标
  • 该容量属于源湖容量,并非已接受的语料库体量
  • 物理源湖包含 13,974 个 LFS 对象,数据头哈希为 cc8576fbb3f949bdaf59049a150c1fa1d35f47c3
  • 每个对象均已对照其固定的上游大小和 SHA-256 进行重放,零不匹配

目录结构

目录 功能说明
sources/ 字节一致、修订版本固定的源快照,保留源特定许可证和条款
registry/ 不可变的上游修订、源清单、权利路由、基准边界、试点项目和审计收据
evidence/ 源安全出版物和测量转换产量收据
candidates/ 有界的候选数据集,其来源和再分发边界允许发布
compiler_judgments/ 与源绑定的 Hermès 分类和转换计划,不自动构成训练示例
curriculum/ Sai 编写的概念图和预期的螺旋策略
verified/ 保留用于独立验证的派生表示
training/ 保留用于最终去污、分词、按课程调度的完整谱系分片

数据源组成

源湖包含以下数据源的完整选定快照:

  • FineMath-4plus(完整数据集)
  • 三个 Nemotron 专家数据集
  • UltraData-Math L1
  • 31 个 Common Pile 数据族
  • 10,000 个 PleIAs Common Corpus 数据分片
  • 1,250 个路径有序的 FinePDFs 分片(Hugging Face 在第 5 批完成后的第 6 批上传被公开存储边界阻止,未提交部分第 6 批)

当前证据与审计结果

文件清单与收据

  • 文件级清单和收据发布于 evidence/materialized-source-lake/20260825-r1/,规范收据:0715eefc3c3bda8ee800fc4c80155df461055da3bbf2a473ad6c93cf93bea9d8
  • 38 源准入矩阵将每个实化字节与精确权利工作路线关联,并保持十个独立编译器门为故障关闭状态,规范收据:e70b65ebec4d451be5d4a7094fe798e1154019a0db79cf64d99ec1ff6ee26ab6

FineMath-4plus 普查结果

  • 完成 64 分片机械普查,覆盖 6,699,493 行34,126,971,204 UTF-8 文本字节9,573,187,002 上游 token
  • 发现 0 个字节完全重复行7 个规范化重复行
  • 保守筛选保留 56,654 行(官方基准边界前)和 52,277 行(边界后),拒绝 4,377 行(1,422 行词 shingle 重叠、3,290 行合格代码重叠、335 行两者兼有)
  • 严格的裸 MCQ 答案键过滤器在上述 52,277 行中零匹配
  • 更广泛的 Hermès 审计已标记 36 个答案农场行、149 个 SEO/内容农场行、97 个损坏行

其他关键审计

  • 源无关机械门重放 12 个当前数据群的 8,323 个不同候选:8,313 个通过机械检查、9 个因重复样板保留清理、1 个硬拒绝(无上下文评分物理答案表,含 136 个嵌入退格控制符),跨群候选身份重叠为零
  • 已完成的 Hermès 收据包含 6,751 个跨领域分配提议,涵盖 730 个直接标签;512 对源不相交开发提议数据集已冻结,涵盖 290 个标签
  • 两个精确源清单引用 23,680,076,298,761 物理候选字节(21.5369039313 TiB),涵盖 42,600 个文件
  • 六个不可变审计数据集包含 2,103 行
  • 两个有界 Common Pile 试点包含 3,290 个基准不相交、源内近去重候选
  • 完整 Common Pile PEP 普查产生 567 个基准不相交、近去重候选
  • 1,024 行 CC0 arXiv 时间筛选留下 1,023 个基准不相交行,零近重复对
  • 完整无文本 arXiv 快照普查覆盖 2,504,679 行,排除 1,060 个先前审计标识和 45,463 个短行,测得 2,458,156 个机械合格唯一行,含 2,380,856,330 UTF-8 文本字节
  • 便携式 r7 转换产量台账区分引用、采样、机械合格和训练就绪数量,且不包含机器本地绝对路径

权利与来源边界

  • 源特定权利管辖每个项目,仓库级别的 other 标签不替代源许可证、条款、署名或共享相同义务
  • 受限机构书籍文本不在本仓库中再分发
  • 出现在 sources/ 下的源快照在完成其要求的源级或行级权利路线、去污、去重、质量编译和最终准入证据前,仍处于非训练就绪状态

验证机制

已发布证据采用哈希清单管理。重要发布包含规范收据哈希、文件 SHA-256 值、不可变上游修订和远程重放提交。代码、验证合同、精确状态和研究台账维护于 https://github.com/GodlyDonuts/sai-initiative。

搜集汇总
数据集介绍
Sai 数据集图片
构建方式
Sai数据集是一个面向英语优先的博学模型预训练的数据编译注册表,旨在通过螺旋式课程学习实现高质量的数据筛选。其构建遵循严格的准入流程,从源参考到候选、模型判断、独立验证、课程编排直至最终训练,每个环节均设有门控机制。当前物理源湖包含8.8 TB字节的源快照,覆盖FineMath-4plus、Common Pile等多个数据集,并附带不可变修订和SHA-256校验,确保数据完整性和可追溯性。该注册表通过清单和收据记录每个字节的来源、权利路径及门控结果,但明确标注训练就绪容量为零字节,强调当前仅为源湖状态。
特点
Sai数据集的核心特点在于其严格的等级分类和审计机制。它区分源参考、候选、机械通过和训练就绪等不同状态,并强调机械通过不等于语义或训练准入。数据集包含38个源准入矩阵,通过十个编译器门控实现故障封闭,并提供了详细的重复数据检测、基准污染过滤和质量评估证据,如FineMath的64分片普查显示零字节重复行和七个归一化重复行。此外,数据集注重权利边界,尊重每个源的许可证和条款,不擅自重新分发受限文本,确保合规性。其可复现的哈希清单和独立验证机制增强了数据的可信度和透明度。
使用方法
使用Sai数据集时,研究者应首先查阅其证据目录和收据,了解数据来源和门控状态。由于当前训练就绪容量为零,用户不可将源快照直接用于预训练,而应遵循注册表中的准入流程,通过编译器门控、去污染、去重和质量评估后,方可获得训练认可。数据集提供了详细的清单和哈希值,便于验证数据完整性和溯源。建议用户访问GitHub仓库获取代码、验证合约和完整的实验记录,以复现数据编译过程。对于下游任务,应谨慎使用候选和机械通过的数据集,并参考其附带的归属清单和基准边界,确保符合各源的权利条款。
背景与挑战
背景概述
Sai数据集由Sai Initiative团队于2026年创建,旨在构建一个面向英语优先的通才模型(polymath model)的训练数据注册与编译系统。其核心研究问题在于如何通过螺旋式课程学习(spiral curriculum)从海量原始数据中筛选出高质量、无污染、且具有严格来源追溯的训练语料。该数据集并非简单的数据混合体,而是一个分层递进的‘数据编译器’,强调从源参考到最终训练状态的十重门控流程。其影响力在于为大规模语言模型预训练树立了数据治理与质量保证的新范式,推动了对数据来源、版权合规、基准污染和语义质量的系统性审查,尤其关注训练就绪数据的零字节现状,凸显了严格标准下的审慎态度。
当前挑战
Sai数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,它应对大规模语言模型预训练中的数据质量危机,包括基准污染(benchmark contamination)、重复冗余(duplication)和语义低质(semantic quality)问题,这些直接威胁模型泛化能力与评估可靠性。构建过程则遭遇多重困难:物理源湖容量达8.8 TB,但需逐字节验证SHA-256,并处理FineMath-4plus等五大数据源的版权与再分发边界;候选数据需通过十道独立门控,如去重、代码重叠过滤(例如拒绝335行双重重叠行),且面临Hugging Face存储上限导致的数据流中断;此外,跨来源的候选身份一致性、上下文缺失或嵌入式控制字符等异常也须机械门控剔除。这些挑战要求建立高度可靠的审计链,目前训练就绪体积严格为零字节,体现了数据编译的严苛性。
常用场景
经典使用场景
Sai数据集作为Sai Initiative的数据编译注册表,是构建英语优先的通才模型的核心资源。其经典使用场景在于为螺旋式课程学习提供经过严格门控的数据流,涵盖从原始源数据快照到候选集、模型判断、独立验证、课程编排直至最终训练就绪的完整pipeline。研究者利用该注册表进行数据质量评估、去重、基准污染检测以及语义过滤,确保每个训练样本具备完整溯源和权利合规。尤其适用于大规模语言模型预训练中的课程学习设计,通过分阶段引入不同难度和领域的数据,实现模型能力的渐进式提升。
实际应用
在实际应用中,Sai数据集为工业级大模型训练提供了合规且高质量的数据基础设施。其注册表架构支持团队在预训练流程中实施严格的数据准入策略,防止版权侵权和内容农场污染,同时通过分层存储(如sources、candidates、verified等)实现数据生命周期管理。具体应用包括:构建领域自适应课程(如数学、代码、科学文献)、进行跨域知识迁移实验、以及实现数据溯源审计。该数据集还促进了多团队协作下的数据共享与版本控制,确保训练数据集的透明度和可追溯性,符合企业级AI治理要求。
衍生相关工作
Sai数据集衍生了一系列关于数据编译和课程学习的经典工作。首先,其门控框架启发了可复现的数据筛选方法论,例如基于哈希清单的验证协议和基准污染检测算法。其次,FineMath-4plus的机械普查产生了大规模重复检测和去重研究,推动了数据去重技术(如MinHash和嵌入相似度)的发展。此外,Hermès跨域分类系统被用于构建语义标签体系,衍生出预训练数据的自动标注和课程排序研究。最后,Sai的容错和审计设计影响了后续数据集的合规性标准,促进了诸如DataComp、RedPajama等项目的改进,推动了开放数据集的治理透明度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务