Sai
收藏资源简介:
Sai Data Compiler Registry 是 Sai Initiative 项目下的一个持久化、有组织的数据集注册表,旨在为大规模语言模型(LLM)的预训练和课程学习提供高质量、可追溯的训练数据资源。该数据集采用编译器管道结构,而非简单的混合数据,强调数据经过严格的准入状态流程(源参考→候选→模型判断→验证→课程→训练),只有最终状态的数据才可用于训练任务。数据集的目录结构包括:registry(存储不可变上游版本、本地工件哈希、权利和发布处置)、compiler_judgments(包含源绑定的 Hermes 分类和转换计划)、curriculum(Sai 创建的概念图和课程工件)、verified(保留独立验证的派生表示)以及 training(最终去污染、分词、课程调度的分片,带有完整谱系)。当前内容包含 14 个严格的 FineWeb-Edu Hermes 编译器判断(均标记为 training_ready=false)、Sai 编写的基础教学大纲图工件、完整编译器工作区的哈希/索引(包括分阶段或仅参考材料的明确发布处置),以及一个经过清理的 185 本 Institutional Books 试点清单(164 本英文,21 本翻译路由书籍,不含门控文本)。每个发布的工件都有哈希清单,确保可追溯性。权利边界方面,每个项目受源特定权利约束,数据集级别的 other 标签不替代它们;门控机构书籍文本未在此重新分发,但上游版本和本地编译器构建哈希记录在 registry 中,用户需从原始仓库获取源访问权限。该数据集适用于数据质量评估、课程学习、预训练数据谱系追踪等场景。
Sai Data Compiler Registry is a persistent, organized dataset registry under the Sai Initiative project, aimed at providing high-quality, traceable training data resources for pre-training and curriculum learning of large language models (LLMs). The dataset adopts a compiler pipeline structure rather than a simple mixture of data, emphasizing a strict admission state flow (source reference → candidate → model judgment → verification → curriculum → training), with only final-state data eligible for training tasks. The directory structure includes: registry (immutable upstream versions, local artifact hashes, rights and release dispositions), compiler_judgments (source-bound Hermes classifications and transformation plans), curriculum (Sai-created concept maps and curriculum artifacts), verified (independently verified derived representations), and training (final decontaminated, tokenized, curriculum-scheduled shards with full provenance). Current content includes 14 strict FineWeb-Edu Hermes compiler judgments (all marked training_ready=false), Sai-authored foundational syllabus graph artifacts, hash/index of the complete compiler workspace (including staged or reference-only materials with explicit release dispositions), and a cleaned 185-book Institutional Books pilot list (164 English, 21 translation-routed books, no gated texts). Each published artifact has a hash manifest ensuring traceability. Rights boundaries: each project is subject to source-specific rights; the other label at the dataset level does not supersede them. Gated institutional book texts are not redistributed here, but upstream versions and local compiler build hashes are recorded in the registry; users must obtain source access from the original repository. The dataset is suitable for data quality assessment, curriculum learning, pre-training data provenance tracking, etc.
Sai Data Compiler Registry 数据集概述
数据集基本信息
- 名称:Sai Data Compiler Registry
- 许可证:other(其他)
- 语言:英语(English)
- 标签:预训练(pretraining)、课程学习(curriculum-learning)、数据质量(data-quality)、大语言模型(llm)
- 维护仓库:https://github.com/GodlyDonuts/sai-initiative
数据集定位与核心理念
该数据集是 Sai Initiative 项目的持久化证据与数据注册中心。其核心定位是一个数据编译器(data compiler),而非单一混合数据集。文件出现在该仓库中不代表已达到训练就绪状态。
目标为训练一个以英语为首的多学科模型,采用螺旋式课程(spiral curriculum)方法。原始数据集仅作为源材料,必须依次通过以下审核关卡方可进入训练:来源证明、权利审查、基准污染检测、去重、语义质量审查、有根据的转换、先修条件审查、课程编排,以及最终的数据流重放。
数据准入状态
数据状态流转路径
来源引用(source reference)→ 候选(candidate)→ 模型判定(model judgment)→ 独立验证(independent verification)→ 课程(curriculum)→ 训练(training)
重要警示
- 当前训练就绪数据量为零字节。未授权任何 4B 规模的训练运行。
- Hugging Face 可能展示的
train或test分割是继承自上游 Parquet 数据集的源布局名称,并非 Sai 验证标签。当前上游train视图不是经批准的 Sai 训练数据,上游test文件也不构成 Sai 评估边界。
物理数据规模
- 物理注册中心当前包含 8,802,247,613,960 字节(8.802247614 TB 十进制;8.0055975686 TiB)
- 超过 8.5 TB 十进制容量目标和此前 8 TiB 二进制目标
- 该容量属于源湖容量,并非已接受的语料库体量
- 物理源湖包含 13,974 个 LFS 对象,数据头哈希为
cc8576fbb3f949bdaf59049a150c1fa1d35f47c3 - 每个对象均已对照其固定的上游大小和 SHA-256 进行重放,零不匹配
目录结构
| 目录 | 功能说明 |
|---|---|
sources/ |
字节一致、修订版本固定的源快照,保留源特定许可证和条款 |
registry/ |
不可变的上游修订、源清单、权利路由、基准边界、试点项目和审计收据 |
evidence/ |
源安全出版物和测量转换产量收据 |
candidates/ |
有界的候选数据集,其来源和再分发边界允许发布 |
compiler_judgments/ |
与源绑定的 Hermès 分类和转换计划,不自动构成训练示例 |
curriculum/ |
Sai 编写的概念图和预期的螺旋策略 |
verified/ |
保留用于独立验证的派生表示 |
training/ |
保留用于最终去污、分词、按课程调度的完整谱系分片 |
数据源组成
源湖包含以下数据源的完整选定快照:
- FineMath-4plus(完整数据集)
- 三个 Nemotron 专家数据集
- UltraData-Math L1
- 31 个 Common Pile 数据族
- 10,000 个 PleIAs Common Corpus 数据分片
- 1,250 个路径有序的 FinePDFs 分片(Hugging Face 在第 5 批完成后的第 6 批上传被公开存储边界阻止,未提交部分第 6 批)
当前证据与审计结果
文件清单与收据
- 文件级清单和收据发布于
evidence/materialized-source-lake/20260825-r1/,规范收据:0715eefc3c3bda8ee800fc4c80155df461055da3bbf2a473ad6c93cf93bea9d8 - 38 源准入矩阵将每个实化字节与精确权利工作路线关联,并保持十个独立编译器门为故障关闭状态,规范收据:
e70b65ebec4d451be5d4a7094fe798e1154019a0db79cf64d99ec1ff6ee26ab6
FineMath-4plus 普查结果
- 完成 64 分片机械普查,覆盖 6,699,493 行、34,126,971,204 UTF-8 文本字节、9,573,187,002 上游 token
- 发现 0 个字节完全重复行,7 个规范化重复行
- 保守筛选保留 56,654 行(官方基准边界前)和 52,277 行(边界后),拒绝 4,377 行(1,422 行词 shingle 重叠、3,290 行合格代码重叠、335 行两者兼有)
- 严格的裸 MCQ 答案键过滤器在上述 52,277 行中零匹配
- 更广泛的 Hermès 审计已标记 36 个答案农场行、149 个 SEO/内容农场行、97 个损坏行
其他关键审计
- 源无关机械门重放 12 个当前数据群的 8,323 个不同候选:8,313 个通过机械检查、9 个因重复样板保留清理、1 个硬拒绝(无上下文评分物理答案表,含 136 个嵌入退格控制符),跨群候选身份重叠为零
- 已完成的 Hermès 收据包含 6,751 个跨领域分配提议,涵盖 730 个直接标签;512 对源不相交开发提议数据集已冻结,涵盖 290 个标签
- 两个精确源清单引用 23,680,076,298,761 物理候选字节(21.5369039313 TiB),涵盖 42,600 个文件
- 六个不可变审计数据集包含 2,103 行
- 两个有界 Common Pile 试点包含 3,290 个基准不相交、源内近去重候选
- 完整 Common Pile PEP 普查产生 567 个基准不相交、近去重候选
- 1,024 行 CC0 arXiv 时间筛选留下 1,023 个基准不相交行,零近重复对
- 完整无文本 arXiv 快照普查覆盖 2,504,679 行,排除 1,060 个先前审计标识和 45,463 个短行,测得 2,458,156 个机械合格唯一行,含 2,380,856,330 UTF-8 文本字节
- 便携式 r7 转换产量台账区分引用、采样、机械合格和训练就绪数量,且不包含机器本地绝对路径
权利与来源边界
- 源特定权利管辖每个项目,仓库级别的
other标签不替代源许可证、条款、署名或共享相同义务 - 受限机构书籍文本不在本仓库中再分发
- 出现在
sources/下的源快照在完成其要求的源级或行级权利路线、去污、去重、质量编译和最终准入证据前,仍处于非训练就绪状态
验证机制
已发布证据采用哈希清单管理。重要发布包含规范收据哈希、文件 SHA-256 值、不可变上游修订和远程重放提交。代码、验证合同、精确状态和研究台账维护于 https://github.com/GodlyDonuts/sai-initiative。





