遇见数据集

Sophia training dataset

收藏
魔搭社区2026-07-19 更新2026-07-19 收录
官方服务:

资源简介:

# Sophia Dataset Sophia Dataset 是 Sophia 语言模型训练项目使用的公开数据集资产,面向约 0.83B 参数 decoder-only causal LM 的预训练与 SFT 后训练流程。 本数据集包含两类内容: - **预训练语料与 token shards**:用于从头训练或继续预训练 Sophia 基座模型。 - **SFT 指令微调数据**:用于完成预训练后的监督微调阶段。 > 说明:本数据集主要服务于 Sophia 项目的训练流水线。推荐配合项目仓库中的训练脚本、tokenizer、manifest 校验与 preflight 流程使用,不建议随意改动 manifest、token shard 或 tokenizer 指纹。 ## 数据规模 本次公开上传的数据约 103GB,约 5,800+ 个文件,主要目录如下: | 路径 | 用途 | 规模 | | --- | --- | ---: | | `pretrain_tokens/` | 已 tokenized 的主预训练 token shards,含 train/val/test | 约 61.8GB | | `pretrain_decay/` | 衰减/补充训练用 token shards | 约 8.9GB | | `pretrain/` | 原始或中间预训练数据分组,按 books/code/wiki/math/translation/discourse 等组织 | 约 32.3GB | | `sft/` | SFT JSONL 数据,含 train/val/test | 约 22MB | ## 目录结构 ```text . ├── pretrain_tokens/ │ ├── train/ │ │ ├── manifest.json │ │ └── shard_*.bin │ ├── val/ │ │ ├── manifest.json │ │ └── shard_*.bin │ ├── test/ │ │ ├── manifest.json │ │ └── shard_*.bin │ └── rebuild_report.json ├── pretrain_decay/ │ └── train/ │ ├── manifest.json │ └── shard_*.bin ├── pretrain/ │ ├── train/ │ ├── val/ │ └── test/ └── sft/ ├── train.jsonl ├── val.jsonl └── test.jsonl ``` ## Token Shard 格式 `pretrain_tokens/` 与 `pretrain_decay/` 下的训练数据已经完成 tokenizer 编码,采用二进制 token shard 存储: - `dtype`: `int32` - `eos_token_id`: `3` - `tokenizer_sha1`: `0540271a37a7710ba7216e5d46ce8c647c768cdc` - shard 文件名通常为 `shard_00000.bin`、`shard_00001.bin` 等 - 每个 split 使用对应的 `manifest.json` 描述 shard 列表、token 数量与 tokenizer 指纹 主要 token 数量: | Split | Token 数 | | --- | ---: | | `pretrain_tokens/train` | 16,221,700,096 | | `pretrain_tokens/val` | 341,311,488 | | `pretrain_tokens/test` | 24,754,652 | | `pretrain_decay/train` | 2,402,189,312 | ## SFT 数据 `sft/` 目录提供监督微调数据: - `sft/train.jsonl` - `sft/val.jsonl` - `sft/test.jsonl` 每行是一个 JSON 对象,供 Sophia 项目的 SFT 数据加载流程读取。具体字段以项目训练代码为准。 ## 推荐使用方式 推荐将数据集下载到 Sophia 项目的 `dataset/` 目录,然后使用项目内的一键脚本启动训练。 ```bash bash tools/one_click_train.sh pretrain --dry-run bash tools/one_click_train.sh pretrain bash tools/one_click_train.sh sft ``` 常用环境变量: ```bash export SOPHIA_DATA_PATH=/path/to/dataset/pretrain_tokens export SOPHIA_DECAY_DATA_PATH=/path/to/dataset/pretrain_decay export SOPHIA_SFT_TRAIN_DATA=/path/to/dataset/sft/train.jsonl export SOPHIA_RESUME=auto ``` ## 校验要求 Sophia 的训练流程对数据一致性有严格校验: - tokenizer、token shards、manifest 指纹必须一致。 - 不要手动修改 `manifest.json` 绕过校验。 - 如果 tokenizer 或语料发生变化,应重新构建 token shards。 - checkpoint 与输出目录应放在 Linux 原生盘,避免使用 `/mnt/*` Windows 挂载路径进行长时间训练。 - 训练前建议先执行 dry-run,确认 preflight、数据资产校验、GPU readiness probe 均通过。 ## 适用场景 本数据集适合: - 复现实验性中文/中英混合 causal LM 预训练流程。 - 测试 Sophia 项目的数据加载、训练、SFT 与监控链路。 - 基于已切分 token shards 进行继续预训练或训练流程调试。 不适合: - 直接作为通用自然语言处理 benchmark。 - 在不了解 tokenizer/manifest 绑定关系的情况下拆分、重排或混用 shard。 ## 许可证 本数据集卡片声明许可证为 Apache License 2.0。使用者仍需自行确认原始语料、下游用途和部署场景满足适用法律、平台规则与合规要求。 ## 项目 Sophia 是一个面向单张高端消费级 GPU 训练的小型语言模型项目,包含数据构建、preflight 门禁、预训练、SFT、监控和导出流程。训练与复现说明请参考 Sophia 项目仓库中的 README 与 `tools/one_click_train.sh`。

提供机构:
maas
创建时间:
2026-07-11
二维码
社区交流群
二维码
科研交流群
商业服务