遇见数据集

bitmoe-400m-t-v1

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

bitmoe-400m-t-v1 是一个专为 BitMoE-400M-T 模型设计的文本分词器预训练语料库。数据集以分片形式组织,每个分片包含 33554432 个 uint32 类型的 token ID,原始数据存储在二进制文件(.bin)中,并配有详细的 JSON 元数据侧文件(.meta.json)。元数据包含 18 个字段,详细记录了每个分片的信息,包括分片索引、文件名、token 数量、创建时间、质量分数统计(平均分、最小分、最大分、标准差)、分数直方图(0.0 至 10.0,步长 0.5)、模态组成(纯文本)以及支柱来源组成(如 fineweb-edu、wikipedia、c4 等)。数据集通过 Azure D4s_v3 虚拟机上的 bitmoe_miner.py 脚本生成,并遵循 Apache-2.0 许可证。该数据集适用于大规模语言模型的预训练任务,特别是需要高质量、结构化文本 token 序列的场景。

bitmoe-400m-t-v1 is a text tokenizer pre-training corpus specifically designed for the BitMoE-400M-T model. The dataset is organized in shards, with each shard containing 33554432 uint32-type token IDs. Raw data is stored in binary files with the .bin extension, accompanied by detailed JSON metadata sidecar files (.meta.json). The metadata includes 18 fields that comprehensively document information for each shard, including shard index, file name, token count, creation time, quality score statistics (mean, minimum, maximum, standard deviation), score histogram (0.0 to 10.0 with a step size of 0.5), modality composition (plain text), and pillar source composition (e.g., fineweb-edu, wikipedia, c4, etc.). The dataset was generated using the bitmoe_miner.py script on an Azure D4s_v3 virtual machine, and is licensed under the Apache-2.0 license. This dataset is suitable for pre-training tasks of large-scale language models, particularly scenarios requiring high-quality, structured text token sequences.

创建时间:
2026-06-07
原始信息汇总

数据集概述:BitMoE-400M-T 文本分词器预训练语料库

该数据集是专为 BitMoE-400M-T 模型设计的文本分词器预训练语料库,包含大量预处理后的 Token ID 数据分片及相关元数据。

数据集结构

数据集由两种主要文件组成,位于 data/shards/state/ 目录下:

路径 格式 说明
data/shards/shard_*.bin uint32 小端序,128 MiB 原始 Token ID 数据,每个分片包含 33,554,432 个 Token
data/shards/shard_*.meta.json JSON,18 个字段 每个数据分片的侧车元数据文件
state/shard_*.meta.json JSON,18 个字段 与上述 schema 相同,存放较旧的分片
state/warp_*.state JSON,被查看器忽略 矿工恢复检查点,使用不同 schema(6 个字段)

侧车元数据 Schema

每个 JSON 侧车文件包含 18 个固定顺序和类型的键:

json { "shard_idx": 0, // 分片索引 "filename": "shard_00000000.bin", // 对应 .bin 文件名 "num_tokens": 33554432, // Token 数量 "dtype": "uint32", // 数据类型 "size_bytes": 134217728, // 文件大小(字节) "created_at": "2026-06-07T05:34:11.337884", // ISO 8601 时间戳 "tokens": 33554432, // Token 数量(同 num_tokens) "avg_score": 3.2258, // 平均质量分数 "min_score": 2.5, // 最低质量分数 "max_score": 5.9, // 最高质量分数 "std_score": 0.56, // 质量分数标准差 "n_above_3": 11223, // 分数大于 3 的数量 "n_above_5": 39, // 分数大于 5 的数量 "score_hist": {...}, // 21 个固定区间的分数直方图(0.0 到 10.0,步长 0.5) "modality_comp": {"txt": 33554432}, // 模态组成(全为文本) "pillar_comp": {...}, // 数据源组成(如 fineweb-edu、wikipedia、c4) "ts": 1780810451.34, // Unix 时间戳(浮点数,向后兼容) "modality": "text" // 数据模态 }

关键注意事项

  • score_hist 必须始终包含完整的 21 个区间键,即使计数为 0,否则查看器无法合并行。
  • created_at 必须使用 ISO 8601 字符串格式,不能使用浮点数,否则会破坏所有分片的 schema 推断。

数据来源与生成

  • 生成工具bitmoe_miner.py 脚本,运行在 Azure D4s_v3 虚拟机(Ubuntu 24.04)。
  • 数据源:包含 fineweb-edu、wikipedia、c4 等来源。
  • 配置:数据源权重和质量阈值在矿工虚拟机的 /opt/bitmoe/config/*.env 文件中配置。

验证工具

scripts/verify_viewer.py 脚本用于检查所有侧车文件的 schema 一致性、访问 Croissant 端点,并进行流式 load_dataset 往返测试。矿工虚拟机通过 6 小时 systemd 定时器自动运行此检查。

许可协议

Apache-2.0

搜集汇总
数据集介绍
bitmoe-400m-t-v1 数据集图片
构建方式
bitmoe-400m-t-v1数据集专为BitMoE-400M-T模型的文本分词预训练而设计,其构建过程依托于运行在Azure D4s_v3虚拟机上的bitmoe_miner.py脚本。每个数据分片(shard)包含33,554,432个uint32格式的原始token ID,以128 MiB的二进制文件形式存储,并附带包含18个字段的JSON侧车元数据文件。分片文件位于data/shards/目录下,而较旧的分片则迁移至state/目录,以保持数据结构的整洁。元数据详细记录了分片索引、创建时间、token数量、质量评分等关键信息,其中score_hist固定使用21个等距区间(0.0至10.0,步长0.5),确保所有分片能够被统一加载和解析。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库直接加载元数据文件,其YAML配置指定了train分片的数据路径,涵盖data/shards/和state/目录下的所有.meta.json文件。实际token ID需访问同目录的.bin文件进行解析,每个分片对应一个完整的二进制token序列。为了验证数据完整性,项目提供了verify_viewer.py脚本,可检查所有侧车文件的模式一致性,并执行load_dataset往返测试。同时,bitmoe_miner.py内置了启动保护机制,阻止状态文件以.json等扩展名结尾,从而防止与元数据冲突。建议用户基于pillar_comp字段实现数据源的混合采样,并根据avg_score等指标设定质量过滤阈值,以适配不同训练需求。
背景与挑战
背景概述
bitmoe-400m-t-v1数据集诞生于2026年,由BitMoE研究团队开发,核心目标是为参数量达4亿的稀疏混合专家(MoE)语言模型BitMoE-400M-T提供高质量文本预训练语料。该数据集包含约4亿个token,以32M token为单位分片存储,每个分片附带详尽的元数据(如质量分数、来源构成)。通过整合FineWeb-Edu、Wikipedia、C4等优质语料,并引入基于评分机制的过滤策略,数据集在语言模型预训练领域树立了新的质量标杆。其影响力体现在为稀缺的MoE模型开源训练数据领域填补空白,推动了高效稀疏模型的研究进程。
当前挑战
该数据集解决了MoE模型在训练中因数据质量分布不均导致的专家负载失衡问题,通过细粒度的分片质量评分(如avg_score)和源域追踪(pillar_comp),实现了训练数据的高效调度与混合。构建过程中面临两大挑战:一是异构数据源的统一归档与元数据规范化,需确保18字段模式严格一致,避免因字段类型不匹配(如created_at用ISO 8601字符串而非浮点数)导致读取端崩溃;二是分布式存储的容错设计,通过.state后缀规避JSON格式冲突,并设置启动守卫(assert_state_ext)防止错误文件污染全局视图。
常用场景
经典使用场景
bitmoe-400m-t-v1是一个专为BitMoE-400M-T模型设计的文本分词预训练语料库,在自然语言处理领域,其最经典的使用场景是作为大规模语言模型(LLM)的预训练数据源。该数据集以uint32格式存储了约4亿个Token,每个碎片包含33,554,432个Token,并通过元数据文件详细记录了每个碎片的平均质量评分、评分分布、来源构成(如FineWeb-Edu、Wikipedia、C4)等关键信息。研究者可基于这些结构化侧车信息,高效筛选高质量文本片段,用于训练具备混合专家架构(MoE)的语言模型,从而在有限计算资源下提升模型的知识容纳能力和生成质量。
解决学术问题
该数据集解决了大规模预训练语料库管理中数据质量评估与分片元数据标准的学术难题。传统文本数据集往往缺乏细粒度的质量标注,导致研究人员难以定量评估不同文本片段对模型训练的贡献。bitmoe-400m-t-v1通过引入包含平均评分、最低评分、标准差、高于阈值数量及直方图分布等18个字段的侧车元数据机制,为每个碎片建立了可量化的质量画像。这一设计使学术界能够基于统计指标系统研究数据质量与模型性能之间的关联规律,推动了预训练数据筛选策略从经验性启发式方法向数据驱动量化评估范式的转变,并为多源异构文本数据的标准化管理提供了可复现的工程范式。
实际应用
在实际应用层面,该数据集主要服务于工业级语言模型的分布式预训练流水线。云服务提供商可基于侧车元数据中的分片评分分布,动态调整各碎片在训练过程中的采样权重,使模型更多关注高质量文本(如评分高于3.0的片段)而抑制低质量噪声数据的影响。同时,其分片式存储结构(每个128MiB的uint32二进制文件)天然适配分布式文件系统与并行数据加载器,支持在GPU集群中实现近乎线性的训练吞吐量缩放。此外,凭借其详细的来源构成字段(pillar_comp),开发团队能够追溯不同数据源(如维基百科、C4语料)对最终模型性能的贡献比例,为混合数据策略的持续优化提供实时监控依据。
数据集最近研究
最新研究方向
bitmoe-400m-t-v1数据集作为BitMoE-400M-T模型的预训练语料库,聚焦于大规模语言模型的高效训练与质量筛选,其核心创新在于引入细粒度的分片元数据管理机制,每个32M令牌分片均附带18维质量评分字段(包括平均分、标准差、高于阈值计数等),支持基于评分分布的动态数据过滤与选择性训练策略。该数据集的架构设计呼应了当前大模型训练中“数据质量优于数量”的前沿共识,通过分片粒度的质量监控直击数据飞轮中低质噪声影响模型收敛性的痛点。同时,其公开的评分直方图与模态组成结构为研究数据配比、课程学习及不同来源语料对模型能力影响的归因分析提供了标准化基准,对推动可解释数据工程与神经架构-数据协同优化具有显著指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务