遇见数据集

abir177m-pretrain-balanced20-ezhijaru

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

abir177m pretrain mix 是一个为 GPT-2 风格预训练设计的数据集混合包,包含五种语言(英语、中文、印地语、日语、俄语),每种语言占比 20%。数据集来源包括:英语来自 FineWeb 数据集,其他四种语言来自 FineWeb-2 数据集。分词器采用 Mistral-Nemo-Base-2407。数据以打包的 2048 个 token 的因果语言模型块形式提供,其中 input_ids 和 labels 相同。目标总 token 数约为 35.5 亿(约 173.3 万条序列)。该数据集适用于自回归语言模型的预训练任务,可复现的打包 token 分片使得实验可重复。更多细节(如精确混合比例、数据集映射和随机种子)可在 meta.json 文件中找到。

abir177m pretrain mix is a dataset mixture package designed for GPT-2 style pretraining, containing five languages (English, Chinese, Hindi, Japanese, Russian), each with a 20% proportion. The dataset sources include: English from the FineWeb dataset, and the other four languages from the FineWeb-2 dataset. The tokenizer used is Mistral-Nemo-Base-2407. The data is provided in the form of causal language modeling blocks packed with 2048 tokens, where input_ids and labels are identical. The total target number of tokens is approximately 3.55 billion (about 1.733 million sequences). This dataset is suitable for pretraining autoregressive language models, and the reproducible packing of token shards ensures experimental reproducibility. More details (such as exact mixing ratios, dataset mappings, and random seeds) can be found in the meta.json file.

创建时间:
2026-08-22
原始信息汇总

数据集概述

基本信息

  • 数据集名称:abir177m pretrain mix — balanced20 en/zh/hi/ja/ru
  • 许可证:Apache-2.0
  • 支持语言:英语(en)、中文(zh)、印地语(hi)、日语(ja)、俄语(ru)
  • 数据集标签:预训练(pretraining)、因果语言建模(causal-lm)、FineWeb

数据集内容与结构

  • 数据格式:Parquet 文件(data/train-*.parquet),包含默认配置(default),单一训练集(train)划分。
  • 数据打包:以 2048 个 token 为单位的因果语言建模块进行打包,input_idslabels 完全一致。
  • 目标规模:约 35.5 亿 tokens(约 173.3 万个序列)。

数据来源与语言配比

  • 语言配比:英语、中文、印地语、日语、俄语各占 20%。
  • 数据源:英语使用 FineWeb 数据集,中文、印地语、日语、俄语使用 FineWeb-2 数据集。

分词器

  • 分词器mistralai/Mistral-Nemo-Base-2407

附加信息

  • 数据集中包含 meta.json 文件,用于提供精确的混合比例、数据集映射和随机种子信息。
搜集汇总
数据集介绍
abir177m-pretrain-balanced20-ezhijaru 数据集图片
构建方式
该数据集立足于多语言预训练资源均衡化的迫切需求,依托FineWeb与FineWeb-2两大高质量语料库,系统性地采集英语、中文、印地语、日语和俄语五种语言的文本流。构建过程中,采用mistralai/Mistral-Nemo-Base-2407分词器对原始语料进行统一编码,并以2048个token为固定长度实施因果语言建模块打包,形成input_ids与labels完全一致的张量序列。整体预算控制在约35.5亿token,对应173.3万条序列,最终以冻结的Parquet分片形式存储,辅以meta.json记录混合比例、数据集映射及随机种子,确保预训练过程可复现。
使用方法
使用该数据集时,研究者可直接加载HuggingFace datasets库中的parquet分片,借助config_name为default的配置获取训练集。由于input_ids与labels相同,模型训练时仅需将input_ids传入,并自动计算因果语言建模损失。建议在加载后检查meta.json以确认混合比例和随机种子,便于实验复现。该数据集适用于GPT-2架构或类似自回归模型的预训练,训练过程中可结合标准优化器与学习率调度策略,并注意按语言比例进行采样验证,以评估多语言均衡性能。
背景与挑战
背景概述
面向多语言预训练语料库的构建,长期受制于语言资源分布不均与数据配比不透明等问题。abir177m-pretrain-balanced20-ezhijaru数据集于2020年代由相关研究人员基于FineWeb与FineWeb-2数据流构建,覆盖英语、中文、印地语、日语和俄语五种语言,各占20%比例,并采用Mistral-Nemo分词器与2048词元因果语言建模块进行冻结打包,目标预算约35.5亿词元。该数据集旨在为GPT-2风格模型的多语言预训练提供可复现的均衡语料,对推动低资源语言纳入预训练流程具有参考意义。
当前挑战
该数据集所对应的领域问题在于多语言预训练中的数据不均衡与可复现性不足,传统语料库常因英语主导而削弱其他语言的表征学习。构建过程中的核心挑战包括:五种语言在FineWeb与FineWeb-2中的原始分布差异显著,需精确重采样以实现各20%的平衡配比;不同语言的分词效率与词元膨胀率不一致,可能影响打包后的序列质量;大规模词元级打包需保证因果语言建模的输入与标签严格一致,并维持约17.33万条序列的预算控制;此外,数据来源的许可与语言覆盖的时效性亦构成持续约束。
常用场景
经典使用场景
在跨语言预训练研究领域,该数据集为GPT-2风格因果语言模型的预训练提供了均衡的多语言语料。其经典使用场景是作为预训练语料库,支持英语、中文、印地语、日语和俄语五种语言各占20%的混合训练,采用Mistral-Nemo分词器将文本打包为2048 token的因果语言建模块,使模型在统一框架下习得五种语言的语法结构与语义表征。
解决学术问题
该数据集有效缓解了多语言预训练中语料分布不均衡的痼疾,为探究语言间知识迁移与干扰提供了受控实验条件。其均衡的语种配比使研究者能够系统考察低资源语言在联合训练中的表现,并回答多语言模型是否存在容量竞争等核心问题,对推动语言公平性和跨语言泛化研究具有方法论意义。
实际应用
在实际应用中,该数据集可直接用于训练轻量级多语言对话模型、跨语言检索系统及机器翻译预训练基座。其冻结的打包格式确保了实验可复现性,适合工业界快速构建多语言原型系统,也可作为学术基准用于比较不同架构在均衡多语言环境下的收敛效率与下游任务迁移能力。
数据集最近研究
最新研究方向
在大规模语言模型预训练领域,多语言均衡语料构建已成为提升模型跨语言泛化能力的关键路径。abir177m-pretrain-balanced20-ezhijaru数据集以20%等比例混合英语、中文、印地语、日语和俄语,依托FineWeb与FineWeb-2的高质量网页文本,并采用Mistral-Nemo分词器进行2048 token因果语言建模打包,为可复现的GPT-2风格预训练提供了标准化基准。当前前沿研究聚焦于低资源语言在均衡混合下的表征迁移效率、分词器对非拉丁语系的适配性以及打包序列对长程依赖建模的影响,该数据集直接支撑了多语言缩放定律验证与跨语言灾难性遗忘缓解等热点议题,对推动公平且高效的多语言基础模型发展具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务