遇见数据集

KantaHayashiAI/ClimbMix-Ja-Initial64-Training-Data

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

ClimbMix-Ja Initial64 350M Artifacts是一个公共备份数据集,用于存储初始的64个ClimbMix-Ja候选运行的数据和配置。该数据集基于nvidia/nemotron-climb-proxy-models 350M基础模型,转换为Megatron-LM TE兼容的检查点,并使用KantaHayashiAI/ClimbLab-Ja训练语料库,该语料库被聚类为cluster_01到cluster_20。训练序列长度为1024,每个候选运行进行6500次迭代,全局批次大小为304,每个候选训练token数为2,023,424,000,所有候选总训练token数为129,499,136,000。数据集内容包括聚类的JSONL文件、Megatron-LM索引数据集文件、清单文件以及混合物定义和候选脚本。匹配的检查点存储库为KantaHayashiAI/ClimbMix-Ja-350M-Initial64-Checkpoints。

ClimbMix-Ja Initial64 350M Artifacts is a public backup dataset for storing the data and configurations of the initial 64 ClimbMix-Ja candidate runs. It is based on the nvidia/nemotron-climb-proxy-models 350M base model, converted to a Megatron-LM TE-compatible checkpoint, and uses the KantaHayashiAI/ClimbLab-Ja training corpus, which is clustered into cluster_01 to cluster_20. The training sequence length is 1024, with 6500 iterations per candidate, a global batch size of 304, 2,023,424,000 tokens per candidate, and a total of 129,499,136,000 tokens across all candidates. The dataset contents include clustered JSONL files, Megatron-LM indexed dataset files, manifest files, and mixture definitions with candidate scripts. The matching checkpoint repository is KantaHayashiAI/ClimbMix-Ja-350M-Initial64-Checkpoints.

提供机构:
KantaHayashiAI
搜集汇总
数据集介绍
KantaHayashiAI/ClimbMix-Ja-Initial64-Training-Data 数据集图片
构建方式
在语言模型预训练中,数据混合策略对模型性能具有关键影响。ClimbMix-Ja-Initial64-Training-Data数据集作为ClimbMix-Ja项目初始阶段的核心产物,旨在系统性地探索不同数据配比方案下的训练效果。该数据集基于基础模型nvidia/nemotron-climb-proxy-models的350M参数版本构建,采用了Megatron-LM TE兼容的检查点格式。其训练语料来源于KantaHayashiAI/ClimbLab-Ja,该语料经过聚类处理划分为从cluster_01至cluster_20的20个簇,为后续多样化的数据混合实验奠定了结构基础。在训练配置上,每条候选训练序列长度设定为1024个token,每轮候选训练迭代次数为6500次,全局批处理大小设为304。每个候选训练实例消耗约2,023,424,000个token,而全部64个候选实例累计训练的token总量达到129,499,136,000。整个训练过程采用BF16混合精度,并集成了Transformer Engine与FlashAttention以优化计算效率与内存占用。
特点
该数据集最显著的特点在于其明确的候选驱动架构,通过64个独立的候选实例(编号从n1至n64)系统性地映射不同数据混合脚本与训练数据路径。每个候选实例均配有对应的检查点,其关联关系记录在candidate_mapping.jsonl与candidate_mapping.csv文件中,便于后续分析各数据配比策略对模型性能的影响。数据集仓库内部结构清晰,包含以JSONL格式存储的聚类语料文件、Megatron-LM索引化数据集文件、集群与数据清单文件,以及定义混合策略、候选脚本和每候选训练数据路径的专用文件夹。这种多层级、有序化的组织方式,使得研究人员能够轻松追溯每个候选实例从数据选择到训练配置的完整链路。此外,配套的检查点仓库(KantaHayashiAI/ClimbMix-Ja-350M-Initial64-Checkpoints)提供了可直接用于评估和下游任务的模型权重,极大增强了该数据集的实用性与可复现性。
使用方法
使用ClimbMix-Ja-Initial64-Training-Data数据集时,研究人员首先应从配套的候选映射文件(candidate_mapping.jsonl或candidate_mapping.csv)入手,解析每个候选编号对应的混合脚本与训练数据路径。基于这些信息,可提取jsonl目录下的聚类语料文件进行自定义数据混合实验,或直接利用indexed目录中的Megatron-LM索引化数据集进行标准化的模型预训练。若需复现候选检查点,则需结合kantaHayashiAI/ClimbMix-Ja-350M-Initial64-Checkpoints仓库中的模型权重,并参考climbsearch_initial64文件夹中提供的混合定义与候选脚本配置训练参数。该数据集的设计高度适配Megatron-LM训练框架,建议用户在具备相应基础设施的环境下(如配备Transformer Engine与FlashAttention支持的GPU集群)运行,以充分发挥BF16混合精度和高效注意力机制的性能优势,实现大规模数据混合实验的可重复探索。
背景与挑战
背景概述
ClimbMix-Ja-Initial64-Training-Data数据集由日本研究者Kanta Hayashi及其团队于近年创建,依托公共机构资源,旨在优化日语言模型的预训练数据配比策略。该数据集的核心研究问题聚焦于如何通过多候选混合(Mixture of Candidates)方法,从聚类后的语料库中筛选出最优训练数据组合,以提升模型在下游任务中的表现。基于nvidia/nemotron-climb-proxy-models 350M基础模型,数据集包含64个候选运行,覆盖约1295亿词元,其设计理念在语言模型数据工程领域具有创新性,为日文自然语言处理研究提供了系统化的数据混合基准。
当前挑战
该数据集所解决的领域问题在于语言模型预训练中数据配比的优化挑战,即如何在有限算力下从大量候选组合中高效识别提升模型泛化能力的数据分布,避免冗余或低质量词元对训练效率的负面影响。构建过程中,团队面临语料聚类(如20个簇)与64个候选脚本的复杂编排,需协调Megatron-LM索引格式、Transformer Engine精度及全局批次大小等参数,确保每个候选运行在相同序列长度(1024)与训练迭代数(6500)下具备可比性,同时管理约1295亿词元的大规模数据管线与精准映射,对工程实现提出严苛要求。
常用场景
经典使用场景
ClimbMix-Ja-Initial64-Training-Data数据集专门用于语言模型在日语混合数据上的预训练与混合策略探索。该数据集基于ClimbLab-Ja语料库,经过聚类划分为20个不同主题的簇,并定义了64种候选混合方案,每个方案均以固定参数(序列长度1024、全局批次大小304)在350M参数的Nemotron基模型上训练6500步,覆盖约20亿token。研究者通过对比不同候选方案的训练结果,系统性地评估各混合策略对模型性能的影响,从而在日语语言模型预训练中优化数据配比。
实际应用
在实际应用中,该数据集直接服务于日语自然语言处理系统的开发与优化。企业和研究机构可借助ClimbMix-Ja的64种预训练候选结果,快速定位最适合其特定任务(如日语问答、文本生成、情感分析等)的数据混合方案。此外,该数据集提供的标准化索引文件和元数据管理工具(manifest.json等)极大简化了大规模预训练数据管线的构建流程,降低了在Megatron-LM框架上进行复现或扩展实验的门槛,推动了日语AI应用从通用模型向领域适配模型的转型。
衍生相关工作
ClimbMix-Ja-Initial64-Training-Data催生了多项经典相关工作。其配套检查点仓库(ClimbMix-Ja-350M-Initial64-Checkpoints)为模型分析提供了直接资源,研究者可基于此开展数据混合影响因素的深度归因研究。该数据集还启发了针对不同语言(如英语、中文)的类似混合搜索方法,形成了数据高效预训练(Data-Efficient Pretraining)领域的小型基准。此外,部分工作进一步探索了聚类粒度与混合策略的协同作用,以及将训练过程中动态调整混合比例的思想延伸至课程学习框架中,延续了ClimbMix在数据配置科学化方向的贡献。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务